Цифровая зависимость современного автопромаСинтез вычислительных мощностей AMD и Cerebras

Эволюция больших языковых моделей привела к тому, что традиционные GPU начинают сталкиваться с серьезными ограничениями при генерации ответов в реальном времени. Основная проблема заключается в пропускной способности памяти: даже самые современные решения на базе HBM4 не всегда могут обеспечить ту скорость, которая необходима для мгновенного взаимодействия с пользователем. Именно здесь возникает потребность в гибридном подходе, объединяющем грубую вычислительную силу и сверхбыстрый доступ к данным.
Решением стал союз AMD и Cerebras Systems. В основе новой платформы лежит синергия систем AMD Instinct и уникальных ускорителей Cerebras на базе памяти SRAM. В отличие от стандартных чипов, где память выносится за пределы основного кристалла или располагается в виде стеков, технология Wafer Scale Engine (WSE) от Cerebras предполагает использование всей кремниевой пластины как единого процессора с интегрированной памятью. Это позволяет на порядки сократить путь сигнала и практически исключить задержки, которые неизбежны при использовании внешней памяти.
Такой подход превращает оборудование Cerebras в один из самых эффективных инструментов для инференса в мире. Скорость генерации текста здесь может превышать 2000 токенов в секунду, что делает взаимодействие с ИИ практически незаметным для человеческого восприятия. В рамках совместной платформы разделение труда происходит по функциональному признаку: сложные аналитические запросы и тяжелые вычисления обрабатываются на мощностях AMD Instinct, а сама генерация токенов делегируется системе WSE.
С технической точки зрения такая конфигурация позволяет достичь высокого уровня производительности без пропорционального роста стоимости или энергопотребления. Согласно имеющимся данным, эффективность системы по количеству генерируемых токенов на один ватт энергии возрастает в пять раз. Это критически важный показатель для дата-центров, где стоимость электроэнергии и охлаждения становится определяющим фактором масштабирования.
Рыночный контекст этого партнерства продиктован жесткой конкуренцией с Nvidia и ее экосистемой, включая специализированные решения вроде LPU (Language Processing Units) от Groq. Сравнение эффективности показывает значительный разрыв в плотности вычислений: если для обслуживания модели масштаба Kimi K2.5 с одним триллионом параметров инфраструктуре на базе Groq могут потребоваться тысячи чипов, то связка AMD и Cerebras способна справиться с аналогичной задачей, используя лишь несколько десятков единиц оборудования.
Ожидается, что объединенное решение станет доступно в облаке Cerebras уже в текущем году. Этот шаг знаменует собой начало новой главы в противостоянии технологических гигантов, где победа будет одержана не просто за счет количества транзисторов, а за счет переосмысления самой концепции взаимодействия процессора и памяти.

