Синтез вычислительных мощностей AMD и Cerebras

Дата24 июл. 2026 г.
Читать3 мин
Синтез вычислительных мощностей AMD и Cerebras
Современная гонка вооружений в сфере искусственного интеллекта смещается от этапа обучения моделей к их эффективному развертыванию. В то время как графические процессоры остаются эталоном для тренировки нейросетей, стадия инференса требует принципиально иного подхода к работе с памятью и задержками. Стратегический альянс AMD и Cerebras Systems призван пересмотреть стандарты производительности для ИИ-агентов нового поколения. Эта коллаборация нацелена на устранение главного «узкого места» индустрии — низкой скорости передачи данных между вычислителем и памятью.

Эволюция больших языковых моделей привела к тому, что традиционные GPU начинают сталкиваться с серьезными ограничениями при генерации ответов в реальном времени. Основная проблема заключается в пропускной способности памяти: даже самые современные решения на базе HBM4 не всегда могут обеспечить ту скорость, которая необходима для мгновенного взаимодействия с пользователем. Именно здесь возникает потребность в гибридном подходе, объединяющем грубую вычислительную силу и сверхбыстрый доступ к данным.

Решением стал союз AMD и Cerebras Systems. В основе новой платформы лежит синергия систем AMD Instinct и уникальных ускорителей Cerebras на базе памяти SRAM. В отличие от стандартных чипов, где память выносится за пределы основного кристалла или располагается в виде стеков, технология Wafer Scale Engine (WSE) от Cerebras предполагает использование всей кремниевой пластины как единого процессора с интегрированной памятью. Это позволяет на порядки сократить путь сигнала и практически исключить задержки, которые неизбежны при использовании внешней памяти.

Такой подход превращает оборудование Cerebras в один из самых эффективных инструментов для инференса в мире. Скорость генерации текста здесь может превышать 2000 токенов в секунду, что делает взаимодействие с ИИ практически незаметным для человеческого восприятия. В рамках совместной платформы разделение труда происходит по функциональному признаку: сложные аналитические запросы и тяжелые вычисления обрабатываются на мощностях AMD Instinct, а сама генерация токенов делегируется системе WSE.

С технической точки зрения такая конфигурация позволяет достичь высокого уровня производительности без пропорционального роста стоимости или энергопотребления. Согласно имеющимся данным, эффективность системы по количеству генерируемых токенов на один ватт энергии возрастает в пять раз. Это критически важный показатель для дата-центров, где стоимость электроэнергии и охлаждения становится определяющим фактором масштабирования.

Рыночный контекст этого партнерства продиктован жесткой конкуренцией с Nvidia и ее экосистемой, включая специализированные решения вроде LPU (Language Processing Units) от Groq. Сравнение эффективности показывает значительный разрыв в плотности вычислений: если для обслуживания модели масштаба Kimi K2.5 с одним триллионом параметров инфраструктуре на базе Groq могут потребоваться тысячи чипов, то связка AMD и Cerebras способна справиться с аналогичной задачей, используя лишь несколько десятков единиц оборудования.

Ожидается, что объединенное решение станет доступно в облаке Cerebras уже в текущем году. Этот шаг знаменует собой начало новой главы в противостоянии технологических гигантов, где победа будет одержана не просто за счет количества транзисторов, а за счет переосмысления самой концепции взаимодействия процессора и памяти.

Тала знает • Использование материалов сайта разрешено исключительно при условии размещения активной, прямой и открытой для поисковых систем гиперссылки на первоисточник. Ссылка должна быть кликабельной и располагаться непосредственно в теле публикации — до или после заимствованного текста. Любое копирование, воспроизведение или цитирование контента без соблюдения этого условия рассматривается как нарушение авторских прав.