Цифрова залежність сучасного автопрому
Синтез обчислювальних потужностей AMD та Cerebras

Еволюція великих мовних моделей призвела до того, що традиційні GPU починають стикатися з серйозними обмеженнями під час генерації відповідей у реальному часі. Основна проблема полягає в пропускній здатності пам'яті: навіть найсучасніші рішення на базі HBM4 не завжди можуть забезпечити ту швидкість, яка необхідна для миттєвої взаємодії з користувачем. Саме тут виникає потреба в гібридному підході, що поєднує грубу обчислювальну потужність та надшвидкий доступ до даних.
Рішенням став союз AMD та Cerebras Systems. В основі нової платформи лежить синергія систем AMD Instinct та унікальних акселераторів Cerebras на базі пам'яті SRAM. На відміну від стандартних чипів, де пам'ять виноситься за межі основного кристала або розташовується у вигляді стеків, технологія Wafer Scale Engine (WSE) від Cerebras передбачає використання всієї кремнієвої пластини як єдиного процесора з інтегрованою пам'яттю. Це дозволяє на порядки скоротити шлях сигналу та практично виключити затримки, які є неминучими при використанні зовнішньої пам'яті.
Такий підхід перетворює обладнання Cerebras на один із найефективніших інструментів для інференсу у світі. Швидкість генерації тексту тут може перевищувати 2000 токенів за секунду, що робить взаємодію з ШІ практично непомітною для людського сприйняття. У межах спільної платформи розподіл завдань відбувається за функціональною ознакою: складні аналітичні запити та важкі обчислення обробляються на потужностях AMD Instinct, а сама генерація токенів делегується системі WSE.
З технічної точки зору така конфігурація дозволяє досягти високого рівня продуктивності без пропорційного зростання вартості чи енергоспоживання. Згідно з наявними даними, ефективність системи за кількістю генерованих токенів на один ват енергії зростає у п'ять разів. Це критично важливий показник для дата-центрів, де вартість електроенергії та охолодження стає визначальним фактором масштабування.
Ринковий контекст цього партнерства продиктований жорсткою конкуренцією з Nvidia та її екосистемою, включаючи спеціалізовані рішення накшталт LPU (Language Processing Units) від Groq. Порівняння ефективності демонструє значний розрив у щільності обчислень: якщо для обслуговування моделі масштабу Kimi K2.5 з одним трильйоном параметрів інфраструктурі на базі Groq можуть знадобитися тисячі чипів, то зв'язка AMD та Cerebras здатна впоратися з аналогічним завданням, використовуючи лише кілька десятків одиниць обладнання.
Очікується, що об'єднане рішення стане доступним у хмарі Cerebras вже цього року. Цей крок знаменує початок нової глави у протистоянні технологічних гігантів, де перемога буде здобута не просто за рахунок кількості транзисторів, а завдяки переосмисленню самої концепції взаємодії процесора та пам'яті.

