Синтез обчислювальних потужностей AMD та Cerebras

Дата24 лип. 2026 р.
Читати3 хв
Синтез обчислювальних потужностей AMD та Cerebras
Сучасна гонка озброєнь у галузі штучного інтелекту переходить від фази навчання моделей до етапу їхнього ефективного розгортання. Якщо графічні процесори й надалі залишаються еталоном для тренування нейромереж, то стадія інференсу потребує принципово іншого підходу до управління пам'яттю та мінімізації затримок. Стратегічний альянс AMD та Cerebras Systems покликаний переосмислити стандарти продуктивності для ШІ-агентів нового покоління. Мета цієї колаборації — подолати головне «вузьке місце» індустрії: критично низьку швидкість передачі даних між обчислювальним модулем та пам’яттю.

Еволюція великих мовних моделей призвела до того, що традиційні GPU починають стикатися з серйозними обмеженнями під час генерації відповідей у реальному часі. Основна проблема полягає в пропускній здатності пам'яті: навіть найсучасніші рішення на базі HBM4 не завжди можуть забезпечити ту швидкість, яка необхідна для миттєвої взаємодії з користувачем. Саме тут виникає потреба в гібридному підході, що поєднує грубу обчислювальну потужність та надшвидкий доступ до даних.

Рішенням став союз AMD та Cerebras Systems. В основі нової платформи лежить синергія систем AMD Instinct та унікальних акселераторів Cerebras на базі пам'яті SRAM. На відміну від стандартних чипів, де пам'ять виноситься за межі основного кристала або розташовується у вигляді стеків, технологія Wafer Scale Engine (WSE) від Cerebras передбачає використання всієї кремнієвої пластини як єдиного процесора з інтегрованою пам'яттю. Це дозволяє на порядки скоротити шлях сигналу та практично виключити затримки, які є неминучими при використанні зовнішньої пам'яті.

Такий підхід перетворює обладнання Cerebras на один із найефективніших інструментів для інференсу у світі. Швидкість генерації тексту тут може перевищувати 2000 токенів за секунду, що робить взаємодію з ШІ практично непомітною для людського сприйняття. У межах спільної платформи розподіл завдань відбувається за функціональною ознакою: складні аналітичні запити та важкі обчислення обробляються на потужностях AMD Instinct, а сама генерація токенів делегується системі WSE.

З технічної точки зору така конфігурація дозволяє досягти високого рівня продуктивності без пропорційного зростання вартості чи енергоспоживання. Згідно з наявними даними, ефективність системи за кількістю генерованих токенів на один ват енергії зростає у п'ять разів. Це критично важливий показник для дата-центрів, де вартість електроенергії та охолодження стає визначальним фактором масштабування.

Ринковий контекст цього партнерства продиктований жорсткою конкуренцією з Nvidia та її екосистемою, включаючи спеціалізовані рішення накшталт LPU (Language Processing Units) від Groq. Порівняння ефективності демонструє значний розрив у щільності обчислень: якщо для обслуговування моделі масштабу Kimi K2.5 з одним трильйоном параметрів інфраструктурі на базі Groq можуть знадобитися тисячі чипів, то зв'язка AMD та Cerebras здатна впоратися з аналогічним завданням, використовуючи лише кілька десятків одиниць обладнання.

Очікується, що об'єднане рішення стане доступним у хмарі Cerebras вже цього року. Цей крок знаменує початок нової глави у протистоянні технологічних гігантів, де перемога буде здобута не просто за рахунок кількості транзисторів, а завдяки переосмисленню самої концепції взаємодії процесора та пам'яті.

Тала знає • Використання матеріалів сайту дозволено виключно за умови розміщення активного, прямого і відкритого для пошукових систем гіперпосилання на першоджерело. Посилання має бути клікабельним і розташовуватися безпосередньо в тілі публікації — до або після запозиченого тексту. Будь-яке копіювання, відтворення або цитування контенту без дотримання цієї умови розглядається як порушення авторських прав.