AMD Instinct MI455X змінює правила гри

Дата24 лип. 2026 р.
Читати3 хв
AMD Instinct MI455X змінює правила гри
Глобальне протистояння у сфері штучного інтелекту остаточно перейшло в площину апаратного забезпечення, де визначальними факторами стали пропускна здатність пам'яті та обчислювальна щільність. Сучасні нейромережі потребують колосальних ресурсів для навчання та інференсу, що змушує виробників переосмислювати самі принципи архітектури чипів. AMD робить рішучий крок уперед, представляючи акселератор Instinct MI455X, покликаний кинути серйозний виклик ринковому домінуванню Nvidia. Цей продукт уособлює перехід до нових стандартів пам'яті та гібридних методів виробництва напівпровідників.

Фундаментом нового флагмана Instinct MI455X стала архітектура CDNA 5, розроблена спеціально для масштабного навчання ШІ та високопродуктивного виводу даних у стійкових системах. Головним технологічним досягненням є інтеграція пам'яті HBM4 обсягом 432 Гбайт, що дозволяє досягти пікової пропускної спроможності у 23,3 Тбайт/с. В епоху «голодування за даними», коли обчислювальні потужності часто простоюють в очікуванні інформації з пам'яті, такі показники стають критично важливими для ефективності роботи LLM (великих мовних моделей).

Технічна реалізація чипа є свідченням досконалості сучасної мікроелектроніки: AMD застосовує гібридний підхід до виробництва. Замість єдиного техпроцесу для всього кристала, пристрій складається з кількох спеціалізованих чиплетів. Вісім обчислювальних блоків ACD (Accelerator Complex Dies), що об'єднують 256 процесорів робочих груп WGP, виконані за передовим 2-нм техпроцесом TSMC N2. Водночас два чиплети Fabric, відповідальні за передачу даних і кешування, а також два модулі введення-виведення виробляються за 3-нм техпроцесом TSMC N3P. Такий підхід дозволяє оптимізувати вартість і вихід придатних кристалів, зберігаючи при цьому загальну щільність транзисторів на рівні 320 мільярдів.

Пам'ять HBM4 реалізована через 192-канальний інтерфейс із використанням 12 стеків, що забезпечує безпрецедентний рівень взаємодії між даними та обчислювальними ядрами. Для мінімізації затримок передбачено глобальний кеш L2 обсягом 192 Мбайт, розділений на два незалежні блоки по 96 Мбайт. З точки зору комунікацій, акселератор підтримує сучасний стандарт PCIe Gen 6 або може бути інтегрований через три мережеві адаптери AMD AI-NIC з використанням протоколу UALink, що фактично є відповіддю на закриті екосистеми конкурентів.

Показники продуктивності MI455X свідчать про якісний стрибок порівняно з попередником MI355X. В операціях MXFP8 та MXFP6 пристрій досягає 20,13 Пфлопс, а за умови використання формату MXFP4 потужність зростає до 40,26 Пфлопс. Фактично, новий акселератор забезпечує чотирикратний приріст продуктивності в цих режимах, пропонуючи при цьому в півтора раза більше пам'яті та майже трикратне збільшення її пропускної спроможності.

Еволюція CDNA 5 запровадила низку критично важливих функціональних нововведень. Впровадження блоку Tensor Data Mover дозволяє здійснювати пряму асинхронну передачу даних між глобальною пам'яттю та локальними сховищами, що суттєво розвантажує основні обчислювальні ресурси. Крім того, з'явилися механізми кластеризації робочих груп, багатоадресна розсилка даних (multicast) та оновлений процесор команд, покликаний звести до мінімуму затримки при відправці інструкцій.

Операційна гнучкість MI455X забезпечується підтримкою просторового розділення. Акселератор може працювати в режимі одного, двох або восьми розділів. Наприклад, режим NPS1 забезпечує рівномірне чергування адрес по всіх дванадцяти стеках HBM4, тоді як NPS2 розділяє GPU на два незалежні домени по шість стеків, виключаючи перехресну передачу даних між групами кристалів для оптимізації локальних обчислень.

Паралельно з головним флагманом було представлено модель Instinct MI430X. Цей акселератор орієнтований на специфічні завдання: наукові обчислення, створення «суверенного ШІ» та гібридні сценарії AI-HPC. У завданнях із подвійною точністю (FP64) він демонструє продуктивність 288 Тфлопс, що робить його потужним інструментом для симуляцій і складного математичного моделювання, де точність обчислень є пріоритетнішою за швидкість обробки нейромережевих ваг.

Тала знає • Використання матеріалів сайту дозволено виключно за умови розміщення активного, прямого і відкритого для пошукових систем гіперпосилання на першоджерело. Посилання має бути клікабельним і розташовуватися безпосередньо в тілі публікації — до або після запозиченого тексту. Будь-яке копіювання, відтворення або цитування контенту без дотримання цієї умови розглядається як порушення авторських прав.