Лідерство iPhone 17 на світовому ринку
Оптимізація пам'яті в екосистемі NVLink Fusion

У сфері високопродуктивних обчислень давно сформувалася ситуація, коли можливості логічних ядер значно випереджають швидкість доставки даних із пам'яті. Для систем навчання та інференсу нейромереж це стає критичним вузьким місцем: навіть найпотужніший процесор простоюватиме, якщо дані — ваги моделей, активації та KV-кеш — не надходитимуть із достатньою швидкістю. У межах програми NVLink Fusion компанія Nvidia представила NVHBM — спеціалізоване рішення для базового кристала пам'яті HBM, покликане усунути цей дисбаланс.
Важливо розуміти, що NVHBM не є повноцінною заміною загальноіндустріальному стандарту HBM, а виступає в ролі оптимізованого будівельного блоку. Технологія орієнтована на розробників власних ШІ-прискорювачів, дозволяючи їм використовувати перевірену та сертифіковану підсистему пам'яті замість того, щоб витрачати ресурси на самостійну розробку та валідацію складних інтерфейсів.
Ключовий технічний зсув полягає в перегляді фізичного інтерфейсу пам'яті. У традиційних рішеннях контролер пам'яті розташовується на основному обчислювальному кристалі. У NVHBM натомість контролер перенесено безпосередньо в базовий кристал тривимірного стека HBM. Такий маневр дозволив скоротити площу PHY (фізичного рівня) та пов'язаної з ним логіки до 67% порівняно зі стандартом JEDEC HBM4e.
Це запускає ланцюгову реакцію позитивних наслідків. По-перше, спрощується розводка інтерпозера — мікроскопічної підкладки, що з'єднує чипи. По-друге, простір, що звільнився на основному кристалі (до 30% площі), може бути використаний для розміщення додаткових обчислювальних блоків або інших функціональних модулів, що безпосередньо збільшує щільність обчислень на одиницю площі.
З точки зору продуктивності, NVHBM забезпечує зростання пропускної здатності до 30% на один стек порівняно з HBM4e. Для завдань інференсу великих мовних моделей (LLM) це означає відчутне прискорення генерації токенів, оскільки дані переміщуються між пам'яттю та ядрами значно швидше.
Паралельно зі зростанням швидкості відбувається зниження енергоспоживання — приблизно на 15%. У масштабах одного чипа це може здатися незначним, проте в контексті гіпермасштабованих дата-центрів ефект стає колосальним. У гіпотетичному ЦОД потужністю 1 ГВт, оснащеному прискорювачами зі споживанням 2000 Вт, економія енергії завдяки впровадженню NVHBM дозволила б запустити ще 15 000 додаткових обчислювальних модулів (XPU) без збільшення загального бюджету потужності.
Синергія NVHBM та NVLink Fusion створює потужний важіль для підвищення загальної ефективності системи. Сукупний виграш у пропускній здатності, площі кристала та енергоефективності здатен збільшити продуктивність одного XPU на 30%.
Першим стратегічним партнером у цьому напрямку стала компанія Annapurna Labs, що належить Amazon. У нових прискорювачах Trainium 4 вже реалізовано підтримку NVLink Fusion, а наступні ітерації чипів отримають повноцінну інтеграцію NVHBM. Це підкреслює тренд на створення відкритих, але глибоко оптимізованих екосистем, де апаратні компоненти від різних вендорів працюють як єдиний, безшовно інтегрований механізм.

