Лидерство iPhone 17 на мировом рынкеОптимизация памяти в экосистеме NVLink Fusion

В индустрии высокопроизводительных вычислений давно сложилась ситуация, когда возможности логических ядер значительно опережают скорость доставки данных из памяти. Для систем обучения и инференса нейросетей это становится критическим узким местом: даже самый мощный процессор будет простаивать, если данные — веса моделей, активации и KV-кеш — не поступают с достаточной скоростью. В рамках программы NVLink Fusion компания Nvidia представила NVHBM — специализированное решение для базового кристалла памяти HBM, которое призвано устранить этот дисбаланс.
Важно понимать, что NVHBM не является полноценной заменой общеиндустриальному стандарту HBM, а выступает в роли оптимизированного строительного блока. Технология ориентирована на разработчиков собственных ИИ-ускорителей, позволяя им использовать проверенную и сертифицированную подсистему памяти вместо того, чтобы тратить ресурсы на самостоятельную разработку и валидацию сложных интерфейсов.
Ключевой технический сдвиг заключается в пересмотре физического интерфейса памяти. В традиционных решениях контроллер памяти располагается на основном вычислительном кристалле. В NVHBM же контроллер перенесен непосредственно в базовый кристалл трехмерного стека HBM. Такой маневр позволил сократить площадь PHY (физического уровня) и связанной с ним логики до 67% по сравнению со стандартом JEDEC HBM4e.
Это влечет за собой цепочку положительных последствий. Во-первых, упрощается разводка интерпозера — микроскопической подложки, соединяющей чипы. Во-вторых, освободившееся пространство на основном кристалле (до 30% площади) может быть использовано для размещения дополнительных вычислительных блоков или других функциональных модулей, что напрямую увеличивает плотность вычислений на единицу площади.
С точки зрения производительности, NVHBM обеспечивает прирост пропускной способности до 30% на один стек по сравнению с HBM4e. Для задач инференса больших языковых моделей (LLM) это означает ощутимое ускорение генерации токенов, так как данные перемещаются между памятью и ядрами значительно быстрее.
Параллельно с ростом скорости происходит снижение энергопотребления — примерно на 15%. В масштабах одного чипа это может показаться незначительным, однако в контексте гипермасштабируемых дата-центров эффект становится колоссальным. В гипотетическом ЦОД мощностью 1 ГВт, оснащенном ускорителями с энергопотреблением 2000 Вт, экономия энергии за счет внедрения NVHBM позволила бы запустить еще 15 000 дополнительных вычислительных модулей (XPU) без увеличения общего бюджета мощности.
Синергия NVHBM и NVLink Fusion создает мощный рычаг для повышения общей эффективности системы. Совокупный выигрыш в пропускной способности, площади кристалла и энергоэффективности способен увеличить производительность одного XPU на 30%.
Первым стратегическим партнером в этом направлении стала компания Annapurna Labs, принадлежащая Amazon. В новых ускорителях Trainium 4 уже реализована поддержка NVLink Fusion, а последующие итерации чипов получат полноценную интеграцию NVHBM. Это подчеркивает тренд на создание открытых, но глубоко оптимизированных экосистем, где аппаратные компоненты от разных вендоров работают как единый, бесшовно интегрированный механизм.

