Цена ускоренного развития памяти CXMTЭволюция памяти для вычислений искусственного интеллекта

В индустрии полупроводников наметился важный поворот: компании Sandisk и SK hynix, при поддержке Tenstorrent и Google, представили стандарт памяти HBF. Эта разработка стала результатом работы отраслевого консорциума, стремящегося преодолеть фундаментальный разрыв между энергонезависимой памятью (хранилищами) и сверхбыстрой оперативной памятью.
Ключевой точкой применения HBF становится этап инференса — процесс работы уже обученной модели, когда она генерирует ответы или делает логические выводы на основе полученных данных. В современных LLM (больших языковых моделях) объем весов настолько огромен, что их хранение исключительно в дорогостоящей и ограниченной по объему памяти HBM становится экономически нецелесообразным. HBF предлагает элегантный выход: она фактически повторяет компоновочную логику HBM, обеспечивая колоссальную пропускную способность, но при этом обладает свойством долговременного хранения информации.
С точки зрения системного анализа, такая гибридизация позволяет значительно сократить задержки при извлечении данных для вычислений. Специалисты из Google DeepMind подчеркивают, что в условиях текущих трендов развития ИИ, где модели растут экспоненциально, способность быстро считывать огромные массивы параметров становится критическим фактором. Кроме того, переход на HBF существенно повышает энергетическую эффективность всей инфраструктуры, что является приоритетом для операторов гиперскейл-дата-центров, борющихся с растущим энергопотреблением и тепловыделением.
Однако высокая производительность сопряжена с техническими рисками. Основная проблема заключается в износе ячеек памяти при интенсивных циклах перезаписи. Теоретически, если использовать HBF как полноценную оперативную память, микросхемы выйдут из строя в кратчайшие сроки из-за ограниченного ресурса циклов стирания и записи.
Для решения этой проблемы предлагается стратегия разделения ролей. Инфраструктура должна быть организована так, чтобы HBF использовалась преимущественно для операций чтения — например, для хранения статичных весов модели. Для всех динамических операций записи и временного кэширования данных будет привлекаться традиционная память HBM. Такой тандем позволит нивелировать недостатки обеих технологий: HBM возьмет на себя нагрузку по обновлению данных, а HBF обеспечит масштабное и быстрое хранилище, превращая процесс инференса в максимально оптимизированный конвейер.

