Nvidia N1X и новая эра Arm-ПКРециклинг памяти в эпоху ИИ-дефицита

Современная индустрия высокопроизводительных вычислений столкнулась с парадоксальным вызовом: пока мир обсуждает мощность графических процессоров и тензорных ядер, реальным «бутылочным горлышком» стала оперативная память. В типичном современном ИИ-сервере стоимость компонентов памяти теперь составляет более 75% от общей стоимости комплектующих. Эта экономическая диспропорция превратила DRAM из обычного расходного материала в стратегический ресурс, дефицит которого диктует новые правила эксплуатации дата-центров.
В ответ на этот кризис Google применила метод, который в любой другой индустрии назвали бы «каннибализацией» оборудования. Компания начала массово разбирать списанные серверы, чтобы извлекать из них модули DDR4. Чтобы интегрировать устаревшие стандарты памяти в современные системы, были разработаны специализированные аппаратные адаптеры. Это решение позволяет использовать старые модули в новых ИИ-системах, фактически продлевая жизнь железу, которое должно было отправиться на переработку.
Рыночная конъюнктура лишь подтверждает безысходность ситуации. Аналитические данные TrendForce и Goldman Sachs указывают на устойчивый рост цен: в третьем квартале стоимость серверной DRAM может вырасти на 13–18%, а памяти для персональных компьютеров — до 23%. Спотовые цены на модули DDR4 и DDR5 демонстрируют высокую волатильность, что делает закупку новых компонентов в промышленных масштабах крайне затратной и рискованной операцией.
Однако аппаратный рециклинг — лишь одна из составляющих комплексной стратегии. Чтобы снизить зависимость от физического объема памяти, Google ведет глубокую оптимизацию на программном уровне. Основной удар приходится на библиотеки и алгоритмы сжатия KV-кеша (Key-Value cache) — критически важного механизма, который определяет, сколько контекста модель может удерживать в памяти при генерации ответа. Оптимизация этого слоя позволяет сократить объем необходимых ресурсов на единицу вычислительной мощности, что фактически увеличивает «плотность» вычислений.
Особое внимание уделяется иерархии памяти в новых ускорителях. Например, TPU8i, предназначенный для инференса, использует многоуровневый подход: основной массив данных обрабатывается сверхбыстрой памятью HBM3E объемом 288 Гбайт, встроенной непосредственно в ускоритель. В то же время задачи уровня хоста традиционно ложатся на DDR5. Но именно здесь дефицит DRAM проявил себя наиболее остро: в ряде сценариев Google была вынуждена заменить современную DDR5 на те самые восстановленные модули DDR4.
Таким образом, борьба с дефицитом ресурсов привела к созданию замкнутого цикла внутри инфраструктуры одного из крупнейших операторов ИИ. Ситуация, когда передовые системы машинного обучения опираются на компоненты десятилетней давности, подчеркивает критическую зависимость цифрового прогресса от физических ограничений полупроводникового рынка.

