Энергетический стандарт для рабочих станций AorusЛокальный интеллект в масштабе микроконтроллера

Современный рынок ИИ привык к масштабам: триллионы параметров, тысячи видеокарт H100 и колоссальные энергозатраты. Однако параллельно развивается и другой путь — поиск минимально возможного объема ресурсов, достаточного для поддержания текстовой генерации. Показательным стал кейс по запуску большой языковой модели (LLM) на микроконтроллере ESP32-S3, стоимость которого не превышает десяти долларов.
Это устройство изначально создавалось для управления датчиками и простыми задачами интернета вещей (IoT). Его аппаратные возможности крайне ограничены: всего 520 Кбайт статической оперативной памяти (SRAM) и 8 Мбайт псевдо-SRAM (PSRAM). Очевидно, что современные флагманы вроде DeepSeek V4 Flash здесь бессильны. Для реализации задачи потребовался принципиально иной подход к выбору модели.
В качестве фундамента была взята TinyStories — разработка Microsoft Research. Эта модель в десять тысяч раз компактнее индустриальных стандартов и содержит всего 28,9 млн параметров. Несмотря на малый размер, даже она в исходном виде оказалась слишком тяжелой для ESP32-S3: при стандартной 16-битной точности веса занимают около 60 Мбайт, что многократно превышает доступный объем памяти устройства.
Решением стала агрессивная квантование — процесс снижения точности представления весов. Переход с 16 бит на 8, а затем и на 4 бита позволил сжать модель до 14,9 Мбайт. Для размещения такого объема данных потребовалась модификация микроконтроллера с расширенной флеш-памятью на 16 Мбайт.
Однако простого размещения весов во флеш-памяти недостаточно для эффективной работы, так как скорость доступа к ней значительно ниже, чем к оперативной памяти. Чтобы преодолеть этот барьер, был применен механизм послойного встраивания (Per-layer embedding — PLE), концептуально схожий с тем, что используется в моделях семейства Google Gemma.
Суть метода заключается в разделении данных: основная часть весов (около 25 млн параметров или 12 Мбайт) выносится во флеш-память, к которой обращения происходят эпизодически. В оперативную память помещаются лишь критически важные данные объемом 2 Мбайт. Таким образом, входные токены и кеш ключ-значение (KV) располагаются в PSRAM, а для процессов активации используется основной SRAM.
Результатом такой инженерной оптимизации стала скорость генерации почти в 10 токенов в секунду. Это сопоставимо со скоростью чтения среднестатистического человека, что делает взаимодействие с устройством комфортным и естественным.
Разумеется, TinyStories ограничена своей спецификой — она способна генерировать лишь короткие истории, что недостаточно для полноценного чат-бота. Существуют и другие узкоспециализированные модели, например Barista, которая работает еще быстрее, но ограничена тематикой приготовления кофе. Тем не менее, данный эксперимент демонстрирует важный технологический сдвиг: интеллект перестает быть прерогативой серверных стоек и становится доступным на уровне простейших электронных компонентов.

