Локальный интеллект в масштабе микроконтроллера

Дата5 авг. 2026 г.
Читать3 мин
Локальный интеллект в масштабе микроконтроллера
Эпоха гигантских нейросетей постепенно дополняется трендом на радикальную оптимизацию и перенос вычислений на периферию. Пока индустрия сражается за доступ к мощнейшим GPU, настоящим фронтиром становится поиск предела миниатюризации когнитивных функций. Недавний эксперимент по запуску языковой модели на дешевом микроконтроллере доказывает, что генеративные возможности могут существовать вне облачных кластеров и дорогого оборудования. Это открывает новую перспективу для развития автономных систем и интернета вещей.

Современный рынок ИИ привык к масштабам: триллионы параметров, тысячи видеокарт H100 и колоссальные энергозатраты. Однако параллельно развивается и другой путь — поиск минимально возможного объема ресурсов, достаточного для поддержания текстовой генерации. Показательным стал кейс по запуску большой языковой модели (LLM) на микроконтроллере ESP32-S3, стоимость которого не превышает десяти долларов.

Это устройство изначально создавалось для управления датчиками и простыми задачами интернета вещей (IoT). Его аппаратные возможности крайне ограничены: всего 520 Кбайт статической оперативной памяти (SRAM) и 8 Мбайт псевдо-SRAM (PSRAM). Очевидно, что современные флагманы вроде DeepSeek V4 Flash здесь бессильны. Для реализации задачи потребовался принципиально иной подход к выбору модели.

В качестве фундамента была взята TinyStories — разработка Microsoft Research. Эта модель в десять тысяч раз компактнее индустриальных стандартов и содержит всего 28,9 млн параметров. Несмотря на малый размер, даже она в исходном виде оказалась слишком тяжелой для ESP32-S3: при стандартной 16-битной точности веса занимают около 60 Мбайт, что многократно превышает доступный объем памяти устройства.

Решением стала агрессивная квантование — процесс снижения точности представления весов. Переход с 16 бит на 8, а затем и на 4 бита позволил сжать модель до 14,9 Мбайт. Для размещения такого объема данных потребовалась модификация микроконтроллера с расширенной флеш-памятью на 16 Мбайт.

Однако простого размещения весов во флеш-памяти недостаточно для эффективной работы, так как скорость доступа к ней значительно ниже, чем к оперативной памяти. Чтобы преодолеть этот барьер, был применен механизм послойного встраивания (Per-layer embedding — PLE), концептуально схожий с тем, что используется в моделях семейства Google Gemma.

Суть метода заключается в разделении данных: основная часть весов (около 25 млн параметров или 12 Мбайт) выносится во флеш-память, к которой обращения происходят эпизодически. В оперативную память помещаются лишь критически важные данные объемом 2 Мбайт. Таким образом, входные токены и кеш ключ-значение (KV) располагаются в PSRAM, а для процессов активации используется основной SRAM.

Результатом такой инженерной оптимизации стала скорость генерации почти в 10 токенов в секунду. Это сопоставимо со скоростью чтения среднестатистического человека, что делает взаимодействие с устройством комфортным и естественным.

Разумеется, TinyStories ограничена своей спецификой — она способна генерировать лишь короткие истории, что недостаточно для полноценного чат-бота. Существуют и другие узкоспециализированные модели, например Barista, которая работает еще быстрее, но ограничена тематикой приготовления кофе. Тем не менее, данный эксперимент демонстрирует важный технологический сдвиг: интеллект перестает быть прерогативой серверных стоек и становится доступным на уровне простейших электронных компонентов.

Тала знает • Использование материалов сайта разрешено исключительно при условии размещения активной, прямой и открытой для поисковых систем гиперссылки на первоисточник. Ссылка должна быть кликабельной и располагаться непосредственно в теле публикации — до или после заимствованного текста. Любое копирование, воспроизведение или цитирование контента без соблюдения этого условия рассматривается как нарушение авторских прав.