Разработчик slvDev продемонстрировал возможность запуска языковой модели с 28,9 млн параметров на бюджетном микроконтроллере ESP32-S3. Благодаря оптимизации использования памяти, устройство стоимостью около 8 долларов способно генерировать связный текст со скоростью около 9,5 токенов в секунду.

image

Что произошло

Используя метод Per-Layer Embeddings, адаптированный из архитектур Google Gemma, разработчик смог разместить основную массу параметров (25 млн из 28,9 млн) во внешней Flash-памяти вместо дефицитной SRAM. Модель, протестированная на наборе данных TinyStories, обеспечивает стабильную генерацию коротких историй в условиях жестких аппаратных ограничений.

Контекст

Метод Per-Layer Embeddings позволяет эффективно распределять веса модели между различными типами памяти, что критически важно для embedded-систем. Ранее подобные архитектурные оптимизации применялись преимущественно к крупным моделям, но данный проект доказывает их применимость и для сверхмалых систем.

Почему это важно для индустрии

Проект демонстрирует возможность переноса оптимизаций больших моделей на сверхбюджетное Edge-оборудование. Это открывает путь к созданию автономных локальных LLM в IoT-устройствах, которые могут работать полностью без участия облачных вычислений.

Почему это важно для пользователей

Для потребителей это означает появление доступных и приватных умных гаджетов. Даже недорогие устройства смогут обладать базовым интеллектом для обработки текста и выполнения команд локально, не требуя постоянного подключения к интернету и не передавая данные на сторонние серверы.

Источники

Автор

Look at AI, редакция