Итальянский инженер Vincenzo (JustVugg) представил Colibrì — инновационный proof-of-concept runtime на языке C, который позволяет запускать сверхмощные модели архитектуры Mixture-of-Experts (MoE) на стандартном потребительском железе за счет эффективного управления иерархией памяти.



Что произошло
В рамках проекта Colibrì была продемонстрирована работа модели GLM-5.2 с 744 миллиардами параметров, чей объем составляет около 1.5 ТБ. Благодаря использованию трехуровневой иерархии памяти (VRAM, RAM и NVMe-накопитель) и интеллектуального кэширования, запуск такой модели стал возможен всего на 25 ГБ оперативной памяти. Система обучается предсказывать и подгружать необходимые веса экспертов непосредственно с диска, минимизируя задержки.
Контекст
Традиционно для работы с frontier-моделями такого масштаба требуются специализированные вычислительные кластеры, такие как системы на базе NVIDIA H100. Основным барьером является физический объем видеопамяти (VRAM), необходимый для размещения весов модели. Colibrì предлагает программный метод обхода этого ограничения, смещая фокус с объема видеопамяти на скорость подкачки данных через NVMe.
Почему это важно для индустрии
Технология меняет парадигму локального развертывания LLM, доказывая, что архитектурные ограничения по памяти для MoE-моделей можно преодолеть программными методами. Это может привести к пересмотру стандартов локального AI-оборудования: фокус может сместиться с наращивания объема VRAM на увеличение скорости NVMe-накопителей и внедрение более умных алгоритмов управления памятью в популярные инструменты вроде llama.cpp.
Почему это важно для пользователей
Теоретически пользователи могут запускать мощнейшие ИИ-модели мира на обычных ноутбуках или домашних ПК, обладающих быстрым SSD. Хотя текущая скорость генерации составляет всего около 0.1 токена в секунду, что делает ее непригодной для оперативного общения, технология открывает путь к доступности сверхмощного ИИ без необходимости покупки дорогостоящих видеокарт.
Что пока неизвестно / ограничения
Текущая производительность крайне ограничена пропускной способностью накопителя, что приводит к экстремально низкой скорости генерации. На данный момент решение является лишь доказательством концепции (PoC) и неприменимо для real-time задач или production-среды без значительных оптимизаций.
Источники
Автор
Look at AI, редакция
