🚀 Запуск гигантских ИИ-моделей на обычном железе

Инженер Vincenzo представил Colibrì — runtime на языке C, который позволяет запускать модели Mixture-of-Experts (MoE) размером 1.5 ТБ на обычном потребительском железе. Благодаря потоковой передаче весов с NVMe-накопителя и трехуровневой иерархии памяти, модель GLM-5.2 (744B параметров) смогла работать всего на 25 ГБ оперативной памяти.

🌍 Это меняет парадигму локального запуска LLM, доказывая, что для работы с frontier-моделями не обязательно иметь кластер из H100, а достаточно грамотного управления иерархией памяти.

👤 Теперь мощнейшие модели мира теоретически доступны на обычном ноутбуке с быстрым SSD. Хотя скорость генерации пока крайне низкая (~0.1 токена/сек), технология открывает путь к доступности сверхмощного ИИ без огромных затрат на видеокарты.