🤖 Сентябрьский State of Local AI: что работает на локальном железе
Base Compute выпустила ежемесячный отчёт о локальном инференсе: какие модели на каком железе и с какой скоростью. В центре — Qwen3.8-27B (Apache 2.0, vision-language, контекст 262K, ~17 ГБ в Q4), плюс GLM-5.3-Flash (MIT) и Mac Studio M5 Ultra с RDMA-кластером до 3x на четырёх машинах.
🌍 Выбор модели свёлся к трём ограничителям — память, bandwidth, compute. Dense 27–31B в Q4 вытесняет 70B на карте 24 ГБ, открытые MoE дают frontier-качество на 128–192 ГБ unified memory — довод за self-hosting вместо облака. Пороги: чат 10–30 tok/s, кодинг 30+, агенты 50+.
👤 Практический справочник по сборке локального ИИ: от Gemma 4 E4B на 4 ГБ RAM до GLM-5.3-Flash (~120 ГБ в 3-бит), цены — от ноутбука до on-prem за $150k+. Обновляется ежемесячно; это вендор локального инференса, ключевые цифры стоит сверять с model card.
Источник 1: https://www.basecompute.co/stateoflocalai
