Компания Base Compute, разработчик локального инференс-движка BaseRT, выпустила сентябрьское издание ежемесячного отчёта State of Local AI Report — практическую карту того, какие ИИ-модели реально работают на локальном железе, на каком именно и с какой скоростью. В центре выпуска новый локальный «универсал» Qwen3.8-27B, агентная Meta Muse Glimmer 30B, открытые веса GLM-5.3 и Mac Studio M5 с кластеризацией по Thunderbolt 5 RDMA. Отчёт сводит выбор модели к трём физическим ограничителям и задаёт скоростные пороги для типовых задач.

Что произошло
Сентябрьский выпуск State of Local AI Report собрал главные события месяца в локальном инференсе. Новым «универсалом» для локального запуска названа Qwen3.8-27B: dense-модель под лицензией Apache 2.0 со встроенным vision-language, контекстом 262K и весами около 17 ГБ в 4-битном квантовании. Под агентные tool-calling циклы рекомендована Meta Muse Glimmer 30B. Веса GLM-5.3 появились на Hugging Face 28 августа под bespoke-лицензией с порогом выручки, а GLM-5.3-Flash, открытый MoE на 320B общих и 18B активных параметров под лицензией MIT, был опубликован 26 августа. В железе главное событие — Mac Studio M5 Max/Ultra, анонсированные 25 августа с началом поставок 22 сентября: пропускная способность памяти M5 Ultra выросла с 819 ГБ/с до 1,2 ТБ/с, а Apple заявляет до 3x прироста инференса на кластере из четырёх машин, соединённых по Thunderbolt 5 RDMA. Отчёт также задаёт пороги скорости по задачам: 10–30 tok/s для чата, от 30 для кодинга и от 50 для агентных сценариев.
Контекст
Методологическая ценность отчёта — в рамке выбора модели. Локальный запуск сводится к трём физическим ограничителям: ёмкость памяти определяет, поместится ли модель, пропускная способность памяти задаёт скорость генерации токенов, а вычислительная мощность — скорость обработки промпта. На этой рамке строится главный сдвиг выпуска: класс dense-моделей 27–31B в 4-битном квантовании вытесняет 70B dense как рабочий стандарт на одной карте с 24 ГБ памяти, что объясняется ростом качества квантов и потолком VRAM. Второй сдвиг — открытые MoE вроде GLM-5.3-Flash и gpt-oss-120b, делающие frontier-качество достижимым на 128–192 ГБ unified memory: арифметика сходится, GLM-5.3-Flash в 3-бит занимает около 120 ГБ и помещается в 128 ГБ Mac Studio. При этом источник — вендор локального инференса: Base Compute продаёт движок BaseRT, поэтому отчёт корректнее читать как практическую карту, а не научную работу.
Почему это важно для индустрии
Для индустрии отчёт фиксирует превращение локального инференса из хобби-эксперимента в планируемую продуктовую платформу: связка модели, железа и ожидаемого tok/s становится расчётной задачей, а не вопросом вкуса. Класс 27–31B dense на одной 24-ГБ карте удешевляет пилоты, а появление открытых MoE, которым достаточно 128–192 ГБ unified memory, делает self-hosting рентабельной альтернативой облачным API — решение всё чаще сводится к стоимости токена, требованиям к данным и операционной готовности. Для стартапов это одновременно сжатие маржи чистых API-обёрток и открытие ниш в приватном, edge- и on-prem-инференсе. Если ежемесячные обновления накопят воспроизводимую методологию с фиксированными конфигурациями, отчёт может стать де-факто точкой отсчёта локального инференса и создать давление на публикаторов моделей публиковать tok/s на стандартных конфигурациях; вероятный ответ рынка — рост числа dense-релизов, продуктов с local-first дефолтами и инструментов автоподбора модели под машину пользователя.
Почему это важно для пользователей
Для читателя отчёт — рабочий справочник по сборке локального ИИ. По таблицам можно подобрать модель под задачу и железо под модель: от Gemma 4 E4B, работающей в 4 ГБ RAM, до GLM-5.3-Flash, которому нужен Mac Studio со 128 ГБ unified memory, с реалистичными tok/s и ценами по шести уровням — от ноутбука до on-prem сервера за 150 тысяч долларов и выше. Заявленные пороги скорости помогают соотнести конфигурацию с задачей: для чата достаточно нижней границы, кодинг требует заметно большего темпа, а агентные циклы — ещё большего. Практический шаг сегодня — собрать прототип на Qwen3.8-27B: веса модели в 4-битном квантовании помещаются на одну карту с 24 ГБ памяти, а vision-language и контекст 262K закрывают большинство типовых сценариев. Отчёт обновляется ежемесячно, так что его можно держать в закладках и отслеживать динамику от выпуска к выпуску.
Что пока неизвестно / ограничения
Ключевые цифры отчёта — вендорские, и перед продакшн-решениями их стоит сверять с официальными model card и собственным бенчмарком на своём железе. Заявление, что Qwen3.8-27B улучшает результат Qwen3.6-27B на 77,2% на SWE-bench Verified, опубликовано без методологии: неизвестны агентная обвязка, число прогонов и настройки декодирования, а результат на SWE-bench сильно зависит от скаффолдинга. Методология измерений в отчёте не раскрыта: не указаны batch size, длины контекста и ядра квантования, поэтому цифры tok/s нельзя воспроизвести напрямую. Формулировка Apple «до 3x инференса на четырёх машинах» не уточняет, идёт ли речь об агрегированной пропускной способности или латентности одного запроса, и какова эффективность масштабирования при росте числа узлов; распределённый инференс по consumer-интерконекту имеет нетривиальные издержки. Открытым остаётся и вопрос качества MoE при агрессивной 3-битной квантизации. Первые независимые замеры Mac Studio M5 появятся только после начала поставок.
Источники
- State of Local AI Report · Base Compute (сентябрьское издание, обновляется ежемесячно)
- Обсуждение State of Local AI Report на Hacker News
Автор
Look at AI, редакция
