Xiaomi впервые вывела процесс RL-обучения моделей MiMo-V2.6-pro и MiMo-V2.6-flash в публичный стрим: с 17 сентября 2026 телеметрия рана доступна в реальном времени на странице mimo.xiaomi.com/rl. На каждом шаге асинхронного обучения выполняется около 25 000 роллаутов и обрабатывается примерно 2 млрд токенов, суммарные затраты превысили $1,1 млн, а открытый дашборд показывает passrate, распределение задач по доменам и лог сбоев. В ближайшие недели команда обещает опубликовать документацию и наработки, что может дать инженерам первый открытый рецепт асинхронного multi-agent RL.
Что произошло
Стрим запустил глава команды Xiaomi MiMo Луо Фули (Luo Fuli) 17 сентября 2026 на странице mimo.xiaomi.com/rl. Обучение обеих моделей устроено полностью асинхронно: на каждом шаге берётся 1568 промптов по 16 роллаутов, что даёт около 25 000 попыток и примерно 2 млрд токенов за шаг. К моменту проверки дашборд показывал шаг 17 по flash с passrate 0,585 и смешанные домены code/general/chat/visual; по pro к этому моменту прошло 12 шагов. Затраты превысили $1,1 млн: около $806 тыс. израсходовано на pro за 12 шагов и около $354 тыс. на flash за 17 шагов при темпе примерно $30,9 тыс. в час. В промежуточных замерах бенчмарка DeepSWE v1.1 pro показывает 63,72, flash — 60,77. В открытом логе инцидентов зафиксированы перезапуски обоих ранов из-за сетевых и VRAM-сбоев, а кибербезопасность-датасет удалён из ближайшего запуска pro из-за «плохих паттернов» в роллаутах.
Контекст
Обычно этап RL-обучения фронтирных моделей закрыт до релиза: внешние наблюдатели видят лишь итоговый техотчёт с отобранными цифрами, а живая динамика рана остаётся внутренней информацией лаборатории. Xiaomi идёт противоположным путём и превращает обучение в наблюдаемый эксперимент, который можно проверять в реальном времени, а не принимать на веру по пресс-релизу. Само устройство рана необычно: в одном запуске смешиваются домены code, general, chat и visual и одновременно задействуются несколько тестовых харнессов — фактически это заявка на multi-domain асинхронный RL-рецепт, ценность которого станет проверяемой только после публикации методологии. Дополнительный вес истории придаёт биография Луо Фули: он возглавляет команду MiMo после работы в DeepSeek и Alibaba DAMO, то есть за стримом стоит человек, знакомый с закрытой практикой ведущих лабораторий. Ориентиром качества на промежуточном этапе служит бенчмарк DeepSWE v1.1, а обещанные открытые рецепты можно будет напрямую сопоставить с подходами DeepSeek и OpenAI.
Почему это важно для индустрии
Для индустрии это первый известный случай, когда компания стримит телеметрию фронтирного RL-запуска в реальном времени: механизм RL-scaling становится наблюдаемым, а не заявленным в техотчёте после релиза. Инженерам и исследователям доступны редкие рыночные данные об экономике большого рана — около $30,9 тыс. в час и более $1,1 млн на середину запуска — которые можно использовать для планирования собственных RL-бюджетов и capacity-расчётов. Открытый лог инцидентов с перезапусками из-за сетевых и VRAM-сбоев показывает реальную цену надёжности больших ранов, которая обычно остаётся скрытой. Для стартапов сигнал двойственный: обещанная документация по асинхронному multi-agent RL может удешевить вход в RL-масштабирование и дать blueprint для сравнения с подходами DeepSeek и OpenAI, но одновременно прозрачность работает как GTM-ход, поднимающий планку ожиданий до релиза модели. Если практика публичных телеметрий приживётся, отраслевая норма может сместиться от «техотчёт после релиза» к наблюдаемым в реальном времени обучающим ранам, а накопленные кривые passrate, логи сбоев и затраты на шаг станут корпусом данных для изучения динамики и экономики RL-scaling.
Почему это важно для пользователей
Дашборд mimo.xiaomi.com/rl открыт прямо сейчас: можно вживую наблюдать шаги обучения, passrate, распределение задач по доменам, тайминги и лог сбоев — без ожидания релиза и без платного доступа. Инженерам это даёт бесплатный кейс для учений по инцидент-менеджменту и калибровки ожиданий по скорости и стоимости RL-обучения, а читателям — редкую возможность увидеть, как реально идут большие раны, включая отказы и перезапуски, которые компании обычно не показывают. Практическое ограничение: разворачивать MiMo-V2.6 в продуктах пока не на чем — API-доступа, прайсинга и метрик латентности в источниках нет, а модели ещё обучаются, поэтому ценность сейчас в наблюдении и накоплении телеметрии, а не в интеграции. Аналитикам и авторам техконтента живые цифры дают материал для сравнительных разборов и прогнозов ещё до выхода моделей.
Что пока неизвестно / ограничения
Passrate 0,585 на шаге 17 у flash нельзя читать как показатель прогресса: без определения награды, весов доменов и разбивки по code/general/chat/visual это число несопоставимо ни между шагами, ни между доменами, ни с чужими рунами. Цифры 63,72 и 60,77 в DeepSWE v1.1 — промежуточные замеры ещё обучающихся моделей, а не финальная оценка. Удаление кибербезопасность-датасета из запуска pro — факт из источника, но трактовка его как сигнала нестабильности качества роллаутов при смешивании доменов требует подтверждения после раскрытия методологии. Обещание открыть документацию и наработки ещё не исполнено; если открытой окажется лишь часть материалов, выводы о воспроизводимости рецепта придётся ограничить. Наконец, API-доступа, прайсинга и данных по латентности MiMo-V2.6 пока не существует, поэтому продуктовые выводы делать рано.
Источники
- Luo Fuli on X — анонс публичного стрима RL-обучения MiMo-V2.6
- mimo-v2.6 RL — официальный live-дашборд обучения Xiaomi (метрики mimo-v2.6-pro и mimo-v2.6-flash)
- 36kr / APPSO — Xiaomi New Model Training Program Unveiled for First Time (детали шагов, затрат, DeepSWE)
Автор
Look at AI, редакция