🤖 Xiaomi стримит RL-обучение моделей MiMo-V2.6 в прямом эфире
Глава команды Xiaomi MiMo Луо Фули (Luo Fuli, ранее DeepSeek и Alibaba DAMO) 17 сентября 2026 впервые вывел в публичный стрим процесс RL-обучения моделей MiMo-V2.6-pro и MiMo-V2.6-flash на странице mimo.xiaomi.com/rl. Обучение идёт полностью асинхронно: на каждом шаге берутся 1568 промптов по 16 роллаутов — около 25 000 попыток и примерно 2 млрд токенов. К моменту проверки дашборд показывал шаг 17 по flash с passrate 0.585 на смешанных доменах code/general/chat/visual. Затраты уже превысили $1,1 млн: около $806 тыс. на pro за 12 шагов, $354 тыс. на flash за 17 шагов — примерно $30,9 тыс. в час. В бенчмарке DeepSWE v1.1 pro показывает 63.72, flash — 60.77. Документацию и наработки обещают открыть в ближайшие недели; в логе инцидентов видны перезапуски обоих ранов из-за сетевых и VRAM-сбоев, а кибербезопасность-датасет убрали из ближайшего запуска pro из-за «плохих паттернов» в роллаутах.
🌍 Впервые компания стримит телеметрию фронтирного RL-запуска в реальном времени — обычно обучение закрыто до релиза модели. Публично видны проверяемые механизмы RL-scaling: объём токенов на шаг, распределение задач по доменам, награды и инциденты инфраструктуры. Эксперимент «до каких пределов масштабируется RL» стал наблюдаемым, а не только заявленным в пресс-релизе: цифры, которые обычно раскрываются в техотчёте спустя месяцы, здесь считываются с дашборда вживую.
👤 Дашборд mimo.xiaomi.com/rl можно открыть прямо сейчас и смотреть шаги, passrate и тайминги вживую, а обещанное открытие документации даст конкретные рецепты асинхронного multi-agent RL, сравнимые с подходами DeepSeek и OpenAI. Поучителен и открытый лог инцидентов: он показывает, как выглядят реальные сбои больших RL-ранов. При этом passrate 0.585 сам по себе не показатель прогресса — без определения награды и весов доменов это число несопоставимо ни между шагами, ни с чужими ранами.
Источник 1: https://x.com/_LuoFuli/status/2100296686719610932 Источник 2: https://mimo.xiaomi.com/rl/#overview