Reflection AI объявила о своей первой модели с открытыми весами — Beam, крупной разреженной MoE-сети, которая по данным лаборатории ставит рекорды среди открытых моделей в кодинговых бенчмарках и уступает конкурента Kimi K3 только по сырой вычислительной силе. Веса под лицензией Apache 2.0 обещаны в этом месяце вместе с полным стеком для запуска и файнтюнинга, а главный продающий аргумент — в разы меньшие затраты вычислений на инференс — пока опирается на собственную методику подсчёта, которую независимые исследователи почти наверняка будут оспаривать.

Что произошло
5 октября 2026 года Reflection AI опубликовала в официальном блоге пост «Introducing Beam: Reflection's 501B open-weight model», представив свою первую модель с открытыми весами. Beam построена как sparse Mixture-of-Experts: 501 млрд параметров суммарно, из которых в работе одновременно задействованы 23 млрд. Преобучение прошло на 23,8 трлн токенов, а после мидтрейнинга эффективный контекст достигает 1 млн токенов. Разработчики называют RL-этап одним из крупнейших среди открытых лабораторий: более 100 млн роллаутов за 4 недели на 10,5 тыс. ускорителей NVIDIA GB300, около 1,3 млрд песочниц и примерно 1 млн окружений. Полностью асинхронные policy gradients, согласно анонсу, остаются стабильными даже при устаревании весов политики на 107 версий, а один прогон пережил 71 инференс-инцидент. По собственным числам лаборатории, Beam показывает лучший результат среди открытых моделей в SWEBench Verified (80,9) и SWEBench Multilingual (78,0), набирает 97,8 на AIME 2026 и 90,5 на GPQA Diamond, однако на SWE Bench Pro v2-Hard проигрывает Kimi K3 — 77,2 против 88,2.
Контекст
Открытый frontier в кодинге и агентных задачах в последние месяцы формировался вокруг китайских лабораторий: GLM 5.2 и 5.3, Kimi K3 и Qwen 3.8 Max задают планку, с которой Beam выходит на прямое сравнение. Reflection AI сознательно смещает конкуренцию из плоскости сырых бенчмарков в плоскость инференс-эффективности, заявляя 3–4-кратное снижение FLOPs при сопоставимых reasoning-скорах. Показанная в блоге формула приблизительной оценки — примерно 2 × активные параметры × сгенерированные токены — не учитывает prefill, attention и overhead сервинга; при контексте до 1 млн токенов доля prefill может быть значительной, поэтому такой подсчёт заведомо благоприятствует MoE-архитектурам с малым числом активных параметров. Судя по опубликованным характеристикам, сама архитектура представляет собой типовой frontier-конфигурацию без очевидной новизны, а главный кандидат на воспроизводимую инженерную ценность — инфраструктура масштабного обучения с подкреплением, а не сама модель.
Почему это важно для индустрии
Для индустрии это первый открытый frontier-выход Reflection AI и заявка на западную альтернативу GLM 5.2/5.3, Kimi K3 и Qwen 3.8 Max в кодинге и агентных задачах. Если тезис об эффективности подтвердится независимыми измерениями, юнит-экономика агентных сервисов улучшится, а закрытые API столкнутся с ценовым давлением, потому что стоимость решённой задачи начнут считать в FLOPs и токенах. Второй актив — RL-инфраструктура: асинхронные policy gradients, допускающие заметное устаревание весов политики, в сочетании с песочницами в масштабе около миллиарда образуют воспроизводимую инженерную базу, которую смогут переиспользовать будущие открытые модели; со временем тяжёлый агентный RL перестанет быть привилегией закрытых лабораторий. Одновременно методика подсчёта FLOPs почти наверняка станет предметом споров о честном сравнении стоимости инференса MoE-моделей: сопоставления на выровненном compute-бюджете в анонсе нет.
Почему это важно для пользователей
Для читателей, работающих с открытыми моделями, главный практический факт — обещание опубликовать в этом месяце веса под Apache 2.0 вместе с полным стеком для запуска, оценки и файнтюнинга; 501-миллиардная MoE с 23 млрд активных параметров относится к классу моделей, который энтузиасты с несколькими GPU реально запускают у себя. Уже сейчас открыта запись в ранний доступ на platform.reflection.ai, где можно попробовать пользовательский параметр reasoning effort, управляющий балансом между длиной размышлений модели и качеством ответа. Лаборатория показывает и демо: детерминированный пазл 180×90 с покрытием 95,5% и пример файнтюна Gemma-4. Разумное действие сегодня — встать в очередь раннего доступа и заранее подготовить собственную методику оценки на своих агентных задачах, чтобы в день релиза сравнивать Beam по стоимости решённой задачи, а не по анонсным цифрам.
Что пока неизвестно / ограничения
Весов, техотчёта и модельной карты пока нет — всё обещано на этот месяц, поэтому ни бенчмарк-скоры, ни сравнение эффективности независимо не проверяемы: перед нами числа самой лаборатории, а не сторонние прогоны. Использованная в анонсе методика подсчёта FLOPs смещена в пользу архитектуры Reflection с малым числом активных параметров, а сопоставления на выровненном compute-бюджете в материале нет, так что разговоры о «модели в 3–4 раза дешевле» преждевременны до появления весов. AIME 2026 и GPQA Diamond близки к насыщению и слабо различают модели, а показательные демо вроде пазла и файнтюна являются иллюстрациями, а не стандартизированными бенчмарками. Независимая проверка — сторонние прогоны SWEBench и SWE Bench Pro, реальная стоимость инференса с учётом prefill и сервинга, воспроизведение деталей RL — возможна только если веса под Apache 2.0 выйдут в обещанный срок.
Источники
- Introducing Beam: Reflection's 501B open-weight model — официальный блог Reflection AI
- Beam — ранний доступ и waitlist на платформе Reflection AI
Автор
Look at AI, редакция
