Яндекс опубликовал на Hugging Face под лицензией Apache 2.0 базовую модель AliceAI-Foundation-80B-A3B-Base — свой первый претрейн, полностью обученный с нуля без чужих весов. При 80 млрд параметров на каждый токен активны лишь около 3 млрд, а контекст достигает 262 144 токенов. По данным техотчёта, модель обходит более крупные открытые претрейны DeepSeek-V4-Flash-Base, Nemotron-3-Super-120B-A12B-Base и GLM-4.5-Air-Base по русской фактике и ряду технических бенчмарков. Одновременно компания открыла два новых русскоязычных фактологических бенчмарка, WikiWebFacts и HardMultiQA, и подробный техотчёт с абляциями. Это base-модель без чат-инструктов, поэтому для диалоговых продуктов её пока нужно дообучать самостоятельно.

image
image
image

Что произошло

Яндекс выложил в открытый доступ под лицензией Apache 2.0 базовую модель AliceAI-Foundation-80B-A3B-Base: 80 млрд параметров, из которых на каждый токен активны около 3 млрд, MoE из 512 экспертов с маршрутизацией top-10 плюс один общий эксперт, гибридная архитектура из 36 слоёв линейного внимания KDA и 12 слоёв полного внимания, контекст до 262 144 токенов. Модель обучена полностью с нуля, без использования чужих весов. По опубликованным таблицам, она обходит более крупные открытые претрейны DeepSeek-V4-Flash-Base (284B-A13B), Nemotron-3-Super-120B-A12B-Base и GLM-4.5-Air-Base (106B-A12B) по русской фактике — WikiWebFacts 86.5, HardMultiQA 67.9, EGE CoT 90.5 — а также по MATH-500 (91.1), LiveCodeBench v5-6 (50.5) и AIME 2026 pass@32 (96.7). Заявлено и превосходство над прежней закрытой Alice AI LLM 235B Base при примерно семикратно меньшем числе активных параметров. Вместе с весами Яндекс открыл два новых русскоязычных фактологических бенчмарка, WikiWebFacts и HardMultiQA, и техотчёт с абляциями по KDA, Attention Residuals, Muon и стабилизации MoE через Z-loss.

Контекст

Прошлогодняя Alice AI LLM 235B была претрейном на базе Qwen3-235B-A22B, то есть опиралась на чужие веса; AliceAI-Foundation-80B-A3B-Base — первый претрейн Яндекса, пройденный от инициализации до чекпоинта самостоятельно. Ставка на разреженный MoE с 512 экспертами и на гибрид, где 36 слоёв из 48 отданы линейному вниманию KDA, — это расчёт на дешёвый длинный контекст: активных параметров на токен в несколько раз меньше, чем у сравнимых открытых моделей. Описание истории стабилизации MoE-активаций через Z-loss говорит о том, что в техотчёт вошли реальные проблемы претрейна, а не только итоговые победы. Открытие весов вместе с абляциями — редкий для индустрии вне Китая и США случай воспроизводимого рецепта претрейна, а созданные Яндексом WikiWebFacts и HardMultiQA дают сообществу то, чего раньше не было в открытом виде, — инструмент измерения русской фактики. По заявлению компании, эта base-модель должна стать фундаментом единой reasoning-модели для Алисы.

Почему это важно для индустрии

Лицензия Apache 2.0 допускает коммерческое использование, поэтому для команд, строящих русскоязычные AI-продукты, фундамент стал бесплатным и юридически чистым. Меняется и экономика: около 3 млрд активных параметров на токен против 12–13 млрд у претрейнов, с которыми модель соревнуется, — если цифры подтвердятся, это аргумент в пользу качества данных и рецепта обучения, а не грубого масштаба. Для продуктовых команд это редкий полный набор «кирпичей»: претрейн с сильной русской фактикой, контекст 262 144 токена, открытые бенчмарки для оценки и техотчёт с абляциями, который можно воспроизводить. На такой базе логично ожидать нового класса русских RAG-систем и SFT-проектов, а также снижения зависимости русскоязычных продуктов от чужих весов. Не менее важен прецедент: открытый претрейн Яндекса выходит на равных против моделей китайских опен-лабораторий при меньшем числе активных параметров.

Почему это важно для пользователей

Веса уже можно скачать на Hugging Face и запустить на своей инфраструктуре: в transformers (референс — версия 5.16.1, для KDA-слоёв потребуется flash-linear-attention 0.5.0) или в vLLM через готовый Docker-образ с tensor-parallel на 4 GPU. Реальные сценарии прямо сейчас — completion-пайплайны, few-shot, генерация данных для дистилляции, прогоны evals, SFT-эксперименты на своих русских корпусах и RAG по длинным документам с опорой на контекст 262k. Лицензионные издержки при этом нулевые, а прототипирование длинноконтекстных русскоязычных приложений становится заметно дешевле. Ограничение существенное: это base-модель без чат-инструктов, готовой instruct-версии Яндекс не опубликовал, поэтому диалоговый или агентный продукт потребует собственного дообучения — в продакшен без доработок модель брать нельзя.

Что пока неизвестно / ограничения

Все сравнения с DeepSeek-V4-Flash-Base, Nemotron-3-Super-120B-A12B-Base и GLM-4.5-Air-Base выполнены автором модели, включая два новых бенчмарка его же авторства, поэтому до независимых прогонов заявленное превосходство остаётся правдоподобной гипотезой, а не подтверждённым фактом. Внутреннее сравнение с закрытой Alice AI LLM 235B Base извне верифицировать труднее всего. Яндекс не опубликовал latency, throughput и стоимость на токен, а зрелость vLLM-стека для KDA-слоёв ещё предстоит проверить на практике. Неизвестны и сроки появления instruct- или reasoning-версии на этом фундаменте.

Источники

Автор

Look at AI, редакция