🤖 Яндекс открыл веса претрейна AliceAI-Foundation-80B-A3B-Base

Под лицензией Apache 2.0 на Hugging Face опубликована базовая модель, обученная с нуля: 80 млрд параметров (3 млрд активных), MoE из 512 экспертов, контекст 262 144 токена. По данным Яндекса, она обходит более крупные открытые претрейны DeepSeek-V4-Flash-Base и GLM-4.5-Air-Base на русских фактах, математике и коде.

🌍 Первый претрейн Яндекса, обученный полностью с нуля, конкурирует с открытыми моделями китайских лаб при меньшем числе активных параметров. Apache 2.0 разрешает коммерческое использование; сравнения с конкурентами пока авторские.

👤 Веса уже можно запустить: в transformers (референс 5.16.1, для KDA-слоёв нужен flash-linear-attention 0.5.0) или в vLLM через Docker-образ с tensor-parallel на 4 GPU. Но это base-модель без чат-инструктов — для диалога нужен свой SFT/RL.

Источник 1: https://huggingface.co/yandex/AliceAI-Foundation-80B-A3B-Base