Qwen (Alibaba) выпустил открытые веса модели Qwen3.8-2.4T-A95B — это первая модель уровня Qwen-Max с полностью открытой архитектурой. 2.4 триллиона параметров, MoE с 512 экспертами, контекст до миллиона токенов и day-0 поддержка vLLM и SGLang делают модель немедленно готовой к деплою.

image
image
image

Что произошло

Alibaba сделал открытыми веса модели Qwen3.8-2.4T-A95B. Модель использует гибридную архитектуру из 92 слоёв Gated DeltaNet и Gated Attention с миксом экспертов: из 2.4 трлн параметров одновременно активно 95 миллиардов при 512 экспертах. Контекстное окно — до 1 миллиона токенов. Весы доступны в BF16 (около 5 ТБ), FP8 (около 2.4 ТБ) и квантованных версиях NVFP4 и MXFP4 (около 1.2 ТБ). На бенчмарках модель показала AIME25 на уровне 92–96% и PaperBench 93.0, заняв лидирующие позиции на большинстве мультимодальных и агентных задач. Фреймворки vLLM и SGLang добавили поддержку с первого дня выхода весов.

Контекст

До этого выпуска фронтier-модели с триллионами параметров были доступны преимущественно через закрытые API: GPT-5.6 Sol от OpenAI, Gemini 3.1-Pro от Google, Fable 5 и Opus 4.8. Открытые модели с весами в сотни миллиардов параметров существовали, но модель класса 2T+ параметров с открытым доступом — это прецедент. Архитектурный выбор Gated DeltaNet + Gated Attention значим: линейное внимание на большинстве слоёв даёт сложность памяти O(1) на слой вместо O(N) у стандартного self-attention, что критично для работы с контекстом в 1M токенов. Конфигурация MoE с рациона 95B из 2.4T (около 37% активных) близка к оптимальному балансу между специализацией экспертов и накладными расходами на маршрутизацию.

Почему это важно для индустрии

Это прямой вызов закрытым фронтier-моделям: производительность на уровне GPT-5.6 Sol и Opus 4.8 теперь доступна для локального деплоя и модификации без привязки к API-провайдеру. Инфраструктура инференса готова — vLLM и SGLang поддерживают модель с первого дня. Для команд с доступом к кластерам NVIDIA B300 или AMD MI355X инференс на одной ноде возможен уже в FP4. Архитектура Gated DeltaNet + MoE может стать стандартным паттерном для эффективных моделей 1T+ параметров, поскольку линейная память на контекст решает ключевое bottleneck-ограничение для длинных рабочих нагрузок.

Почему это важно для пользователей

Если у вас есть доступ к одной ноде B300 или MI355X, вы можете скачать FP4-версию и запустить инференс через vLLM или SGLang. Для мультинодных кластеров доступны версии FP8 и BF16. Рекомендованные параметры генерации: temperature=1.0, top_p=0.95, max_tokens не менее 128_000 для reasoning-задач. Команды без доступа к флагманскому железу могут ожидать квантованные порты для consumer GPU. Продуктовые команды могут начать интеграцию в agent-workflow и A/B-тестирование против текущих моделей уже сегодня.

Что пока неизвестно / ограничения

Заявление о превосходстве или паритете с GPT-5.6 Sol, Gemini 3.1-Pro и Opus 4.8 основано на самоотчётах Alibaba и пока не подтверждено независимой верификацией. Результат AIME25 указан как диапазон 92–96%, а не точное значение. Методологические детали тренировки — включая объём и состав данных, расписание обучения, конфигурацию кластера — не раскрыты полностью. Независимые репликации бенчмарков потребуют от 1 до 2 недель. Реальная производительность на продакшен-данных может отличаться от бенчмарковых результатов.

Источники

Автор

Look at AI, редакция