14 августа 2026 команда Qwen (Alibaba) выпустила Qwen3.8-27B — открытую dense-модель на 27,8 млрд параметров под Apache-2.0, которая понимает текст, изображения и видео и запускается на одном сервере. По официальным цифрам вендора модель настигает, а по части агентных метрик обгоняет закрытую фронтир-модель Opus4.6 Max, что впервые даёт self-hosted стекам проверяемую альтернативу фронтир-API для агентного кодинга и computer use.

image
image
image

Что произошло

Модель построена на гибридной архитектуре Gated DeltaNet (линейное внимание) и Gated Attention, имеет нативный контекст 262 144 токена и включает режим рассуждения по умолчанию, который настраивается через reasoning_effort (xhigh, medium, low) и preserve_thinking. В официальных цифрах вендора Qwen3.8-27B впереди Opus4.6 Max на SWE-bench Pro (61,7 против 53,4), LiveCodeBench v6 (90,3 против 88,8), OSWorld-Verified (84,3 против 72,7) и AndroidWorld (81,9 против 62,0), но отстаёт на GPQA Diamond (89,2 против 91,3), HLE (30,8 против 40,0) и Terminal Bench 2.1 (73,0 против 78,2). Та же генерация Qwen 3.8 включает открытый MoE-флагман Qwen3.8-2.4T-A95B на 2,4 трлн параметров с примерно 95 млрд активных и контекстом 1 млн токенов. Веса лежат на Hugging Face под Apache-2.0, занимают около 55,6 ГБ в BF16 и запускаются на vLLM и SGLang, а в день релиза AMD объявила day-0 поддержку на Ryzen AI Max и Radeon.

Контекст

Четыре года назад китайские лаборатории воспринимались как догоняющие, а открытые модели — как вариант подешевле, уступающий закрытому фронтиру по качеству. Сегодня картина иная: Alibaba выпускает открытые dense-модели, которые на конкретных задачах настигают закрытые фронтир-системы, и делает это целой линейкой, а не единичным релизом. Ключевым полем стал агентный воркфлоу — кодинг, где модель сама пишет и правит код, и computer use, где модель управляет интерфейсом. Именно на этих задачах стоимость за внимание в длинных сессиях становится главным ограничителем, а открытые веса позволяют запустить модель в собственном периметре без оплаты за токены.

Почему это важно для индустрии

Появление dense-модели на 27,8 млрд параметров под Apache-2.0, которая помещается на один сервер и по официальным числам настигает закрытый фронтир на агентном кодинге (SWE-bench Pro, QwenSWEBench) и computer use (OSWorld, AndroidWorld), сдвигает аргумент «для агентных воркфлоу нужен фронтир-API» в сторону локальных и self-hosted решений и усиливает ценовое давление на платные API. Любой, кто строит прототип на фронтир-API, теперь может пересчитать юнит-экономику на self-hosted 27B. Ставка Alibaba на дешёвые длинные агентные сессии видна в архитектуре: гибридное DeltaNet-внимание и контекст до 1 млн токенов в хостед-версии нацелены на этот сегмент, а выход открытого MoE-флагмана на 2,4 трлн параметров в ту же неделю показывает, что речь о целой линейке, а не об одной модели.

Почему это важно для пользователей

Практически сейчас читатель может скачать веса на Hugging Face, развернуть модель на vLLM или SGLang на одном сервере и получить агента с мультимодальным входом — нативное понимание изображений и многочасовых видео, 262K контекста и управляемой «думливостью» через reasoning_effort. Для on-prem и privacy-продуктов это немедленная возможность без оплаты за токены и без периметровых ограничений. Заявлена и локальная работоспособность: в день релиза AMD подготовила day-0 поддержку на Ryzen AI Max и Radeon, так что модель можно проверить и вне дата-центра. Для production без пилота и собственных замеров латентности пока рано.

Что пока неизвестно / ограничения

Числа взяты из официальных бенчмарков вендора, независимая верификация пока отсутствует, поэтому корректное утверждение — «сопоставима с Opus4.6 Max по официальным цифрам», а не «фронтир-уровень в открытой коробке». Крупнейший разрыв — на HLE (30,8 против 40,0, около 23% относительной потери): на самых сложных научных и рассудочных бенчмарках открытая 27B-модель отстаёт заметно сильнее, чем на агентных, так что тезис «сопоставима с фронтиром» корректен только для доменов агентного кодинга и computer use.

Источники

Автор

Look at AI, редакция