Tencent (команда Tencent Hy / Hunyuan) выпустила в open source флагманскую MoE-модель Hy4 preview: 770B параметров всего, 49B активных на токен, нативный контекст 1M токенов и лицензия Apache 2.0, разрешающая коммерческое использование. Веса в форматах BF16 и FP8 уже доступны для скачивания, модель поддержана официальными образами vLLM и SGLang и фактически приглашает проверить заявленные характеристики frontier-класса самостоятельно. Главная оговорка — статус preview: режим рассуждений включён по умолчанию и замедляет работу, а вендорские бенчмарки пока не подтверждены независимыми прогонами.



Что произошло
Tencent опубликовала веса Hy4 preview в двух форматах, BF16 и FP8, сразу на четырёх площадках: Hugging Face, ModelScope, GitCode и CNB. Архитектура насчитывает 78 слоёв и 256 маршрутизируемых экспертов плюс один общий, из которых на каждый токен активируются восемь; внимание построено на механизме Gated DeepSeek Sparse Attention (Gated DSA) с кэшем IndexCache, внутри чекпойнта есть residual-механизм iHC с четырьмя residual-потоками и отдельный MTP-слой на 10B параметров (0.7B активных) для speculative decoding. Заявленные метрики: GPQA Diamond 92.3, SWE-bench Multilingual 82.9, SWE-bench Pro 65.7 и Deep SWE 64.3. Во внутреннем слепом сравнении 163 экспертов Tencent на 203 инженерных задачах Hy4 preview незначительно опередил GLM 5.3.
Контекст
Смысл архитектуры Hy4 в разделении объёма и стоимости: как и у других MoE-моделей, на каждый токен работают не все 770B параметров, а только 49B, поэтому инференс обходится дешевле, чем у плотной модели такого размера. Узким местом длинного контекста обычно становится внимание, и здесь ставка сделана на Gated DSA: sparse-индексы, вычисленные в одних слоях, переиспользуются в других через IndexCache, что удешевляет обработку контекстов до 1M токенов. MTP-слой для speculative decoding и iHC показывают ко-дизайн архитектуры и инференса: оптимизации скорости заложены на уровне самого чекпойнта, а не прикручены снаружи. Отдельная особенность релиза в том, что архитектура раскрыта достаточно детально для воспроизведения, что нетипично для frontier-класса и делает модель полноценным объектом независимых абляций.
Почему это важно для индустрии
Это второй крупный открытый frontier-флагман поколения MoE за короткий срок под разрешающей коммерческое использование лицензией Apache 2.0, поэтому сам доступ к сильной модели перестаёт быть защитным рвом, а ценность продуктов смещается в данные, интеграцию в рабочие процессы и дистрибуцию. Готовые образы, рецепты деплоя и квантизация через AngelSlim означают, что модель пригодна для self-hosting сразу, а не существует только на бумаге: компании могут поставить пилот и сравнить его стоимость с текущим счётом за закрытый API. Если механизм IndexCache подтвердится на практике и подхватится экосистемой, переиспользование sparse-индексов между слоями может стать стандартной частью open-source инференс-стека для длинного контекста, а MTP-слой задаёт образец оптимизаций, заложенных в чекпойнт. В случае подтверждения цифр сторонними прогонами открытая frontier-модель станет реальным давлением на цены закрытых API и базой для дообучения.
Почему это важно для пользователей
Веса можно скачать с Hugging Face (а также ModelScope, GitCode и CNB) и поднять модель на 8 GPU через vLLM или SGLang по официальным рецептам, вызывая её по OpenAI-совместимому API из существующих клиентов с минимальными изменениями. Режим рассуждений включён по умолчанию и отключается параметром reasoning_effort=no_think. Реалистичный план сейчас — пилотирование на неинтерактивных задачах вроде batch-обработки, офлайн-аналитики и кодогенерации, а также прототипы long-context-аналитики, приватные кодинг-ассистенты и PoC агентных пайплайнов. Для интерактивных сценариев модель пока неудобна: она тратит лишнее время на рассуждения и склонна переверифицировать собственные результаты, хотя команда обещает быстрые итерации.
Что пока неизвестно / ограничения
Заявленные метрики — вендорские цифры без раскрытой методологии в предоставленных материалах, и пока никто их независимо не воспроизвёл. Внутренний слепой тест 163 экспертов Tencent содержит конфликт интересов, а отрыв от GLM 5.3 минимален. Статус preview означает, что часть ограничений ранней версии обещано исправить, но сроки не названы. Модель на 770B параметров требует серьёзной инфраструктуры, что сужает круг тех, кто способен проверить её самостоятельно, а поведение на реальных long-context задачах вне бенчмарков остаётся открытым вопросом до сторонних прогонов.
Источники
- Tencent — официальный пресс-релиз о выпуске Hy4 preview
- tencent/Hy4-preview — Model Card на Hugging Face
- GitHub — Tencent-Hunyuan/Hy4-preview (README, спецификации, деплой)
Автор
Look at AI, редакция
