10 сентября 2026 года Сбер выпустил GigaChat 3.5 Reasoning — первую в России открытую модель с рассуждениями, обученную с нуля, а не дообученную из существующей открытой модели. Веса 432B-A28B MoE в формате FP8 опубликованы на Hugging Face под лицензией MIT и разрешены для коммерческого использования.


Что произошло
Пост-обучение модели прошло по online RL-конвейеру: сначала обучены шесть доменных экспертов — математика/STEM, код, code-агент, общий агент, диалог и следование инструкциям, каждый со своей функцией награды, — а затем они объединены в одну модель через on-policy дистилляцию (OPD), при этом RL-алгоритмом служил CISPO. По сравнению с GigaChat 3.5 Instant и S3.5 Ultra Instruct заявлены такие результаты: SWE-bench Verified — с 42.6 до 64.7, AIME-2026 (mean@32) — с 67 до 92, IFBench — с 43.66 до 77, GPQA-Diamond — с 61.11 до 82.32. На сложной математике (AIME 2025 и 2026, HMMT, IMOAnswerBench) модель в среднем тратит примерно на 37% меньше reasoning-токенов. Рассуждения уже доступны конечным пользователям в режиме рассуждений ГигаЧата.
Контекст
Формат 432B-A28B означает mixture-of-experts: из 432 миллиардов общих параметров в каждом токене активно работают лишь 28 миллиардов, что снижает стоимость инференса при сохранении ёмкости модели. Архитектура дополнительно комбинирует приёмы эффективности: гибридное внимание MLA + GatedDeltaNet, GatedNorm, три MTP-головки для спекулятивного декодинга и контекст до 262K токенов. Открытые веса под MIT-лицензией дают право свободно скачивать, разворачивать и монетизировать модель, а публикация описания пост-обучения (без деталей pre-train) — редкий для индустрии случай публичного разбора RL-конвейера.
Почему это важно для индустрии
Для рынка это первый российский открытый reasoning-артефакт, который можно развернуть на собственном инференсе без привязки к чужому API: стартапы и компании могут деплоить, дообучать и продавать reasoning-продукты на MIT-модели без лицензионных рисков. Открытая альтернатива создаёт ценовое давление на вендоров, монетизирующих доступ к закрытым reasoning-API, — покупатель теперь может сравнить стоимость запроса через API с ценой self-hosted-модели. Опубликованный конвейер (раздельные доменные награды, on-policy дистилляция, CISPO) становится публичным образцом для других команд, а при независимом подтверждении бенчмарков модель может стать открытым baseline для reasoning-задач, вокруг которого построятся файнтюны и дериваты.
Почему это важно для пользователей
Конечные пользователи получают модель сразу, в режиме рассуждений ГигаЧата, без необходимости что-либо разворачивать. Для разработчиков веса уже лежат на Hugging Face в репозитории ai-sage/GigaChat3.5-432B-Reasoning, а официальный путь самостоятельного запуска — через SGLang с приведённым примером на 8x H100. Для команд с готовым 8-GPU узлом это рабочее решение для сложных кодовых и математических задач на собственной инфраструктуре, где данные не покидают контур компании, а сложные запросы с длинными рассуждениями обходятся дешевле.
Что пока неизвестно / ограничения
Публичных замеров латентности, пропускной способности и стоимости запроса пока нет, поэтому реальную себестоимость инференса нужно оценивать самостоятельно. Все бенчмарки заявлены относительно собственных моделей Сбера, абсолютный уровень GigaChat 3.5 Reasoning по сравнению с другими frontier-моделями в материалах не раскрывается, а формулировки о паритете с сильнейшими моделями не называют конкретных конкурентов. Поддержка запуска в SGLang на момент релиза оформлена как pull request sgl-project/sglang#29189 и ещё не вошла в стабильный релиз, а самоотчитанные цифры — особенно AIME-2026 и GPQA-Diamond — ждут независимого воспроизведения.
Источники
- Hugging Face — официальная карточка модели ai-sage/GigaChat3.5-432B-A28B-Reasoning
- Хабр — статья Сбера «GigaChat 3.5 Reasoning — первая в России открытая модель с рассуждениями»
Автор
Look at AI, редакция
