StepFun выложила в открытый доступ веса флагманской модели Step-5-Preview: чекпоинт TypeSafeAI/Step-5-Preview-BF16 появился на Hugging Face 20 сентября 2026 года. Это sparse Mixture-of-Experts с 600 млрд параметров суммарно, из которых на каждый токен активны лишь 27 млрд, то есть около 4,5%. Контекст достигает 1 млн токенов, на вход принимаются текст, изображения и видео. Компания заявляет место в тройке сильнейших open-weight моделей и позиционирует релиз как шаг к эффективности конвертации вычислений в интеллект. Если независимые проверки подтвердят цифры, это изменит экономику и открытого сегмента, и закрытых API.


Что произошло
20 сентября 2026 года на Hugging Face появился открытый чекпоинт TypeSafeAI/Step-5-Preview-BF16 с весами флагманской модели StepFun. Архитектура — sparse Mixture-of-Experts на 92 слоях «узкой и глубокой» схемы со Sparse GQA и block-wise token merging: суммарно 600 млрд параметров, из которых на токен активны 27 млрд, примерно 4,5%. Стоимость индексации длинного контекста в карточке заявлена как примерно одна восьмая от плотного базлайна, а сам контекст достигает 1 млн токенов. На вход принимаются текст, изображения и видео в форматах MP4, QuickTime и Matroska объёмом до 128 МБ. В карточке заявлены Intelligence Index 44 по Artificial Analysis v4.3.2 — топ-3 среди open-weight моделей, а также 67,7 на DeepSWE v1.1 и 33,3 на Terminal-Bench v4, что в 2,6 раза выше результата Kimi K3. Скорость генерации — 99,8 токена в секунду при TTFT 2,96 секунды. Там же приведены показательные демо: автономная 22-часовая оптимизация CUDA-кернела для H100 до 508 TFLOPS против 493 у Claude Opus 5 и самостоятельное пост-тренирование Qwen3-30B-A3B, поднявшее результат на AIME24 с 53,3% до 60% за 24 часа.
Контекст
Разреженные Mixture-of-Experts уже стали стандартом для больших открытых моделей, но обычно за высокой суммарной ёмкостью стоит сравнительно большая активная часть. Ближайший ориентир в open-weight сегменте — Kimi K3 Max, несущая порядка 2,8T параметров; StepFun в ответ делает ставку не на размер, а на минимальную долю активных параметров на токен. О намерениях говорит и нумерация релизов: компания пропустила всю линейку Step 4.x и перепрыгнула с Step-3.7-Flash сразу на Step 5, продвигая философию «Pareto Frontier» — эффективность конвертации вычислений в интеллект вместо простого наращивания масштаба. В этой логике открытие весов — не только жест открытости, а способ проверки: любые цифры из карточки сообщество может воспроизвести на своём железе, чего с закрытыми моделями сделать нельзя.
Почему это важно для индустрии
Для индустрии главное здесь — архитектурная экономика, а не бенчмарки. При 27B активных параметров на токен near-frontier качество инференсится на 8× H100 в BF16, а заявлен и FP8-вариант на 4× H100. Это прямое ценовое давление на закрытые модели вроде Claude Opus 5 и GPT-6 Astra: если открытый стек даёт сопоставимое качество дешевле, ценовая власть API-вендоров держится всё больше на инерции, чем на цене доступа. Внутри open-weight сегмента меняется система координат: сравнивают не суммарный размер, а стоимость активной ёмкости на токен, и конфигурация «600B/27B» при подтверждении заявленных результатов станет ориентиром эффективности. У стартапов появился открытый near-frontier кандидат с мультимодальным входом, который можно поднять в собственном контуре и прогнать через свою eval-сеть; если философия «Pareto Frontier» закрепится, конкуренция сместится от гонки суммарных параметров к гонке активной ёмкости на токен.
Почему это важно для пользователей
Веса доступны для скачивания, поэтому любое заявление из карточки можно проверить на своих задачах. Локальный запуск поддерживают vLLM и SGLang — например, командой vllm serve с флагом --reasoning-parser stepfun. Своё железо не обязательно: модель дёргается по OpenAI-совместимому API на api.stepfun.com под именем step-5-preview. Для интеграций важны параллельные вызовы инструментов, strict JSON Schema и уровни reasoning_effort low, medium, high и xhigh — привычный агентный контракт закрытых API переносится без переписывания пайплайнов. Миллион токенов контекста и видео-вход позволяют пробовать сценарии, которые раньше требовали дорогих узких решений: работу с очень длинными документами и анализ видеофайлов. Разумный первый шаг — сравнить step-5-preview с текущим закрытым вендором на реальных задачах и измерять не заявленные цифры, а цену за решённую задачу.
Что пока неизвестно / ограничения
Все ключевые заявления о качестве — Intelligence Index 44, DeepSWE v1.1 67,7, Terminal-Bench v4 33,3 — взяты из карточки модели и пока не подтверждены независимыми прогонами; выборка бенчмарков узкая, единой методики сравнения с closed-source моделями нет, что оставляет риск cherry-picking. Показательные демо с CUDA-кернелом и пост-трейном Qwen3-30B-A3B приведены без методик, сидов и описания окружения, поэтому их корректно считать маркетинговой демонстрацией, а не доказательством. Прайсинг хостед-API в доступных материалах не раскрыт. Отдельная оговорка: оценка автора телеграм-канала о том, что до 70% профита в квантизации NVFP4 даёт именно разреженность MoE, — это личная оценка, а не данные StepFun; в ней смешаны вклад квантизации и вклад разреженности, и без контролируемого замера BF16 против NVFP4 на одинаковом железе и трафике она не проверяема.
Источники
Автор
Look at AI, редакция
