Китайская компания StepFun (阶跃星辰) 20 сентября 2026 года представила Step 5 Preview — флагманскую модель для агентских задач на разреженной MoE-архитектуре: 600 млрд параметров, из которых 27 млрд активны на каждый токен, контекстное окно 1 млн токенов и вход для текста, изображений и видео. Модель уже доступна через API под именем step-5-preview, а открытые веса обещаны 15 октября 2026 года. На индексе Artificial Analysis Intelligence Step 5 Preview набрала 44 балла, сохранив, по заявлению компании, стоимость существенно ниже сопоставимых моделей.

Что произошло
StepFun опубликовала анонс и открыла доступ к модели step-5-preview через platform.stepfun.ai. За один запрос модель принимает до 60 изображений и видео в форматах MP4, QuickTime и Matroska объёмом до 128 МБ, а на выходе выдаёт до 64k токенов. Компания показала результаты на агентских бенчмарках: DeepSWE v1.1 — 67.7, ProgramBench — 80.5, ALE-CLI — 29.5, FrontierFinance — 66.4; здесь Step 5 Preview первая среди моделей с открытыми весами, хотя уступает закрытым GPT-6 Astra и Claude. На Terminal-Bench v4 разрыв заметнее: 33.3 против 57.9 у Claude Opus 5. Вместе с моделью StepFun выпустила собственный бенчмарк StepCodeBench на 553 реальных репозиториях, 9 категориях задач и 33 языках программирования и продемонстрировала два 24-часовых автономных запуска: оптимизацию GPU-ядра MLA на NVIDIA H100 с результатом 508 TFLOPS против 493 TFLOPS у Claude Opus 5 и автономный пост-тренинг Qwen3-30B-A3B, поднявший точность на AIME24 с 53.3% до 60%.
Контекст
Разреженная MoE-архитектура (Mixture-of-Experts, «смесь экспертов») означает, что на каждый токен работают не все параметры, а только часть — у Step 5 Preview это около 4.5% от общего объёма, что снижает стоимость инференса. Сам механизм не новшество; новизна в комбинации: 27 млрд активных параметров в связке с контекстом 1 млн токенов, видео-входом и заявкой на фронтир агентских задач — это целенаправленная ставка на нагрузки, где доминирует стоимость длинного инференса. Демонстрации 24-часовой автономной работы задают другой формат публичных доказательств: не одиночные вопросы, а многочасовая агентская работа с обратной связью. Публикация таблиц с поражениями — редкий для вендоров сигнал честности, хотя набор бенчмарков и метрики по-прежнему выбирает сама компания. Ориентирами для сравнения в открытом сегменте остаются GLM-5.3 и Kimi K3, а закрытыми — GPT-6 Astra и Claude.
Почему это важно для индустрии
Для индустрии это выход ещё одного игрока на фронтир агентских моделей с конкретной датой открытия весов. Механизм давления — MoE-экономика: 27 млрд активных параметров из 600 млрд дают фронтирный уровень качества при заметно меньшей стоимости инференса, и StepFun прямо строит аргумент вокруг сдвига «Pareto frontier» — границы компромисса между интеллектом и ценой. Если цифры подтвердятся, это давление на ценовые модели OpenAI и Anthropic и удешевление агентской инфраструктуры для стартапов. Для билдеров важнее не звание «флагман», а готовый каркас нового класса продуктов — длительных автономных агентов с 1M-контекстом и видео-входом. После открытия весов появляются self-hosting, файнтюн под доменные задачи и дистилляция в более мелкие модели, а ценовое давление на закрытые API, вероятно, усилится.
Почему это важно для пользователей
Попробовать модель можно уже сейчас: step-5-preview доступна через API на platform.stepfun.ai, включая поддержку 1M-контекста, видео-вход и подключение к Claude Code через Step Plan. Практичная проверка за вечер — прогнать на ней свой реальный агентский сценарий: код-ревью репозитория, разбор видео или отчёт по сотне источников, а затем сравнить с текущими провайдерами по качеству и стоимости одного агентского запуска, собрав собственные замеры latency. Сверять результаты имеет смысл с публичными таблицами StepFun, где видны как победы среди открытых весов, так и отставания от закрытых моделей. Тем, кто следит за агентскими пайплайнами и кодинг-ассистентами, стоит сравнить модель с GLM-5.3 и Kimi K3. После открытия весов появится возможность локального запуска и файнтюна под свои задачи.
Что пока неизвестно / ограничения
Ключевые цифры пока вендорские и не прошли независимой проверки. Заявленный сдвиг «Pareto frontier» опирается на формулировку «существенно ниже сопоставимых моделей» без единой цифры цены в открытых материалах — это маркетинговое утверждение, а не измеренная экономика. 44 балла на Artificial Analysis Intelligence — оценка стороннего индекса, методология которого отличается от вендорских бенчмарков. В доступных материалах нет опубликованных цен, лимитов и задержек, поэтому выводы о реальной стоимости агентских запусков делать рано, а продакшен-внедрение разумно рассматривать только как shadow- или pilot-трафик. Подбор задач и метрики в StepCodeBench контролирует вендор, независимого аудита нет, а проверка контаминации и воспроизведение результатов 24-часовых запусков станут возможны только после открытия весов 15 октября 2026 года.
Источники
- Step 5 Preview: Advancing the Pareto Frontier — official StepFun announcement
- Step 5 Preview — StepFun Open Platform documentation (model ID step-5-preview, 1M context, pricing)
- StepFun Open Platform — Step 5 Preview доступна через API
Автор
Look at AI, редакция
