Китайская AI-студия StepFun 18 сентября 2026 года выпустила Step 5 Preview — проприетарную reasoning-модель на 600 млрд параметров, которая принимает на вход текст и изображения и удерживает в контексте до 1 млн токенов. По бенчмарку Artificial Analysis Intelligence Index v4.3 она набрала 44 балла и заняла 25-е место среди 200 моделей при медиане 25 баллов для reasoning-моделей схожего ценового класса. Цена выходных токенов при этом примерно в 3,7 раза ниже медианы класса: $2.70 против $10.00 за 1 млн. Сдерживающие факторы: модель почти вдвое многословнее медианы, скорость генерации пока не раскрыта, а API доступен лишь у одного провайдера.

image

Что произошло

Step 5 Preview вышел 18 сентября 2026 года как проприетарная reasoning-LLM: StepFun заявляет 600 млрд параметров, поддержку изображений на входе, текстовый выход и контекстное окно 1 млн токенов, что позволяет загружать длинные документы целиком. В независимой оценке Artificial Analysis Intelligence Index v4.3 модель получила 44 балла и 25-ю строчку рейтинга из 200 позиций, тогда как медиана для reasoning-моделей схожего ценового класса равна 25 баллам. Тарифы заметно агрессивнее медиан класса: $1.00 за 1 млн входных токенов и $2.70 за 1 млн выходных против $1.88 и $10.00 соответственно. Скидка на кэшированные токены достигает 95%, смешанная ставка составляет $0.51 за 1 млн токенов, а стоимость одной задачи по методике AA — $0.71. По данным AA, в ходе оценки модель сгенерировала около 160 млн выходных токенов, почти вдвое больше медианы, то есть она существенно многословнее типичной модели класса. Скорость генерации пока не раскрыта, а доступ к API обеспечивает единственный провайдер.

Контекст

Artificial Analysis Intelligence Index — агрегированная оценка, которая соотносит уровень интеллекта модели с фактической стоимостью выполнения типовой задачи, поэтому в сводках фигурируют медианы по ценовому классу, а не по всему рынку сразу. Формулировка «на границе Парето», вынесенная в заголовок обсуждения на Hacker News, означает не рекордный балл, а положение на кривой «интеллект/цена»: при сопоставимом качестве модель дешевле конкурентов, при сопоставимой цене — способнее. Это интерпретация самого агрегатора, а не измеримое свойство модели. Методика учитывает и многословность: тарифицируются именно выходные токены, поэтому разговорчивая модель съедает часть ценового преимущества даже при низком номинальном тарифе. Появление Step 5 Preview вписывается в более широкую динамику рынка, где конкуренция в reasoning-классе смещается от сырых баллов бенчмарков к стоимости задачи, а экономика кэша при длинном контексте становится самостоятельным фактором выбора, потому что агентные пайплайны многократно прогоняют одни и те же префиксы.

Почему это важно для индустрии

Для отрасли выход Step 5 Preview — продолжение коммодитизации интеллекта: китайские разработчики последовательно давят на тарифы reasoning-класса, и ещё одна модель с ценой выходных токенов в разы ниже медианы усиливает давление на западные лаборатории, ускоряя гонку удешевления. Меняется и сама метрика сравнения: на первый план выходит стоимость задачи, а не цена за токен, причём многословность модели и эффективность кэширования способны изменить итоговый расчёт в разы. Скидка 95% на кэш — технически самый значимый элемент тарифа: для агентных пайплайнов с длинными повторяющимися префиксами она радикально пересчитывает юнит-экономику. Для стартапов, строящих документные и агентные продукты, это потенциальное прямое снижение COGS и шанс вывести в плюс сценарии, которые раньше не сходились по экономике. Если подтвердятся данные по скорости и подключатся дополнительные провайдеры, в горизонте ближайших месяцев модель может занять место дешёвого тира в model-роутерах для массовых задач, а в горизонте пары лет контекст порядка миллиона токенов способен вытеснить часть RAG-обвязки и закрепить мультипровайдерную маршрутизацию с кэшированием как первоклассной оптимизацией.

Почему это важно для пользователей

Если вы подбираете модель для работы с длинными документами или агентными задачами, Step 5 Preview — разумный кандидат для сравнительного пилота. Логичный первый шаг — подключить модель через доступного провайдера и прогнать собственные eval-наборы: 20–50 реальных сценариев, включая длинные документы, агентные циклы и обработку изображений, а затем сравнить качество, стоимость и латентность с текущей моделью. При пересчёте затрат заложите поправку на многословность: фактический объём выходных токенов примерно вдвое выше медианы, поэтому номинальный тариф занижает реальный счёт. Кэширование повторяющихся префиксов — отдельный резерв экономии для пайплайнов с фиксированными системными промптами. В продакшн-критичные пути модель ставить пока рано из-за статуса Preview и неполных операционных данных; выводы для интерактивных сценариев отложите до появления замеров скорости, а обновления отслеживайте на странице модели у Artificial Analysis.

Что пока неизвестно / ограничения

Доказательная база пока узкая: весь результат опирается на один агрегированный индекс без разбивки по типам задач, поэтому профиль способностей модели — сильные и слабые стороны в рассуждениях, коде и vision — из него не вывести. Технического отчёта StepFun в источниках нет, так что заявления о 600 млрд параметрах и мультимодальном входе не верифицированы независимо, а архитектура (плотная модель или MoE) неизвестна. Скорость генерации не раскрыта, что исключает выводы о латентности и пригодности для интерактивных сценариев, а доступность через одного API-провайдера создаёт единую точку отказа. Независимых репликаций результатов пока нет, а формулировка «граница Парето» — интерпретация Artificial Analysis, а не измеренное свойство. Модель носит статус Preview, поэтому и тарифы, и условия доступа могут измениться.

Источники

Автор

Look at AI, редакция