Китайская StepFun выпустила семейство аудио-моделей StepAudio 3. Его флагман, StepAudio 3 Realtime, — полнодуплексная аудио-языковая модель, которая рассуждает параллельно речи: она переспрашивает, поддерживает реплики и перебивается без пауз. В линейку также вошли StepAudio 3 Music для генерации полных песен по текстовому описанию и StepAudio 3 Gen для единого дизайна голоса, эффектов, эмбиента и музыки, а распознавание и озвучку закрывают ASR Max и TTS — весь аудио-конвейер собирается под одним API-ключом.


Что произошло
StepFun анонсировала семейство StepAudio 3 из нескольких направлений. Флагман StepAudio 3 Realtime построен по архитектуре «слушай — говори — думай — действуй»: в режиме Think-While-Speaking внутренние рассуждения идут параллельно речи, поэтому модель может переспрашивать, поддерживать реплики и прерываться без пауз; рабочие языки — китайский и английский. StepAudio 3 Music генерирует полные песни со словами и без них: сначала chain-of-thought-планирование ABC-COT задаёт структуру трека — куплеты, припев, бридж — и аранжировку, затем связка AR + DiT синтезирует готовую запись 48 кГц стерео длительностью до 5 минут 30 секунд; заявлены режимы генерации песни по описанию, инструментал, «вокал в песню» и кавер. Также анонсирован StepAudio 3 Gen — единая генерация голоса с дизайном голоса, звуковых эффектов, эмбиента и музыки; его описание вынесено в техотчёт arXiv:2609.12945, тариф называется stepaudio-3-gen-preview. Для Realtime опубликован техотчёт arXiv:2609.14005, а официальные демо-страницы Realtime и Music уже открыты.
Контекст
Чтобы оценить анонс, полезно понимать, чем полнодуплекс отличается от привычных turn-based ассистентов: классический голосовой бот ждёт конца реплики, а Realtime совмещает слушание, говорение и размышление в одном потоке, и по заявленной архитектуре может выполнять агентные действия прямо в диалоге — встроенные VAD, ASR, web_search и retrieval доступны в Realtime API по WebSocket. Цифры вендора выглядят сильно: 98,9 на Artificial Analysis Full-Duplex Bench против 95,3 у GPT-realtime-2 (High) и 98,4 у Qwen Audio 3.0 Realtime Plus, а также 90,6 на MMSU. При этом 56,0 на τ-Voice — честный индикатор зрелости: «рассуждения внутри голоса» пока далеки от текстового уровня reasoning, модели легко болтать, но сложнее думать в реальном времени. В распознавании заявлено 0,57% ошибок в контекстном тесте и минус 43% к Doubao ASR 2.0; результат 1,18% на LibriSpeech clean малоинформативен, потому что это почти насыщенный бенчмарк с низкой различительной силой. TTS поддерживает потоковый вывод до окончания синтеза предложения, то есть озвучка начинает звучать раньше, чем предложение синтезировано целиком.
Почему это важно для индустрии
StepFun закрывает одной линейкой весь аудио-конвейер — распознавание, озвучку, дизайн аудио и полнодуплексный диалог — и продаёт его по ценам ниже инкумбентов: ASR 0,24 $ в час, TTS 0,36 $ за 10 000 символов, Gen бесплатно на время триала. Для стартапов это резкое удешевление входа в голосовые продукты: полнодуплексные перебивания, VAD и ASR доступны «из коробки», а прототип голосового агента собирается без отдельного кода на разметку речи. Обратная сторона — обесценивание простых обёрток над ASR и TTS: ценность смещается от доступа к модели к оркестрации, дистрибуции и вертикальным сценариям. Давление испытают OpenAI Realtime API, Gemini и Doubao — в цене и в сценариях, где важны перебивания и агентные действия без разрыва диалога. Если независимые прогоны подтвердят цифры Realtime, полнодуплекс и встроенные VAD/ASR рискуют стать базовыми требованиями к голосовым API, и тогда сравнение вендоров сместится к цене за час диалога и латентности.
Почему это важно для пользователей
Попробовать модели можно уже сейчас: в Voice Studio по адресу audio.stepfun.ai работают разговорные демо, а API-ключ открывает stepaudio-3-realtime-preview, stepaudio-3-tts с дизайном голоса через текстовое описание и бесплатный на триал stepaudio-3-gen-preview. Кто делает голосовых ботов, подкасты или озвучку видео, экономит код на VAD и ASR — эти функции входят в Realtime API, цены на ASR и TTS известны заранее, поэтому пайплайн закладывается в бюджет без сюрпризов. StepAudio 3 Music по описанию вида «куплет — припев — бридж» обещает готовый 48-кГц стерео-трек до 5:30, который можно сразу слушать и скачивать — это потенциально готовый материал для джинглов, подкаст-оформления и озвучки видео.
Что пока неизвестно / ограничения
Большинство цифр пока вендорские: техотчёт arXiv:2609.14005 даёт проверяемую отправную точку, но воспроизведённых независимых результатов нет. У Realtime всего два языка — китайский и английский, а латентности не опубликованы, их придётся замерять самим. Методика сравнения ASR с Doubao ASR 2.0 в подаче не раскрыта. Музыкальная генерация в Voice Studio помечена как «Coming Soon», поэтому заявленные 48 кГц и длительность до 5:30 вживую проверить нельзя, и неизвестно, выдержит ли подход ABC-COT проверку на длинных формах. Данных об открытых весах в источниках нет. Наконец, «весь конвейер под одним API-ключом» — это продуктовая интеграция компонентов, а не научная новизна, и технический уровень моделей нельзя выводить из цен.
Источники
- Step-Audio 3 Realtime — официальная демо-страница StepFun
- Step-Audio 3 Music — официальная демо-страница StepFun
- StepAudio 3 Realtime Technical Report (arXiv:2609.14005)
- StepAudio 3 Gen technical report (arXiv:2609.12945)
Автор
Look at AI, редакция
