🤖 StepFun выпустила аудио-семейство StepAudio 3

Флагман StepAudio 3 Realtime — полнодуплексная модель с режимом Think-While-Speaking: рассуждения идут параллельно речи, поэтому она переспрашивает и прерывается без пауз. Языки — китайский и английский.

🌍 StepFun закрывает аудио-конвейер одной линейкой: ASR Max (0,24 $ в час), TTS (0,36 $ за 10 000 символов), Gen с голосом, эффектами и музыкой на одной таймлинии и Realtime API (WebSocket, VAD, ASR, web_search). На Full-Duplex Bench Realtime даёт 98,9 против 95,3 у GPT-realtime-2.

👤 Разговорные демо уже работают в Voice Studio (audio.stepfun.ai), тариф stepaudio-3-gen-preview бесплатный. Для голосовых ботов Realtime API экономит код на VAD и ASR, а Music по описанию выдаёт стерео-трек 48 кГц до 5:30.

Источник 1: https://stepaudiollm.github.io/step-audio-3-realtime/

Источник 2: https://stepaudiollm.github.io/step-audio-3-music/