🤖 StepFun выпустила аудио-семейство StepAudio 3
Флагман StepAudio 3 Realtime — полнодуплексная модель с режимом Think-While-Speaking: рассуждения идут параллельно речи, поэтому она переспрашивает и прерывается без пауз. Языки — китайский и английский.
🌍 StepFun закрывает аудио-конвейер одной линейкой: ASR Max (0,24 $ в час), TTS (0,36 $ за 10 000 символов), Gen с голосом, эффектами и музыкой на одной таймлинии и Realtime API (WebSocket, VAD, ASR, web_search). На Full-Duplex Bench Realtime даёт 98,9 против 95,3 у GPT-realtime-2.
👤 Разговорные демо уже работают в Voice Studio (audio.stepfun.ai), тариф stepaudio-3-gen-preview бесплатный. Для голосовых ботов Realtime API экономит код на VAD и ASR, а Music по описанию выдаёт стерео-трек 48 кГц до 5:30.
Источник 1: https://stepaudiollm.github.io/step-audio-3-realtime/
Источник 2: https://stepaudiollm.github.io/step-audio-3-music/
