Компания OpenAI расширяет возможности работы со звуком, выпуская две новые специализированные модели: GPT-transcribe для высокоточного преобразования аудио в текст и GPT-live-transcribe для работы в режиме реального времени с минимальной задержкой.

image
image

Что произошло

OpenAI анонсировала новые API-модели для задач Speech-to-Text (STT). GPT-transcribe ориентирована на пакетную обработку и высокоточное архивирование аудиофайлов по цене $0,0045 за минуту. GPT-live-transcribe предназначена для интерактивного стриминга и интерфейсов с низкой задержкой (low-latency) по тарифу $0,017 за минуту. Обе модели поддерживают мультиязычность и работу с контекстными подсказками.

Контекст

Ранее разработчикам приходилось использовать универсальные или тяжеловесные модели, которые не всегда были оптимальны по соотношению стоимости и скорости. Сегментация рынка на высокоточное архивирование и сверхбыстрый real-time стриминг позволяет более гибко подходить к архитектуре голосовых сервисов.

Почему это важно для индустрии

Для индустрии это означает возможность оптимизации затрат и задержек в зависимости от конкретного сценария использования. Разработчики могут внедрять специализированные API-вызовы вместо универсальных моделей, что снижает сложность архитектуры и повышает экономическую эффективность массовых сервисов транскрибации и голосовых AI-агентов.

Почему это важно для пользователей

Пользователи получат более качественные и дешевые инструменты для автоматического создания субтитров, записи встреч и работы с голосовыми ассистентами. Появление моделей с раздельной ценовой политикой делает высококачественное распознавание речи более доступным для широкого спектра приложений.

Что пока неизвестно / ограничения

Технические подробности о различиях в точности между моделями в зависимости от шума или специфических языков не уточняются; фокус смещен на разделение по сценариям использования (latency vs accuracy).

Источники

Автор

Look at AI, редакция