Команда Venus (Ant Group) совместно с Университетом Цинхуа выпустила Realtime-Venus — систему полного дуплексного взаимодействия: модель слушает и смотрит, пока сама говорит, и умеет делегировать фоновые задачи внешнему рантайму, не прерывая разговор. Под лицензией Apache 2.0 открыты два чекпоинта по 9B параметров — Realtime-Venus-Omni для работы с аудио и видео и Realtime-Venus-Audio для голосового диалога, — а также рантайм Harness, демо и бета-версия Android-приложения.

image
image

Что произошло

Команда Venus (Ant Group) вместе с Университетом Цинхуа опубликовала Realtime-Venus — систему полного дуплексного взаимодействия, в которой модель одновременно слушает, смотрит и говорит. Выложены два чекпоинта по 9B параметров на базе MiniCPM-o 4.5 (Omni-Flow) с языковым бэкбоном Qwen3-8B и контекстом 40 960 токенов. Realtime-Venus-Omni работает с аудио и видео и сама решает, когда вступить в диалог; Realtime-Venus-Audio рассчитан на голосовой диалог и синтезирует речь через дискретные S3-токены и потоковый flow-matching-декодер. Фоновые задачи делегируются через -запросы на общей причинной временной шкале: внешний рантайм Realtime-Venus-Harness выполняет их — например, ищет билеты по увиденному в камеру городу — не блокируя разговор, и возвращает результат в ту же беседу. Память длинных видео работает без дообучения. По техотчёту arXiv:2609.13814 вариант Omni лидирует в 6 из 8 видеобенчмарков среди онлайн-моделей: 70.2% на StreamingBench и 81.3% на Daily-Omni; вариант Audio показывает 78.0% на MMAU. На Full-Duplex-Bench v1.5 система продолжает речь после «поддакиваний» в 97% случаев (метрика C_RESUME) и реагирует на реальные перебивания в 75% случаев (метрика C_RESPOND).

Контекст

Полный дуплекс — это режим, в котором голосовой агент не «отдаёт микрофон» по очереди, а непрерывно слушает и наблюдает, даже когда говорит сам: именно так ведут разговор люди. До сих пор такой режим предлагали в основном облачные realtime-API — GPT-4o Realtime упомянут в материале как сравнительный контекст, — и живое дуплексное поведение оставалось закрытой инженерией крупных лабораторий. Отдельная сложность этого режима в том, что агент должен различать, когда собеседник перебивает, чтобы перенаправить мысль, а когда лишь «поддакивает», не требуя ответа; именно эти сценарии измеряются на бенчмарке Full-Duplex-Bench v1.5. Техническая сборка Realtime-Venus собрана из известных компонентов: речевой вывод через дискретные S3-токены и потоковый flow-matching-декодер, мультимодальная основа MiniCPM-o 4.5, языковой бэкбон Qwen3-8B. Научный интерес здесь в интеграции и обучении дуплексного поведения, а не в новом классе архитектур: архитектурная новизна сосредоточена в протоколе — -запросы на общей причинной временной шкале плюс внешний Realtime-Venus-Harness, который выполняет фоновые задачи и возвращает результат в тот же диалог.

Почему это важно для индустрии

Для отрасли Realtime-Venus — это архитектурный шаблон интерактивного агента, который можно скачать и запустить, а не просто очередная «говорящая» модель. Два цикла — живой дуплексный диалог и асинхронный Harness — позволяют LLM-ассистенту параллельно вести разговор и выполнять внешние задачи: поиск, вызов инструментов, работу с тем, что видит камера, без пауз на «подождите, я уточню». Различение перебиваний, «поддакиваний» и редиректов, измеренное на Full-Duplex-Bench v1.5, задаёт измеримый стандарт для голосовых ассистентов: если независимые замеры подтвердят цифры C_RESPOND 75% и C_RESUME 97%, паттерн «дуплекс плюс асинхронная делегация» с высокой вероятностью начнут копировать в открытых голосовых ассистентах, а метрики Full-Duplex-Bench могут стать стандартом отчётности для realtime-моделей. Открытые веса 9B под Apache 2.0 переводят интерактивных голосовых агентов из категории облачных API в категорию локально разворачиваемых продуктов: для стартапов это одновременно давление на маржу API-обёрток и окно для собственных продуктов. Живость интереса подтверждает уже появившийся сторонний квантованный вариант чекпоинта Realtime-Venus-Omni-heretic-ARA.

Почему это важно для пользователей

Исследователям мультимодальных и речевых моделей это редкий открытый объект для изучения turn-taking, перебиваний и бэкчаннелов в полном дуплексе. Разработчики голосовых продуктов уже сегодня могут скачать оба чекпоинта 9B с Hugging Face (Apache 2.0), развернуть Realtime-Venus-Harness и собрать прототип дуплексного ассистента: Audio — для голосовых линий и call-сценариев, Omni — для видео-агентов, которые сами решают, когда вступить в разговор. Всё доступно для самостоятельной проверки: можно прогнать модели на Full-Duplex-Bench v1.5 и StreamingBench, сверить их с цифрами техотчёта arXiv:2609.13814 и оценить протокол на своих задачах. Для быстрой оценки без развёртывания есть онлайн-демо и Android-APK в бете, хотя мобильный прод-кейс пока остаётся на ранней стадии.

Что пока неизвестно / ограничения

Главное: слово «realtime» пока остаётся заявлением авторов, а не проверенным инженерным фактом — в источниках нет опубликованных измерений латентности, throughput и стоимости продакшен-serving. Требование минимум одной NVIDIA A100 для онлайн-демо само по себе не опровергает дуплекс, но означает высокий порог входа: прототипы и pilot-оценки запускаемы сегодня силами команд с собственной GPU-инфраструктурой, а спуск к consumer-GPU зависит от появления квантизаций — сигнал уже есть в виде стороннего варианта Heretic-ARA, но порог пока не опустился. Все бенчмарк-цифры взяты из техотчёта авторов и ждут независимых evals, в том числе на Full-Duplex-Bench v1.5 и StreamingBench. Android-APK существует только в бете, поэтому локальный мобильный сценарий пока нельзя считать продуктом.

Источники

Автор

Look at AI, редакция