23 сентября 2026 Nvidia открыла веса модели диаризации Nemotron 3 Diarization — разметки «кто говорил когда» в аудио — под лицензией OpenMDW-1.1. Компактная модель примерно на 100 млн параметров работает с числом говорящих до 8, что вдвое превышает лимит предыдущей Streaming Sortformer, и занимает первое место среди 12 систем бенчмарка VoiceArena Diarization-Bench. Разметка спикеров перестаёт быть платной компонентой отдельных вендоров: веса опубликованы полностью, и слой атрибуции «кто сказал» можно встроить в расшифровки, митинг-ботов и голосовых агентов самостоятельно.


Что произошло
Nvidia опубликовала веса на Hugging Face в репозитории nvidia/Nemotron-3-Diarization: в F32-чекпоинте 99,2 млн параметров. Внутри — 31-слойный Transformer-энкодер с RoPE: моно-звук с частотой 16 кГц переводится в мел-спектрограмму, кадры по 10 мс упаковываются в окна по 80 мс, а Conv1D на выходе каждые 10 мс возвращает вероятность активности каждого из анонимных каналов speaker_1…speaker_8. Разметка идёт покадрово по каналам, а не через пост-кластеризацию, поэтому одновременная речь не ломает атрибуцию; в стриминговом режиме память хранится через Arrival-Order Speaker Cache и FIFO-очередь. На VoiceArena Diarization-Bench модель показала DER 14,72% (долю ошибок диаризации) против 19,3% у ближайшей конкурирующей системы — относительный отрыв около 24%.
Контекст
Диаризация закрывает то, чего не даёт обычная расшифровка: ASR превращает звук в слова, но не отвечает, кто их произнёс, поэтому протокол встречи или разбор звонка без атрибуции остаётся полуфабрикатом. Модель продолжает линейку Sortformer: по заявлению Nvidia, относительно предшественницы среднее снижение DER составляет 41% при латентности 1,04 секунды — на DIHARD III метрика улучшается с 19,60% до 13,18%, на NOTSOFAR1 с 22,12% до 7,70%. Один чекпоинт покрывает латентность от 0,32 до 30,4 секунды, а при батче 32 на RTX PRO 5000 достигается RTFx 865× против 136× у предыдущей версии — это профиль продакшн-компоненты, а не лабораторного прототипа. Каналы нумеруются по порядку появления голосов в записи, поэтому привязка обезличенного канала к конкретному имени решается логикой на стороне приложения; прирост качества при прежнем порядке размера модели объясняется архитектурой и рецептом обучения, что удешевляет воспроизведение и файнтюнинг на одной GPU.
Почему это важно для индустрии
Для индустрии это смена экономики слоя атрибуции: лицензия OpenMDW-1.1 явно разрешает коммерческое использование, поэтому «кто сказал» превращается из платной фичи единичных вендоров в бесплатный встраиваемый компонент, а моат стартапов, у которых диаризация была ядром продукта, обнуляется. Прототип «ASR + диаризация» теперь собирается за дни: attributed-транскрипты, живые протоколы встреч с именами, аналитика звонков и память голосовых агентов складываются из готовых частей. Ожидаемая волна ближайших месяцев — speaker-aware функции в заметках, митинг-ботах и колл-аналитике, независимые переоценки на DIHARD III и NOTSOFAR1 вне вендорских конфигураций и файнтюны сообщества под другие языки и домены. Конкуренция в открытом стеке смещается от качества слов к качеству атрибуции, а ценность — к UX сопоставления каналов с именами и к работе с ошибками разметки.
Почему это важно для пользователей
Всё доступно немедленно: веса скачиваются с Hugging Face, запускаются одной строкой через SortformerEncLabelModel.from_pretrained в среде NeMo 3.0 на GPU поколений Ampere, Hopper или Blackwell, а для лёгких сценариев есть C++-рантайм NeMo-Speech.cpp. Потрогать модель без установки можно в демо-Space Nvidia с живым стриминговым ASR. Модель анонимна по замыслу: она не определяет личность и возвращает только метки speaker_Х и интервалы, поэтому записи можно размечать на собственном железе, не отправляя аудио во внешние сервисы, а кусочная обработка снимает ограничение на длину записи. Порог входа низкий, а настраиваемая латентность позволяет подогнать скорость реакции под сценарий — от почти живого протокола встречи до аккуратной офлайн-расшифровки.
Что пока неизвестно / ограничения
Ключевые цифры пока вендорские: VoiceArena Diarization-Bench насчитывает 139 английских диалогов и 12 систем, а отрыв около 24% показан в конфигурации Nvidia, поэтому до независимой проверки корректнее говорить «лучшая заявленная открытая система», а не «текущий SOTA». Заявленное снижение DER на 41% относительно предшественницы также приведено в вендорских конфигурациях, и на двухспикерном CALLHOME новая модель чуть хуже предыдущей: 5,98% против 5,68%. Качество на языках, кроме английского, и в тяжёлых доменах вроде колл-центров независимо не подтверждено — его должны показать переоценки сообщества и файнтюны. Наконец, анонимность модели переносит связывание каналов с реальными именами и ответственность за ошибки атрибуции на сторону приложения.
Источники
- Блог Nvidia на Hugging Face: Know Who Spoke When — анонс Nemotron 3 Diarization
- Nvidia Nemotron 3 Diarization — карточка модели и веса на Hugging Face
- Live Speaker Diarization — демо Nvidia на Hugging Face Spaces со стриминговым ASR
Автор
Look at AI, редакция
