🌟 Nvidia открыла веса модели для разметки спикеров в аудио
23 сентября Nvidia опубликовала веса модели диаризации Nemotron 3 Diarization (~100 млн параметров) под лицензией OpenMDW-1.1 с разрешением коммерческого использования. Модель определяет «кто говорил когда» до 8 говорящих — вдвое больше предшественницы Streaming Sortformer. В VoiceArena она первая из 12 систем с DER 14,72%. Nvidia заявляет снижение DER на 41% и рост RTFx до 865×.
🌍 ASR даёт слова, эта модель — метки говорящего: протоколы встреч с именами, аналитика звонков и память голосовых агентов. Открытые веса снимают барьер для встраивания «кто сказал» в продукты.
👤 Веса — на Hugging Face, запуск через NeMo 3.0 или NeMo-Speech.cpp, есть демо-Space. Модель анонимна: speaker_1…8 без личности, длина записи не ограничена.
Источник 1: https://huggingface.co/blog/nvidia/nemotron-diarization Источник 2: https://huggingface.co/nvidia/Nemotron-3-Diarization
