Google (команда Speaker, Voice and Language) выпустила модель DiarizationLM-Gemma-4-E4B-v1 для пост-обработки диаризации: она исправляет метки спикеров и границы реплик в готовых расшифровках ASR. Модель построена на Gemma 4 E4B (4B параметров, вдвое меньше, чем у предыдущей DiarizationLM-8b-Fisher-v2) и впервые даёт статистически значимые улучшения не только на телефонных диалогах Fisher и Callhome, но и на 4–9-спикерных собраниях ICSI и AMI. Веса и код открыты под Apache-2.0, а квантованная версия весит около 5,3 ГБ, так что связку «ASR + диаризация + LLM-коррекция» можно собрать даже на одном десктопе.

image
image

Что произошло

Модель дообучена методом Locality-Preserving Oracle Supervision на 51 063 парах Fisher и 20 762 парах Callhome/ICSI/AMI с LoRA r=256 за 10 000 шагов на 8× TPU v5p. Ключевой приём рецепта: правки допускаются только на коротких вставках-«backchannels» из 1–5 слов, а реплики от 6 слов сохраняются как акустические якоря, чтобы личность спикера не дрейфовала в длинных монологах. Это осознанный компромисс между точностью границ и стабильностью атрибуции. На всех четырёх бенчмарках улучшения WDER и cpWER статистически значимы (p<0.0001): на Fisher WDER снижается до 2,99% против 3,28% у 8B-версии (cpWER 17,62% против 18,37%), на Callhome — до 4,92% против 6,66%, с идеально точным подсчётом числа спикеров (MAE=0). Веса распространяются в форматах GGUF Q4_K_M (~5,3 ГБ) и safetensors (~16 ГБ) под лицензией Apache-2.0.

Контекст

Пост-обработка диаризации языковой моделью — не новая идея: предыдущие модели семейства DiarizationLM той же команды уже исправляли гипотезу расшифровки с тегами . Узким местом был охват: их обучали и оценивали преимущественно на двухголосых телефонных корпусах Fisher и Callhome, тогда как типовая офисная встреча собирает четыре-девять участников, где реплики перебиваются короткими вставками вроде «ага» и «угу», и ошибки в границах множатся с каждым дополнительным голосом. Понять масштаб улучшений помогают две метрики: WDER измеряет долю ошибок атрибуции спикеров, а cpWER — итоговое качество расшифровки с учётом сдвигов границ, то есть показывает эффект коррекции целиком.

Почему это важно для индустрии

Смешанные атрибуции спикеров остаются главным остаточным источником ошибок в транскрибации многоголосых встреч, и LLM-коррекция этого этапа до недавнего времени давала значимый прирост только на двухголосых телефонных звонках. Новый релиз впервые показывает значимое улучшение и на 4–9-спикерных собраниях ICSI и AMI, причём при вдвое меньшем размере модели, то есть подход масштабируется на типовой офисный сценарий без потери качества на телефонных разговорах. Показателен и сам способ: качество выросло за счёт рецепта LoRA-дообучения и супервизии с локальностью, а не за счёт масштаба, — редкий случай, когда компактная 4B-модель обходит более крупную предшественницу. Для компаний это превращает корректор в добавляемый батч-этап существующего пайплайна: веса открыты, формат входа простой, миграция ASR не нужна, а порог входа в точную атрибуцию спикеров в self-hosted стеках резко снижается.

Почему это важно для пользователей

Попробовать модель можно уже сегодня без GPU-фермы: квантованная сборка GGUF Q4_K_M весит примерно 5,3 ГБ и запускается в llama.cpp-совместимых рантаймах, а полные веса в safetensors (~16 ГБ) работают через Python — pip install diarizationlm — либо через библиотеку transformers. Формат обмена простой: на вход подаётся гипотеза расшифровки с тегами , на выходе получается исправленная разметка меток и границ. Есть и живое веб-демо HF Space DiarizationLM-GGUF, где пайплайн можно проверить до установки. Практичный план пилота — низкорисковый A/B-эксперимент: подать текущую гипотезу своего диаризационного пайплайна, получить исправленную разметку и сравнить WDER на собственной размеченной выборке против базовой версии без коррекции.

Что пока неизвестно / ограничения

Результаты получены на исследовательских корпусах (телефонные диалоги и собрания) с фиксированным качеством upstream-распознавания, поэтому переносимость на другие домены, языки и живые ASR-движки пока не показана. В доступных данных сравнение приводится только с предыдущей моделью той же команды, и позиция относительно других подходов к диаризации остаётся неясной. Кроме того, это слой поверх готовой расшифровки: модель исправляет метки спикеров и границы реплик, но качество самих слов определяется upstream-ASR, так что заявления о готовности к продакшену на произвольных данных стоит проверять на собственной разметке.

Источники

Автор

Look at AI, редакция