🤖 Google выпустила компактную модель-корректор диаризации

Вышла DiarizationLM-Gemma-4-E4B-v1 для пост-обработки диаризации: модель на Gemma 4 E4B (4B параметров — вдвое меньше прошлой 8B-версии) правит метки спикеров и границы реплик в ASR-расшифровках, а реплики от 6 слов сохраняет как акустические якоря от дрейфа личности.

🌍 Прежние DiarizationLM-модели помогали в основном в двухголосых телефонных звонках, а новая впервые даёт значимый прирост на собраниях ICSI и AMI с 4–9 спикерами: WDER на Fisher 2,99% против 3,28% у 8B, на Callhome 4,92% против 6,66%.

👤 Попробовать можно локально: GGUF Q4_K_M ~5,3 ГБ идёт через llama.cpp, есть Python-пакет diarizationlm и веб-демо, веса и код — под Apache-2.0. Перед коммерческим внедрением стоит проверить условия базовой модели Gemma.

Источник 1: https://huggingface.co/google/DiarizationLM-Gemma-4-E4B-v1 Источник 2: https://github.com/google/speaker-id