🤖 Tencent Hunyuan открыла код speech-модели AuK на 1.5B параметров
9 сентября 2026 компания выложила исходники, веса под MIT и техотчет (arXiv:2609.08936). Модель понимает команды на естественном языке: TTS и клонирование голоса по референсу, TTS по описанию, замена и удаление слов в записи, перепев текста в песне с сохранением мелодии, смена эмоции и тембра, денойзинг, разделение говорящих и выделение вокала.
🌍 Открытые веса, код, ComfyUI-ноды, Python API и fine-tuning-пайплайн с day-0 поддержкой в SGLang-Omni дают open-source альтернативу закрытым TTS-инструментам.
👤 Демо уже на HuggingFace и ModelScope: веса tencent/AuK и tencent/AuK-Flash можно скачать и локально клонировать голос, переписывать слова и чистить шум. Русский не заявлен, но мультиязычный энкодер Qwen2.5-Omni-3B оставляет шанс.
Источник 1: https://github.com/Tencent-Hunyuan/AuK Источник 2: https://huggingface.co/tencent/AuK
