Компания ShengShu Technology представила масштабные обновления для платформы Vidu, включая инструмент One-click MV для автоматического создания музыкальных клипов и новую модель Vidu S1, способную генерировать интерактивных видеоперсонажей в реальном времени.

Что произошло
В рамках обновления платформы Vidu был запущен инструмент One-click MV, который позволяет за несколько минут создавать музыкальные видео в разрешении до 1080p, используя только аудиофайл и референсное изображение персонажа. Параллельно была выпущена модель Vidu S1, использующая архитектуру autoregressive diffusion для генерации интерактивных видеоаватаров в разрешении 540P с частотой до 42 FPS, что обеспечивает возможность взаимодействия с персонажем через голосовые команды.
Контекст
Технологический сдвиг заключается в переходе от традиционной пакетной генерации видео по запросу к потоковой генерации контента. Использование autoregressive diffusion в модели Vidu S1 позволяет сохранять визуальный и эмоциональный контекст на протяжении всего диалога, что критически важно для создания живого взаимодействия.
Почему это важно для индустрии
Для индустрии ИИ это означает трансформацию инструментов продакшена в платформы для живого взаимодействия. Технология открывает новые рынки для создания умных NPC в видеоиграх, виртуальных стримеров и интерактивных AI-помощников, способных поддерживать долгосрочную память и эмоциональную связь с пользователем.
Почему это важно для пользователей
Обычные пользователи получают возможность мгновенно превращать фотографии в «говорящие головы» или музыкальных героев одним нажатием, а также взаимодействовать с AI-персонажами в режиме реального времени, где их мимика и движения подстраиваются под голос собеседника.
Что пока неизвестно / ограничения
На данный момент отсутствуют подробные данные о стоимости инференса модели и доступности специализированных API для промышленного использования (production), что оставляет вопросы относительно масштабируемости решения.
Источники
Автор
Look at AI, редакция
