Компания ShengShu Technology представила масштабные обновления для платформы Vidu, включая инструмент One-click MV для автоматического создания музыкальных клипов и новую модель Vidu S1, способную генерировать интерактивных видеоперсонажей в реальном времени.

image

Что произошло

В рамках обновления платформы Vidu был запущен инструмент One-click MV, который позволяет за несколько минут создавать музыкальные видео в разрешении до 1080p, используя только аудиофайл и референсное изображение персонажа. Параллельно была выпущена модель Vidu S1, использующая архитектуру autoregressive diffusion для генерации интерактивных видеоаватаров в разрешении 540P с частотой до 42 FPS, что обеспечивает возможность взаимодействия с персонажем через голосовые команды.

Контекст

Технологический сдвиг заключается в переходе от традиционной пакетной генерации видео по запросу к потоковой генерации контента. Использование autoregressive diffusion в модели Vidu S1 позволяет сохранять визуальный и эмоциональный контекст на протяжении всего диалога, что критически важно для создания живого взаимодействия.

Почему это важно для индустрии

Для индустрии ИИ это означает трансформацию инструментов продакшена в платформы для живого взаимодействия. Технология открывает новые рынки для создания умных NPC в видеоиграх, виртуальных стримеров и интерактивных AI-помощников, способных поддерживать долгосрочную память и эмоциональную связь с пользователем.

Почему это важно для пользователей

Обычные пользователи получают возможность мгновенно превращать фотографии в «говорящие головы» или музыкальных героев одним нажатием, а также взаимодействовать с AI-персонажами в режиме реального времени, где их мимика и движения подстраиваются под голос собеседника.

Что пока неизвестно / ограничения

На данный момент отсутствуют подробные данные о стоимости инференса модели и доступности специализированных API для промышленного использования (production), что оставляет вопросы относительно масштабируемости решения.

Источники

Автор

Look at AI, редакция