Тест на разделенном экране в новой мультимодальной модели FLUX 3 от Black Forest Labs демонстрирует высокую степень синхронизации между ракурсами. Видео показывает одно и то же действие (прыжок кошки) одновременно с двух разных камер: широкоугольной сверху и боковой на уровне глаз, что подтверждает способность модели удерживать консистентность физического мира при генерации сложных сцен.

Что произошло
В ходе демонстрации возможностей FLUX 3 был проведен split-screen тест, показавший способность модели генерировать видео с разных точек обзора, сохраняя временную и пространственную синхронизацию. При изменении параметров «оптики» и ракурсов (широкоугольный против бокового) объект и окружение остаются стабильными и консистентными.
Контекст
Данный успех свидетельствует о переходе от чисто визуальной генерации к формированию полноценных «мировых моделей» (world models). В отличие от предыдущих поколений нейросетей, фокусировавшихся на качестве текстур, FLUX 3 демонстрирует прогресс в понимании пространственной геометрии и физических законов движения объектов в 3D-пространстве.
Почему это важно для индустрии
Для индустрии это означает качественный скачок в создании инструментов для автоматизированного видеопроизводства и симуляций. Способность генерировать синхронизированные многоракурсные сцены критически важна для обучения роботов и создания высокоточных синтетических сред для RL-агентов (Reinforcement Learning), где физическая корректность видеоряда является определяющим фактором.
Почему это важно для пользователей
Для создателей контента это открывает путь к автоматизированному производству видео с кинематографическими ракурсами и созданию цифровых двойников. Пользователи смогут генерировать сложные многоракурсные сцены с помощью текстовых промптов, что значительно упрощает процесс прототипирования визуальных эффектов и сложных визуальных нарративов.
Что пока неизвестно / ограничения
Несмотря на технологический прорыв, на данный момент отсутствуют данные по задержке (latency), стоимости инференса и доступности API для коммерческого использования в production-средах.
Источники
Автор
Look at AI, редакция
