Компания Black Forest Labs анонсировала FLUX 3 — новое поколение мультимодальных моделей, способных бесшовно объединять генерацию изображений, видео и аудио в единую систему. Благодаря уникальной архитектуре Self-Flow, модель демонстрирует глубокое понимание физических законов мира и обеспечивает высокую согласованность между визуальным рядом и звуковым сопровождением.

image
image

Что произошло

Black Forest Labs представила FLUX 3, которая переходит от дискретных моделей к единой мультимодальной архитектуре. Модель FLUX 3 Video поддерживает создание видеороликов длительностью до 20 секунд с нативным аудио. Согласно результатам бенчмарков, новая технология превосходит по показателям такие решения, как Luma Ray 3.2, Runway Gen-4.5 и Kling v3 Pro.

Контекст

Разработка FLUX 3 базируется на концепции Real World Models, где архитектура Self-Flow служит основой для создания визуального интеллекта. Это знаменует сдвиг индустрии от использования разрозненных инструментов (отдельные модели для видео и отдельно для звука) к комплексным системам, способным генерировать физически достоверный контент в рамках единого конвейера.

Почему это важно для индустрии

Для индустрии этот переход означает возможную стандартизацию архитектур типа Self-Flow и смену фокуса с простых связок image-to-video на полноценные мультимодальные backbone-модели. В долгосрочной перспективе развитие таких систем может обеспечить прорыв в области Visual Intelligence, что критически важно для создания точных симуляций и обучения роботов в виртуальных средах.

Почему это важно для пользователей

Пользователи могут получить доступ к тестированию FLUX 3 Video через форму раннего доступа. Это дает возможность протестировать технологию, которая потенциально меняет расклад сил на рынке видеогенерации, и начать прототипирование новых UX-паттернов, основанных на мгновенной генерации видео вместе со звуком по текстовому запросу.

Что пока неизвестно / ограничения

На данный момент отсутствуют сведения о задержках (latency), стоимости использования и доступности API, что не позволяет оценить готовность модели к промышленной эксплуатации (production). Технология пока находится преимущественно в стадии исследовательского интереса и раннего доступа.

Источники

Автор

Look at AI, редакция