Компания World Labs, основанная Фей-Фей Ли, представила Atlas — «omni» world model для пространственного интеллекта, которая нативно работает с текстом, изображениями, видео и 3D. Модель генерирует видео до 60 секунд в 1440p, где траектория камеры задается явной геометрией как отдельный вход, а не текстовым промптом, и восстанавливает 3D-сцены по нескольким снимкам. Публичного доступа к Atlas пока нет: заявки на ранний доступ принимаются через Marble.

image

Что произошло

World Labs объявила о выпуске Atlas, описав ее как универсальную world model, объединяющую генерацию видео, 3D-реконструкцию и симуляцию. Архитектурно это мультимодальный авторегрессионный diffusion-трансформер с rectified flow и общим пространственным контекстом. Модель генерирует видео до 60 секунд в разрешении 1440p с попиксельно точным управлением камерой: геометрия камеры подается отдельным входом, а не описывается текстом. Atlas восстанавливает 3D-сцены по 2–3 и до 100+ снимкам, выдавая облака точек и 3D Gaussian splats, а из трех ракурсов собирает эффект bullet time. По данным компании, в человеческих сравнениях Atlas оказалась предпочтительнее MiniMax H3 в 75% случаев, Gemini Omni Flash — в 81%, FLUX 3 — в 93% и Seedance 2.5 — в 94%; в 3D-реконструкции ее средняя ошибка составила 8,6 против 11,1 у Pi3X, сравнение также проводилось с VGGT-Ω 1B и MapAnything. Отдельно продемонстрирован режим Real-to-Sim: из 24 кадров видео с телефона модель восстанавливает сцену с RGB, глубиной и физикой жестких, шарнирных и деформируемых объектов.

Контекст

Atlas развивает направление world models — генеративных моделей, которые работают не с отдельными кадрами, а с пространством сцены целиком. Центральная идея выпуска — камера как явный тип входа: в привычных видео-моделях положение и движение камеры выводятся из текстового промпта как побочный эффект, тогда как Atlas принимает геометрию камеры отдельным полем. Такой дизайн превращает генеративную модель в инструмент, похожий на превизуализацию, где сцену можно «поставить», а затем снимать ее с любых ракурсов. Ставка World Labs состоит в том, что единая world model со временем вытеснит раздельные пайплайны «видео-генератор плюс отдельная 3D-реконструкция плюс отдельный симулятор», а сами world models перейдут от исследовательских демо к коммерческим инструментам. Продуктовая интеграция с Marble, через которую открывается ранний доступ, указывает на движение именно в эту сторону.

Почему это важно для индустрии

Для отрасли главный сдвиг в том, что камера превращается из побочного эффекта промпта в управляемую переменную производства, а готовый паттерн «сцена плюс траектория камеры» дает сильный рычаг переиспользования: из одной согласованной 3D-сцены можно получать и видео по заданной траектории, и облака точек, и 3D Gaussian splats. Если заявления World Labs подтвердятся независимой проверкой, один универсальный подход обгонит узкоспециализированные пайплайны реконструкции, что станет аргументом против узкой специализации моделей. Real-to-Sim из 24 кадров телефонного видео открывает практичный путь к масштабной генерации обучающих данных для робототехники с RGB, depth и физикой жестких, шарнирных и деформируемых объектов. Для стартапов это удешевляет превизуализацию, VFX и создание синтетических данных, однако строить на Atlas коммерческие продукты пока нельзя: публичного API, прайса и данных о latency и требованиях к железу не существует.

Почему это важно для пользователей

Для тех, кто работает с AI-видео, сцена теперь ставится как в превизуализации: задается пространство, рисуется траектория камеры, и модель выдает согласованные кадры с любых ракурсов, включая bullet time всего с трех точек съемки на телефонных штативах. Реконструкция 3D-сцены по 2–3 фотографиям с выдачей Gaussian splats, которые рендерятся на устройстве в высоком разрешении, — то, что можно реально попробовать в ближайшие недели. Конкретное действие доступно уже сегодня: подать заявку на ранний доступ через Marble. Планировать стоимость и обязательства перед клиентами пока рано — публичного прайса у Atlas нет.

Что пока неизвестно / ограничения

Все сравнения качества — это вендорский «blog eval» без раскрытого протокола: число оценщиков, набор промптов и сцен, условия съемки и способ отбора базлайнов в источнике не раскрыты. Метрика реконструкции, 8,6 против 11,1 у Pi3X, приводится без единиц измерения, датасетов и условий теста, поэтому ни о статистической, ни о практической значимости разрыва судить нельзя. Публичного доступа к модели, прайса, данных по latency и требованиям к железу нет; независимая проверка станет возможной только после открытия раннего доступа.

Источники

Автор

Look at AI, редакция