Команда Гонконгского университета (HKU) и Университета электронных наук и технологий Китая (UESTC) выпустила открытый пайплайн SceneMosaic: из одной фотографии комнаты он за порядка 8 минут собирает 3D-сцену, готовую к симуляции, и варианты её расстановки, а код выложен под лицензией MIT.

image
image
image

Что произошло

Авторы — Синцзянь Жань, Сяое Мо и коллеги, Бо Дай — опубликовали проект вместе с препринтом «Efficient and Diverse Simulation-Ready Scene Generation via Hybrid Agentic Layout Evolution». На вход пайплайн принимает фотографию комнаты, на выходе отдаёт 3D-сцену в формате .glb, пригодную для размещения в симуляторе, и набор из шести валидных вариантов расстановки. Проектная страница фиксирует тайминги: базовая сцена в среднем собирается за 8 минут, каждый дополнительный вариант занимает примерно 2 минуты. Код размещён в репозитории rxjfighting/SceneMosaic на GitHub под лицензией MIT, первый коммит с пайплайном датирован 3 сентября 2026 года, на момент публикации у проекта 38 звёзд.

Контекст

Генерация симуляционно-готовых сред стоит перед выбором: агентный text-to-3D даёт физически согласованные сцены, но требует часов итеративной работы с инструментами, а быстрые image-to-3D-методы выдают летающие, пересекающиеся и клиппящиеся объекты. SceneMosaic решает это гибридом: для быстрой инициализации используются готовые визуальные модули — сегментация SAM3 и 3D-реконструкция SAM 3D Objects от Meta (подключены сабмодулями с зафиксированными коммитами), глубинная модель MoGe и DINOv2. Дальше сцена разбирается на независимые «локальные единицы», каждая из которых физически стабилизируется — по гравитации, с проверкой коллизий и поправкой контейнеров, — а VLM-агенты в схеме Critic–Actor правят семантику и физику по ортографическим проекциям. Новизна авторов не в самих модулях, а в этой композиции.

Почему это важно для индустрии

Для отрасли это конкретный механизм-примитив для офлайн-генерации сим-данных: быстрые image-priors дают скорость инициализации, агентная коррекция — семантику и физику, а локальная декомпозиция с декартовым сбором делает разнообразие почти бесплатным, поскольку комбинация валидных единиц наследует их валидность. Семейство валидных сред становится дешёвым побочным продуктом вместо отдельной дорогой процедуры, что даёт прямой способ генерировать среды для обучения роботов и наполнять игровые движки. MIT-лицензия делает референс-реализацию бесплатным baseline для всех: для команд, разрабатывающих собственные сим-дата пайплайны, это сигнал об обвале стоимости валидных сред вместо многомесячной разработки с нуля.

Почему это важно для пользователей

Для читателя, работающего с embodied AI и обучением роботов, проект уже сейчас можно склонировать и прогнать на своём GPU: зафиксированные сабмодули дают воспроизводимый стек, а собственные фотографии комнат превращаются в симуляционно-готовые .glb-сцены за порядка 8 минут на базовую сцену плюс около 2 минут за каждый дополнительный вариант. Отдельная ценность — проверенный паттерн «независимая стабилизация единиц плюс декартовая комбинация», который можно перенести в собственные конвейеры генерации данных. При этом для конечных пользователей продукта нет: это ни API, ни SaaS, а исследовательская референс-реализация.

Что пока неизвестно / ограничения

Валидность сцен пока проверяется только собственными проверками пайплайна — коллизиями, гравитацией и поправкой контейнеров, — внешнего валидатора или общепринятого стандарта, по которому можно подтвердить статус «simulation-ready», в доступных источниках нет. Сравнения с бейзлайнами отсутствуют: никаких таблиц, датасетов или метрик качества, есть только собственные времена прогона. Проект очень свежий — первый коммит с пайплайном датирован 3 сентября 2026 года, — и остаётся research-grade: нет API, docker-обёртки, SLA и задокументированных требований к железу, а сообщество лишь начинает его замечать (38 звёзд).

Источники

Автор

Look at AI, редакция