Runway представила Solaris — первую модель семейства Interface World Models, «моделей мира интерфейсов»: приложение в ней не программируется, а генерируется покадрово в реальном времени в 720p и реагирует на клики и перетаскивания напрямую, без кода и заранее описанных экранов. Попробовать модель пока нельзя — компания открыла только заявки на ранний доступ.

image

Что произошло

Solaris рендерит интерфейс приложения покадрово, как видео, в разрешении 720p: клики и перетаскивания поступают в модель как conditioning для следующего кадра, наравне с текстом или картинкой. Технической основой стала видео-модель Gen-4.5: кадры генерируются авторегрессивно, многошаговый денойзинг дистиллирован до нескольких шагов, а быструю модель дообучили на её же выходах, чтобы длинные сессии оставались стабильными. За «разум» отвечает отдельная LLM: она решает, изменять текущую сцену или переходить к новой, и пишет промпты, тогда как world model занимается рендерингом. Целевой задержкой компания называет значение меньше 0,5 секунды — именно при таком пороге интерактивность начинает ощущаться. В пользовательском исследовании участвовали 250 человек, было собрано около 7500 попарных сравнений с интерфейсами, закодированными Claude Opus 5 по тем же запросам: Solaris предпочли в 61% случаев против 24%, ещё в одной серии сравнений доли составили 71% против 21%. Вместе с анонсом опубликован бенчмарк «стоимость трансляции»: 30 интерфейсов восстанавливались из скриншотов моделями вплоть до Claude Fable 5, визуальное сходство оценивалось метриками SSIM и DINOv3. Пока это research preview без публичного доступа.

Контекст

Solaris продолжает путь, который Runway начала с general world model GWM-1: там модель мира воспроизводит не картинку, а поведение среды. В такой архитектуре интерфейс живёт в пикселях, без DOM и заранее описанных экранов, а поведение приложения определяет world model, а не прописанные воркфлоу. На этом строится главный аргумент компании: по выводу Runway, бенчмарк «стоимость трансляции» показывает, что перевод интерфейса в промежуточное представление — код — необратимо теряет информацию, поэтому слой трансляции предлагается убрать целиком. Показательно и то, что реалтайм здесь собран из стандартного набора приёмов инференс-инжиниринга и открыто описан в анонсе — это делает демо честным ориентиром, а не закрытым фокусом.

Почему это важно для индустрии

Solaris атакует базовый цикл разработки «дизайн → код → интерфейс»: если перевод интерфейса в код действительно теряет информацию, под ударом оказываются инструменты, переводящие макеты и скриншоты в код, а слой «код» и частично «дизайн-система» начинают сжиматься — сначала для прототипирования и одноразовых интерфейсов. Второе следствие касается computer-use агентов: генерируемые интерфейсы дают им постоянно меняющиеся среды для обучения, которых раньше не существовало, вместо оверфиттинга к фиксированным разметкам; синтетические миры для таких агентов могут выделиться в отдельную индустрию. Наконец, инженерный рецепт реалтайма из анонса уже можно учитывать в планах собственных продуктов, а протокол «стоимости трансляции» компактен и дёшев в воспроизведении сторонними группами.

Почему это важно для пользователей

Попробовать Solaris сегодня нельзя ни читателю, ни компании: доступ только по заявке на ранний доступ через форму на странице анонса, цена, лимиты и API-поверхность не раскрыты. Практическая ценность сейчас в другом: анонс стоит прочитать целиком — там есть демо и открытый список ограничений. Если ранний доступ расширится, первыми внешними применениями станут ниши, где ошибка рендеринга некритична: прототипы, демо-стенды, брендированные сцены, интерактивные концепты из промптов. Разумные шаги на сегодня: зафиксировать продуктовые гипотезы вокруг открытых поведений сцен, пересмотреть бэклог прототипирования и проверить собственный продукт на «слои перевода», которые можно убрать — или которые уберут за вас.

Что пока неизвестно / ограничения

Доказательная база пока типична для вендорского анонса. В пользовательском исследовании один baseline — интерфейсы, закодированные Claude Opus 5, — а протокол не опубликован; доли 61% против 24% и 71% против 21% не суммируются в 100%, и судьба оставшихся сравнений, например ничьих, не раскрыта. Бенчмарк «стоимость трансляции» — вендорский замер визуального сходства без опубликованной методологии: он не доказывает тезис о необратимой потере информации в коде, корректно говорить лишь о направлении. Фактическая задержка, стабильность текста и поведение в длинных сессиях независимыми замерами не подтверждены. Открытые проблемы, которые Runway перечисляет сама, фундаментальны: читаемый текст и grounding — известные слабости видео-диффузии, а совместимость со скринридерами упирается в отсутствие у пиксельного интерфейса семантического слоя — это следствие самой архитектуры «интерфейс как кадр», а не баг текущей версии. Сценарий, при котором код как слой интерфейса исчезает, — условная ветка на горизонте около двух лет, а не свершившийся факт.

Источники

Автор

Look at AI, редакция