Исследователи Google — Chih-Wei Hsu, Moonkyung Ryu и соавторы — опубликовали 29 сентября 2026 года пост в Google Research Blog, в котором представили Diffusion Controller (DiffCon): фреймворк, описывающий управление диффузионными генераторами изображений языком теории управления. Из единого формализма выводятся практические алгоритмы дообучения, а небольшая «боковая» сеть позволяет управлять моделью с замороженными весами, в том числе закрытой. На Stable Diffusion v1.4 подход уже обошёл LoRA в двух режимах дообучения, однако пока остаётся исследовательским результатом, а не готовым продуктовым инструментом.


Что произошло
Пост в Google Research Blog сопровождается статьёй «Diffusion Controller: Framework, Algorithms and Parameterization» на arXiv под номером 2603.06981. Ключевая идея в том, что обратный диффузионный семплинг формулируется как стохастическое управление в линейно-разрешимых марковских процессах (LS-MDP): контроль перевзвешивает переходные ядра предобученной модели, балансируя целевую награду и f-дивергентный штраф, который не даёт качеству генерации развалиться. Из условий оптимальности авторы выводят два практических метода дообучения — регуляризованный policy gradient с PPO-правилом и reward-weighted regression с гарантией сохранения минимизатора по KL-дивергенции. Управлять моделью с замороженным бэкбоном позволяет «боковая» побочная сеть, вносящая поправки на промежуточных результатах денойзинга, включая gray-box доступ к закрытым моделям. В экспериментах на Stable Diffusion v1.4 gray-box вариант DiffCon обошёл LoRA в режимах SFT и RWL по метрике HPS-v2, затрагивая меньше внутренних слоёв, а white-box вариант показал 90% win rate против базовой модели.
Контекст
До недавнего времени способы управления диффузионной генерацией развивались независимо друг от друга: classifier-free guidance задаёт силу прилипания к промпту, LoRA адаптирует веса под стиль или задачу, а семейство reward-методов дотренировывает модель под измеримую награду. У каждого подхода своя механика, свои компромиссы между управляемостью и деградацией качества и свой стек инструментария, что делает сравнение и комбинирование методов громоздким. DiffCon предлагает общий формализм, в котором эти приёмы становятся частными случаями перевзвешивания переходных ядер, и переносит в диффузионные генераторы методологию выравнивания, привычную по RLHF-стеку языковых моделей. Отдельно важна архитектурная перестановка: управляемость из свойства весов превращается во внешний модуль, который ставится поверх замороженного бэкбона и корректирует процесс денойзинга на промежуточных шагах.
Почему это важно для индустрии
Для индустрии DiffCon — это шаблон продуктового слоя управления: единый фреймворк задаёт награду, стилевые ограничения и safety-требования, а сам слой остаётся лёгкой надстройкой над базовой моделью. Для команд, где LoRA «перетягивает» модель и ломает исходное качество, это кандидат на замену части адаптационного пайплайна, причём проверяемый прямо сейчас: статья и код-фреймворк доступны, а эксперименты воспроизводимы на Stable Diffusion v1.4. Gray-box маршрут особенно значим для сервисов, работающих с закрытыми моделями: управляемость и safety-фильтры можно добавлять без доступа к весам, прототипируя sidecar на открытых бэкбонах. В ближайшие полгода ключевой проверкой станут независимые перепроверки на современных архитектурах, например Flux; если превосходство над LoRA удержится, вероятны первые открытые реализации контроллеров в инференс-фреймворках и запросы к провайдерам API на доступ к промежуточным шагам денойзинга. В более длинной перспективе тот же паттерн, по описанию Google Research Blog, применим к видео-моделям, где перевзвешивание переходных ядер может стать стандартным формализмом контроля генерации.
Почему это важно для пользователей
Практикам, которые работают со Stable Diffusion, Flux или Nano Banana, DiffCon описывает альтернативу LoRA: лёгкую надстройку-контроллер поверх замороженной модели с одним параметром силы guidance на инференсе, который, как утверждается в посте Google, можно плавно подкручивать без дисторсий качества. Вместо подбора и хранения набора адаптеров под каждую задачу появляется внешний модуль, который корректирует генерацию и который можно снимать и заменять без переобучения бэкбона. Разобрать метод самостоятельно уже возможно: статья на arXiv и код-фреймворк открыты, а подтверждённые эксперименты воспроизводимы на Stable Diffusion v1.4, так что сравнение с LoRA на собственном датасете и собственном eval-харнесе — реальный первый шаг. Тем, кто пользуется только закрытыми API, следует помнить, что gray-box маршрут к ним в источниках не подтверждён: сегодня это направление для разработчиков открытых моделей и исследовательских команд.
Что пока неизвестно / ограничения
Все подтверждённые результаты пока касаются Stable Diffusion v1.4 — модели 2022 года, поэтому переносимость на современные и будущие бэкбоны требует проверки. 90% win rate измерен против простой базовой модели, что является низкой планкой, а сравнение по HPS-v2 остаётся proxy-метрикой, требующей ручной вертикальной проверки качества. В источниках нет данных по латентности, pricing и managed API, так что о продакшен-применимости судить невозможно. Заявление об одном параметре силы guidance, который плавно крутится без дисторсий, взято из описания в посте Google Research Blog и не является верифицированным эвалюационным результатом. Gray-box маршрут к закрытым сервисам вроде Nano Banana в источниках не подтверждён, и вопрос, откроют ли провайдеры доступ к промежуточным шагам денойзинга, остаётся открытым.
Источники
- Google Research Blog — How Diffusion Controller unifies and simplifies AI image generation
- Diffusion Controller: Framework, Algorithms and Parameterization (arXiv 2603.06981)
Автор
Look at AI, редакция
