Qwen Business Unit Alibaba совместно с Southeast University и ShanghaiTech University опубликовала статью «What to Edit Next» (arXiv:2608.07565) о том, как делать follow-up подсказки в чате генерации картинок визуально согласованными с текущим изображением, чтобы каждая подсказанная правка была на нём реально выполнима. Авторы комбинируют надзорное обучение, обучение с подкреплением по кликам пользователей и отдельный визуальный верификатор выполнимости, а рецепт проверяют в живом 14-дневном A/B-тесте с миллионами пользователей.

image
image
image

Что произошло

Фреймворк построен на анализе 100 000 многоходовых диалогов Qwen App, в которых 80,1% запросов-продолжений зависят от текущего изображения. Пайплайн состоит из трёх этапов: сначала SFT на 39,5 тыс. слайтов подсказок, затем GRPO-обучение на 173 071 паре кликов с 8B VLM-моделью в роли вознаграждения (канал называет базовой моделью Qwen3-VL-8B), и наконец визуальный верификатор, который проверяет, что «источник» правки реально виден на изображении, а целевое состояние ещё не достигнуто. Данные готовили по цепочке: из 120 тыс. запросов получили 44,3 тыс. контекстов, из них 243 тыс. валидированных подсказок и 39,5 тыс. слайтов. Онлайн-эксперимент шёл 14 дней на миллионах пользователей при 5% трафика на вариант, все дельты статистически значимы при p<0,05: визуальная несогласованность подсказок упала с 3,7% до 0,9%, CTR рекомендаций вырос на 32,70%, сохранение изображений — на 16,32%, среднее число ходов на пользователя — на 39,90%.

Контекст

В разговорной генерации изображений после каждого хода пользователя система предлагает продолжить работу с картинкой, и полезность подсказки определяется тем, можно ли её реально применить к текущему состоянию. Ключевое научное заключение работы состоит в том, что сигнал вовлечённости и визуальная выполнимость ортогональны: авторы показали абляцией, что RL по кликам (GRPO) поднял качество подсказок и CTR, но не устранил визуально невозможные правки, поэтому потребовался отдельный визуальный сигнал. Сами по себе механизмы верификации — тоже инженерный вклад: однопроходная проверка VLM давала 22,2% ложных отказов, тогда как упорядоченная source-target процедура с image-first наблюдением — 0,6% при 78,7% recall.

Почему это важно для индустрии

Работа — не новая модель, а воспроизводимый рецепт паттерна «что поправить дальше», который переносится на любой ассистент, предлагающий действия поверх изображений: канвасы, дизайн-ассистенты, image-чаты. Порядок этапов задаёт принцип проектирования мультимодальных рекоммендеров: сначала задача на human-reviewed intents, затем клики, затем проверка выполнимости по пикселям. Комбинация «RL по кликам + структурированный визуальный верификатор» может быть перенята немедленно командами, у которых уже есть кликовый лог и собственная VLM, а A/B-цифры статьи служат бенчмарком для категории. При этом статья — методологический референс, а не библиотека: архитектуру можно изучить и переосмыслить, но drop-in компонента нет.

Почему это важно для пользователей

Для всех, кто строит генеративные продукты с функцией «что поправить дальше», статья — открытый методологический референс, читаемый без глубокой математики: в ней есть полный data-пайплайн, абляция архитектуры верификатора и честные A/B-цифры. Практический шаг сегодня — изучить пайплайн и source-target верификатор, оценить, применим ли паттерн «подсказка должна быть выполнима на текущем изображении» к собственному продукту, и спланировать реализацию на своей VLM. Готовой библиотеки или API для интеграции нет, поэтому ценность работы — в методологии и порядке этапов, а не в установке готового компонента.

Что пока неизвестно / ограничения

Код и веса модели не опубликованы, а в статье нет данных о вычислениях, латентности или стоимости инференса, поэтому утверждение, что стек «в принципе влезает в consumer GPU», не подкреплено источниками. SFT и GRPO-обучение 8B VLM с отдельной 8B VLM-моделью вознаграждения на 173 071 паре кликов — серьёзная тренировочная нагрузка, ресурсная стоимость которой в работе не раскрывается. Базовая модель Qwen3-VL-8B названа каналом, а не подтверждена в самой статье, и вывод о воспроизводимости пайплайна на открытых 8B VLM остаётся гипотезой, а не фактом.

Источники

Автор

Look at AI, редакция