Qwen Business Unit Alibaba совместно с Southeast University и ShanghaiTech University опубликовала статью «What to Edit Next» (arXiv:2608.07565) о том, как делать follow-up подсказки в чате генерации картинок визуально согласованными с текущим изображением, чтобы каждая подсказанная правка была на нём реально выполнима. Авторы комбинируют надзорное обучение, обучение с подкреплением по кликам пользователей и отдельный визуальный верификатор выполнимости, а рецепт проверяют в живом 14-дневном A/B-тесте с миллионами пользователей.



Что произошло
Фреймворк построен на анализе 100 000 многоходовых диалогов Qwen App, в которых 80,1% запросов-продолжений зависят от текущего изображения. Пайплайн состоит из трёх этапов: сначала SFT на 39,5 тыс. слайтов подсказок, затем GRPO-обучение на 173 071 паре кликов с 8B VLM-моделью в роли вознаграждения (канал называет базовой моделью Qwen3-VL-8B), и наконец визуальный верификатор, который проверяет, что «источник» правки реально виден на изображении, а целевое состояние ещё не достигнуто. Данные готовили по цепочке: из 120 тыс. запросов получили 44,3 тыс. контекстов, из них 243 тыс. валидированных подсказок и 39,5 тыс. слайтов. Онлайн-эксперимент шёл 14 дней на миллионах пользователей при 5% трафика на вариант, все дельты статистически значимы при p<0,05: визуальная несогласованность подсказок упала с 3,7% до 0,9%, CTR рекомендаций вырос на 32,70%, сохранение изображений — на 16,32%, среднее число ходов на пользователя — на 39,90%.
Контекст
В разговорной генерации изображений после каждого хода пользователя система предлагает продолжить работу с картинкой, и полезность подсказки определяется тем, можно ли её реально применить к текущему состоянию. Ключевое научное заключение работы состоит в том, что сигнал вовлечённости и визуальная выполнимость ортогональны: авторы показали абляцией, что RL по кликам (GRPO) поднял качество подсказок и CTR, но не устранил визуально невозможные правки, поэтому потребовался отдельный визуальный сигнал. Сами по себе механизмы верификации — тоже инженерный вклад: однопроходная проверка VLM давала 22,2% ложных отказов, тогда как упорядоченная source-target процедура с image-first наблюдением — 0,6% при 78,7% recall.
Почему это важно для индустрии
Работа — не новая модель, а воспроизводимый рецепт паттерна «что поправить дальше», который переносится на любой ассистент, предлагающий действия поверх изображений: канвасы, дизайн-ассистенты, image-чаты. Порядок этапов задаёт принцип проектирования мультимодальных рекоммендеров: сначала задача на human-reviewed intents, затем клики, затем проверка выполнимости по пикселям. Комбинация «RL по кликам + структурированный визуальный верификатор» может быть перенята немедленно командами, у которых уже есть кликовый лог и собственная VLM, а A/B-цифры статьи служат бенчмарком для категории. При этом статья — методологический референс, а не библиотека: архитектуру можно изучить и переосмыслить, но drop-in компонента нет.
Почему это важно для пользователей
Для всех, кто строит генеративные продукты с функцией «что поправить дальше», статья — открытый методологический референс, читаемый без глубокой математики: в ней есть полный data-пайплайн, абляция архитектуры верификатора и честные A/B-цифры. Практический шаг сегодня — изучить пайплайн и source-target верификатор, оценить, применим ли паттерн «подсказка должна быть выполнима на текущем изображении» к собственному продукту, и спланировать реализацию на своей VLM. Готовой библиотеки или API для интеграции нет, поэтому ценность работы — в методологии и порядке этапов, а не в установке готового компонента.
Что пока неизвестно / ограничения
Код и веса модели не опубликованы, а в статье нет данных о вычислениях, латентности или стоимости инференса, поэтому утверждение, что стек «в принципе влезает в consumer GPU», не подкреплено источниками. SFT и GRPO-обучение 8B VLM с отдельной 8B VLM-моделью вознаграждения на 173 071 паре кликов — серьёзная тренировочная нагрузка, ресурсная стоимость которой в работе не раскрывается. Базовая модель Qwen3-VL-8B названа каналом, а не подтверждена в самой статье, и вывод о воспроизводимости пайплайна на открытых 8B VLM остаётся гипотезой, а не фактом.
Источники
- What to Edit Next — официальная страница проекта (Qwen Business Unit of Alibaba)
- Статья «What to Edit Next: Visually Aligned Image-Editing Follow-Up Suggestions in Conversational Systems» (arXiv:2608.07565)
Автор
Look at AI, редакция
