🖼️ Qwen подсказывает следующие правки картинки — и проверяет, что они выполнимы
Qwen Business Unit Alibaba с Southeast University и ShanghaiTech University опубликовала What to Edit Next (arXiv:2608.07565): трёхэтапный фреймворк, который в чате генерации картинок подсказывает следующие правки, проверенные по текущему изображению. Модель Qwen3-VL-8B обучили на 100 000 диалогах Qwen App и 173 071 паре кликов.
🌍 Рецепт для мультимодальных ассистентов: упорядоченный source-target верификатор дал 0,6% ложных отказов против 22,2% у однопроходной VLM. RL по кликам поднял CTR, но не устранил визуально невыполнимые правки.
👤 В A/B-тесте на 14 дней с миллионами пользователей CTR рекомендаций вырос на 32,70%, несогласованность подсказок упала с 3,7% до 0,9%. Статья открыта на arXiv, кода и весов нет — это референс по методологии.
Источник 1: https://what-to-edit-next.github.io/ Источник 2: https://arxiv.org/abs/2608.07565
