Qwen выпустила два промпт-энхансера для системы генерации изображений Qwen-Image-2.1, дообученных на базе модели Qwen3.5-VL 9B. Qwen-Image-2.1-PE-T2I разворачивает короткий запрос на любом языке в детальное английское описание и угадывает соотношение сторон будущего кадра, а PE-I2I переписывает инструкции для редактирования с учётом входных изображений, сохраняя свет, тон и неупомянутые детали. Обе модели отдают результат строго в JSON, а команда Comfy-Org уже подготовила для ComfyUI int8-квантованный текстовый энкодер, снижающий требования к видеопамяти.

image
image
image

Что произошло

Qwen разместила на Hugging Face две дообученные копии модели Qwen3.5-VL 9B, которые работают не как чат-бот, а как этап подготовки запроса внутри генеративного конвейера. После внутреннего блока размышлений каждая модель возвращает строго структурированный ответ: поле rewritten_prompt плюс wh_ratio для сценария text-to-image или ratio_follow для сценария редактирования. Спрос оказался заметным уже в первый день: версии PE-T2I и PE-I2I скачали 4604 и 876 раз соответственно. Параллельно команда Comfy-Org, репак которой ведёт Kijai, выложила файлы для ComfyUI, включая int8-квантованную версию текстового энкодера под именем qwen3.5_9b_qwen_image_2.1_pe_i2i.int8_convrot.safetensors.

Контекст

Ручное составление промптов считается слабым местом open-source генерации изображений: итоговое качество сильно зависит от умения пользователя описать сцену, причём обычно по-английски. Раньше этот навык оставался ручным: вспомогательные модели отдавали свободный текст, который нельзя надёжно распарсить и проверить автоматически. Здесь применён другой паттерн: визуально-языковая модель дообучена под узкую задачу и жёсткий формат вывода, фактически превращаясь в компилятор промптов, а машиночитаемый ответ делает её полноценным звеном конвейера, пригодным для автотестирования. Дистрибуция тяжёлых текстовых моделей через квантованные репаки Comfy-Org — уже привычный для экосистемы ComfyUI способ ставить такие компоненты на потребительские карты.

Почему это важно для индустрии

Для индустрии важен не размер модели, а контракт: строгий JSON с фиксированными полями позволяет встраивать автоулучшение промптов как промежуточный слой в продукты и агентные пайплайны без ручной обработки текста. Развёртывание описано конкретно: модель на 9B параметров влезает на одну GPU, а стек зафиксирован на vLLM 0.19.1 и transformers 5.4.0, что упрощает планирование внедрения. Это удешевляет и ускоряет генеративные пайплайны для стартапов и одновременно обесценивает ручное улучшение промптов как отдельную компетенцию или услугу. Команда получает готовый образец того, как специализация «дообученный VLM под узкий машиночитаемый контракт» оформляется внутри креативного пайплайна.

Почему это важно для пользователей

Всё необходимое уже доступно для скачивания: PE-T2I и PE-I2I лежат на Hugging Face, а int8_convrot-энкодер — в репаке Comfy-Org. Для запуска достаточно одной видеокарты: около 20 ГБ весов в bf16, комфортно на карте с 40 ГБ видеопамяти, на 24 ГБ модель стартует с параметром --max-model-len 12000. В официальном репозитории prompt_rewrite есть скрипты для vLLM-сервера и батч-обработки, а к апскейлу приложен готовый workflow. Важная оговорка: промпт в этом workflow придётся подбирать под конкретные изображения, иначе редактирование может дать артефакты.

Что пока неизвестно / ограничения

В источниках нет ни одной метрики качества переписывания: сохранение света, тона и неупомянутых деталей в PE-I2I остаётся заявлением разработчиков, а точность предсказания соотношения сторон wh_ratio — самая проверяемая часть контракта — нигде не измерена. Данных о деградации качества после int8-квантования энкодера также нет. Наконец, неизвестно, останется ли отдельный промпт-энхансер постоянной ступенью пайплайна: если базовые модели научатся нативно принимать короткие запросы на любом языке, этот слой окажется переходным этапом.

Источники

Автор

Look at AI, редакция