За пять дней — с 21 по 25 сентября 2026 года — экосистема вокруг открытой модели генерации изображений Qwen Image 2.1 (7B, Alibaba Qwen) закрыла оба её главных слабых места: скорость и управляемость. Появились turbo-LoRA от Viggle и Pruna, сокращающие генерацию с 40 шагов трансформера до 4–8, единый ControlNet-Union от alibaba-pai с восемью режимами контроля и инпейнтингом, а также fix-LoRA, исправляющая битые слои базовой модели. Весь этот стек рассчитан на одну 16-ГБ видеокарту, однако независимой проверки заявленного качества дистиллятов пока нет.

image
image

Что произошло

Всё уложилось в окно с 21 по 25 сентября 2026 года. Viggle опубликовала turbo-LoRA v0.2.1 на дистилляции DMD2: репозиторий появился 22 сентября, обновление v0.2.1 вышло 24 сентября, и к концу окна у LoRA около 48 тысяч загрузок; она сокращает инференс с 40 шагов трансформера до 6 без CFG и ускоряет генерацию примерно в 5 раз. Pruna выложила официальные 5- и 8-шаговые turbo-LoRA под именем PrunaAI/Pruna-Qwen-Image-2.1 с заявленным ускорением генерации и эдита до 6.3x, сопроводив их демо-Space akhaliq/Pruna-Qwen-Image-2.1 и готовыми ComfyUI-workflow; энтузиаст NidAll отдельно сделал ComfyUI-конверсию, чинящую игнорируемый загрузчиком alpha (rank 64, alpha 128). Команда alibaba-pai в рамках проекта VideoX-Fun выпустила ControlNet-Union — единый чекпоинт около 7 ГБ, содержащий только control-ветку и объединяющий восемь режимов контроля (Canny, Depth, Grayscale, HED, Lineart, MLSD, Pose, Scribble) плюс инпейнтинг, — и 4-шаговую Acc-LoRA на дистилляции Parallel Decoding Distillation, которая сжимает 40 NFE до 4 при примерно десятикратном ускорении (arXiv:2607.26004). На Civitai при этом вышла fix-LoRA qwen-image-21-fix-v10, обученная на 475 шагах: она исправляет битые слои базовой модели и заметно улучшает режим эдита.

Контекст

Оба направления работ закрывали известные пробелы базовой модели: на старте Qwen Image 2.1 требовала 40 шагов трансформера с CFG и не имела единого инструмента структурного контроля и инпейнтинга. Дистилляция до нескольких шагов к этому моменту уже стала типовым приёмом для открытых image-моделей, поэтому параллельные релизы Viggle с методом DMD2, Pruna со своими 5- и 8-шаговыми вариантами и alibaba-pai с Parallel Decoding Distillation выглядят как отработанный конвейер, а не разовая акция. Разброс их заявленных ускорений — от примерно пятикратного до примерно десятикратного — объясняется прежде всего разными исходными конфигурациями: числом шагов и отказом от CFG, а не прямым превосходством одного метода над другим. Консолидация восьми отдельных ControlNet в один Union-чекпоинт — ожидаемый инженерный шаг: он сокращает операции ввода-вывода и экономит видеопамять, и такой формат поставки контроля, судя по практике alibaba-pai в VideoX-Fun, становится стандартным.

Почему это важно для индустрии

Главный сигнал для индустрии — темп: три независимых подхода к дистилляции и консолидированный контроль-чекпоинт появились за три-четыре дня после релиза базовой модели, то есть превращение 40-шагового генератора в 4–6-шаговый де-факто стало стандартным этапом запуска открытых image-моделей. Официальный ControlNet-Union от alibaba-pai закрывает главный пробел Qwen Image 2.1, давая структурный контроль и инпейнтинг одним чекпоинтом вместо восьми отдельных. Fix-LoRA, в свою очередь, показывает, что часть «сломанности» базовой модели локализована в узком подмножестве весов и лечится дешёвым патчем на уровне весов, а не промптов. Отсюда ожидаемый сдвиг исследовательского фокуса: сокращение шагов уже рутинизировано, поэтому внимание смещается к восстановлению качества дистиллятов — весовым патчам, абляциям и селективной дистилляции. Вероятны и сравнительные таблицы DMD2, PDD и Pruna на одной базовой модели, а разрыв между релизом модели и появлением ускорителей промышленного уровня продолжит сжиматься до дней.

Почему это важно для пользователей

Практическая выгода в том, что весь перечисленный стек рассчитан на одну 16-ГБ видеокарту: 5/8-шаговые turbo-LoRA идут с готовыми ComfyUI-workflow JSON, ControlNet-Union даёт контроль поз и контуров плюс инпейнтинг, а MTP-энхансер промптов под MIT-лицензией ускоряет подготовку промптов в 1.36–1.67x, требуя около 9.5 ГБ весов PE (prompt enhancer) и ещё 0.5 ГБ под MTP-голову. Есть и heretic-GGUF-версии PE без цензуры, и готовый workflow генерации character sheet по одному фото — полученный лист пригоден как референс для видео-моделей вроде Seedance 2.5 и MiniMax Hailuo H3. Порог входа упал до часов: вместо сборки пайплайна с нуля достаточно взять готовые workflow, демо-Space и конверсии — облако и дорогое железо для этого не нужны.

Что пока неизвестно / ограничения

Независимой оценки сохранения качества у трёх дистиллятов пока нет: «почти то же качество» — формулировка вендора, а деградация плотного мелкого текста у 4-шаговых версий уже зафиксирована в самих источниках. Руки у fix-LoRA остаются ненадёжными, значит остаточные дефекты базовой модели не сводятся к одному исправленному слою весов. Прямые сравнения качества от разных пользователей стоит читать с осторожностью из-за тихих несовместимостей уровня загрузчика, как в случае с игнорируемым alpha у turbo-LoRA Pruna. Наконец, MTP-энхансеру промптов нужно около 14–16 ГБ видеопамяти, то есть на 16-ГБ карте он работает на пределе вместе с остальным стеком.

Источники

Автор

Look at AI, редакция