Philipp Emanuel Weidmann (p-e-w), создатель инструмента Heretic для автоматического удаления цензуры из языковых моделей, опубликовал публичное предупреждение в r/StableDiffusion: модели, обработанные Heretic через метод directional ablation, непригодны в качестве текстовых энкодеров для генеративных моделей изображений и видео — MiniMax H3, Stable Diffusion, Flux и других.

image
image

Что произошло

Weidmann в своём посте-PSA разъяснил техническое ограничение метода. Heretic модифицирует внутренние резидуальные векторы LLM с помощью направленной абляции (directional ablation / SOMA), заставляя потенциально «вредные» запросы проецироваться в область «безопасных» представлений. Это не обогащает эмбеддинги дополнительными деталями и не делает их более графичными — оно искажает их. Диффузионные модели получают слегка изменённые текстовые эмбеддинги, на которых они не обучались, что закономерно снижает соответствие промпту и вызывает визуальные артефакты. Автор подчёркивает: «it will never, ever remove censorship from the output». Единственный рабочий сценарий применения Heretic-моделей — LLM-базированные prompt enhancer, которые блокируют запрос до передачи в диффузионный генератор, где модификация не участвует в pipeline эмбеддингов.

Контекст

Heretic — инструмент полностью автоматического удаления цензуры из языковых моделей, исходный код открыт на GitHub (p-e-w/heretic). Метод SOMA (directional ablation) воздействует на остаточные-stream представления LLM на уровне архитектуры, а не на уровне фильтров вывода. Коллекция The Bestiary на HuggingFace содержит десятки децензор-моделей, созданных с помощью Heretic, включая модифицированные версии Qwen3-VL и Gemma. Эти модели стали популярны в сообществе, и пользователи начали экспериментировать с ними как с текстовыми энкодерами в ComfyUI-воркфлоу для H3 от MiniMax, Flux, SDXL и Krea 2. Публикация Weidmann — редкий случай, когда создатель инструмента публично и технически обоснованно закрывает популярный misuse. Отказ H3 от генерации по определённым промптам обусловлен отсутствием соответствующих знаний в обучающих данных, а не фильтром безопасности — замена текстового энкодера это не исправит.

Почему это важно для индустрии

Для экосистемы open-source генерации это важное техническое разъяснение границ метода SOMA/directional ablation. Разработчики диффузионных моделей и pipeline-инструментов (ComfyUI и аналоги) получат формальный сигнал о несовместимости модифицированных LLM-энкодеров. Ожидается, что в будущем разработчики начнут документировать совместимость текстовых энкодеров на уровне API и весов, а появятся eval-протоколы, проверяющие не только safety benchmarks, но и downstream качество эмбеддингов для cross-modal задач. Для стартапов и проектов, которые строились на идее «heretic-энкодер = лучше», это короткий noise-риск, требующий пересмотра архитектуры воркфлоу.

Почему это важно для пользователей

Если вы используете Heretic-версии моделей (Qwen3-VL, Gemma) как текстовые энкодеры в ComfyUI для H3, Flux, SDXL или Krea 2 — это не разблокирует цензуру и ухудшит качество генерации. Переключение обратно на оригинальные текстовые энкодеры сэкономит VRAM и время инференса без потери качества. Heretic-модели остаются релевантными только в одном сценарии: как LLM-prompt enhancer, который фильтрует запросы до передачи в генератор, где модификация резидуальных векторов не влияет на пайплайн эмбеддингов диффузионной модели.

Что пока неизвестно / ограничения

Технический анализ Weidmann фокусируется на практической несовместимости, но методологическая граница метода directional ablation остаётся недоизученной в контексте cross-modal задач. Нет независимых бенчмарков, количественно оценивающих степень деградации prompt adherence при использовании модифицированных эмбеддингов в различных диффузионных моделях. Неясно, насколько сильно эффекты зависят от конкретной комбинации LLM и диффузионной модели — результаты могут варьировать между Flux, SDXL и H3.

Источники

Автор

Look at AI, редакция