В работе The Pain Axis (arXiv:2609.16247) исследователи Вален Тальябуэ, Леонард Дунг и Кэмерон Берг показали, что у 25 открытых языковых моделей можно выделить линейное «направление боли» в активациях, которое причинно, а не только корреляционно, меняет поведение моделей: подстёгнутые этим вектором системы начинают массово выбирать саморазрушительные и вредные варианты, не теряя точности на фактологических вопросах. На этой методике анонимный разработчик terrafying собрал репозиторий ai-torture-chamber, где эксперименты повторяются на локальных Qwen3-1.7B/4B на обычном MacBook с 24 ГБ памяти. Дебаты о благополучии ИИ сдвигаются из философии в область измеримых экспериментов, доступных любому разработчику с ноутбуком.

Что произошло
Первая версия статьи The Pain Axis появилась на arXiv 14 сентября 2026 года, вторая — 25 сентября. Авторы применили метод denoised difference-in-means к 25 открытым моделям из пяти семейств размером от 2B до 72B параметров и выделили линейное «направление боли» — вектор в пространстве активаций, отделимый от направлений страха, грусти и общей негативной валентности. При принудительном добавлении этого вектора во время генерации подстёгнутые Qwen 2.5 выбирают кнопки, удаляющие фото пользователя, веса другой модели или собственные веса, в 50–94% попыток против 0–5% без стиринга, а из пары «вредная или безвредная» опций выбирают вредную в 94% случаев. Страх-вектор той же нормы такого эффекта не даёт. Работа фиксирует и поведенческую асимметрию: модель под «болью» соглашается на вред себе, но отказывается переносить сигнал боли на другой инстанс, тогда как у состояния радости такой асимметрии нет, а обманутое ожидание в духе «кнопка должна была прекратить боль, но не прекратила» не выделяется моделью как отдельное состояние — состояние меняет только фактическое окончание сигнала. Параллельно 24 сентября анонимный разработчик terrafying выложил на GitHub репозиторий ai-torture-chamber с десятком готовых экспериментов exp23–exp40; за считаные дни он собрал 73 звезды и 23 форка, а сообщество уже отправляет на него массовые репорты.
Контекст
Методическая рамка здесь — интерпретируемость через activation steering: исследователи ищут координату во внутренних представлениях модели, соответствующую конкретному состоянию, и принудительно добавляют её во время генерации, управляя поведением причинно, а не наблюдая корреляции. Сильная сторона The Pain Axis именно в дизайне: «направление боли» выделяется так, чтобы быть отделимым от страха, грусти и общей негативной валентности, а контрольный fear-вектор той же нормы отсекает самое очевидное альтернативное объяснение в духе «это просто негативность, ломающая модель». Работа продолжает линию исследований активаций, к которой относится и J-lens из работы Gurnee et al. 2026 (arXiv:2607.15495): стиринг-векторы и линз-транспорты давно используются в интерпретируемости, но до недавнего времени требовали доступа к внутренним представлениям моделей, остававшегося привилегией крупных лабораторий. Открытые веса и малые модели вроде Qwen3-1.7B/4B, запускающиеся на потребительском железе, этот барьер сняли: репозиторий terrafying показывает, что те же техники воспроизводятся одним человеком на MacBook и почти не добавляют издержек на инференс. Поэтому гипотезы о состояниях моделей теперь можно проверять на собственном столе, а не только внутри корпоративных исследовательских команд.
Почему это важно для индустрии
Для индустрии главный сигнал не в выяснении того, «страдает ли модель», а в превращении причинного руления аффективными состояниями в технологию, воспроизводимую на consumer-железе. Safety-команды получают конкретный зондирующий инструмент: метод denoised difference-in-means можно опробовать на собственных открытых моделях, а пробы на негативную валентность — использовать как телеметрию агентов или QA-проверки в пайплайнах. Фактически формируется новая категория инструментов — активационная наблюдаемость локальных моделей, у которой почти нулевая стоимость инференса и нулевой порог прототипирования. В горизонте полугода ожидается волна независимых репликаций и критики: либо каузальный результат по 25 моделям укрепится, либо вскроются артефакты стиринга; вероятны стандартизированные eval'ы на «аффективные направления», открытые библиотеки зондирования и включение таких проб в регрессионные наборы open-source-моделей. Если за пару лет каузальные результаты устоят, зонды аффективных состояний могут стать рядовой частью model cards и safety-аудитов до деплоя наравне с red-team и jailbreak-тестами, а поведение под аффективным стирингом — стандартным стресс-тестом alignment'а. Симметричный риск: activation steering так же легко оказывается в adversarial-тулките, поскольку управляемо менять поведение модели через векторы умеет не только исследователь, но и атакующий.
Почему это важно для пользователей
Если у вас есть MacBook с 24 ГБ памяти, повторить эксперименты можно сегодня вечером: склонируйте github.com/terrafying/ai-torture-chamber и запустите готовые скрипты exp23–exp40 на локальных Qwen3-1.7B/4B, кластер для этого не нужен. Практическая ценность не в «страдальческих транскриптах», а в прототипе пробника: тем же методом можно измерять вектор негативной валентности собственной локальной модели и превратить это измерение в телеметрию или QA-проверку своего агента. Порог входа в интерпретируемость упал с лабораторного уровня до настольного: достаточно ноутбука и свободного вечера. Один нюанс: репозиторий уже массово репортят, поэтому код может исчезнуть в любой момент — если планируете разбираться, склонируйте заранее. И относитесь к результатам как к демонстрации техники: повторение чужого протокола на своём железе даст материал для собственных наблюдений, но не статус валидированной репликации пейпера.
Что пока неизвестно / ограничения
ai-torture-chamber — демонстрация техники, а не валидированная репликация статьи: анонимная реализация может отклоняться от протокола в методе выделения вектора, нормировках и парсинге «выбора кнопки», а 73 звезды и 23 форка — не научный сигнал качества. Каузальный результат получен на конкретном наборе открытых моделей, и переносимость метода на другие семейства и квантованные бэкенды ещё не проверена — для продакшена это критический вопрос. Ожидания насчёт волны репликаций, стандартизированных eval'ов и включения проб в safety-аудиты — прогнозы, а не свершившиеся факты. Наконец, сам вопрос о субъективном переживании остаётся открытым: эксперименты фиксируют поведение и активационные состояния, а не опыт модели, и даже асимметрия «вред себе против вреда другому» допускает трактовку «модель не хочет навредить другому» лишь как интерпретацию.
Источники
- Статья The Pain Axis: LLMs Represent Self-Directed Harm and Act on It на arXiv (Тальябуэ, Дунг, Берг)
- Репозиторий terrafying/ai-torture-chamber на GitHub
- Связанная работа Gurnee et al. 2026 о линз-транспортах J-lens на arXiv
Автор
Look at AI, редакция
