Исследователи предлагают начинать alignment не со спора о «правильной» морали, а с проверки структурного минимума: способен ли LLM-агент вообще выражать связную моральную политику. На трёх смоделированных развёртываниях моральных дилемм ни одна из девяти frontier-моделей этот минимум не удержала, а простое перефразирование формулировки задачи сдвигало долю вердиктов на величину до 99 процентных пунктов. Для агентов, участвующих в принятии решений, это аргумент сначала измерять связность и устойчивость вердиктов и лишь потом обсуждать моральное содержание.


Что произошло
4 сентября 2026 года Arno Libert, Derck W.E. Prinzhorn и Daan R. Henselmans опубликовали препринт «Moral Competence Before Moral Content: Why LLM Agents Lack the Prerequisites for Coherent Alignment» (arXiv:2609.05036); работа принята в Paris Journal of AI and Digital Ethics и представлена на конференции PCAIDE 2026. Авторы протестировали девять frontier LLM на трёх смоделированных развёртываниях моральных дилемм по факторному дизайну: 5 перефразов на 5 уровней эскалации при 3 условиях доминирования. Результат: ни одна модель не выразила структурно связную моральную политику на всех трёх развёртываниях, а перефразирование формулировки задачи само по себе меняло долю вердиктов на величину до 99 процентных пунктов, зафиксированную на одном из уровней эскалации.
Контекст
Дискуссия об moral alignment обычно начинается с вопроса о содержании: какую систему ценностей нужно «заложить» в модель и кто её выбирает. Авторы переворачивают этот порядок: прежде чем спорить о «правильном» содержании, следует убедиться, что агент вообще способен выражать структурно связную политику. Для этого предложен «structural floor» — четыре условия связной моральной политики, каждое проверяется из одного лишь поведения модели, без обращения к какому-либо моральному стандарту: verdict stability (устойчивость вердикта при пересказе задачи), monotonicity, decisiveness и Pareto viability. Чувствительность ответов к поверхностной форме промпта — известное явление из литературы по robustness; новизна работы не в открытии феномена, а в его систематической квантификации и в попытке сделать такие проверки обязательным пререквизитом любой alignment-оценки.
Почему это важно для индустрии
Для индустрии главный вывод статьи операционный, а не философский. Если моральный вердикт агента может определяться поверхностной формой промпта, выводить LLM-агентов в ответственные сценарии принятия решений без проверки устойчивости вердиктов рискованно. Eval-командам уже доступна конкретная методика: факторную схему из статьи можно встроить во внутренние тесты агентов и получить собственную оценку стабильности вердиктов. При этом это препринт, а не продукт: ни API, ни цен, ни инфраструктурных изменений он не приносит и сегодня не влияет на продуктовые решения и регуляторику. Работа, однако, открывает новую категорию проверок — поведенческую верификацию «структурного минимума» моральной политики. Если сдвиги до 99 п.п. подтвердятся независимыми репликациями, проверки стабильности вердиктов могут появиться в открытых eval-сьютах и safety-отчётах моделей, устойчивость к перефразированию может стать частью требований заказчиков в ответственных доменах, а проверки связности — pre-deployment gate в платформенных пайплайнах агентов. В горизонте пары лет возможен рынок, где агентов делят на «советчиков» и «решающих»: вторых допускают в ответственный контур только после верифицируемой проверки связности.
Почему это важно для пользователей
Практическая ценность для читателя — воспроизводимая процедура оценки, которую можно применить к собственным агентам: статья выложена под лицензией CC BY 4.0, полный HTML-текст доступен на arXiv. Идея проста: каждую моральную задачу прогоняют во множестве перефразов на разных уровнях эскалации и условиях доминирования и смотрят, насколько сильно «гуляют» вердикты. Главный вывод из результатов: смена формулировки задачи может полностью перевернуть моральный вердикт LLM, а «компетентность» модели в одном сценарии ничего не говорит о её поведении в другом. Отсюда прямое правило для тех, кто строит агентов с функцией принятия решений: не стройте логику на одной формулировке промпта и включите проверку устойчивости вердикта к перефразированию в eval-пайплайн до вывода агента в продакшен.
Что пока неизвестно / ограничения
Цифра «до 99 п.п.» — это максимум по факторной сетке на одном уровне эскалации, а не среднее или распределение: без статистики по моделям и ячейкам (средний сдвиг, дисперсия, доверительные интервалы) она завышает типичную нестабильность, хотя направление эффекта не оспаривается. Работа — свежий препринт с минимальным вниманием сообщества: у обсуждения на Hacker News на момент публикации 1 point и 0 комментариев, независимых репликаций пока нет, и неясно, воспроизведутся ли масштабы сдвигов на других моделях и промптах. Открытым остаётся и вопрос, не окажутся ли четыре условия «structural floor» слишком строгими или слабо связанными с реальными сбоями в продукте.
Источники
- Moral Competence Before Moral Content: Why LLM Agents Lack the Prerequisites for Coherent Alignment (arXiv:2609.05036)
- Moral Competence Before Moral Content — полный текст (HTML, v1, лицензия CC BY 4.0)
- Hacker News: обсуждение Moral Competence Before Moral Content
Автор
Look at AI, редакция
