🤖 У LLM-агентов нет связного морального основания

Arno Libert, Derck W.E. Prinzhorn и Daan R. Henselmans опубликовали работу (arXiv:2609.05036, Paris Journal of AI and Digital Ethics): alignment стоит начинать не со спора о «правильной» морали, а с проверки четырех условий — стабильности вердикта, монотонности, решительности, парето-жизнеспособности. На девяти frontier LLM в трех сценариях моральных дилемм ни одна модель не дала связной политики.

🌍 Перефразировка формулировки сдвигала долю вердиктов на до 99 процентных пунктов, а успех в одном сценарии не предсказывает результат в другом.

👤 В статье (CC BY 4.0, доступен HTML-текст) описана воспроизводимая схема оценки: 5 перефраз, 5 уровней эскалации, 3 условия доминирования, — её можно применить к собственным агентам.

Источник 1: https://arxiv.org/abs/2609.05036 Источник 2: https://arxiv.org/html/2609.05036v1