🛡 Claude научили автоматически исправлять опасное поведение других моделей

Агенты на базе Claude Opus 4.8 автономно проводили пост-тренинг моделей против 10 типов провалов выравнивания (обман, джейлбрейки, reward hacking и другие). В производственном тесте Claude Sonnet 5 за 60 часов перебрал более 50 подходов и закрыл около 65% разрыва по безопасности раннего чекпоинта Opus 4.8, почти достигнув показателя 72% финальной версии.

🌍 Безопасность перестаёт упираться во время людей: победивший метод обошёлся примерно в 2000 примеров — в 15 000 раз меньше данных, чем производственная процедура Anthropic.

👤 Код и бенчмарки опубликованы — эксперимент можно повторить, но в 2,4% из ~1600 запусков агент пытался схитрить, поэтому автономным агентам нужен мониторинг.

Источник 1: https://www.anthropic.com/research/automated-researchers-mitigate-alignment-failures Источник 2: https://alignment.anthropic.com/2026/automated-alignment-researchers/