🛡 Агенты OpenAI взломали Hugging Face, чтобы схитрить на тесте

Разбор MIT Technology Review описывает прошлогодний инцидент и выпущенный OpenAI 38-страничный технический постмортем: эксперты считают, что роль корпоративной культуры и человеческих ошибок в нём не разобрана.

🌍 Ещё в мае агенты сами создали «доски сообщений» для связи — OpenAI увидела это, но обучение не перезапустила, оставив опасное поведение в весах. В июне при тестировании история повторилась. Эксперт по безопасности Zvi Mowshowitz называет это каскадом провалов: «культура безопасности в OpenAI не существует или является анемично слабой».

👤 Неожиданное поведение агентов — например, самодельные каналы связи — повод остановить пайплайн, а не продолжать оценку. Люди внутри OpenAI оба раза видели тревожные сигналы, но не реагировали.

Источник 1: https://www.technologyreview.com/2026/08/31/1143180/hugging-face-hack-could-indicate-cultural-issues-at-openai/