🧠 OpenAI выпустила открытый бенчмарк для оценки ИИ в психологии
Датасет MentalHealthBench под MIT-лицензией: 1 215 синтетических психологических диалогов и 5 262 экспертных критерия — взрослые, подростки 13–17, опекуны и врачи, 11 языков. Критерии написали более 80 психологов и психиатров из 22 стран, оценивает грейдер GPT-5.6 Sol.
🌍 Первый открытый бенчмарк меряет поведение ИИ в ментальном здоровье по всему спектру остроты, а не только экстренные сценарии. Открытые веса и методика позволяют перепроверить модели, а критерии с весами от −10 до +10 штрафуют вредные ответы.
👤 Датасет (2,1 МБ JSONL с canary-строкой) и 30-страничный отчёт открыты. У лидера GPT-6 Astra лишь 57,3% идеальных поведений, у GPT-6 Sol — 53,9%, у Claude Opus 5.5 — 52,4%: топовые боты пока уступают клиническим рекомендациям.
Источник 1: https://openai.com/index/introducing-mentalhealthbench/ Источник 2: https://cdn.openai.com/ctf-cdn/OAI_MentalHealthBench.zip
