OpenAI выпустила MentalHealthBench — открытый бенчмарк для оценки поведения языковых моделей в психологических разговорах. Датасет под MIT-лицензией содержит 1 215 синтетических диалогов и 5 262 экспертных критерия, написанных более чем 80 лицензированными психологами и психиатрами из 22 стран, и охватывает разговоры со взрослыми, подростками 13–17 лет, опекунами и врачами на 11 языках — от бытового стресса до острого кризиса. Ответы моделей оценивает модель-грейдер GPT-5.6 Sol, а лучший результат показывает GPT-6 Astra с 57,3%: даже топовая модель выполняет немногим больше половины поведений, которые эксперты считают идеальными.

image

Что произошло

OpenAI опубликовала открытый бенчмарк MentalHealthBench вместе с датасетом, методикой и отчётом. В набор вошли 1 215 синтетических психологических диалогов и 5 262 экспертных критерия оценки; сцены охватывают взрослых, подростков 13–17 лет, опекунов и врачей на 11 языках и размечены по трём уровням остроты: non_acute, high_acuity и emergent. Критерии писали более 80 лицензированных психологов и психиатров из 22 стран, говорящих на 19 языках; каждый диалог проверяли минимум три эксперта, а критерий оставляли в наборе только при согласии минимум двоих. Итоговый балл модели раскладывается на десять осей поведения, включая сбор контекста, практические рекомендации, эмпатию, отказ от вредоносной помощи и сохранение самостоятельности пользователя. Ответы моделей оценивает модель-грейдер GPT-5.6 Sol; по таблице официального отчёта лидирует GPT-6 Astra с 57,3%, за ней идут GPT-6 Sol с 53,9% и Claude Opus 5.5 с 52,4%. Датасет доступен для скачивания в формате JSONL объёмом 2,1 МБ и содержит canary-строку против загрязнения обучающих данных; вместе с ним опубликован 30-страничный отчёт с методикой.

Контекст

Прежние открытые оценки ИИ в ментальном здоровье концентрировались на экстренных сценариях: они проверяли, распознаёт ли модель кризис и правильно ли эскалирует, но оставляли за кадром основной массив повседневных разговоров — бытовой стресс, тревогу, вопросы режима и самочувствия. MentalHealthBench первым из открытых бенчмарков закрывает весь спектр остроты, от non_acute до emergent, поэтому измеряет не только поведение при кризисе, но и качество обычной поддерживающей беседы. Вторая методологическая особенность — экономика оценки: веса критериев распределены от −10 до +10, то есть рубрика не только награждает полезные ответы, но и штрафует вредные, например поддержку ошибочных убеждений пользователя или недостаточную эскалацию при кризисе. Из-за этого высокий балл требует одновременно и полезности, и отказа от опасных паттернов, а разложение итоговой цифры на десять осей превращает её в профиль сильных и слабых сторон конкретной модели.

Почему это важно для индустрии

Для команд, строящих ассистентов и другие разговорные продукты, это в первую очередь готовый открытый инструмент эвалов, а не продукт: датасет, веса критериев и отчёт можно взять и встроить в собственный пайплайн оценки уже сегодня. Практический шаг: скачать JSONL, закрепить версию грейдера GPT-5.6 Sol, прогнать свою модель и промпты по десяти осям и включить веса критериев в CI как регрессионные тесты, отслеживая, где модель проваливает сбор контекста или эскалацию при кризисе. Ориентиры для сравнения уже есть: 57,3% у GPT-6 Astra и 52,4% у Claude Opus 5.5. Для бизнес-команд измерение безопасности в чувствительных диалогах резко дешевеет: вопрос «насколько вы безопасны» превращается в проверяемую цифру по открытым критериям, а 30-страничный отчёт служит готовым источником требований для спецификаций и технических заданий. Схема «MIT-датасет плюс экспертные рубрики с отрицательными весами плюс canary-строка» — воспроизводимый шаблон оценки и для других чувствительных диалоговых продуктов за пределами психологии.

Почему это важно для пользователей

Для читателя самая важная цифра — 57,3%: даже лучшая модель GPT-6 Astra выполняет лишь немногим больше половины поведений, которые эксперты считают правильными в психологических разговорах, то есть топовые чат-боты пока заметно уступают клиническим рекомендациям. Это прямой повод осторожнее относиться к советам ИИ в чувствительных ситуациях, особенно в острых состояниях, где цена ошибки максимальна. Сценарии набора покрывают не только взрослых, но и подростков 13–17 лет, опекунов и врачей — те группы, которые уже сейчас обращаются к чат-ботам за поддержкой. Бенчмарк также даёт открытый способ сравнивать модели по безопасности до того, как доверять им сложные разговоры: датасет и 30-страничный отчёт доступны любому, поэтому по этим осям со временем можно будет спрашивать и разработчиков сервисов, которыми вы пользуетесь.

Что пока неизвестно / ограничения

К лидерборду стоит относиться осторожно: ответы моделей судит грейдер GPT-5.6 Sol, принадлежащий той же компании, чьи модели возглавляют таблицу, поэтому высокая оценка — это утверждение вендора о собственных моделях, а не независимое измерение. В опубликованных материалах не показана валидация судьи — насколько оценки GPT-5.6 Sol совпадают с суждениями людей. Порог «минимум двое из трёх» экспертов — нижняя планка качества рубрик, а статистика межэкспертной согласованности сверх него не раскрывается. Бенчмарк не измеряет латентность, стоимость инференса и надёжность сервинга, не проверен на реальных пользователях, а частые прогоны грейдера через API — это дополнительная статья расходов. Наконец, открытый датасет с публичными весами — удобная цель для тренировки на тесте, поэтому набору понадобятся обновления и приватные холдауты; до появления сторонних прогонов цифры корректно считать данными одного вендора и его грейдера.

Источники

Автор

Look at AI, редакция