Группа из 35 исследователей под руководством Valentin Liévin представила ResidencyRL — метод обучения с подкреплением для клинических AI-агентов, который учит модель последовательному медицинскому рассуждению через симулированные приёмы пациентов. Работа опубликована 7 августа 2026 на arXiv (2608.07418). Агент на базе Gemini 3.5 Flash показывает улучшение точности диагноза на сложных тестах на 7 п.п. и снижение пропусков критических сигналов на 31%, однако доля оставшихся пропущенных «красных флагов» всё ещё составляет 31,5%.

image
image

Что произошло

Исследователи представили метод ResidencyRL, в котором AI-агент проходит стажировку через симулированные многотурные приёмы пациентов: до 60 ходов диалога и 8 вызовов инструментов за одну траекторию. Тренировочный набор включает 49 870 случаев телемедицины охватывающих 81 диагноз, 5000 сценариев сбора анамнеза и 2583 адверсариальных кейсов безопасности. На сложных диагностических тестах точность достигла 88% против 81% у базовой модели Gemini 3.5 Flash. Пропущенные критические вопросы снизились с 65,5% до 43,5%, пропущенные красные флаги — с 45,5% до 31,5%. Слепые эксперты-клиницисты предпочли ответы обученного агента ответам базовой модели.

Контекст

Обучение с подкреплением в симулированной среде — это относительно новый подход для клинических AI-агентов. Ранние системы обучались на текстовых корпусах или через supervised fine-tuning, что давало точечные улучшения в ответе на конкретный вопрос, но не влияло на процесс многоступенчатого рассуждения. ResidencyRL использует RL-обучение на длинных горизонтах до 60 ходов, что требует стабильного reward modelling — задачи, которая редко решается в клинических доменах. Аналогия метода с реальной медицинской ординатурой: как молодой врач проходит стажировку у наставника, так и AI-агент учится через повторяющиеся симуляции с обратной связью. Подход показал перенос навыков на внешние бенчмарки AMIE Multi-Visit, AgentClinic и CRAFT-MD.

Почему это важно для индустрии

ResidencyRL устанавливает новый baseline для multi-turn clinical reasoning agents: метод доказывает, что RL в симуляции может обучить именно процесс клинического рассуждения, а не только точечные ответы. Для исследовательского сообщества это открывает путь к репликациям на open-weight моделях вроде Llama и Qwen — если аналогичные результаты получатся на локально развёртываемых моделях, это устранит зависимость от проприетарных API. Для индустрии появляется технологический фундамент для нового класса AI-ассистентов первичной диагностики: структурированный сбор анамнеза, проверка по клиническим протоколам, документирование. Архитектура симуляция плюс RL воспроизводима для уже более узких доменов с меньшим риском, например корпоративная медицина или первичный скрининг. Для инвесторов — новый нарратив в healthtech: RL-обученные клинические агенты вместо LLM-чатботов. Прямых продуктов, API или open-source кода на текущий момент нет.

Почему это важно для пользователей

Работа показывает один из реалистичных путей обучения AI врачебному суждению через практику на симуляциях, аналогичную реальной медицинской ординатуре. В ближайшей перспективе технология может появиться как вспомогательный инструмент для врачей: структурированный сбор анамнеза на телемедицинских платформах, проверка назначений по клиническим рекомендациям, автоматическое документирование приёма. Для пациентов это может означать более качественную первичную консультацию с AI-ассистентом, который задаёт больше правильных вопросов и реже пропускает опасные симптомы. Однако до самостоятельной постановки диагнозов или лечения AI-агентом далеко — необходимы проспективные исследования с реальными пациентами, которые пока не проведены.

Что пока неизвестно / ограничения

Доля оставшихся пропущенных красных флагов составляет 31,5%, что неприемлемо для автономного клинического использования. Тренировочный набор охватывает лишь 81 диагноз — узкое подмножество реальной практики, и модель не тестировалась на out-of-domain специальностях вроде хирургии или педиатрии. Все три внешних бенчмарка (AMIE Multi-Visit, AgentClinic, CRAFT-MD) работают в том же телемедицинском домене, поэтому перенос на них подтверждает валидацию, но не гарантирует обобщения. Нет данных по задержкам, стоимости inference, стабильности на production-нагрузке. Открытого API, open-source кода или SDK нет. Проспективные исследования с реальными пациентами не проводились. Неясно, воспроизведутся ли результаты на open-weight моделях.

Источники

Автор

Look at AI, редакция