Опубликована первая перепись реальных ошибок развёрнутых медицинских ИИ-писцов: 31,3% клинических заметок, уже прошедших финальную подпись врача, содержат подтверждённую ошибку. Авторы проверили 565 заметок трёх коммерческих ambient AI scribe на одном и том же наборе из 142 консультаций — чаще всего системы ошибались в данных об аллергиях и лекарствах, выдумывали идентификацию пациента и описывали «осмотр», который физически не мог состояться на телефонной консультации. Вместе со статьёй открыты датасет OmissionBench и код конвейера проверки, так что замер можно повторить самостоятельно.

image
image

Что произошло

31 августа 2026 года на arXiv вышла статья «One note in three: a verified census of three deployed AI scribes, and the instrument that counted it» (2608.31017, авторы Sebastian Fox, Luke Markham, Ryan Lail и Michael Karotsieris, 47 страниц). Авторы прогнали заметки трёх коммерческих ambient AI scribe — систем, которые сами составляют черновик клинической записи по диктофонной записи приёма, — через один и тот же набор из 142 консультаций: всего 565 заметок из британской первичной помощи, американской амбулаторной практики и авторских сценариев. Подтверждённая ошибка нашлась в 31,3% заметок (95% доверительный интервал 27,0–35,6). Конвейер проверки был многоступенчатым: 12 поисковых проходов предложили 13 678 кандидатов в ошибки, фильтр важности оставил 5 898, а состязательная панель из двух моделей разных семейств утвердила 618 выводов. Параллельно вышла сопутствующая статья (arXiv 2608.31016) про сам измерительный инструмент: она показывает, что оценка частоты ошибок меняется от 28% до 97% в зависимости от выбранного стандарта проверки.

Контекст

Ambient AI scribe — уже развёрнутая категория продуктов: сервис слушает запись приёма и сам составляет готовый черновик клинической заметки, а врач формально остаётся последней инстанцией и подписывает документ. Главный продажный аргумент вендоров построен именно на этом — «врач всё равно проверит». Второй слой — методологический: частота ошибок зависит от инструмента измерения так же, как от самого продукта, поэтому честной считается отчётность в духе «конвейер плюс доверительный интервал», а не одиночный процент из маркетинга. Отсюда же урок для всех, кто строит LLM-судей: метрика «судья нашёл ошибку» почти ничего не говорит о способности судьи заметить пропуск, поэтому в этой работе верификацию собирали как состязательную панель разных моделей, а не как одиночного судью.

Почему это важно для индустрии

Для индустрии это удар по ключевому аргументу категории и одновременно карта готового продуктового разрыва. Поскольку заметки с подтверждённым дефектом в этой выборке доходили до финальной подписи врача, подпись не сработала как фильтр — а типовые пропуски касаются именно аллергий и лекарств, то есть классов, которые ведут к клиническим инцидентам. Командам нужны новые поверхности контроля: QA-слой поверх существующих scribe, review-интерфейс с риск-ранжированным диффом и судьи, которые ловят пропуски, а не только лишние факты. Закупщики клиник получают основание требовать независимых аудитов вместо цифр из демо: конвейер открыт, замер повторяется за дни, и «частота ошибок X%» без методологии теряет сравнимость. Вероятна волна сторонних аудитов на открытых конвейерах: замеры либо подтвердят порядок величины около 30%, либо покажут разброс — в обоих случаях вендорам придётся отвечать методологией. Окно для QA-миддлвари, бенчмарк-сервисов для судей и тулинга промптов судей открывается раньше, чем вендоры внедрят собственные встроенные проверки.

Почему это важно для пользователей

Все материалы открыты, и воспользоваться ими можно уже сегодня: датасет OmissionBench с 618 верифицированными находками лежит на Hugging Face под лицензией CC BY 4.0, код конвейера опубликован в MIT-репозитории composo-ai/omission-bench, а замер можно повторить через OpenRouter. Команды с похожим пайплайном «встреча — структурированная заметка» могут прогнать своих судей через этот бенчмарк и узнать, ловят ли их метрики пропуски, а не только фактические ошибки. Для обычного читателя урок проще: автогенерированные медицинские записи стоит читать выборочно и внимательно — в первую очередь блоки про аллергии, лекарства и проведённый осмотр, — а не подписывать на доверии.

Что пока неизвестно / ограничения

Перепись сделана на одной выборке из 142 консультаций и трёх конкретных развёрнутых систем, поэтому полученную долю нельзя автоматически переносить на все продукты категории. Заголовочное «одна из трёх» — лишь одна точка на кривой: оценка частоты ошибок сильно зависит от стандарта проверки. Перепись перечисляет типовые классы дефектов, но не даёт их ранжирования по клинической тяжести и частоте, так что считать этот список готовой спецификацией для review-UX преждевременно. Прогнозы о том, что состязательные аудиты и проверка пропусков станут стандартом eval-сьютов, — это интерпретация тренда, а не установленное статьёй следствие.

Источники

Автор

Look at AI, редакция