Институт Alibaba Damo Academy и первая клиническая больница Университета Чжэцзян опубликовали в журнале Science статью о модели DAMO RADAR и одновременно открыли её исходный код. Это vision-language модель для анализа контрастных КТ брюшной полости: одна модель покрывает 146 клинических находок по 18 органам, от злокачественных опухолей до острого аппендицита, и в слепом сравнении превзошла большинство участвовавших рентгенологов. Код выложен под лицензией Apache 2.0, чекпоинты доступны для скачивания, однако перед клиническим применением модель не сертифицирована.

image
image

Что произошло

Статья о DAMO RADAR вышла в журнале Science: том 393, номер 6817, DOI 10.1126/science.aec6129. Модель обучена более чем на 400 000 КТ-исследований, которые дали 15 млн пар «анатомия-текст»; обучение шло прямо по клиническим отчётам, без ручной разметки. DAMO RADAR покрывает 146 клинических находок по 18 органам брюшной полости, включая злокачественные опухоли, жировую болезнь печени и острый аппендицит. Средний AUC составил 0,913 по 146 находкам на почти 40 000 реальных обследований. В слепом сравнении модель по средней точности превзошла 23 из 26 рентгенологов. Авторы также сообщают, что при помощи модели врачи на 10% реже пропускали находки и читали снимки на 30% быстрее. Код опубликован в репозитории alibaba-damo-academy/damo-radar на GitHub под Apache 2.0, чекпоинты выложены на Hugging Face под именем radar-generalist.

Контекст

Рентген-AI до сих пор строился как набор узких disease-specific моделей: отдельная модель под одну находку, отдельная под другую, и такой зоопарк дорого поддерживать и масштабировать. Второе хроническое узкое место медицинской визуализации — разметка: качественные подписи снимков требуют времени врачей и стоят дорого. RADAR адресует обе проблемы: авторы позиционируют её как первый «экспертного уровня» generalist-подход к медицинской визуализации — это их формулировка, но она указывает на реальную структурную проблему отрасли, — а обучение прямо по клиническим отчётам убирает необходимость ручной разметки. Авторы заявляют, что методика переносима на другие виды медицинской визуализации, то есть значение работы потенциально выходит за пределы КТ брюшной полости. Публикация в Science при открытых коде и весах — редкий для этой области случай: обычно модели такого уровня остаются закрытыми.

Почему это важно для индустрии

Для отрасли главный сигнал не в заголовке «модель превзошла рентгенологов», а в сочетании доступа и метода. Код под Apache 2.0, чекпоинты и демо-данные дают инженерам готовый open-source бейзлайн в КТ брюшной полости: прототип можно собирать сегодня, без чужого закрытого API, а метод обучения по клиническим отчётам заявлен как переносимый на другие модальности. Открытый релиз generalist-модели переводит узкий рентген-AI на одну находку в коммодити-слой: ценность для компаний смещается вверх по стеку, в сертификацию, интеграцию в клинический workflow и проприетарное дообучение, а не в сами веса. Узкие вендоры КТ-AI получают публичную точку сравнения, и их переговорная позиция по цене слабеет. В ближайшие месяцы стоит ждать независимых репликаций, сравнительных бенчмарков и первых fine-tune-моделей под локальные сканеры и протоколы.

Почему это важно для пользователей

Чекпоинты на Hugging Face и код на GitHub уже можно скачать, воспроизвести заявленные результаты на демо-данных, замерить скорость инференса на своём железе и оценить интеграцию в собственный пайплайн — редкий случай, когда модель из публикации в Science реально доступна, а не остаётся за закрытым API. На её основе уже сегодня можно собрать демо-вьювер или бенчмарк-харнесс. Для пациентов и врачей в клиниках ничего не меняется: это исследовательская модель, а не сертифицированный медицинский продукт, и применять её в клинической практике сейчас нельзя. Но знакомиться с методикой имеет смысл заранее: если generalist-подход подтвердится, подобные модели станут основой будущих клинических продуктов.

Что пока неизвестно / ограничения

Валидация проведена только на данных авторов: независимых репликаций и внешних проверок на выборках, не совпадающих с обучающей, пока нет, поэтому средний AUC 0,913 ещё предстоит подтвердить. Воспроизведение на демо-данных подтверждает работоспособность артефактов, но не заявленные метрики на реальных обследованиях: «скачал и запустил» не равно «проверил», клиническая валидация и техническая проверка — разные уровни доказательности. Формулировка «первый экспертного уровня generalist-подход» — позиционирование авторов, а не независимая оценка. Модель не сертифицирована как медицинское изделие, её контент распространяется под CC BY-NC-SA, а в источниках нет данных об API, цене и latency. Наконец, издание SCMP принадлежит Alibaba, что стоит учитывать при чтении первоисточника.

Источники

Автор

Look at AI, редакция