GitHub Security Lab опубликовала разбор аудита, который провёл её открытый AI-агент Taskflow Agent: инструмент нашёл и подтвердил 24 уязвимости в Android-приложениях, а адвайзори по всем находкам выложены на securitylab.github.com/ai-agents. Агент из репозитория seclab-taskflows запускается через GitHub Copilot, а результатом стали находки CVE-уровня, включая цепочку захвата местоположения в навигаторе OsmAnd с более чем 10 миллионами установок.

image
image

Что произошло

В блоге GitHub вышел разбор «How we found 24 Android vulnerabilities using our open source AI security agent»: команда GitHub Security Lab описала, как её open source AI-агент Taskflow Agent из репозитория seclab-taskflows, запускаемый через GitHub Copilot, нашёл и подтвердил 24 уязвимости в Android-приложениях. Все адвайзори по находкам собраны в отдельном индексе на securitylab.github.com/ai-agents. Под платформу адаптировали два taskflow-промпта: новый gather_mobile_entry_point_info.yaml разделяет точки входа приложения на мобильные и немобильные, а classify_application_local.yaml прогоняет каждую точку входа по списку популярных классов уязвимостей, включая confused deputy и insecure broadcasts. Самая яркая находка — в навигаторе OsmAnd: экспортированная активность MapActivity принимает intent-extras вроде SilentImport, Replace и SettingsTypes без подтверждения пользователя, из-за чего у стороннего приложения с нулевыми разрешениями открывается цепочка, позволяющая отслеживать местоположение владельца устройства.

Контекст

Taskflow Agent — это агентная надстройка GitHub Security Lab, в которой экспертная методика аудита упакована в переиспользуемые taskflow-промпты, а не в свободный диалог с моделью: прогоны выполняются в режимах strict и broad, а проверки заданы явными чек-листами классов уязвимостей. Перечень классов задаётся вручную из-за недетерминизма LLM: без явного перечня модель может пропустить нужную категорию багов, поэтому каждую точку входа проверяют по конкретным пунктам. Механика находки в OsmAnd при этом опирается на давнюю особенность Android: платформа не даёт приложению ограничить, какие extras внешний caller может положить в intent, поэтому проблемы с настройками, читаемыми из extras, известны в экосистеме задолго до появления AI-агентов и относятся к классическим exported-компонентам.

Почему это важно для индустрии

Для индустрии это редкий случай, когда агентная LLM-система подкреплена измеримым результатом, а не демо: 24 находки CVE-уровня с публичными адвайзори, зафиксированные прогоны и проверяемый машиночитаемый артефакт результата. Для AppSec-команд это готовый шаблон первой линии проверки мобильного кода: вместо узкого экспертного аудита часть exported-поверхности закрывается регулярным агентным прогоном, который можно встроить в CI. Для команд, строящих собственные агенты, это референс инженерии методологии: переиспользуемые workflow-промпты, разбивка точек входа, явные чек-листы и параллельные strict и broad прогоны компенсируют недетерминизм модели без новых архитектур, а ценность системы смещается к качеству чек-листов и трекингу фиксов. Если индекс адвайзори продолжит пополняться, корпус публичных находок напрашивается на роль бенчмарка для агентной секьюрити, а по образцу Android-адаптации вероятны taskflow-наборы для других платформ и классов багов; это ожидания, а не подтверждённые источниками данные.

Почему это важно для пользователей

Практический эффект для читателя доступен сегодня. Если вы пишете Android-приложения, проверьте exported-компоненты и особенно настройки, которые читаются из intent-extras: как показывает OsmAnd, такая схема укладывается в атаку, не требующую у злоумышленника ни одного разрешения. Собственный репозиторий можно прогнать в codespace командой ./scripts/audit/run_mobile.sh в формате myorg/myrepo: по оценкам авторов это 1–2 часа на средний репозиторий, результат читается из SQLite (таблица audit_results, колонка has_vulnerability), потребуется лицензия GitHub Copilot. Прогон можно поставить как регулярный шаг в CI и собирать отчёт по audit_results для команды. Отдельно стоит сверить свои зависимости с индексом адвайзори на securitylab.github.com/ai-agents на предмет затронутых библиотек.

Что пока неизвестно / ограничения

Основной источник — блог-пост самого GitHub о его собственном инструменте, а тред на Hacker News набрал 2 балла и 0 комментариев, то есть независимого обсуждения по материалу пока нет. Неизвестно, на скольких репозиториях были найдены эти 24 уязвимости, поэтому сравнение эффективности агента с ручным аудитом остаётся без опоры. Открытой статистики по доле ложных срабатываний и стоимости токенов на прогон в источниках нет, а без этих данных сложно обосновывать встраивание прогонов в CI. Воспроизводимость частичная: промпт-слой и скрипт аудита открыты, однако полная независимая репликация ограничена. Ожидания о переносе методики на другие платформы и роли индекса адвайзори как бенчмарка — интерпретации, а не подтверждённые факты.

Источники

Автор

Look at AI, редакция