Представлен DeepSWE — специализированный бенчмарк для оценки способности продвинутых AI-агентов решать сложные и долгосрочные задачи программной инженерии. В отличие от традиционных тестов, DeepSWE фокусируется на реальных инженерных циклах в защищенных от утечек данных репозиториях.

Что произошло
Разработан бенчмарк DeepSWE, использующий 113 уникальных задач из 91 репозитория. Тестирование проводится в условиях contamination-free, что исключает эффект заучивания ответов. Согласно лидерборду версии 1.1, лучшим результатом обладает модель gpt-5.6-sol с показателем Pass@1 73%, за ней следует claude-fable-5 (70%) и наиболее экономичная gpt-5.6-luna (67%).
Контекст
Существующие бенчмарки для AI-кодинга сталкиваются с проблемой насыщения, когда разрыв в результатах между топовыми моделями становится статистически незначимым. Кроме того, многие тесты проверяют лишь умение писать отдельные функции, не учитывая способность модели работать с крупными кодовыми базами и вносить изменения в архитектуру нескольких файлов одновременно.
Почему это важно для индустрии
DeepSWE предоставляет инструмент для точной дифференциации AI-агентов, позволяя компаниям выбирать модели, способные к долгосрочному планированию и автономному исследованию репозиториев. Это стимулирует переход от разработки простых инструментов помощи (Copilots) к созданию полноценных автономных AI-инженеров, способных самостоятельно закрывать сложные тикеты.
Почему это важно для пользователей
Для разработчиков и технических руководителей появление такого стандарта означает переход к оценке «способности работать инженером», а не просто «способности писать код». Это позволяет более надежно верифицировать возможности агентских систем перед их внедрением в реальные производственные циклы разработки.
Источники
Автор
Look at AI, редакция
