Представлен DeepSWE — специализированный бенчмарк для оценки способности продвинутых AI-агентов решать сложные и долгосрочные задачи программной инженерии. В отличие от традиционных тестов, DeepSWE фокусируется на реальных инженерных циклах в защищенных от утечек данных репозиториях.

image
image

Что произошло

Разработан бенчмарк DeepSWE, использующий 113 уникальных задач из 91 репозитория. Тестирование проводится в условиях contamination-free, что исключает эффект заучивания ответов. Согласно лидерборду версии 1.1, лучшим результатом обладает модель gpt-5.6-sol с показателем Pass@1 73%, за ней следует claude-fable-5 (70%) и наиболее экономичная gpt-5.6-luna (67%).

Контекст

Существующие бенчмарки для AI-кодинга сталкиваются с проблемой насыщения, когда разрыв в результатах между топовыми моделями становится статистически незначимым. Кроме того, многие тесты проверяют лишь умение писать отдельные функции, не учитывая способность модели работать с крупными кодовыми базами и вносить изменения в архитектуру нескольких файлов одновременно.

Почему это важно для индустрии

DeepSWE предоставляет инструмент для точной дифференциации AI-агентов, позволяя компаниям выбирать модели, способные к долгосрочному планированию и автономному исследованию репозиториев. Это стимулирует переход от разработки простых инструментов помощи (Copilots) к созданию полноценных автономных AI-инженеров, способных самостоятельно закрывать сложные тикеты.

Почему это важно для пользователей

Для разработчиков и технических руководителей появление такого стандарта означает переход к оценке «способности работать инженером», а не просто «способности писать код». Это позволяет более надежно верифицировать возможности агентских систем перед их внедрением в реальные производственные циклы разработки.

Источники

Автор

Look at AI, редакция