🤖 DeepSWE: новый бенчмарк для AI-агентов в программировании
Представлен DeepSWE — специализированный бенчмарк для оценки способностей передовых AI-агентов в решении сложных, долгосрочных задач программной инженерии. Он использует 113 уникальных задач из 91 репозитория, защищенных от утечки данных.
🌍 DeepSWE решает проблему «насыщения» текущих тестов, когда разрыв между топовыми моделями становится статистически незначимым. Это позволяет лучше дифференцировать агентов по их реальному поведению и планированию.
👤 Индустрия переходит от оценки «умения писать код» к оценке «способности работать инженером» — самостоятельно исследовать репозитории и вносить изменения в системы.
Источник 1: https://deepswe.datacurve.ai/ Источник 2: https://github.com/datacurve-ai/deep-swe
