Бенчмарк SWE-rebench представил масштабное обновление, превращая оценку ИИ-агентов из демонстрации навыков кодинга на Python в проверку их пригодности для реальных промышленных задач в многоязычных средах.

image
image

Что произошло

SWE-rebench расширил охват тестирования до 111 задач на пяти языках программирования: Go, Java, Python, Rust и TypeScript. В обновленном лидерборде Anthropic Fable 5 показала лучший результат по метрике Pass@1 (64.5%), в то время как Anthropic Opus 5 признана наиболее стабильным решением по показателю Pass all 5. Также отмечена высокая эффективность модели OpenAI GPT-5.6 Sol, выполняющей задачи в среднем за 18.4 шага.

Контекст

Предыдущие методы оценки ИИ-агентов часто были ограничены узким Python-centric подходом, что не позволяло объективно сравнивать возможности моделей в гетерогенных технологических стеках. Новое обновление вводит не только мультиязычность, но и критически важные метрики: стабильность выполнения (Pass all 5) и эффективность траектории (количество шагов), что позволяет оценивать не только точность, но и стоимость эксплуатации (inference cost).

Почему это важно для индустрии

Для индустрии это означает переход к стандартизации 'industrial-grade' агентов. Компании теперь могут выбирать модели, ориентируясь на их надежность в production и предсказуемость затрат на выполнение задач. Введение метрик эффективности заставит разработчиков оптимизировать длину траектории агента, делая их работу более экономически выгодной.

Почему это важно для пользователей

Разработчики и инженеры получают инструмент для точного подбора ИИ-агентов под конкретные стеки технологий и требования к надежности. Теперь можно оценивать потенциального помощника не просто по его способности писать код, а по тому, насколько дешево и предсказуемо он справится с реальной задачей в рамках существующего проекта.

Источники

Автор

Look at AI, редакция