🛠 Обновление бенчмарка SWE-rebench для ИИ-агентов

Вышло масштабное мультиязычное обновление бенчмарка SWE-rebench для оценки ИИ-агентов в программировании. Теперь тест охватывает 111 задач на пяти языках: Go, Java, Python, Rust и TypeScript. Лидером по Pass@1 стала Anthropic Fable 5 (64.5%), а наиболее стабильным решением признана Anthropic Opus 5. Модель OpenAI GPT-5.6 Sol показала высокую эффективность, выполняя задачи за минимальное количество действий.

🌍 Переход к мультиязычности делает оценку агентов более реалистичной. Введение метрик стабильности и стоимости решения помогает компаниям выбирать модели для промышленной эксплуатации.

👤 Теперь можно оценивать ИИ-агентов не только по их способностям, но и по предсказуемости и стоимости решения реальных задач в разных языках.

Источник 1: https://swe-rebench.com/ Источник 2: https://teletype.in/@ibragim_bad/swe-rebench-2026-07