🤖 Оболочка кодинг-агента почти не влияет на качество, но меняет цену до 5×
Arena.ai 16 сентября 2026 опубликовала исследование HarnessTax: 7 моделей на трёх оболочках (Claude Code, Codex CLI, Pi) прогнали на SWE-bench Lite и Terminal-Bench 2.0. Разброс успеха — ±2–5%, цены — до 5×: Claude Fable 5 даёт 97,8% в Claude Code против 96,7% в Pi, но $1,33 против $0,67 за задачу.
🌍 В 9 из 12 сравнений «чужая» оболочка обыгрывала родную: Sonnet 4.6 — 68,9% в Codex против 66,7% в Claude Code. Дефолтный харнес — скрытый конфаундер лидербордов: сравнивать модели без учёта оболочки некорректно.
👤 Та же модель в другом CLI — почти тот же успех, экономия до 5×. Открытый Pi с четырьмя инструментами на Парето-фронтире, его стартовый контекст в 10+ раз меньше. Данные и трейсы открыты на harnesstax.github.io — проверьте на своих задачах.
Источник 1: https://arena.ai/blog/coding-agents-harness-tax Источник 2: https://harnesstax.github.io/
