Команда Arena.ai опубликовала исследование «HarnessTax: How Much Does the Harness Matter for Coding Agents?»: на 21 паре «модель × харнес» выбор агентной оболочки сдвигал долю решённых задач лишь на ±2% на SWE-bench Lite и ±5% на Terminal-Bench 2.0, тогда как цена одной задачи различалась до 5 раз. Одна и та же модель в минималистичной оболочке Pi решала задачи с почти тем же успехом, что и в Claude Code, но примерно вдвое дешевле. Авторы делают вывод, что сравнивать кодинг-агентов без указания харнеса некорректно, а сложность оболочки — эмпирический трейд-офф, а не ценность по умолчанию.

Что произошло
16 сентября 2026 года команда Arena.ai в составе M. Z. Pan, S. Yang, N. Arabzadeh, W.-L. Chiang, I. Stoica и M. Zaharia опубликовала работу «HarnessTax: How Much Does the Harness Matter for Coding Agents?». Авторы прогнали 7 моделей в трёх агентных оболочках — Claude Code, Codex CLI и минималистичном Pi — и получили 21 пару «модель × харнес», которую тестировали на SWE-bench Lite и Terminal-Bench 2.0: по 30 задач на бенчмарк, 3 повтора, до 100 ходов агента, с 95% доверительными интервалами на 10 000 бутстрэп-ресемплах. В связке с Claude Fable 5 оболочка меняла успех с 97,8% в Claude Code до 96,7% в Pi, но цену — с $1,33 до $0,67 за задачу. Ставка на «родную» оболочку тоже не оправдывалась: в 9 из 12 сравнений для моделей Anthropic и OpenAI чужой харнес давал лучший результат — Sonnet 4.6 показал 68,9% в Codex против 66,7% в Claude Code, а GPT-5.6 Sol на Terminal-Bench 2.0 — 83,3% в Pi против 78,9% в Codex при цене $0,42 против $0,76 за задачу.
Контекст
Харнес — это агентная оболочка, которая управляет инструментами и контекстом модели: определяет, какие инструменты доступны, как собирается стартовый контекст и как организованы ходы агента. До этой работы оболочка оставалась скрытым конфаундером всех сравнений кодинг-агентов: лидерборды и обзоры фиксировали результат конкретной связки «модель плюс дефолтный харнес» и приписывали его целиком модели. Системного измерения переплаты за оболочку — «налога на харнес» — отдельно от модели никто до сих пор не проводил. Исследование предлагает относиться к сложности харнеса как к эмпирическому трейд-оффу, а не к ценности по умолчанию: минималистичный Pi обходится всего четырьмя инструментами (read/write/edit/bash), и его стартовый контекст более чем в 10 раз меньше, чем у Claude Code.
Почему это важно для индустрии
Для индустрии эффект в первую очередь методологический: перед цитированием любого кодинг-агентного результата теперь нужно указывать харнес, потому что дефолтная оболочка вносит до 5× разброса по деньгам при почти неизменном качестве. Цена при этом не объясняется объёмом работы агента: у Claude Code и Pi почти равное число ходов (15,4 против 15,3), а геометрическое среднее ценового коэффициента составляет около 2,0×, то есть переплата сидит в накладных расходах контекста и инструментария, а не в числе шагов. Для продуктовых команд агентная оболочка — не источник качества, а статья затрат, которую можно измерить и оптимизировать; премиальные цены за «фирменные» оболочки теряют обоснование, а минимальные харнесы уровня Pi выходят на Парето-фронтир. Открытые трейсы профилирования и дашборд AgentBRANE делают все 21 пару воспроизводимыми и сравнимыми, поэтому мульти-харнесная оценка и метрика «цена за решённую задачу» могут стать отраслевым стандартом.
Почему это важно для пользователей
Практический вывод для читателя, который платит за кодинг-агента: если модель остаётся той же, а меняется только оболочка, успех почти не меняется — значит, есть смысл попробовать альтернативный CLI и сэкономить до 5× без потери качества. Готовые ориентиры из исследования: GPT-5.6 Luna — самый дешёвый вариант на обоих бенчмарках, Kimi K3 с открытыми весами держится рядом с оптимумом по соотношению цены и качества, а переход с Claude Code на Pi для той же модели даёт экономию примерно вдвое. Прежде чем платить за «фирменный» агент, пару «модель × харнес» можно проверить на собственных задачах: трейсы, графики и дашборд открыты на harnesstax.github.io, и результаты воспроизводимы.
Что пока неизвестно / ограничения
Вывод о паритете качества доказан только для трёх конкретных оболочек (Claude Code, Codex CLI, Pi) и двух бенчмарков с 30 задачами и 3 повторами на каждый: переносить его на любые харнесы, длинные горизонты и более сложные задачи нельзя. Формула «качество покупается моделью, а не оболочкой» из этих результатов не следует — данные говорят лишь о пределах ±2% на SWE-bench Lite и ±5% на Terminal-Bench 2.0, и на других классах задач роль оболочки может оказаться значимой. Проверить это предстоит независимым репликациям на больших наборах задач; кроме того, ценовые выводы привязаны к актуальным тарифам моделей и оболочек, которые могут меняться.
Источники
- HarnessTax: How Much Does the Harness Matter for Coding Agents? (Arena.ai blog)
- HarnessTax study site — charts and profiling data (AgentBRANE dashboard)
- HarnessTax/HarnessTax.github.io repository (GitHub)
Автор
Look at AI, редакция
