Открытая бенчмаркинг-инициатива aistack, созданная исследовательским центром imec, опубликовала сравнение трёх агентских обвязок для кодинга — Claude Code, Codex и Pi — на двух открытых моделях: Qwen3.8-27B (FP8, один NVIDIA H200) и GLM-5.3-Flash (FP8, четыре H200). На 64 задачах SWE-Bench Pro все шесть комбинаций harness и модели показали resolve rate от 44% до 53%, то есть точность практически не зависела от выбора обвязки. Но стоимость различалась почти вдвое: GPU-стоимость полного прогона составила 22,8 доллара у связки Codex с GLM-5.3-Flash против 45 долларов у Claude Code и Pi.

Что произошло
aistack прогнала три кодинг-агентские обвязки (harness) — Claude Code, Codex и Pi — на двух моделях: Qwen3.8-27B в формате FP8 на одной NVIDIA H200 и GLM-5.3-Flash в FP8 на четырёх H200. Набор из 64 задач был отобран из SWE-Bench Pro, и каждая обвязка работала с каждой моделью, что дало шесть комбинаций. Resolve rate во всех шести случаях уложился в диапазон 44–53% — разброс составил всего 2–3 задачи, то есть выбор harness почти не влиял на точность. Разница проявилась в ресурсах: Codex с GLM-5.3-Flash сгенерировал около 2,1 млн выходных токенов против 3–4 млн у остальных комбинаций и потребовал 192 млн входных токенов на GLM против 480 млн у Claude Code. Итоговая GPU-стоимость 64-задачного прогона — 22,8 доллара у Codex с GLM-5.3-Flash против 45 долларов у Claude Code и Pi. В замере зафиксированы две аномалии: у Pi воркеры застревали в повторяющемся цикле («doom loop»), модель деградировала в бессмыслицу, а запуск убивался оркестратором по 4-часовому лимиту; у Claude Code версия v2.1.233 сломала prefix caching — средний hit rate упал с 97,36% до 29,84%, а латентность на запрос выросла примерно в 10 раз.
Контекст
Harness — это агентская обвязка, которая управляет контекстом, инструментами и остановкой агента поверх LLM; до недавнего времени её влияние на результат измерялось редко, и выбор сводился в основном к подбору модели. Новизна замера aistack именно методологическая: переменная harness впервые выделена отдельно от переменной модели, а к точности добавлены экономические метрики — токен-эффективность, wall time и стоимость прогона. Обе участвующие модели работают в самостоятельном self-hosted инференсе на GPU NVIDIA H200 в квантовании FP8, поэтому цифры отражают реальную операционную картину, а не цены облачных API. Отдельный кейс с Claude Code v2.1.233 известен из GitHub issue о латентности: точечный релиз обвязки нарушил работу prefix caching — кэширования KV-суффиксов для статической части контекста, от которого зависит и латентность, и расход токенов.
Почему это важно для индустрии
Для builders и компаний, эксплуатирующих агентов, замер imec даёт измеримый аргумент: выбор harness сопоставим по влиянию с выбором модели, потому что при равной точности 44–53% на SWE-Bench Pro стоимость 64-задачного прогона варьируется от 22,8 до 45 долларов за счёт токен-эффективности и wall time. Это напрямую определяет юнит-экономику агентских продуктов и self-hosted инференса: оптимизировать нужно context engineering и prefix caching, а не только подбор LLM. Конкурентное преимущество агентских продуктов смещается от доступа к модели в сторону качества обвязки — токен-бюджетов, observability и стабильности релизов. Регресс Claude Code v2.1.233 дополнительно показывает, что одна точечная версия harness способна обрушить hit rate prefix-кэша и кратномножить латентность, поэтому командам имеет смысл фиксировать версии, ставить canary-прогоны перед обновлением и мониторить стоимость на задачу.
Почему это важно для пользователей
Тем, кто сам поднимает инференс и гоняет кодинг-агентов, замер даёт готовый чек-лист для аудита собственного стека: токен-эффективность (отношение выходных и входных токенов), hit rate prefix-кэша, wall time и нагрузку на KV cache. Реальный кейс с релизом Claude Code v2.1.233 показывает, почему не стоит обновлять версии harness в production вслепую: падение hit rate кэширования с 97,36% до 29,84% кратномножило латентность каждого запроса. Практический шаг — добавить мониторинг hit rate prefix cache и стоимости на решённую задачу и проверять любую новую версию обвязки на небольшом canary-прогоне, прежде чем выкатывать её на рабочий контур.
Что пока неизвестно / ограничения
Точность во всех комбинациях остаётся на низком абсолютном уровне: обе модели решают менее половины задач SWE-Bench Pro, так что равенство результатов не означает, что точность стала порогом, «который уже никто не обсуждает». При 64 задачах шаг одной задачи — около 1,6 процентного пункта, и разброс в 2–3 задачи не позволяет статистически подтвердить ни наличие, ни отсутствие систематической разницы между harness'ами. Две аномалии — «doom loop» у Pi и сломанный prefix caching в Claude Code v2.1.233 — свидетельствуют о хрупкости самого замера: результат чувствителен к версиям обвязок и поведению оркестратора. Наконец, замер сделан на одной конфигурации оборудования и двух конкретных моделях, а рыночный отклик пока слабый, поэтому переносить выводы на другие модели, задачи и тарифы следует с осторожностью.
Источники
- aistack (imec): Does your harness matter more than your model? — сравнение Claude Code, Codex и Pi (harness-cost)
- Hacker News: Benchmarking Claude Code, Codex and Pi on SWE-Bench Pro: Same Accuracy, 2x Cost (item 49639415)
- GitHub issue anthropics/claude-code #87227: ~10x per-turn latency regression against custom ANTHROPIC_BASE_URL (vLLM) — prefix cache no longer works
Автор
Look at AI, редакция
