🤖 Обвязка агента важнее модели: та же точность, вдвое дороже
aistack, открытая бенчмаркинг-инициатива imec, сравнила Claude Code, Codex и Pi на моделях Qwen3.8-27B и GLM-5.3-Flash на 64 задачах SWE-Bench Pro. Точность всех шести комбинаций — 44–53%: выбор harness'а почти не влияет на resolve rate.
🌍 Разница — в цене: Codex с GLM-5.3-Flash выдал ~2,1M выходных токенов против 3–4M у остальных, входных — 192M против 480M у Claude Code. Прогон 64 задач стоил $22,8 против $45 у Claude Code и Pi — почти вдвое дороже при равной точности.
👤 Если инференс свой, мониторьте токен-эффективность, hit rate prefix-кэша и wall time: в Claude Code v2.1.233 hit rate кэша упал с 97,36% до 29,84%, а у Pi агенты застревали в «doom loop» до убийства прогона по 4-часовому лимиту. Обновляйте harness не вслепую.
Источник 1: https://aistack.imec-int.com/blog/harness-cost Источник 2: https://news.ycombinator.com/item?id=49639415
