🤖 Replay-тесты переключения моделей в LLM-агентах измеряют не то
Исследование «The Replay Gap» (COLM 2026) разветвляло живые траектории SWE-bench-агентов (~900 раскаток) и продолжало каждую другой моделью. После подмены перезаписывается 61–94% следующих действий, валидны лишь 3% проигранных состояний, а все 5 переворотов исхода случились только при переключении.
🌍 Ставка рынка на роутеры LLM опирается на replay-бенчмарки, невалидные для агентов: они считают, что траектория после подмены модели не меняется. Вдобавок FP8-инференс делает temperature-0 недетерминированным, ломая статические сравнения моделей.
👤 Тестируете каскады моделей в агентных пайплайнах — не доверяйте метрикам с логов без живого перезапуска окружения. Нужны ветвящиеся раскатки; код и траектории автора открыты, методологию можно повторить на своём стеке.
Источник 1: https://arxiv.org/abs/2608.08239 Источник 2: https://github.com/AshrithaG/replay-gap
