Birgitta Böckeler из Thoughtworks опубликовала на MartinFowler.com исследование, доказывающее, что принудительное соблюдение TDD внутри автономного AI-агента не улучшает качество генерируемого кода, а увеличивает расход токенов в 3–8,5 раза.



Что произошло
В эксперименте использовались Claude Sonnet 4.6 для генерации кода и Claude Opus 4.8 для слепого оценивания результатов. Решения, сгенерированные без инструкций по TDD, стабильно занимали первые места по качеству дизайна и тестов. При этом запросы с предписанием пройти цикл red-green-refactor потребляли от трёх до восьми с половиной раз больше токенов, не давая измеримого выигрыша в финальном продукте.
Контекст
TDD как методология предполагает цикл «написать тест — написать код, который его проходит — рефакторинг». Исследование объясняет отсутствие эффекта тем, что LLM обучены на готовых функциях с описаниями, а не на пошаговых TDD-транскриптах. Их latent space маппит требования напрямую на код, минуя промежуточный процесс «тест сначала». Статья вошла в серию Exploring Generative AI на MartinFowler.com, а Anti-pattern «Prescribing TDD Inside the Agent Loop» был задокументирован на AgentPatterns.ai.
Почему это важно для индустрии
Исследование ставит под сомнение предписание TDD как best practice для agentic-разработки. Вместо process-driven quality assurance индустрии предлагается переход к измеримым метрикам результата: mutation testing как quality-gate в CI/CD, статический анализ, сохранение тестов, написанных человеком. Командам следует оставлять человека в критических точках цикла, а не полагаться на автономный red-green-refactor.
Почему это важно для пользователей
Если вы используете AI-агентов с инструкциями по TDD, вы можете немедленно сократить расходы на токены на 70–88%, убрав предписание цикла red-green-refactor из промптов. Продуктовым командам рекомендуется добавить переключатель режима TDD с метрикой потребления токенов и отключать его по умолчанию.
Что пока неизвестно / ограничения
Исследование использовало только модели Anthropic — Claude Sonnet 4.6 и Opus 4.8. Поведение может отличаться для GPT-o1, Gemini 2.5 Pro, Llama и open-source моделей с иной структурой pre-training. До появления cross-vendor исследования уверенность в обобщаемости ограничена. Это не рецензируемая статья, а публикация в серии блога MartinFowler.com.
Источники
- TDD inside the agent loop — Martin Fowler
- Prescribing TDD Inside the Agent Loop (Process Theater) — AgentPatterns.ai
- Exploring Generative AI — Martin Fowler (series index)
Автор
Look at AI, редакция
