Birgitta Böckeler из Thoughtworks опубликовала на MartinFowler.com исследование, доказывающее, что принудительное соблюдение TDD внутри автономного AI-агента не улучшает качество генерируемого кода, а увеличивает расход токенов в 3–8,5 раза.

image
image
image

Что произошло

В эксперименте использовались Claude Sonnet 4.6 для генерации кода и Claude Opus 4.8 для слепого оценивания результатов. Решения, сгенерированные без инструкций по TDD, стабильно занимали первые места по качеству дизайна и тестов. При этом запросы с предписанием пройти цикл red-green-refactor потребляли от трёх до восьми с половиной раз больше токенов, не давая измеримого выигрыша в финальном продукте.

Контекст

TDD как методология предполагает цикл «написать тест — написать код, который его проходит — рефакторинг». Исследование объясняет отсутствие эффекта тем, что LLM обучены на готовых функциях с описаниями, а не на пошаговых TDD-транскриптах. Их latent space маппит требования напрямую на код, минуя промежуточный процесс «тест сначала». Статья вошла в серию Exploring Generative AI на MartinFowler.com, а Anti-pattern «Prescribing TDD Inside the Agent Loop» был задокументирован на AgentPatterns.ai.

Почему это важно для индустрии

Исследование ставит под сомнение предписание TDD как best practice для agentic-разработки. Вместо process-driven quality assurance индустрии предлагается переход к измеримым метрикам результата: mutation testing как quality-gate в CI/CD, статический анализ, сохранение тестов, написанных человеком. Командам следует оставлять человека в критических точках цикла, а не полагаться на автономный red-green-refactor.

Почему это важно для пользователей

Если вы используете AI-агентов с инструкциями по TDD, вы можете немедленно сократить расходы на токены на 70–88%, убрав предписание цикла red-green-refactor из промптов. Продуктовым командам рекомендуется добавить переключатель режима TDD с метрикой потребления токенов и отключать его по умолчанию.

Что пока неизвестно / ограничения

Исследование использовало только модели Anthropic — Claude Sonnet 4.6 и Opus 4.8. Поведение может отличаться для GPT-o1, Gemini 2.5 Pro, Llama и open-source моделей с иной структурой pre-training. До появления cross-vendor исследования уверенность в обобщаемости ограничена. Это не рецензируемая статья, а публикация в серии блога MartinFowler.com.

Источники

Автор

Look at AI, редакция