Anthropic включила в официальный скилл claude-api для Claude Code команду /claude-api prompt-audit: она ищет в CLAUDE.md, скиллах, agent.md, описаниях инструментов и промптах «антипаттерны» времён старых моделей и предлагает их удалить. По бенчмарку компании на задаче клиентской поддержки миграция Opus 4.8 → Opus 5.5 сама по себе дала около 18% экономии токенов, а чистка промптов добавила ещё около 9% экономии и около 2 процентных пунктов точности. Аудит конфигураций харнесса из опциональной гигиены превращается в стандартный шаг перехода на новое поколение моделей.
!image.jpg)
Что произошло
Команда /claude-api prompt-audit появилась в официальном скилле claude-api для Claude Code. Она сканирует CLAUDE.md, скиллы, файлы agent.md, описания инструментов и промпты, помечает типовые антипаттерны эпохи предыдущих моделей и предлагает найденное удалить. В списке — ритуалы проверки вроде «double-check your work», капслок-усилители в духе «CRITICAL: YOU MUST», принудительные scratchpad-рассуждения, противоречивые правила и устаревшие настройки thinking. Количественный эффект компания показывает в блоге на бенчмарке миграции Opus 4.8 → Opus 5.5 для задачи клиентской поддержки. Там же разобраны конкретные механизмы поломок: устаревшая настройка thinking приводила к отказу API-запросов, а принудительный ручной scratchpad — к тому, что модель писала вызов инструмента внутри рассуждений и не выполняла его.
Контекст
Ритуальные проверки, капслок и принудительные промежуточные рассуждения раньше решали реальную задачу: компенсировали слабости старых моделей, которые пропускали ошибки или теряли нить в многошаговых сценариях. У фронтирных моделей со встроенным reasoning эти костыли перестают быть нейтральными — они тратят токены, ломают кэш промптов и конфликтуют с собственным механизмом рассуждений, причём модель исполняет legacy-инструкции буквально и во вред. Отсюда менее очевидный вывод: конфигурация харнесса — промпты, скиллы, CLAUDE.md — это фактически зависимость от конкретного снапшота модели, а не нейтральный текст, который можно не трогать годами. Контекст появления команды — релиз Claude Opus 5.5 22 сентября 2026 года, который по официальным release notes на 40% дешевле Opus 5 в эксплуатации: когда цена токенов падает, доля расходов на устаревшие инструкции становится заметнее, а выигрыш от их чистки — измеримее.
Почему это важно для индустрии
Главный отраслевой сигнал — пропорция эффекта: по бенчмарку Anthropic чистка конфигураций даёт величину, сопоставимую с половиной выгоды от апгрейда модели, то есть накопленный «config debt» в промптах, скиллах и CLAUDE.md — это измеримая статья расходов, а не абстрактная гигиена. Аудит харнесса встраивается в миграционные плейбуки рядом с прогоном evals, а решение Anthropic закрепить проверку внутри экосистемного скилла делает её дефолтом для экосистемы Claude Code. Вероятное развитие — формирование отдельного слоя инструментария: линтеры промптов у сторонних харнессов, проверки конфигураций в CI, версионирование промпт-конфигов с регресс-тестами против конкретных поколений моделей. Параллельно командам приходится пересчитывать юнит-экономику агентских фич: скидка Opus 5.5 в сочетании с чисткой промптов даёт запас маржи, которого раньше не было.
Почему это важно для пользователей
Тем, кто работает с Claude Code или другим харнессом, ничего не мешает проверить эффект на себе: команду можно прогнать по своим репозиториям уже сейчас, до и после апгрейда на Opus 5.5. Заявленную Anthropic добавку по экономии токенов и точности стоит подтверждать на собственных задачах — замерить токены на задачу, долю реально выполненных вызовов инструментов и качество ответов до и после чистки, а не полагаться только на цифры из чужого кейса. Отдельный повод для ручной ревизии — настройки thinking и принудительные scratchpad-инструкции: по примерам компании именно они чаще всего вызывают сбои в работе API и инструментов, а такие поломки легко пропустить, если мониторить только итоговые ответы.
Что пока неизвестно / ограничения
Доказательная база пока тонкая: цифры получены на одном вендорском кейсе — задаче клиентской поддержки при миграции Opus 4.8 → Opus 5.5. В опубликованных материалах нет размера выборки, разброса и определений метрик «экономия» и «точность», поэтому результат корректно считать гипотезой, которую проверяют собственными evals, а не гарантированным эффектом для любых задач, моделей и харнессов. Вывод об универсальной обязательности аудита пока обоснован не сильнее одного кейса: воспроизводимость цифр на других задачах, у других вендоров и в open-source-харнессах предстоит подтвердить независимыми замерами.
Источники
- Блог Anthropic — Reducing cost and improving performance with Claude Platform
- anthropics/skills — официальный репозиторий скилла claude-api для Claude Code
Автор
Look at AI, редакция
