OpenAI выпустила обновление промпт-кэширования (prompt caching) для семейства GPT-6: границы и время жизни кэша стали явными параметрами API, а скидка на кэшированные входные токены достигает 90%. Для продуктов с большим повторяющимся префиксом — агентских систем, RAG-конвейеров и кодинг-ассистентов — это прямой способ сократить расходы на API.


Что произошло
Обновление затронуло весь жизненный цикл кэша. Выросли показатели cache hit rate; явные точки остановки (explicit breakpoints) задаются через параметры prompt_cache_options.mode и prompt_cache_breakpoint, а время жизни кэша для GPT-5.6 и новее настраивается параметром prompt_cache_options.ttl — например, значением «30m», что означает 30 минут с последней записи или использования кэша. В официальной документации API указаны минимальный кэшируемый префикс в 1 024 токена и до 4 записей в кэш на запрос. По новым тарифам запись в кэш стоит 1,25x обычной цены входного токена, а чтение из кэша — 0,1x. К обновлению также относятся инструмент Prompt Cache Diagnostics для разбора промахов, дашборд Prompt Caching Dashboard и прогрев кэша до запроса пользователя. OpenAI также приводит бенчмарк GitHub: доля токенов, требующих свежей обработки, сократилась более чем на 50% на миллиардах запросов.
Контекст
Механика промпт-кэширования — повторное использование уже вычисленных KV-состояний при совпадении начала запроса: если у нового обращения тот же префикс, модель не пересчитывает его заново. Сам приём известен давно и научной новизны почти не несёт; важнее другое. Раньше кэширование было скрытой серверной оптимизацией, чья эффективность зависела от случайных совпадений префиксов, теперь границы кэша, TTL и диагностика вынесены в явный контракт API. Breakpoint'ы решают главную практическую проблему префиксного кэширования: они позволяют явно отделить неизменяемую часть промпта от динамического хвоста. Экономику при этом можно просчитать заранее: два запроса с одинаковым префиксом обходятся в 1,35x против 2x без кэша, а десять запросов — в 2,15x против 10x.
Почему это важно для индустрии
Кэш стал первоклассной частью API-контракта, и это меняет проектирование продуктов, а не только счета. Строители агентов с длинным контекстом — кодинг-агентов, исследовательских систем, RAG-сервисов — могут явно задавать границы кэша и менять reasoning effort между ответами без его сброса, то есть разделять качество рассуждений и цену запроса. Персистентные агенты с большим стабильным контекстом получают предсказуемую юнит-экономику вместо надежды на удачное совпадение префиксов. Для стартапов это в первую очередь pricing shift, а не platform shift: улучшается экономика уже работающих продуктов, а не требуется их переписывание под новую платформу.
Почему это важно для пользователей
Если вы работаете с API OpenAI, эффект доступен немедленно, но требует активной работы: проверьте текущий hit rate на Prompt Caching Dashboard (platform.openai.com/usage?usage_section=prompt-caching), разберите промахи через Prompt Cache Diagnostics, выделите в промптах стабильный префикс от 1 024 токенов, при необходимости расставьте явные prompt_cache_breakpoint и подберите prompt_cache_options.ttl под ритм обращений. Для повторяющихся промптов входные токены могут стоить до 10% обычной цены, а первый токен ответа приходит быстрее; для персистентных сессий полезно настроить прогрев кэша под расписание обращений.
Что пока неизвестно / ограничения
Единственный опубликованный количественный результат — вендорский бенчмарк GitHub — не сопровождается раскрытой методологией: нет датасета, смеси нагрузок, определения базовой линии и статистики значимости, а упоминание миллиардов запросов — аргумент масштаба, а не метода. Пока нет независимой репродукции, эту цифру стоит считать маркетинговым уровнем доказательности. Реальная экономия зависит от вашего hit rate и структуры промптов, поэтому её нужно измерять на дашборде, а не брать из анонса. Ожидание, что явные cache-контролы — breakpoints, TTL, диагностика, прогрев — станут стандартной частью API-контрактов у других крупных провайдеров, это интерпретация, а не установленный факт.
Источники
- Better prompt caching for GPT-6 — OpenAI
- Prompt caching — OpenAI API documentation
- OpenAI Upgrades GPT-6 Prompt Caching with 90% Discounts for Persistent Agents — Crypto Briefing
Автор
Look at AI, редакция
