OpenAI улучшила кеширование промптов для агентов на GPT-6

OpenAI представила обновлённую систему кеширования промптов для семейства GPT-6. Она рассчитана на постоянных ИИ-агентов, которые выполняют сложные задачи часами, и даёт скидку до 90% на кешированные входные токены. Для подходящих общих префиксов компания теперь предоставляет скидки при повторном использовании в течение 30 минут.
Одновременно OpenAI выпустила панель Prompt Caching Dashboard, средство диагностики промахов кеша и механизмы явного управления его границами. Новые функции должны помочь разработчикам отслеживать долю повторно использованного контекста, находить причины промахов и настраивать запросы под конкретную нагрузку.
Что меняется в работе длительных агентов
Агенты для рефакторинга кода, подготовки исследований и презентаций обычно отправляют последовательность API-запросов. Между ними повторяются системные инструкции, определения инструментов и контекст предыдущих шагов. Кеширование позволяет не обрабатывать такую общую часть заново, сокращая задержку ответа и стоимость входных токенов.
В GPT-6 улучшенный механизм должен повышать вероятность попадания в кеш по умолчанию. OpenAI отдельно отмечает, что разработчикам не обязательно включать дополнительные элементы управления, но они могут точнее адаптировать работу кеша под свой сценарий.
Наблюдение и диагностика
Prompt Caching Dashboard показывает, какая часть входа приложения обслуживается из кеша. В нём можно отслеживать hit rate во времени и сравнивать объём кешированных и некешированных токенов. Это позволяет увидеть, как изменения в приложении влияют на повторное использование контекста.
Инструмент диагностики сопоставляет запрос с недавним ответом и указывает, что помешало повторному использованию: смена модели, набора инструментов, настроек или самого ввода. В примере OpenAI изменение инструментов привело к промаху для 5629 токенов, и столько же токенов могло быть использовано повторно при совпадении условий.
Как сохранить повторно используемый контекст
Разработчики могут применять явные точки разрыва кеша, чтобы определить префиксы, которые следует сохранять. Для предсказуемого результата OpenAI советует держать определения инструментов, их схемы и порядок стабильными. Вместо удаления ненужных инструментов можно ограничить доступный набор через allowed_tools или установить tool_choice в none.
Новые инструкции рекомендуется добавлять ближе к концу контекста в developer messages, чтобы они перекрывали старые правила без изменения устойчивого префикса. В GPT-6 также можно менять уровень reasoning effort между ответами через configuration_update, не ломая кеш: параметр запроса при этом остаётся прежним.
Для известных заранее инструкций, определений инструментов или справочных материалов доступен предварительный прогрев кеша. Обработка переносится на момент до первого пользовательского запроса, что может сократить ожидание ответа.
Практический эффект
GitHub сообщил, что за несколько месяцев снизил более чем на 50% долю токенов промптов, требующих новой обработки, относительно предыдущего базового уровня при миллиардах запросов к моделям OpenAI. В кейсе одного из пользователей панели и диагностика помогли увеличить hit rate на несколько процентных пунктов и сократить расходы на 20%.
Другие пользователи OpenAI сообщили о росте hit rate примерно с 85% до стабильно более 90%, а также с 83% до 91% после перехода к явным точкам разрыва. Во втором случае компания указала на сокращение записей в кеш примерно на две трети и снижение затрат на инференс на 36% при той же нагрузке.
Для бизнеса вывод практический: при внедрении длительных агентов стоит измерять hit rate, фиксировать стабильную часть промпта и отдельно контролировать изменения инструментов и инструкций. Это позволяет использовать общий контекст повторно и принимать решения о затратах и задержках на основе наблюдаемых метрик.

