OpenAI обновила кэширование промптов в GPT-6 — повторное использование одинакового контекста между запросами: система по умолчанию чаще находит повторно используемый контекст, а разработчики могут следить за работой кэша и разбирать обращения, для которых в кэше нет готового ответа.
Для общих префиксов запросов, повторно используемых в течение 30 минут, компания теперь предоставляет скидку на кэшированные входные токены. Явные точки разрыва кэша позволяют выбрать, какие префиксы промпта использовать повторно.
В моделях GPT-6 можно менять уровень рассуждений между ответами, не нарушая кэширование, если добавить configuration_update и оставить уровень рассуждений для запроса без изменений.
Проверка утверждений:
- OpenAI обновила кэширование промптов в GPT-6: система по умолчанию чаще находит повторно используемый контекст, а разработчики могут следить за работой кэша и разбирать обращения, для которых в кэше нет готового ответа. (подтверждено самой публикацией: доказательство; «With the GPT‑6 family, we launched an improved prompt caching system that delivers higher cache hit rates by default. We now give cache discounts for eligible shared prefixes reused within a 30-minute window. We’re also introducing new tools to help developers monitor cache performance, diagnose misses, and choose how much of a prompt to cache.»)
- Для общих префиксов запросов, повторно используемых в течение 30 минут, компания теперь предоставляет скидку на кэшированные входные токены. (подтверждено самой публикацией: доказательство; «We now give cache discounts for eligible shared prefixes reused within a 30-minute window.»)
- Явные точки разрыва кэша позволяют выбрать, какие префиксы промпта использовать повторно. (подтверждено самой публикацией: доказательство; «Explicit cache breakpoints let you choose which prompt prefixes to reuse.»)
- В моделях GPT-6 можно менять уровень рассуждений между ответами, не нарушая кэширование, если добавить configuration_update и оставить уровень рассуждений для запроса без изменений. (подтверждено самой публикацией: доказательство; «On GPT‑6 models, you can now change reasoning effort between responses without breaking cache. Raise effort for a harder task or lower it for a routine follow-up by appending a configuration_update while leaving request-level reasoning effort unchanged.»)
Первоисточники:
оценка 64,6 из 100 · тип: руководство