OpenAI обнови кеширането на подкани в GPT-6 — повторното използване на един и същ контекст между заявки: системата по подразбиране по-често намира контекст за повторно използване, а разработчиците могат да следят работата на кеша и да разследват заявки, за които кешът няма готов отговор.
За споделени префикси на заявки, използвани повторно в рамките на 30 минути, компанията вече дава отстъпка за кеширани входни токени. Явните точки за прекъсване на кеша позволяват да се избере кои префикси на подканата да се използват повторно.
В моделите GPT-6 може да се променя усилието за разсъждение между отговорите, без да се нарушава кешът, ако се добави configuration_update и усилието за разсъждение на ниво заявка остане без промяна.
Проверка на твърденията:
- OpenAI обнови кеширането на подкани в GPT-6: системата по подразбиране по-често намира контекст за повторно използване, а разработчиците могат да следят работата на кеша и да разследват заявки, за които кешът няма готов отговор. (потвърдено от самата публикация: доказателство; «With the GPT‑6 family, we launched an improved prompt caching system that delivers higher cache hit rates by default. We now give cache discounts for eligible shared prefixes reused within a 30-minute window. We’re also introducing new tools to help developers monitor cache performance, diagnose misses, and choose how much of a prompt to cache.»)
- За споделени префикси на заявки, използвани повторно в рамките на 30 минути, компанията вече дава отстъпка за кеширани входни токени. (потвърдено от самата публикация: доказателство; «We now give cache discounts for eligible shared prefixes reused within a 30-minute window.»)
- Явните точки за прекъсване на кеша позволяват да се избере кои префикси на подканата да се използват повторно. (потвърдено от самата публикация: доказателство; «Explicit cache breakpoints let you choose which prompt prefixes to reuse.»)
- В моделите GPT-6 може да се променя усилието за разсъждение между отговорите, без да се нарушава кешът, ако се добави configuration_update и усилието за разсъждение на ниво заявка остане без промяна. (потвърдено от самата публикация: доказателство; «On GPT‑6 models, you can now change reasoning effort between responses without breaking cache. Raise effort for a harder task or lower it for a routine follow-up by appending a configuration_update while leaving request-level reasoning effort unchanged.»)
Първоизточници:
оценка 64,6 от 100 · вид: наръчник