AI Фактор

OpenAI покращила кешування промптів у GPT‑6

Прийом 25.09.2026
OpenAI покращила кешування промптів у GPT‑6

Знижка на кешовані вхідні токени — до 90%, а спільні префікси кешуються, якщо повторно використані протягом 30 хвилин. Новий Prompt Caching Dashboard показує hit rate і склад токенів, а diagnostics tool пояснює причину промаху («tools_changed») і кількість постраждалих токенів.

Reasoning effort тепер можна міняти між запитами через configuration_update, не ламаючи кеш. Доступні інструменти обмежують через allowed_tools або tool_choice: none, а не видаленням визначень — це теж зберігає кеш. Ще додали prewarming: спільні інструкції прогрівають заздалегідь, до першого запиту користувача.

Звідки взагалі взявся такий кеш

OpenAI пише, що GPT‑6 розрахований на агентів, які працюють годинами над складними задачами: рефакторинг кодових баз, підготовка документів і презентацій з дослідженням матеріалу. Такий агент робить серію API-запитів, кожен з яких спирається на попередній, — і часто тягне за собою ту саму інструкцію, ті самі визначення інструментів і той самий контекст із попередніх ходів. Саме цей спільний контекст і кешується, щоб не рахувати його заново щоразу.

Explicit cache breakpoints — самому вирішувати, що кешувати

Крім автоматичного кешування спільних префіксів, з'явився інструмент explicit cache breakpoints: розробник сам позначає, які саме префікси промпту варто перевикористовувати. Оновлений prompt caching guide пояснює, як розставляти ці точки, скільки часу закешований префікс лишається придатним для перевикористання і як зміни в інструментах чи вхідних даних впливають на це.

Як оновлювати інструкції, не ламаючи кеш

Окрім прапорців allowed_tools і tool_choice: none для інструментів, є прийом для самих інструкцій: нові developer messages можна додавати ближче до кінця контексту, щоб вони перекривали старі — замість того, щоб редагувати чи видаляти вже закешовану частину промпту на початку. Загальна рекомендація OpenAI та сама: тримати визначення інструментів, схеми та їх порядок стабільними, щоб раніший контекст лишався перевикористовним.

Прогрів кешу і що з цим робити далі

Приклад prewarming з матеріалу: застосунок може заздалегідь, під час старту, прогріти спільні інструкції, визначення інструментів або довідкові матеріали — ще до того, як користувач поставить перше питання. Тоді ця обробка відбувається не в момент очікування відповіді користувачем, а раніше.

OpenAI також пропонує окремий маршрут для тих, хто хоче оптимізувати свою інтеграцію: стежити за hit rate у дашборді, розбирати пропуски діагностичним інструментом, а для самих правок у коді — використати Codex, щоб він переглянув код, застосував покращення й виміряв результат.

Читати в ТелеграміПрактика ШІ в бізнесі — щодня, без хайпу