核心觀點

對會持續數小時、反覆呼叫 API 的代理而言,推論成本與等待時間常不是由「最後那一句問題」決定,而是由每一回合重送的系統指令、工具定義與既有脈絡決定。OpenAI 表示,GPT-6 改進了預設提示快取,對 30 分鐘內重複出現的合格共同前綴提供快取折抵;已快取的輸入 token 最多可享 90% 折扣。這讓長程代理的效率問題,從單純選更便宜模型,轉向「如何讓可重用脈絡保持穩定」。^[raw/articles/openai-better-prompt-caching-gpt-6-2026-09-28.md]

這補上 OpenAI Agents API:託管 Codex Harness 的長程代理平台 所描述的長程執行面:壓縮與保存脈絡解決「能否續作」,快取則影響「續作時要付多少計算成本」。兩者都不能取代外部的可追溯工作紀錄;重要決策、來源與驗收結果仍應保存於模型上下文之外。

從黑箱命中率到可診斷的工程指標

新設的 Prompt Caching Dashboard 可查看快取命中率的時間趨勢,並以輸入組成圖比較已快取與未快取 token。若命中率突然下降,診斷工具可將本次請求與最近回應比對,指出模型、工具、設定或輸入的哪項變化破壞了重用;官方示例中的 tools_changed 造成 5,629 個原可重用 token 未命中。重點不在追求一個漂亮百分比,而是把快取失效連回某次明確的系統變更。^[raw/articles/openai-better-prompt-caching-gpt-6-2026-09-28.md]

這個做法與 ChatGPT Work 與 Codex:從用量到商業價值的 AI ROI 閉環 的判讀一致:token 用量本身不是商業價值。團隊應同時追蹤命中率、端到端延遲、任務完成率、重試與人工介入;否則可能為了維持快取而保留不合用的工具或過期指令,反而損害交付品質。

設計原則:穩定前綴、局部變動、明確斷點

官方建議將固定的系統指令、工具 schema 與工具排序放在可重用的前段;工作需要切換時,以 allowed_tools 限縮可呼叫工具、或在不需工具時設為不選用,而非直接刪除工具定義。新指令則以附加(append-only)方式放到脈絡後段覆寫舊規則。這不是要求永遠不改設定,而是讓「長期共用」與「本回合例外」有清楚邊界。

開發者也可用顯式 cache breakpoint 決定哪些前綴要重用;GPT-6 允許在回合間以 configuration_update 調整 reasoning effort,同時保留快取,只要不變更請求層級的 reasoning 設定。這與 GPT-6 Astra:新一代智慧、電腦操作與負責任部署 的工作流意義相同:面對難題可提高推理投入,但不必讓每次難度調整都重新支付完整歷史脈絡的計算。

實務意義與導入檢查

對已知會出現的共用脈絡,例如啟動時的政策、工具說明或參考資料,預熱(prewarming)可把處理移到使用者發問前,降低首次互動等待。但快取是效能優化,不是資料治理捷徑:敏感資料是否能保留、保存多久、哪些工具有權取用,仍須依自身的權限與隱私規則決定。

導入時可先選一條高頻、低風險流程,為共同前綴建立版本規則,部署前後比較命中率、p95 延遲、每次成功任務成本與人工覆核時間;再用診斷結果處理真正的失效來源。若快取改善只降低 token 帳單,卻讓工具契約更混亂或例外更難處理,那只是把成本從 API 帳單搬到工程團隊身上。

相關連結

來源

  • OpenAI(2026-09-22),〈Better prompt caching for GPT-6〉:https://openai.com/index/better-prompt-caching-for-gpt-6/
  • 原文快照:raw/articles/openai-better-prompt-caching-gpt-6-2026-09-28.md

反向連結

以下頁面引用了本頁: