核心觀點
對會持續數小時、反覆呼叫 API 的代理而言,推論成本與等待時間常不是由「最後那一句問題」決定,而是由每一回合重送的系統指令、工具定義與既有脈絡決定。OpenAI 表示,GPT-6 改進了預設提示快取,對 30 分鐘內重複出現的合格共同前綴提供快取折抵;已快取的輸入 token 最多可享 90% 折扣。這讓長程代理的效率問題,從單純選更便宜模型,轉向「如何讓可重用脈絡保持穩定」。^[raw/articles/openai-better-prompt-caching-gpt-6-2026-09-28.md]
這補上 OpenAI Agents API:託管 Codex Harness 的長程代理平台 所描述的長程執行面:壓縮與保存脈絡解決「能否續作」,快取則影響「續作時要付多少計算成本」。兩者都不能取代外部的可追溯工作紀錄;重要決策、來源與驗收結果仍應保存於模型上下文之外。
從黑箱命中率到可診斷的工程指標
新設的 Prompt Caching Dashboard 可查看快取命中率的時間趨勢,並以輸入組成圖比較已快取與未快取 token。若命中率突然下降,診斷工具可將本次請求與最近回應比對,指出模型、工具、設定或輸入的哪項變化破壞了重用;官方示例中的 tools_changed 造成 5,629 個原可重用 token 未命中。重點不在追求一個漂亮百分比,而是把快取失效連回某次明確的系統變更。^[raw/articles/openai-better-prompt-caching-gpt-6-2026-09-28.md]
這個做法與 ChatGPT Work 與 Codex:從用量到商業價值的 AI ROI 閉環 的判讀一致:token 用量本身不是商業價值。團隊應同時追蹤命中率、端到端延遲、任務完成率、重試與人工介入;否則可能為了維持快取而保留不合用的工具或過期指令,反而損害交付品質。
設計原則:穩定前綴、局部變動、明確斷點
官方建議將固定的系統指令、工具 schema 與工具排序放在可重用的前段;工作需要切換時,以 allowed_tools 限縮可呼叫工具、或在不需工具時設為不選用,而非直接刪除工具定義。新指令則以附加(append-only)方式放到脈絡後段覆寫舊規則。這不是要求永遠不改設定,而是讓「長期共用」與「本回合例外」有清楚邊界。
開發者也可用顯式 cache breakpoint 決定哪些前綴要重用;GPT-6 允許在回合間以 configuration_update 調整 reasoning effort,同時保留快取,只要不變更請求層級的 reasoning 設定。這與 GPT-6 Astra:新一代智慧、電腦操作與負責任部署 的工作流意義相同:面對難題可提高推理投入,但不必讓每次難度調整都重新支付完整歷史脈絡的計算。
實務意義與導入檢查
對已知會出現的共用脈絡,例如啟動時的政策、工具說明或參考資料,預熱(prewarming)可把處理移到使用者發問前,降低首次互動等待。但快取是效能優化,不是資料治理捷徑:敏感資料是否能保留、保存多久、哪些工具有權取用,仍須依自身的權限與隱私規則決定。
導入時可先選一條高頻、低風險流程,為共同前綴建立版本規則,部署前後比較命中率、p95 延遲、每次成功任務成本與人工覆核時間;再用診斷結果處理真正的失效來源。若快取改善只降低 token 帳單,卻讓工具契約更混亂或例外更難處理,那只是把成本從 API 帳單搬到工程團隊身上。
相關連結
- OpenAI Agents API:託管 Codex Harness 的長程代理平台
- GPT-6 Astra:新一代智慧、電腦操作與負責任部署
- ChatGPT Work 與 Codex:從用量到商業價值的 AI ROI 閉環
- AI Agent 工作流的人機分工原則
來源
- OpenAI(2026-09-22),〈Better prompt caching for GPT-6〉:https://openai.com/index/better-prompt-caching-for-gpt-6/
- 原文快照:
raw/articles/openai-better-prompt-caching-gpt-6-2026-09-28.md
反向連結
以下頁面引用了本頁: