GPT-6的提示缓存改进

GPT-6让持久化agent可以连续工作数小时,处理从重构代码库到生成文档和演示文稿的复杂任务。这类应用会发出相互依赖的一系列API请求,通常携带相同的指令、工具定义和上下文。OpenAI通过缓存这些共享上下文来复用计算,从而减少响应时间,并给开发者提供最高达90%的缓存输入token折扣。

GPT-6系列上线了改进后的提示缓存系统,默认就带来更高的缓存命中率。现在,在30分钟窗口内复用的符合条件的共享前缀可以享受缓存折扣。同时新增了两项工具:Prompt Caching Dashboard用于监测缓存命中率和输入构成变化;prompt caching diagnostics tool用于诊断意外缓存未命中,对比请求与最近响应,定位是模型、工具、设置还是输入变化导致,并估算受影响的token数量。

针对如何优化缓存,官方给出几条具体路径。可以设置显式缓存断点,自主选择要复用的提示前缀。在GPT-6模型上,调整reasoning effort不再破坏缓存:对困难任务提高effort,或对常规追问降低effort,只需追加configuration_update,同时保持请求级reasoning effort不变。当工具和指令变化时,尽量保持工具定义、schema和顺序稳定,用allowed_tools让相关工具可调用,或设tool_choice为none,而不是删除定义;用新的developer消息在上下文末尾追加指令,覆盖旧指令。还可以预热缓存:在用户提问前预先准备共享指令、工具定义或参考材料,把处理移出用户等待时间。

这些控制手段都是对引擎默认性能的补充,开发者可以根据工作负载定制缓存策略。配置方式和诊断工具的使用细节可参考官方文档。

Better prompt caching for GPT-6

查看原文