GPT-5.6 构建指南

GPT-5.6 是 OpenAI 最新模型系列,核心卖点是大幅提升的性价比。它让前沿级别的 Agent 性能变得更便宜,同时推高了能力上限。对开发者来说,关键变化在于:更聪明的模型选择策略和新的 API 控制手段(推理连续性、多Agent编排、可编程工具调用),可以用更低的成本构建更快、更强的 Agent。

先说模型选择。过去,长周期任务基本只能用旗舰模型跑最高推理模式,因为便宜模型处理长上下文和工具调用能力太弱。GPT-5.6 系列改变了这一点:小模型 Luna 和 Terra 通过更多测试时计算,在不少场景下能达到 GPT-5.4/5.5 的水平,但成本低得多。一个直接例子是 BrowseComp 搜索基准测试:三个月前 GPT-5.5(Extra High)得分 84.36%,总成本 $33.27;GPT-5.6 Luna(Extra High)得分 84.04%,成本仅 $1.33。之后 OpenAI 还进一步降价。因此,高频、低延迟、Agent 工作流中的重复步骤(比如法律科技公司先用模型提取手写备忘录)都可以改用 Terra 或 Luna,省下大量费用。

除了开箱性能,GPT-5.6 在 Responses API 里加入了三种新机制,让 Agent 运行更高效。第一是推理持久化(retained reasoning),允许跨模型轮次保留推理结果,并结合原生压缩(compaction)压缩长对话,模型不需要在每个步骤重建上下文,从而在更长任务中保持连贯。第二是原生多Agent编排,允许在并行工作流中协调多个 Agent 子任务,主Agent负责分配,子Agent并行执行后将输出交回主Agent综合。第三是可编程工具调用(Programmatic Tool Calling),让模型用 JavaScript 编排工具——独立调用、并行运行、在上下文窗口外处理输出,模型只专注于需要判断的部分。

这三个机制合在一起效果惊人。例如在 ARC-AGI-3 基准上,GPT-5.6 Sol 用标准配置得分 13.3%,启用推理持久化和压缩后得分跃升至 38.3%,而且输出 token 用量减少了约 6 倍。模型没变,性能接近三倍提升。

Prompt Caching 也有改进:整个模型系列的缓存 TTL 延长到至少 30 分钟,并且可以在上下文窗口内确定性设置缓存断点。配合合适的 prompt_cache_key,能显著提高缓存命中率,降低延迟。

总结来说,GPT-5.6 让构建 Agent 的经济性发生了质变。过去每个步骤都需要旗舰模型的任务,现在通过选用更小的模型、调低推理力度、配合高效的架构选择,可以用远低于以前的成本得到同等甚至更好的结果。

The builder’s guide to GPT‑5.6

查看原文