
GPT-5.6:前沿智能与前沿效率的融合

OpenAI 发布了 GPT‑5.6 模型家族,核心思路是在不同价位上提供差异化的能力与成本组合。旗舰模型 GPT‑5.6 Sol(开启最大推理)在 Artificial Analysis Coding Agent Index 上超越 Claude Fable 5,成本不到后者一半。Terra 在智能基准上持平 GPT‑5.5,价格减半。Luna 是最快且最便宜的型号,定价比 Sol 低 80%。
实现这些效率提升依赖对整个技术栈的优化,本文重点介绍了两个方向:推理栈和代理编排层。在推理方面,OpenAI 利用 GPT‑5.6 Sol 协同 Codex 自主完成了多项改进:
– 负载均衡:GPT‑5.6 Sol 分析生产流量、发现此前被忽视的不均衡点、测试新路由策略并持续调优启发式算法,显著降低了服务成本。
– 内核优化:GPT‑5.6 Sol 在 Triton 和 Gluon(OpenAI 维护的开源 GPU 编程语言)中自主重写并优化了生产内核,端到端服务成本降低了 20%。验证工具 FpSan(浮点消毒器)用于确认内核的正确性。
– 推测解码:GPT‑5.6 Sol 自主设计并运行了数百个架构实验来改进自己的草稿模型,在规模、结构和特征上测试变更,并启动了训练过程,在出现硬件故障或不稳定时自主干预。由此使 token 生成效率提升了 15% 以上。
– KV 缓存与配置超优化:针对不同工作负载(提示/输出长度、批大小、缓存命中率等),GPT‑5.6 Sol 分析生产负载、生成并评估候选配置,实现了场景级别的超优化,从相同硬件中提取更多有效推理。
在代理编排层(Agentic Harness,基于 Rust 的编排层),优化集中于减少循环内的重复工作:
– 避免上下文膨胀:通过延迟发现机制,工具、技能、插件和 MCP 集成只在需要时才可被调用,防止意外占用上下文窗口。工具输出默认上限为 10,000 token。
– 保留精确前缀以最大化提示缓存命中:将所有历史视为仅追加,新消息、工具结果和环境更新追加到末尾而非插入到前面;工具以确定性顺序呈现;运行时设置(如审批策略)在执行时应用,而非嵌入工具定义。这些设计让 Codex 和 ChatGPT Work 的整体提示缓存命中率维持在高水平。
OpenAI 强调,这些改进是多年层层累积的结果,而 GPT‑5.6 Sol 自主参与优化流程让他们对优化速度的持续加快感到乐观。后续计划在核芯优化和堆栈基础层继续推进。


