两项设置让 ARC-AGI-3 得分提升三倍

OpenAI 在尝试提升 GPT‑5.6 Sol 在 ARC-AGI-3 基准测试上的表现时发现,分数低并非模型本身的问题,而是基准测试的默认设置(官方 harness)丢弃了模型的推理过程并采用滚动截断。启用 OpenAI 自身产品(ChatGPT 和 Codex)中使用的两项 API 设置——保留推理消息(retained reasoning)和压缩(compaction)——后,得分从官方 harness 下的 13.3% 提升至 38.3%(基于相对人类动作效率 RHAE 指标,人类平均约 48%),同时输出 token 减少 6 倍

ARC-AGI-3 设计初衷是使用通用 harness 以公平比较模型,但这导致模型每次动作后都“忘记”之前的思考过程,且历史过长时早期动作被丢弃。OpenAI 的 Responses API 通过自动保留推理和压缩上下文来模拟实际部署场景。实验表明,保留推理后模型减少了每步的思考时间,并能更好地从过去经验中学习;压缩进一步保持了关键信息,提升了长序列下的表现。

OpenAI 建议 API 开发者使用 Responses API 并开启这两项设置以获得最佳性能,同时呼吁评测方采用更贴近真实使用场景的配置来评估模型。

How enabling two settings tripled our scores on the ARC-AGI-3 benchmark

查看原文