Harness 比模型更能影响 AI 性能

Endor Labs 的 Agent Security League 发布了一组对比测试:同一个前沿模型在不同的 harness(运行框架)下表现差异巨大。GPT-5.5 在 OpenAI 原生的 Codex harness 上仅拿到 61.5% 功能正确率,切换到 Cursor 的 harness 后直接跃升至 87.2%——单凭运行时变化就产生了 25.7 个百分点的提升。Anthropic 的 Opus 4.7 在自家 Claude Code 上得分为 87.2%,在 Cursor 上则是 91.1%。两个顶尖模型都在竞争对手的 harness 里跑出了更好的成绩。

Harness 之所以成为 AI 栈中的关键杠杆,是因为它同时影响成本、质量和精度。OpenRouter 上 86–98% 的 LLM 流量来自输入 token。尽管输出 token 的单价是输入的 5 倍,但输入量实在太大,总账单仍由输入主导。Harness 决定发送哪些上下文,而许多上下文在多次查询中重复出现。智能缓存可以 节省 40-80% 的成本,同时将首 token 延迟降低 13-31%。这项结论来自对 500 个长周期 agent 会话的分析,效果在 500 到 50,000 token 的提示中线性缩放。最佳做法是只缓存稳定前缀,将动态内容放在缓存断点之后。

Harness 还负责信息检索——读取代码、引用风格指南、分析投资简报的特定章节。上下文越简洁、越精确,成本就越低。Cursor 的 harness 在技术细节上与 Claude Code 完全对标:动态提取工具、基于优先级的组装前缀、两层缓存。这正是为什么 Opus 4.7 在 Cursor 上得分更高,也是为什么 GPT-5.5 的功能正确率在离开 Codex 后近乎翻倍。

原厂绑定的方案并非没有优势。Claude Code 将缓存命中率当作可用性指标来监控,实际会话中命中率约 96%,同版本用户间共享系统提示缓存,并构建字节一致性达 99% 的分叉子 agent,从而实现 90% 的节省。将 harness、缓存 API 与模型协同设计确实能买到真正的缓存纪律。但纪律本身存在于 harness 中,而第三方 harness 完全可能追平——Cursor 的数据已经证明了这一点。

Harness 早已不是那个被轻视的“模型包装器”。它更像一位骑师,能把 AI 推送到超出模型创造者预期的性能水平。对于任何部署 LLM 的团队,投入精力优化 harness 的缓存策略和上下文管理,回报可能比更换基础模型更大。

Aftermarket Harnesses

查看原文