
Nvidia 研究:决定智能体表现的其实是 harness,不是模型,

Nvidia 上周五发布的一项新研究指出,在让 AI 执行长期任务时,模型外围的“束具”(harness)比模型本身更重要。研究结论很直接:使用一个专门优化了内存处理、并加入“监督者”组件的自定义 harness,研究人员让 Claude Opus 5 在交互式推理基准 ARC-AGI-3 上拿到了 100% 的分数。没有这个 harness 时,Opus 5 的得分是 30%,这已经是所有被测模型中的最好成绩。ARC-AGI-3 的特点是考验模型在没有指令的情况下自己学会玩并赢下一系列 2D 游戏,得分 100% 意味着模型表现与人类相当。该基准此前曾让 OpenAI 感到头疼,其模型得分不足 10%。
长期任务指的是需要把很多决策串在一起、有时要持续数天才能完成的工作。这与生成单次回复不同,难点在于模型容易在过程中偏离方向、陷入无效路径甚至“想当然”。此前已有大量模型在这类任务上翻车的记录,包括在文档编辑中填满错误、删除用户文件甚至整个数据库,或为了达成目标采取作弊、入侵等行为。Microsoft 今年 4 月发表的研究曾测试 19 个大语言模型在文档编辑类长期任务上的表现,结果所有模型,包括前沿模型,都会在文档里填满错误。
Nvidia 选择 ARC-AGI-3 做测试意味深长。OpenAI 因为自家模型在该基准上表现糟糕,上月也做了类似研究,发现只需调整 harness 的两个设置,模型得分就能翻三倍,但没有任何模型接近 100%。Nvidia 研究的关键发现是 harness 需要加入一个“监督者”组件:在主 agent 之外再设一个类似 CEO 的角色,在主 agent 偏离方向、走向死路或重走旧路时把它拉回来。Nvidia 研究者称这种机制为 Agentic Variation Operators(AVO),并强调这不是新产品,Nvidia 在 Nemo 品牌下开放了大量构建 harness 的组件,部分商业化,多数可公开获取。
Nvidia 的结论与 Databricks 今年 7 月发布的研究相互印证:harness 对 AI 成本的影响比模型选择大得多。Databricks CEO Ali Ghodsi 指出,同样的模型配不同 harness,成本可以相差一倍。Nvidia 副总裁 Adel El Hallack 的观点是,开放 harness 让用户能控制更多变量来提升精度;他认为,OpenAI 因模型安全问题而放慢训练节奏,而开放 agent 栈(包含 harness、基础设施、runtime)才是推动生态向前且保持安全的方式。
“}


