
Harness、Scaffold与AI Agent术语正名

AI Agent领域的术语正快速演变,但共识滞后,导致“Harness”和“Scaffold”等概念在讨论中常常混用。本文旨在厘清这些关键术语,尤其区分容易被混淆的Harness与Scaffold,并延伸到Agent、Context Engineering、训练相关概念。
Scaffolding(脚手架)是模型周围的行为定义层:系统提示、工具描述、跨步骤记忆管理(上下文工程)。它塑造模型如何看待世界和行动,但不直接驱动执行。Harness(调度器)是执行层:负责调用模型、解析输出、处理工具调用、决定何时停止。产品如Claude Code、Codex和Antigravity CLI常将整个非模型部分称为harness。两者在训练和推理中都需要分别设计,但大多数讨论和框架并没有严格区分,这正是混淆的根源。
Agent(智能体)源自强化学习:一个接收观察、返回动作的函数。在LLM世界中,Agent = Model + Harness。模型(如Claude, Qwen, DeepSeek)本身无记忆无循环,包裹上Scaffolding和Harness后成为能行动循环的Agent。同一模型套上不同Harness会表现截然不同,同一Harness换更好的模型也会改变体验。Context Engineering(上下文工程)设计模型的上下文窗口内容(系统提示、工具描述、对话历史),在推理和训练中都关键但成本不同。Policy(策略)是Agent的行为规则,部分在模型权重中学习,部分由Harness和Scaffolding决定。Tool Use(工具使用)通过结构化格式表达意图并由Harness路由执行。Skills(技能)是可复用的多步任务包,比单个工具更综合。Sub-agents(子代理)拥有自己的模型和Scaffolding,独立推理并返回结果。
训练侧术语:RL Environment(强化学习环境)是能接收动作、更新状态并返回观察的对象(如文件系统)。Trainer(训练器)循环运行Agent、计算奖励并更新模型权重,如TRL的GRPOTrainer。Rollout(回放)是一次完整Agent运行的轨迹和奖励。Reward(奖励)可以是可验证的(测试通过/失败)、学习的(人类偏好)、稀疏的(整次结束得分)或密集的(每一步得分)。Rubrics(评分细目)将奖励拆分为带权重的维度。
无论构建、部署还是使用Agent(如Claude Code、Codex、Hermes Agent),这些术语都频繁出现。本文不试图强制一种正确词汇,而是提供一个实用的心理模型,让讨论更顺畅。


