ALTK-Evolve:更少 token 实现同等或更优的智能体学习

ALTK-EvolveACE 都让智能体从自身轨迹中学习,但两者在如何保存和传递所学内容上分道扬镳,而这一差异直接决定了推理时的 token 消耗。

两者都拒绝压缩。ACE 将失败模式命名为 brevity bias 和 context collapse,其对策是维护一份详尽、逐条编号的 playbook,每条附有 helpful/harmful 计数器,并在读取时让模型自行提炼相关性。ALTK-Evolve 从另一方向得出相同结论:每条独立 guideline 都保留支持计数(support count),记录它由多少次独立片段产生,而且绝不将存储压缩成少数几条规则。一个被五个不同任务发现的教训与只出现一次的教训是不同对象,两者都值得保留。因此,在核心问题——是否应将智能体的经验压缩成简洁摘要——上,两者答案一致:不要压缩,要计数。ACE 的逐条计数器和 ALTK-Evolve 的支持计数是同一想法的两种表达。

分歧在于两处:记忆的构建方式和传递方式,而传递差异直接体现在 token 账单上。在构建方面,ACE 通过 Generator → Reflector → Curator 循环增长单一 playbook,采用增量 delta 更新并用嵌入去重。ALTK-Evolve 则对近似重复的教训进行聚类并在簇内合并,合并时保持支持计数——多个教训合并后,幸存者继承它们的组合计数,因此存储减少却不丢失每条 guideline 背后的经验量。它还提取类型化 guideline(策略、恢复、优化),附带因果归因和来源轨迹,并且按子任务粒度提取,使一个应用上学到的教训可以迁移到另一个应用。

在传递方面,ACE 在每一步都注入完整 playbook,无论模型或任务如何,始终相同。ALTK-Evolve 将传递视为可调节的旋钮,而非固定常量:一个由高支持 guideline 组成的小固定核心,加上按任务挑选的少量 guideline(余弦或 LLM 引导,按优先级加权),或者当模型有足够余量时,使用完整的合并集。两个系统都能获得相同教训;区别在于 ACE 总是发送全部内容,而 ALTK-Evolve 只发送给定模型实际能用的数量。

在 AppWorld 基准上,使用相同的基础 ReAct 智能体,ALTK-Evolve 在 DeepSeek-V3.2 上达到 TGC/SGC 89.3/80.4,token 消耗 263K,而 ACE 为 80.4/73.2,634K;在 gpt-oss-120b 上,TGC/SGC 56.0/37.5,token 116K,而 ACE 为 54.8/35.7,777K。在强模型上,ALTK-Evolve 在两项指标上均更优,成本约为 ACE 的 40%;在弱模型上,准确率 56.0 对 54.8,几乎持平(一次重复运行得到 54.8,与 ACE 几乎一致,处于该基准的噪声范围内),而成本约为 ACE 的七分之一。

按难度划分的结果揭示了不同故事。在 gpt-oss-120b 上,ACE 的完整 playbook 在简单和中等任务上略有优势,因为通用指令遵循足以解决大部分任务,综合提示帮助大于干扰;但在困难任务上,模型必须挑选正确教训而非浏览全部,精选检索领先,而这一层级决定了总体结果。在 DeepSeek-V3.2 上,更强模型吸收 ACE 完整 playbook 的能力在中等任务上略胜,但 ALTK-Evolve 在简单、困难及总体上均领先——有更多余量时,更多教训(以 ALTK-Evolve 方式传递)能持续帮助而非互相挤占。

ALTK-Evolve 给每个模型其最佳配置:强模型使用完整合并集,弱模型使用选择性检索,因为大上下文会压垮弱模型。这一校准带来了上述数字:在相同或更好准确率下,推理成本仅为 ACE 的一小部分;在弱模型上,这决定了引导是帮助还是妨碍。

Thinking of ACE? We Can Do It with Fewer Tokens

查看原文