
智能体到底需要多少记忆?

这篇博客回答了智能体记忆配置的核心问题:给智能体注入多少自蒸馏经验才合适?答案不是越多越好,而是取决于模型自身的能力等级。作者基于八款模型的对比测试,总结出三种规律,并给出了可落地的校准策略。
作者用 ALTK-Evolve 框架让智能体从自己的历史轨迹中提取行为准则(成功的策略、要避免的错误、边界情况),在推理时注入上下文,不更新权重、无需人工标注。关键发现是:不同模型对记忆的“剂量”需求完全不同。强模型有冗余能力,喜欢完整的准则集,每一条都吸收;弱模型会被大准则集淹没,更适合一个高置信核心加少量按任务检索的准则;而已经饱和的模型则没有任何可测收益。例如 DeepSeek-V3.2 (671B MoE) 给全量准则后任务完成率提升 +9.5pp,而 gpt-oss-120b (117B MoE) 用选择性检索提升 +16.1pp,且全量准则反而效果差且更贵。GLM-5 (745B MoE) 则落在饱和区,两种配置都没有提升。
作者强调,这种差异不是由参数量简单决定的,基准冗余、上下文窗口、架构、准则质量、任务分布都在起作用。但实操结论已经清晰:记忆应当校准,而非简单累积。成本数据进一步证明了选择性检索的优势:gpt-oss-120b 用选择性检索每任务只增加 5% 的 token(从110K到116K),而全量准则要增加 51%(到166K)。DeepSeek 用全量准则增加 78%(从148K到263K),但推理步数基本不变(约18-19步),所以开销主要来自输入膨胀。作者特别提到,生产环境中可以利用 prompt caching 缓存准则集的静态部分,大幅降低有效成本,因此设计提示词时要保持准则前缀稳定。
测试在 AppWorld 基准上进行,包含 585 个多步任务(168 个 test_normal 加 417 个 test_challenge),覆盖 9 个模拟应用。评估采用两个指标:TGC(任务目标完成率,衡量单个任务是否完全完成)和 SGC(场景目标完成率,一个场景包含同一任务的多个变体,必须全部成功才算通过,更严格)。SGC 的提升普遍大于 TGC,比如 DeepSeek 的 SGC 提升 +16.1pp(对应 TGC 仅 +9.5pp),因为好准则特别有助于智能体通过场景的全部变体,而不仅是平均情况。即使接近上限的 GPT-5.5 和 Claude Opus 4.6,SGC 也分别提升 +7.2pp 和 +7.1pp,说明只要还有剩余失败模式,记忆就能继续创造价值。
文章也坦诚指出了局限:当前检索用余弦相似度排序,并不完美预测哪些准则对任务有用;对极弱模型,自蒸馏缺乏信号,需要教师蒸馏;目前只在 AppWorld 上验证,其他基准和生产部署还在进行;上下文窗口的影响尚未进行对照实验。作者给出了明确的下一步计划:训练一个有监督的选择器,探索弱模型的教师蒸馏记忆,扩大基准范围,以及隔离上下文窗口变量。整体来看,这不是一篇空谈趋势的文章,而是有数据、有对比、有成本核算的工程实践总结,对于做 Agent 内存设计的开发者很有参考价值。


