Google团队分享Agent行为调教:Evals比Prompt更重要

视频亮点

01:10

纯 prompt 无法产生稳定行为,需要 eval 作为反馈信号

10:28

Agent trace 日志暴露失败原因,避免修新 bug 破旧功能

14:29

评价指标的小改动可能完全颠覆 agent 行为结果

⭐⭐⭐⭐ 4.0

Preetika Bhateja(Google/YouTube PM)和 Daniel Bump(Google 工程师)在一场对谈里,拿他们内部构建的 seed-asset agent 当案例,讲清楚了为什么光靠写 prompt 搞不定 Agent 行为——核心问题是 prompt、eval、迭代、反馈构成一个闭环,任何一环的微小改动都可能颠覆结果。他们专门处理广告素材里的低质量图片、拥挤视觉和文字叠压,要把这些脏数据洗成干净的种子资产,供下游生成式 AI 工具复用。

两位嘉宾的核心观点很实在。[Preetika] 明确说:纯 prompt 根本无法输出稳定行为,必须把 eval 从“打分卡”变成“反馈信号”,让 agent 在循环里自己修正;[Daniel] 补充,agent trace log 才是真正暴露失败原因的东西,团队靠日志定位到具体节点,才做到“修了新 bug 不破旧功能”。他们反复强调,eval 不是终点,而是迭代的燃料——小到一条 prompt 措辞变化,大到 eval 指标切换,都可能让 agent 行为彻底跑偏,所以必须系统化工程,不能靠感觉调。

这个 case 对行业最大的启示是:Agent 行为工程的核心正在从 prompt engineering 转移到 eval-driven 的反馈闭环。Google 这套经验说明,未来做 agent 开发,谁先建起可复用的 eval 系统和 trace 分析工具,谁就能更快驯服复杂行为。尤其是当 Agent 要对接下游多个生成模型时,这种可控性会成为关键竞争壁垒。

Preetika Bhateja(Google/YouTube PM)和 Daniel Bump(Google 工程师)在一场对谈里,拿他们内部构建的 seed-asset agent 当案例,讲清楚了为什么光靠写 prompt 搞不定 Agent 行为——核心问题是 prompt、eval、迭代、反馈构成一个闭环,任何一环的微小改动都可能颠覆结果。他们专门处理广告素材里的低质量图片、拥挤视觉和文字叠压,要把这些脏数据洗成干净的种子资产,供下游生成式 AI 工具复用。

两位嘉宾的核心观点很实在。[Preetika] 明确说:纯 prompt 根本无法输出稳定行为,必须把 eval 从“打分卡”变成“反馈信号”,让 agent 在循环里自己修正;[Daniel] 补充,agent trace log 才是真正暴露失败原因的东西,团队靠日志定位到具体节点,才做到“修了新 bug 不破旧功能”。他们反复强调,eval 不是终点,而是迭代的燃料——小到一条 prompt 措辞变化,大到 eval 指标切换,都可能让 agent 行为彻底跑偏,所以必须系统化工程,不能靠感觉调。

这个 case 对行业最大的启示是:Agent 行为工程的核心正在从 prompt engineering 转移到 eval-driven 的反馈闭环。Google 这套经验说明,未来做 agent 开发,谁先建起可复用的 eval 系统和 trace 分析工具,谁就能更快驯服复杂行为。尤其是当 Agent 要对接下游多个生成模型时,这种可控性会成为关键竞争壁垒。

How Evals and Prompts Shape Agent Behavior — Preetika Bhateja & Daniel Bump, YouTube Ads

查看原文