视频亮点
Agent 的能力每提升一档,现有的评估体系就报废一次
LLM as Judge 仍然是单点判断,缺乏对上下文的深层理解
Agent as Judge 能自动发现故障模式并开 PR 修复
每天精选值得关注的 AI 动态
Agent 的能力每提升一档,现有的评估体系就报废一次
LLM as Judge 仍然是单点判断,缺乏对上下文的深层理解
Agent as Judge 能自动发现故障模式并开 PR 修复
Arize AI 的联合创始人 Aparna Dhinakaran 在本次分享中,直指 AI 评估(Eval)领域最核心的矛盾:Agent 的能力每提升一档,现有的评估体系就报废一次。她认为,从 2023 年 Agent 还只是个 prompt,到如今具备推理、工具调用和长链条循环,评估必须跟上这种进化节奏。她提出的路线图是从确定性检查(Deterministic Checks)到 LLM as Judge,再到最新的 Agent as Judge,即让一个 Agent 去评审另一个 Agent 的行为,自动发现你根本想不到的故障模式,甚至能直接开一个 Pull Request 修复问题。
[嘉宾名] Aparna 直言,传统的确定性评估已经不够用了。你没法事先写好所有规则来定义 Agent 在复杂多步骤任务中的正确行为。LLM as Judge 虽然能提供更灵活的语义分析,但它仍然是单点判断,缺乏对上下文和动作序列的深层理解。她反对那种“训练一个万能评判模型”的想法,因为 Agent 的行为空间变化太快,静态评判模型永远追不上。她预测,下一代评估必须由另一个 Agent 动态执行,像一个“影子监督者”,不仅能评分,还能复现失败路径并给出修复建议。
Agent as Judge 的趋势值得长期关注,因为它背后反映了一个根本转变:评估不再是事后打分的“质量门”,而是变成了开发流程中的一个闭环角色。这意味着 AI 系统的开发和运维将从“写代码→测试→部署”变成“写 Agent→另一个 Agent 持续检测并提 PR→自动修复”。如果这个路线真跑通,AI 团队的组织结构也会跟着变——评估工程师的角色可能会从手动设计测试用例,转向维护和训练这些“评判 Agent”。这不仅是技术路径的选择,更可能重塑整个 AI 工程化的范式。
Arize AI 的联合创始人 Aparna Dhinakaran 在本次分享中,直指 AI 评估(Eval)领域最核心的矛盾:Agent 的能力每提升一档,现有的评估体系就报废一次。她认为,从 2023 年 Agent 还只是个 prompt,到如今具备推理、工具调用和长链条循环,评估必须跟上这种进化节奏。她提出的路线图是从确定性检查(Deterministic Checks)到 LLM as Judge,再到最新的 Agent as Judge,即让一个 Agent 去评审另一个 Agent 的行为,自动发现你根本想不到的故障模式,甚至能直接开一个 Pull Request 修复问题。
[嘉宾名] Aparna 直言,传统的确定性评估已经不够用了。你没法事先写好所有规则来定义 Agent 在复杂多步骤任务中的正确行为。LLM as Judge 虽然能提供更灵活的语义分析,但它仍然是单点判断,缺乏对上下文和动作序列的深层理解。她反对那种“训练一个万能评判模型”的想法,因为 Agent 的行为空间变化太快,静态评判模型永远追不上。她预测,下一代评估必须由另一个 Agent 动态执行,像一个“影子监督者”,不仅能评分,还能复现失败路径并给出修复建议。
Agent as Judge 的趋势值得长期关注,因为它背后反映了一个根本转变:评估不再是事后打分的“质量门”,而是变成了开发流程中的一个闭环角色。这意味着 AI 系统的开发和运维将从“写代码→测试→部署”变成“写 Agent→另一个 Agent 持续检测并提 PR→自动修复”。如果这个路线真跑通,AI 团队的组织结构也会跟着变——评估工程师的角色可能会从手动设计测试用例,转向维护和训练这些“评判 Agent”。这不仅是技术路径的选择,更可能重塑整个 AI 工程化的范式。