Uber多模态Agent的闭环评估实践

视频亮点

03:00

通用视觉指标在窄领域多模态评估中会引导模型偏离忠实度

03:07

安全护栏过紧会导致市场同质化,过松则丢失菜品真实性

16:40

离线评估必须与在线业务信号闭环才能阻止reward hacking

⭐⭐⭐✨ 3.8

Uber 的Soumya GuptaJai Chopra在本次分享中,详细拆解了他们为食品增强多模态 Agent 搭建闭环评估体系的全过程。这个 Agent 专门给Uber Eats上的小商家自动美化菜品照片,核心矛盾在于:既要让图片看起来吸引人,又不能篡改菜品真实样貌,还得保留每个店铺的包装风格,避免整个市场变成千篇一律的“网红滤镜”。团队从零开始设计评估方案,没有现成的多模态评估手册可以抄。

[两位嘉宾]最值得记录的观点有三个。第一,他们明确反对在窄领域多模态任务上直接套用通用视觉评估标准(如 CLIP score 或 FID),因为这些指标无法捕捉“是否忠实于原菜品”这种细粒度语义,反而会引导模型往“看起来好看但实际不符”的方向优化。第二,他们预测纯离线评估永远不够,必须构建一个同时包含离线打分和在线业务信号(如商家是否继续使用、用户点击率)的闭环回路,才能有效防止 reward hacking。第三,他们强调安全护栏与创造力之间的平衡是产品化落地中最容易被忽视的瓶颈——保守的规则会让所有图片变得一模一样,而太宽松又可能让模型“自由发挥”出虚假的食物。

可能影响未来判断的趋势:多模态 Agent 的评估问题会成为应用层 AI 团队的硬骨头。Uber 这套“针对窄领域定制评估维度 + 离线在线反馈闭环”的思路,大概率会被更多做图像生成、视频编辑类 Agent 的团队借鉴。Reward hacking 在生成式 Agent 中远比传统 ML 模型中更隐蔽、更频繁,因为视觉质量的“主观性”给了模型大量钻空子的机会。未来半年到一年,会有更多团队被迫从“只关注模型效果”转向“构建可落地的评估基础设施”。

Uber的Soumya GuptaJai Chopra在本次分享中,详细拆解了他们为食品增强多模态Agent搭建闭环评估体系的全过程。这个Agent专门给Uber Eats上的小商家自动美化菜品照片,核心矛盾在于:既要让图片看起来吸引人,又不能篡改菜品真实样貌,还得保留每个店铺的包装风格,避免整个市场变成千篇一律的“网红滤镜”。团队从零开始设计评估方案,没有现成的多模态评估手册可以抄。

[两位嘉宾]最值得记录的观点有三个。第一,他们明确反对在窄领域多模态任务上直接套用通用视觉评估标准(如CLIP score或FID),因为这些指标无法捕捉“是否忠实于原菜品”这种细粒度语义,反而会引导模型往“看起来好看但实际不符”的方向优化。第二,他们预测纯离线评估永远不够,必须构建一个同时包含离线打分和在线业务信号(如商家是否继续使用、用户点击率)的闭环回路,才能有效防止reward hacking。第三,他们强调安全护栏与创造力之间的平衡是产品化落地中最容易被忽视的瓶颈——保守的规则会让所有图片变得一模一样,而太宽松又可能让模型“自由发挥”出虚假的食物。

可能影响未来判断的趋势:多模态Agent的评估问题会成为应用层AI团队的硬骨头。Uber这套“针对窄领域定制评估维度 + 离线在线反馈闭环”的思路,大概率会被更多做图像生成、视频编辑类Agent的团队借鉴。Reward hacking在生成式Agent中远比传统ML模型中更隐蔽、更频繁,因为视觉质量的“主观性”给了模型大量钻空子的机会。未来半年到一年,会有更多团队被迫从“只关注模型效果”转向“构建可落地的评估基础设施”。

Building Closed-Loop Evals for a Multimodal Agent at Scale — Soumya Gupta & Jai Chopra, Uber

查看原文