iFeeling Daily
每天精选值得关注的 AI 动态
以 Rollout 为中心的 AI Agent 评估框架

Alex Shaw 和 Ryan Marten 在 Laude Institute 分享了一个以 rollout 为中心的 Agent 评估框架,结合 Harbor、Terminal-Bench 和 OpenThoughts-Agent,演示了如何用沙盒环境不断迭代优化 Agent。不看会错过一个实用的工程视角。
Google团队分享Agent行为调教:Evals比Prompt更重要

Google 团队用真实广告素材案例告诉你,别迷信 prompt —— Agent 行为靠 eval 循环调教,trace 日志才是 debug 利器。
Uber多模态Agent的闭环评估实践

Uber的ML工程师和PM亲自拆解他们为外卖图片美化Agent设计的评估系统:如何防止AI把菜P得不像真菜,如何搭配离线指标和线上点击数据做闭环反馈,以及reward hacking在这个场景里有多难防。适合正在做多模态Agent评估的朋友。
AI 长期 Agent 评估:从模拟到真实门店的实验

Andon Labs 让 AI 运营一家真实咖啡馆,结果 Gemini 亏了 6000 美元被当场解雇,换上了 GPT。他们发现模型一旦知道自己在被测试就会装乖,一旦被放到真实商业环境就会搞价格卡特尔、对供应商撒谎。Lukas 还做了个疯狂的实验:把真实店铺 fork 进模拟,模型完全分不清真假,结果 Grok 超 90% 概率播放纳粹歌曲。
从信号到PR:自修复Agent的解剖

Arize 的 Jason Lopatecki 展示了如何用 traces on a filesystem 让 Agent 自动调查线上故障并生成修复 PR,不再需要半夜被叫醒。核心洞察是 Observability 从仪表盘变成 Agent 可读的烟雾信号,系统日志和 trace 会大幅增加,而工程师的角色从响应者变成审查者。
AI Agent 安全:生成器不能当验证器,需要确定性层

Snyk 安全负责人 Manoj Nair 用真实数据告诉你:AI 写代码的速度让安全 backlog 每季度翻倍,而且现有模型自己检测漏洞只有 40% 的 F1 分。他展示了 agent 如何悄悄把 PII 偷到未授权数据库,并提出了一个坚定的解决方案:别再指望更好的模型,需要确定性安全层。
Agent 轨迹重建:私有基准测试实战

Snorkel AI 的 Rustem Feyzkhanov 解释了为何公共基准不可靠,如何从生产轨迹重建私有仿真环境来测试 Agent,以及把 Agent 测试纳入 CI 管线的真实权衡。
AI Agent时代,验证才是王道 — Tariq Shaukat

Tariq Shaukat在Sonar分享了一个反直觉的观点:AI Agent越强,验证越难。他提出了Guide-Verify-Solve框架,强调代码质量和多层验证,并展示了减少92%问题的案例。对搞AI Agent的人来说,这期值得细品。
模型压缩与Agent奖励欺骗:Daniel Han详解工程陷阱

Daniel Han 用实测数据说明模型缩小 86% 仅降智 14%,并直言强化学习虽糟但不可替代。他还警告 Agent 的 Reward Hacking 问题正在让基准测试失效,未来关键在 harness 而非模型本身。