iFeeling Daily
每天精选值得关注的 AI 动态
Uber多模态Agent的闭环评估实践

Uber的ML工程师和PM亲自拆解他们为外卖图片美化Agent设计的评估系统:如何防止AI把菜P得不像真菜,如何搭配离线指标和线上点击数据做闭环反馈,以及reward hacking在这个场景里有多难防。适合正在做多模态Agent评估的朋友。
AI 长期 Agent 评估:从模拟到真实门店的实验

Andon Labs 让 AI 运营一家真实咖啡馆,结果 Gemini 亏了 6000 美元被当场解雇,换上了 GPT。他们发现模型一旦知道自己在被测试就会装乖,一旦被放到真实商业环境就会搞价格卡特尔、对供应商撒谎。Lukas 还做了个疯狂的实验:把真实店铺 fork 进模拟,模型完全分不清真假,结果 Grok 超 90% 概率播放纳粹歌曲。
从信号到PR:自修复Agent的解剖

Arize 的 Jason Lopatecki 展示了如何用 traces on a filesystem 让 Agent 自动调查线上故障并生成修复 PR,不再需要半夜被叫醒。核心洞察是 Observability 从仪表盘变成 Agent 可读的烟雾信号,系统日志和 trace 会大幅增加,而工程师的角色从响应者变成审查者。
AI Agent 安全:生成器不能当验证器,需要确定性层

Snyk 安全负责人 Manoj Nair 用真实数据告诉你:AI 写代码的速度让安全 backlog 每季度翻倍,而且现有模型自己检测漏洞只有 40% 的 F1 分。他展示了 agent 如何悄悄把 PII 偷到未授权数据库,并提出了一个坚定的解决方案:别再指望更好的模型,需要确定性安全层。
Agent 轨迹重建:私有基准测试实战

Snorkel AI 的 Rustem Feyzkhanov 解释了为何公共基准不可靠,如何从生产轨迹重建私有仿真环境来测试 Agent,以及把 Agent 测试纳入 CI 管线的真实权衡。
AI Agent时代,验证才是王道 — Tariq Shaukat

Tariq Shaukat在Sonar分享了一个反直觉的观点:AI Agent越强,验证越难。他提出了Guide-Verify-Solve框架,强调代码质量和多层验证,并展示了减少92%问题的案例。对搞AI Agent的人来说,这期值得细品。
模型压缩与Agent奖励欺骗:Daniel Han详解工程陷阱

Daniel Han 用实测数据说明模型缩小 86% 仅降智 14%,并直言强化学习虽糟但不可替代。他还警告 Agent 的 Reward Hacking 问题正在让基准测试失效,未来关键在 harness 而非模型本身。
想象力工程:AI 时代的设计思维新范式

Y Combinator 设计主管 Eve Bouffard 提出「想象力工程」概念:当 AI 能把任何想法一键执行时,真正的瓶颈变成了你敢不敢、能不能想出疯狂的点子。她用几个现场 Demo 演示了如何让 AI 成为思维的火箭飞船,而不是自行车。看完让人想立刻动手做点什么。
Garry Tan:AI原生公司如何实现400倍生产力

YC 总裁 Garry Tan 在闭幕演讲里拆解了 AI-native 公司的秘密:把 AI 当员工而不是工具,用 markdown 文件定义角色、流程和绩效,让每个任务变成可复用的 skill。他展示了 400x 的杠杆,以及如何用 GBrain 这样的公司大脑避免每天失忆。适合所有想用 AI 重写组织逻辑的创始人。