iFeeling Daily
每天精选值得关注的 AI 动态
一根电线下垂暴露数据中心电网问题

一条电线脱落导致PJM电网扰动,暴露了数据中心同步离线对电网的巨大威胁。
从LLM Judge到Agent Judge:AI评估的下一个进化

Arize AI 的 Aparna 认为,Agent 能力每提升一档,现有评估就报废一次。她提出从LLM Judge进化到Agent Judge,让一个Agent自动发现另一个Agent的失败模式,甚至直接开PR修复。这不是技术细节,是AI工程化方式的重构。
Agent 架构半衰期 6 个月:如何构建不被趋势淘汰的系统

Dan Farrelly 在演讲中犀利指出,你刚学会的 Agent 架构可能半年后就过时了。他分享了如何用核心原语构建持久化架构,避免被趋势牵着走。想看技术选型背后的真实思考吗?这个视频很有料。
微软AI知识团队负责人谈知识系统与Agent

微软 AI 知识团队负责人 Pablo Castro 聊了如何让 Agent 真正用对知识。他反对靠模型硬记,主张用 Azure AI Search 和 Foundry IQ 做外部检索,还批评了过度依赖 Prompt 的风气。全是实战经验,做 Agent 的值得看。
AI on Lakehouse: 上下文形状而非查询

Zach Blumenfeld 在 Neo4j workshop 里现场演示了为什么 Agent 拿到数据还是答错——问题不在模型,而在上下文是平的。他用三种图结构(树、社区、路径)给 Lakehouse 数据搭出骨架,然后用 MCP 喂给 Agent,效果立竿见影。有代码可跑,适合正在做 Agent 数据对接的人。
以 Rollout 为中心的 AI Agent 评估框架

Alex Shaw 和 Ryan Marten 在 Laude Institute 分享了一个以 rollout 为中心的 Agent 评估框架,结合 Harbor、Terminal-Bench 和 OpenThoughts-Agent,演示了如何用沙盒环境不断迭代优化 Agent。不看会错过一个实用的工程视角。
从信号到PR:自修复Agent的解剖

Arize 的 Jason Lopatecki 展示了如何用 traces on a filesystem 让 Agent 自动调查线上故障并生成修复 PR,不再需要半夜被叫醒。核心洞察是 Observability 从仪表盘变成 Agent 可读的烟雾信号,系统日志和 trace 会大幅增加,而工程师的角色从响应者变成审查者。
Agent 轨迹重建:私有基准测试实战

Snorkel AI 的 Rustem Feyzkhanov 解释了为何公共基准不可靠,如何从生产轨迹重建私有仿真环境来测试 Agent,以及把 Agent 测试纳入 CI 管线的真实权衡。
AI Agent时代,验证才是王道 — Tariq Shaukat

Tariq Shaukat在Sonar分享了一个反直觉的观点:AI Agent越强,验证越难。他提出了Guide-Verify-Solve框架,强调代码质量和多层验证,并展示了减少92%问题的案例。对搞AI Agent的人来说,这期值得细品。