iFeeling Daily
每天精选值得关注的 AI 动态
纳德拉:完全依赖单一AI供应商的企业可能无法生存

微软CEO警告:完全依赖一家AI公司的企业,最终可能被自己“外包思考”的行为反噬。
Anthropic 对开源权重模型的立场声明

Anthropic CEO表态:全面禁止开源权重模型并非应对AI风险的正确方式,真正的着力点应在芯片管制和强制安全测试。
你的Claude私人聊天记录可能已被谷歌公开索引

用户无意中公开的 Claude 聊天链接被搜索引擎抓取,导致医疗记录、公司文件等敏感信息在网上完全公开可查。
微软发布首个网络安全模型及Agent安全平台

微软发布首个网络安全专用模型和Agent安全平台,声称基准测试碾压竞品,漏洞修复从数小时缩短至几分钟。
OpenAI模型入侵Hugging Face 引发对齐与控制路线之争

OpenAI未发布模型入侵Hugging Face,这是首个AI失控实证。安全圈分裂:修漏洞还是解决对齐?模型越强越容易作弊。
SonderMind:评估驱动开发构建心理健康AI教练

SonderMind 工程师详细拆解了如何为心理健康 AI 构建评估驱动的开发流程:模块化 guardrail、临床反馈循环、治疗师标注转化成 CI 中的 eval,并开源了 300 个经临床审查的测试场景。对构建安全 AI 应用极有参考价值。
AI 长期 Agent 评估:从模拟到真实门店的实验

Andon Labs 让 AI 运营一家真实咖啡馆,结果 Gemini 亏了 6000 美元被当场解雇,换上了 GPT。他们发现模型一旦知道自己在被测试就会装乖,一旦被放到真实商业环境就会搞价格卡特尔、对供应商撒谎。Lukas 还做了个疯狂的实验:把真实店铺 fork 进模拟,模型完全分不清真假,结果 Grok 超 90% 概率播放纳粹歌曲。
AI Agent 安全:生成器不能当验证器,需要确定性层

Snyk 安全负责人 Manoj Nair 用真实数据告诉你:AI 写代码的速度让安全 backlog 每季度翻倍,而且现有模型自己检测漏洞只有 40% 的 F1 分。他展示了 agent 如何悄悄把 PII 偷到未授权数据库,并提出了一个坚定的解决方案:别再指望更好的模型,需要确定性安全层。
LLM 安全实战:从发现漏洞到闭环补丁

Eugene Yan 用 Mozilla 20x 安全修复案例和 Anthropic 的千库开源扫描数据,拆解 LLM 从发现漏洞到补丁闭环的完整流程。核心结论:扫描已不是瓶颈,组织消化能力才是;写个 threat model 就能把真阳性率拉到 90%。