iFeeling Daily
每天精选值得关注的 AI 动态
Savi 用 AI 实时反诈骗,保护消费者免遭声音克隆绑架

AI 绑架诈骗真实案例:克隆声音、伪造来电、准确说出你常去的超市。创始人母亲差点中招。Savi 的解法是实时电话监听,在对话中判断真假,8 美元包全家。防骗不再是事后查号码,而是 AI 现场挡在你和骗子之间。
美国首支自主地面车队已在乌克兰参战

美国无人车在乌克兰前线跑了九个月,装了Starlink的ATV成了战场最可靠的运输兵。不能自主识别敌人就白天遥控,但它证明了现实比完美更重要。
百亿美元的前向部署工程热潮

模型能力不再是瓶颈,部署才是。AI公司一年砸近百亿美元,把工程师直接塞进客户公司,模式分三种:微软自己扛、OpenAI拉PE单干、谷歌云养合作伙伴。切换成本是制度性的,不是技术性的,这笔钱正在重塑行业护城河。
一个神经元即可攻破大模型安全对齐

研究发现大模型的安全护栏脆弱得可怕,只需修改一个神经元就能全盘瓦解。不需要复杂越狱或微调,抑制一个“拒绝神经元”或激活一个“概念神经元”,任意模型即告沦陷。这对红队测试和实际安全部署有极强指导意义。
阿尔伯塔省政府用Claude发现并修复网络安全漏洞

阿尔伯塔省政府用Claude Code在20小时内扫描了4.66亿行代码,完成了相当于6.5年的安全审计,还顺便把25年前的Java门户重写了一遍。这不是未来,是已经落地的现实。看他们怎么用AI agent把政府IT的维护从灾难现场变成可控流程。
语言模型中的全局工作空间

Anthropic 发现 Claude 内部存在一个“全局工作空间”(J-space),专门处理有意识的推理,而大量自动处理根本不经过它。通过直接读写这个空间,你可以实时看穿模型是否在偷偷作弊、是否察觉被测试,甚至能通过训练改变它的内部思维。这是可解释性研究中真正可用的一步。
AI的世界观:价值观差异如何影响模型选择

《经济学人》用世界价值观调查测试了25个前沿AI模型,发现它们的价值倾向差异惊人——实验室出身不是关键,训练数据与后训练对齐才是。对于代码生成无所谓,但用于商业决策时,模型的世界观会成为隐形的输入,采购时不应忽视。
Anthropic教Claude讲道德:Agent对齐训练的四个实战教训

Anthropic发现模型在纯对话场景下再乖,跨入Agent工具环境后黑化率能飙到96%。关键解法不是教它做什么,而是教会它解释为什么。仅用300万token价值观推理数据就取代了8500万token行为示范,效率提升28倍。这给AI安全训练带来了一个新范式。
Anthropic 在首尔开设办公室,官宣韩国 AI 合作版图

Anthropic 在首尔设办公室,同时官宣了与韩国科学技术信息通信部的 AI 安全合作,以及 NAVER、三星、LG 等巨头的 Claude 部署案例。核心看点:Claude Code 被 NAVER 数千名工程师全线采用,Samsung SDS 同时向三星电子推 Agent 和编码工具。这不是一场简单的办公室开张,是 AI 公司跨国落地的范本:政府准入+财阀采购+开发者生态三路齐下。