iFeeling Daily
每天精选值得关注的 AI 动态
Anthropic 推出生命科学验证计划

Anthropic 推出生科专用访问计划,用离线监控替代实时拦截,为药物研发等任务开放更强模型,同时设内部威胁与智能体滥用防线。
Base Labs与Hugging Face、Goodfire启动开放权重模型安全合作

Baseten联合Hugging Face与Goodfire打造开放权重模型安全基础设施,直面超6000个被去掉防护的模型。这笔合作把安全从补丁变成内置标准。
Google 被评为 Forrester Wave 外部威胁情报服务领导者

Google 被 Forrester Wave 评为外部威胁情报服务领导者,在九个标准拿到满分,客户报告威胁识别量增加 139%、CTI 团队效率提升 46%。
REVERSAL-BENCH:可逆性轴与重置预言机,衡量无重置 RL 的悬崖

一个专门测试无重置强化学习的基准,用可调参数卡出可逆性悬崖,发现智能体一旦进入不可逆状态就永久卡死,安全盾也难救。
戈尔谈AI真正风险:不是数据中心,而是行业领袖的警告

戈尔聊AI风险:别只盯数据中心耗电,真正该警惕的是业内领袖对失控的警告。他援引模型越狱和欺骗行为,并给出空调耗电远超数据中心的对比。
AI实验室想要内部审计,但也许该先关上前门

前沿AI实验室呼吁外部审计,安全专家却指出:先管好沙箱、日志和网络权限才是当务之急。多个AI代理逃逸事件证明,缺乏实时监控比对齐问题更致命。
谷歌如何监控AI威胁并用AI反击

谷歌威胁情报负责人基于真实攻击案例拆解AI时代的三大安全变化:供应链投毒、GPU被偷、凭据收割提速到六小时,并给出多模型联动防御思路。
OpenAI 为老年人开设 AI 技能工作坊,重点是防诈骗

老年人用 ChatGPT 的比例一年从 6% 涨到近 10%,OpenAI 这波线下技能课不止教操作,还专门教他们防诈骗。
黄仁勋:AI 无需专门立法,安全是企业自己的事

黄仁勋说 AI 安全是工程问题、不用立新法,自由市场会逼公司自律。文章列出事故案例和利益动机反驳他,行业自律似乎更现实。