iFeeling Daily
每天精选值得关注的 AI 动态
FFASR基准测试:在真实世界中评估远场语音识别
首个开放远场ASR基准测试上线,量化了模型在真实房间声学环境下的性能骤降,揭示近场与远场WER的差距可达数倍。
OpenAI 联合博通发布 LLM 专用推理芯片 Jalapeño

OpenAI 联合 Broadcom 为其旗舰模型量身打造的专用推理芯片 Jalapeño 发布,实现了远超现有方案的能效比,并用9个月刷新了芯片开发记录。这不是又一个AI芯片新闻,而是软硬一体全栈整合的终极案例。
GPT-5 Pro 如何破解免疫学家三年未解之谜

免疫学家Unutmaz用一个困扰实验室三年、传统方法无法解释的T细胞分化谜题,验证了GPT-5 Pro的推理能力。AI不仅指出关键蛋白IL-2的作用,还正确预测了未发表的实验结果。这不再是信息检索,而是真正的科学协作。
指标依赖的标注饱和:从标签分布中学习

论文用ChaosNLI的100个标注数据做实验,发现评估目标不同,标注饱和点天差地别:识别样本分歧度需要20-50个标注,但逼近真实分布只需10个。这直接挑战了统一标注预算的做法,对训练软标签模型很有参考价值。
开源模型+行业数据:AT&T与GSMA用Gemma给电信AI趟路

电信行业有张自己的“考卷”,通用大模型几乎得零分。GSMA和AT&T用谷歌的Gemma开源模型做了一次教科书式的示范:用行业私域数据微调出的小模型,准确率碾压通用巨无霸,还把幻觉控制住了。这条路径对所有垂直行业都有直接参考价值。
未来产品都是活系统:Ronak Malde 谈企业 AI 持续学习
Ronak Malde 之前在 Windsurf 做 AI coding agent,公司被 Google DeepMind 收购后,他创立了 Trajectory.ai,目标是让企业 AI 系统在生产中持续学习,而不是一次训练就放着不管。
用AI帮助医生诊断儿童罕见遗传病

波士顿儿童医院和哈佛用OpenAI o3模型重新分析了376个多年未解开的罕见病基因病例,新增了18个诊断(提高4.8%)。模型不是直接诊断,而是生成带证据链的假设让专家审查。这告诉我们,AI最实用的价值不是替代医生,而是帮专家在旧数据中系统性地挖出新答案。
超越 LoRA:最流行的微调方法不一定最好
LoRA 并非微调最优解,Hugging Face 用统一基准证明 OFT 等新方法在准确率和内存两项指标上均能同时超越它。
用真实科研工作流给AI打分:LifeSciBench来了

为什么现有的AI评测测不出模型能不能帮科学家干活?答案在LifeSciBench:一个由173位博士级科学家设计的基准,直接对标真实科研中的多步推理、证据整合和判断决策。结果告诉你,模型在纯文本上还行,一遇到图表和序列文件就掉三成。到底差在哪,看这个就知道。