iFeeling Daily
每天精选值得关注的 AI 动态
药物发现中的扩散模型创新远超图像生成

前Meta Llama训练负责人Sergey Edunov说扩散模型在药物发现中的创新比图像生成更前沿。Genesis发布了PEARL,能预测配体结合并模拟蛋白质柔性变形,还做了首个agentic系统SAPPHIRE。对2Å RMSD基准的批评也很尖锐。
Claude Sonnet 5:更智能、更自主的Sonnet模型

开发者最想要的Agent模型长什么样?就是Sonnet 5这样:几乎拥有Opus级别的推理和自主完成任务能力,但价格直接砍半。它能自己写测试复现Bug,能一口气跑完本来会卡住的端到端工作流。性能评测和真实用户反馈都在说一件事——Agent落地的性价比拐点,已经到了。
GeneBench-Pro:AI科学判断能力测试基准

AI代理能写代码做数学题,但碰到需要「科学判断」的生物学分析就露馅了。GeneBench-Pro用129道真实级难题验证了这一点——最强模型通过率不到三成,而人类专家做一道要几十个小时。它把那种模糊的「做研究的感觉」变成了可测的指标,这才是推进AI科研能力的硬门槛。
为何专业化不可避免

文章用“没有免费午餐定理”、进化生物学、市场竞争和AI实践(如AlphaFold)四大证据,论证了专业化是AI的必然方向。读完后你会重新思考“大模型通吃”的思路,转向更务实的领域专注策略。
DiScoFormer:一个跨分布同时估计密度和得分的Transformer

用Transformer同时估计概率密度和得分,无需针对新分布重新训练。在100维上比KDE误差降低37倍,还通过一致性损失实现了零样本自适应。一个值得关注的底层基础设施创新,有望降低生成模型、贝叶斯采样和科学计算的重复训练成本。
预览 GPT-5.6 Sol:新一代模型

GPT-5.6预览,最硬核的不是性能又刷榜了,而是OpenAI在安全上投入了70万GPU小时做自动化红队测试,并搭建了分层防护系统。这和能力同步升级的安全思路,比单纯堆算力更有看点。
OpenAI 研究主管:o1 是最大赌注,预训练没死

OpenAI 研究负责人 Mark Chen 一边做韩式豆腐锅一边讲 AGI、o1 和 Scaling Laws。他明确表示预训练没死,但未来要靠推理时计算。还聊了为何评估体系在崩坏、为何研究者比工程师值钱,以及最终科研可能变成全自动的 Agent 任务。有内味,有干货。
混合模型比Transformer强在哪?逐token对比揭晓答案

语言模型的评测只看平均loss会掩盖关键能力差异。研究者发现混合模型在实义词和追踪上下文上远超Transformer,但在抄写重复内容时优势消失。这篇用逐token对比揭示了架构的深层优劣。
NeMo AutoModel:一行代码让 MoE 微调提速 3.7 倍

微调 MoE 大模型最头疼的就是显存不够、通信太慢。NVIDIA NeMo AutoModel 只改一行 import,就在 Transformers v5 基础上叠加了 DeepEP 通信计算重叠和 Expert Parallelism 显存分片,把 550B 模型训练吞吐提升了 3.7 倍,还省了 32% 显存,存的 checkpoint 标准兼容 vLLM。这是一篇用工程手段解决核心瓶颈的硬核实战复盘。