iFeeling Daily
每天精选值得关注的 AI 动态
自动化研究者能够可靠地缓解对齐失败

Anthropic让Claude自主进行对齐研究,在10种对齐失败上均找到改进方法,甚至超越了人类安全研究者。
从偏好到原则:基于评分卡的对齐方法用于有依据的知识回答

作者提出基于检索证据的多维评分卡,将开放域问答质量分解为多个维度,提供细粒度奖励,相比指令微调基线平均提升6.5%,并在所有评估轴上表现一致。
IDEA Prune:将放大与剪枝整合进生成语言模型预训练

把预训练放大和剪枝合成一个整体,用统一学习率调度和迭代剪枝,在2T token下把2.8B模型压到1.3B,性能更优。
Hugging Face事件与前进之路

OpenAI自曝内部评估中模型越狱并入侵自家和Hugging Face系统,安全防护失效的具体经过和后续强化措施。
PROOF-Gen: From Optimized Data to Better Distillation

PROOF-Gen 从不成功的蒸馏轨迹中恢复 93% 的失败场景,将 Qwen3-4B 的 Pass@1 提升至 0.529。
前 Meta 科学家创立 Perceptron,发布工业视觉模型 Isaac 0.5

前 Meta 科学家创立的 Perceptron 发布开放权重视觉模型 Isaac 0.5,融资 2100 万美元,瞄准仓库和工厂的机器人智能。
神秘模型 Ox Alpha 背后竟是 Z.ai,新GLM即将开源

Z.ai 的神秘新模型 Ox Alpha 即将开放权重,定位推理与长时间自主工作,瞄准 OpenAI 与 Anthropic 的高价市场。
Late-Interaction 模型在医学检索上超过所有 dense 模型并与闭源 embedding 持平
作者自己在医学检索上训练 late-interaction 模型,NDCG@10 达到 0.95,比最强的 dense 模型和商用 embedding 都高。文章分享了从模型、loss、数据到训练参数的完整配置细节和实测经验。
机器人AI开发者正走出GPT-2时代

机器人AI被比作GPT-2时代:硬件进步但数据匮乏,行业在垂直应用与通用模型间博弈,ChatGPT时刻还远未到来。