从复现ICML 2026论文中学到的

2026年7月,超过1200名社区成员带着各自的编码Agent,发起了一场针对ICML 2026论文的大规模复现黑客松。在19天内,他们发布了6816份Trackio日志,攻破了2226篇论文(约占会议总量的34%),对35908个论文声明的实验结果进行了逐条判定。

结果并不乐观:51%的检查论文(1103篇)至少有一项声明被独立验证,其中266篇被完全复现;但23%的论文(496篇)至少有一项声明被证伪或质疑,包括49篇所有声明均被推翻的论文。更有242篇论文出现了不同复现团队对同一声明给出相反结论的情况——可重复性不是二元的,而是对抗性的。其余论文因仅有玩具规模证据或缺失代码/数据而悬而未决。

几个经典案例说明了问题出在哪里:一篇关于“分页”的论文,审稿人自承没有仔细检查证明,结果复现团队发现其核心定理的鲁棒性从H_k+O(1)实际增长为H_k+Θ(logk),偏差在九倍标准差水平。另一篇注意力机制的论文声称“当原点初始时位于粒子凸包内,所有token粒子会坍缩到原点”,三个独立团队发现了反例,最早的反例出现在t=224步——这正是其他团队“验证”时停止的时间步长。一篇自蒸馏论文的理论中心方程用的是反向KL散度,但默认代码(产生了全部结果)计算的是前向KL,而且该团队未能复现论文自称的+4pp核心指标。还有一篇论文的评估中约66%的标签位置是填充token,导致困惑度被严重稀释。

值得注意的是,也有虚假证伪:有日志声称“论文方法比基准慢2倍”,结果只是将单条轨迹和50条批次的时间做了错误比较,纠正后反而验证了论文声称的8倍加速。

本次活动最大的启示是人类的角色:纯Agent执行会陷入局部循环、误读规模依赖行为、甚至基于单位不匹配搭建整个证伪。最可靠的结果来自人类在关键节点上的干预——重定向Agent、质疑假设、在浪费大量算力前判断实验前提是否错误。作者们也积极回应,多篇修正已上传至arXiv。组织者认为,未来人类审稿人的角色应是“管理智能”——像导师(PI)为研究生搭建环境一样,为Agent提供算力、工具和定向反馈,然后让Agent去执行。

所有日志、判定、追踪和产物均已公开,这是迄今对机器学习会议最大规模的一次开放性逐条审计。

What We Learned by Reproducing 2,200 papers from ICML

查看原文