英国AISI携手EvalEval,让AI基准测试结果可复现

英国AI安全研究所(UK AISI)宣布与EvalEval联盟的下一阶段合作:AISI开始使用EvalEval的基础设施,公开分享模型评估结果。这套实践源于双方在NeurIPS 2025联合研讨会上启动的研究,AISI的反馈也直接塑造了EvalEvalEvery Eval Ever(EEE)共享schema——一个用于统一存储评估结果与配置信息的标准格式。

现实问题是:AI部署加速后,评估结果广泛散落在不同平台和格式里,往往缺少重现所需的关键信息,而重新运行评估又可能贵到无法承受。EvalEval的应对方式是一套组合:EEE schema用于结构化描述评估结果,配合开放平台Evaluation Cards,把基准元数据、运行数据和模型元数据合并成可解释的记录,让“看似相近的分数其实来自不同条件”这件事变得透明。

这轮公开内容接上了AISI此前在效率(OptStop)、统计严谨性(HiBayES)、转录分析和能力激发标准化上的工作,覆盖其论文《How Inference Compute Shapes Frontier LLM Evaluation》主实验中的五个基准:HealthBench、FrontierMath、Humanity’s Last Exam、SWE-Bench Pro、Terminal-Bench 2.0。结果对应六个前沿模型:Claude Opus 4、Claude Opus 4.5、Claude Opus 4.6、GPT-5、GPT-5.2、GPT-5.4,另附两个网络评估(Cyber CTFs 和 The Last Ones),后者使用了部分重叠的模型集合。所有数据都附带验证结果、上下文和配置信息。

论文本身展示了一个具体发现:Humanity’s Last Exam的成绩会随评估协议和推理计算量明显变化。当模型在每次尝试后从oracle获得正确性反馈,随着可用token增加,模型会持续解出更多任务。这说明评估设置会直接影响报告性能,也解释了为什么开放原始配置信息如此重要。

有了可对比的开放数据,研究人员能逐项检查个体研究,也能跨生态比较结论。例如,Terminal-Bench 2.0的结果就可以与其他评估方在不同设置下给出的同模型结果并排审视。EvalEval同时呼吁模型开发者提交已验证结果、评估开发者用EEE记录基准和运行数据、研究治理人员通过Evaluation Cards按基准或模型检索,以推动更可靠的元研究。

How UK AISI and EvalEval Are Making Benchmark Results Reproducible

查看原文