olmo-eval:模型开发循环的评估工作台

在LLM开发的反复循环中,你每一步都要重跑评估——但现有工具要么是为最终模型准备的,要么像Harbor那样太重、太死板。它们处理不了不断变化的checkpoint,也看不出2.4个百分点的变化是真实改进还是噪声。olmo-eval就是为填补这个空白而生的。

它的核心是把基准定义和执行策略彻底解耦:任务(task)只管数据和评分,工具、沙盒、辅助模型全是可替换的组件。轻量基准直接跑,需要隔离的代码执行才进容器。最实用的是能逐问题对比两个checkpoint,而不是只看总分——这样你就能看清每一次改动到底改善了哪里、退步了哪里。

评估基础设施不应该只是模型出厂前的最后一道质检,它应该融入日常开发。olmo-eval把标准化的可重复评估带进了迭代循环,而且完全开源。如果你也在做模型开发,这个工具会让你的实验对比变得更清晰、更可信。

olmo-eval: An evaluation workbench for the model development loop

查看原文