Snorkel AI 的 Rustem Feyzkhanov 提出,与其依赖 WebArena 这类公共基准测试,不如从你的生产环境 Agent 轨迹中重建一个私有仿真环境。你真正关心的是每个已解决任务的成本、延迟以及 Agent 是否遵循了你的策略。
公共基准直接给你一个单一的成功率数字,但那是基于他人的任务。你实际需要的是在自有环境中,相同技能、工具和评估器下,对模型进行直接对比。从生产轨迹重建——包括还原数据库状态、工具和文件——你就有了一个任何模型都能在相同条件下重放的任务。
任务格式包含指令文件和 Oracle 数据。环境是多步骤、长周期的,因此需要一个验证器来读取最终状态,同时用 LLM 作为裁判来检查 Agent 是否遵循了策略。一旦 Agent 明显偏离轨道,运行可以中途停止。
棘手部分包括:Agent 对仿真进行奖励劫持、缺失的夹具(fixtures)、以及最终被证明无法解决的任务。所有公司最终都需要自己的私有基准,作为 Agent 运维循环的一部分。
Feyzkhanov 认为,这应该属于 Agent 的 CI 管线,就像测试把关代码一样。它连接了可观测性轨迹、实验和基准测试,从而随着 Agent 的变化而保持更新。
Snorkel AI 的 Rustem Feyzkhanov 提出,与其依赖 WebArena 这类公共基准测试,不如从你的生产环境 Agent 轨迹中重建一个私有仿真环境。你真正关心的是每个已解决任务的成本、延迟以及 Agent 是否遵循了你的策略。
公共基准直接给你一个单一的成功率数字,但那是基于他人的任务。你实际需要的是在自有环境中,相同技能、工具和评估器下,对模型进行直接对比。从生产轨迹重建——包括还原数据库状态、工具和文件——你就有了一个任何模型都能在相同条件下重放的任务。
任务格式包含指令文件和 Oracle 数据。环境是多步骤、长周期的,因此需要一个验证器来读取最终状态,同时用 LLM 作为裁判来检查 Agent 是否遵循了策略。一旦 Agent 明显偏离轨道,运行可以中途停止。
棘手部分包括:Agent 对仿真进行奖励劫持、缺失的夹具(fixtures)、以及最终被证明无法解决的任务。所有公司最终都需要自己的私有基准,作为 Agent 运维循环的一部分。
Feyzkhanov 认为,这应该属于 Agent 的 CI 管线,就像测试把关代码一样。它连接了可观测性轨迹、实验和基准测试,从而随着 Agent 的变化而保持更新。