From Agent Traces to Agent Simulations — Rustem Feyzkhanov, Snorkel AI

Highlights

04:01

The success rates published by public benchmarks and other people's tasks are irrelevant; what you truly care about is the cost and latency of each solved task.

06:34

Reconstruct the environment, tools, and files from production traces, so that any model can replay tasks under the same conditions.

15:19

Agent tests should be integrated into the CI pipeline, just like tests that gate code.

Snorkel AIRustem Feyzkhanov 提出,与其依赖 WebArena 这类公共基准测试,不如从你的生产环境 Agent 轨迹中重建一个私有仿真环境。你真正关心的是每个已解决任务的成本、延迟以及 Agent 是否遵循了你的策略。

公共基准直接给你一个单一的成功率数字,但那是基于他人的任务。你实际需要的是在自有环境中,相同技能、工具和评估器下,对模型进行直接对比。从生产轨迹重建——包括还原数据库状态、工具和文件——你就有了一个任何模型都能在相同条件下重放的任务。

任务格式包含指令文件和 Oracle 数据。环境是多步骤、长周期的,因此需要一个验证器来读取最终状态,同时用 LLM 作为裁判来检查 Agent 是否遵循了策略。一旦 Agent 明显偏离轨道,运行可以中途停止。

棘手部分包括:Agent 对仿真进行奖励劫持、缺失的夹具(fixtures)、以及最终被证明无法解决的任务。所有公司最终都需要自己的私有基准,作为 Agent 运维循环的一部分。

Feyzkhanov 认为,这应该属于 Agent 的 CI 管线,就像测试把关代码一样。它连接了可观测性轨迹、实验和基准测试,从而随着 Agent 的变化而保持更新。

Snorkel AIRustem Feyzkhanov 提出,与其依赖 WebArena 这类公共基准测试,不如从你的生产环境 Agent 轨迹中重建一个私有仿真环境。你真正关心的是每个已解决任务的成本、延迟以及 Agent 是否遵循了你的策略。

公共基准直接给你一个单一的成功率数字,但那是基于他人的任务。你实际需要的是在自有环境中,相同技能、工具和评估器下,对模型进行直接对比。从生产轨迹重建——包括还原数据库状态、工具和文件——你就有了一个任何模型都能在相同条件下重放的任务。

任务格式包含指令文件和 Oracle 数据。环境是多步骤、长周期的,因此需要一个验证器来读取最终状态,同时用 LLM 作为裁判来检查 Agent 是否遵循了策略。一旦 Agent 明显偏离轨道,运行可以中途停止。

棘手部分包括:Agent 对仿真进行奖励劫持、缺失的夹具(fixtures)、以及最终被证明无法解决的任务。所有公司最终都需要自己的私有基准,作为 Agent 运维循环的一部分。

Feyzkhanov 认为,这应该属于 Agent 的 CI 管线,就像测试把关代码一样。它连接了可观测性轨迹、实验和基准测试,从而随着 Agent 的变化而保持更新。

From Agent Traces to Agent Simulations — Rustem Feyzkhanov, Snorkel AI

View Original