
Agent Seer:从规范理解合成测试场景

评估依赖外部工具的AI agent需要逼真的测试场景,但手工构建成本高且难以扩展。新工作Agent Seer提出一种自动化方案:仅凭单个Model Context Protocol (MCP) 规范,无需示例、实时工具访问或领域微调,即可合成包含多轮对话的评估场景。其流程包括丰富原始schema、生成分级场景和合成工具输出,最终形成基于模拟数据的多轮对话,并保持工具调用正确性和对话连贯性。
在横跨多个领域、不同规模的7个MCP规范上测试,Agent Seer在全部领域达到高质量,中小型规范上实现完全工具覆盖。进一步分析发现:参数模式的复杂程度是影响场景质量的最主要因素(工具集大小的影响较小且正交);参数值的准确性是导致不完美场景的首要失败原因,而粗粒度的名称匹配指标无法捕捉这一子维度。
文章末尾还附带介绍了PORTool方法(一种重视重要性的策略优化算法)以及关于工具调用agent轨迹评估的讨论,这些内容共同指向了当前agent评估与训练中的关键挑战。


