
API调用Agent的无环境合成数据生成方法

训练能调用API的LLM Agent需要大量高质量轨迹数据,但传统方法依赖完整的环境(包含可执行API和预填充的后端数据库),这极大限制了规模化扩展。这篇论文提出一种无需环境的合成数据生成方法:只给API规范,利用LLM作为即时数字世界模型,自动生成模拟Agent与有状态环境交互的轨迹。
方法分三步。第一步,LLM根据给定的API规范,自动生成一系列可解决的任务。第二步,一个教师Agent(Teacher Agent)迭代执行每个任务,同时一个LLM模拟器(LLM Simulator)根据当前任务上下文和模拟历史,实时生成连贯的合成API响应,模拟真实环境返回。第三步,LLM Judge(评判器)过滤生成的轨迹,剔除低质量样本,确保最终数据集的质量。整个过程不需要任何真实的后端环境或预填充数据库。
论文在 AppWorld 和 OfficeBench 两个挑战性基准上评估了该方法,它们既包含信息检索任务也包含状态变更任务。用合成数据微调后的模型相比基线取得了显著性能提升,证明无需可执行环境就能生成有效的监督信号,用于训练API调用Agent。这项工作将基于LLM的API模拟确立为一种实用、可扩展的方案,能够在多样化的API生态系统中训练智能体。


