PROOF-Gen: From Optimized Data to Better Distillation

PROOF-Gen 提出了一种从失败轨迹中恢复可用训练数据的方法,用于改进工具调用模型的蒸馏。在工具调用模型的蒸馏中,标准流程是监督微调于教师模型生成的轨迹,但常规的生成-过滤机制只会保留成功的轨迹,丢弃失败的轨迹。在 τ²-bench 基准上,57% 的教师试运行失败,其中三分之二是近失(大多数工具调用正确,仅由一个关键错误导致失败)。

PROOF-Gen 的思路是:对每个失败任务,使用一个反射器分析执行轨迹和评估反馈,生成纠正性指导,引导教师模型产生通过轨迹。训练前剥离这些指导,学生模型仅从干净的演示中学习。在 τ²-bench 上,该方法恢复了 93% 的失败场景。结合数据微调后,Qwen3-4B-Instruct-2507 的 Pass@1 从 0.132 提升到 0.529,Gemma 4 E4B-it 在 BFCL v4 多轮任务上提升 +7.2 个百分点。

在部署管线中,该方法的轨迹质量提升 +6.3 个百分点目标完成率,迁移到设备端模型后仍有 +1.5 个百分点目标完成率提升,响应质量指标提升 +1.7 至 +5.0 个百分点,在每种语言环境中都呈现正迁移(非英语环境平均 +1.48 个百分点)。论文还提及了相关研究:在线蒸馏的收益条件尚不明确,以及探索计算预算在教师与学生之间分配的蒸馏缩放定律。

PROOF-Gen: From Optimized Data to Better Distillation

查看原文