PROOF-Gen:从优化数据到更好的蒸馏

在教师生成轨迹上的监督微调是将工具调用能力蒸馏到可部署模型的标准第一阶段。推动已发布工具调用代理的后训练流水线以每日或每周的节奏重新运行此阶段。

来源:Apple机器学习研究

对教师生成的轨迹进行监督微调是将工具调用功能提炼为可部署模型的标准第一阶段。驱动运输工具调用代理的训练后管道以每日或每周的节奏重新运行此阶段,每个周期支付前沿教师成本,但该机制是生成和过滤的(保留教师的通过轨迹,丢弃其余部分),并且每个周期都会留下相同的困难场景,因为失败不提供信号。在 τ 2-bench 上,57% 的教师试验失败,其中三分之二险些失败(大多数工具调用正确,但因一个决定性错误而取消)。

我们引入了 PROOF-Gen(按场景反射优化来克服失败的生成),它通过按场景提示优化从这些故障中恢复黄金轨迹。对于每项失败的任务,反思者都会分析执行轨迹和评估反馈,然后编写纠正指导,引导教师走上通过的轨迹。在训练之前就取消了指导,因此学生可以从干净的演示中学习,而无需特定于任务的支架。

在 τ 2-bench 上,每个场景优化可以恢复 93% 的失败场景。对组合数据进行微调后,Qwen3-4B-Instruct-2507 从 Passˆ1=0.132 提高到 0.529,Gemma 4 E4B-it 在 BFCL v4 多圈上获得 +7.2pp。在已部署的管道中,该方法将轨迹质量提高了 +6.3pp 目标完成度,并​​转移到已部署的设备上模型(+1.5pp 目标完成度;+1.7 至 +5.0pp 响应质量指标),在每个语言环境中都有积极的转移(非英语平均 +1.48pp)。