Apple 机器学习 3小时前 · 2026-08-31 13:09:38 · 0 阅读
PROOF-Gen:从优化数据到更优蒸馏
,
作者:Anh Ta、Junjie Zhu、Shahin Shayandeh
在教师模型生成的轨迹上进行监督微调,是将工具调用能力蒸馏到可部署模型中的标准第一阶段。驱动已上线工具调用智能体的后训练流程会按天或按周重跑这一阶段,每一轮都要付出前沿教师模型的调用成本,但其机制不过是"生成-筛选"(保留教师模型通过的轨迹,丢弃其余),而每一轮都会留下同样棘手的场景,因为失败并不能提供任何信号。在 τ 2-bench 上,教师模型有 57% 的尝试失败,其中三分之二是近乎成功(多数工具调用正确,仅因一次关键性失误而前功尽弃)。
我们提出了 PROOF-Gen(Per-scenario Reflective Optimization to Overcome Failed Generation),通过逐场景的提示词优化,从这些失败案例中恢复出"金标轨迹"。对每个失败的任务,一个反思器会分析执行轨迹和评估反馈,然后写出纠正性指引,引导教师模型走向通过的结果。指引在训练前会被剥离,因此学生模型学习的是干净的示范,而不依赖任何任务专属的脚手架。
在 τ 2-bench 上,逐场景优化恢复了 93% 的失败场景。在合并后的数据上微调后,Qwen3-4B-Instruct-2507 的 Passˆ1 从 0.132 提升到 0.529,Gemma 4 E4B-it 在 BFCL v4 多轮任务上提升 +7.2pp。在已部署的流水线中,该方法将轨迹质量提升了 +6.3pp 的目标完成率,并成功迁移到一款已部署的端侧模型上(目标完成率 +1.5pp;各项响应质量指标提升 +1.7 至 +5.0pp),且在每种语言区域下均呈现正向迁移(非英语区域平均 +1.48pp)。
原始来源: Apple 机器学习