发生了什么

监督微调教师生成轨迹,是蒸馏工具调用能力到可部署模型的标准第一阶段。驱动已上线智能体的后训练流程每天或每周重跑这一步,每轮都要支付前沿教师模型的成本。

现有机制本质是“生成并过滤”:保留教师通过测试的轨迹,其余全部丢弃。由于失败样本不提供任何信号,同一批困难场景会在每一轮循环中反复留下,无法被针对性解决。

在 τ2-bench 上,57% 的教师尝试失败,其中三分之二是接近成功的情况——大多数工具调用正确,但最终未完成。

为什么重要

这种反复重跑却始终绕不开难例的循环,意味着蒸馏成本高但数据质量提升有限。从接近成功的失败中提取信号,可能让每次迭代不只是筛选成功样本,而是真正优化训练数据。

对部署工具调用智能体的团队而言,如果 PROOF-Gen 能把“几乎成功”的轨迹转化为有效训练信号,或可减少重复调用前沿模型的开销,同时改善模型在困难场景下的表现。

关键事实

标准蒸馏第一阶段是对教师生成的轨迹做监督微调,部署管线每天或每周重跑,并支付前沿教师成本。

现有机制是生成-过滤:保留通过轨迹、丢弃失败,难例因无信号而持续存在。

在 τ2-bench 上,57% 的教师尝试失败,其中三分之二是接近成功(大多数工具调用正确但未完成)。

接下来看什么

需关注 PROOF-Gen 如何具体利用接近成功的失败轨迹,能否在不额外增加教师调用的情况下提升蒸馏效果。

后续或会检验该方法在更复杂工具环境中的普适性,以及失败信号能否持续驱动数据质量进步。

来源