PROOF-Gen:从优化数据到更好的蒸馏

PROOF-Gen:从优化数据到更好的蒸馏

💡 原文英文,约500词,阅读约需2分钟。
📝

内容提要

PROOF-Gen是一种通过逐场景提示优化从失败轨迹中恢复黄金数据的方法。在τ²-bench上,57%的教师尝试失败,其中三分之二是近失。该方法利用反射器分析执行轨迹和评估反馈,生成纠正指导,使教师产生通过轨迹,恢复93%的失败场景。微调后,Qwen3-4B和Gemma模型性能显著提升,部署中目标完成率提高6.3个百分点,并正向迁移至设备端模型。

🔎

延伸解读

失败轨迹的价值

传统蒸馏方法只保留教师成功的轨迹,而失败样本往往被丢弃。PROOF-Gen发现,在τ²-bench上57%的教师尝试失败,其中三分之二是近失——大部分工具调用正确,仅因一个关键错误而失败。这些近失轨迹蕴含丰富信息,通过反射器分析执行轨迹和评估反馈,可以生成纠正指导,将失败转化为训练数据。这提示我们,失败数据并非无用,而是未被充分利用的资源。

提示优化的关键作用

PROOF-Gen的核心在于逐场景的提示优化:针对每个失败任务,反射器生成纠正性指导,引导教师产生通过轨迹。这种优化不是全局的,而是针对具体场景,因此能恢复93%的失败场景。值得注意的是,训练时这些指导会被剥离,学生只学习干净的演示,避免依赖任务特定的脚手架。这表明,提示优化可以提升数据质量,而无需在推理时引入额外复杂度。

实际部署中的收益

在部署管道中,PROOF-Gen将目标完成率提升6.3个百分点,并正向迁移至设备端模型,目标完成率提升1.5个百分点,响应质量指标提升1.7至5.0个百分点。所有语言区域均观察到正向迁移,非英语区域平均提升1.48个百分点。这些结果说明,改进训练数据质量不仅能提升模型性能,还能在资源受限的设备端模型中带来实际收益,且具有跨语言泛化能力。

Q&A

PROOF-Gen是什么?它主要解决什么问题?

PROOF-Gen是一种通过逐场景提示优化从失败轨迹中恢复黄金数据的方法。它主要解决在工具调用模型蒸馏中,传统的生成-过滤机制因失败轨迹不提供信号而反复留下相同困难场景的问题。

在τ²-bench上,教师模型的失败率是多少?其中近失的比例是多少?

在τ²-bench上,57%的教师尝试失败,其中三分之二是近失(即大多数工具调用正确,但被一个决定性错误破坏)。

PROOF-Gen是如何从失败中恢复黄金轨迹的?

对于每个失败的任务,反射器分析执行轨迹和评估反馈,然后写出纠正性指导,引导教师产生通过轨迹。在训练前会去除这些指导,使学生从干净的演示中学习。

PROOF-Gen在τ²-bench上恢复了多少失败场景?

在τ²-bench上,逐场景优化恢复了93%的失败场景。

使用PROOF-Gen生成的数据进行微调后,Qwen3-4B和Gemma模型的性能提升如何?

微调后,Qwen3-4B-Instruct-2507的Pass@1从0.132提升到0.529,Gemma 4 E4B-it在BFCL v4多轮任务上提升了7.2个百分点。

PROOF-Gen在部署中的实际效果如何?

在部署管道中,该方法将轨迹质量提升了6.3个百分点的目标完成率,并正向迁移到设备端模型(目标完成率提升1.5个百分点,响应质量指标提升1.7到5.0个百分点),且在非英语环境中平均提升1.48个百分点。

🏷️

标签

➡️

继续阅读