PROOF-Gen是一种通过逐场景提示优化从失败轨迹中恢复黄金数据的方法。在τ²-bench上,57%的教师尝试失败,其中三分之二是近失。该方法利用反射器分析执行轨迹和评估反馈,生成纠正指导,使教师产生通过轨迹,恢复93%的失败场景。微调后,Qwen3-4B和Gemma模型性能显著提升,部署中目标完成率提高6.3个百分点,并正向迁移至设备端模型。
HarnessFix 提出了从失败轨迹到自动修复的闭环,解决了传统方法无法修复 Agent 失败的问题。通过将执行轨迹编译为标准中间表示 HTIR,精确归因到具体步骤,生成可执行的修复方案,从而提高了诊断准确率和修复覆盖率,推动了 Agent 可靠性工程的进步。
研究团队提出了一种名为“步骤拒绝微调”(SRFT)的方法,以提高大型语言模型(LLM)在复杂任务中的学习效率。SRFT通过“评论者”模型分析失败轨迹,标记有害步骤,保留有用的正确步骤,从而显著提升模型性能,证明失败的尝试也能为学习提供重要信息。
完成下面两步后,将自动完成登录并继续当前操作。