内容提要
香港科技大学与澳门大学提出SkillProx框架,用于智能体技能演化,采用前向-后向双阶段优化:前向闭环诊断验证编辑效果,后向近端精炼审计并压缩冗余知识。在SpreadSheetBench、WikiTQ和HiTab基准上,相比基线平均提升约3个百分点,分布外泛化显著更稳,但评估限于结构化表格场景,存在计算开销和过拟合风险。
延伸解读
技能膨胀的代价:负效用知识单元
文章指出,现有方法在技能演化中缺乏控制,导致技能膨胀,包含重复指令、冲突启发式和过度泛化的解法。留一法审计发现,移除某些知识单元反而将准确率从46%提升到54%,说明这些单元具有负效用。这提醒我们,在智能体技能管理中,并非所有累积的知识都有益,定期审计和精简技能内容可能是提升性能的关键。
前向-后向双阶段设计的优势
SkillProx将技能演化分解为前向闭环诊断和后向近端精炼两个阶段,分别对应近端梯度下降的梯度步和近半步。前向阶段通过重执行验证编辑效果,避免无效更新;后向阶段通过效用审计压缩冗余知识。消融实验显示,完整框架优于仅用任一阶段,且移除后向阶段性能下降更大,说明两阶段互补,共同维持技能的高效与准确。
分布外泛化的显著提升
在分布外(OOD)测试中,SkillProx表现远优于基线。例如,在Qwen3.5-4B下,SkillOpt的OOD得分在WikiTQ和HiTab上分别跌至26.0和16.0,而SkillProx达到78.5和69.2。这表明SkillProx不仅提升了IID性能,还增强了技能的泛化能力,使其在未见过的数据上更稳健,这对于实际应用中的适应性至关重要。
局限性与潜在风险
文章指出,SkillProx的评估仅限于三个结构化表格基准,其效果在更开放的编程或推理场景中未知。此外,留一法审计需要大量LLM调用,计算开销大;Prox门控基于固定验证集,存在过拟合风险。这些局限性提示,在将SkillProx应用于更广泛任务时,需考虑计算成本和泛化能力,并可能需要调整验证策略以避免过拟合。
Q&A
SkillProx框架是什么?它由哪个机构提出?
SkillProx是一个用于智能体技能演化的框架,由香港科技大学与澳门大学提出。它采用前向-后向双阶段优化,前向闭环诊断验证编辑效果,后向近端精炼审计并压缩冗余知识。
SkillProx框架的核心创新点是什么?
SkillProx的核心创新是将技能演化分解为两个正交阶段:前向闭环诊断演化(对应梯度步)和后向验证门控近端精炼(对应近半步)。前向阶段通过重执行验证编辑效果,后向阶段通过留一法审计压缩冗余知识。
现有技能演化方法(如SkillGrad、SkillOpt)存在哪些缺陷?
现有方法存在两个根本缺陷:一是无验证的前向更新,即LLM生成的诊断未经重新执行验证就被直接应用,可能导致性能下降;二是不受控的技能增长,迭代打补丁导致技能膨胀,包含重复指令、冲突启发式和过度泛化的特定解法,甚至存在负效用知识单元。
SkillProx在基准测试上的表现如何?
在SpreadSheetBench、WikiTQ和HiTab三个基准上,SkillProx相比最强基线SkillGrad平均提升约3.0个百分点。例如,在Qwen3.6-27B下,SpreadSheetBench达到54.5(提升4.5),WikiTQ达到86.2(提升1.4),HiTab达到80.0(提升1.7)。
SkillProx在分布外(OOD)泛化上的表现如何?
SkillProx在OOD泛化上显著更稳。例如,在Qwen3.5-4B下,SkillOpt的OOD得分在WikiTQ和HiTab上分别跌至26.0和16.0,而SkillProx则达到78.5和69.2。
SkillProx框架的局限性有哪些?
SkillProx的局限性包括:评估仅覆盖三个高度结构化的表格基准,效果能否推广到更开放的编程或推理场景未知;留一法审计需对每个知识单元执行完整评估,LLM调用开销大;Prox门控基于固定验证集,存在过拟合风险。