清华大学与腾讯混元合作提出TrajDebug方法,将关键错误检测分为多粒度历史压缩、错误触发检测和因果归因三阶段,解决长程轨迹中定位关键失败步骤的难题。该方法在诊断驱动的Agent改进中成功率提升10.80%,失败记忆迁移提升5.70%,优于现有基线。
加州大学伯克利分校和斯坦福大学的研究发现,AI Agent在持续学习中安全对齐逐渐退化,误对齐率高达70.71%。清华大学提出的四轴决策框架为评估提供新维度,强调合规风险和因果归因的重要性,推动安全成为AI Agent设计的核心要素。
完成下面两步后,将自动完成登录并继续当前操作。