AI Agent 正在从对话工具转变为任务执行者,广泛应用于自动化办公和代码生成等领域。与传统大语言模型不同,Agent 能够拆解任务并自主推进。为支持其能力,相关数据集强调过程能力,包括长程规划和多步推理。本文整理了10个关键数据集,涵盖长上下文理解、任务规划和工具调用等能力,推动 AI Agent 的研究与应用。
大型语言模型在多步推理任务中的表现有限。研究提出了“链式思维提示”,鼓励模型展示推理过程后再给出答案,从而显著提升推理能力。这一方法无需额外训练,适用于算术、常识和符号推理任务,尤其在大型模型中效果显著。研究表明,适当的提示可以激发推理能力,改变了对语言模型推理的理解。
谷歌的代理开发工具包(ADK)通过事件驱动架构改变了AI应用的开发方式,支持多步推理和实时反馈。ADK的设计确保可观察性、测试隔离和灵活性,使开发者能够构建复杂的AI系统。
大型推理模型(LRMs)在长链推理能力上面临挑战,现有评测体系无法有效评估其复杂任务表现。复旦大学与美团推出的R-HORIZON框架通过问题组合方法提升了模型的多步推理能力。评测显示,主流模型在长链推理中性能普遍下降,存在推理长度、反思机制和预算分配等瓶颈。通过强化学习训练,R-HORIZON显著提升了模型推理性能,标志着研究范式的转变。
标准的检索增强生成(RAG)系统在处理复杂问题时常常失效,无法保持上下文关系。本文提出了一种基于知识图谱的解决方案,通过明确的节点和边存储数据,增强系统推理能力,有效应对多步推理、歧义消解和矛盾信息,提高知识系统的可靠性。
提示链模式通过将复杂任务分解为小的子任务,提升了大语言模型的可靠性与可控性,适用于构建智能体系统,解决多步推理与工具集成问题。
中科院与清华大学等提出的SE-Agent框架突破了Claude-4的编程限制,提升了多步推理能力,成功率提高20.6%。该框架通过轨迹协同进化优化解决方案,刷新了开源框架的性能记录,展现出智能体自我改进的潜力。
阿里推出的WebDancer是一款具备多步推理和自主决策能力的信息检索智能体,凭借创新的数据合成和ReAct框架,在复杂信息检索任务中表现出色,展现出强大的泛化能力。未来将集成更多工具,扩展任务范围,推动智能体发展。
大模型在法律推理中的应用面临挑战,最新的LEXam基准数据集旨在评估其能力。研究表明,现有LLM在复杂法律问题,尤其是多步推理方面表现不佳。LEXam提供高质量法律考试题目,帮助深入理解LLM的能力缺陷,并引入“LLM-as-a-Judge”模式以提升评估的透明性和可靠性。
本研究提出了AdvKT框架,旨在解决知识追踪模型在多步推理中的错误累积和数据稀疏性问题。通过对抗学习和数据增强,显著提升了智能辅导系统的推荐模型性能。
Zoom 研究团队提出了 Chain of Draft(CoD)技术框架,以提高大语言模型(LLM)的推理效率。CoD 通过生成简洁且信息密集的输出,显著降低计算资源和延迟,提升推理性能。实验结果显示,CoD 在多步推理任务中的信息密度是传统思维链(CoT)的 14.7 倍,推理延迟和 token 消耗显著减少,适合高频金融交易等应用。
本研究提出了一种双重逆向链推理框架(DRCR),用于隐性情感分析,解决了捕捉微妙情感的难题。该框架结合对比推理和多步推理,显著提高了情感分类的准确性,并在多个模型上实现了先进性能。
本研究提出了DocPuzzle基准,用于评估大型语言模型在长篇上下文中的推理能力。基准包含100个需要多步推理的专家级QA问题。评估结果表明,慢思维推理模型优于一般指令模型,而蒸馏推理模型与教师模型之间存在显著差距。
本研究提出了一种名为FastMCTS的新采样策略,旨在解决合成多步推理数据中的低效和不平衡问题。实验结果表明,FastMCTS生成的正确推理路径比拒绝采样方法增加超过30%,并提升了模型性能3.9%。
本研究提出了大记忆模型(LM2),通过引入辅助记忆模块,克服了标准Transformer在多步推理和长上下文整合方面的局限性。实验结果表明,该模型在多跳推理和大上下文问答中表现优异。
本文提出了一种基于扭曲序列蒙特卡洛(TSMC)的新验证方法,旨在提升大型语言模型(LLMs)的多步推理能力。该方法通过聚焦有前景的候选项,提高采样效率,减少样本需求,并简化训练目标,降低对人工标注的依赖。实验结果显示,该方法在多个数学基准上表现优越。
本研究探讨了视觉语言模型(VLMs)在多步推理任务中的不足,并提出了一种评估其视觉推理能力的框架。研究表明,显式的图像到文本转换对任务的泛化能力至关重要。
本研究提出了AR-MCTS框架,结合主动检索与蒙特卡洛树搜索,以提升多步多模态推理的多样性和可靠性。
本文探讨了大型语言模型(LLMs)的进展与挑战,提出了多种提升性能的方法,如使用小型模型校正LLM输出、检索增强生成(RAG)和跨模型控制(CMC)。研究表明,这些技术显著提升了LLMs在多步推理和复杂任务中的表现,展现出与先进模型竞争的潜力。
本研究探讨了大型语言模型(LLMs)在自动规划中的应用,发现其自主生成计划的能力有限。通过引入LLM + P框架和RAP推理框架,研究表明LLMs在启发式模式下能改善其他智能计划器的搜索过程。此外,提出了LLM-模块化框架,结合外部验证器以提高规划和推理的准确性,解决了LLMs在多步推理中的不一致性问题。
完成下面两步后,将自动完成登录并继续当前操作。