该论文指出,仓库级编码agent的失败源于“连贯性债务”,即所需事实不在上下文或记忆中。实验显示,缺失事实会导致agent自信编造而非停止,且损伤严格线性。工具使用中,成本差异源于重建工作集速率。结论是保持依赖事实可用,并用产出校验。
该论文提出智能体工具使用需专门的mid-training数据管线,而非仅依赖post-training。研究构建20.3B token的MidTool-Mix语料,在Qwen3模型上经SFT和RL后,BFCLv3、tau2-Bench和MCP-Universe基准均显著提升。对照实验表明数据构成比规模更关键,但telecom和Web Search子集存在能力边界。
本书深入探讨AI智能体设计模式,涵盖规划、记忆与工具使用三大核心领域。规划部分介绍束搜索、计划执行、自适应重规划等模式,强调可审计性与资源管理。记忆部分阐述情景缓冲、语义记忆、工作记忆管理及遗忘策略,确保智能体具备持久且可维护的状态。工具使用部分则聚焦工具选择、API适配、代码沙箱执行及副作用审计,保障智能体安全可靠地操作外部系统。全书提供代码示例、反模式及验收测试,指导工程师构建高效、安全的智能体系统。
kapa.ai分析其产品内代理的1,192次对话,发现知识库搜索是最常用工具,几乎与所有原生工具总和相当。它主要作为兜底回答原生工具无法处理的问题(占32.1%),补充原生工具输出的上下文(占7%),并帮助代理规划如何正确使用工具。结论是文档工具对代理至关重要,它让其他30个原生工具变得有用。
企业代理需要具备记忆、规划、工具使用和反思四种能力。记忆提供连续性,但不足以有效行动;规划将商业目标转化为可执行步骤;工具使用连接模型推理与确定性系统;反思则评估输出的完整性和可信度。这些能力使代理能够参与真实的商业流程,确保任务执行的安全性和合规性。
本文分享了作者在开发AI智能体时的经验,强调了四个安全措施:输入检查、输出检查、成本断路器和工具调用检查。这些措施能有效避免隐私泄露和高额账单,确保AI安全运行。
作者从零开始创建一个AI代理,旨在实现聊天、管理待办事项和获取最新信息。通过学习AI基本概念和工具调用,逐步实现多轮对话和工具使用功能。尽管面临AI的“失忆症”等挑战,最终成功构建了一个能执行复杂任务的AI代理。作者总结了AI模型、工具和上下文管理的重要性,并分享了这一过程的经验。
代理式人工智能(Agentic AI)是具备自主性、推理能力和执行能力的系统,能够独立完成复杂任务。与传统生成式AI不同,Agentic AI能自主规划、调用外部工具并自我修正。其核心架构包括规划、记忆、工具使用和多代理协作,应用于软件开发、自动化营销和个人助理等领域。尽管面临安全性和成本控制挑战,Agentic AI标志着人工智能向行动式的重大转变。
该项目名为 learn-claude-code-rs,旨在用 Rust 从零开始实现类似 Claude Code 的 agent harness。它包含20个渐进章节,涵盖工具使用、权限系统、内存管理等核心机制,适合希望深入理解 coding agent 内部机制的开发者。项目提供中英文文档,欢迎反馈与贡献。
GPT-5.5是一个新模型,专注于处理复杂的任务,如编写代码和信息分析。与之前的模型相比,它能更快理解任务,需求指导更少,工具使用更高效。发布前进行了全面的安全评估,并收集了近200个早期合作伙伴的反馈,确保其具备强大的安全措施以减少误用,同时保留合法的有益用途。
AI代理从单一响应转向自主执行任务,具备工具使用、规划和记忆三大核心能力。它们能够将复杂目标分解为可执行步骤,并动态调整策略以提高任务效率。构建可靠的AI代理需关注设计、状态管理和错误处理,以确保其有效性和安全性。
文章介绍了如何通过MCP协议赋予智能体工具使用能力,实现自动化操作。以将Markdown文章发布到微信公众号为例,智能体连接MCP服务,利用大语言模型进行决策并调用工具,最终完成文章发布。MCP协议简化了不同API的连接,使智能体代码更具通用性。
Z.ai推出了新模型GLM-4.7,具备更强的编码、工具使用和多步骤推理能力,适合复杂任务。用户可通过AI Gateway无账户访问,享受统一API和智能路由功能。
在2025年QCon AI NYC大会上,OpenAI的Will Hang介绍了Agent RFT,这是一种强化微调方法,旨在提升工具使用代理的性能。他强调了优化提示和任务的重要性,并提出了监督微调和偏好优化等多种微调选项。Hang指出,强化微调适合需要探索策略的任务,并强调了在整个轨迹中进行信用分配的重要性。Zi展示了实际应用案例,强调了在工具调用预算下的有效内容定位。
2025年被称为“智能体之年”,AI逐渐融入现实生活。尽管GPT-5和Claude Sonnet 4.5表现出色,但在多步骤任务中仍有超过40%的失败率。研究表明,智能体需具备工具使用、规划、适应性和常识推理等能力,以有效应对现实环境。目前,常识推理仍是AI与人类之间的主要差距。
本文讨论了如何通过服务器指令优化大型语言模型(LLM)与MCP服务器的交互。明确的指令显著提高了模型在复杂任务中的表现,建议开发者编写简洁、功能性强的指令,以提升工具使用效率。
工具使用模式使代理能够与外部系统实时交互,通过函数调用根据用户请求决定使用工具,生成结构化调用并执行,最终返回结果。这种模式扩展了大型语言模型的能力,适用于多种应用场景。
xAI推出了Grok 4 Fast,这是一种高效且低成本的推理模型。与Grok 4相比,思维令牌减少40%,成本降低约98%。该模型支持2百万令牌的上下文窗口,并具备网页浏览等工具使用能力。在基准测试中,Grok 4 Fast表现优异,成本效益高于OpenAI的GPT-4 Turbo。用户可通过grok.com免费试用该模型。
《社会中的心智》探讨了人类与环境的关系、劳动形式及其心理结果,以及工具使用与语言发展的关系。儿童的智力发展依赖于语言与实践活动的结合,模仿成人的工具使用至关重要。在游戏中,儿童通过规则和想象情境发展自我控制和抽象思维,学习与发展相辅相成,促进心理功能提升。
本文概述了内网靶场渗透测试的全过程,包括环境搭建、外网渗透、获取shell、提权、内网渗透及域控攻击,详细阐述了漏洞利用和工具的使用。
完成下面两步后,将自动完成登录并继续当前操作。