该论文提出智能体工具使用需专门的mid-training数据管线,而非仅依赖post-training。研究构建20.3B token的MidTool-Mix语料,在Qwen3模型上经SFT和RL后,BFCLv3、tau2-Bench和MCP-Universe基准均显著提升。对照实验表明数据构成比规模更关键,但telecom和Web Search子集存在能力边界。
完成下面两步后,将自动完成登录并继续当前操作。