内容提要
该论文提出智能体工具使用需专门的mid-training数据管线,而非仅依赖post-training。研究构建20.3B token的MidTool-Mix语料,在Qwen3模型上经SFT和RL后,BFCLv3、tau2-Bench和MCP-Universe基准均显著提升。对照实验表明数据构成比规模更关键,但telecom和Web Search子集存在能力边界。
延伸解读
数据构成比规模更关键
论文通过matched-budget对照实验,将MidTool-Mix与同等规模的通用语料Dolmino-20BT比较,发现后者在BFCL上仅提升+3.4,MCP-Universe甚至下降-7.8,而MidTool-Mix带来两位数增益。这表明对于工具使用能力,数据构成(如合成轨迹)比数据量更重要,优化构成应优先于扩大规模。
能力边界需注意
实验显示,tau2-Bench的telecom子集在最佳配置下Pass@1仅6.36,远低于整体水平;MCP-Universe的Web Search在所有配置下均为0.00%。论文认为这是独立的能力边界而非迁移失败,因为其他子集均有提升。引用结论时需考虑这些局限,避免过度泛化。
mid-training与post-training的差异
本文强调工具使用需要专门的mid-training数据管线,而非仅依赖post-training。与《工具调用的苦涩教训》对比,后者关注推理时方法,本文则从训练数据视角切入。mid-training在预训练后、SFT前进行,用大规模领域数据注入能力,为工具调用提供专门训练样本。
Q&A
MidTool论文的核心观点是什么?
论文提出智能体工具使用能力需要专门的mid-training数据管线,而不是仅依赖post-training。
MidTool-Mix语料是如何构建的?
MidTool-Mix是一个20.3B token的语料,通过收集真实web文本、PDF和代码,再从真实工具API、MCP skills和文档工作流生成合成监督信号,混合而成。
使用MidTool-Mix后,模型在BFCLv3上的表现如何?
在BFCLv3 overall上,Qwen3-4B-Base从SFT基线的39.73提升到加入MidTool-Mix后的50.25,再叠加RL后达到54.18,超过了官方Qwen3-8B的26.45。
论文如何证明数据构成比数据量更关键?
通过matched-budget对照实验,使用同等规模的通用语料Dolmino-20BT,其BFCL overall仅提升+3.4,MCP-Universe score反而下降-7.8,而MidTool-Mix带来两位数增益,说明构成比规模更重要。
MidTool方法在哪些方面存在能力边界?
在tau2-Bench的telecom子集上Pass@1仅6.36,远低于整体水平;在MCP-Universe的Web Search子集上所有配置均为0.00/0.00%,论文认为这是独立的能力边界。
MidTool论文与《工具调用的苦涩教训》有何不同?
《工具调用的苦涩教训》对比的是推理时方法(JSON工具调用与程序化工具调用),而MidTool论文从训练数据管线的视角出发,强调mid-training数据的重要性。