该论文提出智能体工具使用需专门的mid-training数据管线,而非仅依赖post-training。研究构建20.3B token的MidTool-Mix语料,在Qwen3模型上经SFT和RL后,BFCLv3、tau2-Bench和MCP-Universe基准均显著提升。对照实验表明数据构成比规模更关键,但telecom和Web Search子集存在能力边界。
数据管线在量化系统中至关重要,错误难以修复。文章探讨了数据管线的五个层次:接入、规范化、派生、服务和可观测层。强调了数据质量的六个维度及其监控方法,以确保数据的完整性和准确性。同时,讨论了因子库的设计原则,特别是版本化和可追溯性。最后,提出了构建高效数据管线的建议,建议从简单的端到端链路开始,逐步扩展。
完成下面两步后,将自动完成登录并继续当前操作。