内容提要
杰富瑞测试显示,阿里千问办公在八款主流AI Agent中综合得分第一,超越Claude Cowork和Codex。其优势在于模型与Harness协同,复杂办公、浏览器控制及多模态生成表现突出,且API成本较低。Agent竞争正转向企业级场景,工作流和生态协同成核心壁垒,千问办公已初步打通钉钉。
延伸解读
Harness:Agent竞争的新维度
杰富瑞报告将Agent能力拆分为模型与Harness两部分,其中Harness指围绕模型运行的工程机制,包括指令、上下文、工具调用、边界控制、反馈纠错和治理等。千问办公的“隐含Harness分”位居首位,说明在底层模型之外,如何通过工程和产品能力将模型智能稳定转化为实际任务结果,正成为Agent竞争的重要维度。这提示读者,评估Agent时不应只看模型参数或基准分数,还需关注其工程实现和产品化能力。
成本:Agent商业化的关键考量
报告指出,成本正成为Agent商业化的重要因素。千问办公底层Qwen 3.8 Max的API价格明显低于部分海外头部模型,而Agent通常需要多轮推理、持续调用工具和执行长链路任务,因此企业未来衡量Agent价值时,除了模型和产品能力,也可能进一步关注“Cost per Task”,即完成一项真实任务所需的执行成本。千问办公在性能与成本上表现出较好的平衡,这或将成为其吸引企业客户的优势。
企业级场景:工作流与生态协同成壁垒
报告认为,Agent竞争正从个人办公转向企业级场景,工作流和生态协同是核心竞争壁垒。随着Agent持续连接企业数据、业务系统、协作工具和权限体系,用户的历史任务、工作习惯、连接器、Skills和自动化流程会逐渐沉淀在产品中,形成更高的使用粘性和迁移成本。千问办公已初步打通钉钉IM工具,支持群聊总结、文档表格创建、消息邮件收发等操作,未来还将接入企业真实工作流,这有助于其构建企业级生态优势。
Q&A
华尔街投行杰富瑞对八款主流AI Agent的实测中,哪款产品综合得分排名第一?
阿里千问办公综合得分排名第一,超过美国的Claude Cowork和Codex等Agent工具。
杰富瑞测试中设置了哪些真实办公任务?
测试共设置5项任务:基于多份文件完成公司年报摘要、联网查找并比较公司经营数据、操作真实桌面浏览器完成信息检索和文档生成、根据数据制作英文PPT,以及基于参考图片生成营销海报。
千问办公在哪些场景中表现突出?
千问办公在复杂办公任务、网页浏览器控制以及多模态内容生成等场景中表现突出,是唯一一个在所有测评维度中均获得90分以上的Agent产品。
什么是Harness?为什么它重要?
Harness是围绕模型运行的一整套工程机制,包括指令、上下文、工具调用、边界控制、反馈纠错和治理等。它重要是因为在底层模型之外,如何通过工程和产品能力将模型智能稳定转化为实际任务结果,正在成为Agent竞争的重要维度。
千问办公的API成本相比海外头部模型如何?
千问办公底层Qwen 3.8 Max的API价格明显低于部分海外头部模型,体现出较好的性能与成本优势。
企业级Agent的核心竞争壁垒是什么?
对于企业级Agent而言,工作流和生态协同是核心竞争壁垒。随着Agent持续连接企业数据、业务系统、协作工具和权限体系,用户的历史任务、工作习惯、连接器、Skills和自动化流程会逐渐沉淀在产品中,形成更高的使用粘性和迁移成本。
千问办公目前与钉钉的整合情况如何?
千问办公已初步打通钉钉IM工具,企业员工通过千问办公即可完成群聊总结、文档表格创建、消息邮件收发等操作。未来还将接入企业真实工作流,连接企业数据库和工作流。