Windows代理竞技场:大规模评估多模态操作系统代理
原文中文,约300字,阅读约需1分钟。发表于: 。本研究针对现有评估工具在真实环境中应用的局限性,提出了Windows代理竞技场,这是一种 reproducible 的通用环境,专注于Windows操作系统,支持多个任务的评估。创新性地开发超过150个多样化任务,并引入了新的多模态代理Navi,显著提高了评估的效率,为未来的代理开发和数据生成开辟了新的研究机会。
该研究介绍了一种新方法来评估代理程序生成可执行计算机任务的能力,并展示了当前最强的基线语言模型代理在该测试中表现最好。然而,与人类相比,它仅达到15%,突显了传统网络代理在生成可执行脚本方面的挑战。该测试为衡量和评估语言模型代理在自动化计算机任务方面的进展提供了平台,并激励未来研究努力构建大型语言模型和计算机屏幕的视觉基础的多模态模型。