ScaleCUA是清华大学和Z.AI团队提出的框架,旨在解决Computer Use Agent(CUA)训练数据稀缺问题。通过可验证任务合成、动态学习前沿采样和视觉上下文分割,ScaleCUA显著提升了数据质量和训练效率,使开源CUA在OSWorld上达到了68.7%的新高,超越了参数量大四倍的竞品。这一方法强调了数据质量的重要性,证明了在CUA领域,数据效率优于模型参数规模。
复旦大学与通义实验室联合提出ToolCUA,旨在优化计算机使用代理(CUA)在GUI与工具调用之间的选择。研究表明,直接连接工具未能提升模型性能,反而导致准确率下降。ToolCUA通过生成混合轨迹数据,帮助模型学习何时使用GUI或工具,从而提高任务执行效率。在OSWorld-MCP上的评测结果显示,ToolCUA取得46.85%的准确率,显著优于其他模型,展示了其在复杂任务中的有效性和灵活性。
Unify是一个基于AI的销售平台,通过智能化的信息寻找和个性化服务,帮助团队高效接触潜在客户。该系统自动化繁琐工作,使团队专注于客户互动,旨在通过数据驱动提升销售增长,优化产品与客户的匹配。
2025年1月,我们发布了Operator,作为计算机使用代理(CUA)模型的研究预览。CUA能够通过浏览器执行任务,模拟人类操作。我们将Operator的GPT-4o模型替换为基于OpenAI o3的版本,API仍基于4o。o3 Operator在安全性上进行了额外调优,但不具备原生编码环境访问权限。
CUA Office公共许可证1.0是一种开源许可证,旨在平衡软件自由与开发者的公平补偿。它强调捐赠资助模式、双重许可和透明的道德实践,以防止企业剥削。尽管存在法律模糊性和执行问题,该许可证在企业和社区项目中得到广泛应用,未来可能通过区块链等技术实现更透明的补偿机制。
CUA Office公共许可证1.0旨在保障开发者的公平报酬,同时促进开源合作。通过捐赠机制和法律框架,该许可证防止开发者被剥削,增强透明度和社区参与,为开发者提供法律保护,鼓励创新,推动可持续的软件开发生态系统。
CUA结合了GPT-4o的视觉和推理能力,能够在用户请求时启动虚拟主机,并实时同步操作。通过处理屏幕截图,CUA执行多步骤任务,适应变化并自我纠正,从而提高任务完成度。
OpenAI发布了智能体Operator,能够独立完成购物和餐厅预订等任务,标志着其进入Level 3时代。目前仅面向Pro用户,未来将推出更多智能体。Operator基于新模型CUA,支持多任务操作和自我纠错。
OpenAI发布了智能体Operator,能够独立完成购物和预订等任务,目前仅面向Pro用户。预计2025年将是智能体发展的关键年。Operator使用新模型CUA,具备视觉和推理能力,标志着OpenAI进入Level 3阶段,未来将推出更多智能体。
OpenAI推出了Computer-Using Agent(CUA),这是一种智能代理,能够在数字世界中执行任务。CUA结合了视觉能力和强化学习,能够像人类一样与图形用户界面互动,完成多步骤任务。尽管CUA仍处于早期阶段,但在多个基准测试中表现出色,计算机任务成功率为38.1%,网页任务成功率为58.1%。CUA的设计注重安全性,旨在减少潜在风险。
完成下面两步后,将自动完成登录并继续当前操作。