“后人会觉得这很荒谬”:Sai代理在OSWorld 2.0上以73%的成功率完成日常(但必要)工作

“后人会觉得这很荒谬”:Sai代理在OSWorld 2.0上以73%的成功率完成日常(但必要)工作

💡 原文英文,约1300词,阅读约需5分钟。
📝

内容提要

Simular公司的电脑代理Sai在OSWorld 2.0基准测试中取得73%成功率,超越GPT-5.6 Sol和Opus 5,成本仅为它们的三分之二。Sai采用神经符号方法,结合神经网络与符号代码,高效处理真实工作场景任务,如发票验证和疫苗预约。公司强调其设计注重经济实用性,而非追求行业荣誉,旨在为个人和企业提供可负担的自动化解决方案。

🔎

延伸解读

神经符号方法如何降低成本

Sai采用神经符号方法,将神经网络与符号代码结合,使已解决的任务可编码为可复用代码,处理第100张发票的成本远低于第一张。同时,Sai通过自适应摘要控制上下文窗口,保持输入规模,并利用Simulang代码规划长任务,平均模型调用次数比纯模型少约1.5倍,从而在OSWorld 2.0上以约三分之二的成本达到更高成功率。

基准测试的现实意义与局限

OSWorld 2.0任务以小时计,涵盖跨数据源查找、动态环境变化、遵循指南和排查矛盾信息等真实挑战,比OSWorld 1.0更贴近实际工作。但需注意,Sai的结果尚未在官方排行榜上可见,Simular正在提交中。此外,专家提醒,演示虽好,但可靠性依赖护栏、可见性和人工介入检查点,生产环境中的边缘情况可能导致静默失败。

成本效益与行业趋势

Simular强调Sai的设计注重经济实用性,而非追求行业荣誉。联合创始人杨嘉辰认为,为日常必要工作构建的代理不应因底层模型训练目标而价格高昂。Sai在OSWorld 2.0上的成本效益比被视为迈向可负担自动化的一步,反映了新兴模型正从追求原始算力转向聚焦实际工作场景的趋势。

Q&A

Sai在OSWorld 2.0基准测试上的成功率是多少?

Sai在OSWorld 2.0基准测试上的成功率为73%,基于108个任务,这些任务通常需要熟练人类超过1小时完成。

Sai与GPT-5.6 Sol和Opus 5相比表现如何?

Sai以73%的成功率超越了GPT-5.6 Sol(62.57%)和Opus 5(70.57%),且成本约为它们的三分之二。

Sai采用什么技术方法来实现高效的任务处理?

Sai采用神经符号方法,结合神经网络和符号代码,通过规划、执行和验证来高效处理任务,减少模型调用次数,并使用自适应摘要和常量提示前缀来优化内存和缓存。

Sai在OSWorld 2.0上执行了哪些具体任务?

Sai在OSWorld 2.0上执行了包括玩Chrome Dino游戏和疫苗预约(Task 28)等任务。疫苗预约涉及处理邮件、扫描的疫苗接种记录和预订网站,需满足价格、距离和日期限制。

Sai的设计理念是什么?

Sai的设计理念是专注于真实世界的工作场所任务,以经济实惠的成本为个人和企业提供自动化解决方案,而不是追求行业荣誉或解决复杂的数学问题。

Sai在OSWorld 2.0上的结果为何尚未出现在官方排行榜上?

Simular表示,公司或组织先在自家网站上发布基准测试结果并不罕见(如Anthropic和OpenAI),他们正在提交到OSWorld 2.0排行榜,并将轨迹上传到Hugging Face。

Sai与OSWorld 1.0的关系是什么?

Simular的开源代理Agent S是第一个在OSWorld 1.0上超越人类基线的代理,而Sai是后续版本,在OSWorld 2.0上取得了73%的成功率。

Sai在成本效益方面有何优势?

Sai在OSWorld 2.0上以约三分之二的成本达到了顶级性能,通过神经符号规划减少了约1.5倍的模型调用次数,并采用自适应摘要等技术降低计算成本。

🏷️

标签

➡️

继续阅读