内容提要
Ora平台在Vercel上运行,测试AI代理在真实网站上的表现,发现99%的网页不适合代理操作。它对比Claude Code、eve等主流代理,提供详细追踪。Ora采用eve框架,因其配置简单、沙箱可覆盖,使16人团队每天高效提交数百次代码,并计划扩展微服务。
延伸解读
99%的网页不适合代理:这意味着什么
Ora的测试显示,绝大多数网站无法让AI代理完成注册、集成和支付等任务。这并非代理能力不足,而是网站本身的结构、交互方式或验证流程对自动化不友好。对于企业而言,这意味着如果希望AI代理能顺利使用自己的产品,就需要针对代理的导航和操作进行优化,否则可能错失由代理带来的潜在客户或效率提升。
基准测试的公平性:同一模型,不同框架
Ora在对比eve和Claude Code时,让两者使用相同的模型(Claude Fable 5和Haiku 4.5),并执行相同的任务,从而确保差异主要来自框架本身,而非模型能力。这种控制变量的方法使得结果更具参考价值。eve在步骤数、原生成功率和有效端点方面均优于Claude Code,表明框架的设计对代理性能有显著影响。
沙箱覆盖:eve的关键优势
Ora选择eve作为其开发框架,核心原因是eve允许覆盖默认沙箱。这使得Ora能够将代理执行环境替换为自有的追踪系统,从而在不额外开发的情况下记录代理的每一步操作。对于需要深度监控代理行为的团队来说,这种灵活性至关重要,它避免了为每个框架单独构建监控工具的麻烦。
从基准测试到生产:eve在Ora的双重角色
Ora不仅将eve作为基准测试的对象,还将其用于构建自己的代理和平台。这种“吃自己的狗粮”的做法验证了eve的实用性。Ora的16人团队每天能提交数百次代码,部分归功于eve与Next.js的无缝集成,使得代理能够高效地处理基础设施任务。这表明eve不仅适合测试,也适合实际生产环境。
Q&A
Ora平台的主要功能是什么?
Ora平台用于测试AI代理在真实网站上的表现,通过让代理执行注册、集成和支付等任务,评估网站的代理就绪程度,并帮助客户了解代理失败的原因及改进方法。
Ora如何对AI代理进行基准测试?
Ora在Vercel上运行,针对每个代理使用独立的运行时,并记录代理完成任务所需的成本、延迟和步骤。它对比了Claude Code、ChatGPT、Gemini、Hermes、OpenClaw和eve等主流代理,在真实网站上执行相同任务,提供详细的追踪信息。
Ora为什么选择基于eve框架构建?
Ora选择eve是因为其配置简单、开箱即用,并且提供了沙箱覆盖功能,使得Ora能够在不额外构建的情况下记录eve代理的每一步操作。此外,基准测试显示eve在步骤数、成功率和有效端点方面表现优异。
Ora的基准测试结果中,eve相比Claude Code有哪些优势?
根据Ora的测试,eve相比Claude Code减少了7%的步骤,原生成功率提高2倍(即更多任务在客户网站上直接完成而非依赖网络搜索),并且找到的有效端点增加了9%。
Ora如何利用Vercel平台来简化其基础设施?
Ora将前端、后端和代理运行时都部署在Vercel上,共享相同的部署路径、日志和认证,无需单独管理代理运行时。这使得基础设施集中化,提高了编码代理的效率,并简化了部署和调试。
Ora的16人工程团队如何实现每天数百次提交?
Ora的工程团队利用编码代理处理日常基础设施工作,由于所有基础设施都集中在Vercel上,代理可以端到端地运行,无需人工登录Vercel界面。这节省了时间,使得团队能够高效地提交大量代码。
Ora未来有什么扩展计划?
Ora计划将平台拆分为微服务,所有微服务都部署在Vercel上,新服务可以无缝集成,内部基于eve构建的代理将作为其中一个服务运行。