不等Gemini 4了!谷歌发布办公Agent,支持调用Claude

不等Gemini 4了!谷歌发布办公Agent,支持调用Claude

💡 原文中文,约3800字,阅读约需9分钟。
📝

内容提要

谷歌发布企业办公智能体Gemini Agent,可自主规划任务、跨应用调用工具并支持多智能体协作。它拥有独立企业身份、邮箱和日历,具备四种记忆机制,并能动态选择Gemini或Claude等底层模型。此举将与OpenAI、Meta的办公智能体展开竞争。

🔎

延伸解读

企业级AI同事的独立身份与记忆机制

Gemini Agent可拥有独立的企业身份,包括邮箱、日历和账号,使其能像真实同事一样参与协作。其四种记忆机制——会话、语义、程序性和情景记忆——让Agent能持续积累工作知识,减少重复交代。这有助于企业将AI深度整合到工作流中,但需注意管理其权限和操作记录,确保安全可控。

多模型动态选择与成本效率平衡

Gemini Agent支持动态选择底层模型,包括谷歌Gemini和Anthropic的Claude,根据任务需求在效果、速度和成本间权衡。这种多模型编排能力让企业能灵活调整模型,而无需重建工作流程。但这也带来模型管理复杂性和潜在依赖风险,企业需评估不同模型的表现和成本。

办公智能体市场竞争格局

谷歌Gemini Agent的发布加剧了与OpenAI Dots和Meta Muse的竞争。Dots强调个人持续工作,Muse侧重生活场景,而Gemini Agent则深入企业组织体系,利用Workspace应用上下文。三者定位不同,但都推动AI向自主执行发展。企业选择时需考虑自身需求,如集成深度、安全治理和成本控制。

❓

Q&A

谷歌发布的Gemini Agent是什么?

Gemini Agent是谷歌发布的一款企业办公智能体,能够自主规划任务、跨应用调用工具,并支持多智能体协作。它拥有独立的企业身份、邮箱和日历,具备四种记忆机制,并能动态选择Gemini或Claude等底层模型。

Gemini Agent如何选择底层模型?

Gemini Agent可以根据任务要求,在效果、速度和成本之间动态选择底层模型。现阶段它可以在Google自家的Gemini系列和Anthropic的Claude系列模型之间进行选择,未来还计划支持更多闭源和开源模型。对于简单工作,使用成本较低的模型;复杂任务则调用能力更强的模型。一个项目中也可以组合多个模型完成不同环节。

Gemini Agent的记忆机制有哪些?

Gemini Agent拥有四种记忆机制:会话记忆(保存当前任务上下文)、语义记忆(积累知识并组织成结构化知识库)、程序性记忆(记录工作如何完成,甚至可自己编写Skills保存方法)、情景记忆(记录过去完成的工作及执行经历)。四种记忆结合,使其能逐渐熟悉用户工作习惯、公司业务和团队协作方式。

Gemini Agent与OpenAI的Dots、Meta的Muse有何不同?

Meta的Muse更偏向个人生活场景,如购物、预订旅行、发邮件等;OpenAI的Dots强调围绕用户个人持续工作,拥有独立云端电脑,支持7×24小时运行,连接超过4000个应用,但更侧重个人。而Gemini Agent重点展示的是让Agent进入企业已有的组织和办公体系,利用Gmail、Docs、Sheets、Calendar等应用中的业务上下文,并支持创建有独立邮箱、日历、账号和权限的Coworker agent参与团队协作。

什么是Coworker Agent?

Coworker Agent是谷歌在Gemini Agent框架下提出的“同事智能体”。企业可以为Gemini创建一个长期存在、具有明确工作职责的身份,配置独立的Google Workspace账号、企业邮箱、日历、Google Drive存储空间,并能出现在公司通讯录中。团队成员可以像对待普通同事一样邀请它加入Google Chat群聊或在文档中@它。它使用自己的身份执行操作并留下记录,方便企业管理和追踪。

Gemini Agent能自主完成哪些办公任务?

Gemini Agent可以查资料、写邮件、做PPT、分析数据、编写和运行代码,还能跨应用调用工具,自行规划任务,必要时召集多个子Agent一起干活。例如,让它完成一份市场分析报告,它可以自己搜索和整理资料、分析数据,在Google Sheets中建立财务模型,再调用Google Slides生成演示文稿。

🏷️

标签

➡️

继续阅读