衡宇 发自 凹非寺
量子位 | 公众号QbitAI
好好好,谷歌也来加入办公智能体混战,而且强调多模型调用的它连竞争对手Claude都给安排上了!
今天凌晨,Google Cloud发布了一篇名为《Welcome to Gemini at Work 2026: Introducing the Gemini agent》的长文,由Google Cloud CEO Thomas Kurian亲自署名,集中介绍了Gemini在企业Agent领域的一系列更新。
其中最重磅的当属全新发布的Gemini Agent。
按照谷歌的设想,这将是一个覆盖各类工作任务、能够长期运行的通用办公Agent。
它可以帮你查资料、写邮件、做PPT、分析数据、编写和运行代码,还能跨应用调用工具,自行规划任务,必要时召集多个子Agent一起干活。
而且还有两个特别值得注意的地方。
一是它可以拥有自己的企业身份,成为一名有邮箱、有日历、有独立账号的AI同事。
二是它能够根据任务自动选择底层模型,甚至调用Anthropic家的Claude。
好家伙,谷歌连自家Gemini都不一定非用不可了?
更有意思的是,这次发布的种种功能,怎么看都有点冲着最近热闹起来的办公Agent市场来的意思。
小扎听了大概会有如下内心OS:
歌,你不卷你那笨蛋Gemini模型,一扭头冲着我来了????
Gemini agent
谷歌给它定下的工作原则是酱婶儿的:
You give it objectives, not instructions.
给它目标,而非逐步指令。
也就是想让Gemini agent帮忙干活,不用一步步告诉它先做什么、后做什么。
只需要交代最终想要的结果,剩下的交给它自己安排。
其核心能力包括统一入口、云端持久运行、跨平台调用、多Agent协作、事件触发和定时任务等。
文中举的例子是让它帮忙完成一份市场分析报告。
它可以自己搜索和整理资料、分析相关数据,在Google Sheets中建立财务模型,再调用Google Slides生成一份演示文稿。
整个过程中,它能够根据任务需要选择工具、调用不同应用,最后把完成的工作交还给你。
你可能会满脑子问号——类似的跨应用操作,不算啥新鲜事儿啊,你干啥呢?
网友对此也是不看好的居多,官宣推文下面随手一截画风black pink:
但,这次谷歌发布Gemini Agent强调的是试图把各种工作能力都集中到一个Agent身上。
有啥不同?
在Gemini Agent大框架下,谷歌还提出了Coworker Agent,直译过来就是“同事智能体”。
谷歌现在允许企业为Gemini创建一个长期存在、具有明确工作职责的身份,让它像团队中的其他成员一样参与日常协作。
而且AI同事配置了独立的Google Workspace账号、企业邮箱、日历、Google Drive存储空间……还能出现在公司的通讯录里。
首先上手门槛约等于无,其次创建完成后,团队成员便可以像对待普通同事一样,邀请它加入Google Chat群聊,或者在文档中@它。
AI同事用的是自己的身份,执行操作会留下自己的记录,方便企业管理和追踪它究竟做了什么。
到这一步,看起来还是很normal。。。
比较不一样的是,除开独立身份,Gemini Agent获得了一套更完整的记忆机制。
按照官方介绍,它一共拥有四种记忆。
第一种是会话记忆(Session Memory)。
主要用于保存当前任务的上下文。
即使一个任务持续好几天,Gemini Agent也能记住已经完成了哪些步骤,接下来还有哪些工作。
第二种是语义记忆(Semantic Memory)。
Gemini Agent会从阅读过的文档、与人的交流以及同其他Agent的协作中积累知识,并将其组织成结构化知识库。
例如,记住公司有哪些产品、团队成员分别负责什么、某个业务术语在公司内部具体指什么。
第三种是程序性记忆(Procedural Memory)。
主要用于记录一项工作应该如何完成。
比如,某类报告需要哪些数据、按照什么流程分析、最终以什么格式交付。
这里还有个细节,Gemini Agent甚至可以自己编写Skills,把工作过程中学到的方法保存下来,供后续任务使用。
第四种是情景记忆(Episodic Memory)。
用于记录过去完成过哪些工作,以及相应的执行经历。
四种记忆结合起来,Gemini Agent就有机会逐渐熟悉用户的工作习惯、公司业务和团队协作方式。
比如第一次让它做项目周报,可能需要解释报告结构、数据来源和工作流程。
等到第二次、第三次,它就可以沿用此前积累的知识和方法,减少用户重新交代的内容。
谷歌还专门用了一个比喻,说“Gemini会像新员工一样,在正式开展工作前,逐渐熟悉你、你的工具和团队”。
好嘛。
这下连入职培训都能自己做了。
唯一的问题是,这员工好像不会主动离职(此处送上一个微笑脸.jpg)。
此外,这玩意儿可以自己挑选干活用的大模型。
谷歌这次明确表示,Gemini Agent的底层模型可以单独选择。
现阶段,它可以在Google自家的Gemini系列,以及Anthropic的Claude系列模型之间进行动态选择,未来还计划支持更多闭源和开源模型。
至于具体用哪个,Gemini会根据任务要求,在效果、速度和成本之间做选择。
对于比较简单的工作,可以使用成本较低的模型;面对复杂任务,则可以调用能力更强的模型。
一个项目中也可以组合多个模型完成不同环节。
谷歌将这套能力称为多模型编排,并配套提供Smart Routing自动路由能力。
值得注意的是,谷歌还强调了一点——
底层模型可以变化,但Agent积累的上下文、Skills和企业数据可以保留下来。
主要就是让它不必每次从零开始理解工作,而能延续之前的任务、知识和工作方式。
这意味着,即便未来模型能力排名发生变化,企业也可以调整底层模型,而无需将已经建立起来的工作流程全部推倒重来。
谷歌、Meta、OpenAI,海外日常Agent三国杀?
谷歌这次入场,时间点还挺微妙。
就在9月29日,OpenAI刚刚发布了能够7×24小时工作的Dots。
再往前,Meta也推出了个人AI Agent Muse。
如今谷歌带着Gemini agent加入战局,三家巨头算是在Agent这件事上碰头了。
咱一起来回顾一下另外两家是啥路子。
Meta的Muse更偏向个人生活场景,可以帮用户购物、预订旅行、发邮件,甚至完成支付。
比如看中一件商品,Muse可以帮忙找货、比较选项、操作网站,最终完成购买。
相比企业内部复杂的工作流程,Muse更关注个人日常生活中那些琐碎、耗时间的事情。
这与Meta已有的社交产品和庞大用户群体也有关系。
让普通用户习惯把购物、出行等需求交给AI,显然也是Meta希望抓住的机会。
OpenAI的Dots与Gemini Agent的共同点就更多了。
Dots拥有独立的云端电脑,支持7×24小时运行,能够记住用户的长期目标和工作习惯,还可以连接超过4000个应用。
比如开发者收到新的用户反馈,Dots可以主动分析问题、修改代码,并准备PR供人审查。
对于内容创作者,它也可以在新的采访记录到来后,整理素材、制作内容草稿。
不过,Dots目前更强调围绕用户个人持续工作。
它会逐渐了解用户的偏好、目标和判断标准,主动寻找可以推进的事项。
OpenAI也在探索面向企业岗位的专业Dots,让Agent拥有独立身份和职责,不过这部分目前主要处于早期企业试点阶段。
相比之下,谷歌此次重点展示的,是让Agent进一步进入企业已有的组织和办公体系。
Gemini Agent可以利用Gmail、Docs、Sheets、Calendar等应用中的业务上下文,理解员工正在做什么。
企业还能创建有独立邮箱、日历、账号和权限的Coworker agent,让它以自己的身份参与团队协作。
同时,谷歌还把模型选择、企业数据连接、安全审计和成本控制放进这套体系。
甚至连竞争对手Claude,都可以成为Gemini agent完成任务时调用的底层模型。
这么看下来,三家的侧重点就比较清楚了。
One More Thing
BTW,谷歌的长文中还发布了其它相关内容,感兴趣的小伙伴可移步自行查看,啾咪~
Gemini全面进入Google Workspace,支持跨应用完成工作
开放Skills、Tools与企业连接器
推出数据分析、金融和法律专业Agent
增强Agent安全治理和成本控制
【谷歌原文】
https://cloud.google.com/blog/products/ai-machine-learning/welcome-to-gemini-at-work-2026/