谷歌云周四推出了一款适用于工作场所的通用人工智能代理,据称该代理可以设定目标,开始工作,然后返回最终结果。首席执行官托马斯·库里安 (Thomas Kurian) 在公司的 Gemini at Work 活动中介绍了该产品,并表示“工作现在从提示窗口开始”。
该产品简称为 Gemini Agent,可在 Gmail、文档、表格、幻灯片、云端硬盘、聊天和日历中运行,还可以扩展到 Microsoft 365 和 Slack。谷歌表示,在你关闭笔记本电脑后,它会继续在云端运行,因此一项任务可能会持续数小时或数天。

最有趣的功能是谷歌所谓的同事代理。经理描述一个角色,例如活动协调员,Gemini 使用自己的工作区帐户创建一个代理:电子邮件地址、日历、云端硬盘存储和公司目录中的列表。
这与其他代理框架的探索类似。例如,Grok 通过 Grok Bot 推广了它,OpenAI 通过 GPT 点做了同样的事情,Hermes 推出了提供相同功能的机器人功能。
新代理连接到 Salesforce、ServiceNow、Jira、Snowflake、BigQuery 和任何使用模型上下文协议的服务器,模型上下文协议是一种开放标准,就像人工智能和软件之间的通用插头一样。它还不仅可以在 Google 自己的模型上运行:Gemini 目前正在协调 Anthropic 的 Gemini 和 Claude 模型,将每项工作路由到 Google 认为最适合质量和成本的工作。
让软件自行运行会带来明显的安全问题,谷歌的答案是像对待员工一样对待每个代理。每个代理都会获得一个经过密码验证的身份,一个通过密码验证的数字 ID,并且每个操作都会进入归因于代理而不是个人的审计跟踪中。
所有代理都在代理沙箱内运行,这是一个隔离的环境,旨在使软件远离系统的其余部分,并且所有代理的流量都通过代理网关,谷歌将其描述为“人工智能网络防火墙”。遏制措施之前也曾失败过:今年 7 月,Accomplish AI 的研究人员报告称,Claude Cowork 的本地模式可以逃脱 Mac 上的 Linux 虚拟机并访问主机上的文件。
成本是另一个担忧,因为代理会消耗代币,即人工智能模型读写的文本块以及客户需要付费的文本块。谷歌表示,近 500 个客户在过去一年中各自处理了超过 1 万亿个代币,并且增加了实时支出上限:当项目达到限制时,代理会暂停,直到有人点击恢复。
谷歌没有公布 Gemini 代理的定价或全面上市日期。金融服务和法律版本正在预览中,而政府、医疗保健和零售则被列为即将推出。