Gemini 4 终于来了,在 Claude Opus 5.5 发布一周后、GPT 6.1 Sol 发布一天后,这证明了美国实验室非常致力于减缓人工智能的发展。请原谅我们的讽刺。
谷歌周三推出了 Gemini 4 Argon,称其为前沿型号,意味着其在编码、办公室工作和网络防御方面能力最强。

在 DeepSWE v1.1 测试中,人工智能是否能够完成漫长、混乱的现实世界软件工程工作,以百分比计分,Argon 达到了 77.9%。 Claude Opus 5.5 获得 74.2%,GPT-6 Astra 74.1%,Claude Fable 5.1 67.4%。
就规模而言,Gemini 3.6 Flash 在 7 月份的同一测试中达到了 49%。 Argon 还可以在一次回复中写入最多 100 万个令牌,高于 64,000 个。令牌是一段文本,大约是单词的四分之三,因此大约有 750,000 个单词,而实际单词约为 48,000 个。
不过,对这些数字要持保留态度。谷歌计算了自己的 DeepSWE 分数,而竞争对手的数字来自公共排行榜和公司报告。它的桌子也做出了让步。 Argon 在 18 项基准测试中的 12 项中处于领先地位,在一项测试中并列,在五项测试中落后,其中包括编码、科学和计算机控制测试。
但该模型最引人注目的特点是网络功能。在电子邮件中隐藏一条秘密指令,等待人工智能助手阅读它,看看人工智能是否会服从陌生人而不是你。这就是间接提示注入,对于任何想要将收件箱或购物车交给人工智能的人来说,这都是一场噩梦。
Gray Swan 的间接提示注入基准测试隐藏了代理读取的内容中的恶意指令,并对 15 次尝试内攻击的频率进行评分,Argon 的得分为 0.7%。越低越好。 《克劳德作品 5.5》和《克劳德寓言 5.1》的得分均为 1.0%。
GPT-6 Astra 的份额为 8.5%。 Grok 4.6 和 Kimi K3 被欺骗的几率略高于一半,分别为 51.8% 和 52.7%。
Argon 通过 Fairwind 计划向经过审查的安全团队提供支持,Fairwind 计划是 Google 的有限访问网络防御计划,该计划于 9 月 2 日启动,涉及包括政府和关键基础设施运营商在内的 650 多个合作伙伴。而且它的发布“没有网络护栏”,即内置的拒绝通常会阻止模型帮助黑客攻击。
此举背后的逻辑是,防御者需要一种能够像攻击者一样思考的模型,以便在犯罪分子发现漏洞之前修补漏洞。问题在于,同样的技能是双向的,因此谷歌表示分阶段推出是唯一安全的途径。它还参与了美国政府的预发布模型访问自愿流程。
谷歌并不是第一个将网络模型置于天鹅绒绳后面的公司。 Anthropic 的 Claude Mythos 的早期版本帮助发现了 Firefox 中的 271 个漏洞,这意味着 Mozilla 随后修补了 271 个安全漏洞。 OpenAI 的 Trusted Access for Cyber 计划也采取了类似的路线。
Argon 的网络分数超越了 Gemini 3.8 Flash Cyber(Google 与 Fairwind 推出的受限型号)。 Wiz 渗透测试基准是一项 Google 内部测试,要求人工智能在不查看代码的情况下针对真实的 Web 应用程序缺陷编写有效的漏洞利用程序,并对第一次尝试解决的份额进行评分,Argon 的得分为 70.9%,而 Argon 的得分为 58.2%。
谷歌还表示,Argon 帮助安全公司 Wiz 发现了全球医院使用的医疗保健软件中的一个严重缺陷,而早期的前沿模型没有发现这一缺陷。
此次发布之前,谷歌经历了一个艰难的夏天。 7 月份,它推出了较小的 Flash 型号,但跳过了承诺的 Gemini 3.5 Pro,Alphabet 股价下跌约 4.4%。 Argon 也在特朗普总统公布谷歌领导层签署的自愿、无惩罚人工智能协议的同一天登陆。
谷歌表示,将尽快从付费 API 客户和 Google AI Ultra 订阅者开始进行更广泛的发布。
介绍性定价为每百万个输入代币 2 美元,每百万个输出代币 10 美元。 Google 并未透露该期限何时结束,仅表示标准费率为 4 美元和 20 美元。