Google 于 8 月 13 日发布了 Gemini 3.7 Flash,第一天就在 160 多个国家/地区上市。它需要多达 100 万个输入令牌,返回 64,000 个,读取图像、视频、音频和 PDF,并且可以调用工具并驱动计算机。
当问题很困难时,Flash 从来都不是您可以使用的模型。您可以使用它对文本进行排序,在代理会话在自己的上下文中崩溃之前对其进行压缩,并总结您不想付费阅读的文档。

与这些类型的工作相比,3.7 Flash 是一次真正的升级。与其他因素相比,它是一个称职的模型,可以被免费下载的软件所超越。
Google 自己的基准测试表显示 3.7 Flash 在 18 个测试类别中的 11 个类别中领先于 Claude Sonnet 5 和 GPT-5.6 Terra。 Code Arena 网络开发板上的头条数据为 1,588 Elo,AutomationBench 上的头条数据为 30.4%。两者都来自谷歌的方法论,因此将领先视为该公司的主张而不是既定事实。
我们测试了该模型,看看它是否符合谷歌的说法。这些是我们的结果。
编码:它可以构建一些可以在第一次尝试时运行的东西吗?
该测试衡量零样本代码生成——模型是否将一条指令转化为工作软件,而无需复制示例,也没有机会自我修复。我们交付浏览器游戏的单个提示并发送返回的任何内容,包括错误。没有后续行动,没有错误报告,没有第二次尝试。
双子座3.7闪电2分13秒过去了。游戏在第一次运行时就可以玩,语法干净,碰撞和得分逻辑保持不变,视觉质量高于价格等级所建议的水平。
这里重要的比较不是旗舰产品。这是7月21日发布的Gemini 3.6 Flash,它根本无法生成工作文件。它的 HTML 格式错误,元素无法呈现,并且要求其修复自己的输出的后续提示毫无结果。
我们最终将这个残骸交给了 DeepSeek,它发现了 11 个错误并修复了 8 个补丁以使其可以玩。三周后,相同的产品线不需要救援,结果与我们 7 月份审查中产生的 GPT-5.6 Sol 接近。
Gemini 3.7 Flash 彻底赢得了这一胜利,这是切换的最有力的理由。需要注意的是,它执行规范而不是发明规范,因此模糊的提示会给您带来模糊的游戏。
您可以在这里尝试Gemini 3.7 Flash的游戏。
创意写作:能不能容纳一个悖论,写出一个句子?
本节同时测试两件事:文学质量,以及模型是否可以遵循数千个单词的结构规则。提示将何塞·兰兹从 2150 年送回到 1000 年,并要求一个闭合的因果循环——他的干预必须是创造他来阻止的未来的事情。
决定测试的规则是最后一个条款:直到他回家之前,他无法理解自己做了什么。
Gemini 3.7 Flash 产生了不错的结果。何塞向比利牛斯山的裂缝发射了熵大炮,意外地锻造了一座奴役了 22 世纪伊比利亚的方尖碑,并在一千年前仍然站在泥泞中时掌握了整个环路:“它是煤渣尖塔的底部。”
情节机制实际上相当健全。这个故事提到了古代僧侣目睹的一颗流星,并澄清这是何塞自己到来的闪光,而他带来的消除异常的武器正是它的锻造者。它的结束语——“它只是在等待他完成它”——体现了提示所要求的决定论。
但对于那些习惯了这个故事的人来说,这个故事尖叫着“人工智能”。几乎每个名词都附有两个形容词:“超发光的塔”、“潮湿、长满青苔的土地”、“浓密的黑曜石头发”。这是模型选择最可能的下一个单词而不是选择一个的纹理,它会产生像一块“发出低频嗡嗡声”的巨石一样的碰撞。
我们将其与 Qwopus3.5-27B-v3 进行了比较,Qwopus3.5-27B-v3 是 Qwen3.5-27B 的社区微调,它提炼了 Claude Opus 风格的推理,并在单个消费者 GPU 上运行,每个查询不需要任何费用。它遵守了双子座打破的规则。
何塞在圣米兰德拉科戈拉(San Millán de la Cogolla)杀死了一名僧侣,这是一座真正的拉里奥哈修道院,在 1000 年左右实际上很重要,只有在回到 2150 年并在蜡封手抄本中找到自己的 DNA 后才明白他做了什么。
Qwopus 也不完全干净。它把整个计划草稿本(包括打字错误)都扔到了故事上面,而它的最后一部分打破了它花了八个部分构建的闭环,让何塞回去修复问题。
但综合考虑,Qwopus 接受了它。 Gemini 提供了更整洁的程序包和更有纪律的结局,但它未能完成提示所围绕的一条指令,而在游戏 GPU 上运行的免费模型编写了更好的故事。
联想思维:隐喻可以论证吗?
该测试衡量联想推理——模型是否可以在不相关的概念之间生成链接而无需自我解释。提示要求对一根树枝进行描述,使用该描述来解释工人的剥削和对富人的崇拜,然后要求将论证分解为对生菜的描述。
路标是失败模式。给这个比喻命名就杀死了它。
双子座在第二段的开场白中将其命名为:“这是现代无产阶级的精确机制。”之前的一切都正常。
一些图像赢得了它的位置。工人收到的树皮“刚好足以保持一周的产出的刚性”,而掉落的树枝则习惯性地相信,只要有足够的刚性,其中任何一根都可能成为树干。包含第一段的段落还包含一名“受制于庞大、头重脚轻的公司等级制度”的工人。
从逻辑和结构上来说还不错。
溶解才是真正的崩溃。双子座讲述了这一转变,而不是执行它——等级制度“崩溃,溶解到下面有机世界的安静、谦逊的现实中”——然后一棵生菜就出现了,与它之前的任何东西都没有联系。
GPT-5.6 索尔将树枝腐烂到土壤中,并从中长出生菜:“雨水进入谷物。纤维松动,变暗。”争论也埋藏在物体中,财富被重新定义为一种美德语言,其中“豪宅意味着智慧”。
GPT-5.6 Sol 以很大优势获胜。双子座产生了一个很好的单独的线条,但它解释了自己的隐喻,然后跳过了提示专门测试的转换。
逻辑:它会阅读提示或识别谜题吗?
该测试衡量非数学推理,特别是模型是否读取它前面的问题或与其记忆的版本进行模式匹配。我们的桥梁提示为四个人提供一支火炬,过桥时间为 1、2、5 和 10 分钟,然后询问他们能以多快的速度过桥。
诀窍在于提示所遗漏的内容。桥上并没有说只能两个人同时上桥,所以答案是10分钟——大家一起以最慢的速度走过去。
双子座回答了 17 分钟,运行了教科书版拼图中记忆的五步洗牌。它把约束陈述为事实,而没有检查我们是否已经写了它。
它的可见推理比它的答案更糟糕。跟踪表明,将两个最慢的人一起发送是低效的,因为必须有人将火炬走回来——然后最终的答案无论如何都会将他们一起发送。它在单个响应中自相矛盾,并完全自信地报告结果。
早在 7 月份,《克劳德寓言 5》就出现了同样的错误号码。它一开始就宣布了它的假设,“假设桥一次只能容纳两个人的经典限制”,这就是你能捕捉到错误答案和不能捕捉到错误答案之间的区别。
没有人赢。 《神鬼寓言》只注重透明度,而双子座特工运行中的虚假信心就出现在一个你可以手动检查的谜题中。
数学:它完成了工作吗?
该测试衡量的符号数学远远超出了消费者的使用范围,此外还包括一些更简单的东西——模型是否按照要求进行操作。提示需要一个具有实数系数和线性系数 -19 的 19 次奇数一元多项式,其曲线分裂成至少三个不可约分量,然后要求 p(19)。
两个模型发现了同一扇门。 Gemini 和 Qwen 3.7 Max Preview 都识别了 Dickson 多项式,求解约束以将其参数固定为 1,并正确导出闭合形式。
然后双子座停了下来。它将 p(19) 打印为涉及平方根 19 次方的未计算表达式,从未生成数字,也从未演示提示所要求的组件计数。它在一个带有 CSS 和阴影的样式化 HTML 页面中提供了所有这些内容,但没有人要求。
奎文说完了。它将完整分解为 10 个分量(一个线性、九个二次),将递推结果得出 1,876,572,071,974,094,803,391,179,并以模块化方式交叉检查结果。我们在 SymPy 中独立验证了该数字并且它成立。
Qwen 的胜利取决于唯一重要的标准。双子座一开始很好,决定跳过算术,这是一个奇怪的停止点。
结论
如果您已经进入 Google 生态系统,Gemini 3.7 Flash 值得更换。它在代码方面比它所取代的模型要好得多,速度足够快,对代理工作很重要,而且成本足够低,批量运行它会产生舍入误差。
它的优势在于执行力和结构。给它一个详细的规范,它就会构建这个东西,将一个情节组合在一起,并在数千个单词中保持因果逻辑的连贯性。
它的弱点是创造力和推理能力。文字的可预测性足以让人一看就知道是机器生成的,并且该模型断言了错误的答案,但没有标记出导致错误的假设。
价格是最有力的论据。以每百万代币 75 美分的输入代币和 3.75 美元的产出计算,它比 GPT-5.6 Sol 的 5 美元输入率低了 85%,成本是 3.6 Flash 发布时的一半。
反对它的论点是游戏 GPU 上的免费 27B 模型,它写了一个更好的故事,而且不收取任何费用。 Google 的介绍费将于 12 月 31 日到期,届时输入将翻倍至 1.50 美元,输出将达到 7.50 美元。