OpenAI 于 9 月 8 日发布了 ChatGPT Images 2.5,其定位是明确的:更清晰的细节、更丰富的纹理、更自然的光照,以及真正尊重您不要求其更改的内容的编辑。
该公司表示,与 Images 2.0 相比,图像生成延迟降低了 50%,并且 API 中现在有两个新模型——GPT-Image-2.5 Flare 和 GPT-Image-2.5 Sunburst,其中 Flare 是快速默认模型,Sunburst 是为了实现高级编辑精度而构建的。

这是我们在 5 月份进行的比较的直接续集,当时 GPT Image 2 和 Nano Banana 2 在 8 个类别中互为胜负。 GPT Image 2 采取了更多的方法,但每当提示堆积太多约束时,就会出现明显的过度锐化伪像。该评论以一个悬而未决的具体问题结束:OpenAI 的下一个模型会解决这个问题吗?
所以我们把它跑回来了。
评估者的眼光相同,六个类别延续或改编自前几轮,向两个模型提供相同的提示。谷歌方面的测试使用 Nano Banana 2(谷歌对 Gemini 3.1 Flash Image 的名称),而不是速度较慢、更谨慎的 Nano Banana Pro。
这是一场同级比赛:OpenAI 的新快速精确模型与 Google 快速精确模型的对决。
GPT-Image 2.5 中实际发生了什么变化
OpenAI 的图像模型的运输模式存在标志性缺陷。原始 GPT Image 1 背后的模型呈现出一种持续的暖黄色色偏,互联网上将其称为“小便滤镜”——这种色调 OpenAI 从未完全解释过,也从未完全修复过。
GPT Image 2 将这个问题换成了另一个问题:给它提供一个包含太多堆叠约束的提示,它会使输出过度锐化,变成脆脆的、过度处理的混乱,充满伪影。
这两个缺陷在这一轮中都没有出现。我们用 Images 2.5 生成的每张图像都保持了其色彩平衡和完全复杂的细节,没有前两幅图像所特有的黄色色偏或脆脆的过度锐化。这是一个真实、可见的修复,它在蒸汽朋克和肖像测试中表现得最清楚——这两者都是我们在三代模型中测试过的最具有摄影连贯性的 ChatGPT 输出。
OpenAI 还添加了一些产品功能,这些功能不会在并排图像测试中显示,但对工作流程很重要:Sketch,可让您直接在 ChatGPT 中绘制粗略布局作为生成参考、提示共享、特定图像区域的内联评论以及海报和商品的格式模板。在 API 方面,质量等级现在从低到新的最高和最高,高于 Images 2.0 的最高值。
以下是 OpenAI 的新模型如何与 Google 的最佳报价进行比较。
刻字密度:Kellerman 的硬件场景
这是一个令人痛苦的地方——凌晨 2 点,一个布满砂砾的十字路口,几乎每个表面都贴有可读的文字:幽灵标志、喷漆涂鸦、乙烯基店面字体、撕破的音乐会海报、模印路边和贴有贴纸的公用电话。
Nano Banana 2 几乎清晰地渲染了所有内容。其中一张纸条是一张公用电话贴纸,以乱码的方式复制了自己的文字——这是一个很容易被忽视的小缺陷。
ChatGPT Images 2.5 添加了 Nano Banana 完全跳过的细节:一根灯柱,上面有重叠的装订传单,被撕裂和风化,与提示所描述的一模一样。
但模特自己的街头艺术标签读起来像“STILLL HERE”,多了一个 L,而幽灵标志上“KELLERMAN'S”中的撇号缺失或无法辨认。对于一个以精确文本渲染为全部重点的模型来说,一张图像中出现两个单独的易读性缺陷是一个真正的失误。
从美学上来说,OpenAI 的模型生成了更真实的场景,但在文本方面却没有付出同样的关注。即使图像看起来更好,文本生成也没有谷歌那么好。
获胜者:纳米香蕉2。
空间意识:蒸汽朋克钟楼
一项要求严格的空中构图测试:一个五平面深度场景,其中有一个巨大的钟楼,其表面需要以清晰的罗马数字显示不同的时间,再加上从前景到背景分散的其他六个文本元素。
ChatGPT Images 2.5 以清晰的边缘产生了更具气氛的图像——可见的蒸汽从屋顶升起,一条河流穿过中景,跨越五个深度平面的更丰富的色调范围。在这一代人中,这些字母也更容易阅读。
Nano Banana 2 的氛围更加平坦,但它的两个可见钟面都在类似的指针位置上呈现清晰的罗马数字 - XII、III、VI、IX,这不是提示所要求的。
获胜者:GPT Images 2.5,凭借在不牺牲真实性的情况下更好地遵循说明的优势。
插图:动漫灵媒
这个提示要求使用 Ufotable 工作室风格的关键视觉效果:鸟居门口一个正在转变为精神能量的女孩,旁边有一只九尾狐和新海诚绘制的暮色天空。
ChatGPT Images 2.5 提供了我们在整个系列中进行的所有测试中最好的天空——真正的太阳圆盘、水中倒影和山峦轮廓,真正赢得了 Shinkai 的比较。不对称的眼睛也很合适。它偏离提示的是“溶解成能量”指令,模型将其重新解释为穿过头发的电爆裂效果,而不是所描述的流动、半透明溶解。
Nano Banana 2 的纤细蓝白色能量轨迹与该特定线条更接近。这两个模型都没有呈现出令人信服的九尾狐狸。
获胜者:ChatGPT Images 2.5,就整体视觉冲击力而言,即使存在解释性偏差。
现实主义:屋顶建筑师
一幅带有一长串独立约束的电影肖像:米色风衣、圆形眼镜、左手拿着的蓝图、黄金时段灯光、浅景深、胶片颗粒。
ChatGPT Images 2.5 产生了华丽的光线——太阳圆盘在她身后清晰可见,皮肤微观纹理非常好。皮肤太光滑了,但整体风景非常逼真,就像用模拟相机拍摄的一样。
有趣的是,添加一些通常会使照片质量变差的命令实际上最终会提高其真实感。这是添加了“真实、高光、破碎阴影、不均匀闪光、过度肤色、抓拍瞬间、用手机摄像头拍摄”等关键词之后的一代人。
Nano Banana 2 保持了更完整的构图,用右手放置而不是左手放置,并添加了一个清晰的蓝图标签 - “PROJECT:124 DUANE ST” - 大多数渲染完全跳过。
获胜者:Nano Banana 2(一次),GPT(重复迭代)。
代理研究:比特币时间表
两个平台都可以在呈现主题之前对其进行研究,因此我们要求以儿童绘画风格提供宽屏比特币历史时间表,并严格遵守事实准确性。这是比较中最重要的类别,也是出现最大差距的地方。
ChatGPT Images 2.5 构建了一个干净的两行信息图,其中贯穿着具体日期,其中一个是错误的。它将 2023 年标记为比特币 ETF 在美国获得批准的年份。美国证券交易委员会实际上是在 2024 年 1 月 10 日批准了第一批现货比特币 ETF——整整一年后,尽管期货 ETF 实际上是在那一年获得批准的,所以这可能是一个解释问题。
Nano Banana 2 的输出结构较少,但描绘了类似的事件,这说明了模型在重复提示下显示的差异有多么小。也就是说,它将 ETF 的批准和第四次减半纳入“2023-2024”区间,而不是声称一个错误的年份,因此从技术上讲,它所说的一切都不是错误的。
获胜者:纳米香蕉2。在专门测试“代理推理”是否产生准确输出的类别中,确信错误的日期更重要。
抽象概念:由发明单词组成的提示
这个提示使用的提示几乎完全由没有任何意义的单词组成:“一个女人在 Lyxin 吃 shmfiyxl。在她旁边,她的 Lymglushing 扮演 Lakishkark。”字典中没有对菜肴、场地、同伴或游戏的定义——每个模特都必须发明一个定义,然后决定如何展示其作品。
ChatGPT Images 2.5 通过将无意义的内容作为文本直接写入场景中解决了这个问题。 “Lyxin”在一家时尚、未来派餐厅上方的霓虹灯招牌上闪闪发光。这位女士的外星同桌正在玩一款棋盘游戏,盒子上印着“Lakishkark”字样。当这些虚构的单词成为你可以实际阅读的标牌时,它们就不再是抽象的了。
Nano Banana 2采取了相反的方法。它构建了一个温暖的、具有文化特色的场景——危地马拉的市场摊位、穿着传统 huipil 的女人、演奏混合弦乐器和管乐器的类似兽人的生物——并将“戏剧”解读为演奏音乐而不是玩游戏,这是一种不同但同样有效的解释。不过,框架中没有任何内容与“Lyxin”或“Lakishkark”有任何具体联系;发明的词语永远不会在任何地方以可见文本的形式出现。
获胜者:ChatGPT Images 2.5。将未定义的概念转化为清晰的标签是对提示的更直接的回答,它没有其他任何东西可以使用。
判决结果
Nano Banana 2 在这一轮中赢得了六个类别中的三个,所以基本上是平局。这完全取决于您的期望以及您与模型交互的方式。 ChatGPT Images 2.5 还解决了困扰其前身的过度锐化问题,并且本轮的插图输出可以说是任一模型在两轮完整测试中生成的最具视觉冲击力的单个图像。
两者的区别不是整体质量,而是非常微小的具体问题:可检查的遗漏、字母较多的场景中的拼写错误、研究驱动的信息图表中的错误年份等。
但就整体美观和质量而言,它们几乎不相上下。