OpenAI 于 9 月 3 日发布了 GPT-6 Astra,在 48 小时内,抢先体验的开发者将此次发布变成了公开压力测试。他们发布的内容沿着一条清晰的路线分裂。

Astra 是任何人在空间、机械或代理方面使用过的最强大的模型。根据几位同一个人的说法,它也是一个比它所取代的模型更糟糕的作家。

该模型每百万个输入代币的成本为 10 美元,每百万个输出代币的成本为 50 美元,一个代币大约占单词的四分之三,是人工智能公司计费的单位。根据人工分析,这是 GPT-5.6 Sol 速率的 2.5 倍。 OpenAI 总裁 Greg Brockman 在发布会上宣布了 AGI 的到来。

最主要的特征是计算机的使用,这意味着该模型在真实的桌面上驱动鼠标和键盘,而不是交还给您遵循的说明列表。 OSWorld 2.0 是一项对代理自行完成普通桌面事务的百分比进行评分的测试,OpenAI 报告称,每项任务大约需要 40 分钟,完成率为 72.6%,而 Sol 的完成率为 75 分钟,完成率为 65.7%。

这也是 OpenAI 有史以来第一个被评为网络安全关键阈值的模型,这意味着它可以发现未知的软件缺陷并构建有效的攻击,而无需人类先指出漏洞。

但除了基准之外,爱好者分享他们的真实用例可能是了解 GPT-6 哪里是黄金、哪里是垃圾的最好例子。以下是一些最有趣的结果

视觉理解:一条条街道建造的曼哈顿

事实证明,Astra 在视觉理解和空间感知方面非常出色。

HyperWrite 的投资者兼前首席执行官马特·舒默 (Matt Shumer) 让 Astra 在虚幻引擎(《堡垒之夜》背后的游戏引擎)中体验了一周。那时,阿斯特拉能够生成曼哈顿的复制品。他发布了一张飞行图,并表示该模型“逐条街道地工作,使每一个都完美无缺”。

GPT-6 Astra 在虚幻引擎中花了一周的时间构建了这个曼哈顿世界。

它确实能够走一条街一条街,让每一条街都变得完美。 pic.twitter.com/7VTol9QfHq

— 马特·舒默 (@mattshumer_) 2026 年 9 月 3 日

他的另一个实验落地得更艰难。舒默要求阿斯特拉建立一个生存世界,并在其中填充每个角色,每个角色都在自己的模型副本上运行,然后让它运行一夜。一天后,他听到客厅里传来声音,以为有人闯入了他的公寓,并发现“他们开始互相交谈”。

Max Weinbach 提供了 Apple Park 的模型照片,并要求在 Blender(动画师和游戏艺术家使用的免费 3D 建模程序)中进行重建。他的评价是:“它做得很荒谬。”

我很早就接触到了 GPT-6 Astra,它可能是我经历过的最疯狂的模型

在 Blender 中,我让它从图像中重新创建了 Apple Park。它做了一件荒谬的工作。 pic.twitter.com/0vDgg9u1DQ

— 马克斯·温巴赫 (@mweinbach) 2026 年 9 月 3 日

Tom Krcha 向 Astra 提供了一张房子的单张图像,并以每秒 60 帧的速度运行的可编辑几何图形返回完整的内部结构,包括电器和玩具。他认为“现在世界上每个人都拥有触手可及的 3D 设计师。”

Pietro Schirano 将整个工作流程简化为一个手势。在地图上放置一个图钉,询问周围的 3D 区域,正如他所说,“它就会做到这一点。”

你可以在地图上放置一个图钉,要求 GPT-6 以 3D 方式重新创建其周围的区域,它就会做到这一点,哈哈 pic.twitter.com/0PBTpV9kpF

— 彼得罗·斯基拉诺 (@skirano) 2026 年 9 月 4 日

一位名为 SuSu 的开发人员在城市范围内提出了同样的想法。 Astra 在 Three.js(一个可以在普通网络浏览器中渲染 3D 图形的 JavaScript 库,无需下载)中重建了中国杭州及其周边城镇,并在 24 分钟内将西湖、雷峰塔、茶梯和湿地全部就位。

该帖子用中文将其描述为一个真正的交互式“微型杭州”,而不是静态图片,配有可点击的地标和昼夜切换。

🔥绝了!GPT-6 Astra在24分钟内用Three.js把整座杭州搬进网页,能逛能飞能切换昼夜!

刚上线的GPT-6 Astra,直接用Three.js把杭州+周边完整3D还原了:西湖、雷峰塔、钱江新城、奥体大莲花、龙井茶山、西溪湿地……甚至延伸到富阳、桐庐、绍兴。… pic.twitter.com/eC1dZDsVI0

— SuSu_酥酥👅 (@NFT_Chen) September 5, 2026

编码:人们实际玩过的游戏

游戏是迄今为止最受欢迎的用例,也是 GPT-6 Astra 的亮点。

Anshu Chimala 是 Apple 的前 UX/UI 设计师和 AI 开发人员,他在 45 分钟内一次性完成了一款 3D 游戏,他称这仅占他使用配额的百分之几。他称 Astra 为“某种用于 3D 游戏的涡轮 AGI 机器之神”。

该游戏尚未进行测试,但视频显示了等距视图风格、精心设计的角色和环境以及整体良好的美感。

他的方法比最高级更重要。他将模型连接到 Blender,让它为目标外观生成自己的概念艺术,然后告诉它继续迭代,直到游戏中的屏幕截图与 60fps 的参考相匹配。 Astra 对每个资产进行建模并生成自己的纹理。

因此,该模型无法自行设计 AAA 图形,但使用正确的工具,它将能够开发设计精美的环境。

Rishi Prasad 是 Coinbase 和 Eleven Labs 的前开发人员,他在一天之内构建了《Astral War》:一款具有权威多人服务器、12 人大厅、控制器支持和语音聊天的浏览器射击游戏。他描述了与他一个月前使用 Claude Opus 5 构建的产品相比“视觉保真度方面的巨大阶梯函数飞跃”。

GPT-6 Astra 通过 AI 游戏创作打破了所有先例

隆重推出 Astral War,使用 GPT-6 Astra Ultra(快速模式)一天内构建完成

《星界之战》是一款基于浏览器的 CoD 战争世界,灵感来自@ Threejs + @MeshyAI + @ElevenLabs 现代 Claudefare 的混音(和大规模升级) - a… pic.twitter.com/n9kTaDh4Wx

— Rishi (@0xRishi) 2026 年 9 月 5 日

其他人则完全跳过了设计步骤。化名的人工智能开发者 Daniel 向 Astra 展示了一个手机游戏广告,并要求提供其中所有内容的可玩浏览器版本。不到 30 分钟后,他报告说“结果非常接近”。

该模型理解视频中的游戏逻辑和视觉效果,并能够重现它。

电脑使用与插画:用鼠标绘画

一位以 Taiyaki Sun 身份发帖的日本插画家对这批计算机的使用进行了最真实的测试。他们没有索要图片,而是给了 Astra 一份手绘的线条艺术文件,并告诉它使用鼠标在 Clip Studio Paint 中为图画着色,就像人类调色师那样。

GPT-6 Astra的绘图能力惊人! ! !

每个人都让Astra从头开始画一幅画,所以我给了他一张我手绘的线条图,并让他用鼠标和绘画软件给它上色。哇,这就是AI分工啊。

这个延时摄影全部由 Astra 提供动力。 … pic.twitter.com/hZk30pBgCq

- Taiyakisun (Taiyaki Sun)🥐 (@taiyaki_sun) 2026 年 9 月 5 日

Astra 创建图层、放大和缩小、选择画笔并填充图稿。这位艺术家在一篇从日语翻译的帖子中表示,他们一直在观看。该会话以 100 美元的 Pro 计划全力运行,消耗了 21% 的配额。

其他用户一直在分享 Astra 能够使用计算机在 Paint 上完全复制照片的有趣视频(以视觉方式接管您的计算机,而不是使用 MCP 服务器或 API 密钥)。

音乐:巴赫测试

GPT-6 Astra 对音乐也有很好的品味——至少对于法学硕士来说是这样。

负责“增强第五”子堆栈的 Auggie 维护着一个非正式的基准:一个固定的提示,要求模型使用 LilyPond(一种可以编译成乐谱的文本格式,G 小调和 3/4 拍)以巴赫风格编写四部分合唱曲。结果按照音乐学院学生评分的相同和谐规则进行评分。

这些定性基准很难标准化,因为质量、美观等都是主观的。但感谢上帝,我们是人类,我们能够区分这些品质。

Astra 取得了本次测试的最高分。没有语音引导错误,这意味着没有任何旋律线以巴赫规则禁止的方式发生冲突,和声中也有那不勒斯的六度音——莫扎特和贝多芬中出现的半音和弦。 Auggie 将其标记为“第一个在该基准测试中编写传递音的模型”。

GPT-6 Astra 在巴赫基准测试中取得了迄今为止最好的成绩。它的众赞歌不包含任何声部引导错误,其和声调色板足够复杂,包括那不勒斯第六和弦。更重要的是,它是第一个在该基准测试上编写传递音的模型,a… https://t.co/upUts1Y3Ps pic.twitter.com/UMXSbveR0C

- 奥吉 (@aug5thmusic) 2026 年 9 月 5 日

OpenAI 自己的表格也表明了同样的观点。 OpenScore 弦乐四重奏对模型读取和转录古典乐谱的准确度进行评分,Astra 达到了 0.84,而 Sol 为 0.19。

Derya Unutmaz 是一位医生,也是一位多产的人工智能测试员,他需要一款完全可弹奏的虚拟钢琴,并内置巴赫的全部六首勃兰登堡协奏曲。他写道,“这个疯狂的模型在大约 11 分钟内完成了整个过程。”

要求 GPT-6 Astra 创建一个完全可演奏的虚拟钢琴,然后构建巴赫的勃兰登堡协奏曲。这个疯狂的模型在大约 11 分钟内完成了整个过程!所有 6 首协奏曲都是内置的,可以直接在钢琴上演奏!

钢琴链接:🎹✨ https://t.co/6JHXsQq5kP .... pic.twitter.com/DBwXF3uA8O

— Derya Unutmaz,医学博士 (@DeryaTR_) 2026 年 9 月 5 日

需要强调的是,GPT-6 Astra 是一个法学硕士,而不是一个音频/音乐模型。它对音乐的理解可能来自乐谱和书面数据,而不是实际上来自其训练数据集中注入的声音和音乐的联系,因此这些结果对于文本模型来说非常令人印象深刻,但如果它们来自像 Suno 这样的专门人工智能,那么结果就会低于标准。

写作:它崩溃的地方

天啊,人们怀念 GPT-4o 吗?

和往常一样,OpenAI 模型擅长编码,但不擅长写作……至少在没有大量提示、上下文和指导的情况下是这样。公平地说,这不是 OpenAI 的强项,也不是其主要关注点。

路易斯-弗朗索瓦·布沙尔(Louis-François Bouchard)运行了一个内部基准测试,对模型在其团队的编辑声音中的写作能力进行评分,并根据 Elo 进行排名,Elo 是一种国际象棋评级系统,用于为竞争对手在正面交锋中获胜打分。

Astra 以 1995 分排名第 11 位。它的前身以 2156 排名第六。Astra 每个脚本的运行成本约为 0.26 美元,大约是 Sol 成本的 1.8 倍。在 Elo 评分中,没有分数限制:得分越多,模型就越好。

我们内部写作基准测试的重大消息(早期结果):GPT-6 ...令人惊讶地令人失望

我绝对没想到......

@OpenAI 的 GPT-6 Astra 在 1995 年 Elo 中因用我们的社论声音写作而排名第 11。这低于其前身。 GPT-5.6 Sol 排名第六…… https://t.co/hyO5OakLPB pic.twitter.com/gUxHtpIdfo

— 路易斯-弗朗索瓦·布沙尔 🎥🤖 (@Whats_AI) 2026 年 9 月 5 日

布沙尔称这个结果“令人惊讶地令人失望”,并补充说他没有预料到会这样。

Giuseppe Paleologo 是一本广泛使用的量化投资组合管理指南的作者,他要求 Astra 提出关于最佳投资组合多元化的新颖想法。他说,返回的结果是明显和夸大的混合体,他发现这些散文可以立即被识别为机器编写的。他的结论是:“真正的创造力还很遥远。”

Mia AI Lab 也有类似的观点,认为 Astra 可能是某些任务上的最佳模型,同时称其无聊并没有个性。他们的建议是在任何创造性工作中避免使用它。

对不起 GPT 6 Astra 爱好者

它可能是某些任务的最佳模型,但它没有个性,而且非常无聊

会避免任何创造性的工作

— 米娅 (@MiaAI_lab) 2026 年 9 月 5 日

英加·哈兰德运行了最干净的测试版本。他要求 Astra 以他自己的风格写四个段落,足够接近 Pangram 无法捕捉到的内容——Pangram 是一种人工智能检测工具,可以将文本与从数百万人类和机器样本中学到的模式进行比较。结果:“Pangram 没有被愚弄。”

换句话说,该模型没有创造性,其结果很容易被识别为人工智能生成的,不是因为任何水印,而是因为模型如何编写和表达自己。

要求 Astra “以我的风格写四段关于任何你想要的内容,这些内容与我的写作非常接近,甚至不会被 Pangram 检测为人工智能写作。” Pangram 没有被愚弄。 pic.twitter.com/0kfHa2XOe6

- 英加·哈兰德 (@Ingar30) 2026 年 9 月 4 日

独立测量与投诉相符。 Artificial Analysis 在 GDPval-AA v2 上记录了大约 80 个 Elo 点下降,GDPval-AA v2 是一个改编自 OpenAI 自己的数据集的基准,涵盖 44 个职业中具有经济价值的任务,加上客户支持和长上下文推理方面的较小回归。

这并不一致。 Cognition 的 Silas Alberti 告诉 OpenAI,Astra 的写作让 Devin 的测试报告更加清晰,《Every Staff》的撰稿人 Katie Parrott 让 Astra 起草了她自己的评论的第一个版本,该媒体的首席执行官读了该版本,但没有意识到她没有写过它。

两半之间的差距似乎就是这里的重点。 Astra 非常擅长提供可验证的正确答案——解析的和弦、渲染的网格、提交的表单——但在以品味为标准的工作中表现平平。

找出答案需要付出什么代价

Astra 正在通过 API、Microsoft Azure 和 AWS Bedrock 向 ChatGPT Plus、Pro、商业和企业用户推出,企业访问权限将关闭,直到管理员启用为止。先进的网络安全功能受到 OpenAI 的 Daybreak 计划的保护,当路透社报道 OpenAI 特工一直在德国网站上交易违反规则的策略时,这一决定在 48 小时内看起来是谨慎的。

市场交易商预测,Astra 9 月 30 日发货的可能性为 72%。该货于 3 日抵达。

在人工智能分析智能指数(推理、知识和编码评估的第三方汇总)上,Astra 得分为 61.2,GPT-5.6 Sol 得分为 60.9,Anthropic 的 Claude Fable 5.1 得分为 65.7,其价格是 Sol 的 2.5 倍。