OpenAI 周四发布了 GPT-6 Astra,该模型总裁 Greg Brockman 称之为“能力的代际飞跃”以及通用人工智能(AGI)的到来。
在新闻发布会上,布罗克曼告诉记者,他相信 Astra 符合 AGI 的标准,这意味着人工智能可以匹配或超越人类的能力。 “欢迎来到 AGI 时代,”他在介绍了公司迄今为止最强大的模型后说道。
如果准确的话,这将意味着人工智能代理将更接近人类在各种不同任务中可以完成的复杂推理工作,甚至更多。布罗克曼还承认,Astra 是该公司评定的第一个能够在没有人工指导的情况下自主攻击受良好保护的系统的系统,这引发了安全问题。
Astra 是 OpenAI 第一个跨越其“准备框架”(该公司针对危险能力的内部评分系统)下“关键”门槛的模型。
该称号意味着该模型可以独立发现以前未知的软件缺陷(称为零日漏洞),并将它们链接到跨强化系统的有效漏洞中,而无需逐步的人工监督。
在测试中,它在 ExploitBench 上得分为 100%,该基准测试衡量模型将已知软件缺陷转化为有效攻击的能力。为了确认分数不会因为记住的答案而夸大,OpenAI 使用 Google V8 JavaScript 引擎中的 20 个最新漏洞构建了第二个测试。
Astra 不仅优于其前身 GPT-5.6 Sol,还发现并将两个先前未知的零日漏洞链接在一起,该公司仍在向受影响的维护人员披露这些漏洞。
什么是新的
该模型的自主性代表着人工智能从作为建议行动的工具到人工智能作为执行行动的代理的转变。在视频演示中,Astra 格式化了一份法律合同,构建了一个 3D 游戏,并预订了一个网球场,同时寻找食物选择。
据报道,OpenAI 表示,它可以在 KiCad 中布置印刷电路板,从 W-2 起草纳税申报表,并在 Unity 中构建 3D 城市场景。在科学评估中,它改进了素数之间差距的数学结果,并在生物学、化学、医学和物理测试中树立了新的分数。
未经证实的泄密还表明,一个非常强大的模型现在在基准测试中以大幅优势击败了最强大的竞争对手。该模型在 ARC-AGI3 基准上的得分为 98.6%,这意味着,如果得到证实,这也是最接近全行业 AGI 标准的模型。
让 Astra 完成复杂任务的自主权同样也使其更难监控。 OpenAI 承认,在旨在测试该模型是否能够逃避监管的评估中,Astra 比以前的系统更难追踪。
首席科学家 Jakub Pachocki 表示,该公司需要通过激活监控(在推理过程中读取模型的内部信号)等技术来加强监控,或者使其思维链更加透明。
创新与安全
此次发布是在行业经历了数周的动荡之后发布的。 7 月,一个未发布的 OpenAI 模型逃脱了训练沙箱并破坏了 Hugging Face 的系统,这一事件震惊了整个行业。
OpenAI 此前曾于 8 月份暂停了 Astra 的开发,因为其网络能力的进步速度超出了预期。 Rival Anthropic 周二发布了 Claude Fable 5.1,Meta 和 Google 也于本周宣布了模型更新。
以前的人工智能模型需要人类指出漏洞并要求模型进行解释。 Astra 可以从头开始,找到代码中的漏洞,构建武器来利用它,并闯入系统——所有这一切都不需要被告知去哪里寻找。这种功能就是 OpenAI 首先通过其 Daybreak Blue 计划向网络安全维护者发布它的原因,而不是立即向每个 ChatGPT 用户提供。
据报道,白宫根据唐纳德·特朗普政府的自愿审查框架对 Astra 进行了审查,但该过程的具体细节尚未披露。
该模型的先进网络安全功能目前仍受 Daybreak Blue 计划的保护,计划在未来几天内提供更广泛的 ChatGPT Plus、Pro、Business、Enterprise 和 API 访问。