安全研究人员找到了一种方法来读取每个主要人工智能推理模型的加密“内部思想”,并发现了隐藏在会话日志中的 62 个实时 API 密钥和 33 个密码,开发人员在不知道其中内容的情况下在网上公开共享这些日志。

研究人员写道:“通过解码从公共存储库中抓取的 315,320 个推理块,我们恢复了 367 个个人身份信息 (PII) 工件和 182 个凭证。”

这篇论文由 MATS Research、ELLIS 图宾根研究所、马克斯·普朗克智能系统研究所和安全公司 Snyk 的团队于 8 月 10 日提交,针对特定类别的人工智能:推理模型。这些模型不只是立即回答,而是从内部思维链(人工智能在向您显示答案之前逐步解决问题)开始,然后提供最终响应。

Anthropic、OpenAI 和 Google 都对隐藏的暂存器进行了加密。加密是将数据打乱为不可读代码的过程,旨在保护公司的知识产权,并使用户远离敏感的中间推理。加密的块会随着每条后续消息传回提供商的服务器,从而维持对话而不在公司端存储任何内容。

一键统治一切

缺陷是建筑性的。所有三个提供商都没有将每个加密推理块绑定到特定用户、会话或模型,而是在整个生态系统中使用单个提供商范围的加密密钥。研究人员写道:“这些加密块在不同会话、用户甚至提供商生态系统中的不同模型之间完全兼容和互换。”

这意味着来自 Claude Opus 4.8(Anthropic 的旗舰模型)的加密推理块可以注入到 Claude Haiku 4.5(一个更便宜、更少保护的兄弟版本)中,而不会违反 Anthropic 的规则。 Haiku 缺乏 Opus 所具有的反蒸馏对齐(专门设计用于阻止模型根据命令转录自己的推理的安全训练)。

让俳句逐字读出加密块,它确实读出了。该论文指出:“通过将给定模型的加密推理跟踪注入来自同一提供商的较弱、保护较少的模型中,我们迫使它以明文形式逐字解码和输出跟踪,而无需直接越狱功能更强大的模型。”

“跨模型可移植性意味着 Haiku 4.5 可以读取 Opus 4.8 的想法,”首席研究员 Alexander Panfilov 在 X 上写道。同样的攻击在 OpenAI 的 GPT-5.6 系列和 Google 的 Gemini 模型系列中重现。无需特殊访问 - 标准 API 访问(开发人员用于在 AI 模型之上构建应用程序的连接)足以执行它。

我们终于可以谈谈了:

我们找到了一种方法,利用每个前沿人工智能公司 API 中的漏洞来提取前沿模型的隐藏推理。

我们验证了对于我们查询的大多数提示,我们的推理令牌计数与计费的 API 思考令牌 1:1 匹配。 pic.twitter.com/S7wN8aP3X7

— 亚历山大·潘菲洛夫 (@kotekjedi_ml) 2026 年 8 月 11 日

公共日志包含哪些内容

为了展示真实世界的损害,该团队抓取了 6,708 份公开共享的 AI 代理记录,即开发人员通常发布到 GitHub 和 Hugging Face 进行协作或调试的自动会话日志。他们从这些日志中解码了 315,320 个推理块。

该论文指出:“开发人员经常在线公开共享他们的会话日志和加密思维轨迹,完全不知道隐藏在加密块中的敏感数据。”这些秘密中的大多数从未出现在可见的人工智能输出中——它们只存在于加密推理中,对于没有运行攻击的任何人来说都是不可见的。

除了简单的凭证盗窃之外,该漏洞还开辟了四种攻击途径:从人工智能公司窃取专有推理模式,通过蒸馏来训练竞争模型(当较小的人工智能通过研究其输出来学习模仿较大的人工智能时);从共享日志中提取私有数据;执行隐形提示注入,其中恶意指令隐藏在安全监控工具永远看不到的加密推理块内;并通过他们不那么戒备的兄弟姐妹越狱强大的模特。

在团队遵循负责任的披露程序后,Anthropic、OpenAI 和 Google 都部署了服务器端缓解措施。正如 Decrypt 之前报道的那样,Anthropic 今年一直是安全研究人员反复关注的焦点,特别是因为其最新模型在此过程中消耗了更多的代币。

补丁已上线。已经从公共网络上抓取的 6,708 个带有解码推理块的会话记录不会消失。