安全研究人员近日披露了一项影响所有主流AI推理模型的重大架构漏洞,该漏洞允许攻击者解密Anthropic、OpenAI和Google等公司模型的加密“内心思维”数据。研究还发现,公开共享的会话日志中埋藏着62个有效API密钥和33个密码。
由MATS Research、ELLIS Institute Tübingen、马克斯·普朗克智能系统研究所及安全公司Snyk的研究人员于8月10日提交的论文显示,通过对从公共代码仓库抓取的315,320个推理区块进行解码,他们恢复了367个个人身份信息(PII)和182个凭据。
推理模型与标准AI模型不同,它会在给出最终答案前生成内部思维链(chain-of-thought),即逐步推理的草稿。Anthropic、OpenAI和Google等公司对该隐藏推理过程进行加密,以保护知识产权并防止敏感中间数据泄露给用户。加密块会随每次后续消息传回服务商服务器,从而在不于用户端存储数据的情况下维持会话连续性。
漏洞根源在于加密架构:三家提供商并未将每个加密推理块绑定到特定用户、会话或模型,而是在整个生态系统中使用单一全局加密密钥。研究人员写道:“这些加密块在不同会话、不同用户甚至同一提供商的不同模型之间完全兼容且可互换。”这意味着,旗舰模型(如Claude Opus 4.8)的加密推理块可以被注入到防护较弱的姊妹模型(如Claude Haiku 4.5)中。Haiku缺乏防止模型转录自身推理的反蒸馏(anti-distillation)对齐机制。研究人员发现,Haiku在被提示时会逐字读出加密块。
论文指出:“通过将给定模型的加密推理轨迹注入同一提供商下较弱且防护较少的模型,我们迫使其以明文逐字解码并输出该轨迹,而无需直接越狱功能更强的模型。”同样的攻击在OpenAI的GPT-5.6系列和Google的Gemini系列中均成功复现,仅需标准API访问权限。

为展示实际影响,研究团队从GitHub和Hugging Face抓取了6,708份公开共享的AI代理日志。开发者常为了协作或调试而发布会话日志,却未意识到其中隐藏的敏感数据。大多数恢复的秘密从未出现在可见的AI输出中——它们仅存在于加密的推理块内部。
该漏洞可催生四类攻击向量:窃取专有推理模式用于蒸馏攻击;从共享日志中提取隐私数据;在加密块内执行安全工具无法察觉的隐形提示注入;以及借助防护较弱的兄弟模型越狱强大模型。
Anthropic、OpenAI和Google在研究团队遵循负责任披露流程后,均已部署服务器端缓解措施。补丁已经上线,但被抓取的6,708个包含已解码推理块的会话记录仍处于公开可访问状态。
