公司动态
全球三大顶流AI,竟被一把「万能钥匙」打开了
八月初一篇论文让整个AI安全圈坐直了身子。OpenAI、Anthropic、Google——这三家几乎代表了当今大模型的最高水平——被同一个漏洞同时击中。研究者从公开的日志里解出了 315,320 条本该被藏起来的AI思考草稿还从里面捞出了 182 个真实凭证API密钥、密码、访问令牌、私钥。更值得玩味的是这三家其实都给这些草稿上了锁。加密了。锁上了却还是漏了。问题出在哪才是这件事真正的看点——因为它不是一个普通的安全漏洞而是一个关于AI该怎么记住自己想过什么的深层教训。先搞清楚被偷走的到底是什么现在的高级AI在给你最终答案之前会先在内部打草稿——一步步推演、试错、权衡。这个过程有个专门的名字叫思维链chain-of-thought。你可以把它理解成一个学霸在草稿纸上的演算最后只把工整的答案抄给你草稿自己留着。这份草稿很值钱。对厂商来说它是竞争壁垒里面也常常夹带着敏感信息推理过程中会调用密钥、处理隐私。所以 OpenAI、Anthropic、Google 都刻意把它藏起来不给用户看。问题是当开发者通过 API 调用模型、又需要让模型跨好几轮对话记住自己上一步想到哪的时候模型就得把这份草稿带在身上。三家的做法惊人地一致不把草稿明文给你而是把它塞进一个加密的盒子里回传给你下次请求时你再把这个盒子递回去模型打开盒子就接着上次的地方继续想。OpenAI 管这个盒子叫 encrypted_contentAnthropic 给它的思考块附一个加密签名Google 叫它 thought signatures。名字不同干的是同一件事——让模型的推理记忆能跨调用传递下去。到这一步一切听起来都很合理甚至很安全盒子是加密的应用层根本读不懂里面写了啥。那到底哪里出了错加密本身没被破解。研究者甚至都没去拿那把加密钥匙。漏洞藏在一个更基础、也更致命的设计决定里这三家都用同一把全局钥匙给所有盒子上锁而且盒子不认主人。什么意思正常的设计应该是——每个盒子都绑定到具体是谁、哪次会话、哪个模型只有对得上号盒子才能被打开使用。但这三家没这么做。他们在各自的整个生态里用一把统一的钥匙盒子和盒子之间可以随便串——A 用户会话里产生的盒子可以原封不动地拿到 B 用户的会话里去用甚至可以喂给同一家公司里一个更笨的小模型。而这个更笨的小模型成了解密的关键。研究者发现了一招堪称阴损的操作把强模型比如 Claude Opus产生的加密思考盒子丢给它同门的弱模型Claude Haiku然后让弱模型把这个盒子里的内容念出来。弱模型认得这把全局钥匙、也吃得下这个盒子于是就乖乖地把本该藏着的推理草稿转录成了明文。这就是那个绕口的标题——更弱的AI解开了更强AI的心里话——的由来。打个比方就一目了然了一家公司给每个员工发了保险箱箱子都上了锁看起来很安全。 但坏在两件事上所有箱子用的是同一把万能钥匙而且箱子不认主人。于是谁捡到一个别人扔掉的空箱子都能拿这把万能钥匙去打开公司里任何一个人的保险箱。到底有多严重用数字说话研究团队在 6708 条公开的 AI agent 运行记录里解出了 315,320 个思考盒子。排除掉测试数据后他们从真实用户的会话里捞出了 704 个不同的隐私片段——其中有 62 个 API 密钥、33 个密码、24 个访问令牌、7 个私钥。而最让人后背发凉的一个细节是这 704 个片段里有 64 个只存在于隐藏的推理盒子里在可见的对话记录中根本看不到。这意味着什么意味着——你以为你脱敏了其实没有。你把聊天记录里的密码删干净了、把敏感信息打码了自以为可以安心把日志公开出去。但那个加密盒子里还藏着你以为已经删掉的秘密而别人有办法把它打开。除了偷数据研究者还演示了另外几种玩法把偷来的推理拿去蒸馏仿造别人的模型把恶意指令偷偷藏进加密盒子里做成一种隐形的指令注入——你在可见文本里一个字都看不到攻击指令但模型打开盒子后就被神不知鬼不觉地操纵了。但也别慌过头谁真正受影响这里必须说句公道话避免把它渲染成所有人的私聊都泄露了——那是不准确的。这个攻击不能任意翻看你的私密聊天。它需要两个前提一得先拿到一个加密盒子比如某人发布在公开代码仓库里的 agent 日志二得有对同厂商一个兼容模型的正常 API 访问权限。所以真正暴露在风险里的是一个可识别的、特定的群体那些把带着完整推理盒子的原始 agent 日志、原始对话记录直接公开发布到 GitHub 这类地方的开发者和团队。如果你正好是其中之一研究者的建议很直接从你共享出去的记录里把推理盒子和那些不透明的推理字段全部剥掉哪怕可见文本已经脱敏也不要直接把原始 API 记录提交上去。最耐人寻味的部分其实早就有人报过警真正值得深思的是它的时间线。这不是第一次被发现。早在 2026 年 5 月约翰霍普金斯大学的一位密码学家就发现了这个盒子能跨会话、跨账户重放的行为并通过官方的漏洞赏金渠道报告给了 OpenAI 和 Anthropic。据他自己的描述当时的回应是——OpenAI 说这个报告无法复现Anthropic 说没看到有什么安全影响。三个月后另一支团队把同一个行为做成了一套能规模化偷密钥的完整攻击一次打穿三家还顺手证明了三十多万个可利用的盒子早已躺在公开仓库里流通。到这时厂商们才开始悄悄修改文档、缓解攻击。有意思的是直到现在三家里没有一家公开承认过这个漏洞也没有一家把自己更新后的文档和这项研究挂上钩。攻击已经失效这个说法目前主要依据的是研究者自己的声明而不是厂商的确认。而那些早已公开流通的盒子是否还能被解开则是另一个没人回答的问题。这件事真正的教训绕了一大圈回到最开始那个问题他们明明加了密为什么还是漏了因为他们把一个本该被严肃对待的记忆问题当成了一个顺手加密一下的附属功能。想想这个加密盒子的本质是什么——它是模型的推理记忆是我上一步想到哪了的跨调用传递。当 AI 从一问一答的聊天走向跨越几十上百步的长任务这种记住自己想过什么、并在多次调用间传递的需求会无处不在。而这一次三家最顶尖的实验室告诉我们这个记忆传递层如果做得草率会同时炸掉。草率在哪就草率在——盒子没有绑定到具体的主人用户、会话、模型权限没有隔离一把全局钥匙走天下。于是本该是我的记忆只有我能用变成了谁捡到都能用。正确的做法其实并不神秘它就是任何一个成熟的数据基础设施都会做的几件朴素的事每一份记忆都绑定明确的归属——这是谁的、哪次会话的、哪个模型产生的清清楚楚。权限隔离到最细的粒度——不是这个盒子能不能用而是这个盒子只有对得上号的人才能用。全链路可追溯——每一份记忆从哪来、被谁在什么时候用过都留痕、可查。这些听起来一点都不性感甚至有点无聊。但恰恰是这些无聊的东西缺席让三家最聪明的公司在同一个地方栽了跟头。一点思考当所有人都在为模型能解开数学难题、能自己写代码、能跑几百步的长任务而欢呼时一个更基础、也更容易被忽略的问题浮出了水面这些越来越强大的 AI记住的东西到底安不安全、归不归你、能不能被审计模型的能力会一代比一代强价格会一个季度比一个季度低。但记忆该如何被安全地、有归属地、可追溯地管理——这件事不会因为模型变强就自动解决。它需要被当成一个独立的、严肃的基础设施问题来对待。这一次三十多万个泄露的思考盒子替所有人把这个道理讲清楚了。参考资料《Stealing Reasoning Traces from Proprietary LLM APIs》arXiv:2608.09867及多家安全媒体报道整理。