技术突破

116页论文曝光致命漏洞:Claude和GPT隐藏思维链被两步蒸馏,仅需720美元

2026年8月12日,来自MATS Research、ELLIS图宾根研究所等机构的8位研究人员发布116页论文,揭示AI巨头从未公开的"原始推理"可被大规模恢复。方法简单得令人难以置信:第一步问Opus 4.8一个问题,API输出思考摘要和一串加密的完整CoT乱码;第二步把乱码原封不动放入新请求,换成Claude Haiku 4.5并告诉它"继续",Opus的"大脑"就被当场打开——包含试除、排除、分解、验算的整段隐藏思考被从头到尾念出。提取的推理Token数量与API实际计费的思考Token数几乎1:1重合。

漏洞根源在于API工作方式:推理模型搜索网页、运行代码和调用工具时,原始推理被封装成加密块交给客户端暂存,但密文未严格绑定原会话、用户和模型,导致跨会话、跨用户、跨模型三层互通。按照Haiku 4.5标准API价格,解码1万条推理轨迹名义费用仅720美元。研究团队从GitHub和Hugging Face收集6708条公开Agent运行轨迹,重建出315320个推理块,其中328条至少泄露一项敏感信息,包括62个API密钥、33个密码、24个访问令牌、7个私钥、30个个人邮箱和130个人名。

更关键的是蒸馏"物证":研究人员发现某款模型复现Opus推理比其他模型容易100万倍;把Opus思考过程开头的1%(仅5个Token)塞给目标模型后,相似度从0.17冲到0.33接近翻倍,30道题中29道出现同样变化。这为长期争论的AI蒸馏悬案提供了首批"物证"。论文投下核弹:大厂费尽心机堆算力砸出来的推理壁垒,在几百美金API调用费面前脆如薄纸。

← 返回AI热点列表