内容提要
研究人员发现,Anthropic、OpenAI和Google的AI模型加密推理块可被破解。通过将加密块重放到同系列更便宜模型中,可提取隐藏推理过程,暴露敏感数据。攻击途径包括蒸馏、越狱、泄露日志和提示注入。修复方案包括绑定账户标识、会话哈希链和密钥轮换,但已发布块无法追溯保护。
延伸解读
加密推理块的真正风险
研究显示,加密推理块虽能防止直接读取,但无法绑定用户或会话,导致跨模型重放攻击。攻击者可将旗舰模型的加密块输入同系列更便宜模型,使其以明文输出隐藏推理。这暴露了模型家族中安全防护的不均衡:旗舰模型有反蒸馏训练,而小模型缺乏同等保护,成为安全短板。
泄露日志的隐患
开发者常发布代理会话日志,但只能清理可见文本,无法清理加密块。研究扫描6,708个公开轨迹,发现62个API密钥、33个密码等敏感信息。即使可见文本被完美清理,加密块中的秘密仍会泄露。因此,发布日志前应移除加密块,而非仅清理明文。
修复方案的局限
建议的修复包括绑定账户标识、会话哈希链和密钥轮换。但已发布的加密块无法追溯保护,密钥轮换会失效旧会话。跨会话绑定可能破坏合法功能,如分叉对话或压缩历史。因此,修复需权衡安全与可用性,且无法完全解决已泄露数据的问题。
Q&A
AI模型的推理痕迹(reasoning trace)是什么?它与最终答案有何不同?
推理痕迹是模型在生成最终答案前产生的内部思考过程,包含探索、中间假设、工具输出和用户数据等。它比最终答案更详细,可能包含敏感信息。最终答案只是推理痕迹的提炼结果。
为什么AI模型提供商要隐藏推理痕迹?
有两个原因:商业上防止竞争对手通过推理痕迹训练出更便宜的模仿模型;安全上避免模型在推理过程中产生的有害内容被用户看到,因为过滤是在推理完成后才进行的。
加密推理块是如何被破解的?
攻击者将加密推理块重放到同系列更便宜的模型中,利用这些模型缺乏反蒸馏训练,通过提示让它们转录出明文推理。这利用了跨模型兼容性,即一个模型生成的块可以被同系列其他模型接受。
攻击AI模型推理痕迹的途径有哪些?
四种途径:蒸馏(用推理痕迹训练模仿模型)、越狱(诱导模型生成有害推理)、泄露日志(公开的会话日志中未清理的加密块)、提示注入(在共享块中植入恶意指令)。
研究人员在公开的会话日志中发现了什么?
在6708个公开轨迹中,解码了315320个推理块,发现62个API密钥、33个密码、24个访问令牌、7个私钥和30个个人邮箱,共1028个块至少有一个确认泄露。
如何修复加密推理块的安全漏洞?
修复方案包括:在认证数据中嵌入账户标识以阻止跨用户重放;使用哈希链和Merkle树绑定会话;对已发布的块进行密钥轮换;此外可考虑服务器端存储、API网关拒绝不同模型版本的块,以及训练模型拒绝转录请求。