从专有 LLM API 窃取推理轨迹
本文发现 Anthropic、OpenAI 和 Google 的加密推理块可在会话、用户与模型之间重放。攻击者把前沿模型产生的加密推理签名注入同一厂商的较弱模型,迫使后者把隐藏思维过程转录为明文,从而绕过反蒸馏机制、恢复公开轨迹中的密钥与个人信息、暴露隐藏有害推理,并执行不可见提示注入。论文解码 315320 个公开推理块,在真实用户会话中发现 62 个 API key 等敏感数据,并提出了上下文绑定、密钥轮换和训练侧拒绝转录等缓解方案。
Alexander Panfilov, David Schmotz, Ilia Shumailov·2026年8月10日
大语言模型安全推理2026年8月10日