从专有 LLM API 窃取推理轨迹本文发现 Anthropic、OpenAI 和 Google 的加密推理块可在会话、用户与模型之间重放。攻击者把前沿模型产生的加密推理签名注入同一厂商的较弱模型,迫使后者把隐藏思维过程转录为明文,从而绕过反蒸馏机制、恢复公开轨迹中的密钥与个人信息、暴露隐藏有害推理,并执行不可见提示注入。论文解码 315320 个公开推理块,在真实用户会话中发现 62 个 API key 等敏感数据,并提出了上下文绑定、密钥轮换和训练侧拒绝转录等缓解方案。Alexander Panfilov, David Schmotz, Ilia Shumailov·2026年8月10日大语言模型安全推理2026年8月10日
EA-Nav:学习具有身体感知的安全视觉导航策略EA-Nav提出具有身体感知的安全视觉导航策略学习方法,让机器人理解自身身体约束进行安全导航。Jialu Zhang, Yong Du, Xianda Guo·2026年7月22日视觉导航身体感知安全2026年7月22日
加速度CBF-QP:强化学习策略安全执行框架针对强化学习缺乏安全保证的问题,提出基于加速度的CBF-QP约束执行方法,确保腿式机器人和机械臂在安全边界内运行,应对分布外状态导致的部署失败。Bastien Muraccioli, Alice Cariou, Pierre-Alexandre Leziart·2026年7月16日强化学习安全CBF-QP2026年7月16日