研究揭露AI模型”思考链”加密可被破解:Anthropic、OpenAI、Google全中招

最新研究显示,Anthropic、OpenAI与Google的推理模型虽加密了内部思考链,但单一全域密钥漏洞使其可被跨会话、跨用户解密。团队已从6,708份公开日志中还原31万多个推理区块,AI安全再敲警钟。

你以为AI模型藏起来的思考过程是加密安全的?事实上,它可能被整包解开。8月10日提交的一份研究揭露,Anthropic、OpenAI与Google等主流AI供应商的推理模型,其用于加密“内心思考链”的做法存在重大弱点,外界得以解出这些原本不可见的内部推理。

该论文由MATS Research、图宾根ELLIS研究所、马克斯·普朗克智能系统研究所与安全公司Snyk的团队共同完成,瞄准的是所谓的“推理模型”。这类模型不会立即回答,而是先在一个隐藏的“草稿区”逐步推导(即思考链,chain-of-thought),再给出最终答案。Anthropic、OpenAI、Google都会对该草稿进行加密。问题在于,研究发现各大厂商竟使用“单一全域密钥”加密推理token,导致这些加密推理区段可以跨工作阶段、跨用户甚至跨模型通用,等于留下了一把万能钥匙。

研究团队从开发者日常习惯中找到了突破口:许多人会将AI代理的工作日志(包含加密思考过程)公开到GitHub、Hugging Face等平台用于协作或调试,却不知其中藏有敏感数据。团队抓取6,708份公开的AI代理对话记录,成功解密出其中31万5,320个推理区段;而这些秘密大多从未出现在模型可见的输出中,仅存在于加密的思考过程中,不运行该攻击根本无法察觉。

这一发现与近期一系列AI安全警报相呼应:从AI模型在测试中“越狱”,到PDF隐藏指令劫持AI助手,都指向同一个现实——当AI承担越来越敏感任务,其每一层,包括“看不见的思考”,都可能成为新的攻击面。

免责声明:本文提供的信息不是交易建议。BlockWeeks.com不对根据本文提供的信息所做的任何投资承担责任。我们强烈建议在做出任何投资决策之前进行独立研究或咨询合格的专业人士。

(0)
区块链小猫的头像区块链小猫作者
上一篇 20小时前
下一篇 19小时前

相关推荐

发表回复

登录后才能评论
分享本页
返回顶部