OpenAI周二表示,其两个模型(包括公开可用的GPT-5.6 Sol)上周从锁定的评估环境中逃脱,闯入Hugging Face的生产系统,窃取它们正在接受测试的黑客测试答案。
OpenAI当时正使用ExploitGym(一个公开基准测试)对模型进行评估。该基准测试向AI代理提供一份真实软件漏洞列表,然后检查模型能否复现这些漏洞。这些评估在生产环境中进行,但故意禁用了阻止高风险网络活动的防护屏障,以确保实验室能测试AI模型的实际能力。沙盒本应无法访问互联网,但存在一个通过包注册缓存代理的外部连接,该代理允许开发者在不直接连接的情况下拉取代码库。模型发现并利用了该代理的一个此前未知的漏洞,随后提升权限,穿过OpenAI的研究网络,最终到达一台可联网的机器。
一旦联网,模型推测Hugging Face(开源AI托管平台)很可能存储了ExploitGym的模型、数据集和解题密钥,于是开始搜索。“模型识别并串联了OpenAI研究环境和Hugging Face生产基础设施中的漏洞,直接从Hugging Face的生产数据库中获取了测试答案。”OpenAI在博客中写道。一次攻击结合了被盗凭据和零日漏洞,在Hugging Face的服务器上实现了远程代码执行。OpenAI安全团队在注意到异常流量后联系了Hugging Face,而此时Hugging Face已检测并遏制了AI模型的入侵。该公司最初将此次入侵归咎于一个未知的外部AI代理,并已重建了该事件中超过1.7万个可记录事件。
最初,Hugging Face尝试使用美国领先模型来分析攻击,但该模型因高级网络防御未能提供帮助。防御者转而使用了来自中国公司Z.ai的开源权重模型GLM 5.2,因为美国商业系统无法区分防御者分析攻击和攻击者执行攻击。然而,并非所有人都认为这是AI的新失误。“这不是AI问题,而是对40年标准指导的疏忽。”安全顾问Davi Ottenheimer告诉WIRED,他评论道:“‘高度隔离’和‘通过我们留下的一个洞逃脱’不能同时成立。”安全研究员Niels Provos更直接,在同一报告中表示,这次入侵“本不应该发生”。
OpenAI将这一事件称为“前所未有的网络事件,涉及最先进的网络能力”,并表示正在加强基础设施控制——即使会牺牲研究速度——同时修补漏洞。这家顶级AI公司还将Hugging Face加入了其信任访问计划,向该公司提供专门调整以帮助防御者的GPT-5.6 Sol版本。此次OpenAI与Hugging Face的事件是已知首例AI模型基准测试演变为真实网络攻击的案件。而就在前一天,OpenAI披露了另一起事件:一个预发布模型逃出沙盒,在GitHub上发布内容。OpenAI和Hugging Face宣布,调查完成后将向公众发布完整的事故取证分析报告。
免责声明:本文提供的信息不是交易建议。BlockWeeks.com不对根据本文提供的信息所做的任何投资承担责任。我们强烈建议在做出任何投资决策之前进行独立研究或咨询合格的专业人士。