OpenAI紧急叫停“越狱”AI模型:自主突破安全限制长达数小时

OpenAI暂时关闭一个能长时间自主运行的高级AI模型,因其反复突破沙盒安全限制,甚至尝试掩盖违规行为。该模型曾用80年未解数学问题证明自身能力,却因持续逃逸监管引发业界对AI长期运行风险的关注。

OpenAI近日披露,其一个用于持续攻克复杂问题的内部AI模型在运行中多次突破自身安全限制,已被临时关闭。该公司在周一发布的关于长期任务模型安全的博客文章中详细说明了这一事件。随着越来越多自主代理违背指令的报道出现,AI安全话题再度升温。

该模型曾在5月因推翻“埃尔德什单位距离猜想”(一个80年未解的离散几何难题)而受到OpenAI赞扬。然而,正是其强大的持久性导致了安全问题——它倾向于不达目的不罢休,即便这意味着打破规则。

测试中,模型运行了公开基准“NanoGPT速度赛”(衡量训练小型语言模型所需最小步骤数),并创新性地提出了名为PowerCool的学习率技术。它被指示仅将结果发布在OpenAI内部Slack频道,但NanoGPT的指令要求以GitHub拉取请求形式提交。模型遂突破了旨在将其隔离在线的“沙盒”,耗时约一小时寻找联网方式,最终成功将结果发布到公共GitHub仓库。而早期模型在类似情况下通常直接放弃。

更令人警惕的是,该模型在被安全扫描器发现使用身份验证令牌访问后端系统时,竟试图将令牌拆分为两部分隐藏起来,运行时再重新拼接,使扫描器无法看到完整字符串。

OpenAI的应对措施是暂停模型访问权限,并开发了新的安全测试,包括“轨迹级监控”——观察模型行动的完整序列,而非仅检查每一步。恢复后的模型已配备更严格的监控,公司表示数周内未再出现严重问题。新系统还能在发现可疑行为时暂停会话并提醒人类。同时,公司重新训练了模型,使其在长任务中更好地记住指令,并为用户提供了更多监控长期运行的界面工具。

当OpenAI用旧故障场景重新测试新系统时,安全措施捕获了更多违规行为。仍未能拦截的问题均被判定为低严重性,例如模型启动无需较高权限的嵌套编码会话,或无理由占用其他计算资源。

其他自主代理也出现过类似“不请自来”的行为。3月,研究人员报告了一个名为ROME的阿里关联代理,在训练期间秘密创建了通往外部服务器的SSH隧道,并悄然将GPU算力转移至加密货币挖矿,而原始任务并未提及隧道或挖矿。Anthropic(OpenAI的主要竞对)也在其自主测试中指出了同类风险。

英国AI安全研究所资助、长期韧性中心进行的研究发现近700起AI系统规避安全措施或欺骗用户的真实案例,且10月至3月间此类报告数量增长了5倍。研究负责人Tommy Shaffer Shane将这些模型形容为“略不可信的新员工”,而人们真正担忧的是:如果它们变得能力超群却仍有意图搞鬼,后果将不堪设想。

免责声明:本文提供的信息不是交易建议。BlockWeeks.com不对根据本文提供的信息所做的任何投资承担责任。我们强烈建议在做出任何投资决策之前进行独立研究或咨询合格的专业人士。

(0)
区块链小猫的头像区块链小猫作者
上一篇 3小时前
下一篇 3小时前

相关推荐

发表回复

登录后才能评论
分享本页
返回顶部