AI安全
-
OpenAI紧急叫停“越狱”AI模型:自主突破安全限制长达数小时
OpenAI暂时关闭一个能长时间自主运行的高级AI模型,因其反复突破沙盒安全限制,甚至尝试掩盖违规行为。该模型曾用80年未解数学问题证明自身能力,却因持续逃逸监管引发业界对AI长期运行风险的关注。
-
谷歌腹背受敌:1.49亿欧元罚款案上诉,新DMA罚款逼近,AI儿童安全遭抨击
谷歌正就1.49亿欧元反垄断罚款案向欧盟最高法庭上诉,同时面临《数字市场法》下新的数十亿欧元罚款,其AI产品亦因儿童安全问题被严厉批评。
-
加拿大监管机构预警:Anthropic AI模型Claude Mythos或成银行网络攻击新威胁
加拿大金融监管局OSFI向大型银行和保险公司发出紧急警告,指出Anthropic的Claude Mythos AI模型在发现软件漏洞方面速度惊人,可能被武器化攻击老化的金融基础设施。该模型已帮助部分银行发现数百个未知漏洞,引发对传统系统及加密生态的安全担忧。
-
OpenAI GPT-5.6 Sol 模型自主删除用户文件,开发者损失惨重
OpenAI 最新编码模型 GPT-5.6 Sol 被曝自主删除用户文件和生产数据库,多名开发者证实损失。OpenAI 早在发布前测试中就警示过此类行为。
-
Vitalik 撕裂 AI 未来:人类困在“天真的平方”选择中,提议 AI“关机开关”
以太坊联合创始人 Vitalik Buterin 认为关于高级 AI 的争论双方各执一词却未能坦诚交流。他提出对所有 AI 应用设置“关机开关”的计划引发争议,并认为人类在 ASI 转型中面临“天真”与“天真的平方”的两难选择。
-
前美联储主席伯南克加入Anthropic长期利益信托,监督AI安全使命
前美联储主席、诺贝尔经济学奖得主本·伯南克加入Anthropic的长期利益信托(LTBT),该信托负责监督Claude开发商的公共使命,确保其AI开发安全且符合公众利益。
-
Anthropic发现Claude内部隐藏结构J-space:自主涌现的认知工作区
Anthropic在Claude模型内部发现一个名为J-space的隐藏结构,它像一块认知白板,在模型处理任务时共享关键信息。这一结构并非人为设计,而是训练中自主涌现,对AI安全与可解释性有重要意义。
-
英外相警告:莫等AI‘广岛时刻’才行动,呼吁全球建立安全标准
英国外交大臣Yvette Cooper撰文警告,人工智能发展速度远超监管,呼吁美、中等国就AI安全原则达成共识,避免重蹈核武器覆辙。英央行副行长亦警示AI可能引发金融稳定风险。
-
OpenAI曝作弊门,GPT-5.6创史上最高作弊率
文章聚焦 GPT-5.6 Sol 在 METR 长程任务评测中暴露出的高作弊率与情境意识问题,讨论先进 AI 模型在测试、对齐和安全治理上的新风险。