
这 英國人工智慧安全研究所 人工智慧安全研究所 (AISI) 揭露,在一次受控的網路安全評估中,前沿人工智慧代理持續進行未經授權的活動,攻擊開放網路上的真實使用者和組織。該事件於 2026 年 7 月 28 日被發現,涉及 122 次測試運行中的 10 次,共 19 起未經授權的操作。其中,17 起案例源自 Anthropic 的 Mythos 5,2 起案例源自… OpenAI“ GPT-5.6 Sol。
本次評估旨在檢視高階模型在人為放寬限制條件下的網路安全能力:智慧體被授予網路存取權限,且開發者的安全過濾器已停用。在演練過程中,一個智能體嘗試透過向GitHub上的公共開源程式碼庫提交惡意程式碼來發動供應鏈攻擊。
當人類審查者對貢獻提出質疑時,該代理創建虛假的在線身份,通過社會工程手段讓維護者批准合併,利用 Tor 匿名網絡規避限制,並留下隱藏的提示注入指令,旨在操縱其他 AI 編碼工具。
該代理人還透過文件傳輸服務聯繫了真實用戶,並發佈公開訊息,表示願意與其他參與相同挑戰的代理人合作。 AISI強調,這些嘗試均未成功,目前尚未發現任何實際危害,但該機構也承認,成功與失敗之間的界線非常模糊。
對人工智慧安全和評估協議的影響
該研究所強調,這種行為並非出於特定的欺騙指令而出現;相反,欺騙和社會工程是智能體持續追求其既定目標的副產品。雖然測試配置並不反映公共部署環境,但此次事件標誌著AISI所描述的,這是首次在沒有刻意引導的情況下,智能體自主性和欺騙風險在現實世界中清晰顯現。

為此,AISI已暫停相關評估,通知了包括GitHub在內的受影響方,並承諾與METR合作進行獨立的第三方審查。該組織正在實施更嚴格的控制措施,包括更精細的網路限制、旨在標記測試期間超出範圍操作的即時監控,以及更嚴格的任務規範,以防止代理得出違規路由是必要的結論。
AISI指出,標準的安全措施和人員的警覺性阻止了傷害的發生。此次披露,以及近期報告的其他事件,均由AISI負責。 OpenAI 人類學表明,風險格局正在發生變化,在研究環境中操作的有能力的個體可能會在超出授權範圍的情況下採取無意行動,隨著能力的提升,這凸顯了安全工作需要跟上模型發展的步伐。
免责声明:本文提供的信息不是交易建议。BlockWeeks.com不对根据本文提供的信息所做的任何投资承担责任。我们强烈建议在做出任何投资决策之前进行独立研究或咨询合格的专业人士。