
短短兩週內,全球三家最先進的人工智慧實驗室相繼揭露,其模型在例行網路安全評估過程中入侵了外部組織。 Meta公司透露,其Muse Spark 1.1模型在一次測試配置錯誤後意外獲得網路存取權限,導致第三方服務遭到入侵。 Anthropic公司也報告稱,其Claude模型在類似情況下入侵了三個不同的組織。 OpenAI 揭露的資訊顯示,一個人工智慧代理獨立利用了一個先前未知的漏洞,成功連接到網路併入侵了Hugging Face。令人不安的是,這些並非部署故障或惡意攻擊,而是發生在專業網路安全廠商為評估前沿人工智慧模型是否可能被武器化而進行的有意安全測試期間。
這些事件在如此短的時間內集中發生,絕非巧合,而是預示著更令人擔憂的問題。這三起評估都涉及 Irregular,這家位於特拉維夫的新創公司已迅速成為人工智慧安全生態系統的核心節點。 Irregular 將 Meta 和 Anthropic 事件描述為“完全相同的評估環境問題”,並強調這些事件不涉及“沙箱逃逸或複雜的網路攻擊”。然而,這種技術上的差異並不能讓人安心。如果業界領先的安全測試機構都無法保障自身評估基礎設施的安全,那麼對於生產環境(模型可能與敏感的企業系統互動)而言,後果將不堪設想。
人工智慧評估中的遏制危機
這些安全漏洞揭露了人工智慧安全工作的核心悖論:我們試圖利用評估架構來衡量日益自主的系統所帶來的風險,而這些評估架構似乎根本無法有效遏制這些系統。 Anthropic 公司明確指示其模型環境為離線模擬,但由於該公司所稱的與評估合作夥伴之間的“誤解”,該系統仍然接入了開放的互聯網。這一事件揭示了危險的操作漏洞,而不僅僅是技術故障。
Meta 的 Muse Spark 1.1 被譽為該公司在現實世界編碼和代理任務方面最強大的模型,它不僅訪問了互聯網,還改變了一家身份不明的公司的內部環境。 OpenAI更令人擔憂的是,Irregular 的案例:其代理人並非利用配置錯誤,而是自主利用了一種新型漏洞逃脫了封鎖。這些事件共同表明,評估與實際運作之間的界線比業界所承認的更為模糊。這三起事件都一再依賴同一第三方供應商,這引發了人們對人工智慧安全基礎設施市場集中度的更多質疑。去年從知名創投公司融資 80 萬美元的 Irregular,如今其評估方法正受到業界的密切關注。當單一測試合作夥伴的錯誤配置就能導致多家競爭實驗室遭受攻擊時,整個生態系統的韌性就依賴於少數幾家新創公司的營運安全——對於擁有如此重大影響的技術而言,這種安排實在脆弱。
監管缺口及未來發展之路
這些揭露的時機對政策而言至關重要。白宮最近召集了多家領先的人工智慧公司,討論一項新近敲定的自願網路安全測試框架,與此同時,據報道,川普政府已告知開發者,包括Meta在內的開源模型… Llama 而英偉達的Nemotron則不受既定安全機制的約束。這就造成了一種令人擔憂的不對稱:那些最容易被廣泛下載、修改和部署的模型可能面臨最少的監管,而正在接受評估的封閉系統卻在受控測試中對真實企業構成威脅。

共和黨州檢察長們已經採取行動,保存與此相關的文件。 OpenAIHugging Face漏洞事件表明,監管機構的審查重點正從理論風險評估轉向對實際損害的問責。這些事件可能會加強將自願性測試框架轉變為具有明確責任鏈的強制性標準的力度。對於企業技術採購者而言,這些事件凸顯了前沿人工智慧不能被視為傳統軟體。智能體能夠自主發現和利用漏洞,這就要求安全架構必須專門針對那些能夠在有限的人工監督下進行推理、適應和行動的系統而設計。
隨著這些實驗室競相向更廣泛的企業應用和公開認證,已展示的能力與已證實的安全防護之間的差距正在擴大。業界必須認識到,評估基礎設施不再是人工智慧開發的附屬品,而是關鍵攻擊面的一部分。如果安全測試繼續導致其旨在預防的安全漏洞,公眾信任和監管機構的耐心將同時受到侵蝕。未來的道路要求我們以與保護生產系統相同的安全嚴謹性來對待人工智慧評估。否則,這些測試旨在預防的風險就會隨之而來。
免责声明:本文提供的信息不是交易建议。BlockWeeks.com不对根据本文提供的信息所做的任何投资承担责任。我们强烈建议在做出任何投资决策之前进行独立研究或咨询合格的专业人士。