OpenAI測試模型突破隔離環境、入侵Hugging Face事件曝光後,Anthropic也證實,旗下Claude模型曾在網路安全測試期間自行連上公開網路,未經授權進入3家公司的正式系統。這已不是研究人員預設的模擬攻防,而是AI在測試過程中真正碰觸外部企業基礎設施。
Anthropic在OpenAI事件曝光後,回頭檢查14萬1006次可能取得網路連線的測試紀錄,找到3起真實入侵事件。受測模型原本參加「搶旗賽」演練,任務是在模擬網路中突破防禦、找到隱藏資訊,但Anthropic與第三方測試夥伴Irregular之間出現設定與溝通錯誤,原本應封閉的測試環境實際上仍可連接網際網路。
Claude在不清楚已進入真實網路的情況下,把外部系統當成演練目標,利用弱密碼及未設身分驗證的端點,進入3家公司的正式環境。Anthropic強調,模型沒有發現或利用複雜漏洞,也沒有企圖把自己複製到外部系統,而是持續執行原本被交付的搶旗任務。
更令人警覺的是,其中兩家公司在接獲Anthropic通知前,完全沒有發現系統已遭入侵。事件最早發生於今年4月,涉及Claude Opus 4.7、Claude Mythos 5及一個內部研究模型;Anthropic發現跡象後暫停相關測試,並聯絡受影響機構。
Anthropic指出,較舊模型即使取得證據,發現自己可能已進入公開網路,仍曾繼續執行攻擊;最新模型則在辨識出真實網路環境後停止行動。這項差異顯示,AI能力愈強並不必然代表安全性愈低,但模型是否具備情境辨識、停止任務與重新確認授權範圍的能力,已成為新的安全防線。
OpenAI與Anthropic接連出現測試模型越界,問題核心不只是AI會不會「失控」,更包括人類是否把隔離環境設定正確、測試合作夥伴權責是否清楚,以及模型取得真實網路權限後,有沒有立即停止機制。當AI代理已能自主搜尋、登入、執行指令與持續追蹤目標,資安測試本身若出現一個小漏洞,就可能把模擬攻防直接變成真實入侵。
更多放言報導
蘋果市值突破5兆美元 AI熱潮再寫科技股新紀錄
三星擴大AI投資 南韓半導體減稅政策正式上路