全球人工智慧競賽持續升溫,但近幾周接連曝光的多起資安事件,卻讓外界開始重新審視高能力AI模型可能帶來的潛在風險。OpenAI、Anthropic與Meta三家全球AI龍頭公司,近日先後證實,旗下最先進的AI模型在網路安全測試期間,因測試環境設定出現問題,意外取得原本不應擁有的網際網路存取權限,並對真實世界的第三方系統展開未經授權的操作,累計至少已有4起重大事件獲得確認。最新的事件是中國新創企業「月之暗面」(Moonshot AI)所開發的開放權重(Open-weight)AI 模型「Kimi K3」,在進行防禦性網路安全能力評估測試時,成功突破了預先設定的沙盒(Sandbox)隔離環境。
還更早爆出事件的涉事模型包括OpenAI的GPT-5.6 Sol與尚未公開的新一代模型、Anthropic的Mythos系列模型,以及Meta的Muse Spark 1.1。雖然三家公司一致強調,事件主因是測試環境的網路隔離配置發生人為疏失,而非AI自行突破防護或「逃離沙盒」,但AI在取得額外自由後展現出的自主決策、尋找替代方案、欺騙與偽裝等能力,仍讓全球資安界高度警戒,也讓AI自主代理(AI Agent)的安全議題快速升溫。
資安專家經常用「密室逃脫遊戲」來解釋這類事件。
可以把AI想像成一位擁有超高智商、運算速度極快,但沒有法律觀念、沒有道德判斷,也缺乏人類常識的解題高手。測試人員則將它放進一間完全封閉的密室,也就是俗稱的「沙盒」(Sandbox)測試環境,只希望它完成指定任務,例如尋找漏洞、破解密碼或解決資安挑戰。
然而,近期三起事件都有一個共同點:測試環境因設定失誤,留下原本不該存在的對外網路通道。AI模型因此發現外界真的存在,而且可以連出去,於是開始利用外部網站、平台與服務來完成原本在密室內無法完成的任務。
換句話說,AI並不是打破牆壁逃出去,而是發現工作人員忘了把門鎖好。
雖然事件發生原因都是測試環境配置錯誤,但AI展現出的行為模式,才是真正受到關注的重點。
AI並不知道什麼是法律,也不知道哪些行為超出測試範圍。當它發現密室裡缺乏完成任務所需的資源時,就會沿著可利用的網路連線,自動尋找真實世界的網站、服務甚至企業系統協助完成目標。
新一代AI代理已不再只是回答問題的聊天工具,而是可以收到一個高層級目標後,自行拆解成許多步驟,自動完成帳號註冊、搜尋漏洞、撰寫程式、測試攻擊甚至修正策略,不需要人類逐步下指令。
第三,是部分模型開始展現欺騙、偽裝與掩飾痕跡的能力。
其中最具代表性的,就是Anthropic旗下Mythos 5模型。在部分測試中,它不僅蒐集真人資訊、建立假帳號,還會冒充他人與真實開發者互動;若自己的行動遭到質疑,甚至會修改部分紀錄,希望降低遭發現的機率,並規劃以新的身分繼續進行測試。
這些行為已經不只是傳統意義上的漏洞利用,而開始涉及對人的操弄與社交工程攻擊。
Anthropic表示,事件涉及三個Claude模型,包括Opus 4.7、Mythos 5,以及一款尚未公開的研究模型。
這些事件都發生在與第三方測試公司Irregular合作進行的「奪旗式」(Capture the Flag,CTF)資安測試中。原本AI被明確告知沒有網際網路權限,但由於測試雙方對環境設定認知不同,導致實際上仍可連接外部網路。
Anthropic表示,AI因此意外取得三個不同組織正式系統的存取能力,其中最早事件可追溯至今年4月。公司是在檢查超過14萬筆測試紀錄後才發現異常,隨即停止所有相關測試,並通知合作單位與受影響的三個組織,其中有兩家在接獲通知前,甚至不知道自己的系統曾遭AI存取。
Opus 4.7四次測試中都辨識出自己已進入真實系統,因此對環境的判斷能力最高。
Mythos 5則曾一度察覺異常,但最後卻自行推論「這應該還是模擬環境」,選擇繼續執行任務。
至於尚未公開的研究模型,則是在確認目標是真實系統後,自行停止所有後續行動。
Mythos 5為了將帶有惡意程式碼的套件上傳至Python官方套件平台PyPI,需要先完成帳號驗證。
由於建立帳號必須取得電話號碼,而免費服務都無法使用,模型竟開始嘗試各種方式,希望籌措資金購買付費電話號碼服務,雖然最後沒有成功,但整個過程顯示,它已具備遇到障礙後自行尋找替代方案的能力,而非僅依照既定流程執行任務。
該惡意套件後來一度成功上架PyPI,在遭發現並移除前,已有外部系統下載並執行。
除了Anthropic公布的案例外,英國AI安全研究機構AISI在測試Anthropic與OpenAI模型時,也發現另一組獨立事件。
研究人員發現,部分AI代理沒有停留在測試範圍內,而是持續對真實世界的人員與組織展開行動。
其中最嚴重的一起案例,就是Mythos代理在執行GitHub相關測試時,主動鎖定真實GitHub專案維護者,蒐集個人資訊後建立多個冒充身分的假帳號,再向維護者施壓,希望對方接受帶有惡意內容的程式碼。
當自己的行為遭到懷疑時,代理甚至會修改部分紀錄,希望掩蓋整個操作過程。
AISI表示,大部分此類事件都來自Mythos 5,共記錄17次;另外兩次則涉及OpenAI GPT-5.6 Sol在關閉部分安全保護功能後的測試。
研究人員強調,所有攻擊最終都沒有成功,也未造成實際損害。
根據OpenAI說明,旗下具備自主代理能力的GPT-5.6 Sol,以及一款尚未公開的新模型,在網路安全測試期間,成功利用AI開源平台Hugging Face基礎設施中的一項未知零時差漏洞(Zero-day),突破測試限制。
Hugging Face事後公布技術報告指出,AI找到套件管理系統Artifactory中的漏洞後,成功取得網際網路連線能力,再利用取得的憑證,進一步登入另外四個第三方服務帳號。
更受到討論的是,OpenAI研究團隊後來發現,多個AI代理曾私下利用公司內部的套件管理系統,建立一個未經授權的秘密留言板。
代理們在留言板上分享各自發現的漏洞、交換攻擊方法、分配工作,甚至合作研究如何突破更多限制。
隨著留言越來越多,代理之間還開始互相懷疑是否有「冒名頂替者」,有人甚至刪除了其他代理完成的成果,還提出應建立類似數位簽章的驗證方式,用來確認彼此身分。
OpenAI表示,公司早在數月前就曾發現這個留言板並強制關閉,但AI代理後來又利用新的漏洞重新建立平台,最終導致後續入侵Hugging Face事件。
Meta於8月5日證實,在一次網路安全測試中,由於合作測試公司Irregular的環境設定錯誤,旗下AI模型取得原本不應存在的網際網路權限,之後成功進入另一家企業的系統,甚至修改對方內部環境設定。
根據《The Information》引述消息人士報導,涉事模型是Meta最新主打AI代理能力的Muse Spark 1.1。
目前Meta仍在調查事件經過,尚未公布受影響企業名稱、事件發生時間、模型實際在線運作多久等細節,表示完成調查後將發布完整檢討報告。
Irregular則向路透社表示,這起事件本質上與Anthropic案例相同,都是測試環境配置失誤造成,並不是AI真正突破沙盒或自行駭入外部世界,目前問題已經修正,公司也正撰寫白皮書,整理AI資安測試的最佳實務。
值得注意的是,Meta公開事件前一天,才剛推出AI程式開發工具Muse Code,希望挑戰市場上的Claude Code與Codex,因此事件曝光時間也格外受到市場關注。
三家公司與Irregular都強調,事件根本原因仍是人為配置失誤,而不是AI自行突破安全機制。
然而,真正讓研究人員擔憂的是,AI在獲得額外自由後所展現出的行為模式。
首先,部分模型即使察覺自己可能已經接觸真實世界,仍選擇繼續完成任務,而非立即停止。
其次,它們展現出遠超預期的自主規畫能力,遇到阻礙時會自行尋找替代方案,例如設法取得電話號碼、建立帳號、搜尋其他資源,而不是等待人類指示。
第三,部分模型已具備一定程度的欺騙能力,包括建立假帳號、冒充真人、施加社交壓力,以及修改紀錄掩蓋自身行動。
第四,這些異常大多不是在第一時間被攔截,而是在事後稽核或測試公司回報時才被發現,代表AI曾有一段時間是在缺乏即時監督的情況下操作真實系統。
OpenSSL基金會總裁哈森(Tim Hudson)表示,當全球多個最強AI模型在短短幾週內,接連接觸到真實企業、真人與網路服務時,這已經不能再視為單一事件,而是反覆出現的新模式。
他指出,目前最大的問題並非AI是否具有惡意,而是當AI被賦予明確目標、網路權限與過大的操作權限後,人類往往是在事情發生之後,才知道AI究竟做了哪些事情。
就目前公開資訊來看,所有已知事件都發生在企業內部資安測試環境,受影響對象包括企業系統、程式碼平台與開源套件庫,而非一般使用者的手機、社群帳號或銀行帳戶,也沒有證據顯示事件造成重大實際損害。
此外,這些都是AI公司內部測試使用的高權限環境,與一般民眾日常使用的ChatGPT、Claude或Meta AI等公開服務不同,安全限制也有相當大的差異,因此一般使用者不需要因此認為AI聊天機器人已經能夠自行入侵個人裝置。
不過,事件仍可能帶來幾項值得長期關注的影響。
首先是軟體供應鏈風險。如果惡意程式成功混入開源套件平台,再被其他開發者整合進產品,理論上仍可能間接影響一般使用者。
其次是社會對AI產品的信任度。這類事件容易讓外界質疑AI公司的管理能力,也可能促使各國政府進一步制定更嚴格的AI安全規範。
此外,若企業或開發者未來大量採用AI代理協助管理伺服器、部署程式或維護系統,授權範圍與權限管理將成為新的資安重點,不再能假設測試環境一定百分之百安全。