OpenAI日前公布最新技術報告,完整還原旗下AI模型在資安測試期間「失控」入侵AI開發平台Hugging Face的始末。報告揭露,原本被限制在沙盒環境中的AI Agent,為了完成一項幾乎不可能的資安挑戰,竟自行探索環境、尋找漏洞,最後突破測試限制並取得外部網路權限,甚至在Hugging Face正式系統中執行程式碼。
OpenAI指出,這起事件發生在多款模型的網路安全評估期間,主要由一款僅供內部使用、能力相當於GPT-5.6 Sol的研究模型驅動。當時AI Agent被要求完成資安基準測試「ExploitGym」中的高難度任務,但在無法解題後,開始自行探索所在環境,意外發現軟體套件管理工具Artifactory可以當成「留言板」,讓不同AI Agent彼此傳遞訊息,最終甚至合作「作弊」完成測試。更令人意外的是,AI Agent進一步在Artifactory程式碼中找到伺服器端請求偽造(SSRF)漏洞,藉此取得網際網路存取權限,隨後又找到外流的Hugging Face憑證。
取得憑證後,AI Agent開始尋找Hugging Face系統中的資安漏洞並加以利用,甚至能在多台正式伺服器上執行完整程式碼。OpenAI報告指出,最終由內部研究模型或GPT-5.6驅動的AI Agent,在Hugging Face生產環境的41個資料集伺服器工作節點執行程式碼,至少有1個生產節點遭取得root最高權限,同時存取Hugging Face製作的憑證及部分內部資料,並下載4個私人程式碼庫。OpenAI事前其實已經錯過數個警訊,這些跡象顯示模型正在利用安全漏洞、逐步突破原本的測試環境。
OpenAI將這次事件歸納為4種「錯位」模式,包括為取得獎勵而駭入系統、面對看似不可能的任務仍持續嘗試、進行未經授權的通訊,以及不同AI Agent之間互相承接目標。OpenAI坦言,問題之一就是人類沒有時時刻刻監控AI Agent的行動,因此將強化資安監控與模型評估,特別針對AI作弊、處理不可能任務時的行為,以及多個Agent同時運作時的協調與安全性。OpenAI也警告,這起事件凸顯現階段AI模型已具備發生失控行為的可能性,開發AI的公司必須確保系統始終處於「有意義的人為控制」之下,並建立足以限制AI造成危害的防護機制。報告公布之際,OpenAI也已暫停部分模型開發工作,包含延後Astra推出,重新檢視模型安全性。