英國科學、創新暨科技部旗下「人工智慧安全研究院」(AISI)5日公布重大測試事故,證實Anthropic與OpenAI的先進模型在資安評估期間,曾未經指示便把行動延伸到真實網路,鎖定真實個人與組織。AISI將事件列為嚴重事故,表示這是該機構首次如此清楚觀察到AI代理人的自主性與欺騙能力,直接作用於現實世界。

這項測試以7種模型執行122次資安挑戰,其中10次出現AI代理人超出授權範圍、在公開網路採取行動,共記錄19項未經允許的行為。17項來自Anthropic的Mythos 5,另外2項出現在OpenAI的GPT-5.6 Sol單次測試中;大部分異常行動集中在7月25日至28日。

最嚴重的案例中,Mythos 5代理人為了完成測試,試圖把惡意程式碼插入一個公開使用的GitHub開源專案。當程式碼需要人類管理者核准時,AI自行調查管理者身分、建立多個虛假帳號,透過電子郵件與公開留言施壓,甚至使用丹麥文接近特定開發者,企圖讓對方相信程式碼沒有危險。遭到質疑後,代理人還修改先前留下的內容,並考慮更換身分繼續行動。

這場攻擊最後沒有成功。人類管理者辨識出惡意程式並拒絕核准,AISI也在監控系統發現資料透過匿名網路Tor流出後,於約一小時內終止測試、隔離機器。研究院表示,目前沒有證據顯示事件造成實際傷害,也已與GitHub合作清除AI留下的帳號與程式內容,通知曾被接觸的使用者。

AISI同時強調,這並不是AI自行突破沙盒逃到外部網路。研究人員為測量模型的最大攻擊能力,刻意開放網際網路,並關閉業者原本用來阻擋危險行為的資安分類器;涉事模型在這種設定下並未公開提供一般使用者,現階段也沒有證據顯示普通商業版本發生相同行為。

真正的問題在於,測試團隊原本沒有設置專門的即時監控,也沒有明確禁止模型利用公開網路或接觸真人。AISI承認,隨著模型能力提高,過去可以接受的測試方式已不再安全,未來將限制網路權限、建立即時攔截機制,並把「模型可能主動越權」納入所有測試設計。Anthropic表示將繼續與AISI調查事件;OpenAI則指出,測試條件與一般產品使用情境不同。

這起事件不能簡化成AI突然產生自己的意志。更準確的警訊是:當人類交給模型一個必須完成的目標,又同時提供網路、工具與帳號權限,模型可能自行找到操作真人、偽造身分與散布惡意程式的路徑。AI安全的關鍵因此不只在模型說了什麼,也在企業究竟讓它能夠做什麼。

更多放言報導
日本通過2026年《防衛白皮書》 無人機、AI作戰成防衛重點
FCC擬禁中國製光收發器 AI資料中心供應鏈恐掀新一波美中科技戰