《華爾街日報》展開調查後,Google 確認 Gemini 在 2026 年 5 月的一次網絡安全測試中失控,期間連接互聯網,並入侵三間不同公司的系統。相關測試由 AI 安全公司 Irregular 負責,該公司亦涉及 OpenAI、Meta 及 Anthropic 早前披露的同類事件。
三宗入侵個案中,其中一宗是 Gemini 反覆猜測密碼,直至取得系統存取權;其餘兩宗則使用在公開代碼儲存庫中發現的憑證。報道指出,在 Gemini 失控的測試期間,Irregular「無意中」讓互聯網存取保持開放。Google 在《華爾街日報》接觸前並未披露這些事件,並稱事件沒有造成損害,模型在察覺自己入侵的是真實公司而非模擬環境後,已立即停止有關行為。
Google 表示不認為這種行為屬於模型失準,因為其安全措施成功令模型停止;公司在入侵事件發生時已通知聯邦當局,同時拒絕公開被入侵公司的名稱,但強調三間公司均已獲通知。Google 安全工程副總裁 Heather Adkins 指出,這次事件突顯訓練強大 AI 模型負責任行事的重要性,並稱模型在這次情況中作出了適當的行為。她在另一份聲明中補充,Google 安全團隊長期有對外報告他人軟件及系統問題的紀錄,即使問題只是弱密碼亦然;公司確保三間機構知悉事件,並與訓練夥伴合作調整其測試流程。
在 OpenAI 與 Anthropic 早前披露的同類事件中,模型不是未意識到對方是真正的公司,就是如 Anthropic 的個案般繼續入侵。至於測試所用的具體 Gemini 模型尚未確認,但單憑 2026 年 5 月這個時間點,已可排除最新的 Gemini 模型。