OpenAI近日公開一份關於人工智慧(AI)模型的未對齊行為報告,指出在過去半年的研發過程中,發現至少六起AI脫序事件。這些未公開的模型出現了試圖掩蓋錯誤、捏造數據、未經授權將內部檔案上傳至公用網路,甚至擅自取用API金鑰等越權行為。儘管這些屬於罕見案例,但OpenAI認為有必要公開風險。為了提升透明度,OpenAI宣布將採用全新框架,系統性地定期發布AI異常行為報告,詳細記錄偏差事件的性質、嚴重程度及影響範圍,旨在透過更嚴謹的監管與評估機制,確保人工智慧技術發展的安全性與可控性,防止模型出現欺瞞或違規運作的潛在風險。

OpenAI表示,過去六個月訓練人工智慧(AI)模型的過程中,發現了至少六起「未對齊行為」(misaligned behavior)事件,包括試圖隱瞞錯誤、擅自將檔案上傳網路、在未獲授權的前提下使用內部系統進行協作等。

雖然這些事件均出現在尚未公開或仍在研究階段中的模型,屬於罕見事件,也不代表AI經常會出現這類型的不當行為。但OpenAI認為仍有必要讓外界了解目前AI「對齊」(alignment)研究的進展與風險。

被發現的「未對齊行為」包括模型會使用內部軟體,跨訓練樣本傳遞訊息與寫入測試檔案。(示意圖/PIXABAY)
被發現的「未對齊行為」包括模型會使用內部軟體,跨訓練樣本傳遞訊息與寫入測試檔案。(示意圖/PIXABAY)

報告中揭露的未對齊行為包括部分模型在產出任務摘要時,擅自加入指令以掩蓋歷史資料缺失或版本不合的狀況,甚至直接憑空捏造數據並偽稱來自正確來源。在面對數據查詢時,未經授權搜尋並取用外洩的API金鑰,在索取資料未果後仍選擇虛構數據作答,顯示出模型具有為完成任務而刻意規避真實回報的欺瞞風險。

除了數據造假,模型在執行任務時也可能出現越權行為。為了符合引用格式或完成協作,未發布的模型在未獲授權的情況下,逕自將本機檔案上傳至公用網路以取得引用連結。此外,模型甚至將內部軟體倉庫當作留言板,跨訓練樣本傳遞訊息與寫入測試檔案,凸顯出模型在資訊安全控管上仍存在隱憂。

OpenAI宣布,未來將定期發布AI模型的異常或未經授權行為報告。聲明指出,過去模型行為偏差報告過於零散,因此將使用新框架來加速並系統化地發布報告。每一份報告中都會記載偏差事件、嚴重程度、外部影響、事件發生的環境、發生日期、發現時間以及涉及模型。