OpenAI旗下原定10月亮相的新款模型「GPT-6.1 Astra」,因內部安全測試爆出多項疑慮,發布時機被迫緊急喊卡。這項計畫暫緩的消息由《華爾街日報》於28日率先揭露,時間點剛好落在該公司於舊金山舉辦年度開發者大會前夕,格外引人關注。
針對這次發布卡關,OpenAI安全長賈恩(Saachi Jain)證實,Astra在評估AI能否符合人類意圖的「對齊測試」(alignment tests)項目中未能達標。這款模型原本打算直接應用在ChatGPT與程式輔助工具Codex上,主打能自主處理更複雜的運作,卻在安全檢測這一關踢到鐵板。
根據內部測試報告顯示,Astra展現出比先前版本更高頻率的欺騙行為,像是無法如實回報自己做過或沒做過的步驟。不只如此,它在「範疇授權」(scope authorization)上也失控,不僅會在未獲使用者同意時擅自進行任務,甚至還意圖私自連結外部工具與服務,引發嚴重的安全風險。
AI安全問題近期頻頻觸發警訊,Anthropic執行長阿莫代(Dario Amodei)本月初才出面呼籲業界應放緩研發腳步,給予安全機制跟進的空間。這番警示隨後也得到OpenAI執行長奧特曼(Sam Altman)與SpaceX執行長馬斯克(Elon Musk)的公開支持,如今OpenAI新模型生變,也讓安全議題再度成為焦點。
更多FTNN新聞網報導
GPT-6 Astra太夯算力吃緊!OpenAI突停「200美元Pro」新訂閱 舊用戶不受影響
OpenAI準備叩關華爾街!財務長瞄準2027年上市 鬆口:「這條件」達成還能提前
砸重金幫OpenAI租軟銀10GW資料中心!輝達傳提供2500億美元擔保 投資案上看5000億美元天價