ChatGPT 日前才宣布好消息,免費版與 Go 方案的預設模型將升級為 GPT-5.6 Luna,而且免費用戶與 AI 進行文字聊天也不再有訊息次數限制。沒想到才過幾天,OpenAI 又傳出新一代 AI 模型的資安警訊。
OpenAI 表示,新模型「Astra」在內部測試展現出更強的程式開發與網路安全能力,甚至可能跨越自家 Preparedness Framework 所定義的「Critical」最高風險門檻。因此,OpenAI 官方暫停部分尚未符合規定的 Astra 開發與測試工作。
OpenAI 表示,最近幾天針對 Astra 進行的內部測試顯示,這款模型在 AI 代理程式開發與網路安全任務上的能力都有明顯進步。
依照 OpenAI 的 Preparedness Framework,包括 GPT-5.6 Sol 在內的先前模型,在資安能力評估中最高被列為「High」高風險等級;但 Astra 最新的測試表現,讓 OpenAI 不排除它可能會達到「Critical」最高風險門檻。
這裡所說的 Critical,並不是一般資安漏洞常見的嚴重度分級,而是 OpenAI 用來評估 AI 模型本身具備多少自主網路攻擊能力的標準。
依照 OpenAI 定義,假如 AI 能在沒有人類介入的情況下,能針對多個經過強化防護的真實關鍵系統,自行找出並開發可實際利用的零時差漏洞;或者只需要給 AI 一個大方向目標,它就能自行規劃並執行完整的新型網路攻擊策略,那麼這個 AI 模型的資安就可能達到 Critical 最高風險。
換句話說,真正讓 OpenAI 提高警戒的,不只是 Astra 比先前幾種模型更會寫程式,而是它可能逐漸具有「自己找漏洞、規劃攻擊方式,再執行完整任務」的能力。
對於 Astra 模型可能達到更高風險門檻,OpenAI 也同步提升內部安全規範,同時也將建立隔離測試環境、限制網路與工具存取、加強模型權重保護與加密,以及增加監控、異常偵測與沙盒執行環境。
OpenAI 表示,凡是還沒符合強化安全要求的 Astra 開發與測試工作,都會先暫停。
另外,OpenAI 也針對 Astra 模型的 AI 代理、模型訓練與測試過程加入全面監控。一旦偵測到高風險行為,除了會觸發安全審查之外,必要時將中斷相關操作。
接下來,OpenAI 也計畫與相關政府單位及部分 AI 資安組織合作,進一步測試 Astra 模型,並提供第三方測試夥伴更嚴格的安全控制建議。
OpenAI 最近遇到的資安問題不只是 Astra 的資安風險可能達到最高等級,在 2026 年 7 月下旬時,OpenAI 也曾發生 AI 模型在測試中駭入 Hugging Face 系統。
當時 OpenAI 表示,涉及事件的模型以 GPT-5.6 Sol 為主,而在這次 Astra 模型的資安風險說明中,OpenAI 公司特別澄清 Astra 並沒有參與當時的測試。
近期包括 OpenAI、Anthropic 等 AI 公司,都陸續揭露模型在資安測試過程中突破沙盒或存取外部系統的案例,也讓 AI 自主操作能力帶來的安全問題再次受到關注。
OpenAI 認為,更強的 AI 資安能力不一定只代表威脅,這類模型同樣可以協助防禦端更快發現漏洞,讓資安團隊有機會搶在攻擊者之前完成修補。
但當 AI 從協助人類分析漏洞,進一步發展到能自行使用工具、規劃攻擊流程,甚至執行複雜任務時,一旦安全限制不足,可能造成的影響也會跟著放大。
這次消息值得注意的不只是 OpenAI 又開發了一款能力更強的新模型,而是 AI 的資安能力可能已經逼近過去少見的新階段。
這也代表,下一代 AI 模型的競爭,可能已經不只是誰更聰明,而是誰能在能力快速提升的同時,把風險控制在可接受範圍內。