OpenAI 今日表示,正「暫停」涉及即將推出的 AI 模型 Astra 的活動,因為其網絡攻擊能力可能過於危險。OpenAI 指出,最新內部評估顯示 Astra 在智能體編碼與網絡安全方面有「顯著進展」,因此無法排除它具備「關鍵網絡攻擊能力」;OpenAI 過往的 AI 模型,包括 GPT-5.6 Sol,僅被標記為「高」。
Astra 觸發了 OpenAI「準備框架」中的更嚴格指引。該指引要求在開發會造成嚴重傷害風險的前沿 AI 能力時保持謹慎;框架的網絡安全部分亦表明,OpenAI 會為「製造大規模網絡攻擊與漏洞利用新風險」的 AI 模型實施額外保障措施。Astra 可能已達到的「關鍵」門檻,定義是在無人介入下,識別並開發覆蓋所有嚴重程度、可應用於多個已加固真實世界關鍵系統的有效零日漏洞,或者構思並執行端對端的新型網絡攻擊策略。
OpenAI 表示,在部署 Astra 前會加強保障措施與安全控制,包括在新型保障措施到位前限制涉及該 AI 模型的工作。公司計劃採用限制網絡與工具存取的隔離測試環境,並加入沙盒執行及更多監控功能;同時會與相關政府機構及 AI 安全組織合作測試 Astra。OpenAI 表示:「我們致力與各國政府、安全研究所及公民社會合作,確保 Astra 及後續同類 AI 模型的前沿能力以負責任且廣泛的方式部署,造福全人類。」
Astra 未有正式公佈,但 OpenAI 最近在一篇講述數學進展的文章中,分享了下一代主要 AI 模型的細節;Astra 以約 2,000 美元(按 Sol API 費率計算)解決了數學與理論電腦科學領域的 10 道未解問題。AI 發展亦正透過發掘前所未有的漏洞數量,改變 Apple 等大型科技公司的網絡安全工作;Apple 最近限制了漏洞賞金計劃的提交,因為難以處理相關數量。像 Claude Mythos 這類 AI 模型能夠找出關鍵漏洞,而 Apple 是 Anthropic 的 Mythos 合作夥伴之一;Mythos 僅限特定公司使用,因為它除了找出漏洞外,亦有可能利用這些漏洞。OpenAI 在 7 月成為頭條新聞,因為 GPT-5.6 Sol 及另一個「能力較強的預發佈 AI 模型」(並非 Astra)在內部基準測試期間自主入侵了 Hugging Face;Anthropic 亦發現旗下 Claude 做過類似行為,Meta 本週則表示,旗下一個 AI 模型在網絡安全評估期間入侵了另一家公司。