OpenAI於9月4日正式推出新一代旗艦模型「GPT-6 Astra」,官方稱其為目前最聰明、最一致的模型,總裁布羅克曼(Greg Brockman)更形容這是一次「世代級跨越」,暗示AI技術正式跨入AGI門檻。其中最受矚目的,是衡量AI應對陌生任務能力的「ARC-AGI-3」測試,Astra一舉衝上99.9%的高分,相較GPT-5.6 Sol僅個位數的表現,落差相當懸殊。

OpenAI後於9月5日表示,Astra現已開放給ChatGPT Work與Codex的Pro、Enterprise、Business Premium用戶,API也同步上線,Plus與一般Business用戶則預計在數天內跟進。開發者可透過API或亞馬遜雲端服務(AWS)呼叫Astra,標準定價為每百萬輸入token 10美元、輸出50美元,換算約新台幣320元與1,600元,若切換到處理速度更快的Fast模式,價格則直接翻倍。

Astra最大亮點在於電腦操作能力,不需透過API或MCP,就能直接看懂螢幕畫面、找按鈕、打字,處理Excel、Power BI甚至電路板設計等工作,OSWorld測試任務完成率達72.6%,優於前代GPT-5.6 Sol的65.7%。資安能力同樣大幅提升,在ExploitBench拿下滿分100%,並在測試中挖出兩項先前未知的零時差漏洞,已觸及OpenAI「準備框架」中的資安關鍵風險門檻,因此進階漏洞驗證功能暫時只開放給受核准的資安人員。

官方公布的成績單相當亮眼:測試困難數學推理能力的FrontierMath Tier 4,Astra拿下97.6%,優於Claude Fable 5.1的78.0%與GPT-5.6 Sol的80.5%;測試多步驟商業流程自動化能力的AutomationBench,Astra也以41.4%的完成率創下新高,遠優於Fable 5.1的31.4%與GPT-5.6 Sol的18.1%。OpenAI官方更表示,在測試AI代理應對陌生互動任務學習能力的ARC-AGI-3項目當中,Astra拿下99.9%的高分,不只遠勝過GPT-5.6 Sol的7.8%與Anthropic Claude Opus 5的30%,形同不同世代的產品,還遠優於人類的48%平均分。

不過獨立評測機構ARC Prize發現,這個成績是在rovider Adapter特殊測試環境下測出來的,允許模型跨請求保留隱藏推理狀態;換成一般標準環境,分數會直接腰斬到62.7%。同時ARC Prize坦言,這是把基準測試刷到飽和,不足以證明AGI。另一家機構Artificial Analysis給出的智力指數同樣保守,僅61分,跟前代GPT-5.6 Sol打平,還落後Claude Fable 5.1與Muse Spark 1.3各5分。分析認為,Astra真正站得住腳的進步在於效率:完成同樣的寫程式任務,token用量只要GPT-5.6 Sol的三分之一,幻覺率也從92%降至51%。

內容僅供參考,投資人於決策時應審慎評估風險,並就投資結果自行負責。
投資一定有風險,基金投資有賺有賠,申購前應詳閱公開說明書。