OpenAI 9月推出GPT-6 Astra後,網路又出現疑似Google Gemini 4 Pro的匿名模型,外流跑分傳出在程式編碼、AI代理及電腦操作等項目領先Astra。不過,Gemini 4目前尚未獲Google證實。真正值得注意的,也不是誰多贏幾個百分點,而是前沿AI正從「回答問題」,走向能操作電腦、使用工具、持續執行任務的數位代理。

OpenAI 9月正式推出GPT-6 Astra,將重點放在電腦操作、程式開發、科學研究與專業辦公。Astra不只可以回答問題,也能填寫表單、整理資料、操作網站、撰寫程式、測試結果,再根據錯誤重新修正。換言之,AI開始從「提供建議」進一步走向「實際完成工作」。過去使用者可能要求AI「幫我寫一封Email」,現在模型追求的是讀完信件、查找資料、更新系統、撰寫回覆,再完成後續工作。對企業而言,真正有價值的指標不再只是模型知道多少,而是能不能把一項任務從頭做到尾。

就在Astra發表後,AI社群開始流傳一款名為「gemini-3.8-flash」的匿名模型,部分開發者認為它可能是Gemini 4 Pro的早期測試版本。流傳數據稱,它在DeepSWE、GDPval-AA、Terminal-bench及OSWorld等測試中可能超越Astra,甚至傳出更低價格、超長上下文及跨對話記憶等規格。但這些資訊目前都必須加上一個前提:Google尚未正式證實。因此,現階段不能直接下結論說「Gemini 4擊敗Astra」。較準確的說法是,AI社群出現一款能力異常突出的匿名模型,外界懷疑可能與Google下一代模型有關,但身分、價格與跑分仍待官方確認。

真正確定的趨勢則是:AI已經進入「代理式人工智慧」階段。早期聊天機器人的基本模式是「人問、AI答」;接著模型開始具備推理與程式能力;現在更進一步取得瀏覽器、終端機、檔案與各種軟體工具的操作能力,可以觀察環境、採取行動,再根據結果決定下一步。當AI只能輸出文字,錯誤通常停留在螢幕上;當AI可以操作電腦,錯誤就可能直接修改資料、寄出郵件、改動程式甚至接觸企業系統。OpenAI也因此將Astra的部分網路安全能力列入最高級別風險範圍,顯示AI安全問題正在從「會不會答錯」,轉向「做錯事情後會造成多大影響」。

另一個更受關注的方向,是AI開始參與AI本身的研發。所謂RSI,也就是遞迴式自我改進,描述的是AI協助研究模型、撰寫程式、分析失敗,再投入下一輪模型開發,形成「AI協助打造更強AI」的循環。目前沒有足夠公開證據顯示任何公司已經建立能完全自主進化的RSI系統,因此說AI已經「自己變聰明」仍然過早。不過可以確定的是,AI正在成為科學研究與AI研發本身的重要工具。對一般人而言,真正需要注意的,也不是DeepSWE多了幾分,而是AI可以獨立完成的工作正在變長。

今天它可以寫程式,下一步是自己測試、找錯、修改;今天可以整理法律文件,下一步是搜尋判例、比對證據、產出初稿;今天可以寫Email,下一步則是讀信、判斷優先順序,再處理整個工作流程。這意味著未來工作的改變,可能不是「人全部被AI取代」,而是人類的角色逐漸往設定目標、分配權限、驗證成果與承擔責任移動。