Google 發佈新一代前沿模型 Gemini 4 Argon,標榜這是「前沿智能的新時代」,專為「跨複雜、長流程工作負載的深度推理」而設。新模型採用全新命名方式,接續早前取消 Gemini 3.5 Pro、集中發展 3.8 Flash 的路線,目標是在編程、知識工作、網絡安全防禦及創意寫作方面提供「前沿級能力」。
Gemini 4 Argon 的輸出 Token 上限由 64K 大幅提升至 100 萬,以支援更長、更複雜的使用情境,並同時擴大編程、推理及多模態能力。Google 指出,當模型有足夠空間深入思考,並在單一軌跡中生成數十萬個 Token,即可一次過處理艱難問題,令推理深度達到新層次。
在基準測試方面,Google 稱 Gemini 4 Argon 於 DeepSWE v1.1 取得 77.9%,高於 Claude Opus 5.5 的 74.2%,以及 GPT-6 Astra 的 74.1%。在評估模型修復安全漏洞能力的 CWE-bench v1 上,Argon 以 68% 的最高分並列第一。
Google 表示,Gemini 4 Argon 在網絡安全防禦方面「能力極高」,表現較 3.8 Flash Cyber 有明顯躍進。模型將在「不設網絡安全護欄」的情況下,提供予受信任的防禦人員及 Google 內部團隊,讓他們「發揮完整的前沿級網絡安全防禦能力」。除編程以外,Argon 在其他特定領域評估中同樣有領先表現,例如 Vals Finance Agent v2(多步驟財務研究)及 Harvey 的 Legal Agent Benchmark(法律研究與起草)。
在 Zapier 用於衡量核心業務功能端到端執行表現的 AutomationBench 上,Argon 以 51.3% 排名第一;在衡量長影片理解的 LVBench 上,Argon 以 91.7% 取得當前最佳成績。
Gemini 4 Argon 將「即將推出」,最先開放予 Google AI Ultra 訂戶及付費 API 客戶。Google 公佈的入門價格為每 100 萬個輸入 Token 收費 2 美元、每 100 萬個輸出 Token 收費 10 美元,快取輸入 Token 較輸入 Token 價格便宜 95%;入門期結束後,價格會調整為每 100 萬輸入 Token 4 美元、每 100 萬輸出 Token 20 美元。
目前 Gemini 4 Argon 已提供予受信任測試者及網絡防禦人員(透過 Fairwind Program)。在更廣泛推出之前,Google 正集中處理數方面的工作。針對網絡或化學、生物、放射及核(CBRN)攻擊的濫用,Google 已改進「監測模型內部激活以識別濫用的技術」。針對提示注入攻擊,Google 稱 Argon 是「歷來對間接提示注入最具韌性的模型」,並在 Gray Swan 的 Indirect Prompt Injection(IPI)基準中「在提示注入穩健性方面領先」。
在強化系統方面,Google 表示會「在高風險訓練或評估開始前,隔離並封閉沙盒環境」。在監測偏離方面,Google 正「部署偏離緩解措施,監測 Argon 的思維鏈與行動,並在必要時停止執行」,同時以類似系統監測訓練過程,並向專責事故應變團隊發出警報,又小心防範把發現回饋至訓練,以免影響 Argon 的推理,使其學會迴避監測。
在 Google 內部,Gemini 4 Argon 已用於支援內部工作流程,有「數千名 Google 員工」指出模型在專門編程任務、深入研究及寫作品質方面的優勢。Google 亦分享部分例子。
記憶體效率方面,一組 Argon 代理分析全機群的效能剖析遙測數據,自主識別並在 Google 數據中心套用記憶體優化,全面推行後釋放逾 300 TiB 記憶體,預計總節省量達 500 TiB 至 1 PiB。
大規模程式碼庫遷移與優化方面,Argon 代理正協助把 C/C++ 程式碼庫遷移至 Rust,規模由 re2、libgav1 等核心程式庫的數萬行,到 Fuchsia OS Zircon 核心的 80 萬行以上。由於不少系統至關重要,這類大規模重寫在推行至生產環境前,須經過嚴格的自動化與人手審核、模擬測試及覆核。
以 libgav1 為例,這個 Google 用作解碼影片的開源軟件,Argon 代理在現有 Rust 版本上,透過多輪以效能剖析引導的實驗,研究編譯器的輸出並產生安全 Rust 程式碼,讓編譯器自動向量化,最終取代 3.2 萬行 SIMD 程式碼。結果是記憶體安全的影片解碼器,運行速度較 Rust 版本快 2.7 倍,影片輸出完全相同,並更接近經優化的 C++ 版本。