過去的一段時間,當市場上眾多公司都努力更新旗下的 AI 模型,Google 卻好像展現出一副愛理不理的態度,令大家認為 Google 已經大落後了。不過在個多月間,Google 已加快了步伐,昨晚更再度推出新模型,名為 Gemini 3.8 Flash,專攻過去弱項的編寫程式及處理複雜任務能力,力求趕上對手們的步伐。

Google 日前於官方網誌公布,他們在 Gemini 3.7 Flash 推出三星期後,就再推出新版 3.8 Flash。新模型定位為 Google 目前的最強推理與程式編寫模型,針對長時序軟件工程與自主代理任務而設計。不但速度與成本與 3.7 Flash 相當,效能上有更好的表現,甚至接近成本更高的頂級模型。

在 DeepSWE v1.1 評測中,3.8 Flash 於自主端對端解決複雜工程問題方面,勝過大部分規模更大的頂級模型,成本卻可以做到更低。在金融與法律等專業領域,3.8 Flash 於 Vals Finance Agent V2 及 Harvey's Legal Agent Benchmark 兩項評測,均超越 3.7 Flash 及其他頂級模型。

Google 表示,性能提升源於模型在處理複雜任務時,會執行更多推理步驟並反覆調用工具,因此在較高運算力設定下,可能耗用更多 token。對運算成本較敏感的開發者,可調低算力設定以減少 token 消耗,或繼續使用仍獲全面支援的 3.7 Flash。

除了為一般用家、開發者而設的 3.8 Flash,Google 亦同步發表 3.8 Flash Cyber,主力偵測安全漏洞與自動修補能力,並保留 Flash 系列的速度與成本優勢。

Google 指出,在業界標準漏洞偵測評測 CyberGym 中,3.8 Flash Cyber 於自主漏洞發現方面達到頂級水平,表現超越上一代 3.5 Flash Cyber 及規模明顯更大的頂級模型。Google 曾以涵蓋 20 種程式語言、涉及複雜代碼庫的內部評測作測試,模型較舊版有大幅提升,成功率超過 70%。

在自動修補漏洞方面,Google 表示今次特別著重提升防禦方相對攻擊方的優勢。在外部修補能力評測 CWE-Bench(由 Collinear 營運)中,3.8 Flash Cyber 的 pass@1 為 47.2%,與目前表現最佳的頂級模型 47.8% 相近,但成本明顯較低。同時,3.8 Flash 內建針對化學、生物、放射性及核能(CBRN)威脅以及網絡攻擊濫用的防護機制,符合 Google 的前沿安全框架,並在抵禦提示注入攻擊方面,按 Gray Swan 評測標準有顯著提升。

與以往的情況相近,Google 先在 Antigravity、AI Studio 及 Android Studio,以 API 的形式提供 3.8 Flash。至於在我們更常接觸到的 Gemini 程式、Google 搜尋的 AI 模式及 Google 試算表中的 Gemini,就暫時只有 AI Pro 及 Ultra 訂戶才可以用到 3.8 Flash。其他用家包括一般免費版用家,未知將於何時用到。

至於 3.8 Flash Cyber,就不是為一般人而設,而是不同的網絡安全機構、關鍵基礎設施營運商及軟件維護商,所以他們要透過 Fairwind Program,來向 Google 申請優先取用 3.8 Flash Cyber。

這篇文章 Google 推出 Gemini 3.8 Flash 強化編寫程式及處理複雜任務能力 最早出現於 PC3 Magazine。