AI 技術迭代速度再創新高!繼三週前發表 Gemini 3.7 Flash 後,Google 今天正式推出全新的 Gemini 3.8 輕量旗艦模型。這不僅是 Google 在短短六週內發布的第三款 Flash 系列模型,更是目前 Gemini 家族中邏輯推理與程式碼編寫(Coding)能力最強的代表作。
令人關注的是,儘管效能獲得躍進式突破,Google 仍維持「加量不加價」策略,定價與 3.7 Flash 完全一致,每百萬輸入 Token 為 0.75 美元,每百萬輸出 Token 為 3.75 美元。
本次 Gemini 3.8 架構下共推出兩款針對不同應用場景打造的雙生模型:
Gemini 3.8 Flash:專為企業自動化與複雜任務打造的「主力工作模型(Workhorse Model)」。相較前代,它在軟體工程、自主 Agent 任務以及跨領域的多步驟推理上大幅升級。
Gemini 3.8 Flash Cyber:全台首創級別的資安專用模型,具備前沿等級的「漏洞檢測」與「自動補丁修復」能力,將透過全新推動的 Fairwind Program 開放給受信任的資安防禦團隊使用。
兩款模型底層皆共享同一套基礎智慧核心,並透過「長週期 Agent 迴圈(Long-running agentic loops)」持續自我遞迴評估與微調。官方特別指出,這次程式與推理能力之所以有巨大突破,很大程度上歸功於團隊在極高難度的資安領域中進行了嚴格的訓練。
Gemini 3.8 Flash 的核心賣點在於高性價比與長程自主執行能力,多項基準測試表現甚至直逼市場上高單價的旗艦巨型模型:
DeepSWE v1.1 測試(長程軟體工程):在無需人工介入、自主端到端解決複雜工程問題的能力上,3.8 Flash 擊敗了多款規模更大、成本更貴的對手模型。
專業領域 Agent 表現:針對需要高階分析與報告撰寫的量化與專業領域,3.8 Flash 在 Vals Finance Agent V2(金融 Agent 基準) 與 Harvey's Legal Agent Benchmark(法律 Agent 基準) 中的表現全面超越 3.7 Flash。
高難度多步驟推理:在涵蓋 STEM、人文學科與專業領域的 HLE-Verified 基準測試中拿下 54.9% 的優異成績,展現出極為穩健的邏輯推理實力。
Google 透過這次快節奏的更新再次表明,未來的 AI 競爭不僅僅是比拼模型規模,如何在維持極低延遲與低成本的前提下,賦予模型強大的自主執行與深度推理能力,將是企業級 AI 應用的全新戰場。