新創公司 Community Labs 近日發表了開源運行時(runtime)平台 Cascadia,旨在將人工智慧(AI)推理工作負載分散至搭載英特爾(Intel)處理器的現有設備上。此舉為企業與個人提供了在不依賴雲端服務或額外專用硬體下運行大型語言模型的替代方案,特別適用於對資料駐留與隱私有嚴格要求的組織。

Cascadia 的核心技術圍繞著智慧模型分片(model sharding)與路由功能,能將 AI 工作負載自動分配到網路中相互連接的裝置。透過這種方式,組織可將現有的英特爾電腦設備轉換為私有基礎架構,以處理大型語言模型。

該平台支援多種部署方式,包括在單一設備上運行模型、將模型複製到多個設備,或將大型模型分割後分散於多台機器上。Community Labs 創辦人 Tate Berenbaum 表示,開發 Cascadia 的初衷是讓使用者不必在雲端 AI 模型與購買專用硬體之間做出選擇,證明利用現有硬體運行高效能模型是可行的。英特爾全球開發者關係與創新資深總監暨總經理 Jinghui Luo(Dennis Luo)也指出,很高興能與 Cascadia 合作,讓 AI 個人電腦運行過去不可能的模型,並將高效能的分散式 AI 推理技術推廣到更多環境。

在硬體支援方面,Cascadia 採用了英特爾的 OpenVINO 工具包,針對中央處理器(CPU)、整合式圖形處理器(integrated GPU)及神經網路處理器(NPU)進行推理優化,同時也支援多款 Intel Arc Pro 獨立顯示卡。網路中的每台電腦都將運行一個單一程式,負責發現可用設備、路由請求並在分散式系統中執行工作負載。據 Community Labs 表示, Cascading 的早期應用已展現令人期待的成果,其被定位為一個能在英特爾 CPU、整合式 GPU、NPU 及獨立 GPU 上運行本地 AI 模型的分散式 AI 推理叢集。

值得一提的是,Cascadia 也相容於 OpenAI API,這意味著該平台能輕鬆整合至現有的 AI 應用程式與工作流程中。這類型的開源平台發展,對於台灣在 AI 晶片與軟體生態系的發展可提供新的啟示,特別是在如何有效利用現有硬體資源,以及發展本地化 AI 解決方案方面,能為台灣的 AI 產業鏈帶來潛在的技術合作與創新機會。

同時,Google 於 2026 年 8 月 13 日也推出了新一代大型語言模型 Gemini 3.7 Flash,為 Gemini 3.6 Flash 的升級版。此模型主要針對複雜程式開發、AI 代理程式建構與專業工作流程設計,強調速度、準確性與成本效益的提升。例如,在 FrontierCode 1.1 Main 程式設計基準測試中,成功率從 34.4% 提升至 43.6%。該模型支援超過一百萬個 Token 的上下文視窗,並具備多模態輸入與文字輸出的能力。Google 將其定價為每百萬輸入 Token 0.75 美元,每百萬輸出 Token 3.75 美元,此優惠價格將維持至 2026 年底。