Meta 正式推出第四款人工智能模型 Muse Spark 1.3,並透過 Muse Code 與 Meta Model API 開放使用。獨立測試顯示,新模型在代理任務上取得穩健進步,且具備極高的價格競爭力,但在多數基準測試中仍落後於業界頂級表現者。

Muse Spark 1.3 現已提供 xhigh 層級,而運算需求較高的 max 層級則需經過進一步安全測試,目前僅作為受限的合作夥伴預覽版本開放。輸入與輸出 Token 的價格維持不變,分別為每百萬 Token 1.25 美元與 4.25 美元。根據 Artificial Analysis 數據,完成一個指數任務的成本為 0.55 美元,這使其成為該性能級別中最便宜的模型;同級競爭對手的成本介於 0.94 至 1.23 美元之間。不過,此價格高於前一代 1.2 版本的 0.40 美元。

在 Intelligence Index 上,max 層級得分 62 分,xhigh 層級得 61 分,較 8 月的 57 分和 7 月的 53 分有大幅躍升。这一进步主要歸因於指數測試權重的調整,特別是 GDPval-AA v2、Terminal-Bench 2.1 和 τ³-Bench Banking 三項佔比最高的測試,Meta 在此取得了最大改進。在模擬銀行場景的 τ³-Banking 測試中,max 層級達到 52%,暫時位居第一;然而,現有的 xhigh 層級以 47% 與 Claude Fable 5.1 及 GLM-5.3-Flash 持平,並未領先。此外,在終端編程測試 Terminal-Bench 2.1 中,雖然分數從 80% 升至 85% 至 86%,但仍低於 Claude Fable 5.1 的最高成績。

在非代理任務領域,Muse Spark 1.3 的表現處於中游水平。在 GPQA Diamond 專家級科學問題測試中,分數從 90% 升至 94%,雖進入頂尖群體,但仍稍遜於 Gemini 3.8 Flash 和 Grok 4.6。在研究物理學的 CritPt 測試中,分數從 18% 跳升至 26%,遠低於 GPT-5.6 Sol 和 Claude Fable 5.1。值得注意的是,相較於 1.2 版本,兩項指標出現下降:AA-LCR 從 83% 跌至 79%,而 AA-Omniscience 的事實準確率也下滑多達 3 個百分點,原因在於模型在不確定時更傾向於拒絕回答。Meta 尚未公佈 max 層級的具體定價,並表示未來將推出更大規模的模型以及開放權重版本。