OpenAI 推出新模型 GPT-6.1 Sol,聲稱在代理編碼、電腦操作及辦公室工作等任務上表現接近計劃中的旗艦模型 Astra,成本只需約五分之一;原定推出的旗艦 GPT-6.1 Astra 則因安全考慮暫緩發佈。Sol 現已向付費客戶開放,API 定價與 Anthropic 的 Claude Sonnet 5.5 相若。
Sol 的 API 定價為每百萬輸入 Token 2 美元、輸出 10 美元,與 GPT-6 Sol 及 Anthropic 的 Claude Sonnet 5.5 相同。快取輸入每百萬 Token 收費 0.10 美元,較未快取輸入低 95%,Sonnet 5.5 則收 0.20 美元,這對需要跨多個請求重用上下文的代理幫助最大。作為對比,Claude Opus 5.5 每百萬輸入 Token 收費 4 美元、輸出 20 美元、快取讀取 0.20 美元,快取寫入為 5 美元,而 Sol 的快取寫入收費為 2.50 美元。
Plus、Pro、Business、Enterprise 及 Edu 用戶即日起可在 ChatGPT Work 及 Codex 使用 Sol,但一般聊天功能尚未提供。開發者可透過 API 以 gpt-6.1-sol 名稱存取。在 Codex 中產生 Token 速度快達八倍的 Ultrafast 版本,預計於未來數日內推出。
OpenAI 提供的基準數據均屬初步,公司亦承認,包括與 Sonnet 5.5 的公平比較,須待正式發佈才能進行。在 DeepSWE v1.1 編碼基準測試中,OpenAI 表示 Sol 與 Astra 同級,成本約為五分之一,得分較 GPT-6 Sol 最佳成績高 6.4 個百分點。在測試電腦操作的 OSWorld 2.0 中,Sol 較前代高 7 分,落後 Astra 2.1 分,成本約為七分之一。
在 GDP.pdf 文件基準測試中,OpenAI 稱 Sol 勝過 Anthropic 的 Opus 5.5,每項任務成本不到一半。在涵蓋多步商業工作流程的 AutomationBench 中,Sol 以中等推理強度完成任務,成績領先 Opus 5.5 2.2 分,成本約為三分之一。在 Terminal-Bench Science 中,OpenAI 稱 Sol 得分較前代增加超過一倍,平均每項科學任務成本為 5.47 美元,Opus 5.5 為 23.21 美元,Astra 為 23.80 美元。Astra 仍取得最高分 68.1%,OpenAI 繼續建議以它處理最困難的研究工作。
OpenAI 亦聲稱 Sol 在事實準確度上更可靠。在先前模型答錯的刻意困難提示中,低推理強度下的錯誤答案比例由 11.4% 降至 7.7%;OpenAI 承認這些提示不代表正常使用情況。
OpenAI 表示,Sol 在安全測試上較前代表現大幅改善,但仍落後 Astra。Sol 在 23.5% 的情況下試圖繞過「存取被拒」等明確封鎖,較 GPT-6 Sol 的 64.4% 為低,Astra 的比率為 17.4%。未經授權交易等不良結果出現在 4.3% 的運行中,前代為 17.4%,Astra 為 2.9%。
當搜尋工具故障時,Sol 有 2.8% 的情況隱瞞問題而非作出報告,GPT-6 Sol 為 4.9%,Astra 為 1.5%。與 Astra 及前代一樣,Sol 從未試圖繞過自動安全檢查。OpenAI 指出,測試刻意設計得嚴苛,並且未運行產品所用的完整防護措施。
安全正是這款計劃中旗艦模型的不足之處。據《華爾街日報》報道,OpenAI 原定 10 月在 ChatGPT 及 Codex 推出 GPT-6.1 Astra,但因研究人員在內部測試期間提出安全關注,未有按計劃推出。安全主管 Saachi Jain 表示,該模型更常作出欺騙行為,並在未經許可下繼續行動,有時以高風險方式使用外部工具,即使它在完成任務方面表現更好。
OpenAI 並未完全放棄該模型,計劃把基礎模型用於更多強化學習訓練,並可能用於未來的 GPT-6 世代。Jain 表示,公司須在讓模型保持在任務範圍內,以及避免它變得懶惰之間,找到合適界線。