Anthropic 發佈 Claude 5.5 家族的第二個模型 Claude Sonnet 5.5,宣稱輸出生成速度提升超過 30%,每項任務成本最多降低 30%,並在多項基準測試中幾乎追平同門的 Opus 5.5。新模型針對定義清晰的日常工作,例如修正程式錯誤、撰寫文件、製作簡報與試算表;Anthropic 同時預告將於未來數週推出主打高吞吐量、低成本場景的 Claude Haiku 5.5。
根據 Anthropic 公佈的數據,Sonnet 5.5 與前代的性能差距在編碼方面最為明顯。在測試代理式編碼的 Terminal-Bench 4.0 上,Sonnet 5.5 取得 70.6%,遠高於 Sonnet 5 的 10.3%;Opus 5.5 在同一測試的 Xhigh 設定下為 66.4%。在重現 Cursor 編輯器真實編碼過程的 CursorBench 4.0,Sonnet 5.5 得分 55.5%,高於 Sonnet 5 的 34.1%,僅比 Opus 5.5 的 57.8% 低兩分。Anthropic 表示,在 FrontierCode 1.1 的 High 設定下,Sonnet 5.5 比 Sonnet 5 高十分,每項任務成本約為十五分之一。早期測試者讚賞 Sonnet 5.5 掌握程式碼庫的速度,該模型也比前代更常批次處理工具呼叫,減少所需步驟。
推理強度方面出現一個異常情況。在最高努力等級 Max 下,Sonnet 5.5 在 FrontierCode 的得分反而低於 Xhigh 設定。Anthropic 解釋,在最大努力時,模型更頻繁觸發把工作分拆給多個子代理的程式碼審查功能,部分情況因而超時,或產生超出任務範圍的改動,兩種情況都會被 FrontierCode 扣分。
在由 OpenAI 開發、涵蓋 44 種職業及九個行業任務的知識工作基準 GDPval-AA,Sonnet 5.5 取得 1,844 分,幾乎追平 Opus 5.5 的 1,846 分,並較 Sonnet 5 的 1,449 分高約 400 分;按 Anthropic 提供的數字,OpenAI 的 GPT-6 Sol 為 1,487 分。在視覺圖表辨識測試 Chartography,Sonnet 5.5 由 15.6% 躍升至 61.6%。
其他基準表現包括:AA Briefcase v1.1 得 1,811 分,Sonnet 5 為 1,359 分、Opus 5.5 為 1,822 分、GPT-6 Sol 為 1,483 分;在可動用工具的 Humanity's Last Exam 取得 64.5%,Sonnet 5 為 54.9%、Opus 5.5 為 67.7%;在部分評估的 OSWorld 2.1 取得 80.1%,Sonnet 5 為 57.0%、Opus 5.5 為 81.8%。Anthropic 註明,Sonnet 5.5 的數值來自預發佈版本,當時一個其後已修正的錯誤可能影響結構化輸出。
早期測試者形容 Sonnet 5.5 是更自然的對話夥伴,並對設計有感覺。Anthropic 聲稱,該模型可以重做使用者介面,執行簡報範本的效果好得幾乎毋須修改。Anthropic 又表示,Sonnet 5.5 是首個僅憑截圖就能玩《Pokémon Red》的 Sonnet 模型;OpenAI 的 Astra 近期在遊戲基準亦展示類似進展。這類任務在數年前仍被視為困難,往往需要專門演算法,如今連產品系列中的中階模型也能應付。
Sonnet 5.5 每百萬 Token 的價格與 Sonnet 5 相同:輸入 Token $2、輸出 Token $10、快取讀取 $0.20。Anthropic 稱,由於模型每項任務使用的 Token 較少,實際成本最多下降 30%,輸出生成速度亦提升超過 30%。這些說法仍待獨立測試確認。
Anthropic 同時列出同級模型的價格:Opus 5.5 每百萬輸入 Token $4、輸出 Token $20、快取讀取 $0.20、快取寫入 $5;GPT-6 Sol 為 $2、$10、$0.20 及 $2.50;Sonnet 5.5 為 $2、$10、$0.20 及 $2.50;GPT-6 Luna 則為 $0.10、$0.50、$0.01 及 $0.125。
與 Anthropic 其他模型及 OpenAI 的對應產品一樣,Sonnet 5.5 提供可調整的努力設定,讓使用者以成本與速度換取輸出品質。Anthropic 稱,在低或中設定下,Sonnet 5.5 已以約十分之一的每項任務成本,在多項基準超越 Sonnet 5 的最佳分數;不過為每項任務找出合適的努力水平,仍然更接近藝術而非科學。
Anthropic 現以 Fable、Opus 及 Sonnet 對應 OpenAI 的 GPT-6 Astra、Sol 及 Luna。約略而言,Opus 略高於 Sol,Sonnet 高於 Luna,Fable 高於 Astra,但 Anthropic 整體收費較高。同級之間的性能差異小得可能讓成本成為決定因素,Haiku 或有助 Anthropic 收窄差距。
Claude Sonnet 5.5 即日起在主要雲端平台上架,包括 Amazon Web Services、Google Cloud 及 Microsoft Azure。與 Opus 5.5 及 Sonnet 5 一樣,Anthropic 以零數據保留方式提供該模型,開發者可透過 Claude Platform 以模型 ID「claude-sonnet-5-5」使用。
由於 Sonnet 5.5 在網絡安全方面的能力遠勝前代,Anthropic 首次為 Sonnet 模型加入防護措施。涉及高風險網絡安全任務的請求會明顯改派至 Sonnet 5;透過擴大後的 Cyber Verification Program,合資格專業人員可申請分層存取。
Anthropic 亦加入針對蒸餾攻擊的安全分類器,與其最強大模型所用相同。這些措施是否真正有效,應在未來數月逐漸明朗。若中國實驗室一直受惠於這類攻擊,堵住該渠道或會再次擴闊與西方實驗室的差距。