aire.
·約 6 分鐘

Claude Sonnet 5.5 怎麼選:與 Sonnet 5 同價、更快,跟 Opus 5.5 該用哪個

9 月 28 日 Anthropic 發布 Sonnet 5.5:牌價與 Sonnet 5 相同,官方說輸出快 30% 以上、單一任務成本最多低 30%,官方表上多項基準的分數已貼近 Opus 5.5。這篇不重複跑分,把它拆成三個問題:從 Sonnet 5 要不要換、跟 Opus 5.5 怎麼分工、成本到底怎麼算,最後附一張「你在忙什麼→該用哪個」的選型表。

收進
本文涉及工具

先講結論

一句話:日常工作先用 Sonnet 5.5,遇到複雜、開放式的工作再切 Opus 5.5。 這也是 Anthropic 自己在發布頁寫下的分工。

先給一張表:

你在忙什麼 建議 依據
從 Sonnet 5 升級 直接換 同價,官方說更快也更省 token;換前先看兩件事(見第二節)
寫文件、簡報、試算表、一般問答 Sonnet 5.5 官方定位就是這類;GDPval-AA 分數只差 2 分(1844 對 1846)
日常寫程式、修 bug、code review Sonnet 5.5 官方定位含「做功能、修 bug、審程式碼」;CursorBench 最佳分數相差約兩分
大型重構、跨檔案審計、長時間自主執行的 agent Opus 5.5 官方說複雜、開放式工作 Opus 仍明顯較強;長時間自主執行是我依此推論
量大、要壓成本 Sonnet 5.5 調低 effort 官方說低 effort 下單任務成本較低;牌價更低的 Haiku 4.5 已可用($1/$5,本文無其比較數據),Haiku 5.5 官方預告數週內加入

表裡的數字多數是 Anthropic 自己的測試與選登的客戶說法,第五節會講這代表什麼。

一、9 月 28 日發布了什麼

Sonnet 5.5 是 Claude 5.5 家族第二款,9 月 22 日的 Opus 5.5 是第一款。官方定位:Opus 5.5 為需要仔細判斷的複雜工作而生,Sonnet 5.5 最擅長定義清楚的日常任務、修 bug,以及製作文件、簡報與試算表。

三個官方數字:

  • 牌價與 Sonnet 5 相同:每百萬 token 輸入 2 美元、輸出 10 美元。
  • 輸出速度快 30% 以上,比較對象是 Sonnet 5。
  • 單一任務成本最多低 30%,同樣比 Sonnet 5,原因不是單價降了,而是通常需要少得多的 token 就能做完同樣的事。官方註明這是在自己的測試中得到的結果。

可用性方面,官方列出 Claude 應用程式、Claude Platform(API 代號 claude-sonnet-5-5)、Amazon Web Services、Google Cloud 與 Microsoft 的平台,並提供零資料留存選項;各雲端的模型 ID 與區域請以各家文件為準。

二、跟 Sonnet 5 比:值得直接換

同一價位,速度更快、單任務更省。官方表上列出的每一項基準,Sonnet 5.5 的分數都高於 Sonnet 5,例如 GDPval-AA(真實職業工作任務)約高出 400 分。合作夥伴引言也集中在效率:Balyasny 在自己的 2,441 題金融任務上,每個答案約用 12.1 萬 token,Sonnet 5 則是 49.7 萬。

要提醒的是,表上 Sonnet 5 的個別分數低很多(例如 Terminal-Bench 4.0 為 10.3%),頁面沒說明兩欄的測試條件是否完全可比,所以我不引用「進步幾倍」,只採用幅度較平實的數字。

升級前有兩件事。一件要改設定:如果你原本用「關閉思考」的設定,官方要求先改成新的 between_tools 設定。一件要知道:官方說較高風險的網路安全任務會明確回退到 Sonnet 5 處理,一般的找 bug、修 bug 則不受影響。Sonnet 5 的背景見〈Sonnet 5 深度評測〉。

三、跟 Opus 5.5 比:分數貼近,但官方仍說複雜工作 Opus 較強

先看官方表格裡幾組數字(Sonnet 5.5/Opus 5.5):

基準 Sonnet 5.5 Opus 5.5
CursorBench 4.0(真實編程工作階段) 55.5% 57.8%
FrontierCode 1.1(程式碼能否被合併) 52.1%(Xhigh)、46.2%(Max) 54.4%
GDPval-AA v2.1(知識工作) 1844 1846
OSWorld 2.1(電腦操作) 80.1% 81.8%

兩點讀法。一,Opus 5.5 發布頁註明,未特別標示的成績是以 adaptive thinking、max effort 跑的;Sonnet 5.5 各列的 effort,官方表只有 FrontierCode 標明,所以這張表不是逐列同 effort 的比較。二,FrontierCode 的 Sonnet 5.5 在 Max 反而低於 Xhigh,官方註腳說,Max 時它較常拆出多個 subagent 跑 code review,在 Cognition 檢視的兩個案例中導致逾時或超出範圍的修改,因而被扣分。

差距確實小,官方還說幾項評測上 Sonnet 5.5 開到 Max effort 時表現與 Opus 5.5 相當。但同一段話後面接著寫:在官方自己與外部測試者的測試中,Opus 5.5 在需要持續判斷的複雜、開放式工作上仍明顯較強。 基準分數差距小,官方文字卻說 Opus 仍較強,這兩件事並存;官方同頁也說,基準分數只呈現模型能力的一個面向。

另有一格要小心解讀:Terminal-Bench 4.0 上 Sonnet 5.5 是 70.6%、Opus 5.5 是 66.4%。但 Opus 那格是 xhigh 的成績,表中沒標明 Sonnet 5.5 的 effort;Opus 5.5 發布頁另註明該項標準誤約 ±2.6 個百分點,且安全機制介入時會改由舊模型完成任務,分數可能被拉低。我不拿這一格說「Sonnet 5.5 贏了」。

比較實用的參考,是官方頁面上創作者 Kevin Ngo 的一句話:由 Opus 5.5 定下遊戲的架構,他會放心讓 Sonnet 5.5 去實作。這是官方選登的客戶說法,不是實驗結果,但和「Opus 規劃、Sonnet 執行」的分工方向一致。Opus 5.5 的價格與用量上限見〈Opus 5.5 vs GPT-6 Sol/Luna 怎麼選〉。

至於「出錯代價高就用 Opus」,官方並沒有這樣說;同一頁選登的 Box 引言,反而說 Sonnet 5.5 會讓金融與醫療客戶有信心用在最敏感的工作。這是對未來使用的期待,不是已驗證的結果。這類任務建議用自己的驗收流程,把兩個模型各跑一遍再決定。

四、成本怎麼算:單價一半,不等於帳單一半

牌價上,Sonnet 5.5 的輸入、輸出與快取寫入都是 Opus 5.5 的一半,但快取讀取兩者相同,都是每百萬 token 0.20 美元。Opus 5.5 發布頁說,快取讀取占了 agent 與編程工作成本的大宗。

假設情境(數字是我設的,非官方資料):一次任務有 100 萬 token 快取讀取、20 萬輸入、5 萬輸出。

  • Sonnet 5.5:0.20+0.40+0.50=1.10 美元。
  • Opus 5.5:0.20+0.80+1.00=2.00 美元。Sonnet 約是 Opus 的 55%。

如果快取讀取變成 1,000 萬 token,其他不變:Sonnet 5.5 是 2.90 美元,Opus 5.5 是 3.80 美元,Sonnet 約是 Opus 的 76%。快取讀取占比越高,半價的優勢就越被稀釋。

還有一層:每個任務用掉多少 token,會隨 effort 而變。官方自己說,Sonnet 5.5 在較低的 effort 單任務成本較低、最適合搭配 Opus 5.5;到了較高的 effort,兩者表現可以相近,成本也會相近。所以「用便宜的那個」不是固定答案。建議挑幾個你自己的真實任務,兩個模型各跑一遍,記下 token 用量、花費與人工修正次數再決定。

速度也要小心讀。官方的「快 30% 以上」是拿各自的上一代比,沒有 Sonnet 5.5 對 Opus 5.5 的數字;官方頁面只列出 Opus 5.5 有最高約 2.5 倍速的 Fast 模式(輸入 8 美元、輸出 40 美元),未見 Sonnet 5.5 的對應選項。訂閱用戶也一樣:官方只說用量取決於對話長度、所選模型與所用功能,沒有公布 Sonnet 與 Opus 的用量差,所以我不寫「用 Sonnet 比較省額度」。

五、這篇的限制

  1. 多數數字是 Anthropic 自己的測試與選登說法。 官方註腳明載由第三方 Artificial Analysis 執行的是 GDPval-AA 與 AA-Briefcase,但跑的是官方註明有 bug 的預先發布版本(官方預期影響若有也很小,且會低估 Sonnet 5.5),並由官方頁面挑選呈現;Sonnet 5.5 與 Opus 5.5 發布當天,我沒有看到在正式版上對兩者做的獨立頭對頭實測。
  2. 同家族比較相對乾淨,但不等於公平。 兩者列在同一張表上,但 effort 設定不同(見第三節),單任務成本也不同。
  3. 官方表上也有 GPT-6 Sol 一欄,但那是 Anthropic 自己整理的,部分項目因 OpenAI 沒公開成績而改列上一代。本篇不做跨家結論。
  4. 選型表是我依官方數字與定位整理的建議,不是實驗結論。

收尾

Sonnet 5.5 讓日常工作的預設答案更明確:同樣的錢,更快、更省 token,官方表上多項基準已貼近 Opus 5.5。需要 Opus 5.5 的,是複雜、開放、要靠持續判斷的工作。

如果只記一條:先用 Sonnet 5.5,卡住了再升 Opus 5.5,升之前先確認是不是 effort 開太低。


資料來源與查核說明:本文所有價格、速度、成本、基準分數與可用性,逐句對照 Anthropic 官方頁面原文:Sonnet 5.5 發布頁(anthropic.com/claude-sonnet-5-5)、Claude Sonnet 產品頁、牌價頁(anthropic.com/pricing)、Opus 5.5 發布頁(anthropic.com/claude-opus-5-5)與 Sonnet 5 發布頁(含 2026 年 8 月 10 日的價格更正註記),查核日期均為 2026 年 9 月 29 日。文中標示「官方」的皆為 Anthropic 頁面的說法,其中部分基準由第三方執行、由官方引用,文中已個別標明。第四節的成本算式為本文自設的假設情境,非官方資料。方案內容與定價可能持續調整,實際請以官方頁面為準。

常見問題

Claude Sonnet 5.5 多少錢?跟 Sonnet 5、Opus 5.5 比呢?

以每百萬 token 計,Sonnet 5.5 是輸入 2 美元、輸出 10 美元、快取讀取 0.20 美元、快取寫入 2.50 美元,官方明講與 Sonnet 5 同價(Sonnet 5 的 2 美元/10 美元優惠價已在 8 月 10 日改為永久,原訂 9 月 1 日調回 3 美元/15 美元的調整不會發生)。Opus 5.5 是輸入 4 美元、輸出 20 美元、快取讀取 0.20 美元、快取寫入 5 美元。也就是輸入、輸出與快取寫入都是一半,快取讀取則相同。另外有批次處理省 50%,以及僅限美國境內推論加價 1.1 倍的選項。

Sonnet 5.5 比 Opus 5.5 快嗎?

目前官方沒有給出這個比較。Anthropic 的說法是:Sonnet 5.5 輸出速度比 Sonnet 5 快 30% 以上,Opus 5.5 比 Opus 5 快 30% 以上,兩個「30% 以上」的比較對象都是各自的上一代,不能拿來排 Sonnet 5.5 與 Opus 5.5 誰快。另外官方頁面只列出 Opus 5.5 有最高約 2.5 倍速的 Fast 模式(輸入 8 美元、輸出 40 美元),未見 Sonnet 5.5 的對應選項。

從 Sonnet 5 升級到 Sonnet 5.5,要注意什麼?

一項要改設定、一項要知道的限制,另外兩項需要留意。要改的:如果你原本用「關閉思考」的設定,官方要求先改成新的 between_tools 設定才能升級。要知道的:官方說較高風險的網路安全任務會明確回退到 Sonnet 5 處理,一般的找 bug、修 bug 不受影響。需要留意的:API 代號為 claude-sonnet-5-5;官方說在 Claude Code 與 Claude 應用程式裡預設 effort 是 Medium,Claude Platform 則是 High,比較成本前先確認兩邊 effort 一致。

什麼情況還是該用 Opus 5.5?

Anthropic 自己的說法是:在它自己與外部測試者的測試中,Opus 5.5 在需要持續判斷的複雜、開放式工作上仍明顯較強。實務上可以理解成兩類(這是依官方定位的推論):跨檔案的大型重構與程式碼審計,以及長時間自主執行的 agent。其餘定義清楚的日常工作,先用 Sonnet 5.5 起手,遇到卡關再切到 Opus 5.5。官方沒有說「出錯代價高就一定要用 Opus」,這類工作建議用自己的驗收流程把兩個模型各跑一遍再決定。

📚 收進你的工具

For AI Reading Era

把這篇文章交給你日常用的工具——做研究、整理筆記,或當 AI 的 context。

 
延伸閱讀