aire.
·7 分鐘

Claude Sonnet 5 深度評測:什麼時候該用 Opus 4.8,什麼時候它就夠了

6 月 30 日,Sonnet 5 上線,同時成為免費與 Pro 方案的預設模型,多數人是在沒收到通知的情況下換過去的。這篇把它跟 Sonnet 4.6、Opus 4.8 的效能與價格攤在同一張表上,講清楚三件事:它強在哪、它的價格有一條容易被忽略的伏筆,以及什麼情況你才真的需要升上 Opus。

收進
本文涉及工具

先講結論

如果你只想要一句話:多數情況下 Sonnet 5 已經夠用,真正需要升上 Opus 4.8 的是「難的軟體工程」和「長時間無人看管的自主任務」這兩類。

如果你想要一張表:

你的情況 建議
一般問答、寫作、資料整理 Sonnet 5,而且你多半已經在用了
日常寫程式、改 bug、跑測試 Sonnet 5
大型重構、跨檔案的難題 Opus 4.8
讓 agent 自己跑一整晚 Opus 4.8
成本敏感、量大 Sonnet 5,並且先調 effort 再考慮換模型

更新(2026-07-24): 這篇寫於 Opus 5 上線之前。7 月 24 日 Anthropic 發佈 Claude Opus 5,API 代號 claude-opus-5,每百萬 token 輸入 5 美元、輸出 25 美元,與 Opus 4.8 同價,並成為 Claude Max 的新預設模型、Pro 方案上最強的可選模型。所以下面凡是講「什麼時候該升上 Opus 4.8」的段落,今天同樣的錢應該升到 Opus 5,官方稱它已接近 Fable 5 的前沿智慧。文中 Opus 4.8 的評測數字仍然有效,但請當成上一代的基準。Sonnet 5 仍是免費與 Pro 方案的預設模型,這一點沒有變。

下面是這張表背後的依據,以及一條我認為多數評測沒講清楚的價格伏筆。

一、你可能已經換過去了,只是沒收到通知

6 月 30 日,Anthropic 上線 Claude Sonnet 5,API 代號 claude-sonnet-5。同一天它成為免費與 Pro 方案的預設模型,Max、Team、Enterprise 也都能用。

這件事的體感很特別。過去換模型是一個動作:你要去下拉選單挑。這次不是,多數人是某天打開對話框,背後跑的東西已經換了,介面沒有任何提示。Anthropic 給它的定位是「至今最具代理性的 Sonnet」,意思是它被優化的方向不是聊天答得漂亮,而是拿著工具把事情做完。

這也解釋了為什麼它的分數長成後面那個樣子:進步最大的幾格,全都跟「會不會用工具」有關。

二、數字攤開來看

以下是 Anthropic 在發表時公布的評測結果。我用三份彼此獨立的第三方整理交叉比對過,Sonnet 5 與 Sonnet 4.6 這兩欄的每一個數字,三份來源完全一致。

評測項目 Sonnet 4.6 Sonnet 5 Opus 4.8
SWE-bench Pro(軟體工程) 58.1% 63.2% 69.2%
Terminal-Bench 2.1(終端機操作) 67.0% 80.4% 見下方說明
OSWorld-Verified(電腦操作) 78.5% 81.2% 見下方說明
Humanity's Last Exam(可用工具) 46.8% 57.4% 57.9%
Humanity's Last Exam(不可用工具) 34.6% 43.2%
GDPval-AA v2(知識工作,Elo) 1618 1615

先看 Sonnet 4.6 到 Sonnet 5 這一段。Terminal-Bench 2.1 從 67.0% 跳到 80.4%,13 個百分點,是整組數字裡幅度最大的一格。Humanity's Last Exam 在可用工具的條件下從 46.8% 到 57.4%,也超過 10 個百分點。而在不可用工具的條件下,同一份考題只從 34.6% 到 43.2%。

同一個模型、同一份考題,給不給工具的差距是 14 個百分點。這個對照很能說明它這一代被投資在哪裡:不是變得更博學,是變得更會查、更會動手。

再看 Sonnet 5 對 Opus 4.8。純軟體工程的 SWE-bench Pro 上,Opus 4.8 的 69.2% 仍然明顯領先,6 個百分點不是可以忽略的差距。但在 Humanity's Last Exam 的工具組,兩者是 57.4% 對 57.9%,實質上打平。

三、有一格是 Sonnet 第一次贏

GDPval-AA v2 是偏「知識工作」的基準,用 Elo 分數呈現。Sonnet 5 是 1618,Opus 4.8 是 1615。

分差小到不該拿來說誰比較強,3 分的 Elo 差距在統計上幾乎沒有意義。但它的象徵性值得記一筆:這是 Sonnet 等級的模型第一次在基準上超過同期的 Opus 旗艦。過去 Anthropic 的三階分工很乾淨,Haiku 快、Sonnet 均衡、Opus 最強,價格由低到高排一條直線。現在這條線在某一段上交叉了。

對使用者而言,這代表「Opus 一定比較好」不再是可以直接套用的預設。它在某些任務上依然明顯較強,但你得先知道自己的任務落在哪一類。

四、有兩格我沒對上,所以我不填

Terminal-Bench 2.1 和 OSWorld-Verified 這兩項,Opus 4.8 的分數我沒能對到官方原始表格。

我查到的三份第三方整理彼此不一致:Terminal-Bench 上 Opus 4.8 有寫 74.6% 的、有寫約 79% 的,也有整理推算出 Sonnet 5 在這項落後的;OSWorld 則有 81.7% 和 83.4% 兩個版本。Sonnet 5 自己的 80.4% 與 81.2% 三份來源都一樣,有問題的只有 Opus 4.8 那一欄。

三份來源給出三個不同答案,代表其中至少兩份是錯的,我沒有辦法判斷哪一份對。所以這兩格我留白,不用「大約」或「據報導」把它糊過去。

如果你的決策剛好卡在這兩項上,建議直接去看 Anthropic 官方的模型發表頁與系統卡,不要採信任何二手整理(包括這一篇)。

五、價格看起來沒漲,但帳單可能會

這是我認為最容易被跳過的一段。

先講明面上的價格,以每百萬 token 計:

模型 輸入 輸出
Sonnet 5(導入價,至 8/31) 2 美元 10 美元
Sonnet 5(標準價) 3 美元 15 美元
Sonnet 4.6 3 美元 15 美元
Opus 4.8 5 美元 25 美元

導入價到 2026 年 8 月 31 日為止,之後回到 3 美元/15 美元 —— 跟 Sonnet 4.6 完全相同。單看這張表,結論會是「效能大幅提升,價格不變」。

但 Sonnet 5 換了新的 tokenizer。官方說明寫得很清楚:同一段輸入會對應到大約 1.0 至 1.35 倍的 token,實際倍率依內容型態而定。

把兩件事疊起來看:每個 token 的價錢一樣,但同一份文件會被切成更多 token。所以 8 月 31 日之後,同樣的工作量,帳單有機會比 Sonnet 4.6 時期高,而你在價目表上看不到這件事。這也意味著 100 萬 token 的脈絡長度,實際能裝進去的文字量比舊模型少一些。

如果你有在跑量,這裡有兩個具體建議。第一,不要沿用舊模型量到的 token 數推估成本,用 count_tokens 對自己最常用的那幾份提示詞,新舊模型各測一次再比。第二,如果你的 max_tokens 是照 Sonnet 4.6 的輸出長度調過的,回去確認一下。同樣的回答內容在新 tokenizer 下會佔更多 token,原本剛好夠的上限現在可能會把回答砍掉一半。

六、比「選哪個模型」更該先動的旋鈕

effort 這個參數控制模型願意花多少力氣思考,可以設 low、medium、high、xhigh、max。在 Claude API 與 Claude Code 上,Sonnet 5 的預設值是 high。

我想強調的是:這個旋鈕對成本與速度的影響,常常大過換模型。同一個模型從 low 轉到 max,token 用量與等待時間的差距相當可觀,而不同 effort 下的表現曲線也不是同一條。有第三方分析指出,Sonnet 5 在 xhigh 設定下可以達到接近 Opus 4.8 的準確度,而每個任務的 token 成本大約只有三分之一。這是單一來源的觀察,數字我沒有第二份佐證,但方向值得參考。

實務上的順序建議是這樣:先固定模型,把 effort 從 medium、high、xhigh 各掃一輪,用自己的實際任務評估;確定調到頂還是不夠,再考慮換模型。反過來先換模型再調參數,很容易多付錢卻沒解決問題。

順帶一提,「一律開 max 最保險」不成立。較高的 effort 在簡單任務上會出現想太多的狀況,反而拖慢速度、增加成本,結果不見得更好。

七、什麼情況該升 Opus 4.8

把上面的數字翻譯成判斷。

該用 Opus 4.8 的情況。 難的軟體工程,也就是跨多個檔案的重構、需要理解整個專案脈絡才能動的改動。SWE-bench Pro 那 6 個百分點的差距,主要就反映在這類任務上。長時間無人看管的自主作業也算,任務跑得越久,每一步的小失誤越會往後累積。還有一類是失敗代價高的場景:改到正式環境、動到金流、處理無法回復的資料,這時候多付的錢是買保險。

Sonnet 5 就夠的情況。 一般的寫程式與除錯、資料整理與分析、寫作與翻譯、大部分的日常問答。量大而單筆價值低的任務也是,這種情境下成本結構比單次品質重要。以及所有「你會在旁邊看著、隨時可以叫停」的互動式工作。

兩個都不用先想的情況。 如果你是一般使用者、沒在寫程式,那你其實不需要做這個決定 —— 打開 Claude 就是 Sonnet 5。真的遇到它處理不好的難題,再手動切到 Opus 試一次就好。

八、如果你不寫程式,這件事的意義是什麼

這一代的進步集中在「動手」而不是「知道」,而這件事對一般使用者的意義,比分數本身大得多。

前面那組對照講得很直白:同一份考題,給工具比不給工具高出 14 個百分點。這意味著你使用 AI 的方式,回報率最高的改變可能不是把提示詞寫得更精巧,而是把資料、檔案、工具接到它手上。同一個問題,你貼一段文字問它,跟你把整份檔案給它、讓它自己去查去算,得到的東西已經不是同一個等級。

這也跟我們先前談過的觀察對得上:模型之間的差異,越來越不是「誰比較聰明」,而是「誰比較會用手邊的東西」。相關的討論可以參考〈換個語言,AI 就換了個性〉裡對模型性格差異的拆解,以及〈GPT-5.6 是什麼〉裡 OpenAI 那邊的三檔分工。兩家的產品線正在收斂到很像的形狀。

收尾

Sonnet 5 這一代最值得記的三件事:它在終端機與工具操作上跳了一大步,它在知識工作的基準上第一次追平了同期的 Opus,而它的價格有一條寫在 tokenizer 裡、不會出現在價目表上的伏筆。

至於怎麼選,我的建議還是那句:先確認你的任務屬於哪一類,再去看要不要多付那筆錢。多數人會發現自己根本沒走到需要 Opus 的那一格。


資料來源與查核說明:本文的效能數字出自 Anthropic 於 2026 年 6 月 30 日發表 Sonnet 5 時公布的評測結果,我以三份彼此獨立的第三方整理交叉比對,Sonnet 5 與 Sonnet 4.6 兩欄三份完全一致才採用。Opus 4.8 在 Terminal-Bench 2.1 與 OSWorld-Verified 兩項因來源互相矛盾,已於文中留白說明。定價與脈絡長度以 Anthropic 官方文件為準,查核日期 2026 年 7 月 20 日;導入價的適用期限與 tokenizer 的說明同樣出自官方文件。effort 於 xhigh 下的成本比較為單一第三方分析,文中已標註。方案內容與價格變動快,實際請以 Anthropic 官網為準。

常見問題

Claude Sonnet 5 是什麼?跟 Sonnet 4.6 差在哪?

Sonnet 5 是 Anthropic 於 2026 年 6 月 30 日推出的 Sonnet 世代新模型,API 代號 claude-sonnet-5,上線同時成為免費與 Pro 方案的預設模型。相對 Sonnet 4.6,官方公布的分數在幾個代理型任務上有明顯拉升:SWE-bench Pro 從 58.1% 到 63.2%,Terminal-Bench 2.1 從 67.0% 到 80.4%,Humanity's Last Exam(可用工具)從 46.8% 到 57.4%。它同樣是 100 萬 token 的脈絡長度、最多 12.8 萬 token 輸出。

Sonnet 5 跟 Opus 4.8 該怎麼選?

看任務型態。純軟體工程的難題上 Opus 4.8 仍領先,SWE-bench Pro 是 69.2% 對 63.2%,差距 6 個百分點。但在偏知識工作的 GDPval-AA v2 上,Sonnet 5 以 1618 對 1615 些微勝出,這是 Sonnet 等級的模型第一次在基準上超過同期的 Opus 旗艦。實務上的判準是:任務失敗的代價高、需要長時間自主連續作業的,用 Opus;其餘大多數情況 Sonnet 5 已經夠用,而且便宜。要補充的是,2026 年 7 月 24 日 Anthropic 發佈了 Claude Opus 5,每百萬 token 價格與 Opus 4.8 相同(輸入 5 美元、輸出 25 美元),並成為 Claude Max 的預設模型、Pro 方案上最強的可選模型。所以今天要「升上 Opus」,同樣的錢應該升到 Opus 5,本文的 Opus 4.8 數字請當成上一代的基準看。

Claude Sonnet 5 多少錢?

API 以每百萬 token 計價。導入價是輸入 2 美元、輸出 10 美元,適用到 2026 年 8 月 31 日;之後回到標準價輸入 3 美元、輸出 15 美元。標準價與 Sonnet 4.6 相同。Opus 4.8 則是輸入 5 美元、輸出 25 美元(2026 年 7 月 24 日上線的 Opus 5 同為 5 美元/25 美元)。一般使用者不需要另外付費,Sonnet 5 是免費與 Pro 方案的預設模型;Claude Max 的預設模型自 7 月 24 日起換成了 Opus 5。

為什麼有人說 Sonnet 5 帳單會變貴,價格不是沒漲嗎?

單價確實沒漲,8 月 31 日之後回到跟 Sonnet 4.6 一樣的 3 美元/15 美元。但 Sonnet 5 換了新的 tokenizer,官方說明同一段文字會對應到大約 1.0 至 1.35 倍的 token,實際倍率依內容型態而定。也就是說每個 token 的價錢一樣,但同一份文件會用掉更多 token。要估算成本,建議用 count_tokens 對自己的實際提示詞各測一次新舊模型再比較,不要沿用舊模型量到的數字。

effort 參數是什麼?跟選模型比哪個重要?

effort 是控制模型思考深度與 token 花費的參數,可設 low、medium、high、xhigh、max。在 Claude API 與 Claude Code 上,Sonnet 5 的預設值是 high。對成本與延遲來說,這個旋鈕的影響常常大過「選 Sonnet 還是 Opus」:同一個模型從 low 調到 max,token 用量與回應時間的差距相當可觀。建議先固定模型、掃一輪 effort,再決定要不要換模型。

📚 收進你的工具

For AI Reading Era

把這篇文章交給你日常用的工具——做研究、整理筆記,或當 AI 的 context。

 
延伸閱讀