aire.
·12 分鐘

同樣的價錢,更少的「不能回答」:Claude Opus 5 上線,分數之外,這次改的是誰會被擋下來

7 月 24 日 Anthropic 發佈 Claude Opus 5,價格和上一代一模一樣,同時成了 Claude Max 的新預設模型。多數報導會停在那張分數表,但這次公告裡真正新的東西在後半段:網路安全類的攔截預期比 Fable 5 少約 85%,被擋下的請求從「拒絕」改成「換一個模型接手」。這篇拆三件事:分數該怎麼讀、你的預設模型又被換了一次、以及那道閘門這次是往哪個方向動的。

收進
本文涉及工具

先講結論

7 月 24 日,Anthropic 發佈 Claude Opus 5。如果你只想知道跟你有什麼關係:

  • 價格沒動。每百萬 token 輸入 5 美元、輸出 25 美元,跟 Opus 4.8 一模一樣。
  • 你的預設模型換人了。Opus 5 是 Claude Max 的新預設模型;在 Pro 方案上,它是你能選的最強模型。
  • 官方主動把它擺到 Fable 5 旁邊比。公告開頭就寫著,它「以一半的價格接近 Claude Fable 5 的前沿智慧」。Fable 5 的牌價是輸入 10 美元、輸出 50 美元,這句話字面上成立。同一份公告也用 Opus 4.8 當前代基準講代際進步,兩個對照組都在。
  • 它不是 Anthropic 最強的模型。生物研究與攻擊型網路安全這兩塊,公告明說仍落後 Mythos 5;而 Mythos 5 的開放範圍,依本站六月那篇的整理,仍限於核准的組織。
  • 這次真正新的東西不在分數,在它比較少拒絕你

前四點各家報導都會寫。這篇想多花一點篇幅在第五點,因為那是公告後半段的內容,通常沒什麼人讀完。

分數那一段:成本被寫進了同一句話裡

先把數字擺出來。以下全部是 Anthropic 自己公布的:

  • Frontier-Bench v0.1:超過所有其他模型,並以更低的每任務成本,把 Opus 4.8 的表現拉高到兩倍以上。
  • CursorBench 3.2:在最高 effort 檔位,落在 Fable 5 最佳分數的 0.5% 以內,每個任務的成本約一半。
  • ARC-AGI 3(解陌生新問題的評測):分數是次高模型的三倍。
  • Zapier AutomationBench(從頭到尾完成商務任務):在相同的每任務成本下,通過率約為次高模型的 1.5 倍;官方並稱,即使切到最低 effort 檔位,它通過的任務仍多於任何其他模型。
  • OSWorld 2.0(電腦操作):以略高於三分之一的成本,超過 Fable 5 的最佳成績。
  • 生命科學方面,相對 Opus 4.8,從光譜資料推斷分子結構的有機化學任務高 10.2 個百分點,預測蛋白質序列變異如何影響功能的任務高 7.7 個百分點,兩項都是內部評測。

讀完這串你會發現一件事:軟體工程與代理任務那幾項,成本都被寫進了同一句話裡。「更低的每任務成本」「一半的成本」「相同的每任務成本」「三分之一的成本」,這是這份公告談那幾項時的語法。不是每一項都這樣講,ARC-AGI 3 和兩項生命科學就是單純的成績比較。

這不是文案巧合。公告說明這一節的圖表是按 effort 檔位呈現表現變化,官方也直接說了,客戶可以用這個旋鈕在「要更聰明」和「要更省」之間選位置。不過別誤讀:公告並沒有放棄「最強」這個說法,它同時寫著 Opus 5 在 Frontier-Bench 與 GDPval-AA 上是新的 state-of-the-art。變的是「最強」旁邊多了一欄成本。這件事我們在〈一張做得很好的評比圖,和我還是得自己跑一次的理由〉裡從讀者這一側談過,這次的公告就是照這個框架寫的。

一條藏在註腳裡的話

公告最底下有一段 Frontier-Bench 的方法註腳,應該單獨拿出來看。它說明那張圖是內部跑的、用 mini-SWE-agent 這套 harness、跑在 GKE 上、每題五次取平均獎勵,然後補了一句:

Opus 4.8 在 Opus 5 與 Fable 5 被安全分類器拒絕時,作為 fallback 使用。

意思是,跑分的時候如果請求被安全分類器擋下來,由 Opus 4.8 接手完成。也就是說,那條曲線是在含退回機制的設定下跑出來的。至於這種情況發生的比例多高、fallback 的回覆又怎麼計分,公告沒有說。

註腳寫明這個設定對 Opus 5 和 Fable 5 兩邊都套用;其他家的模型在同一份測試裡是什麼設定,這份公告裡找不到,這一格是空的。這條註腳不能拿來當成「分數灌水」的證據,它比較像一個提醒:跑分的設定裡可以放進這種東西,而它不會出現在那張圖上。這跟我們在〈AI 給的分數為什麼總是偏高〉裡談的是同一類問題的不同面向。

而且這句註腳其實提前劇透了公告後半段的主題。fallback 在這裡是測試設定,在後面會變成產品功能。

你的預設模型,又被換過一次

6 月 30 日 Sonnet 5 上線那天,它同時成了免費與 Pro 方案的預設模型(依 Anthropic 當時的公告),這件事我們寫在〈Claude Sonnet 5 深度評測〉裡。7 月 24 日,同樣的事情在 Max 方案上再發生一次:Max 的預設模型換成了 Opus 5。公告沒有說明它取代的是哪一個。

這次的換人多半是往好的方向,價格沒漲、能力上去了。但真正該留意的是這個節奏本身:不到一個月,Claude 的預設模型在不同方案上換了兩次。如果你有任何依賴模型行為穩定性的流程,例如固定格式的輸出、調校過的提示詞、跑批次的腳本,那麼「我的預設模型是誰」不是一個可以放著不管的問題。

這也是我們在〈你叫的名字,和你拿到的東西〉裡談過的同一件事的另一面。那篇講的是同一個模型名字底下可能裝著不同的東西,這裡則是同一個入口底下的模型在換。應對方式只有一個:在 API 上指名版本,在應用裡確認當前用的是誰,不要把「我上次測的結果」當成現在仍然成立的事實。

真正的新聞,在安全那一段

接下來是這次公告我認為最值得讀的部分。

從六月到現在,我們追過兩篇文章:〈最強的那批模型,開始「不給你用」了〉講的是六月那場出口管制風波,最強的那一檔被政府和廠商同時管起來;〈閘門沒拆,只是換了收費員〉講的是七月風波落幕之後,臨時管制退場、分層卻留下來,長成了產品設計。

照這條線讀下來,Opus 5 是第三章,而且是我們寫到現在第一次看到往回鬆的一格。這是本站的讀法,公告本身沒有這樣定位自己,它只說 Opus 5 的網路安全分類器比 Fable 5 寬鬆。公告裡有三個具體動作:

第一,網路安全類的分類器放寬。 Opus 5 允許在原始碼裡尋找漏洞,但仍然阻擋二進位檔的漏洞掃描、滲透測試,以及攻擊程式生成。在這個設定下,官方預期分類器介入的頻率會比 Fable 5 少約 85%。請注意這是預期值,不是實測結果,範圍也限定在網路安全類任務。

第二,被擋下來的處理方式改了。 在 Claude.ai、Claude CodeCowork 上,被標記的請求預設退給 Opus 4.8 接手。同時 API 端推出 beta 的自動 fallback:開啟之後,被 Opus 5 或 Fable 5 的安全分類器標記的請求會自動路由到另一個模型,官方的說法是「預設總是路由到當下最好的可用模型,而不是被擋下」。Fable 5 時代那個「敏感題退回上一代」的設計,這次被做成了一個你可以打開的開關。

第三,生物類請求的路由改向。 原本在 Fable 5 上被擋下的生物類請求,現在改路由到 Opus 5,而不是 Opus 4.8。因為 Opus 5 的生物防護配置和 Opus 4.8 相近,官方於是說它是目前「一般可用的模型中最有科研能力的一個」。

另外還有一件對企業使用者有意義的小事:Opus 5 在一般使用上沒有資料保留要求,這一點和先前的 Opus 模型一致。相較之下,Fable 5 上線時是 30 天保留,這對某些公司來說是能不能用的分水嶺。

為什麼敢放寬:找得到,不代表做得出來

放寬安全設定通常需要一個理由,這次公告給的理由很具體,而且我認為是整篇最有資訊量的一段。

Anthropic 說,他們刻意沒有拿網路安全任務去訓練 Opus 5,但模型因為整體變強,這方面的能力還是跟著提升了。結果是:在「找出軟體漏洞」這件事上,Opus 5 已經接近 Mythos 5;但在「把漏洞變成可用的攻擊程式」這件事上,它還遠遠落後。他們用一套叫 OSS-Fuzz 的評測來說明這件事,兩個模型辨識漏洞的成功率相近,開發攻擊程式的分數則差距很大。

這條分界線我覺得該記下來。過去談模型的危險程度,常常是一句籠統的「它會不會駭進系統」。這裡把它拆成了兩段能力:發現與利用。而這次的安全設定,看起來就架在這道裂縫上。要說清楚的是,公告把這道能力落差和分類器的設定寫在同一節,但沒有說前者就是後者的理由。那層因果是我讀出來的。

如果這個讀法成立,門往這個方向動就不必解釋成他們對風險的判斷變寬鬆了,而是這個模型剛好落在一個他們願意放行的區間。但這是推論,公告沒有這樣寫。

最強的那個,還是不給你

所以分層並沒有消失。公告本文就寫著,Opus 5 在生物研究與攻擊型網路安全上仍落後 Mythos 5;Mythos 5 的開放範圍不在這份公告裡,依本站六月那篇的整理,它仍限於核准的組織。另外,已經加入 Cyber Verification Program 的企業與研究者,可以拿到一個安全限制更少的 Opus 5 版本。

把三層排開來看會更清楚:一般人拿到的是放寬過的 Opus 5,通過驗證的組織拿到限制更少的版本,最強的那一檔繼續留在名單裡。七月那篇說的「分層長成了產品設計」,這次又長出了一格。差別只在於,這一格的方向是把門開大一點,而不是關小一點。

Opus 5 的定位在公告裡講得很白:它是設計來每天用的那一個,是 Max 的預設、Pro 上最強的選擇。Anthropic 沒有把最強的東西給你,他們給你的是最常會被你用到的那個。 從商業角度這完全合理,只是我們得意識到,這句話已經是這個產業的常態語法了。

公告裡我最喜歡的一段

撇開數字不談,公告中間有三個實際案例,其中一個我看了兩次。

在一項 Frontier-Bench 的題目裡,模型拿到一張機械零件的工程圖,要寫程式把它重建成 FreeCAD 的 3D 模型。但這題故意不給模型任何可以「看」圖的方法。Opus 5 的做法是自己寫了一套電腦視覺流程,從原始像素裡把幾何資訊抽出來,再重建整個零件。官方說它反覆做到了這件事,而在相同的設定下,其他模型試五次都沒有解出來。

另外兩個是同一種味道。拿到一個開源套件管理器的真實 bug,它找出根因,還補上了社群的修補漏掉的一個邊界情況;一位交易公司的工程師用它在單次工作階段內接好了一個新交易所的行情資料流,因為找不到可以對照的即時資料,它自己搭了一套測試框架來驗證解析是否正確。

三個故事的共通點都在同一件事上:它會自己想辦法驗證。這也是這次公告在 22 則客戶證言裡反覆被講到的特質,有人說它交接 PR 前會先確認分支、檢查模板,也有人說它在一次架構討論裡反對了工程師提出的設計,對方堅持之後它沒有跟著讓步,而是把反對範圍縮到單一問題上、再提出一個折衷做法。

當然,這三個例子是 Anthropic 自己挑出來寫進公告的。這就接到下一段。

這些數字該打幾折

我得把話說完整。上面所有的分數,來源都是 Anthropic 自己,包括那六項評測和兩項內部生命科學測試。

公告裡另外附了 22 則客戶證言,數字都很漂亮:Zapier 說 Opus 5 拿下他們 AutomationBench 榜首、先前模型無法通過的任務它拿到 100%;Box 說整體優於 Opus 4.8 8%,資料分析與盡職調查兩類工作分別高 11% 與 17%;一家法律 AI 公司說它在較低的推理檔位就能維持相近品質,相較 Opus 4.8 的最高推理檔位平均少用 26% 的 token;一家金融公司說跨檔位平均高 9 個百分點的準確度、少三分之一的回合與工具呼叫、少 60% 的時間。

這些數字有它的價值,因為它們來自各家自己的內部評測、而不是公版跑分,比較貼近實際工作。但它們也全部來自 early access 客戶,也就是拿到早期權限、被選進發佈公告的那一群。沒有人會在發佈當天放上一則說「跟上一代差不多」的證言。 讀的時候要記得這層選擇效果。

至於安全那一段,「我們目前最對齊的模型」這個說法,依據是 Anthropic 自己的自動化行為稽核,整體失準行為得分 2.3,官方稱是近期模型中最低的。這個量表怎麼構成、上限在哪,官方沒有交代,所以它比較像一個內部相對值,不太適合當成跨廠商的比較基準。

那你現在該做什麼

分三種人講:

訂閱用戶(Pro/Max)。 Max 的預設已經是它,你不換也會用到;Pro 上它是你能選的最強選項,要自己切過去。公告沒有交代各方案的額度與用量費用怎麼算,那部分以方案頁為準。如果你有調校過的提示詞或固定輸出格式,值得重跑一次你的常用任務,確認行為沒有跑掉。

開發者。 API 代號是 claude-opus-5,每 token 牌價和 Opus 4.8 相同,所以換過去單價不會變貴。總成本還要看 token 用量與 effort 檔位,換了自己量一次比較保險。這次同時有兩個 beta 值得看:對話中途更換工具而不作廢 prompt cache(長對話的 agent 會直接受益),以及前面提到的自動 fallback。另外,如果你在意速度,Fast 模式約為預設的 2.5 倍速,價格是兩倍。

還在用 Fable 5 的人。 這是最需要重新算一次的一群。逐 token 牌價上 Fable 5 是 Opus 5 的兩倍,而「已經接近」這句話是官方自己說的、不是第三方測出來的。合理的做法是先拿 Opus 5 跑一次你自己的任務、跟 Fable 5 比一次品質差距,再決定那一倍價差值不值得。至於 effort 檔位怎麼調,那是另一個旋鈕,通常比換模型更值得先試一輪。

一句話

這次發佈表面上是一個更划算的模型,實際上有三件事同時發生了:分數旁邊多了一欄成本、你的預設模型在一個月內被換了第二次、以及那道從六月立起來的閘門,照我們追的這條線看,第一次往回鬆了一格。而鬆開的那一格,放行的是「在原始碼裡找漏洞」,也就是它已經接近 Mythos 5 的那一段;仍然擋著的攻擊程式生成,正是它自己說還遠遠落後的那一段。

最強的那個,仍然不在你手上。

本文事實整理自 Anthropic 官方公告〈Introducing Claude Opus 5〉(2026-07-24):發佈日期、API 代號 claude-opus-5、每百萬 token 輸入 5 美元/輸出 25 美元(與 Opus 4.8 相同)、Fast 模式約 2.5 倍速與兩倍價、Claude Max 新預設與 Pro 最強模型定位、Frontier-Bench v0.1/CursorBench 3.2/ARC-AGI 3/Zapier AutomationBench/OSWorld 2.0 等評測敘述與其方法註腳、有機化學 10.2 個百分點與蛋白質序列 7.7 個百分點的內部評測、自動化行為稽核 2.3 分、網路安全分類器放寬與預期少介入約 85%、二進位掃描/滲透測試/攻擊程式生成仍受阻擋、Claude.ai/Claude Code/Cowork 預設退回 Opus 4.8、API 自動 fallback 與對話中途更換工具兩項 beta、生物類請求改路由至 Opus 5、Cyber Verification Program、OSS-Fuzz 上發現與利用的能力落差、一般使用無資料保留要求,公告中三則能力案例(FreeCAD 工程圖重建、開源套件管理器 bug 根因、交易所行情資料流與自建測試框架),以及 22 則 early access 客戶證言中的 Zapier、Box、法律與金融四則數字與兩則行為描述。以下事實不在這份公告裡,另有來源:Fable 5 每百萬 token 輸入 10 美元/輸出 50 美元與 30 天資料保留(Anthropic Fable 產品頁);Sonnet 5 於 2026-06-30 上線並同時成為免費與 Pro 方案預設模型(Anthropic 當時的 Sonnet 5 公告,本站〈Claude Sonnet 5 深度評測〉已整理);Mythos 5 的開放範圍限於核准組織(本站〈最強的那批模型,開始「不給你用」了〉整理)。另外,文中把「發現與利用的能力落差」讀成這次分類器放寬的理由、以及把 Opus 5 定位為本站閘門系列「第一次往回鬆的一格」,都是本站的詮釋,公告本身沒有這樣陳述。所有評測分數與內部稽核分數均由 Anthropic 提供,客戶證言來自其早期使用客戶。方案、價格與安全設定變動快速,實際以 Anthropic 官網最新公告為準。

常見問題

Claude Opus 5 是什麼?跟 Opus 4.8 差在哪?

Opus 5 是 Anthropic 於 2026 年 7 月 24 日推出的 Opus 世代新模型,API 代號 claude-opus-5,在 Claude.ai、Claude Code、Cowork 與 Claude Platform 上同日可用。跟 Opus 4.8 相比,官方公布的差異集中在三處:同樣價格下的任務表現(以 Frontier-Bench v0.1 為例,官方稱在更低的每任務成本下超過 Opus 4.8 兩倍以上)、生命科學類任務(有機化學高 10.2 個百分點、蛋白質序列高 7.7 個百分點,皆為 Anthropic 內部評測),以及安全設定(網路安全類分類器比 Fable 5 寬鬆許多)。

Claude Opus 5 多少錢?我要另外付費嗎?

API 價格是每百萬 token 輸入 5 美元、輸出 25 美元,和 Opus 4.8 相同。另有 Fast 模式,速度約為預設的 2.5 倍,價格為基礎價的兩倍(Claude Platform 計價,Claude Code 則走 usage credits)。訂閱方面,公告只說明 Opus 5 是 Claude Max 的新預設模型、在 Pro 方案上是最強的可選模型,沒有交代各方案的額度與是否另計用量費用,那部分以 Anthropic 方案頁為準。

Opus 5 比 Fable 5 強嗎?該用哪一個?

分開來看。官方說法是 Opus 5 以一半的價格接近 Fable 5 的前沿智慧,並在 CursorBench 3.2 的最高 effort 檔位落在 Fable 5 最佳分數的 0.5% 以內、每任務成本約一半;在 OSWorld 2.0 電腦操作評測上,官方稱它以略高於三分之一的成本超過 Fable 5 的最佳成績。但這些都是 Anthropic 自己的評測,不是第三方測出來的。價格面:Fable 5 牌價為輸入 10 美元、輸出 50 美元,逐 token 算 Opus 5 是它的一半,所以拿 Opus 5 當比較基準是合理的起點。實際總成本還受 token 用量、effort 檔位、快取與方案額度影響,最後仍建議用自己的任務量一次再決定。

「安全分類器少介入 85%」是什麼意思?一般使用者會有感嗎?

這句話的範圍是網路安全類任務,而且是官方的預期值不是實測值。具體是:Opus 5 允許在原始碼裡尋找漏洞,但仍然阻擋二進位檔的漏洞掃描、滲透測試與攻擊程式生成;在這個範圍內,官方預期分類器介入的頻率會比 Fable 5 少約 85%。一般寫作、分析、日常編程的使用者本來就很少踩到這條線,多半不會有感。真正有感的是資安研究與相關工程工作。

被安全分類器擋下來的時候,現在會發生什麼事?

在 Claude.ai、Claude Code 與 Cowork 上,被標記的請求預設會退給 Opus 4.8 接手,而不是直接拒絕。API 這邊同時推出 beta 的自動 fallback:開啟後,被 Opus 5 或 Fable 5 的安全分類器標記的請求會自動路由到另一個模型,而不是被擋下。另外,原本在 Fable 5 上被擋下的生物類請求,現在改路由到 Opus 5,而不是 Opus 4.8。

📚 收進你的工具

For AI Reading Era

把這篇文章交給你日常用的工具——做研究、整理筆記,或當 AI 的 context。

 
延伸閱讀