Claude Haiku 5.5 便宜 90% 只到 10 萬 token,公告的高分是 max effort 量的
Anthropic 10 月 7 日發布 Claude Haiku 5.5,說平均運行成本比 Haiku 4.5 低約 75%。落到單一請求,牌價在 prompt 10 萬 token 以內是 Haiku 4.5 的十分之一,超過只便宜一半;新 tokenizer 讓同一段輸入多算約 30%,本站推算同一段輸入的實付單價約為 Haiku 4.5 的 13%(10 萬內)或 65%(超過),只限輸入端,不是整筆帳單。公告表上 Haiku 5.5 的七項評測,在 system card 裡都是 max effort 量的,API 預設卻是 medium,system card 自己量到的 medium 分數明顯較低。要不要換,先看 prompt 守不守得住 10 萬 token、工作在 medium 上夠不夠用。
Anthropic 10 月 7 日發布 Claude Haiku 5.5,公告正文寫了一句話:平均下來,它的運行成本比 Haiku 4.5 低約 75%。同一份公告的基準表,把 Haiku 5.5 的分數和 Haiku 4.5、GPT-6 Luna、Sonnet 5.5 並排放在一起。
這兩組數字各帶一個前提。價格的前提是 prompt 長度:75% 是一群請求的平均,落到單一請求,10 萬 token 以內的牌價是 Haiku 4.5 的十分之一,超過只便宜一半。
分數的前提是 effort:公告表上 Haiku 5.5 那一欄的七項評測,在 system card 裡都是 max effort 量的。API 預設卻是 medium,而 system card 自己量到的 medium 分數明顯較低。
所以要不要換成 Haiku 5.5,先看兩件事:你的 prompt 守不守得住 10 萬 token,你的工作在預設的 medium 上夠不夠用。得開到 xhigh 或 max 才夠用的工作,要同時拿 Sonnet 5.5 比一次。
事實分級:「官方明寫」是公告、Claude Platform 文件或 system card 的文字;「官方圖內標籤」是 system card 圖上直接印的數字;「讀圖估值」是本站從圖上讀出的大小,只寫「約」與倍數;「本站推算」是用官方數字相除或相乘得到的,會附算式;「本站實測」是本站 10 月 8 日自己跑的小測。
公告的「平均便宜約 75%」,是把三件事合在一起算的平均數
Anthropic 說的約 75%,描述的是一群請求的平均,不是你手上某一筆請求的價差。那句話的句尾掛著腳註 2,腳註列出這個平均包含哪三件事:
Claude Haiku 5.5 is priced 90% lower than Claude Haiku 4.5 for requests up to 100,000 tokens, and 50% lower for requests over 100,000 tokens. On Haiku 4.5, 90% of requests fell into the former category. This calculation also accounts for changes between Haiku 4.5 and Haiku 5.5 in how many tokens are used to complete a given piece of work: Haiku 5.5 has an updated tokenizer (similar to Sonnet 5.5’s and Opus 5.5’s), which means it uses slightly more tokens per task.
三件事照順序是:兩級價格(prompt 在 10 萬 token 以內便宜 90%,超過便宜 50%)、Haiku 4.5 的請求分布(九成請求落在 10 萬 token 以內),以及完成同一件工作所用 token 數的變化(新 tokenizer,每個任務多用一些 token)。腳註沒有寫三件事怎麼合成一個數字,也沒有寫各自的權重。
腳註用的詞是「每個任務多用一些 token」。約 30% 這個數字出自 Claude Platform 文件,量的是同一段輸入文字,和腳註的「每個任務」不是同一個東西。
公告正文另有一句更窄的話:prompt 在 10 萬 token 以內的任務特別划算,這類請求約占 Haiku 4.5 請求的九成。這九成是 Haiku 4.5 過去的請求分布;你的請求落在哪一級,看的是你自己的 prompt 長度。
10 萬 token 這條價格線切的是整筆請求,輸入、輸出和快取一起換級
Haiku 5.5 依 prompt 長度分兩級定價。
價格表(單位:美元/每百萬 token)
| 項目 | Haiku 5.5(prompt 10 萬 token 以內) | Haiku 5.5(超過 10 萬) | Haiku 4.5 | Sonnet 5.5 |
|---|---|---|---|---|
| 輸入 | 0.10 | 0.50 | 1 | 2 |
| 輸出 | 0.50 | 2.50 | 5 | 10 |
| 快取寫入(5 分鐘) | 0.125 | 0.625 | 1.25 | 2.50 |
| 快取寫入(1 小時) | 0.20 | 1 | 2 | 4 |
| 快取讀取 | 0.01 | 0.05 | 0.10 | 0.10 |
表上每一列,超過 10 萬 token 的價格都是 10 萬以內的 5 倍(本站用表上數字相除)。對照 Haiku 4.5,10 萬以內是十分之一,超過是一半,和腳註 2 的 90% 與 50% 一致;這還是牌價,沒有計入 tokenizer。
Sonnet 5.5 的快取讀取價從 10 月 7 日起才是 0.10 美元,原本是 0.20 美元。Batch 也分兩級:10 萬以內輸入 0.05 美元、輸出 0.25 美元,超過則是輸入 0.25 美元、輸出 1.25 美元。官方模型頁頂端寫的是「起價」0.10 美元與 0.50 美元,往下才分兩級列價。
跨過 10 萬時,加價的是整筆請求,不只是超出的那部分。Anthropic 在 system card 說明成本算法的圖說裡這樣寫:
Claude Haiku 5.5 is charged per request at the rate for that request’s prompt length (above or below 100K tokens).
定價頁只寫依 prompt 長度定價,超過 10 萬 token 的 prompt 付較高的價格;「整筆」的明文在 system card 這段圖說。價目表上連輸出與快取讀寫都分兩級,也和整筆套用同一級的讀法一致。所以多出幾個 token 把 prompt 推過線,這筆請求的輸入、輸出和快取費率會一起跳級。
快取讀到的 token 算不算進那 10 萬,在定價頁、模型頁、公告與 prompt caching 文件裡,官方都沒有明寫。prompt caching 文件把快取讀取、快取寫入和未快取的輸入 token 加總成「總輸入 token」,但沒有說 Haiku 5.5 的 10 萬級距看的是不是這個總數。Anthropic 在同一天調降 Sonnet 5.5 快取讀取價時說,快取讀取在模型的 token 用量裡占很大一部分。所以官方沒寫的這一點,會直接影響大量用快取的 agent 工作怎麼估價。
視窗和價格線是兩回事。Haiku 5.5 的 context window 是 1M token、輸出上限 128K(Haiku 4.5 分別是 200K 和 64K)。定價頁另外寫,Claude 4.6 以後的模型整個 1M 視窗都用標準價,900K 與 9K 的請求每 token 同價;Haiku 5.5 是這條規則的例外。
新 tokenizer 讓同一段輸入多算約 30%,prompt 比看起來更早跨過 10 萬線
十分之一的牌價,是用新 tokenizer 的 token 算的;同一段文字換到 Haiku 5.5,token 數會變多。
Claude Platform 文件寫,Haiku 5.5 用和 Claude 4.7 之後模型相同的新 tokenizer。同一段輸入文字產生的 token,比 Haiku 4.5 約多 30%,實際增幅依內容而定。遷移指南要求用 claude-haiku-5-5 重新數 prompt,並重算成本估算。Simon Willison 用他的 token 計數工具量一段長 prompt,Haiku 5.5 約是 Haiku 4.5 的 1.25 倍,可以當作增幅因內容而異的旁證。
這個機制和快取要讀幾次才回本,站內拆過:8 月 18 日那篇講 Claude Code 快取成本的文章。Sonnet 5 發布時,官方給的是 1.0 至 1.35 倍、要用 count_tokens 自己量,這點寫在7 月 20 日那篇。token 是各家自己定義的計價單位,跨廠商不能用單價直接比;從另一個方向講「單價不等於帳單」的,是GPT-6 Astra 牌價那篇。
常見的坑,是把牌價比當成帳單比。本站以官方的約 30% 推算輸入端的單價:Haiku 5.5 的輸入價 0.10 美元乘 1.30,再除以 Haiku 4.5 的輸入價 1 美元,得 0.13;超過 10 萬則是 0.50 乘 1.30 再除以 1,得 0.65。也就是說,同一段輸入文字在 Haiku 5.5 上實付的單價,約為 Haiku 4.5 的 13%(prompt 在 10 萬 token 以內)或 65%(超過);這是本站推算,只限輸入端。輸入、快取寫入、快取讀取都是輸入文字,適用同一個倍率。
輸出那一側沒有可套的倍率。官方的 30% 指同一段輸入文字;遷移指南對輸出只有定性的一句:為 Haiku 4.5 調好的 max_tokens,可能把等量的輸出截斷。輸出多長,取決於模型這次寫多少、想多少,thinking token 也算進 max_tokens。所以本站推算的 13% 和 65% 只是輸入端的單價比,不能套到輸出,也不是整筆帳單的比例。
跨線也來得比想像早。只看輸入端的 prompt,本站以 100,000 除以 1.30 推算:在 Haiku 4.5 上數出約 7.7 萬 token 的 prompt,換到 Haiku 5.5 就可能被算成超過 10 萬。門檻仍是 Haiku 5.5 自己數出來的 10 萬,舊模型上的數字只是換算。若實際增幅是 25%,本站推算的跨線點約是舊模型上的 8 萬;30% 依內容而定,這幾個推算數字都會跟著動。
多 1,000 個舊 token,這筆輸入費約從 0.0099 美元跳到 0.05 美元,約 5 倍(本站推算,以約 30% 計,只算輸入端)。下表是這兩筆的對照:
跨線舉例(本站推算:以約 30% 計,只算輸入端)
| 舊模型數出的 token | Haiku 5.5 約數出的 token | 所在級 | Haiku 4.5 輸入費(美元) | Haiku 5.5 輸入費(美元) |
|---|---|---|---|---|
| 7.6 萬 | 約 9.88 萬 | 10 萬以內 | 0.0760 | 0.0099 |
| 7.7 萬 | 約 10.01 萬 | 超過 10 萬 | 0.0770 | 0.0500 |
跨線之後,Haiku 5.5 和 Sonnet 5.5 的牌價差距也縮小了。Sonnet 5.5 同樣用 Claude 4.7 之後的新 tokenizer,同一段文字的 token 數相同,牌價可以直接相除(本站推算)。輸入、輸出和兩種快取寫入,10 萬以內 Sonnet 5.5 是 Haiku 5.5 的 20 倍,超過 10 萬變成 4 倍;快取讀取則從 10 倍變成 2 倍。這些都是牌價。每個任務實際花多少,還要看各自用掉多少 token,effort 與 thinking 都會改變它。Sonnet 5.5 的快取讀取占成本多大,算式在9 月 29 日那篇 Sonnet 5.5 怎麼選;那篇寫在 Haiku 5.5 上線之前,當時 Sonnet 5.5 的快取讀取價還是 0.20 美元。
公告表上 Haiku 5.5 的七項評測都是 max effort 量的,API 預設卻是 medium
跟 Sonnet 5.5 並排的那排分數,是 Haiku 5.5 開到 max 量的;不改設定直接用,拿到的是 medium。
公告頁沒有為 Haiku 5.5 那一欄標 effort,只指向 system card。system card 的總表通則寫,除另有註明,Haiku 5.5 的結果一律是 adaptive thinking、max effort、預設取樣、五次平均。本站把公告表逐列對到 system card:GDPval-AA、AA-Briefcase、OSWorld、HLE(無工具與有工具各一個分數)、Terminal-Bench、FrontierCode、Chartography,七項評測、八個分數,在 system card 裡對到的都是 max effort。
公告表上有 effort 標籤的,只有 FrontierCode 一列的 Sonnet 5.5 那一格:放的是它自己的 xhigh 成績 52.1%,格內標了 Xhigh。同樣在 max,Haiku 5.5 是 46.4%,Sonnet 5.5 是 46.2%。用 effort 檔位來比分數和每任務成本,Anthropic 不是第一次。Opus 5 發布時也是這樣呈現,站內拆過:7 月 25 日那篇 Opus 5 的文章。
預設值是另一回事。Haiku 5.5 的預設 effort 是 medium,Claude API 與 Claude Code 都是,adaptive thinking 預設開啟。Haiku 5.5 也是第一個可以調 effort 的 Haiku 級模型。Sonnet 5.5 在 Claude API 的預設則是 high。
system card 自己量了 medium:
medium 對 max 對照(單位:除註明 Elo,皆為 %)
| 評測 | Haiku 5.5 medium(預設) | Haiku 5.5 max | Sonnet 5.5 high(API 預設) |
|---|---|---|---|
| GDPval-AA(Elo) | 1277 | 1620 | — |
| AA-Briefcase(Elo) | 1372 | 1578 | — |
| HLE 無工具 | 35.5 | 45.9 | 47.9 |
| HLE 有工具 | 45.0 | 57.4 | 56.7 |
| DRACO | 72.4 | 81.5 | 81.0 |
| WANDR(soft F1) | 12.9 | 49.9 | 56.3 |
| HealthBench Professional(長度校正) | 59.9 | 64.8 | — |
| PhysicianBench | 25.2 | 43.0 | — |
HLE、DRACO、WANDR 的分數是 system card 圖內標籤,其餘四列是 system card 內文。GDPval-AA 與 AA-Briefcase 兩列,system card 給了 Sonnet 5.5 的分數(1840 和 1824),但沒寫是哪一檔 effort,所以 high 那一欄留空。HealthBench Professional 的 Sonnet 5.5 只有文字交代:max 以下每一檔,Sonnet 5.5 都高於 Haiku 5.5。PhysicianBench 則是 Haiku 5.5 在每一檔都低於 Sonnet 5.5。DRACO 與 WANDR 是 Perplexity 的基準,Anthropic 用自己的跑法評分,分數不能和 Perplexity 公布的數字直接比。
以百分比計的幾列裡,WANDR 的落差最大:medium 比 max 低 37.0 個百分點(本站相減)。max 多出來的分數,伴隨著多得多的輸出與等待。system card 寫,GDPval-AA 上 medium 用掉的輸出 token 約是 max 的十分之一,AA-Briefcase 則不到四分之一。HealthBench Professional 上,low 到 xhigh 每答 8 到 21 秒,max 約 110 秒。
兩邊都不改設定時,在 Claude API 上比的是表上 Haiku medium 與 Sonnet high 這兩欄。有 Sonnet 數字的四列,Haiku medium 都低一截,差最多的是 WANDR(只比分數,不比成本)。
OSWorld 的 72.4% 是 82 題離線子集的部分給分,嚴格通過率是 37.1%
常見的坑,是把 72.4% 讀成「七成多的任務做完了」。
OSWorld 2.1 是一組長時程的電腦操作任務,共 108 題,模型靠截圖和滑鼠鍵盤操作一台真的 Ubuntu 虛擬機。Anthropic 現在只報官方離線子集:108 題裡的 82 題,虛擬機不給網路。成績有兩個指標:部分給分,是每題各檢查點得分的平均;嚴格通過率,是所有檢查點都滿足的任務比例。兩個指標都是 Pass@1,每題五次獨立嘗試取平均,設定是基準預設值(1080p、每題 500 步上限)加 max effort。
Haiku 5.5 的部分給分是 72.4%,嚴格通過率是 37.1%。同條件重跑,Sonnet 5.5 是 83.9% 和 48.8%,Opus 5.5 是 87.2% 和 53.2%。公告表四欄都標了離線子集,軸標也寫部分給分。從 system card 的價格對分數圖讀出來,Haiku 5.5 medium 那一點大約在五成出頭(讀圖估值)。
公告表上 Haiku 4.5 的 15.7%,設定也不同:同一節裡所有 Anthropic 模型用同一個設定,只有 Haiku 4.5 用固定的 thinking budget,而且沒有 server-side compaction。所以從 15.7% 到 72.4%,不是同一個設定下的進步。
本站 9 月 23 日比較 Opus 5.5 與 GPT-6 Sol、Luna 時,寫過 Anthropic 沒有對應 Luna 的平價分層。10 月 7 日的公告表把 Haiku 5.5 和 Luna 放在同一排,但 Luna 那一欄各列的來源並不相同:
Luna 欄各列由誰跑的
| 評測(單位) | Luna 欄數字 | system card 的說法 |
|---|---|---|
| OSWorld(%,部分給分) | 48.9 | Anthropic 自己透過 OpenAI 的 API,在同樣 82 題上跑,用 OpenAI 自家的 context compaction |
| Terminal-Bench 4.0(%) | 16.4 | 公開排行榜上的成績,用 Codex CLI、max thinking;Anthropic 說據其所知 OpenAI 沒有自行公布 |
| Chartography(%,無工具) | 29.1 | Surge AI 公開回報的成績 |
另外三項:FrontierCode 是 Cognition 跑了圖中每個模型並回報結果;GDPval-AA 與 AA-Briefcase 兩項評測由 Artificial Analysis 獨立執行,system card 沒有逐格註明 Luna 那一格的來源;HLE 的公告表與 system card 總表都沒有 Luna 的數字。
所以同一列裡 Haiku 5.5 和 Luna 的兩個數字,不一定是同一方、用同一套設定跑出來的。
拉到 max 划不划算看任務:OSWorld 的圖支持直接開 max,HLE 與 DRACO 的圖不支持
「開到 max 也夠便宜,直接開 max 就好」是個合理的說法。system card 的價格對分數圖,兩邊的證據都有。
支持這個說法的是 OSWorld。圖上看起來,Haiku 5.5 開到 max 的每題花費,和 Sonnet 5.5 的 low 檔差不多,分數卻高一截。Haiku max 的花費也大約是 Sonnet 5.5 開 max 的十分之一。Haiku max 的分數和 Sonnet 5.5 的 high 檔相近,花費不到它的一半。這張圖的圖說只寫了每題平均成本,沒有寫成本怎麼算,所以只能比大小。
反過來的是 HLE。HLE 和 DRACO 這幾張圖的成本口徑是:Sonnet 5.5 的成本假設快取全中,Haiku 5.5 用實際記錄的用量乘牌價,所以實際用起來,Sonnet 5.5 的花費可能比圖上更高。無工具那張圖上,Sonnet 5.5 high 是 47.9%,花費不到 Haiku max(45.9%)的一半,分數還高 2 個百分點。Sonnet 5.5 xhigh 是 53.0%,花費和 Haiku max 相近,分數高約 7 個百分點。有工具那張圖上,Sonnet 5.5 xhigh 是 62.0%,比 Haiku max 的 57.4% 高約 5 個百分點,花費略低。Sonnet 5.5 high 是 56.7%,花費約是 Haiku max 的三分之一,分數低 0.7 個百分點。Haiku 從 medium 開到 max,圖上每題花費約多出數十倍。
DRACO 的圖也是同一個口徑:Sonnet 假設快取全中,Haiku 是實際用量。Haiku max 是 81.5%,Sonnet 5.5 high 是 81.0%,分數相當,圖上 Sonnet high 的花費約是 Haiku max 的三分之一。低檔位反過來:Haiku medium 的 72.4% 略高於 Sonnet medium 的 71.2%,圖上花費也較低;在這個檔位,Haiku 5.5 在圖上比較划算。
三組圖放在一起,能說的是:在 OSWorld 2.1 離線子集上,圖支持 Haiku 5.5 開到 max 的花費;在 HLE 與 DRACO,Sonnet 5.5 的 high 或 xhigh 以相近或更低的圖上花費(Sonnet 假設快取全中、Haiku 用實際用量),拿到相當或更高的分數。你的工作像哪一個,或哪一個都不像,只能用你的資料跑。這也是 Anthropic 自己的 prompting 指南寫的:
xhigh and max are for work where a quality gain on your evals justifies the cost. Thinking and replies get much longer at these levels, so also run your evals on Claude Sonnet 5.5 and compare performance, cost, and speed.
同一段指南還說,medium 是預設,多數工作包括 agentic coding 從這裡起步。再好的公開評測圖,也回答不了它量的是不是你的工作;為什麼還是得自己跑一次,講過的是站內 7 月 23 日那篇。
Anthropic 自己劃了線:複雜的 agentic coding 仍以 Sonnet 5.5 和 Opus 5.5 為佳
Anthropic 替 Haiku 5.5 劃了兩條線:一條劃在能力上,一條劃在請求被擋之後。
能力那條,公告寫在 Terminal-Bench 4.0 的成本圖旁邊:
Sonnet 5.5 and Opus 5.5 remain better choices for complex agentic coding tasks like those measured by Terminal-Bench 4.0. By contrast, Haiku 5.5 is best suited to more narrowly scoped tasks that might otherwise have been cost-prohibitive with previous versions of Claude—like compaction, summarization, or subagent work.
公告同一頁也說,Haiku 5.5 為高量、成本敏感的任務設計,能可靠處理摘要、compaction、資料庫查詢和分類,也適合在 coding 工作裡當 Opus 5.5 或 Sonnet 5.5 的 subagent。system card 對能力的總評是:比 Haiku 4.5 大幅進步,但通常未達 Sonnet 5.5 的水準,有些例外。例外之一是 ProgramBench:Haiku 5.5 是 82.0%,Sonnet 5.5 是 79.7%。
被擋之後那條,分兩步看:什麼會被擋,以及被擋之後怎麼辦。資安是被擋的一類:Haiku 5.5 的 cyber safeguards 比 Haiku 4.5 嚴、比其他近期模型稍寬,允許的防禦性任務比 Sonnet 5.5 多,但仍然擋滲透測試和其他較可能被攻擊者使用的技術;需要更寬權限的組織,可以申請 Cyber Verification Program。至於被擋之後,不論哪一類,在 Anthropic 的第一方產品與 API 上,Haiku 5.5 沒有 server-side fallback:被擋的請求不會由 API 自動退到別的模型,其他平台與供應商可能有不同行為。實際寫程式時,要在自己的 client 處理 stop_reason: "refusal"。同一個請求重送給 Haiku 5.5,通常還是被拒;fallbacks: "default" 時被拒的請求維持被拒,指定 fallback 模型清單則回 400。想改送別的模型,文件另列了 SDK middleware 與手動重試兩種 client 端做法;手動重試時,Haiku 5.5 的拒答不附 fallback credit,換去的模型要付全額的快取寫入價。
兩條線在 Terminal-Bench 4.0 上碰在一起。Haiku 5.5 是 39.2%,Sonnet 5.5 是 70.6%,但兩邊條件不同。Haiku 5.5 開著 safeguards,跑這項評測時也沒有接 fallback 模型;請求一被擋,該次 trial 就停在那裡。660 個 trial 裡有 12 個因此失敗(1.8%),其中 10 個在同一題。Sonnet 5.5 被擋的請求(1.2%)則由 fallback 模型接手回答。Haiku 5.5 這項評測也不允許對外網路;Anthropic 說原則上可能壓低分數,沒有嚴格量過影響多大,但相信沒超出雜訊範圍。次數也不同:Haiku 5.5 每題跑 10 次,Sonnet 5.5 每題跑 5 次,標準誤是 ±1.9 和 ±2.5 個百分點。Haiku 4.5 在這項是 0.0%。
system card 另外寫了兩個弱點。第一個是過度拒絕,兩個量測的方向不同:在自動化行為稽核裡,Haiku 5.5 的過度拒絕比 Anthropic 測的其他模型都多,包括 Haiku 4.5;在單輪的良性請求上,它比 Haiku 4.5 少,Claude API 無 system prompt 時是 0.17% 對 0.44%,claude.ai 上是 0.82% 對 3.05%,但仍高於 Sonnet 5.5 的 0.02% 和 0.20%。第二個是幻覺:比其他近期模型多,約與 Haiku 4.5 相當;未告知使用者就使用外洩答案的比例是 17%,Haiku 4.5 是 2%。
本站小測:12 次正式考試全對,題目偏簡單、樣本小,沒測 max 也沒測 10 萬 token 以上
分數是別人量的。本站 10 月 8 日自己考了一輪,考題用的是上一篇 Gemini 4 Argon 的基準比較表。
環境是 Claude Code 2.1.293,指令 claude -p --model claude-haiku-5-5 --safe-mode --no-session-persistence,關掉 hook、CLAUDE.md 與外掛。冒煙測試要求回覆一個字,回 OK;用量紀錄顯示 context window 1,000,000、輸出上限 128,000。
四種考題,共 12 次:
- 圖表轉錄:讀一張 Google 的 Gemini 4 Argon 基準比較表 PNG,抄下 19 列、4 欄共 76 格。low、medium、high 各跑 1 次,三次都是 76 格全對標準答案。標準答案是上一篇文章核定過的數字。
- 顏色判讀:判斷哪些儲存格被標藍、標灰。medium、high 各 1 次,兩次都是 76 格全對。標準答案是 GPT-6 Luna 讀圖的結果,所以這只代表兩個讀者一致。
- 來源分類:給 Google 評測方法說明的純文字與 19 列數字,依「第三方榜單、Argon 自跑對手榜單或自報、全自跑」三類定義分類,並判斷 Argon 領先、並列或落後。medium、high 各 1 次,兩次都是來源類 19 比 19、結果 19 比 19 全對。
- 防亂編:同時給 Argon 公告頁與 Gemini 3.8 Flash 公告頁,問三題:Argon 導入價的截止日(頁面沒寫,3.8 Flash 那頁有寫 12 月 31 日)、Argon 的 context window(頁面沒寫)、Argon 的導入價(頁面寫 2 美元和 10 美元)。medium 3 次、high 2 次,五次都對那兩題回「頁面沒寫」,沒有把 12 月 31 日套給 Argon,價格也答對。
12 次合計約 0.024 美元(牌價計,不是訂閱實扣);前三類單次約 7 到 9 秒。
樣本的限制:每個格子只跑 1 到 5 次,沒有變異估計;題目由本站挑,偏簡單,定義和數字都給齊了;沒測 max effort,沒測 10 萬 token 以上的長脈絡,沒測會上網的 worker,也沒測拒答頻率;防亂編題用的是本機存的網頁快照,不是即時網路。
12 次的結果能支持的說法很窄:low 到 high 三檔,讀表、照定義分類、頁面沒寫就回沒寫這類題目,每一次都對。它不能拿來驗證公告的分數,也不能推到 max 或長脈絡。
給非工程師的一句話
本站判斷:Haiku 5.5 的便宜條件是 prompt 守在 10 萬 token 以內,公告高分的條件是 max effort;只有 prompt 守得住 10 萬 token、範圍窄、量大,而且在預設的 medium 上用自己資料驗過的工作,才值得整批換成 Haiku 5.5。得開到 xhigh 或 max 才夠用的工作,應該同時拿 Sonnet 5.5 比一次,不要直接換。
這個判斷靠三個前提。第一,Anthropic 自己說複雜的 agentic coding 仍以 Sonnet 5.5 與 Opus 5.5 為佳,system card 也說 Haiku 5.5 通常未達 Sonnet 5.5 的水準。第二,預設 medium 的分數低於公告分數。第三,官方 prompting 指南要求用 xhigh 與 max 時同時跑 Sonnet 5.5。三個前提任何一個被推翻,這個判斷就要重做。
OSWorld 那張圖是「直接開 max 也划算」的反例,但它只是一個離線子集的圖;你的電腦操作工作值不值得開 max,要自己跑才知道。
常見問題
Claude Haiku 5.5 多少錢?
以每百萬 token 計:prompt 在 10 萬 token 以內,輸入 0.10 美元、輸出 0.50 美元、快取讀取 0.01 美元;超過 10 萬,輸入 0.50 美元、輸出 2.50 美元、快取讀取 0.05 美元。對照 Haiku 4.5 是輸入 1 美元、輸出 5 美元、快取讀取 0.10 美元。官方模型頁頂端寫的是「起價」0.10 美元與 0.50 美元,兩級價格的完整對照見正文講價格表的那一節。
prompt 超過 10 萬 token 會怎樣?
整筆請求改用較高那一級的費率,輸入、輸出、快取寫入、快取讀取每一項都是 10 萬以內的 5 倍(本站推算),不是只有超出的部分加價;「整筆」的說法出自 system card 的圖說。超過 10 萬的牌價仍是 Haiku 4.5 的一半。快取讀到的 token 算不算進那 10 萬,定價頁、模型頁、公告與 prompt caching 文件都沒有明寫。細節見正文講 10 萬 token 價格線的那一節。
Haiku 5.5 的預設 effort 是哪一檔?
medium,在 Claude API 與 Claude Code 都是,thinking 預設為 adaptive 並且開啟。Sonnet 5.5 在 Claude API 的預設是 high。公告表上的分數是 max effort 量的,見正文講 medium 與 max 的那一節。
從 Haiku 4.5 搬到 Haiku 5.5,要改什麼?
遷移指南列了五項會報錯或失效的改動:手動 extended thinking(budget_tokens)要換成 adaptive thinking;非預設的 temperature、top_p、top_k 會回錯誤;assistant prefill 會回錯誤;Claude API 與 Google Cloud 上的 computer use 要改用 computer_toolset_20260801;改動較早的 turn 會讓 thinking block 失效。同一段文字也會算出更多 token,成本估算與 max_tokens 要用 claude-haiku-5-5 重新數過,見正文講新 tokenizer 的那一節。
Haiku 5.5 的 thinking 可以關掉嗎?
可以,但有檔位限制:effort 在 high 以下,可以把 thinking 設成 disabled;xhigh 與 max 關閉會回 400 錯誤,那兩檔要用 adaptive thinking(不帶 thinking 欄位,或設成 adaptive)。thinking token 算進 max_tokens,max_tokens 可以設到 128,000。
Haiku 5.5 的請求被拒絕時,會自動換別的模型接手嗎?
在 Anthropic 的第一方產品與 API 上,不會由 API 自動換:Haiku 5.5 沒有 server-side fallback,要在自己的程式裡處理 stop_reason 為 refusal 的回應,同樣的請求重送給 Haiku 5.5 通常還是被拒。想改送別的模型,可以用 SDK middleware 或手動重試;手動重試時,Haiku 5.5 的拒答不附 fallback credit,換去的模型要付全額的快取寫入價。其他平台與供應商可能有不同行為。細節見正文講 Anthropic 自己劃線的那一節。
📚 收進你的工具
For AI Reading Era把這篇文章交給你日常用的工具——做研究、整理筆記,或當 AI 的 context。