aire.
·7 分鐘

Claude Code 的快取不是存了就省,是讀夠次數才回本

Claude 官方部落格教你怎麼在 Claude Code 裡少花錢,但價目表上還有幾個數字,那篇文章沒有寫進去:快取要讀幾次才回本、output 為什麼剛好貴 5 倍、4.7 之後同一段文字被算出的 token 數變了。這篇把價目表拆開,加上一次實測,看常駐負載裡真正能自己調整的是哪一塊。

收進
本文涉及工具

事實分級說明

官方機制引自 Claude 官方部落格〈Maximizing the value of your Claude Code sessions〉(2026 年 8 月 14 日發布)與 Claude 官方價目表(2026 年 8 月 18 日讀取,價格可能隨時間調整)。標示「一次實測」的段落,是在同一個時間點、一個日常使用環境裡跑 /context 的結果,射程僅限那一次、那個環境、那個版本,不是通則。

一段 5 分鐘的快取,讀一次就回本;一段 1 小時的快取,要讀兩次才回本。這不是隨口估的比例,是 Claude 官方價目表上寫死的算術:快取寫入比一般輸入貴 1.25 倍到 2 倍,快取命中只要 0.1 倍。8 月 14 日,Claude 官方部落格發了一篇文章,教你怎麼在 Claude Code 裡少送 token、少花錢,內容照著做並不難。但價目表上還有幾個數字,那篇文章沒有寫——不先看懂這幾個數字,直接照著做,省下來的可能比想像中少。

Output 比 input 貴 5 倍,價目表上每一列都一樣

官方部落格給的理由是,decode(產生輸出)讓 GPU 忙的時間比讀輸入長得多,所以 output 定價比 input 高,原文用的字是「大約」5 倍。這句話讀起來像一個概略值,容易被當成某個模型剛好湊出來的數字。

翻開官方價目表(2026 年 8 月 18 日讀取),這個倍數不是概略,是精確的 5.0,而且全表每一列都一樣:Fable 5 的 base input 是每百萬 token 10 美元、output 50 美元;Opus 系列(5、4.8、4.7、4.6、4.5)是 5 美元對 25 美元;Sonnet 5 是 2 美元對 10 美元;Sonnet 4.6、4.5 是 3 美元對 15 美元;Haiku 4.5 是 1 美元對 5 美元。連已經退役的 Opus 4.1、Opus 4、Haiku 3.5,倍數也都是 5.0。這不是某一款模型的特例,是整張表共用的定價規則——但價格會隨時間調整,這裡引的是 8 月 18 日當天讀到的快照。

快取的倍率也定死在同一張表上。讀一次快取,只付 base input 的 0.1 倍。快取寫入則分兩檔:5 分鐘的快取寫入是 1.25 倍,1 小時的快取寫入是 2 倍。官方部落格說快取寫入「最多到 2 倍」,講的正是 1 小時那一檔;5 分鐘檔的 1.25 倍,部落格原文沒有寫出來,要對到價目表才看得到。

5 分鐘快取讀一次回本,1 小時快取讀兩次回本

官方價目表把這筆帳算給你看:快取命中只要付標準 input 價格的 10%,這代表 5 分鐘檔的快取(寫入貴 1.25 倍)讀一次就回本,1 小時檔的快取(寫入貴 2 倍)要讀兩次才回本。

把數字攤開算一次:5 分鐘檔,寫入比正常輸入多付 0.25 倍,每讀一次省下 0.9 倍——讀第一次就已經賺回來。1 小時檔,寫入多付 1.0 倍,讀一次只省 0.9 倍,還沒打平;讀兩次省下 1.8 倍,才真的回本。

這句話容易被讀反。快取寫入比較貴,不代表快取不划算,方向是反的——快取整體是省的,只是省的前提是要讀夠次數。一份 context 寫進快取之後只被讀一次就丟掉,尤其是寫進 1 小時檔,這筆錢多半是虧的;同一份 context 在對話裡被反覆讀取,快取才真的開始省。

會打掉快取的動作,都該在對話一開始做完

/model(換模型)和 /effort(換思考等級),是快取鍵值的一部分。官方原文說明,每個模型都有自己的快取,換模型之後,下一輪要把整段對話用全額價格重新填一次;思考等級同樣是快取鍵值的一部分,中途換一樣會打掉快取。中途做這兩個動作,代價是整段歷史被重新計算一次。

/rewind/compact 都是拿掉對話內容的指令,但代價不同。/rewind 把最後幾輪砍掉,砍掉之前的部分仍然留在快取裡,不花錢。/compact 是把整段對話換成一份較短的摘要——寫這份摘要要花錢,只是如果舊對話還沒過期、還在快取裡,寫摘要這件事本身比較便宜。也就是說,/compact 划不划算,取決於動手的時候快取還在不在。

順帶一提,這些指令怎麼用會影響帳單,而 Claude Code 對「什麼時候該問你、什麼時候自己決定」也另外改過一輪規則,那件事寫在〈權限提示有 97% 被直接按同意,於是 Claude Code 改用分類器把關〉。

4.7 之後,同一段文字被算出的 token 數不一樣了

官方價目表寫了一件部落格文章沒提到的事:Claude 4.7 之後的模型(含 Claude Mythos Preview)換了一款新的 tokenizer,同一段文字用新版計算,大約會多出 30% 的 token,官方也註明,實際增加的幅度依內容與工作型態而定。Sonnet 4.6 以前的模型用的仍是舊版 tokenizer。

這件事跟「怎麼省 token」直接相關,卻很容易被忽略:同一份 context,拿去餵給 4.7 之後的模型和 4.6 以前的模型,算出來的 token 數本來就不是同一個數字——不是內容變了,是計數的方式換了。

這裡有三條線要守住,一步都不能跨:官方給的是「大約 30%」,而且明說幅度依內容而定,不能把它當成一個精確係數去套公式;官方沒有針對任何語言另外給數字,中文、日文之類的語言別比例,價目表上完全沒寫,不能自己補一個出來;新舊 tokenizer 的差異,跟模型單價的漲跌是兩件事,不能相乘出「所以新模型更貴」這種結論——例如 Sonnet 5 的 base input 是每百萬 token 2 美元,比 Sonnet 4.6 的 3 美元還便宜,價格與 token 數這兩條線各自看各自的。

Claude Sonnet 5 深度評測:什麼時候該用 Opus 4.8,什麼時候它就夠了〉整理過 Sonnet 5、Sonnet 4.6、Opus 4.8 之間該怎麼選;上面借用這些單價只是為了說明倍數關係,選型那件事那篇講得完整。

常駐負載裡,能自己調整的只有記憶檔和 skill 描述

一次實測(在一個日常使用的環境裡執行 /context)拆開了每個 session 一開始就帶著的常駐負載:那次量到的常駐總量約 42.2k token,占 1M context window 的 4% 左右。組成裡,系統提示占 5.5k、系統工具占 15.9k,這兩項不可控,是 Claude Code 本身的固定開銷。剩下的才是自己疊上去的:記憶檔 14.5k、約 40 支 skill 的描述合計 5.8k、自訂 agent 定義 0.5k。

同一次實測也量到,那個環境裡掛了 410 個 MCP 工具,佔用卻是 0 token,因為工具定義是按需載入,不是每個 session 一開始就把全部說明書塞進去。這代表在那個環境、那個版本下,「關掉用不到的連接器來省 token」對常駐負載沒有幫助——它們本來就沒有占常駐。這是一次實測的結果,不同版本、不同組態的環境,行為可能不同。

把這幾個數字放在一起看:系統提示和系統工具是拿不掉的固定成本,真正能自己動手調整的,只有記憶檔的份量和裝了幾支 skill。

官方那六條建議,這裡有三條的處理不一樣

官方那篇文章的 TL;DR 給了六條建議。其中三條,這裡的處理跟字面上不太一樣——兩條是前提對不上,一條是往同一個方向做得更徹底。三條都不是官方講錯了。

第一條是「休息前先 /compact」。官方的邏輯站得住:對話變短,回來之後每一輪要重送的內容變少;趁快取還沒過期時寫摘要,也比較便宜。但這條建議有一個沒明講的前提——休息完之後會回到同一個 session 繼續。如果收工的習慣是直接把這個 session 收掉、下次開一個新的,那份摘要就沒機會被用到,寫它的那筆錢等於白付。

第二條是把思考關掉來省錢,官方自己也標了例外——Fable 5 不能被這個設定關掉。這條的取捨很直接:省的是錢,代價是能力,值不值得換,要看那個 session 在做的工作是不是本來就需要那一級的推理能力。〈我以為找到更好的模型,後來發現只是它比較不愛說話〉記錄過同一種取捨的另一個版本:省下來的成本,常常是拿品質換的,而品質這件事不一定在第一眼就看得出來。

第三條是「中途不要切模型」。這條其實不是沒照做——官方自己在 TL;DR 裡就先講了,開始前把模型和思考等級定好,中途換會打掉快取。這裡的做法是,需要換一個更快的模型時,開一個新的獨立 session 去跑,而不是在原本的對話裡切換,等於把官方的建議做到底,不是反著來。

還有一處落差值得記下來。官方建議把工作流專屬的指示從 CLAUDE.md 搬進 skill,理由是 skill 只在用到時才載入。但前面那次實測量到,skill 的「描述」本身是常駐的——那個環境裡約 40 支 skill 的描述,合計占了 5.8k token,每個 session 都要先付這筆錢。搬家不是零成本,是把「整份指示常駐」換成「一行描述常駐」,多數時候仍然划算,只是不是免費的。skill 裝得越多,這筆固定成本越高;決定要不要留一支 skill,該問的是它的那行描述,值不值得每個 session 都付一次。

給非工程師的一句話

官方那篇教的省錢方法,照著做大致有用。只是動手之前,有三件事最好先知道。快取比較貴的是寫進去那一次,要讀夠次數才回本,不是存了就開始省。4.7 之後的模型換了計算方式,同一段文字算出來的 token 數已經不是同一個數字,舊的直覺套不上去。至於每次開機就背在身上的那些負載,真正動得了的往往不是那些看起來很多的工具,而是自己一行一行疊上去的說明檔——那才是唯一能自己減的部分。

常見問題

Claude Code 的 output token 為什麼比 input 貴這麼多?

官方部落格給的理由是,decode(產生輸出)讓 GPU 忙的時間比讀輸入長得多,所以 output 定價比 input 高,原文用的字是「大約 5 倍」。但對照官方價目表(2026 年 8 月 18 日讀取)會發現,這個倍數在每一款模型上都精確是 5.0,不是某個模型剛好湊出來的近似值,是整張表共用的定價規則。

快取寫入比一般輸入貴,是不是代表用快取不划算?

方向剛好相反。快取寫入的確比一般輸入貴,5 分鐘檔貴 1.25 倍,1 小時檔貴 2 倍,但快取命中只要付 0.1 倍。算下去,5 分鐘檔的快取讀一次就回本,1 小時檔的快取讀兩次才回本。只要同一份內容會被反覆讀取,快取整體是省的,只是省的前提是要讀夠次數,一次性內容寫進 1 小時檔,大概率是虧的。

中途切換模型或調整思考等級,為什麼會讓成本變高?

因為每個模型有自己的快取,思考等級(effort)也是快取鍵值的一部分。中途換模型或換思考等級,下一輪對話會被視為全新的快取狀態,整段歷史要用全額價格重新計算一次。官方建議在對話一開始就把這兩項定好,而不是留到中途調整。

4.7 之後的新 tokenizer,會讓中文比英文更貴嗎?

官方價目表只寫了,4.7 之後的模型換了新版 tokenizer,同一段文字大約會多算出 30% 的 token,且實際幅度依內容與工作型態而定;官方沒有針對任何語言另外公布數字。中文或其他語言的實際變化幅度,不能用這個 30% 直接推算,只能等官方公布或自己實測。

📚 收進你的工具

For AI Reading Era

把這篇文章交給你日常用的工具——做研究、整理筆記,或當 AI 的 context。

 
延伸閱讀