自架 Kimi K3 划算嗎?先過三道門:1.56TB 權重、64 顆加速器,和一份設了兩道門檻的授權
Moonshot AI 的 Kimi K3 有 2.8 兆參數,官方稱它是世界第一個開放的 3 兆等級模型,完整權重已於 7 月 27 日晚間公開。規模紀錄是真的,但「開放權重」跟「你拿得到」是兩件事:權重實測 1.56TB,比用參數量推算的多一成;官方建議的部署規格是 64 顆以上的加速器;授權雖然寬鬆,卻在營收與使用者規模上設了兩道門檻。更反直覺的是,開放權重並沒有換成更低的標價:它的輸出價和 GPT-5.6 Terra 一模一樣,未命中的輸入還貴一點。這篇把三道門的實際數字算給你看。
先講結論
Moonshot AI 的 Kimi K3 有 2.8 兆參數,官方在技術部落格上稱它是世界第一個開放的 3 兆等級模型。完整權重已於 7 月 27 日晚間公開下載,這個規模紀錄是真的。
如果你想知道「自己架一台是不是就不用再付 Claude 或 ChatGPT 的錢」,答案幾乎確定是不划算。理由不是它不夠好,而是三道繞不過去的門:
第一道是體積。權重實測 1.56TB,比用參數量推出來的還多一成。第二道是硬體。官方建議的部署規格是 64 顆以上的加速器,而且不是隨便哪一代都行。第三道是授權。條款已隨權重公布,寬鬆但不是 MIT,它在營收與使用者規模上各設了一道門檻。
還有一件更反直覺的事,跟自不自架無關:開放權重並沒有換成更低的標價。 K3 的輸出價和 GPT-5.6 Terra 一模一樣,未命中的輸入還貴一點(它另有一檔便宜十倍的快取命中價,後面細談)。
先把兩件事分開:模型早就能用,權重是後來才放出來的
這件事的報導很容易把兩個日期壓成一個,值得先拆開。
模型本身不是跟著權重一起上線的。 依據科技媒體 TECHi 的整理,Kimi K3 透過官方 API 提供服務是從 2026 年 7 月 16 日開始。也就是說,在權重公開之前,想試它的人已經試了十幾天。
權重是後來才可以下載的。 官方技術部落格與 API 文件的說法都是「The full model weights will be released by July 27, 2026」。現在確實下載得到:repo 裡有 96 個權重檔,也沒有設下載限制。至於是哪一刻開始可以下載的,能查到的只有一個參考點:moonshotai/Kimi-K3 的 repo metadata 顯示最後更新於世界標準時間 2026 年 7 月 27 日 16 時 29 分,換算台北時間是 7 月 28 日凌晨 0 時 29 分。這是 metadata 的更新時間,不等於每個權重檔首次可下載的精確時刻。在那之前幾個小時,頁面掛的還是倒數計時與 Upcoming release 的標示。
我把這個時間差寫出來,是因為在權重公開之前,網路上就已經出現「權重昨晚就放出來了」的說法。「模型可以用了」和「權重可以下載了」是兩件事,中間差了十天以上。 這類題材的半衰期很短,所以下面每一段引用的數字我都盡量標了日期與查證時點。
本文的權重相關數字,都是在台北時間 2026 年 7 月 29 日上午重新查證過的實測值,不是預估。
它到底是什麼:2.8 兆參數,但每次只用其中 16 個專家
規格取自官方技術部落格:
- 總參數 2.8 兆,混合專家(MoE)架構,896 個專家,每次啟用 16 個。
- 上下文長度 100 萬 token(精確值 1,048,576)。
- 具原生視覺能力(官方原文為 native vision capabilities,未進一步載明可輸入的媒體型別)。
- 權重採 MXFP4 格式,activation 用 MXFP8。
- 架構上的新元件是 Kimi Delta Attention(KDA)與 Attention Residuals(AttnRes),官方描述前者是「擴展注意力的高效基礎」,後者「跨深度選擇性地取回表徵」;專家路由則用了 Quantile Balancing 與 Per-Head Muon。
「896 選 16」值得停一下:每次前向傳播實際動用的參數只佔總量一小部分,這是近兩年大型 MoE 的共同做法:用總參數換知識容量,用稀疏啟用換推論成本。 但稀疏的是「計算」不是「記憶體」,你仍得把全部 2.8 兆參數放在隨時取得到的地方。這正是第一道門的來源。
至於它有多強,兩份公開排名可以對照,日期都標出來:Interconnects 的 Nathan Lambert 在 7 月 20 日記的是 Vals AI 第 2、Artificial Analysis 智慧指數第 3、Frontend Code Arena 第 1;Northflank 標註 7 月 17 日查證的整理則是 Artificial Analysis v4.1 得 57 分排第 4(189 個模型中)、Vals 74.70% 排第 2、Terminal-Bench 2.1 得 80.90% 排第 2。
同一個指數一個說第 3、一個說第 4。這不是誰弄錯,而是這種合成指數本來就跟著榜單更新移動。我們在〈一張做得很好的評比圖,和我還是得自己跑一次的理由〉裡拆過這件事:一個總分能告訴你它在量的那些題目上大概落在哪一區,但回答不了「它在我的工作上行不行」。把這些名次當成 7 月中的快照看,不要當成規格。
有一點倒是幾份來源一致:它已經進到與西方旗艦同一個對話裡,而不是「開源模型裡最強的那個」這種次級組別。這在開放權重這條線上是新的。
第一道門:實測 1.56TB,比紙上算的多一成
權重落地之後,這個數字不必再用推的了。
Kimi K3 的 repo 裡有 96 個 safetensors 權重檔,加總是 1,560,936,091,448 位元組,也就是 1.56TB(十進位),換成二進位單位是 1.42TiB。
值得留意的是,這個實測值比紙上算的高出約一成。天真的算法是:MXFP4 是四位元格式,2.8 兆參數乘以 4 位元再除以 8,得到 1.4TB。但 MXFP4 這類格式除了每個參數本身,還要為每一小塊數值存一個共用的縮放係數,加上模型裡本來就有一部分張量不是以四位元存放。把實測體積除回參數量,每個參數平均約 4.46 位元,不是 4 位元。
也就是說,用「參數量乘以量化位元數」估體積會系統性偏低。第三方先前用每參數 4.25 位元估出的約 1.49TB 比較接近,但仍然低估。要真實數字就去看檔案大小。
換個精度看更有感:同一批權重用 16 位元存大約是 5.6TB,四位元量化已經是壓到四分之一之後的結果。而 1.56TB 只是「參數本身」,你還需要空間放下載、解壓與至少一份可用副本,實務上建議 2TB 起跳。
先記住這個數字,因為它直接決定第二道門。
第二道門:官方建議 64 顆加速器,而且不是隨便哪一代
Moonshot 官方技術部落格的原句是:推論效率同樣受益於更大的高頻寬通訊域,因此「建議把 Kimi K3 部署在 64 顆以上加速器的 supernode 配置」。
先講清楚免得誤讀:這是「為了跑得有效率」的建議配置,不是「低於這個數字就啟動不了」的最低門檻,官方並沒有給出最低可運作的卡數。下面推算的是「要像官方建議那樣有效率地服務它,代價是什麼」。
為什麼要這麼多?因為 1.56TB 的權重必須放進加速器的高速記憶體裡。粗略地除一除:用 80GB 一張的卡,光塞權重就要 20 張左右;就算用單卡容量最大的那一級,一個節點 8 張、每張 192GB,標稱合計 1,536GB——還比這份權重少了大約 25GB。也就是說,這樣一個節點連完整權重都放不進去,更不用說還要空間放 KV cache。這是一個號稱 100 萬 token 上下文的模型,長上下文正是吃記憶體最兇的地方;你也還需要餘裕服務同時進來的請求。
換句話說,「塞得進去」和「跑得順、而且能同時服務很多人」是兩件事,官方那句建議談的是後者,代價比前者高一個數量級。
還有一個容易被略過的細節:MXFP4 原生支援的是 NVIDIA 的 Blackwell 世代與 AMD 的 MI400 世代。 拿前一代的卡估成本會偏樂觀,你得額外處理格式轉換。
至於租金量級,可參考一份 7 月 25 日的第三方試算:64 顆 H100、每 GPU 每小時 3.99 美元,一天約 6,100 美元。這是該文作者的示範換算,不是 Moonshot 的報價;而且 H100 屬於前一代,這個數字是偏低的一側。
換算一下量級:那筆租金等於多少 API 用量
把上面兩個數字放在一起,可以得到一個抓量級用的錨點。這種換算很容易被讀成它撐不起的結論,所以先說清楚它是什麼、不是什麼。
一天 6,100 美元的租金,如果只拿來買官方 API 的輸出——每百萬 token 15 美元——大約等於 4.07 億個輸出 token。
這是「只比較輸出費的等價量」,不是自架的總成本回本點。至少有三件事沒被算進去:
- 輸入費。API 帳單不是只有輸出,輸入還分快取命中與未命中兩種價。其他條件不變、只把輸入費加進去的話,同樣一筆 6,100 美元的帳單會在更低的輸出量就達到。
- 你的輸入輸出比。大量餵資料、只吐短答案的工作負載,跟長篇生成的落點完全不同。
- 自架那側也不只有租金。電力、機房、維運人力、可用性責任都沒算,這一項把分界線往反方向推。
注意上面第一項和第三項的方向是相反的,所以全成本的分界線到底比 4.07 億高還是低,本文不做斷言:那取決於你自己的輸入輸出比,和你把自架的隱性成本算得多實在。
所以正確的用法是:把 4.07 億當成一個量級的參考點,不是門檻。 它能回答「這是幾百萬還是幾億 token 等級的事」,回答不了「我們公司該不該自架」,後者要用你自己的數字重算。
量級感還是很清楚。第三方在託管 API 上量到的輸出速度約每秒 62 個 token,一條連續不斷的生成一天約產出 536 萬個 token。要摸到億這個量級,你需要幾十條這樣的線幾乎不間斷地跑。
達得到的人是有的:那些把推論當基礎設施在賣的公司,和真的有連續批次工作負載的機構。 但如果你是在問「我們公司十幾個人用得兇不兇」,那不是同一個量級的問題。
最反直覺的一格:開放權重沒有換成更低的標價
這是我在查證過程中最意外的一件事。
官方定價(每百萬 token):
| 模型 | 輸入 | 輸出 |
|---|---|---|
| Kimi K3 | 3.00 美元(快取命中 0.30 美元) | 15.00 美元 |
| GPT-5.6 Sol | 5.00 美元 | 30.00 美元 |
| GPT-5.6 Terra | 2.50 美元 | 15.00 美元 |
| GPT-5.6 Luna | 1.00 美元 | 6.00 美元 |
| Claude Opus 5 | 5.00 美元 | 25.00 美元 |
對上兩個西方旗艦,K3 的標價確實低:比 Claude 的 Opus 5 低,也比 ChatGPT 的 GPT-5.6 Sol 低。但跟 GPT-5.6 Terra 並排就變了:輸出價完全相同,未命中的輸入還貴了兩成。 而 Terra 正是很多團隊日常在用的那一檔。
這裡得補一個對你可能有利的條件,否則上面那句會被讀得太滿。K3 的輸入是兩段式計價,快取命中只要 0.30 美元,是未命中的十分之一;官方在同一篇技術部落格寫明:靠 Mooncake 的分離式推論架構,官方 API 在程式類工作負載上的快取命中率超過 90%。
如果你的用法落在那個區間,實際付的輸入單價會遠低於表上的 3.00 美元。所以誠實的講法是:在標價這一欄,K3 沒有比 Terra 便宜;但實際帳單誰高誰低,取決於雙方各自的快取命中率,那不是這張表回答得了的。
真正該收下的是另一件事:「開源所以便宜」這個推論在這裡沒有著力點。 開放權重降低的是取得模型的門檻,不會自動降低你用它的單價;K3 的 API 價格是 Moonshot 自己訂的商業決定,跟權重公不公開是兩回事。真正會把價格壓下來的,是第三方託管商開始互相競價的那一段。權重與授權都已到位,接下來幾週值得觀察。
第三道門:授權出來了,對多數人是開的,但設了兩道門檻
權重落地時,授權條款一起公布了。這道門的答案因此從「不知道」變成了具體條文。
它叫 Kimi K3 License,不是 MIT,也不是任何一個現成的標準授權。授權範圍寫得非常寬:使用、複製、修改、合併、發布、散布、再授權、販售,以及部署、微調、製作衍生作品都允許,前提是在所有副本或實質部分中保留著作權與授權聲明,並且遵守適用的法律法規。以絕大多數讀者的用法來說,這道門是開的。
在那之上,還有兩項以規模為觸發點的額外要求。
第一條針對「Model as a Service」。 條文自己定義了這個詞:讓第三方能存取語言模型推論或微調,且該第三方對輸入、參數或訓練資料有實質控制權,例如透過 API 對外提供。條文同時排除兩種情況:把模型能力只嵌在特定功能裡的終端產品,以及單純轉送請求到別人代管的模型。如果你確實在經營這類服務,而且你與關係企業在任何連續十二個月內的總營收超過兩千萬美元,那麼在把它用於任何商業用途之前,必須先和 Moonshot AI 另行簽約。
第二條是署名,觸發條件不同。 如果你把它用在月活躍使用者超過一億、或月營收超過兩千萬美元的商業產品或服務上,必須在該產品的使用者介面上顯著標示「Kimi K3」。
還有一條豁免值得知道:上述兩條都不適用於純內部使用(不把模型、其輸出或其能力提供給第三方),也不適用於透過 Moonshot 官方產品或其認證推論夥伴使用的情況。
怎麼讀?我們在〈最強的那批模型,開始「不給你用」了〉裡寫過六月那條以 MIT 公開的路線,那是最寬鬆的一種樣子。K3 沒走到那一步,但也離「限研究使用」很遠——它把限制放在你變得夠大的時候,而不是放在門口。
以上是條文整理,不是法律意見。真的踩在門檻附近,請看原文並找你的法務。
那開放權重到底開給了誰
講到這裡很容易得出「所以跟我沒關係」的結論,那也不太對。
它確實不是開給個人的。 完整權重的受眾是有多節點叢集的機構、雲端供應商與研究單位。權重公開跟你能不能在自己電腦上跑它,沒有直接關係。
但它對兩種需求是真的有意義的。 一是資料主權:有些內容就是不能送出去,這時「模型放在你控制的環境裡」本身就是規格,不是省錢手段。二是可控性:要微調、要固定版本、要確保它不會某天下午被一道指令換掉。我們在〈你叫的名字,和你拿到的東西〉裡談過,你打 API 時無法驗證對面是不是你點名的那個模型,自己持有權重是少數能繞過的做法。
還有一種比較間接、但對多數人最實際的好處:權重公開之後,社群通常會在幾週內做出各種量化版本,把門檻往下拉。這在影像模型那條線上演過一輪,我們在〈2026 上半年 AI 圖像工具評比〉裡整理過 VRAM 門檻怎麼降下來。權重才剛落地,這條曲線會不會複製,接下來幾週才看得出來。
這裡要說一句保留:網路上已經有不少「等蒸餾出 14B 到 30B 的小版本就能在消費級顯卡上跑」的說法。權重落地後我重新查過,截至 2026 年 7 月 29 日,Moonshot 官方 Hugging Face 帳號的模型清單裡沒有任何 K3 的小尺寸或蒸餾版本,這一輪只有 moonshotai/Kimi-K3 一個 repo。 這只涵蓋該帳號,不等於窮盡了所有官方管道;但至少可以說,目前流傳的 14B 到 30B 說法是社群的期待,不能當成已發布的規格。
那你現在該做什麼
分三種情況。
如果你只是想知道它好不好用: 直接打官方 API,不用碰權重。模型從 7 月 16 日起就在線上,旗艦模型需先儲值(最低 1 美元)解鎖。花幾塊美金跑你自己的真實題目,比看任何排行榜都準。
如果你在評估要不要導入產品: 先讀一遍授權原文,確認你離那兩道規模門檻有多遠。多數團隊會發現自己根本碰不到,那就回頭看第一道門和第二道門的數字,決定要自架、用第三方託管,還是就打官方 API。
如果你是被「史上最大開源模型」吸引進來的個人使用者: 以官方建議的那種配置把完整版跑起來,對個人不是實際的選項。你能做的是把它當成一個新的 API 選項納入比較,並留意接下來幾週會不會出現量化版本。不要因為這則新聞去買硬體。
一句話
Kimi K3 把「最大的開放權重模型」這個紀錄推到了 2.8 兆,但權重公開降低的是取得門檻,不是使用成本——實測 1.56TB 的體積、官方建議的 64 顆加速器,加上一份寬鬆卻設了規模門檻的授權,這三件事合起來的意思是:它對你是一個新的 API 選項,不是一台你會搬回家的機器。
本文事實整理自 Moonshot AI 官方技術部落格與 Kimi 開發者平台文件(模型規格 2.8 兆參數/896 專家啟用 16/100 萬 token 上下文/MXFP4 權重與 MXFP8 activation/KDA 與 AttnRes 架構/原生視覺能力/基於推論效率而「建議」部署於 64 顆以上加速器的 supernode/API 定價 0.30 與 3.00 與 15.00 美元/官方稱其 API 在程式類工作負載的快取命中率超過 90%/權重「will be released by July 27, 2026」),以及 Hugging Face 上
moonshotai/Kimi-K3的 repo metadata 與檔案清單(於台北時間 2026 年 7 月 29 日上午擷取:metadata 顯示最後更新於 UTC 2026-07-27 16:29(此為 metadata 更新時間,非權重首次可下載時刻)、96 個 safetensors 檔合計 1,560,936,091,448 位元組、未設下載限制、該官方帳號清單中僅此一個 K3 repo)與同址取得的 Kimi K3 License 全文。以下事實不在官方公告裡,另有來源:排名數字來自 Interconnects(Nathan Lambert,2026-07-20)與 Northflank(標註 2026-07-17 查證)兩份第三方整理,兩者在 Artificial Analysis 上名次不同,文內已標明為快照;「API 自 7 月 16 日起提供」與「MXFP4 原生支援 Blackwell 與 MI400 世代」出自 TECHi;租金試算(64 顆 H100、每 GPU 每小時 3.99 美元、一天約 6,100 美元)出自 Popular AI(2026-07-25)作者的示範換算,非 Moonshot 報價;Google Cloud 8 張 H200 每小時 84.81 美元為公開牌價。GPT-5.6 三檔與 Claude Opus 5 價格為各廠商官方公告價。
以下是本站自己的推算或詮釋:1.56TB 為實測檔案加總(非推算),由此回除的「每參數平均約 4.46 位元」與「用參數量乘量化位元數估體積會系統性偏低」是本站的計算與詮釋;5.6TB 為同批權重換算 16 位元的算術結果;「一個 8 張 192GB 的節點放不下完整權重」是以標稱容量 1,536GB 對照實測 1,560.9GB 的算術結果;「4.07 億個輸出 token」是以上述租金除以官方輸出單價得到的只比較輸出費的等價量,明確不是總成本回本點(未計入輸入費,也未計入自架側的電力、機房、維運與可用性成本;兩者對分界線的作用方向相反,故全成本分界線相對於此數字的高低,本文未下斷言);「H100 的試算偏樂觀」是基於 MXFP4 原生支援世代的推論。授權條款的整理逐條對應 Kimi K3 License 原文,本站未對條文做法律解釋;「多數團隊碰不到那兩條線」是基於門檻數值的判斷,不是條文本身的表述。
常見問題
Kimi K3 是什麼?跟 Kimi K2 系列差在哪?
Kimi K3 是 Moonshot AI 的新一代旗艦模型,總參數 2.8 兆,採混合專家(MoE)架構,896 個專家中每次只啟用 16 個,具備 100 萬 token 的上下文長度,並具原生視覺能力。官方在技術部落格把它描述為世界第一個開放的 3 兆等級模型。架構上的兩個新元件是 Kimi Delta Attention(KDA)與 Attention Residuals(AttnRes)。與前一代的差距,第三方整理引用 Artificial Analysis 的合成指數:Kimi K2.6 為 44,K3 為 57(該站 2026 年 7 月中的快照)。
我可以自己下載 Kimi K3 架在自己的機器上嗎?
權重已公開下載,但個人電腦跑不動完整版。權重以 MXFP4 四位元格式為主,實測 96 個檔案合計約 1.56TB(十進位,即 1.42TiB),比用參數量乘以四位元推算的 1.4TB 高出約一成;若換成 16 位元精度則約 5.6TB。Moonshot 官方基於推論效率,建議部署在「64 顆以上加速器的 supernode 配置」(這是建議配置,官方並未公布最低可運作的卡數)。以消費級顯示卡而言,即使是 32GB 的 RTX 5090 也與這個量級差了好幾個數量級。實務上一般使用者的可行路徑是呼叫 API,或使用第三方託管服務。
Kimi K3 的 API 多少錢?比 Claude 或 ChatGPT 便宜嗎?
官方定價為每百萬 token:快取命中的輸入 0.30 美元、未命中的輸入 3 美元、輸出 15 美元。與其他旗艦模型相比,它的標價比 Claude Opus 5 的 5 美元/25 美元低,也比 GPT-5.6 Sol 的 5 美元/30 美元低;但對上 GPT-5.6 Terra 的 2.50 美元/15 美元,K3 的輸出價完全相同、未命中的輸入還略高一點。要注意的是輸入分兩段計價,官方在技術部落格中表示其 API 在程式類工作負載上的快取命中率超過 90%,命中價只要 0.30 美元,因此實際帳單高低取決於雙方各自的快取命中率,不能只看標價下定論。可以確定的是:「開放權重」本身並沒有在官方 API 這一層換成更低的標價。
自架和直接呼叫 API,成本的分界點大概在哪?
可以先用一個換算抓量級,但要清楚它的限制。若以第三方文章示範的租用配置估算,64 顆加速器一天的租金約 6,100 美元;同樣的錢若只拿來買官方 API 的輸出,以每百萬 token 15 美元計算,大約等於 4.07 億個輸出 token。這是「只比較輸出費的等價量」,不是總成本的回本點。其他條件不變、只把 API 輸入費加進去的話,同一筆帳單會在更低的輸出量就達到;但反過來,自架那一側的電力、機房、維運人力與可用性責任也還沒計入,方向相反。兩者相抵之後,全成本的分界線究竟比這個數字高還是低並不確定,取決於你自己的輸入輸出比與自架成本。因此它只能用來判斷這是幾百萬還是幾億 token 等級的問題,實際該不該自架要用你自己的數字重算。
「開放權重」等於開源嗎?可以商用嗎?
兩者不一樣。開放權重指的是模型參數可以下載,不必然包含訓練資料、訓練程式碼,也不必然給予寬鬆的商業使用授權。Kimi K3 隨權重公布了自訂的 Kimi K3 License:授權範圍很寬,允許使用、修改、散布、再授權、販售與商業部署,前提是在所有副本或實質部分保留著作權與授權聲明,並遵守適用的法律法規。在這之上另有兩項以規模為觸發點的額外要求。其一,若你經營條文定義的 Model as a Service 業務,且你與關係企業在任何連續十二個月的總營收超過兩千萬美元,須先與 Moonshot AI 另行簽約才能用於商業用途;其二,若用於月活躍使用者超過一億或月營收超過兩千萬美元的商業產品,須在介面上顯著標示 Kimi K3。純內部使用,以及透過 Moonshot 官方產品或其認證推論夥伴的使用,可免除這兩項額外要求(保留聲明與遵法的前提仍在)。以上為條文整理,不是法律意見。
📚 收進你的工具
For AI Reading Era把這篇文章交給你日常用的工具——做研究、整理筆記,或當 AI 的 context。