aire.
·11 分鐘

GPT-6 Astra 的牌價和 Claude Fable 5.1 一模一樣,帳單不會一樣

OpenAI 9 月 3 日發布 GPT-6 Astra,API 定價每百萬 token 輸入 10 美元、輸出 50 美元,和 Anthropic 的 Claude Fable 5.1 同價。把兩份官方定價頁往下多看四行,快取讀取 Astra 是 4 倍、超過 272K 的請求整份重新計價、兩邊的 token 也不是同一種切法。另外,官方發布頁寫「所有 ChatGPT Plus 使用者」,官方說明頁寫的是 Plus 在 Chat 裡拿不到。

收進
本文涉及工具

9 月 3 日 OpenAI 發布 GPT-6 Astra,API 定價寫在公告的 Availability 一節:每百萬輸入 token 10 美元、輸出 50 美元。

打開 Anthropic 的官方定價頁,Claude Fable 5.1 那一列是同樣的兩個數字。

兩家旗艦模型的檯面價相同。有意思的是往下多看幾行:決定帳單長什麼樣的那幾個欄位,多數對不起來。而 OpenAI 共同創辦人暨總裁 Greg Brockman 在發布當天的簡報上講了一句話,剛好把這件事說完了。

檯面價相同,往下幾格對不起來

兩邊都是官方定價頁上的數字,單位都是每百萬 token。

項目 GPT-6 Astra Claude Fable 5.1
輸入 10 美元 10 美元
輸出 50 美元 50 美元
快取讀取 1 美元 0.25 美元
快取寫入 12.5 美元 12.50 美元(5 分鐘)/20 美元(1 小時)
Batch 5 折 5 折
超長輸入加價 超過 272K 有
脈絡窗 1,050,000(輸入上限 922,000) 1,000,000

快取讀取那一格,Astra 的價格是 Fable 5.1 的 4 倍。Anthropic 是 9 月 1 日發布 Fable 5.1 時把這格從 1 美元降到 0.25 美元的,官方的說法是這一版的快取命中價格是基礎輸入價的 0.025 倍,其他模型走的是標準的 0.1 倍。這件事站內已經拆過一次,重點是它只對反覆讀同一份 context 的用法有意義,短問答一毛都不會省。

超長輸入那一格值得單獨看,因為它是本次最容易被漏掉的一條。OpenAI 的模型文件寫的是:

Prompts with more than 272K input tokens are priced at 2x input and cache rates and 1.5x output for the full request.

句尾 for the full request 這幾個字是關鍵。超過 272K 之後不是只有超出的部分變貴,是整份請求改用加價費率。一份 273,000 token 的請求,前面那 272,000 個 token 也一起漲。

Anthropic 那邊在同一件事上的官方寫法是:

Claude 4.6 and later models and Claude Mythos Preview include the full 1M token context window at standard pricing. (A 900k-token request is billed at the same per-token rate as a 9k-token request.)

括號裡那句是官方自己加上去的:90 萬 token 的請求和 9,000 token 的請求,每個 token 的費率一樣,所以 Anthropic 這邊不存在一條會讓整份請求跳價的線。

還有一格是不對稱的:Astra 在 API 上有 Fast 模式,官方寫的是最高 2 倍速、2 倍價。Anthropic 的 Fast 模式支援清單只列了 Claude Opus 5 與 Claude Opus 4.8,沒有 Fable 5.1。官方沒有寫過「Fable 5.1 不支援」這種否定句,那份清單是窮舉的寫法,這是清單上的缺席,不是官方的否認。

同一段文字,兩邊切出來的 token 數本來就不一樣

上面整張表都建立在一個沒人明講的假設上:兩邊的 token 是同一種東西。它不是。

Anthropic 在自家文件裡把這件事寫得很清楚。Fable 5.1 的更新說明裡有一行:

Tokenizer: the same as Claude Fable 5 (introduced with Claude Opus 4.7). Compared with models older than Claude Opus 4.7, the same text produces roughly 30% more tokens.

定價頁上也有對應的一段,說 Claude 4.7 之後的模型換了新的 tokenizer,同樣的文字會產生大約多 30% 的 token,實際增幅取決於內容與工作型態。

要注意這個 30% 的比較對象。它是 Anthropic 拿自己的新舊模型比,不是拿自己跟 OpenAI 比。沒有任何官方來源做過跨廠商的 token 換算比較,所以「Claude 比 GPT 多切幾成」這種話沒有依據,這裡也不會這樣寫。

但這段揭露本身已經足夠說明一件事:token 是每個模型家族自己定義的計價單位,連同一家的前後代都可以不一樣,所以兩張定價表上同樣的 10 美元,換算回「一份 5,000 字的文件要多少錢」的時候,得到的並不是同一個數字。

同一個模型、同一個測驗,換一個 harness 分數從 62.7% 變 99.9%

OpenAI 的發布頁列出 Astra 在 ARC-AGI-3 拿到 99.9%,那一格掛了一個腳註,說這次是用 OpenAI 自家的 Responses API harness 跑的,調整了兩個設定以更貼近真實表現。

ARC-AGI-3 的持有方 ARC Prize 在同一天發表了自己的測試結果,把這件事攤開了。

推理強度 標準 harness Provider Adapter harness
max 62.7%,26,098 美元 98.6%,17,332 美元
xhigh 59.3%,37,317 美元 98.4%,18,147 美元
high 54.8%,40,705 美元 99.9%,18,817 美元
medium 38.6%,48,090 美元 98.4%,19,285 美元
low 17.5%,38,166 美元 98.0%,21,298 美元
none 35.2%,49,791 美元 96.7%,23,457 美元

同一個模型、同一個測驗。走 ARC Prize 那套供應商中立的標準介面,各推理強度裡最好的成績是 62.7%,跑完花 26,098 美元;換成配合 OpenAI 自家脈絡管理功能的 harness,最好成績 99.9%,花 18,817 美元。

這兩個數字取的是各欄最佳值,落在不同的推理強度上,前者是 max、後者是 high,所以 harness 嚴格說不是唯一的變因。但把同一列的左右兩欄擺在一起看就很清楚:六個推理強度沒有一個例外,換上 Provider Adapter 之後分數都跳到 96% 以上。ARC Prize 的說明是,後者保留了模型看不見的推理狀態,並使用壓縮來處理較長的對話。以累計耗時計,Provider Adapter 的執行大約快 3.66 倍;以兩種 harness 都解出來的那 167 組配對為基準,它少用了 49% 的 token。

坊間流傳的 98.6% 和 99.9% 兩個版本都是對的,它們是同一張表的不同列,前者是 max、後者是 high。

這張表另外有一件事值得看:分數與費用都不是隨推理強度單調變化的。標準 harness 下,none 的 35.2% 高於 low 的 17.5%;Provider Adapter 下,high 的 99.9% 高於 max 的 98.6%;費用上 low 的 38,166 美元也比 medium 的 48,090 美元便宜。推理強度調高不一定換到更好的結果,這件事站內另一篇文章談過。

ARC Prize 自己對這組數字的定調寫得很直接:

Therefore, while we believe Astra represents meaningful progress towards generalization, we are not claiming that it is AGI.

這件事,OpenAI 自己的總裁講過一次

發布當天 OpenAI 開了一場媒體簡報,Brockman 在會上談到定價。以下兩段照出席該場簡報的 VentureBeat 記者所發表的原文抄錄,包含他們的引號與標點:

"Pricing tokens doesn't make any sense," Brockman said. "Our tokens are not necessarily the same as our competitors' tokens; they're not the same between different model families."

接著他說,市場真正該看的是完成一件事要多少錢:

"What you actually want, and I think the market is starting to really wake up to, is the price per task," Brockman said. "It's just about: can you get the thing done for an appropriate cost at appropriate speed?"

這是廠商在替自己的產品定位,不必照單全收。不過前面幾節的證據方向與他一致,而且最極端的一組不是來自定價表:同一個模型跑同一個測驗,只是換掉外面那層系統,帳單就從 26,098 美元變成 18,817 美元,成績從 62.7% 變成 99.9%。

發布頁寫「所有 Plus 使用者」,說明頁寫的是 Plus 在 Chat 裡沒有

實際能不能用到,官方有兩份文件在講,細緻度不同。

發布頁的原文是:

GPT‑6 Astra is rolling out today to a limited set of organizations and over the coming days will become available to all ChatGPT Plus, Pro, Business, and Enterprise users, as well as through the OpenAI API, Microsoft Azure, and AWS Bedrock.

官方說明中心那頁講得比較細:

GPT‑6 Pro, powered by GPT‑6 Astra, is rolling out in ChatGPT for Pro $100, Pro $200, Business and Enterprise plans. Enterprise access also depends on your workspace's model-access permissions. Plus plans include GPT‑6 Astra in ChatGPT Work and Codex as it rolls out. Rollout is gradual, and availability can differ between Chat, Work and Codex.

兩句話都成立,但講的不是同一件事。Chat 裡的 GPT-6 Pro 給的是 Pro 100 美元方案、Pro 200 美元方案、Business 與 Enterprise;Plus 方案拿到的是 ChatGPT Work 與 Codex 裡的 Astra。說明頁自己補了一句,開放是分批的,Chat、Work、Codex 三個地方的狀況可能不同。

另外幾件寫在官方文件裡、但不太會被轉述的事:

  • 企業版預設是關的,發布頁寫的是存取權限在發布時預設關閉,要管理員自己替工作區開啟。
  • Free 與 Go 方案不在名單上。這兩檔的預設模型是 GPT-5.6 Luna,站內拆過 GPT-5.6 那三個名字
  • 想在 Codex 裡用,官方註明 Codex CLI 要 0.153.0 或更新的版本。
  • 兩份文件對同一個東西用了兩個名字:發布頁叫 GPT-6 Astra Pro,說明頁叫 GPT-6 Pro。是同一個。
  • 走 API 的話,模型代號是 gpt-6-astra,沒有帶日期的版本快照。知識截止日是 2026 年 4 月 30 日,最大輸出 128,000 token。官方支援的 endpoint 是 Chat Completions、Responses 與 Batch,但官方的變更紀錄另外註明工具呼叫要走 Responses API,所以「支援 Chat Completions」不等於功能對等。

還有一件事值得講清楚:官方談開放進度的每一句都是進行式或未來式,rolling out、will become available、as it rolls out。到 9 月 5 日為止,沒有任何一份官方文件說開放已經完成。

拿到之後能用幾次,官方表列得很清楚

這是訂閱制使用者最該先看的一格。官方說明頁把話講死了:

GPT-6 Pro has usage limits. A Pro subscription does not include unlimited use of the GPT-6 Pro model.

方案 Chat 裡的 GPT-6 Pro 額度
Pro 200 美元 每週 200 則
Pro 100 美元 每週 50 則
Business Standard 每月 15 則
Business Premium 每週 50 則

除了 Pro 200 美元方案之外,這個額度是與 GPT-5.6 Sol Pro 共用的,在兩個模型之間切換不會讓你多拿訊息。Pro 200 美元方案是唯一不共用每週額度的,但它另外有一層每日的合計天花板:GPT-5.6 Sol Pro 每日 170 則,兩者加起來每日不超過 200 則。當週的 GPT-6 Pro 額度用完之後,ChatGPT 會自動改用 GPT-5.6 Thinking 的 Medium 推理強度。

Business Standard 每月 15 則這一格換算下來是每個工作天不到一則,如果用途是每天丟幾份長文件進去,這個額度大概第一週就會見底,之後要另外買 credits。

資安等級到了 Critical,代價是你的任務可能被停下來

Astra 是 OpenAI 第一個在自家應變整備框架下被評為「關鍵」等級網路安全能力的模型。這是官方自陳,中文版原文是:

我們現在認為,Astra 已達到應變整備框架中的「關鍵」網路安全能力門檻;也就是說,只要具備適當工具與存取權限,它無須人員逐步引導,就能在許多防護嚴密的系統中找出過去未知的安全缺陷,並開發利用方式。這是我們首度將模型評定為此等級,因此在開發期間及發布前都需要更強的防護措施。

順手更正一個常見的轉述:這個框架不是「低、中、高、關鍵」的四級制。把框架文件抓下來全文檢索,Critical 出現 23 次、High 出現 30 次,Medium 與 Low 一次都沒有出現。文件裡的能力門檻就是 High 與 Critical 兩級,Critical 是較高的那一級。

動詞也值得留意。8 月初 OpenAI 的說法還是「排除不了」達到關鍵等級,並且明講當時尚未如此分級;9 月 3 日的系統說明卡才寫成已經達到。兩個時間點講的不是同一件事。

對一般使用者來說,真正會碰到的是副作用。官方中文版寫得很白:

系統偶爾可能將正當活動標記為疑似網路濫用或未經授權的行為,導致活動意外減慢、暫停或中止。這可能包括表面上與網路安全無直接關係的工作,或智慧體長時間執行的任務。

被攔下來之後的處理方式,兩邊不一樣:

如果對齊偏差監控器暫停任務,ChatGPT 或 Codex 使用者可能會被要求先檢視該行動,才能繼續。使用 API 等其他介面時,任務將會停止。

在 ChatGPT 或 Codex 裡你會看到一個要你確認的提示,在 API 上任務就是停了。如果你把 Astra 接進一條沒人看著的自動化流程,這一條要先想清楚。

今天上線的這個版本另外會拒絕比較進階的資安要求,例如產生概念驗證漏洞利用程式。官方寫的是計畫在未來數週透過 Daybreak 放寬。順帶更正一個常見的轉述:Daybreak 不是這次為了 Astra 開的早鳥名單,它是 OpenAI 今年稍早就啟動的資安防禦者計畫,官方說已有 2,000 個核准組織與工作區在用。官方發布頁對首波開放對象的用字是「a limited set of organizations」,並沒有把 Daybreak 寫進首發條件,「首波就是 Daybreak 企業」的說法來自媒體的補充推論。

連 OpenAI 自己的對照表,都有幾格是輸的

發布頁附了一張對照表,把 Astra 和 GPT-5.6 Sol、Claude Fable 5.1、Claude Fable 5、Claude Opus 5、Gemini 3.8 Flash 排在一起。多數格子是 Astra 高,但有幾格不是:

項目 GPT-6 Astra 對手
Artificial Analysis Intelligence Index v4.1.1 61.2 Claude Fable 5.1 為 65.7
Humanity's Last Exam(含工具) 57.2% Claude Fable 5.1 為 65.0%
Artificial Analysis Coding Agent Index v1.4 67.0 Claude Fable 5 為 67.2、Claude Opus 5 為 68.1
FrontierCode 1.1 Main 53.3% Claude Fable 5 為 53.5%、Claude Opus 5 為 53.4%(三者實質同分;同一列的 Claude Fable 5.1 是 50.9%,Astra 較高)

這張表是發布方自己選的對照組與設定,表尾官方也註明分數取的是各推理強度中的最高值,不是獨立評測,方向本來就會偏向自己。所以這幾格的意思不是「Fable 5.1 比較強」,而是連發布方自己挑的表裡都留著這幾格

同一張表還有幾個腳註值得一起讀。ScreenSpot-Pro 與 ExploitGym 兩列掛在 Fable 欄位下的分數,官方註明實際上是 Mythos 跑的,那是護欄較少的版本。Claude Fable 5 與 Fable 5.1 在三項生命科學評測裡缺席,官方給的理由是這兩個模型拒答了大部分題目,不是分數低。HealthBench 那一列的 Claude 分數是 OpenAI 自己跑的,並且對 Fable 5.1 用了 Opus 5 當拒答時的備援。表格裡的「-」代表官方沒列,不代表對手做不到。

給非工程師的一句話

兩邊的旗艦模型現在同一個檯面價,所以價格本身已經不是選擇的理由了;決定實際付多少的是快取讀取佔帳單的比重、單次請求會不會越過 272K 那條線,以及同一件事要重跑幾次。對訂閱制使用者來說,更貼近日常的數字其實不是每百萬 token 多少錢,而是自己那一檔每週或每月有幾則額度。

常見問題

GPT-6 Astra 的 API 要多少錢?

官方標準費率是每百萬輸入 token 10 美元、輸出 50 美元。另外三個欄位官方也寫明了:快取讀取每百萬 1 美元、快取寫入 12.5 美元(等於未快取輸入價的 1.25 倍);Batch 與 Flex 是標準價的 5 折;Fast 模式是適用費率的 2 倍。還有一條容易漏看的規則:輸入超過 272K token 的請求,輸入與快取費率變 2 倍、輸出變 1.5 倍,而且是整份請求都套用,不是只算超出的部分。

GPT-6 Astra 和 Claude Fable 5.1 哪個便宜?

檯面價完全相同,都是輸入 10 美元、輸出 50 美元,Batch 也都是 5 折。差別在三個地方:快取讀取 Astra 是 1 美元、Fable 5.1 是 0.25 美元,Astra 是 4 倍;超長輸入的加價 Astra 有、Anthropic 官方明寫整個 100 萬 token 視窗都是同一個費率;兩家的 token 切法不同,同一段文字換算出的 token 數不會一樣。所以哪個便宜取決於你的用法,尤其取決於帳單裡快取讀取佔幾成、以及單次請求會不會超過 272K。

ChatGPT Plus 用戶拿得到 GPT-6 Astra 嗎?

看你在哪個產品裡用。官方發布頁寫的是未來數日會開放給所有 Plus、Pro、Business 與 Enterprise 使用者,但官方說明中心寫得更細:Chat 裡的 GPT-6 Pro 是給 Pro 100 美元方案、Pro 200 美元方案、Business 與 Enterprise,Plus 方案拿到的是 ChatGPT Work 與 Codex 裡的 Astra。說明頁也寫明開放是分批進行的,Chat、Work、Codex 三個地方的狀況可能不同。Free 與 Go 方案不在名單上,這兩檔的預設模型是 GPT-5.6 Luna。

訂閱方案裡的 GPT-6 Pro 可以無限用嗎?

不行,官方說明頁直接寫了 Pro 訂閱不包含無限使用。Chat 裡的額度是:Pro 200 美元方案每週 200 則、Pro 100 美元方案每週 50 則、Business Standard 每月 15 則、Business Premium 每週 50 則。除了 Pro 200 美元方案之外,這個額度是與 GPT-5.6 Sol Pro 共用的,換模型不會多拿訊息。Pro 200 美元方案用完當週額度後,ChatGPT 會自動改用 GPT-5.6 Thinking 的 Medium 推理強度。

Astra 達到 Critical 資安門檻,對一般使用者有什麼影響?

官方明說會有副作用。發布頁與官方中文版都寫到,額外的安全檢查有時會減慢、暫停或中止正當工作,包括與資安無直接關係的工作,以及代理程式長時間執行的任務。被攔下來時,ChatGPT 或 Codex 使用者會被要求先檢視該動作才能繼續;走 API 的話,任務會直接停止。另外這次上線的版本會拒絕較進階的資安要求,例如產生概念驗證漏洞利用程式。

Astra 在 ARC-AGI-3 拿 99.9%,代表它是 AGI 了嗎?

基準的持有方 ARC Prize 自己說不是。他們在 9 月 3 日的說明裡寫明,當初推出 ARC-AGI-3 時就講清楚把這個基準做滿並不代表證明達成 AGI,並且直接表示他們沒有主張 Astra 是 AGI。同一份說明也顯示,同一個模型用 ARC Prize 的標準 harness 跑是 62.7%、換成配合 OpenAI 自家脈絡管理功能的 harness 才是 99.9%,分數差距來自模型外面那層系統。

📚 收進你的工具

For AI Reading Era

把這篇文章交給你日常用的工具——做研究、整理筆記,或當 AI 的 context。

 
延伸閱讀