Gemini 4 Argon 還買不到,成績單卻有一半是 Google 自己跑的
Google 9 月 30 日宣布 Gemini 4 Argon,附了一張 18 項基準的比較表。Google 的評測方法說明把其中 9 項歸為第三方榜單的成績,另外 9 項的 Argon 分數由 Google 自己跑。Argon 目前只透過 Fairwind 計畫開放給受信任的網路防禦者,Gemini API 定價頁查不到它;官方寫的介紹價是輸入 2 美元、輸出 10 美元,介紹期哪天結束沒寫,官方寫的 1M 是輸出上限、不是 context window。本站的判斷:這張表值得追蹤,還不是換模型的理由。
Gemini 4 Argon 的發布比較表有 18 項基準。其中 9 項,Argon 那一格的分數是 Google 自己跑出來的。
這裡說的是「Argon 的分數由誰跑」,不是指那 9 個基準由 Google 出題。另外 9 項,Google 的評測方法說明(Methodology)把它們歸為第三方榜單的成績;這 9 項裡,Argon 在 RiemannBench 的 76.0%,目前在 Surge 的公開榜單頁上讀不到。
表上的 Argon,今天一般開發者還買不到。Google 9 月 30 日的公告寫,Argon 正透過 Fairwind 計畫開放給一批受信任的網路防禦者。到 10 月 3 日為止,Gemini API 的定價頁與公開模型清單都查不到 Argon。
本站的判斷是:這張表現在是一張值得追蹤的成績單,還不是換模型的理由。這個判斷靠兩個前提。第一,一般開發者今天買不到 Argon。第二,表上多數分數能不能拿來互比,要看每一格是怎麼跑的。兩個前提任何一個改變,判斷就要重做。
事實分級:Argon 的可用範圍、價格、規格與基準分數來自 Google 9 月 30 日的 Argon 官方頁、繁體中文版公告與官方頁連結的評測方法說明(Methodology);Fairwind 的資格來自 Google DeepMind 的 Fairwind 專頁。對手的價格與規格來自 OpenAI 與 Anthropic 的官方文件。榜單數字對照 Zapier、Proximal、Surge、CWE-bench、Agents' Last Exam、Terminal-Bench 的公開頁(10 月 3 日讀取)。官方沒寫的:Argon 的 context window、介紹期結束日。沒有驗證的:Gemini app 與 Google AI Studio 登入後的模型選單。
Argon 9 月 30 日宣布,對外只開放給 Fairwind 計畫的受信任防禦者
Google 的 Argon 官方頁日期是 9 月 30 日,換成台北時間是 10 月 1 日凌晨 4 點;繁體中文版公告在 10 月 1 日上線。署名作者是 Google DeepMind 資深副總裁暨 Google 首席 AI 架構師 Koray Kavukcuoglu。
公告第一段就講了開放範圍:Argon 正在透過 Fairwind 計畫,開放給一批受信任的網路防禦者。Google 自己的團隊已經在用:公告另外寫,Argon 已經在驅動 Google 內部的工作流程,數千名 Google 員工提到它在專門的程式任務、深入研究和寫作品質上的強項。第二段接著寫,Google 正配合美國政府的自願性計畫,在模型正式發布前先開放權限讓相關單位評估,並且會在逐步擴大開放的同時蒐集早期測試者的回饋、調整護欄,之後才會盡快開放給開發者、企業與一般消費者。
文末「Rolling out soon」一節把順序再寫一次:正式開放時,先給付費 API 客戶與 Google AI Ultra 訂閱者。這一句沒有日期。Google 10 月 2 日發布的 9 月彙整頁,對 Argon 的說法也一樣:目前透過 Fairwind 開放、持續蒐集回饋、之後再擴大,同樣沒有日期。
Fairwind 不是為 Argon 新開的門。它是 9 月 2 日隨 Gemini 3.8 Flash 與 3.8 Flash Cyber 一起推出的有限存取計畫,對象是政府與國家網安機關、關鍵基礎設施營運者、核心技術平台,也接受聚焦防禦基準的學術實驗室。申請要填表,還要經過背景審查。DeepMind 的 Fairwind 專頁現在寫,一部分 Fairwind 夥伴取得 Argon 的獨家存取,夥伴總數超過 650 個。
進了門也有規矩。夥伴只能拿 Argon 做兼具攻防用途的防禦與研究任務,只能給內部的資安、事件應變與滲透測試團隊使用,不得轉售或再散布。透過 Gemini Enterprise 以代管模型提供時,支援零資料保留。
一般開發者那一側,查得到的是空白。Gemini API 的定價頁、模型清單頁,還有 Google Cloud 的 Google 模型清單頁,都還沒有 Argon;3.8 Flash 在這些頁面上都查得到。Gemini app 與 Google AI Studio 登入後的模型選單沒有驗證過,能確定的只有公開文件與清單查不到 Argon。
先給審核過的對象、晚一點才一般開放,這個節奏在前沿模型上不是第一次,站內有六月底的整理,寫過 GPT-5.6 的先例。Argon 目前的狀態是:先給審核過的對象,一般開放的日期還沒寫。
標準價是 Astra 的 4 成,在 AutomationBench 上每個任務的成本卻差不多
Argon 的價格目前只寫在公告裡,而且用的是未來式:「Argon will launch at an introductory price」,Argon 將以介紹價推出。介紹價是每百萬輸入 token 2 美元、輸出 10 美元,快取輸入比輸入價便宜 95%。
介紹價後面掛了一個註腳:
After the introductory period expires, the price of $4 per 1M input tokens and $20 per 1M output tokens will apply.
介紹期結束後,標準價是輸入 4 美元、輸出 20 美元。繁中版的寫法是「優惠期結束後,將恢復標準計費」。介紹期哪一天結束,官方頁、繁中頁、9 月彙整頁、Fairwind 頁都沒寫,Gemini API 定價頁也還沒有 Argon 這一列。
每百萬 token 牌價(美元)
| 模型 | 輸入 | 輸出 | 快取讀取 | 價格狀態 |
|---|---|---|---|---|
| Gemini 4 Argon 介紹價 | 2 | 10 | 官方只寫比輸入價便宜 95%,沒給美元數 | 公告寫將以此價推出,介紹期結束日沒寫 |
| Gemini 4 Argon 標準價 | 4 | 20 | 同上 | 介紹期結束後適用 |
| GPT-6 Astra | 10 | 50 | 1 | 官方定價已列 |
| Claude Fable 5.1 | 10 | 50 | 0.25 | 官方定價已列 |
| Claude Opus 5.5 | 4 | 20 | 0.20 | 官方定價已列 |
把牌價對齊,Argon 標準價的輸入與輸出都是 Astra 和 Fable 5.1 的 4 成(4÷10、20÷50),和 Opus 5.5 同價;介紹價則是 Astra 和 Fable 5.1 的 2 成。快取的美元價 Google 還沒公布。超長輸入要不要加價,Argon 公告也沒提;Astra 有一條超過 272K 整份加價的規則,站內拆 Astra 定價時寫過。Opus 5.5 和 GPT-6 Sol/Luna 的價格怎麼比,站內另有一篇。
但單價不等於帳單。各家的 token 切法不同,同一段文字算出來的 token 數不一樣,單價 4 成不代表同一個任務的帳單也是 4 成。
剛好有一個榜單直接算了帳。Zapier 的 AutomationBench 榜單(1.0.6 版)在分數旁邊多給了一欄「Cost / task」,也就是每完成一個任務花多少錢。
Zapier AutomationBench:分數與每任務成本(標準牌價)
| 模型(設定) | 分數 | 每任務成本 |
|---|---|---|
| Gemini 4 Argon(High) | 51.29% | 1.70 美元 |
| Gemini 4 Argon(Medium) | 50.08% | 1.54 美元 |
| Claude Opus 5.5(default fallbacks, Max) | 42.47% | 1.44 美元 |
| GPT 6 Astra(Max) | 41.4% | 1.73 美元 |
照標準牌價算,Argon(High)每個任務 1.70 美元,Astra(Max)1.73 美元,相差 0.03 美元。單價只有 4 成,每個任務的成本卻幾乎一樣。合理的讀法是 Argon 在這組任務上計費的 token 比較多;這是從價格反推的,榜單沒有直接寫。
榜單的排名與成本欄用的都是標準牌價,註腳另外列了促銷價:Argon(High)每個任務 0.85 美元,Argon(Medium)0.77 美元。照促銷價算,Argon(High)每個任務的成本大約是 Astra(Max)的一半(0.85 對 1.73);照標準牌價,兩邊就回到差不多。
這組數字只代表 AutomationBench 這一個基準的這一次測量,換一個工作負載,token 用量的比例會不一樣。還有一件 Argon 公告沒寫的事:輸出價包不包含思考 token。CWE-bench 榜單替 Argon 算成本時,寫的是思考 token 也算在內。
官方寫的 1M 是輸出上限,Argon 的 context window 官方沒寫
Argon 公告講規格的那一段是這樣寫的:
we are significantly expanding the model’s output token limit to an industry-leading 1M tokens, up from the previous 64K tokens.
主詞是 output token limit,也就是輸出 token 的上限,從 6 萬 4 千提高到 100 萬。繁中版寫的也是「輸出詞元上限」。
同一頁的上方,寫法不一樣。官方頁頂部有一段由 Google AI 產生的摘要,寫的是「1 million token limit」,沒有 output 這個字;正文往下才寫明是輸出上限。查到的報導裡,有 3 家把這個數字寫成 context window,也有媒體寫對。
Argon 的 context window 到底多大,官方頁與 API 文件都沒寫。對手三家都寫了。OpenAI 的模型文件寫,GPT-6 Astra 的 context window 是 1,050,000 token、輸出上限 128,000。Anthropic 的文件寫,Claude Fable 5.1 的 context window 是 1M、輸出上限 128K;Claude Opus 5.5 也是 1M 與 128K。
所以在容量規格上,四個模型能並排比的只有輸出上限:Argon 1M,另外三家都是 128K。輸入能塞多少,Argon 那一格目前是空的。
Google 在公告裡講的用途在輸出這一側:讓模型有餘裕深入思考,在單次推演裡生成數十萬個 token。
18 項基準分三種來源,Argon 在每一種的成績都不一樣
Google 的比較表把 Argon 和 GPT-6 Astra、Claude Fable 5.1、Claude Opus 5.5 並排,一共 19 列。GraphWalks 分成兩個長度子集,算一項,所以是 18 項。
每一格分數從哪裡來,寫在比較表底下連結的評測方法說明(Methodology)裡。開頭先定了預設值:非 Gemini 模型的分數,除非下面另外註明,都取自廠商自報;Astra、Fable 5.1、Opus 5.5 預設取各自可用的推理強度上限的成績。往下逐項看註明,18 項可以分成三類。下面這張表的重點在最右邊三欄:同樣是 Argon,三類來源下的成績不一樣。
Google 比較表 18 項基準的來源分類(依 Google Methodology)
| 來源類 | 項數 | 基準 | Argon 第一 | 並列 | 沒贏 |
|---|---|---|---|---|---|
| A:Methodology 歸為第三方公開榜單 | 9 | Vals Index、AutomationBench、Vals Finance Agent v2、Harvey's Legal Agent Benchmark、FrontierSWE v2、Vibe Code Bench、RiemannBench、Chartography、CWE-bench v1 | 7 | 1 | 1 |
| B:Argon 由 Google 自己跑,對手取榜單或廠商自報 | 5 | DeepSWE v1.1、Terminal-Bench 4.0、Terminal-Bench Science 0.1、Agent's Last Exam、OSWorld 2.0 | 2 | 0 | 3 |
| C:四個模型全由 Google 自己跑 | 4 | PostTrainBench、LABBench2、GraphWalks(兩個子集)、LVBench | 3 | 0 | 1 |
| 合計 | 18 | 12 | 1 | 5 |
A 類 9 項,Methodology 寫的是取自 Vals AI、Zapier、Proximal、Surge、CWE-bench 等公開榜單,Argon 和對手的分數從同一處來。B 類 5 項,Argon 的分數由 Google 自己跑;對手那幾格,Terminal-Bench 兩項與 Agent's Last Exam 取自榜單,DeepSWE v1.1 的 Astra 取自榜單、兩個 Claude 模型取自各自的 system card,OSWorld 2.0 的 Astra 取自 OpenAI 的部落格。B 類 5 項的共同點只有一個:Argon 那一格是 Google 跑的。C 類 4 項,四個模型的分數全部由 Google 自己跑。
Argon 沒贏的 5 項,括號裡是該項表上分數高的對手:FrontierSWE v2(Astra 65.5%)、Terminal-Bench 4.0(Opus 5.5 66.4%)、Terminal-Bench Science 0.1(Astra 68.1%)、OSWorld 2.0(Astra 72.6%)與 PostTrainBench(Opus 5.5 49.3%)。寫程式的代理任務那 4 項,Argon 贏 DeepSWE v1.1 與 Vibe Code Bench,輸 FrontierSWE v2 與 Terminal-Bench 4.0。
這個分類說明的是「這一格是誰跑的」,不說明哪一類比較可信。數字也不支持「自己跑就贏比較多」的讀法:全由 Google 自跑的 C 類,Argon 贏 4 項裡的 3 項;同樣是 Argon 自跑的 B 類,只贏 5 項裡的 2 項。A 類也不等於 Google 沒經手:榜單上的 Argon 分數是榜單收錄的,是不是 Google 提交的,從公開頁看不出來。
A 類裡有一格要多帶一句,就是 RiemannBench 的 Argon 76.0%。Surge 的公開榜單上,Astra 72%、Opus 5.5 69.6%、Fable 5.1 65.6% 都和 Google 的表對得上,Argon 這一行目前讀不到。
Astra 的 Agent's Last Exam 是 34.2% 還是 59.3%?兩個數字都在同一個榜單上
Google 的比較表上,GPT-6 Astra 的 Agent's Last Exam(ALE)是 34.2%。OpenAI 自己的 Astra 發布頁,同一個基準寫的是 59.3%。差了 25.1 個百分點。
答案在榜單本身。ALE 的公開榜單分五個分頁,Google 與 OpenAI 的數字都對得上 Overall 分頁。Overall 分頁上每個模型有兩欄:Pass Rate 與 Score。Astra 的 Pass Rate 是 34.2、Score 是 59.3;Opus 5.5 的 Pass Rate 是 38.2、Score 是 63.2。
Google 的 Methodology 寫了「We report the binary pass rate」,用的是 Pass Rate 欄。OpenAI 頁沒有註明 59.3% 是哪一欄,但這個數字對得上 Score 欄。所以最合理的讀法是:兩家寫的是同一個榜單、同一個模型的兩個指標。
同一個模型、同一個基準名稱,數字對不上的情況,表上至少還有兩種。
同一個模型、同一個基準名稱,兩個數字
| 基準 | 模型 | Google 表 | 另一個數字 | 兩個數字的出處 |
|---|---|---|---|---|
| Agent's Last Exam | GPT-6 Astra | 34.2% | 59.3%(OpenAI 頁) | 同一榜單的 Pass Rate 欄與 Score 欄 |
| Agent's Last Exam | Claude Opus 5.5 | 38.2% | 63.2%(榜單 Score 欄) | 同上 |
| Terminal-Bench 4.0 | Claude Fable 5.1 | 57.9%(榜單 57.88%) | 55.8%(Anthropic 自報) | 榜單與廠商自報 |
| Terminal-Bench 4.0 | GPT-6 Astra | 58.2%(榜單 58.18%) | 57.9%(OpenAI 頁) | 榜單與廠商自報 |
| Terminal-Bench Science 0.1 | GPT-6 Astra | 68.1%(Google 寫取自榜單) | 64.6%(OpenAI 頁) | 兩個來源 |
| Terminal-Bench 4.0 | Claude Opus 5.5 | 66.4%(Google 寫取自榜單) | 榜單頁找不到這一列 | 66.4% 出現在 Anthropic 的 Opus 5.5 公告頁 |
第二種是廠商自報與榜單不同。Terminal-Bench 4.0 的榜單上,Fable 5.1 是 57.88%、Astra 是 58.18%,Google 的表寫成 57.9% 與 58.2%;Methodology 說取的是榜單上各模型分數較高的那個推理強度。兩家廠商自己公布的數字比較低:Anthropic 報 Fable 5.1 是 55.8%,OpenAI 報 Astra 是 57.9%。
第三種是表上標示的來源與查到的來源不一致,原因未明。Google 表上 Opus 5.5 的 Terminal-Bench 4.0 是 66.4%,比 Argon 的 57.4% 高 9 個百分點。Methodology 寫 Argon 以外的模型都取自官方公開榜單;但 10 月 3 日的 Terminal-Bench 4.0 榜單頁上,找不到 Opus 5.5 這一列,也找不到 66.4 這個數字。榜單上 Claude 系列最高的兩列,Fable 5.1 是 57.88%、Opus 5 是 53.94%。
66.4% 出現在 Anthropic 的 Opus 5.5 公告頁,是 Anthropic 自報、xhigh 推理強度的成績。這一格標示的來源是榜單,查到的來源是廠商公告,兩者對不上的原因,公開資料看不出來。
不是每一格都對不上。DeepSWE v1.1、AutomationBench、OSWorld 2.0,以及 Terminal-Bench Science 0.1 的 Fable 5.1,OpenAI 頁和 Google 表寫的是同一個數字。讀比較表時,同名的基準要先確認是哪一欄、誰報的,再拿來比。
同一個 LVBench,Argon 每秒抽 1 幀,Astra 整支影片抽 800 幀
基準名稱一樣,跑法可以不一樣。Google 的 Methodology 與幾個榜單頁把設定寫得很清楚,拿出來排在一起,每一項都是一個具體的差異。
第一個是 LVBench,測長影片理解。Argon 在表上是 91.7%,Astra 87.5%、Opus 5.5 83.7%、Fable 5.1 79.7%,四個模型都由 Google 自己跑、都不用工具。但抽影格的方式不同:Gemini 每秒抽 1 幀,Astra 整支影片抽 800 幀,Fable 5.1 抽 300 幀,Opus 5.5 抽 600 幀。Google 寫的理由是 API 的限制。抽幀方式不同對哪一邊有利,Methodology 沒寫,表上也看不出來。Gemini 處理影片時一幀算多少 token,站內實測過代理式影片理解。
第二個是 OSWorld 2.0,測電腦操作。Argon 的 69.2% 不是一般意義上的 OSWorld 成績:它是離線子集的部分分數,跑了三次、每次只有一次嘗試,取三次裡分數高的那次;用的是 Gemini CUA harness,還加了脈絡壓縮流程。Astra 的 72.6% 取自 OpenAI 的官方部落格。Anthropic 只公布線上與離線合併的成績,所以 Claude 兩欄沒有分數。Argon 三次取高,仍然輸 Astra 3.4 個百分點。
第三個是 Agent's Last Exam。Argon 是用 ALE-Claw harness、5 小時的時限、開著安全過濾器跑的;被過濾器擋下的回應會變成空字串,但這一輪任務可以繼續。
第四個是 Claude 的分數裡含護欄與接手。Zapier 的 AutomationBench 榜單上,Fable 5.1 那一列標的是 Fable 5.1 搭配 Opus 5 接手:Fable 5.1 的安全分類器拒絕的步驟由 Opus 5 完成,再交回 Fable 5.1 收尾。Opus 5 處理了約 4 成的任務(657 個裡的 260 個),這些任務都算進 31.4%。成本欄只算 Fable 5.1 的部分,Zapier 自己寫了合計成本會更高。在分領域排名裡,Zapier 把這一列排除:
Claude Fable 5.1 (with Opus 5 Fallback) is excluded as not directly comparable.
Google 表上 Fable 5.1 的 AutomationBench 31.4%,就是這個合計的數字。Opus 5.5 在 Zapier 榜單上也標著「default fallbacks」。Anthropic 的 Opus 5.5 公告頁註腳寫,評測時開著正式環境的安全護欄;護欄介入時,資安任務由 Opus 4.8 完成,生物與前沿 LLM 開發任務由 Opus 5 完成,Anthropic 自己寫這很可能拉低 Opus 5.5 在這些基準的表現。
第五個是 FrontierSWE。Proximal 的榜單頁上,Argon 那一列有一條註記:因為非正式環境的設定,Argon 的快取命中率低很多。這一項 Argon 是 55.0%,輸給 Astra 的 65.5%。
第六個是 CWE-bench v1,測修補資安漏洞。榜單圖在每個模型下面標了 harness:Argon 用 Antigravity,Astra 用 Codex,Opus 5.5 與 Fable 5.1 用 Claude Code,Grok 4.7 用 opencode。Argon、Astra、Grok 4.7 都是 68%,Opus 5.5 是 67%。榜單依 pass@1 排序,同分再用 pass@4 破同分,排出來的順序是 Grok 4.7、Argon、Astra、Opus 5.5。Google 公告寫的是「ties for first place with a top score of 68%」,並列第一;這句屬實,但 Argon 不是單獨第一。
同一個模型換一個 harness,分數可以差多遠,站內拆 Astra 的成績時看過一次:GPT-6 Astra 在 ARC-AGI-3 的兩種 harness。
Fairwind、Daybreak、Glasswing 是三扇門,開給的對象各不相同
Argon 的資安能力是公告的主打之一,而它目前的開放方式本身就是一道資安入口。三家都有一個放寬資安限制、要審核才拿得到的入口,但門開給誰不一樣;這一節先把三扇門並排,再看 Google 給的資安成績。
Google 的 Fairwind 開給政府、關鍵基礎設施、核心技術平台,再加上聚焦防禦基準的學術實驗室。Argon 公告寫,對受信任的防禦者與 Google 自己的內部團隊,Argon 會不帶資安護欄釋出,讓他們用上完整的資安防禦能力。
OpenAI 的 Daybreak 個人與組織都能申請,但要讓 Astra 降低拒答,目前得用 Daybreak Red,Red 只開給核准的 Business 與 Enterprise 組織。Astra 的發布頁寫,Astra 會拒絕執行更進階的網路安全任務,例如為漏洞建立概念驗證利用程式,OpenAI「計劃在未來數週擴大開放使用範圍」。Daybreak 的 Blue 與 Red 兩層差在哪裡,站內在OpenAI 推出 GPT-5.6-Cyber 的時候拆過。
Anthropic 的 Claude Mythos 5.1,開發者文件寫只透過 Project Glasswing 邀請提供,公告則寫走受信任存取計畫,對象是受審核的網路防禦者與生命科學研究者。官方不同頁面的說法並存,站內在Fable 5.1 與 Mythos 5.1 的發布文裡整理過三種說法。
門後的成績,Google 給了三組數字,對手各不相同。
第一組只跟自家前代比。Google 內部的漏洞發現資料集涵蓋 20 種程式語言,Argon 85.8%,3.8 Flash Cyber 71.0%;Wiz 內部的滲透測試基準,Argon 70.9%,3.8 Flash Cyber 58.2%。這兩項沒有 Astra 或 Fable 5.1 的分數。Wiz 也已經用 Argon 跑它的 Scan for Good,一個免費保護關鍵公共基礎設施的計畫。
第二組是 CWE-bench v1,上一節講過:Argon、Astra、Grok 4.7 同為 68%,harness 各異。
第三組是 Gray Swan 的間接提示注入基準,量的是攻擊成功率,數字越低越好。Google 的圖上列了 13 個模型:Argon 0.7%,Opus 5.5 與 Fable 5.1 各 1.0%,Astra 8.5%。Argon 的 0.7% 比其他 12 個模型都低。Methodology 寫這組數字取自 Gray Swan;Gray Swan 的公開榜單沒有找到,目前只能以 Google 的圖為準。
本站判斷:Argon 先列候補,四個訊號出現再重測
以下是本站的選型判斷,不是事實本身。結論是:台灣的開發團隊現在可以把 Argon 列進候補名單,但還不必為它改動手上的模型選擇。信賴度中等。
往支持「先列候補」的方向,有三組材料。第一,一般開發者今天買不到 Argon,公開開放沒有日期,定價頁也還沒有它。第二,比較表上有 9 項的 Argon 分數是 Google 自己跑的,跑法的差異(抽幀數、三次取高、安全過濾器、harness)在 Methodology 與榜單頁上寫得很清楚,直接拿來和對手比,比的不是同一個條件。第三,價格的優勢還沒定型:介紹期結束日沒寫、快取的美元價沒寫、context window 沒寫,而 AutomationBench 那一次測量裡,標準牌價下 Argon 和 Astra 每個任務的成本只差 0.03 美元。
往反對的方向,也有材料要認真看。Google Methodology 歸為第三方榜單的 9 項,Argon 第一 7 項、並列 1 項,只輸 FrontierSWE v2 一項。同一個 Zapier 榜單上,Argon(High)的 51.29% 比 Opus 5.5 的 42.47%、Astra 的 41.4% 都高,而且是同一個榜單、同一套計分。Gray Swan 的注入攻擊成功率,Argon 的 0.7% 也比圖上其他 12 個模型低。標準價和 Opus 5.5 同價,介紹期內又更便宜。這些材料說明 Argon 值得列進候補,但不改變「今天買不到」這個前提。
台灣的組織如果屬於政府單位、關鍵基礎設施營運者或核心技術平台,可以先去看 Fairwind 的申請條件。Fairwind 頁面上沒看到地區限制的條款;沒看到不等於沒有限制,送件前要先確認。
出現下面四個訊號,就值得重測一次:
- Gemini API 定價頁出現 Argon 這一列,寫出介紹期結束日、快取的美元價,以及長輸入要不要加價。
- 官方寫出 Argon 的 context window。
- B 類那 5 項出現第三方榜單收錄的 Argon 分數,或 Surge 的 RiemannBench 頁出現 Argon 這一行。
- Argon 開放給付費 API 客戶之後,拿自己的工作負載量一次每個任務的成本,而不是只比每百萬 token 的單價。
給非工程師的一句話
Google 這款新模型的成績單,有一半是 Google 自己跑的分數,而且現在一般人還買不到;先記住 Gemini 4 Argon 這個名字,等它真的上架、等別人也跑過,再決定要不要換。
常見問題
Gemini 4 Argon 現在可以用嗎?
一般開發者與一般消費者還不行。Google 9 月 30 日的公告寫,Argon 正透過 Fairwind 計畫開放給一批受信任的網路防禦者,之後會先開放給付費 API 客戶與 Google AI Ultra 訂閱者,但沒有給日期。到 10 月 3 日為止,Gemini API 的定價頁、模型清單與 Google Cloud 的模型清單都查不到 Argon;Gemini app 與 Google AI Studio 登入後的模型選單沒有驗證過,所以能確定的是公開文件與清單查不到。
Gemini 4 Argon 的 API 價格是多少?
官方寫 Argon 將以介紹價推出:每百萬輸入 token 2 美元、輸出 10 美元,快取輸入比輸入價便宜 95%。介紹期結束後改用標準價,輸入 4 美元、輸出 20 美元,但介紹期哪一天結束,官方沒寫。標準價的單價是 GPT-6 Astra 與 Claude Fable 5.1 的 4 成,與 Claude Opus 5.5 同價。單價不等於帳單:Zapier AutomationBench 榜單照標準牌價算,Argon 每個任務 1.70 美元、Astra 1.73 美元,幾乎一樣,這只是單一基準的一次測量。
Argon 的 100 萬 token 是 context window 嗎?
不是。官方公告寫的是輸出 token 上限,從 6 萬 4 千提高到 100 萬。官方頁頂部的 AI 摘要寫成「1 million token limit」,沒有 output 這個字;正文才寫明是輸出上限。Argon 的 context window 在官方頁與 API 文件都沒寫;對照之下,GPT-6 Astra 是 1,050,000 token,Claude Fable 5.1 與 Claude Opus 5.5 都是 1M。
Google 比較表上 Argon 有 12 項排第一,可以直接拿來選模型嗎?
先看每一格是誰跑的。Google 的評測方法說明把 18 項裡的 9 項歸為第三方榜單成績,另外 9 項的 Argon 分數由 Google 自己跑,其中 4 項連對手的分數也是 Google 跑的。設定也不一樣:LVBench 的抽幀方式不同;OSWorld 2.0 的 Argon 分數是離線子集的部分分數,而且三次取高;Claude 有些分數含護欄介入後由其他 Claude 模型接手的結果。這些差異不代表哪一邊的分數有問題,但代表表上的數字不是同條件比較。
台灣的公司可以申請 Fairwind 拿到 Argon 嗎?
Fairwind 的對象是政府與國家網安機關、關鍵基礎設施營運者、核心技術平台,也接受聚焦防禦基準的學術實驗室,申請要填表並通過背景審查。Fairwind 頁面上沒看到地區限制的條款,但沒看到不等於沒有限制。拿到 Argon 的是一部分 Fairwind 夥伴,用途限防禦與研究任務、只給內部資安團隊使用、不得轉售或再散布。
📚 收進你的工具
For AI Reading Era把這篇文章交給你日常用的工具——做研究、整理筆記,或當 AI 的 context。