一張做得很好的評比圖,和我還是得自己跑一次的理由
上週末我看到 Artificial Analysis 的一張圖,把 GPT-5.6 三個模式在各個推理檔位的表現與成本全部畫了出來。它做得很好:標了軸、標了成本、畫出前緣,而且沒有評誰最強。這禮拜中文圈也在聊同一批模型,各種該選哪一檔的說法。我差點就照著把設定調高一級——不是因為那些說法草率,是因為底下那份資料很好。然後我停住,因為再好的圖也回答不了一件事:它量的,是不是我在做的工作。
上週末那張圖
上週末我看到 Artificial Analysis 的一張圖,橫軸是每個任務要花多少錢(對數刻度),縱軸是他們的 Intelligence Index,把 GPT-5.6 的 Sol、Terra、Luna 三個模式,各自在 low 到 max 五個推理檔位的位置全部點了出來,順便還放上前一代做對照。
我得說,這張圖做得很好。
它標了軸,說清楚了自己在量什麼、成本怎麼算。它沒有只挑幾個好看的格子,而是把每個檔位都畫上去,所以你能看見一條線:同一個模型,檔位往上走,指數會上去,錢也會上去。它也把成本相對低、指數相對高的那一區在視覺上區隔出來。
最重要的是,它沒有評誰最強。它畫的是一條成本與能力的前緣,讓你自己決定要站在哪一點上。在他們七月九日那篇文章裡,最高檔那幾個點是這樣的:Sol 59 分、每個任務約 1.04 美元;Terra 55 分、約 0.55 美元;Luna 51 分、約 0.21 美元。你看得到差距,也看得到差距的價錢。
(這些成本是會動的。我寫這篇的時候回去看,Terra 最高檔已經從 0.55 變成 0.82 美元了。所以下面講的數字,請當成當時的快照。)
這禮拜,中文圈也開始聊同一批模型了。Reddit、X、Threads,我在幾個地方都刷到,大意都差不多:哪一檔最強、哪一檔最划算、哪一檔可以先別開。
於是我開始想我自己那個設定。
我平常會找 Codex 那邊的模型幫我挑錯,替我的文章和程式抓漏,用的是 Terra,推理檔位停在 high,從裝好那天就沒動過。而所有這些討論指向的方向都很一致:往上調,會更好。
我的手指已經往設定那邊移動了。
然後停住。
停住的理由,不是它做得不好
這件事我想講清楚,因為它跟「別信網路上的排行榜」不是同一回事。
我停下來,不是因為它草率,恰恰是因為它做得很好。它嚴謹、透明、有方法論、有成本軸,看起來完全值得照做。
好資料其實更難抵抗。看到一張隨便做的圖,你會警覺;看到一張做得很好的圖,你會直接照做——而你照做的時候,通常不會停下來問一個更基本的問題:
它量的,是不是我在做的事?
那個縱軸叫 Intelligence Index。它是一個合成指數,而且他們把配方寫得清清楚楚:九項評測,分成四類加權平均:代理任務 34%、程式 24%、科學推理 24%、一般能力 18%。他們自己也說明了,這個權重刻意偏向代理型任務。
這是很負責任的做法,權重公開、分項也公開。但把配方攤開之後,我看到的是另一件事:這個指數有將近六成的份量,押在代理任務和寫程式上。
而那九項裡面,最接近我要做的事的大概是「長文脈推理」那一項。它佔 6%。
我要模型做的事情很窄:讀一份三千字的稿子或一套驗證邏輯,然後告訴我哪一句話站不住腳、哪個檢查有洞。這需要它記得住上下文的細節,也需要它對一句聽起來很合理的話產生懷疑。
所以那條曲線在講的,有六成是我用不到的能力,而我真正在乎的那一塊,大概佔一成不到。這不是說指數做錯了。**權重是他們公開講明的設計選擇,偏向代理任務本來就是刻意的。**只是那個設計,跟我的用途不是同一個方向。
所以它沒有錯,它只是回答了一個比我的問題大得多的問題。而我要是照著它改設定,等於是拿一個大問題的答案,去回答我的小問題。
順便說一個我自己出的糗
在讀這禮拜那些討論的時候,我還做了另一件蠢事,寫出來有點難為情,但它比上面那段實用。
那些貼文裡常常是一張圖配一段文字。我讀完之後,在腦子裡把某個數字記成「圖上寫的」,實際上那個數字只出現在圖旁邊的文字說明裡,圖上根本沒有。等我要引用的時候才發現對不上。
一張圖和它旁邊的說明文字是兩個東西:圖是被截下來的,可能有出處;文字是轉貼者的詮釋和補充。它們一起出現在你的螢幕上,中間沒有分隔線,你的腦子就自動把它們讀成一份材料了。
我提這件事,是因為我自己很容易重犯。而且我當時正在寫的,就是一篇講「別把不完整的東西拿來做決定」的文章。
那就自己跑一次
既然這條曲線回答不了我的問題,我就自己問一次。想法很單純:同一份考題、同一個模型,把 Terra 的推理檔位從 high 調到 xhigh,看它會不會多抓到東西。
單純歸單純,真要做到「只有這一項不同」,意外地囉唆。我做了四件事。先講白,這是我嘗試凍結的條件,不是我證明了只有這一項不同。
同一份考題,一個字都不改。 我手上正好有一份幾天前用 high 跑過的考題。裡面甚至有一個我後來才發現寫錯的日期,但我沒改。它是基準的一部分,改了就不能比了。
受測材料整份複製,再用程式比對到沒有差異。 那是一個 38MB 的資料夾。複製完我跑了一次全樹比對,確認輸出是空的才敢開始。這步看起來很多餘,但它是我唯一能拿出來的憑據,證明兩輪吃的真的是同一份東西。
不讓第二輪看到第一輪。 新的環境裡不留前一份報告和評分。這是最容易漏掉的一環:如果它看得到前面的結論,你可能只是在測它會不會點頭。
過程紀錄自動留檔,不要手抄。 我把執行的輸出整個接進一個檔案。
這裡有個坦白:這條規矩是我這次才訂的。所以 high 那一輪根本沒有自動紀錄,它的數字是我當時手抄下來的。這是個真實的缺口,我想了一下要不要含糊帶過,決定不要。
至於評分,兩輪都用同一張表,逐條對答案,命中、半中、沒中。評分的人是我,只有我一個,也沒有蒙著眼睛。
結果讓我有點掃興
| Terra high | Terra xhigh | |
|---|---|---|
| 命中 | 6.5/10.5 | 7.0/10.5 |
| 工具回報的 token | 189,661 | 173,887 |
| 最終判定 | 不通過 | 不通過 |
差 0.5 分。
我承認我本來期待更戲劇性一點。跑之前我心裡有兩個劇本:一個是「果然值得升級」,一個是「果然是智商稅」,兩個我都想好怎麼寫了。結果拿到一個「差不多」。
倒是有件事出乎我意料:xhigh 那一輪用掉的 token 比 high 少了 8.3%。
這個數字要講精確一點:那是工具回報的 token 總數,不是帳單,也不是我訂閱額度的實際消耗。它只能支持一件事——檔位調高不必然伴隨更多的 token。「想得更久所以更貴」這個直覺,至少這一次不成立。
而且,我的方向跟那張圖一致
這裡有個對我自尊心不太友善的發現。
我花一個晚上得到的「往上調一級,好一點點」,跟 Artificial Analysis 那條曲線顯示的方向,是同一個。他們列的 Terra 是 high 49 分、xhigh 52 分,成本從 0.34 美元漲到 0.48 美元。上去三分,貴四成。我的 6.5 到 7.0,也是上去一小截。
別人早就用比我嚴謹得多的方法量過了。
所以我花那個晚上,換到的到底是什麼?
我想是這個:我現在知道,那個方向在我的工作上大概也成立。這句話跟「公開評測說它成立」不是同一句話。前者是我自己看過的,後者是我借來的。差別在信心的來源,不在結論本身。
有時候這個差別不值一個晚上。但這次那個設定要跑很多輪、要幫我守很多篇稿子,我覺得值得。
我拿到一件那條曲線給不了我的東西
不過真正有意思的,不在分數,在組成。我把兩輪的發現攤開對照才看到。
xhigh 那一輪,動手做了實驗。 它把受測的資料庫複製到隔離環境,把某一季某位車手的一筆比賽積分從個位數改成三位數,然後重跑整套檢查。
全部通過。零個未預期的失敗。
我看到這個結果的時候是有點背脊發涼的,因為那套檢查是我自己寫的。問題出在它有一份「已知例外清單」,記錄那些看起來像錯、其實是歷史規則造成的差異。但它比對時只認「哪一條規則、哪一個賽季」,不管數字對不對。所以只要污染落在一個已經登記過的賽季裡,就會被當成已知差異放過去。
high 那一輪完全沒動手,只把程式讀了一遍,然後指出兩件更難察覺的事。一是所有檢查都以「資料庫裡實際存在的賽季」當巡邏範圍,整季資料要是憑空消失,迴圈根本不會跑到那裡,全部亮綠燈。二是例外清單有幾條的說明文字提到某個標記,但整套系統根本沒有這個欄位,那個標記從來不存在。
第二條我看了很久。它不是抓錯,是抓到「一句宣稱有、但實際上沒有的話」,藏在我自己核准過的文字裡。
至於兩輪的關係,要講精確:十一條基準問題裡,六條兩輪都命中、兩條兩輪都漏,真正分開的只有三條:high 獨有一條、xhigh 獨有兩條,另外 high 還抓到兩個不在清單裡的架構問題。
所以不是「兩套完全不同的答案」,重疊其實挺多的。但那幾條各自看見、對方沒看見的,很有意思。而這種東西,一個合成指數不會告訴你,因為它已經被壓成一個數字了。
我很想說的那句話,我不能說
到這裡,一個很順口的結論已經在我嘴邊了:high 擅長靜靜讀穿邏輯,xhigh 擅長動手構造反例,調高檔位換來的是視角而不是強度。
寫起來多漂亮。而且它跟我看到的東西完全吻合。
但我不能寫,理由簡單到令人洩氣:我只跑了一次。
模型有隨機性,同樣的輸入跑兩次結果本來就會不同。我手上這一對輸出確實各自抓到對方漏掉的東西,但那可能來自檔位,也可能只是兩次執行之間的正常擺動。我沒辦法分辨。要下「檔位造成風格差異」這種因果結論,我需要多次重複、打亂順序、最好還有第二個人蒙著眼睛評分。我一樣都沒有。
而且 6.5 和 7.0 這兩個數字,是我一個人對兩份報告的判斷,不是什麼客觀測量。把它們相減得到 0.5,那個 0.5 的份量比它看起來輕得多。
這也是為什麼我一直強調 Artificial Analysis 做得好:他們做的正是我沒做的那些事:跨九項評測、有公開的權重與一致的計分方式,該重複的地方有重複機制。我這一次充其量是個親手做的抽樣,不是量測。
說實話,把一個現成的漂亮結論刪掉,比寫出來難多了。
但我還是得做決定
實測給不了通則,我仍得決定那個工作要用哪一檔。
我事先設了規則:xhigh 的淨進步少於兩個命中就停手,不再往上測更高的檔位。實際是 0.5,所以我停了,維持 high。依據是「我沒看到值得改的證據」,不是「我證明了不該改」。你的工作型態跟我不一樣,同一份資料未必導向同一個選擇。
我在這個站上寫過一篇操作說明,裡面有一句「檔位的本質是預算分配,不是越高越好」。那句話我現在還是同意,而且那份評測某種程度上就是它的圖解版。只是要記得,那條軸上的錢是他們用 API 價格估的每任務成本,跟訂閱制使用者的實收帳單不是同一回事。
這次實測讓我多了一個想追下去的方向:檔位變動的可能不只是投入多寡,也許還包括切入問題的角度。但這一次的資料,只夠讓它停在「也許」。
後來那些洞怎麼了
寫到這裡還缺一個交代:那些被挑出來的問題,後來呢?
這是整件事裡我最滿意的部分。「例外清單可能放過真錯誤」那一條,依現存的檔案與提交紀錄,兩個時間相隔不到半小時:一邊是那份審查報告的檔案時間,一邊是修正被提交的時間。(要說明的是,這兩者都不是什麼公證過的時間戳,也不等於事情發生的精確時刻。我只能證明到這裡。)
修法是把比對的鑰匙從「規則加賽季」換成「規則加賽季加一枚指紋」,指紋是把該項檢查的完整判別明細算成雜湊。範圍也講精確:凡是進入那份判別明細的數值或成員有變動,指紋就對不上、直接失敗;但這不等於資料庫裡任何一個數字被改都抓得到,程式自己也列了每條檢查守什麼、不守什麼。
另外兩個發現也都落地了:外鍵沒人檢查變成一條新的檢查規則,整季消失不會報錯變成另一條,程式註解裡直接寫著它們的出處,還加了反向測試專門確認「把數值改壞之後必須失敗」。我在一份乾淨的簽出上重跑過,25 個測試全過。
風險範圍也交代一下:依這個專案的公開站台設定,對外只有靜態檔案、沒有 HTTP 服務,那支檢查器是在本機與建置流程裡跑的命令列腳本。我沒有交出完整的部署清冊,所以這是就這份原始碼範圍講的話。上面描述的繞過方式,屬於已修版本的歷史狀態。
還有個細節我特別想說:指紋的第一版是把浮點數四捨五入才算雜湊,後來被指出這留了一個碰撞窗,於是又改了一次。修正本身也是還沒被檢查過的東西。這件事我踩過太多次,多到我現在改完任何東西的第一個念頭都是「這次我又弄壞了什麼」。
所以這次實測真正的收穫,可能不是「哪個檔位比較好」,那個問題公開評測早就答得比我好。是那些被挑出來的問題,最後都變成了程式裡跑得起來的檢查。價值不在當下被打幾分,在於它有沒有變成之後跑得起來的東西。
給想自己測的人
好的公開評測值得看,也值得信。我這篇從頭到尾沒有一句在說那份評測有問題。它嚴謹、透明,而且比我做得好。
要問的只有一個問題:它量的那條軸,跟你要它做的事,是同一件嗎?
如果是,那照著它的結論走通常沒問題,不必重造輪子。如果不是,或者你不確定,那它就從「答案」降級成「線索」:一個很好的線索,但還是線索。這時候找一份你真的在乎的題目,把其他變因盡量凍死,只動你想測的那一項,把過程留下來。
然後是最重要的一步:誠實地檢查你這樣做完之後,到底能說什麼、不能說什麼。
我這次能說的是「我沒有看到值得改設定的證據,而且方向跟公開評測一致」。不能說的是「調高沒有用」。這兩句話聽起來很像,中間隔著的東西叫做樣本數。
延伸閱讀:如果你要找的是三個模式各是什麼、差在哪、多少錢,可以看〈GPT-5.6 是什麼?Sol、Terra、Luna 三個模式一次看懂〉;「我該用哪一檔、怎麼切換、什麼時候調高」這類實用問題,請看〈ChatGPT 5.6 使用說明〉,那篇才是為選擇而寫的。本篇談的是驗證方法,不是選購建議。
來源與限制說明:文中引用的公開評測為 Artificial Analysis 的 Intelligence Index 對每任務成本資料。最高檔位三個數值(Sol 59/約 1.04 美元、Terra 55/約 0.55 美元、Luna 51/約 0.21 美元)取自該機構 2026 年 7 月 9 日的公開文章;Terra high 49/約 0.34 美元與 xhigh 52/約 0.48 美元取自其公開的供應商比較頁;指數組成(九項評測、四類加權:代理 34%、程式 24%、科學推理 24%、一般 18%)取自其公開方法論頁。這些成本會隨時間變動,本文寫作時該機構已將 Terra 最高檔列為約 0.82 美元,文中數字請視為當時快照。該指數量的是 API 工作負載下的加權估計成本,與訂閱制使用者的實收帳單不是同一件事。實測數據來自我自己的單次執行,xhigh 那一輪的模型、檔位與 token 取自工具輸出紀錄,high 那一輪為當時人工記錄。命中數為我個人評分,非盲評、無第二評分者。受測材料為刻意凍結的歷史版本,文中提及的問題在目前的程式碼上均已修復並有測試覆蓋。單次執行不足以支撐因果結論,本文請當成方法示範而非評測結果。
常見問題
所以推理檔位調高到底有沒有用?
以公開評測來說,方向是有的:Artificial Analysis 的圖上,同一個模型從低檔位往高檔位走,指數會上去,成本也會上去,這是一條相當清楚的曲線。我自己那一次也拿到同方向的小幅進步。但「有用」跟「值得為你的工作改設定」是兩件事,後者取決於你要它做什麼、以及那點進步對你的任務有沒有差。如果你要找的是「哪一檔適合我、怎麼切換」,我另外寫過一篇操作說明,那篇才是為這個問題寫的。
既然已經有做得很好的公開評測,我還需要自己測嗎?
看你的工作跟它量的東西差多遠。像 Artificial Analysis 這種合成指數,是把多項評測加權成一個數字,它能告訴你整體的成本與能力關係,這很有用。但它沒辦法告訴你「這個模型讀我的稿子時會不會抓到我漏掉的東西」。差距越大,自己跑一次的價值越高。反過來說,如果你的用途剛好就在它量的範圍內,那照著它的結論走通常沒問題,不必重造輪子。
同一個模型要怎麼公平地比兩次?
原則是除了你要測的那一項,其他盡量凍結:考題一個字不改、受測材料整份複製後用程式比對到沒有差異、兩輪都禁止上網、評分用同一張表。還有一件容易漏的是別讓第二輪看到第一輪的結果,否則你可能只是在測它會不會同意前面那份。但要老實說,做到這些也不等於證明了「唯一的差別就是那一項」。取樣有隨機性、評分有主觀成分,跑一次分不開這些。
被別人挑出來的問題,後來真的有用嗎?
這是我覺得最值得講的部分。這次被拿來當考題的,是我自己一個 F1 資料專案的驗證層。它前後被挑出三類問題:例外清單可能把真錯誤放過去、外鍵沒人檢查、整季資料消失不會報錯。它們現在都變成程式裡的東西了:多了兩條檢查規則,例外清單改成綁指紋,還加了反向測試專門確認「改壞了必須失敗」。價值不在當下被打幾分,在於它有沒有變成之後跑得起來的檢查。
📚 收進你的工具
For AI Reading Era把這篇文章交給你日常用的工具——做研究、整理筆記,或當 AI 的 context。