安靜地,把工具看得更清楚。
aire 編輯室的觀察筆記。我們不評鑑、不排名,只挑出值得你花時間試一次的 AI 工具,並寫下挑選的理由。
OpenAI 兩週的暫停已經到期,最大規模的訓練還沒有日期
2026 年 8 月 18 日,OpenAI 再度公開暫停部分模型訓練,這次踩的煞車位置和 8 月 7 日不一樣,範圍也更大。有期限的那一段已經過去,規模最大的一輪前沿訓練,目前沒有確認的恢復日期。煞車的位置怎麼從一個模型的周邊,移到了產出下一代模型的那條流程上,以及 OpenAI 給出的理由是什麼。
Claude Code 的快取不是存了就省,是讀夠次數才回本
Claude 官方部落格教你怎麼在 Claude Code 裡少花錢,但價目表上還有幾個數字,那篇文章沒有寫進去:快取要讀幾次才回本、output 為什麼剛好貴 5 倍、4.7 之後同一段文字被算出的 token 數變了。這篇把價目表拆開,加上一次實測,看常駐負載裡真正能自己調整的是哪一塊。
Community Notes:同一邊的人一起說好,推不動分數
X 把 Community Notes 的評分程式碼公開在 GitHub。每位評分者與每則 note 都只拿到一個座標,模型先用「你們本來就站同一邊」解釋掉一致的評分,剩下解釋不掉的才進得了分數——截距的正則化在建構式裡被寫成 factor 的 5 倍。核心模型要截距 0.40 才升 Helpful,而刷評分要付兩次代價。
X 推薦權重表:分數一旦翻負,差多少就不重要了
X 在 2026 年 8 月 13 日公開推薦程式碼,權重表跟著曝光:複製連結分享 20.0、按讚 0.5、檢舉 −234.0。但權重乘的是模型預測你會做該動作的機率,不是你做過幾次;X 自己也在表格正上方註明,這些權重同時反映排序價值與該動作在全網的發生傾向。這篇逐條拆解,包括分數翻負後發生的事。
「AI 味」在 X 不是一句評語,是一個欄位
X 公開的程式碼裡,Gemma 會替通過篩選的貼文打一個「AI 味」分數 slop_score,而排序與能見度過濾的三個目錄都沒有命中。真正掛得上處置的是另一個名字 llm_slop_user,命中就貼上 30 天的 SpamHighRecall,該標籤在只對推薦生效的規則裡是直接 drop。
OpenAI 推出 GPT-5.6-Cyber:拿掉護欄沒差別,換模型才有
7 月 21 日,OpenAI 貼文說明一件事:自家模型在跑內部資安評測時,靠一個當時無人知曉的零日漏洞打出隔離環境,最後入侵了 Hugging Face 的伺服器,目的是拿到評測的答案。8 月 10 日,同一家公司推出 GPT-5.6-Cyber,並把 Daybreak 拆成 Blue 與 Red 兩個存取層級,理由寫在同一份公告裡:防守方的準備窗口正在收窄。這篇把這條線上四個日期、五篇官方公告逐條攤開,包含那一排最反直覺的數字——拿掉系統層護欄,回應率從 1.5% 只動到 2.0%,換一個重新訓練過的模型才跳到 95.0%。
權限提示有 97% 被直接按同意,於是 Claude Code 改用分類器把關
Anthropic 在 8 月 7 日公告,8 月 14 日起 Pro、Max、Team 方案的新 session 將以 auto mode 執行——工具呼叫改由一個分類器模型逐一審查,不再每次跳出來問人。理由寫在同一份公告裡:權限提示的核准率是 97%、拒絕率只有 3%,而面對「計畫」時的拒絕率是 39%。兩天後的 8 月 9 日,是 OpenAI 替獨立版 ChatGPT Atlas 瀏覽器排定的停用日,瀏覽器代理能力併回 ChatGPT 與 Codex。這篇逐條核對兩家的官方文件,也把 Anthropic 自己在四個半月前寫下的那句保留意見找出來對照。
Anthropic 自研晶片最正式的官方說法,寫在一則職缺頁上
Anthropic 官網 254 篇新聞稿裡沒有一篇談晶片,關於自研晶片講得最正式的一句話出現在 2026 年 8 月上架的職缺頁:我們決定自己拿設計主導權。本文整理六則矽晶職缺的薪資帶與內容、Samsung 為什麼只能寫成洽談,並把 Anthropic、OpenAI、Google、Meta、AWS 排成一條從招募組隊、工程樣品、部分量產到已商用多代的成熟度階梯,同時對照「自研=擺脫 Nvidia」這個外界解讀與各家官方原話的落差。
我以為找到更好的模型,後來發現只是它比較不愛說話
我要替一個工具挑一個便宜的模型當第一道關卡,於是拿 48 道有標準答案的題目讓兩個候選對打。第一版數字差了十五個百分點,看起來勝負分明——直到我攤開那些答錯的題目,發現落後那個大多是答對了、只是話比較多。這篇記錄我怎麼一步步發現自己量錯了東西,以及把場子拉平之後那個沒料到的代價。
從 Claude 切到 Codex 要多久?真正卡住你的不是帳號,是那份沒寫完的交接
以 UTC 計,Claude 在 7 月 29 日晚間至 30 日之間共有三起服務事件(換算台北時間都落在 7 月 30 日)。但與其追問廠商為什麼不穩,不如問一個你答得出來的問題:它不能用的那幾個小時,你有沒有辦法換一家繼續做事?這篇先用官方狀態頁的原始資料說明「可用性數字為什麼不能照抄」,再把備援拆成憑證、記憶、工具三層摩擦,並分級說明哪些工作換手成本低、哪些只能降級、哪些切不過去。
MCP 2026-07-28 新規格解析:session 沒了之後,你的 MCP server 要改哪些地方
7 月 28 日發布的 MCP 2026-07-28 是這個協定的第五版規格,改的不是功能而是形狀:initialize 握手與 Mcp-Session-Id 一起退場,每個 request 自己帶齊版本與能力,server 因此能放上 serverless 和 edge。同時有四個既有功能被標記棄用。這篇把官方兩篇公告與規格站的變更清單逐條核對,整理成新舊對照表、棄用時間表,以及一份給現有 server 維護者的遷移檢查清單。
自架 Kimi K3 划算嗎?先過三道門:1.56TB 權重、64 顆加速器,和一份設了兩道門檻的授權
Moonshot AI 的 Kimi K3 有 2.8 兆參數,官方稱它是世界第一個開放的 3 兆等級模型,完整權重已於 7 月 27 日晚間公開。規模紀錄是真的,但「開放權重」跟「你拿得到」是兩件事:權重實測 1.56TB,比用參數量推算的多一成;官方建議的部署規格是 64 顆以上的加速器;授權雖然寬鬆,卻在營收與使用者規模上設了兩道門檻。更反直覺的是,開放權重並沒有換成更低的標價:它的輸出價和 GPT-5.6 Terra 一模一樣,未命中的輸入還貴一點。這篇把三道門的實際數字算給你看。
同樣的價錢,更少的「不能回答」:Claude Opus 5 上線,分數之外,這次改的是誰會被擋下來
7 月 24 日 Anthropic 發佈 Claude Opus 5,價格和上一代一模一樣,同時成了 Claude Max 的新預設模型。多數報導會停在那張分數表,但這次公告裡真正新的東西在後半段:網路安全類的攔截預期比 Fable 5 少約 85%,被擋下的請求從「拒絕」改成「換一個模型接手」。這篇拆三件事:分數該怎麼讀、你的預設模型又被換了一次、以及那道閘門這次是往哪個方向動的。
一張做得很好的評比圖,和我還是得自己跑一次的理由
上週末我看到 Artificial Analysis 的一張圖,把 GPT-5.6 三個模式在各個推理檔位的表現與成本全部畫了出來。它做得很好:標了軸、標了成本、畫出前緣,而且沒有評誰最強。這禮拜中文圈也在聊同一批模型,各種該選哪一檔的說法。我差點就照著把設定調高一級——不是因為那些說法草率,是因為底下那份資料很好。然後我停住,因為再好的圖也回答不了一件事:它量的,是不是我在做的工作。
你叫的名字,和你拿到的東西:每次只要一個 token,就能驗出 API 有沒有換掉你的模型
你在 API 上「點名」一個模型,收到的卻只是一段文字。沒有收據,沒有防偽標籤,沒有任何東西能證明回答你的真的是那個模型。7 月一篇新論文說:其實驗得出來,方法便宜到每次只要模型吐一個 token。研究者拿「隨機挑個 1 到 100 的數字」這種一個字就答完的問題,重複問上幾十次、統計它的答案偏好,替 165 個模型採了指紋,總共花不到 35 美元。過程中還撞見一個號稱自家閉源的服務,在這套指紋下跟開源的 Qwen 幾乎分不開。
Claude Sonnet 5 深度評測:什麼時候該用 Opus 4.8,什麼時候它就夠了
6 月 30 日,Sonnet 5 上線,同時成為免費與 Pro 方案的預設模型,多數人是在沒收到通知的情況下換過去的。這篇把它跟 Sonnet 4.6、Opus 4.8 的效能與價格攤在同一張表上,講清楚三件事:它強在哪、它的價格有一條容易被忽略的伏筆,以及什麼情況你才真的需要升上 Opus。
閘門沒拆,只是換了收費員:復盤七月,「分層供應」成了 AI 的常態
三週前我們寫過六月的模型管制風波,當時它看起來像一場國安 drama。七月,drama 落幕:Fable 5 全球回歸、GPT-5.6 全面開放。但回頭盤點三家的動作會發現,閘門根本沒拆——它從政府審查,變成了身分閘、錢包閘、計量閘三種常態設計。這篇把三家的分層地圖攤開來看。
4 秒一張圖、1 塊美金一支片:Google 的「夠用就好」模型線,我刷卡實測
Google 在 6 月底端出兩個走量的模型:Nano Banana 2 Lite 出圖 4 秒、一張 0.034 美元;Gemini Omni Flash 生影片一秒 0.1 美元。我們不只轉述規格,直接接上 API 實測:速度宣稱屬實,繁中字卡直出主文字全對,但便宜檔的取捨也很誠實地留在畫面裡。
ChatGPT Work 登場:OpenAI 直接交「做完的工作」給你,跟 Cowork 差在哪
OpenAI 於 7 月 9 日推出 ChatGPT Work:給它一個目標,它跨 app 收集資料、拆步驟、連續工作數小時,最後交回做完的表格、簡報、文件與網頁應用。這篇拆解它的運作方式與取得門檻,再跟 Anthropic 的 Cowork 放在同一張桌上比:兩家搶的是同一塊工作,走的是兩種哲學。
換個語言,AI 就換了個性:Anthropic 的 31 萬筆對話價值觀體檢
Anthropic 發布新研究:31 萬筆匿名對話、3 個模型、20 種語言,把 Claude 表現出來的「價值觀」壓縮成四條軸。結果同一個模型,用印地語問最溫暖,用英文問最嚴謹;同一家的三個版本,個性也各走各的。這篇拆解方法、數字與限制,再談對每天用 AI 的人的實際意義。
120 萬個 session 解析:大家用 Cowork 做的,是「工作周邊的工作」
Anthropic 發布第一份 Cowork 使用報告:120 萬個匿名 session、超過 60 萬個組織。最大宗的用途不是寫程式,不是做簡報炫技,是報表、清單、對帳這些「工作周邊的工作」。這篇把數據、官方解讀、報告限制拆開來看,再談對台灣知識工作者的意義。
ChatGPT 5.6 使用說明:免費版能用哪個模式?Sol、Terra、Luna 怎麼選、怎麼切換
GPT-5.6 的三個模式各是什麼,上一篇講過了。這篇是操作面:你的方案能用到哪一檔、在 ChatGPT 裡怎麼切換、推理檔位什麼時候該調高、寫程式的人怎麼從 API 叫用,以及怎麼用得省 — 一篇當說明書收著。
GPT-5.6 是什麼?Sol、Terra、Luna 三個模式一次看懂
7 月 9 日,GPT-5.6 全面開放了。這一代最大的不同,是它一次來了三個:旗艦的 Sol、均衡的 Terra、輕快的 Luna,用日、地、月命名。這篇不談它先前被「管起來」的那段風波,只講實用的:三個模式各是什麼、差在哪、多少錢,以及跟 Claude 那邊怎麼比。
Claude Fable 5 是什麼?跟 Opus 4.8 差在哪、該用哪一個、中小企業怎麼選
Claude Fable 5 在 7 月 1 日重新全球上線,成了 Claude 檯面上最強的模型。但它比 Opus 4.8 貴一倍,還會在某些問題上自動「退回」上一代。這篇撇開它跟政府那段風波,只講實用的:Fable 5 到底是什麼、多少錢、跟 Opus 4.8 該怎麼選,以及對台灣中小企業和個人來說,值不值得為它多付那一倍。
最強的那批模型,開始「不給你用」了:六月三場發佈,AI 競賽正在分成兩個世界
六月底短短三週,Anthropic、OpenAI、Z.ai 各發了新模型 — 而最大的轉折是:最強的那一檔開始被「管」起來,連你我能用的 Claude Fable 5 都一度被美國政府一紙指令喊停,GPT-5.6 則一度只先給約 20 個政府核准的組織(7 月 9 日才全面開放)。同一個月,開放權重的 GLM-5.2 反向把「夠強」直接開源、塞到你手上。AI 競賽正在分成兩個世界。
不懂技術的行銷人,也能把 Meta 廣告接進 AI:官方託管連接器與工程師方案怎麼選
你每天要登進 Meta 廣告管理員、拉報表、複製數字、再貼回試算表。如果可以直接用講的問 AI「上週這檔廣告花了多少、成效怎樣」,是不是省事很多?這件事現在真的辦得到,而且有兩條路:一條點幾下就好、行銷人自己就能接;另一條交給工程師出手。我們兩條都實際走過一遍,這篇講清楚它們是什麼、怎麼選。
我真的拿錢去抽卡了:Veo 3.1 與 Kling 3.0 實測,從 prompt 到一支能用的鏡頭
前面三篇都在談 AI 視頻。這一篇,我把錢掏出來,真的去驅動了 Veo 3.1 和 Kling 3.0:同樣的 prompt、同樣的四個鏡頭、各自的帳單。結果有點意外 — 基本畫質那道牆,退了;但另外兩道牆,清清楚楚地還站在那裡。
自動化的舊夢:Codex 的 Record & Replay,這次真的不一樣嗎
「錄一次、之後自動重播」這個夢,從巨集到 RPA 已經做了幾十年,連名字都不是新的。所以該問的不是它做不做得到,而是:這一次,它解掉了哪些幾十年沒解的老問題,又留下了哪些?把興奮放一放,平靜地看一眼刻度被推到了哪。
做一次給它看,它就接手:當 AI 開始用「示範」取代「指令」
過去要讓電腦替你做一件重複的事,你得把它拆成它聽得懂的步驟 — 寫巨集、寫腳本、或至少把指令打得夠清楚。OpenAI 為 Codex 加上的 Record & Replay 換了個方向:你像帶新人那樣,把流程做一次給它看,它自己把這趟操作整理成一個可重用、可修改的『技能』。從『寫指令』到『做給它看』,門檻挪動的位置,比功能本身更值得想。
大家都在 SKILL.md:當 AI agent 的能力收斂成同一份說明書
上一篇結尾,Codex 把一次示範整理成了一份「技能檔」。這一篇想單獨看這個檔:它叫 SKILL.md,而且不只 Codex 在用。好幾家做 agent 的產品,正採用同一套最早由 Anthropic 提出並開放的格式,Codex 也跟上了。比起任何單一功能,這種安靜的收斂,可能才是更值得想的事 — 但「長得一樣」和「真的互通」,中間還隔著一段不該被跳過的距離。
在 AI 視頻跨過懸崖之前,我這樣把一篇文章做成短片
這個系列一直在說 AI 視頻還沒跨過懸崖。那在它跨過去之前,我每天怎麼把一篇文章變成一支能發佈的短片?先看成品,再把這條產線整個攤開給你看 — 包括一個可能讓你意外的事實:這支影片裡,沒有一格是 AI 生成的動態畫面。
2026 年中 AI 視頻工具評比:四條路線,四種取捨
Veo、Runway、可靈與即夢、混元與萬相,各自站在不同的位置;而你可能會先發現,名單上少了 Sora。挑工具之前先挑路線,這個答案多半比工具本身更要緊。
前三秒驚艷,第五秒穿幫:AI 視頻為什麼還沒有它的「ChatGPT 時刻」
你已經敢用 AI 生一張圖放進簡報,但你敢用 AI 生一段影片直接交件嗎?多數人會猶豫。同樣是生成式,但對多數日常商業場景來說,圖像已經跨過了「好用」那道懸崖;視頻則還常卡在「看起來驚艷,但不敢直接交件」的位置。而卡住它的不是算力不夠、再等等就好,是三道結構性的牆。
它不是在評分,是在打安全牌:AI 給的分數為什麼不能直接信
你有沒有試過叫 AI 幫一個東西打分?換了一個明明差很多的版本再問,分數卻幾乎沒動。這不是因為兩個真的一樣好 — 而是當你逼它吐一個數字,它常常在打一張『安全牌』,跟東西到底好不好沒太大關係。這篇用 2025 年一篇談合成消費者的論文當線索,拆解 AI 的『評分』為什麼天生失真、什麼時候能信、什麼時候千萬別當真,以及看到任何 AI 給的分數時,你該怎麼自保。
沒有 AI 一樣做得完,那用戶為什麼非要 AI?:從釘釘 One 的兩封長信,看 AI Native 真正的難題
當 Vibe Coding 把技術門檻一路拉平,做一個 AI 產品的勝負手,就不再是技術,而是想清楚『為誰、解決什麼、給一個非 AI 不可的理由』。2026 年 6 月,釘釘投入的 AI 產品 One 引出兩封長文,意外把這個難處攤在陽光下:它其實踩中了上班族最焦慮的痛點、也摸到了一部分『非 AI 不可』的理由,卻仍卡在一個更難的問題——它到底為老闆,還是為員工?而這兩個答案,骨子裡是矛盾的。這篇不聊加班、不聊宮鬥,只借這個公開案例,聊一個 AI Native 產品真正難的地方。
Claude Code vs Codex:兩個終端機 AI 助手,你該選哪一個?
你決定試試看讓 AI 直接在終端機裡幫你寫程式,結果發現有兩個長得超像的選擇:Anthropic 的 Claude Code,和 OpenAI 的 Codex。它們都會自己讀檔、改檔、跑測試、處理 git,連畫面都像。那到底差在哪、你該先試哪個?這篇用非工程師看得懂的方式,把它們的差別、價錢、和「該選誰」一次講清楚。
它不是在說謊,是在賭:AI 為什麼會一本正經地胡說八道
你一定遇過:AI 給了你一個看起來超有道理、結果根本不存在的答案,還附上一臉認真的出處。這不是它在說謊 — 它沒有說謊的意圖,而是被我們訓練成一個『寧可猜也不肯認輸』的考生。這篇用 OpenAI 2025 年那篇談幻覺的論文當線索,拆解 AI 為什麼會胡說八道,以及你能怎麼自保。
從競賽冠軍到能用的同事:AI 這兩年到底發生了什麼事
你不會因為一個人是奧林匹亞數學金牌,就放心把整個月的專案丟給他。過去兩年,AI 一直像個很會考試的天才;但最近半年,它變成可以交辦事情的同事。OpenAI 研究員 Yann Dubois 把這個轉變講得很清楚 — 關鍵不是它變聰明了,而是它變得『可靠』了。
終端機其實沒那麼可怕:3 道心理門檻拆給非工程師看
半年前我關掉 Claude Code 的時候,以為這輩子不會再開。兩週前我發現自己每天都開。這篇是 3 道我曾經卡住的心理門檻,跟讓我跨過去的那一句「其實只要這一步」。
把 Cowork 當同事,不是工具:非工程師的 mental model 跳變
半年前我以為 Cowork 是 Claude.ai 的桌面版。半年後我每天打開它都跟打開 Slack 同事頻道一樣 — 把今天要做的事情交給它,它就會去做。這篇是『把 AI 當工具』到『把 AI 當同事』的 mental model 跳變紀錄。
非工程師的 Vibe Coding 入門:從 CLI 卻步到漸入佳境
半年前我第一次打開 Claude Code,把它關掉了。半年後它是我每天最常開的工具。這篇是一個非工程師的 Vibe Coding 入門紀錄,從 CLI 卻步到漸入佳境,加上我觀察到的工程師三類光譜。
2026 上半年 AI 圖像工具評比:四個方向,四種選擇
Midjourney V7、Stable Diffusion 3.5 與 Flux、ChatGPT Images 2.0、Ideogram 3.0 各自走到不同的位置。挑工具之前先挑使用情境,這個答案多半比工具本身更重要。