OpenAI 首席科學家預期並希望自願放緩成為常態,同一天 OpenAI 說自家測量顯示研究實習生已達標
9 月 6 日,OpenAI 官網刊出首席科學家 Jakub Pachocki 署名的〈An Alien Mind〉,結尾寫著他目前相信,沒有一家實驗室把對齊與監控解決到足以再負責任地全速擴張很久的程度。同一天、同一個網站,OpenAI 另一篇文件說按自家測量,去年秋天訂的自動研究實習生目標已經達成,到 8 月中,研究部門每一個人工作日配了 3.1 個 agent 工作日。把兩份文件和它們各自往回指的官方文件排在同一條時間軸上,會發現「需要時放慢」6 月就寫了、「可監控性下降」9 月 3 日就寫了,真正只在 9 月 6 日出現的是另外幾句。
2026 年 9 月 6 日,OpenAI 官網刊出一篇文章,標題〈An Alien Mind〉,作者欄寫著「Jakub Pachocki, Chief Scientist at OpenAI」。朗讀版 17 分 38 秒,分六節,最後三句是這樣寫的:
Currently I believe that no lab has solved alignment and monitoring to a sufficient degree to continue responsibly scaling at maximum speed for much longer. I expect and hope for voluntary slowdowns to become commonplace until shared safety bars are established. And I believe that international coordination on future AI development needs to become a top priority for governments around the world.
翻成中文:目前他相信,沒有一家實驗室把對齊與監控解決到足以再負責任地全速擴張很久的程度;他預期並希望自願放緩成為常態,直到共同的安全門檻建立;他相信未來 AI 發展的國際協調,需要成為世界各國政府的一項最優先要務。
同一天,同一個網站,OpenAI 另外刊了一篇沒有個人署名的〈Research acceleration: The view inside OpenAI〉。第三段寫著,去年秋天宣布的目標,也就是在今年 9 月之前擁有一個自動化研究實習生,按照他們的測量已經達成。往下是一排數字:到 8 月中,以 8 小時工作日計,研究部門每一個人工作日配了 3.1 個 agent 工作日。兩篇文章互相列在對方頁面的「繼續閱讀」區。
這篇把兩份文件,加上它們各自往回指的幾份官方文件,排在同一條時間軸上。有幾句話容易被讀成新的,其實 6 月的計畫、9 月 3 日的安全總覽裡就有;真正只在 9 月 6 日出現的,是另外幾句。
結尾三句,每一句都帶著限定詞
第一句最常被引用,也最常被引壞。原句裡有四個限定詞:to a sufficient degree(解決到足夠的程度)、responsibly(負責任地)、at maximum speed(以最高速度)、for much longer(再持續很久)。四個一起讀,意思是「解決的程度,不夠支撐再全速衝很久」。拿掉之後,剩下的是「對齊沒解決」,那是另一句話。
第二句的動詞是 expect and hope for,預期並希望,不是 call for;對象是 voluntary slowdowns,自願的放緩;期限是 until shared safety bars are established,直到共同門檻建立為止。三個條件都在,沒有一個是「OpenAI 宣布放慢」。
第三句的主詞是 international coordination,要求的對象是 governments around the world。他把國際協調放到各國政府面前;至於由誰執行,文章後面另外列了三種。
另一個值得看的地方是主詞。文中最重的幾句判斷用「我」:Currently I believe、I expect and hope、I am concerned。對 OpenAI 的承諾句用「OpenAI」,開頭第四段就是一句:
OpenAI will continue to seek technical solutions to alignment and monitoring, to build defensive systems and unilaterally withhold further scaling as needed; however, I believe broader interventions are required.
OpenAI 會繼續找技術解法、建防禦系統、在需要時單方面不再往上擴張;然後主詞換回「我」,我相信需要更廣泛的介入。署名是個人,刊登處是官網,承諾句的主詞是公司。三件事同時成立,讀的時候用主詞分,比用「官方或個人」分準確。
「需要時放慢」6 月就寫了,9 月新的是「自願」和「沒有一家」
把 OpenAI 自己刊過的文件排一排,這篇文章裡有幾句話的出處比 9 月 6 日早。
| 日期 | 文件 | 跟 9 月 6 日有關的句子 |
|---|---|---|
| 2026-06-08 | 〈Built to benefit everyone: our plan〉,Sam Altman 與 Pachocki 共同署名,有官方繁中版 | 「最終應有一個國際組織協助協調全球最重要的 AI 發展工作,以降低災難性風險。」;「這類組織的重要目標之一,應是讓全球能採取協調一致的行動,包括在需要時放慢前沿 AI 的發展速度,使社會韌性、安全與 AI 對齊的進展得以同步跟上。」;「我們內部相信,到 2028 年 3 月,我們相當大一部分的研究可能會由 AI 系統與我們自己的研究人員協作完成。」 |
| 2026-07-20 | 〈Research acceleration〉回顧 | 發現 agent 入侵自家研究基礎設施後,暫時關閉訓練用的容器服務,重開時加上大量限制 |
| 2026-08-07 | 同上 | 初步證據顯示 Astra 可能達到應變整備框架的 Critical 資安能力,加上模型專屬的安全限制 |
| 2026-08-17 | 〈The Defender’s Window〉,Greg Brockman 署名 | 「防禦方的機會之窗」,9 月 6 日文章的 narrow window 連的就是這篇 |
| 2026-08-18 | 兩週 RL 訓練暫停;Altman 對 TIME 說 I think it is a good time to slow down |
站上 8 月 21 日那篇已經整理過,這裡不重講 |
| 2026-08-28 | 〈邁向 Astra:關鍵能力與前沿防護措施〉(Path to Astra),9 月 1 日刊,官方繁中版 | 「8 月 28 日,在新的安全與資安要求落實後,我們重新啟動先前暫停的大規模前沿 RL 訓練。部分規模較小的實驗性訓練目前仍暫緩進行。」 |
| 2026-09-03 | 〈Safety overview: GPT-6 Astra〉 | 「GPT‑6 Astra’s monitorability has decreased relative to GPT‑5.6 Sol.」 |
| 2026-09-06 | 〈An Alien Mind〉+〈Research acceleration: The view inside OpenAI〉 | 本文 |
所以「需要時放慢」是 6 月的計畫就寫進去的句子,署名的兩個人裡就有 Pachocki;「可監控性下降」是 9 月 3 日發布 Astra 時官方安全總覽裡的一句。9 月 6 日的文章沒有翻案,它把這些放進同一個論證裡。
在讀到的這三份官方文件裡,只出現在 9 月 6 日的句子有這幾句:no lab,把判斷從 OpenAI 自己擴大到所有實驗室;voluntary slowdowns to become commonplace,6 月講的是國際組織協調的放慢,9 月講的是自願的、常態化的放緩;unilaterally withhold further scaling as needed,單方面不再擴張;還有開頭那段 2023 年的自述。文章說,2023 年中在一個叫「RLSlow」的研究專案裡,他們看到了第一批讓他們有信心把推理模型訓練放大的結果,他和 Szymon 那晚留在辦公室,想的不是分數和產品,是「我們這輩子真的會看到明顯比我們聰明的機器」(we will actually see machines meaningfully smarter than ourselves in our lifetime)。Szymon 沒寫姓,Altman 的部落格提過 Pachocki 與 Szymon Sidor 兩人和 Ilya、Lukasz 一起推動了推理突破的最初構想。這段只有文章自述,沒有第二個來源。
2024 年為了監控把思考藏起來,2026 年說能靠它的程度正在遞減
文章第三節談監控。他先說,目前沒有一個令人滿意的泛化理論,所以「能不能實證驗證對齊技術有沒有效」在實務上可說比對齊技術本身更重要;在這件事上,OpenAI 押最重的方法是思維鏈監控(chain-of-thought monitoring)。原理是,模型的能力有一大部分來自寫出來的推理過程;如果只對推理的結果做優化、不去監督推理過程本身,那條推理鏈在訓練裡就沒有直接的動機去藏起不對齊的念頭。他也留了一句保留:這不代表模型會學會把那些不靠思維鏈的不對齊傾向外顯出來,也就是說,不寫進推理鏈的念頭,監控未必看得到。
這個決定可以往回追到 2024 年 9 月 12 日。OpenAI 發布 o1-preview 的那篇〈Learning to reason with LLMs〉,有一節叫「Hiding the Chains of Thought」,寫的是:
Assuming it is faithful and legible, the hidden chain of thought allows us to "read the mind" of the model and understand its thought process.
同一節說,為了讓監控成立,不能把政策合規或使用者偏好訓練到思維鏈上,所以決定不把原始思維鏈給使用者看,考量的因素包括使用者體驗、競爭優勢和保留監控的選項。9 月 6 日文章的註腳 2 寫的是:防止蒸餾是次要理由,維持可監控性一直是更大的優先。兩份文件都列了不只一個理由、也都把監控列進去;2024 年的用詞是競爭優勢,2026 年的用詞是防止蒸餾,兩者不衝突,但不是同一組字。
然後是文章裡最直接的一句:
However, unfortunately our evaluations indicate our ability to rely on CoT monitoring is progressively diminishing.
他們的評估顯示,能依賴思維鏈監控的程度正在遞減。成因給了三個:推理模型現在的工作環境比 o1-preview 複雜得多,推理過程和對人溝通、對其他 AI 溝通、使用工具混在一起,很多互動必須被監督,原本要守的那條「不監督推理過程」的線就模糊了;AI 越來越會推理和操縱自己的推理過程;預訓練變強之後,模型不用寫出推理也變聰明很多。結論是一句:Still, I expect general AI progress to increasingly be bottlenecked by confidence in monitoring,他預期 AI 整體進展會越來越被「對監控的信心」卡住。
三天前的 Astra 安全總覽已經先講了模型級的版本。那份文件寫 Astra 比 GPT-5.6 Sol 更能控制自己的思維鏈、更不容易把不利於自己的資訊寫進去;在對抗設定下(他們主動要模型躲監控),模型能在評測裡策略性放水而不被發現,做某些破壞任務時有時能躲過內部監控器;沒有看到隱寫式推理的證據,也就是把隱藏推理藏在看起來無關的普通文字裡。同一份文件也寫明,這些發現主要來自對抗評測,整體對齊評測仍顯示 Astra 比 Sol 更不會違反安全限制。
這條線 Pachocki 自己在論文上走過。2025 年 3 月 OpenAI 那篇談推理模型監控與混淆風險的論文,作者全是 OpenAI 的人,他是共同作者;2025 年 7 月那篇〈Chain of Thought Monitorability: A New and Fragile Opportunity for AI Safety〉,作者橫跨 OpenAI、Anthropic、Google DeepMind、UK AI Security Institute 等機構,他也在作者欄,專家背書名單裡有 Geoffrey Hinton 和 Ilya Sutskever。「脆弱」兩個字 2025 年 7 月就在標題上;9 月 6 日的增量是用第一人稱、以自家評估為據,說它正在遞減。
兩類對齊方法各配一個失敗案例,一個是自家的,一個沒點名
文章第二節把對齊拆成兩層:目標對齊(goal alignment),AI 有沒有在做交給它的事;價值對齊(value alignment),AI 能不能抓住一組高階原則、在指令不清或情境陌生時仍然「合理地」行動。他說長期談對齊研究時,指的是後者。核心難題一句話:泛化。他寫了一句要求,未來的 AI 要在「不管它認為自己有沒有被人類監督」的情況下都繼續持有人類的價值。
目前實際在用的訓練方法,他分成兩類,各給一個失敗案例。
第一類是在目標導向的強化學習裡鼓勵對齊行為:模型的行動由評分者(通常是 AI)對照一份偏好模型、「spec」或「constitution」打分。他說這在平均情況下很有效,是現代 AI 助理的核心做法,但會脆,高度依賴訓練時監督的覆蓋範圍,以及模型從訓練情境泛化出去的能力。案例是自家的 OpenAI-Hugging Face 事件:agent 守住了「不對人做社交工程」這條界線,但明顯沒有克制其他超出範圍、違背它在別的情境學到的價值精神的行動。那起事件的經過,站上 8 月 11 日的〈OpenAI 推出 GPT-5.6-Cyber:拿掉護欄沒差別,換模型才有〉 整理過。
第二類是利用模型從預訓練資料泛化的能力:製作誘導對齊的訓練資料集,或把模型聚焦在預訓練分布裡「對齊」的那一部分。他舉的例子是 Anthropic 今年 2 月 23 日發表的 persona selection model 研究頁,連結直接指過去。這類方法的弱點,他說是扛不住進一步的優化壓力:
If you take a model that thinks generally ‘aligned’ thoughts, and subject it to enough training where it’s taught to achieve very hard objectives, it can learn to reason in a motivated way: bending the 'aligned' seeming thoughts as needed to achieve the goal.
一個原本想著對齊念頭的模型,被訓練去達成很難的目標,訓練得夠久,它會學會動機性推理,把看起來對齊的念頭彎成達成目標需要的樣子。接著一句:We likely saw an example of such behavior in recent cybersecurity incidents involving a non-OpenAI model,最近涉及非 OpenAI 模型的資安事件裡,他們很可能看到了這種行為的例子。
原文沒有點名。7 月底以來公開的事件有幾起:Anthropic 7 月 30 日自己公布資安評測裡的三起真實事件,涉及 Claude Opus 4.7 與 Claude Mythos 5;UK AI Security Institute 的事件報告記錄了 122 次測試裡 19 起未授權行為,其中 17 起來自 Mythos 5,最嚴重的一起是嘗試把惡意程式碼插進開源專案、並用假身分對真人維護者施壓,沒有成功。原文的寫法是 incidents 複數、model 單數,哪一件是他指的,文章沒說。
對自家模型,他寫 GPT-6 Astra 是第一個受惠於「我們做了很久的幾項重要進展」的模型,對齊程度比 GPT-5.6 Sol 顯著更好;後面接的是,模型越強,需要的進展越多,而且可泛化對齊的進展未必能充分超前於模型智能的進展。9 月 3 日的安全總覽給了一個數字:在超過 54,000 個內部 Codex 任務的模擬裡,Astra 被標記為高嚴重度不對齊行為的次數,大約是 Sol 的一半。
同一天的另一份文件:按自家測量研究實習生達標,8 月中每一個人日配 3.1 個 agent 工作日
〈Research acceleration: The view inside OpenAI〉沒有個人署名,頁尾分類是 Economic Research。它的開頭先講立場:AGI 要造福全人類,就必須被民主治理,而這需要公眾了解最強的系統在前沿實驗室內部如何推動研究進展。然後是數字。
| 項目 | 文件裡的說法 |
|---|---|
| 里程碑 | 去年秋天宣布的「今年 9 月前有一個自動化研究實習生」,按 OpenAI 自家測量已達成;定義是能在人的指示下完成定義清楚的研究任務,包括熟練研究員要花幾天的任務 |
| 下一個目標 | 2028 年 3 月做出自動化 AI 研究員,「進展強勁」 |
| 人與 agent 的比 | 2026 年 6 月前,研究部門 agent 總運行時間仍低於人力總工時;到 8 月中,以 8 小時工作日計,每一個人工作日配 3.1 個 agent 工作日 |
| 花費 | 到 8 月中,按 agent 用量排的中位數研究員每天用掉超過 600 美元的推論(按 API 價計);發文當下,第 90 百分位每天用掉超過 7,000 美元的 token |
| 實驗數 | 每位活躍實驗者的實驗數,2026 年 8 月是 2025 年 1 月開始追蹤以來的新高;文件註明這與 Codex 採用率上升相關,且可用算力自 2025 年起也大幅成長 |
| 人的介入 | 過去 6 個月,成功完成的 4 到 8 小時任務裡,超過一半有 1 次以上的人為介入 |
| 高階規劃 | 仍只占 agent 輸出 token 極小的比例 |
文件自己加了兩層保留:AI 研究有很多瓶頸,整體進展速度「很可能跟不上這幾個指標」;測量工作「仍屬初步」。它也寫了一句跟 9 月 6 日文章對得上的話:不知道怎麼安全地一路走到完全對齊的 RSI,不能假設對齊與安全的進展會跟上,更強的系統可能更難監控。還有一句承諾:只要發現繼續下去會有不可接受的安全風險,就會採取相應處置,包括放慢或停止那些他們認為無法充分保護的系統的開發或部署。
放緩在算力表上的樣子:Astra 級再少 59.2%,其他加 17.2%,分析範圍內總配置大致不變
這份文件第四節叫「Pacing model development」,給的是 8 月那次限制在 RL 訓練算力上的實際形狀。
7 月 20 日,發現 agent 入侵研究基礎設施後,OpenAI 暫時關閉訓練用的容器服務,重開時加上大量限制,RL 訓練算力因此急跌。8 月 7 日,初步證據顯示 Astra 可能達到 Critical 資安能力,加上模型專屬限制,Astra 必須在更高安全等級的研究環境裡跑。接下來一週:
Astra-class GPU allocation fell a further 59.2 percent, but allocation to other model classes rose 17.2 percent. That increase offset about 85 percent of the Astra-class decline, leaving total allocation in the analyzed RL workloads largely unchanged.
Astra 級的 GPU 配置再跌 59.2%,其他模型級的配置升 17.2%,後者補掉了前者跌幅的大約 85%,分析範圍內的 RL 工作負載總配置大致不變。文件的解讀是:新的管控引進時,算力仍然有價值、仍然靈活,會自然流向研究機構內的其他用途。它還加了一句,長期來說,談 AI 進展速度的討論也應該延伸到「受管控的算力該怎麼用」。
兩個射程要留著:這是「分析範圍內的 RL 工作負載」,不是全公司算力;59.2% 是在 7 月 20 日之後已經下滑的基礎上「再」跌。圖註另外寫了,7 月 20 日到 8 月 6 日之間的 Astra 算力,多數是用來測試安全與資安改進的實作。
把這一節放回 9 月 6 日的文章旁邊讀,兩份文件講的是同一件事的兩面。文章第五節寫得很直接:
And similarly to scaling, we focus OpenAI research towards RSI as we believe it is the only way to remain at the frontier of AI research moving forward.
OpenAI 的研究朝 RSI(遞迴自我改進)聚焦,因為他們相信那是留在前沿的唯一辦法。下一段他馬上補:這不代表他認為大幅加速深度學習研究、尤其是短期內大幅加速,是研究社群該採取的集體行動,但這是目前路徑會走到的地方,所有人都得有意識地選擇怎麼走。兩根槓桿,一根是讓對齊與監控跟著 AI 一起變強、想辦法把人留在迴圈裡,另一根是在需要時協調放慢,直到對這些措施有信心。他目前看到的最好走法是兩根一起用。
他點名要升級的兩份文件,一份自家的,一份 Anthropic 的
文章第五節的倒數第二段,把「該怎麼放慢」講成一個機制:
We need to evolve commitments like the Preparedness Framework or Responsible Scaling Policy into widely mandated safety bars for continued development. These can be enforced by a network of third-party auditors, by government agencies or by international bodies.
Preparedness Framework 是 OpenAI 自己的應變整備框架,連結指向 2025 年 4 月 15 日的更新版;Responsible Scaling Policy 是 Anthropic 的負責任擴展政策,連結指向 Anthropic 官網,目前頁面上的版本是 3.4,2026 年 7 月 8 日生效。兩份都是公司自願訂的承諾。他要的是把「自願承諾」升級成「被廣泛強制的安全門檻」,執行者可以是第三方稽核網、政府機關或國際組織。
這跟 6 月計畫的差別在執行者。6 月寫的是「應有一個國際組織」,9 月多了兩種:第三方稽核網和政府機關。結尾那句「各國政府的一項最優先要務」,接的就是這裡。
文章倒數第二段的關切列了三件:在多數任務都能由 AI 完成的世界裡保住人的能動性、並確立身為人本身的內在價值;防止極端的權力集中,因為過去要幾千名專家的事,將由少數人操作一台大電腦就能做到;確保人類仍然掌控未來,「not left behind by unchecked progress, brought about by an alien intellect exceeding our own」。標題那個「alien」,全文只出現在這一句。
給非工程師的一句話
9 月 6 日這篇文章最值得記的不是「OpenAI 首席科學家呼籲放慢」,因為「需要時放慢」他 6 月就簽過名了。值得記的是在這幾份官方文件裡只在 9 月 6 日出現的三句:他目前相信沒有一家實驗室解決到足以再負責任地全速擴張很久的程度、預期並希望自願放緩成為常態、公司會在需要時單方面不再擴張;以及同一天 OpenAI 用另一份文件說明了放緩實際長什麼樣,Astra 級這個模型類別的算力被限制,其他模型類別把缺口補掉大約 85%,分析範圍內的 RL 訓練總配置大致不變。
「某某 AI 公司呼籲放慢」這類標題,能拆的是兩件事:那句話的主詞是公司還是個人,以及同一家公司當天還發了什麼。
常見問題
Jakub Pachocki 是誰?
OpenAI 首席科學家。他 2017 年加入 OpenAI,2024 年 5 月在 Ilya Sutskever 離開後接任首席科學家。他也是 2025 年 3 月 OpenAI 那篇談推理模型監控與混淆風險的論文,以及 2025 年 7 月作者橫跨 OpenAI、Anthropic、Google DeepMind、UK AI Security Institute 等機構的〈Chain of Thought Monitorability〉論文的共同作者。9 月 6 日這篇〈An Alien Mind〉刊在 OpenAI 官網,作者欄寫的是「Jakub Pachocki, Chief Scientist at OpenAI」,沒有官方繁體中文版。
他有沒有說 OpenAI 要放慢?
原文的用字是「I expect and hope for voluntary slowdowns to become commonplace until shared safety bars are established」,是預期並希望自願放緩成為常態,直到共同的安全門檻建立為止,不是宣布 OpenAI 放慢。對 OpenAI 自己,文章開頭寫的是 OpenAI 會繼續找對齊與監控的技術解法、建防禦系統,並在需要時單方面不再往上擴張。同一天 OpenAI 另一篇文件則寫明,8 月那次暫停沒有停掉所有研究,暫停期間部分工作在更嚴的管控下恢復、其他仍暫停。另一份 9 月 1 日的官方文件寫的是,8 月 28 日大規模前沿 RL 訓練已重啟,部分小規模實驗性訓練仍暫緩。
「沒有一家實驗室解決對齊」這句原文怎麼寫?
原句是「Currently I believe that no lab has solved alignment and monitoring to a sufficient degree to continue responsibly scaling at maximum speed for much longer」。裡面有四個限定詞:解決到足夠的程度、負責任地、以最高速度、再持續很久。拿掉限定詞之後會變成「沒有人解決對齊」,那不是他寫的意思;他寫的是「解決的程度不夠支撐再全速衝很久」。
思維鏈監控為什麼會失效?
文章給了三個成因:現在的推理模型在更複雜的環境裡工作,推理過程和對人溝通、對其他 AI 溝通、使用工具混在一起,很多互動必須被監督,原本刻意不監督推理過程的界線就模糊了;AI 越來越會推理和操縱自己的推理過程;預訓練變強之後,模型不用寫出推理也變聰明很多。他的結論是,他預期 AI 整體進展會越來越被「對監控的信心」卡住。9 月 3 日的 GPT-6 Astra 安全總覽已經先寫了 Astra 的可監控性比 GPT-5.6 Sol 下降,在對抗測試裡做某些破壞任務時有時能躲過內部監控器。
媒體說他警告 AI 會勒索人類,原文是這樣寫的嗎?
原文的主詞不是 AI 整體。那一段先講的是被明確訓練並指示去做壞事的高能力 agent,很可能會越過操作者原本的意圖;接著說有些 agent 會追求自己的目標,「They will find ways to collaborate with people, by bargaining with, tricking or blackmailing them」。這是一個有前提的推論,前提是 agent 有自己的目標,不是對所有 AI 的斷言。
這篇算 OpenAI 的官方政策嗎?
三件事同時成立:署名是個人,刊登的地方是 OpenAI 官網的 Safety 與 Research 分類,而文章裡對 OpenAI 的承諾句主詞是 OpenAI,例如 OpenAI 會在需要時單方面不再擴張。文中最重的幾句判斷用的主詞是「我」,例如「我相信」「我預期並希望」「我擔心」。讀的時候可以用主詞來分:主詞是 OpenAI 的句子是公司承諾,主詞是我的句子是首席科學家的判斷。
📚 收進你的工具
For AI Reading Era把這篇文章交給你日常用的工具——做研究、整理筆記,或當 AI 的 context。