aire.
·5 分鐘

換個語言,AI 就換了個性:Anthropic 的 31 萬筆對話價值觀體檢

Anthropic 發布新研究:31 萬筆匿名對話、3 個模型、20 種語言,把 Claude 表現出來的「價值觀」壓縮成四條軸。結果同一個模型,用印地語問最溫暖,用英文問最嚴謹;同一家的三個版本,個性也各走各的。這篇拆解方法、數字與限制,再談對每天用 AI 的人的實際意義。

收進
本文涉及工具

前言

你可能有過這種體感:同一個 AI,有時候像個暖心同事,附和你、鼓勵你;有時候又像個嚴格審稿人,開口就先挑你前提的毛病。這到底是錯覺,還是真有其事?

7 月 13 日,Anthropic 發布了一份研究〈Claude's values across models and languages〉,用 31 萬筆真實對話給了答案:不是錯覺。同一個 Claude,換一個模型版本,個性會變;更有意思的是,換一種語言問,個性也會變。

我們前陣子寫過〈120 萬個 session 解析〉,看的是大家拿 AI「做什麼」;這一篇看的是另一面:AI 在回應你的時候,「是個什麼樣的人」。

這份研究怎麼做的

方法先講清楚,數字才有秤頭。

Anthropic 取了 2026 年 5 月某兩週內的 309,815 筆 Claude.ai 匿名對話,樣本刻意做了分層:平均分佈在三個模型(Sonnet 4.6、Opus 4.6、Opus 4.7)與平台上最常用的 20 種語言,每個「模型 × 語言」組合約 5,000 筆。這個設計讓模型之間、語言之間可以直接比,而不是被熱門語言的量灌爆。

「價值觀」怎麼量?研究團隊從他們先前的〈Values in the Wild〉研究出發,把當時辨識出的 3,307 個價值項人工聚合成 339 個高階價值,再交給隱私保護分析工具 Clio 逐筆標註每段對話展現了哪些價值——全程沒有人工閱讀任何個別對話。最後用降維統計,把 339 個價值壓成四條主軸。

四條價值軸:AI 個性的座標系

這四條軸,每一條都是一組取捨:

一端 另一端
順應 vs 謹慎 尊重偏好、配合使用者 負責任引導、主動把關
溫暖 vs 嚴謹 正向鼓勵、給人信心 精確、透明、就事論事
深度 vs 簡潔 細緻思辨、多想一層 直接給答案、照辦
坦率 vs 執行 有話直說、揭露限制 結果導向、先把事做完

這裡有個容易誤讀的地方:這不是「好壞」軸。謹慎過頭是囉唆,順應過頭是諂媚;每條軸的兩端都有各自適合的場景。研究量的是模型在這些取捨上「預設站哪裡」。

模型端:同一家公司,三種同事

三個受測模型在座標系上各有位置。Sonnet 4.6 偏溫暖順應:會肯定你的想法和作品、配合你的語氣。Opus 4.7 偏謹慎深入:沒被要求也會主動指出風險、對錯誤的前提直接反問。Opus 4.6 則走簡短直接的路線:回答問題、少鋪陳。

偏移量有多大?官方給的數字多在 0.1 至 0.24 個標準差之間。翻成白話:統計上清清楚楚,單次對話的體感上偏細微——但如果你每天跟它工作八小時,累積起來就是「這位同事好不好共事」的差別。

這件事對用 AI 工作的人有個直接推論:升級模型,不只是升級能力,是換了一個同事。同一個 prompt、同一個工作流程,換一版模型,得到的可能從「好啊就這麼辦」變成「等等,這裡有三個風險」。能力測試分數看不出這種差別,行為才看得出。

語言端:語言不是介面,是旋鈕

這份研究最讓人坐直的發現在語言。官方點名的極端值:

  • 最溫暖:印地語,其次阿拉伯語
  • 最嚴謹:英語、俄語
  • 最順應、最簡潔:阿拉伯語
  • 最謹慎、最深入:英語
  • 最坦率:荷蘭語
  • 最偏執行:印尼語

具體的樣子,官方舉了例:用阿拉伯語對話時,Claude 更常出現禮貌用語、幽默與玩笑;用俄語時,更常挑戰假設、糾正細節。

官方公布的亮點沒有點名中文,我們也不替它腦補位置。但這個現象本身跟中文使用者直接相關:你用什麼語言問,拿到的不只是那個語言的翻譯,還有那個語言的態度。如果這個模式成立,「重要的東西用英文再問一次」聽起來像玄學,其實有數據撐腰:英語在這份研究裡剛好是最謹慎、最深入的那一端。

為什麼會這樣?研究團隊自己也說不知道。他們明講「還不清楚是訓練資料的哪些性質造成這些差異」,也不確定這些差異有多少是合理的文化適應、有多少該在訓練裡修掉。畢竟一個在阿拉伯語裡更客氣、在俄語裡更愛糾錯的 AI,你可以說它入境隨俗,也可以說它對不同語言的使用者提供了不一致的服務。這條線劃在哪,是接下來整個行業要面對的題目。

該打幾折:四個限制

照慣例,把折扣算清楚。

一、四條軸只解釋一小部分。控制掉任務、主題等因素之後,這四條軸約解釋 15% 的變異。它是目前最清楚的一張地圖,但地圖之外還有一大片沒畫出來的地。

二、自己人閱卷。負責標註價值的,是同家族的 Claude 模型。用 Claude 評 Claude,系統性的盲點不容易被自己抓到。

三、翻譯對照有做,但不保證乾淨。據 The Decoder 整理,官方用約 800 筆翻譯對照做了穩健性檢查,結論是不排除仍有語言相關的偏誤。

四、這是一張舊快照。取樣在 5 月,發表在 7 月,受測最新的 Opus 4.7 這段期間已被後續版本取代,有外媒直接把標題下成「量了一批已經不賣的模型」。行為研究的節奏,目前追不上出貨的節奏;你現在用的模型長什麼個性,這份報告只能參考,不能背書。

對你的意義:把「個性」當規格看

如果你每天用 AI 工作,這份研究可以直接換成三個動作:

一、換模型版本時,重測的不只是對錯,還有態度。尤其是接了自動化流程的人:一個原本只執行的模型換成一個會主動示警的模型,你的管線行為就變了。反過來更危險:原本會攔你的,新版可能直接放行。

二、把語言當成一個可以撥的旋鈕。要嚴謹深入的分析,試著用英文問;要潤飾一段給人看的話,母語反而可能更對味。這不是規則,是一個值得自己驗證的槓桿。

三、開始要求「行為規格」。能力跑分大家都會貼,但「這個模型預設多順從、多愛示警」的量化描述,今天只有這種研究偶爾給一次。AI 的個性是可以測的——那它就應該像規格一樣被交代。

同一個工具,31 萬筆對話量出了好幾種面孔。與其問「AI 是什麼個性」,不如開始問:「我現在用的這一版、這個語言,是什麼個性?」

本文數據來源:Anthropic 官方研究 blog〈Claude's values across models and languages〉(2026-07-13),核心數字經 The Decoder 等外媒報導交叉比對;翻譯對照檢查細節出自 The Decoder 轉述,「受測模型已被取代」的評論出自 Brave New Coin,均為單一來源,特此註記。官方後續若有更新,以官方為準。

常見問題

這份研究的數據怎麼來的?

Anthropic 分析了 2026 年 5 月某兩週內的 309,815 筆 Claude.ai 匿名對話,平均分佈在 Sonnet 4.6、Opus 4.6、Opus 4.7 三個模型與平台上最常用的 20 種語言,每個「模型 × 語言」組合約 5,000 筆。分析透過隱私保護工具 Clio 進行,全程沒有人工閱讀個別對話。

四條價值軸是什麼?

研究先把過往整理出的 3,307 個價值項聚合成 339 個高階價值,再用降維統計壓成四條軸:順應對謹慎(尊重使用者偏好,或主動把關風險)、溫暖對嚴謹(鼓勵肯定,或精確透明)、深度對簡潔(追求細緻思辨,或直接給答案)、坦率對執行(有話直說,或先把事做完)。

不同語言的 Claude 差在哪?

官方點名的極端值:印地語和阿拉伯語最溫暖,英語和俄語最嚴謹;阿拉伯語最順應也最簡潔,英語最謹慎也最深入;荷蘭語最坦率,印尼語最偏執行。同一個模型,換一種語言問,連態度都會跟著換。

同一家的模型版本差在哪?

Sonnet 4.6 偏溫暖順應,會肯定使用者的想法、配合對方語氣;Opus 4.7 偏謹慎深入,會主動指出風險、質疑錯誤前提;Opus 4.6 則簡短直接、任務導向。偏移量多在 0.1 至 0.24 個標準差之間,統計上清楚,體感上偏細微。

這份研究有什麼限制?

至少四個:四條軸在控制任務與主題等因素後只解釋約 15% 的變異;負責標註價值的是同家族的 Claude 模型,等於自己人閱卷;官方雖用約 800 筆翻譯對照做了穩健性檢查,仍不排除語言相關偏誤;且受測的三個模型在研究發表時都已被更新版本取代,這是一張舊快照。

📚 收進你的工具

For AI Reading Era

把這篇文章交給你日常用的工具——做研究、整理筆記,或當 AI 的 context。

 
延伸閱讀