aire.
·5 分鐘

GPT-Live-1 vs Gemini 3.8 Live:語音 API 怎麼選,先問要不要吃鏡頭

OpenAI 9 月 10 日在 API 上線 GPT-Live-1,Google 9 月 15 日跟著發布 Gemini 3.8 Live,兩家只差五天。但把官方技術規格表攤開來看,這不是「誰比較便宜」的問題:GPT-Live-1 完全不吃鏡頭或螢幕畫面,只有語音與文字;Gemini 3.8 Live 額外吃得下每秒最多一張的 JPEG 截圖流。價格上,GPT-Live-1 的 0.05 美元/分鐘是連線時間買斷,Gemini 3.8 Live 的音訊費率是按實際流量計費,兩邊帳單邏輯本來就不是同一種算法。

收進
本文涉及工具

9 月 10 日,OpenAI 在 API 上線 GPT-Live-1。9 月 15 日,Google 跟著發布 Gemini 3.8 Live 與帶背景推理的 Extended Thinking 版本,官方部落格寫明開發者管道是 Gemini API 與 AI Studio,同時也鋪進一般使用者會碰到的 Search Live 與 Workspace(Docs/Gmail/Keep Live)。兩家只差五天,開發者社群很自然地在問「該選哪一個」——但這篇文章要談的是開發者真正拿得到的 API,不是使用者介面裡的體驗。

但把兩邊的官方技術規格表攤開來看,這其實不是「誰比較好」的問題——是兩種不同的產品。

先問一句:你的產品要不要吃畫面

OpenAI 的 GPT-Live-1 模型頁,Modalities 那張表寫得很直白:Text 支援輸入輸出、Audio 支援輸入輸出,Image 不支援、Video 也不支援。它是一個全雙工(full-duplex)純語音模型,能同時聆聽與說話,但推理和工具呼叫是委派給後端另外配置的模型去做——官方原文是「It can listen and speak at the same time, and delegate reasoning and tool use to a backend agent.」。

Gemini 3.8 Live 不一樣。Google 的技術規格頁列出 Input modalities 是 Audio(16-bit PCM、16kHz)、Images(JPEG,每秒最多一張)、Text;Output modalities 是 Audio(16-bit PCM、24kHz)。它吃得下畫面,只是不是連續視訊串流,而是低幀率的 JPEG 截圖流——鏡頭或螢幕分享在產品層就是這樣實作的。

這一步決定一切,但要分清楚「畫面」是指什麼:如果是「語音 session 進行的當下,AI 要同步看到使用者在做什麼」——客服邊講邊看截圖、智慧眼鏡邊講邊辨識眼前物體——GPT-Live-1 的模態表已經排除了這條路,session 本身收不了 Image/Video。如果只是先把一張截圖或畫面交給另一個支援視覺的模型分析、再由 GPT-Live-1 把分析結果講出來,架構上做得到,只是那已經是另一層系統整合,不是 GPT-Live-1 這顆語音模型本身的能力。如果只需要純語音一問一答,兩邊才算進入同一個擂台。

計費邏輯本來就不是同一種算法

價格是第二個容易被誤讀的地方。GPT-Live-1 前端語音層是每分鐘 0.05 美元,官方寫明「billed per second」、且不會被無條件進位到下一分鐘——但這是連線時間買斷,session 開著多久就算多久,不管當下是誰在講話。背後配的推理模型(Responses API)另外照該模型自己的牌價計費,官方原文直接寫「Backend Responses calls use the normal pricing for the configured model and tools」,沒有指定預設要搭哪個模型。

Gemini 3.8 Live 的音訊費率是輸入每分鐘 0.005 美元、輸出每分鐘 0.018 美元(官方同時給了每百萬 token 的算法,per-minute 是官方換算好的等效值),這是依實際流量計費、端到端價格,沒有另一層後端模型費用。

兩者算法不同,直接相加比較會失真。以下通話成本是 aire 依官方公布的每分鐘費率自己換算的情境數字,不是任何一方官方公布的固定通話方案價。用「雙向同時講滿」的理論上限估:10 分鐘通話,GPT-Live-1 前端層 0.5 美元、Gemini 3.8 Live 純音訊 0.23 美元;60 分鐘則是 3 美元對 1.38 美元。但真實對話很少雙向同時講滿,改用一般輪流對話 50/50 估,Gemini 3.8 Live 10 分鐘會落在約 0.115 美元、60 分鐘約 0.69 美元。GPT-Live-1 這邊還沒完——前端 0.5 美元之外,還要疊加後端模型的 token 費用。舉個情境示範(非官方套餐價,只是示範算法,不是說這是官方推薦或常見的後端搭配):如果後端配 aire 站內另一篇已查證過牌價的 GPT-6 Astra(每百萬輸入 token 10 美元、輸出 50 美元),一段 10 分鐘對話粗估處理 3,000 輸入加 3,000 輸出 token,後端費用約 0.18 美元,加上前端 0.5 美元,10 分鐘總價落在約 0.68 美元——這只是說明「GPT-Live-1 的帳單是前端加後端兩段疊加」的結構,實際數字取決於你自己配的後端模型。

免費層也是一個對稱的落差:GPT-Live-1 的並行 session 上限表裡,Free 那一列寫著「Not supported」,最低要 Tier 1(25 個並行 session)的付費帳號才進得去;Gemini 3.8 Live 則有 Free tier 可以直接免費打 API 試手感,差別是 Free tier 的資料官方會用來改進產品,Paid tier 才不會。

兩邊都內建逐字稿,但其他附加功能各自不同

先說兩邊都有的:GPT-Live-1 官方模型頁寫明「natively provides ASR transcripts and response text」,也就是原生就有雙向逐字稿;Gemini 3.8 Live 的 Key features 裡同樣列了 Audio transcriptions。這一項不是差異點,兩邊都內建。

差異在其他附加功能。Google 官方列的 Key features 裡,Gemini 3.8 Live 支援 70 種以上語言對話、隨時可被打斷(barge-in)、Proactive audio(模型自己判斷什麼時候該接話)、Affective dialog(語氣會跟著使用者的表達方式調整)。官方頁面另外列了 Live Translation(即時語音對語音翻譯)功能,但那其實是另一顆獨立模型(gemini-3.5-live-translate-preview),有自己另外的一套費率,不包含在 Gemini 3.8 Live 的音訊費率裡,要翻譯得另外呼叫、另外計價。

GPT-Live-1 的功能支援表寫著 Streaming、Function calling 支援,但 Structured outputs、Fine-tuning、Predicted outputs 都不支援。它的定位更像一根「語音管線」——聽與說、逐字稿這一段做得好,但工具使用(tool use)與複雜判斷邏輯、狀態管理,都交給你自己配置的後端模型去處理;端點也和既有的 Realtime API(v1/realtime)分開,是獨立的 v1/live/sessions,兩者並存不是取代關係。事實表裡沒有找到官方寫 GPT-Live-1 支援幾種語言的具體數字,這點留白,不代人猜。

小團隊還要看的一件事:並行上限

如果產品要正式上線,並行使用人數也是門檻之一。GPT-Live-1 的並行 session 上限是按付費 tier 分級的:Tier 1 只有 25 個並行 session,Tier 2 是 50、Tier 3 是 200、Tier 4 是 300、Tier 5 是 500——剛起步的小團隊帳號多半卡在較低的 tier,25 個並行連線對一個小型客服或語音助理產品未必夠用,得先確認自己帳號的 tier,別等上線撞牆才發現。這一點官方頁面沒有寫 Gemini 3.8 Live 的對應數字,本篇不比較,只提醒 GPT-Live-1 這邊有這道門檻要先查。

給繁中小團隊的選型建議

先問「要不要吃畫面」。要,Gemini 3.8 Live 目前是唯一選項;GPT-Live-1 現階段的模態表完全排除鏡頭與螢幕輸入,不是價格或體驗的問題,是規格上做不到。

不需要畫面、純語音對話(客服電話、語音助理這類場景),才進入真正的比價:Gemini 3.8 Live 的檯面費率明顯較低、有免費層可以先試,內建 70+ 語言對話;GPT-Live-1 的前端層費率單純,但要自己另外配後端模型、自己接工具鏈,整體帳單與工程量都取決於你怎麼配置後端。兩邊都內建雙向逐字稿;即時翻譯兩邊都得另外處理——Gemini 那頭是另一顆獨立計價的模型,不是 3.8 Live 本身內建。

兩家上線都在最近兩週內,9 月 29 日 OpenAI DevDay 前後可能還有新公告。這篇的定價與規格數字是發稿當下逐一對過官方頁面查到的,真要導入生產環境前,建議自己再上 developers.openai.com 與 ai.google.dev 重查一次官方頁面。

常見問題

GPT-Live-1 和 Gemini 3.8 Live 最大的差別是什麼?

不是價格,是吃不吃得下畫面。OpenAI 官方模型頁的 Modalities 表逐字寫著 GPT-Live-1 的 Image 與 Video 兩欄都是「Not supported」,只吃語音與文字。Gemini 3.8 Live 的技術規格頁則列出 Input modalities 包含「Images(JPEG,每秒最多 1 張)」,也就是能吃鏡頭或螢幕分享的低幀率截圖流。如果產品需要「AI 在語音對話當下同步看到畫面」(例如客服邊講邊看使用者截圖、AR 眼鏡邊講邊辨識眼前物體),GPT-Live-1 的語音 session 目前技術上無法直接串流接收畫面;如果只需要純語音對話,兩邊才進入同一個擂台。

GPT-Live-1 的 0.05 美元/分鐘和 Gemini 3.8 Live 的費率,哪個比較便宜?

不能直接比,因為計費邏輯不一樣。GPT-Live-1 的 0.05 美元/分鐘是連線時間買斷——官方寫明「billed per second」,算的是連線的 wall-clock 時間,不管誰在講話都照算,而且這只是前端語音層,背後配的推理模型另外用該模型自己的牌價計費。Gemini 3.8 Live 的音訊費率是輸入每分鐘 0.005 美元、輸出每分鐘 0.018 美元,按實際音訊流量算,是端到端價格、沒有另一層後端模型費(即時翻譯是另一顆獨立模型、另外計價,不算在這個音訊費率裡)。以下是本站依官方每分鐘費率自算的情境數字,不是任何一方官方公布的固定通話方案價:用雙向同時講滿的理論上限估,10 分鐘 GPT-Live-1 前端層 0.5 美元、Gemini 3.8 Live 0.23 美元;如果照一般輪流對話抓 50/50,Gemini 3.8 Live 10 分鐘落在約 0.115 美元。GPT-Live-1 這邊還要另外加後端模型費用,實際總價要看你配哪個模型。

GPT-Live-1 有免費額度可以先試用嗎?

沒有。OpenAI 官方的並行 session 上限表裡,Free 那一列寫的是「Not supported」,最低要 Tier 1(25 個並行 session)的付費帳號才能用。Gemini 3.8 Live 則有 Free tier,可以直接免費試打 API,差別是 Free tier 的資料官方會拿去改進產品,Paid tier 才不會。

DevDay(9 月 29 日)前這篇文章的數字會不會過期?

有可能。兩家上線都在最近兩週內,DevDay 前後常有新公告或費率調整,這篇的定價數字寫稿時逐一對過官方頁面與 Wayback 存檔,但語音 API 這塊目前變動頻率高,正式導入生產環境前,建議直接重新查一次 developers.openai.com 與 ai.google.dev 的官方頁面,別只信這篇文章的數字。

📚 收進你的工具

For AI Reading Era

把這篇文章交給你日常用的工具——做研究、整理筆記,或當 AI 的 context。

 
延伸閱讀