Gemini 代理式影片理解實測:問它講了什麼,它一張畫面都沒載,token 少 98%
Google 在 9 月 1 日發表代理式影片理解,官方數字是成本最多省 66%、token 最多省 88%,兩個「最多」衡量的是不同指標。9 月 3 日用官方 API 對一支 13 分 50 秒的公開影片跑七次呼叫:問它講了什麼,static 模式吃掉 76,203 個 token,agentic 模式 1,076 個,工具載入欄裡沒有任何畫面。一支影片、一次實測,但省的方式攤開了:不是看得更快,是決定不看。
事實分級:官方數字與機制來自 Google 2026 年 9 月 1 日的發表文,以及 Gemini API 文件的 Video understanding、Tokens、Pricing、Release notes 四頁(都在 9 月 3 日重新核對,文件標示最後更新 9 月 2 日)。實測是 9 月 3 日用官方 REST API 對同一支公開 YouTube 影片跑的七次呼叫,一支影片、一次觀察;成本是用 usage 欄位乘以牌價算出來的,不是帳單。
同一支 13 分 50 秒的影片、同一個問題,static 模式吃掉 76,203 個 token,agentic 模式只用了 1,076 個。9 月 3 日跑的一次實測,一支影片、一題。差距不是壓縮出來的:模型沒有把整支影片放進 context,工具載入欄裡只有文字模態、沒有任何畫面,讀完就回答。
Google 在 9 月 1 日發表這個功能,標題是「Introducing agentic video understanding with Gemini」(Google 發表文),列了三款模型:Gemini 3.7 Flash、3.6 Flash、3.5 Flash-Lite。給的數字是三個「最多」:分析成本最多省 66%、token 最多省 88%、準確度最多升 7%,前提寫在同一句裡——跨標準影片分析基準測試。
省的方式,發表文自己交代了:模型決定「what to watch, at what speed, and through which modality」(Google 發表文),只抓需要的片段與訊號。文件寫的是用量隨問題、內容複雜度與模型的導航策略變動,不再像 static 那樣跟影片長度成正比。另一件事官方沒說:66% 和 88% 是兩個各自的上限,不是同一次比較;而這一次實測裡,依牌價推算的成本減幅(約 94%)小於 token 減幅(98.6%),錢確實省得比 token 少。計價表上可推算出一個可能的機制,官方沒有解釋。
官方一次給了三個「最多」,token 的減幅最大
衡量的指標不一樣。
| 官方數字 | 衡量的指標 | 出處 |
|---|---|---|
| 分析成本最多省 66% | 跨標準影片分析基準測試的分析成本 | 9 月 1 日發表文 |
| token 最多省 88% | 同一組基準測試的 token 消耗量 | 9 月 1 日發表文 |
| 準確度最多升 7% | 同一組基準測試的準確度 | 9 月 1 日發表文 |
| 一小時講座的官方例句:static 約 1.08M、agentic 可能約 108K tokens | 單支影片的 token 用量,官方用的是「可能」的說法 | Gemini API Tokens 文件 |
| 增益圖表跑的是 Gemini 3.7 Flash 在 LongVideoBench 上的結果 | 單一模型、單一基準測試 | 9 月 1 日發表文圖說 |
那個 108K 官方加了條件——「depending on the prompt and content」(Gemini API Tokens 文件)。順帶一提,1.08M 等於 3,600 秒乘以每秒 300 個 token,用的是高解析度的算法,108K 是它的十分之一。
這三個數字衡量的是不同指標,把它們寫在同一句裡就是在誤導。66% 說的是錢,88% 說的是 token,7% 說的是答對的程度;官方寫的是每一個都「最多」,沒有說它們會同時落在同一次呼叫上。發表文也把品質那條講清楚了:三款模型都有增益,但 Gemini 3.7 Flash 的整體品質最好、品質與成本的組合也最好,官方稱它在受測模型裡位於 Pareto 前緣。
機制那句寫得很乾淨。agentic 模式是模型按題目取材:看什麼、用什麼速度看、走哪個模態(畫面、音軌、字幕),三件事自己決定,只抓需要的片段與訊號;發表文用的動詞是呼叫一個內部工具,去載入影片檔的相關部分。對照組是 static:固定幀率吃整支影片,預設 1 FPS,可以經 API 調整。
官方也說了,開發者以前就可以手動做同樣的事。這次的差別是把這個迴圈搬進模型裡面,發表文把它類比成 agentic vision——程式碼執行加上原生圖像理解的那一套。
發表文列舉了四個用例,並沒有把清單收在那裡:秒以下的片段定位(1 FPS 容易整段漏掉)、長片大海撈針、異常偵測、動作與物件計數。發表文說增益在長片上特別明顯,範圍從 10 分鐘的教學片到 90 分鐘的講座和多小時的錄影。
static 模式的帳算得出來:一秒約 100 個 token
文件給了公式。低解析度每幀 66 tokens,高解析度每幀 258 tokens,音訊每秒 32 tokens,再加一點 metadata。合起來官方寫成約每秒 100 個 token(預設低解析度)或約 300 個(高解析度)。
Tokens 文件那張模式表對 static 的形容只有一行:「Predictable, proportional to video duration」(Gemini API Tokens 文件)。長度上限文件也給了:1M context 的模型在預設低解析度下最長吃 3 小時影片,高解析度最長 1 小時。拿一支 10 分鐘的影片套進去:
| 一支 10 分鐘影片(static) | 低解析度 | 高解析度 |
|---|---|---|
| 影片輸入 token | 約 60,000 | 約 180,000 |
| Gemini 3.7 Flash 依牌價推算 | 約 $0.045 | 約 $0.135 |
| Gemini 3.5 Flash-Lite 依牌價推算 | 約 $0.018 | 約 $0.054 |
(按官方約 100/約 300 tokens/秒的近似值推算,非實測;只算影片輸入,不含輸出與思考。官方底層是每幀 66 或 258 個 token,加上音訊每秒 32 再加 metadata,所以這一欄本身是近似值。)
牌價來自計價頁:Gemini 3.6 Flash、3.7 Flash、3.8 Flash 三款同價,輸入每百萬 tokens $0.75、輸出 $3.75,這個價到 2026 年 12 月 31 日為止,2027 年 1 月 1 日起變成 $1.50 與 $7.50;Gemini 3.5 Flash-Lite 輸入 $0.30、輸出 $2.50,文字、圖像、影片、音訊都是同一個輸入價。7 月那篇便宜模型實測量的是 Google 同一條走量線。
static 的好處不是便宜,是帳可預測。影片輸入那一格可以依片長與解析度先算出來,不會因為換一個問題就上下跳;thought 與輸出仍隨題目變動,但在後面那次 static 呼叫裡只占 4%。做預算、做報價、做用量上限,這一格填得進去。
問它講了什麼,模型只載入文字
這次測的是理解,不是生成——6 月那篇影片模型實測測的是把影片做出來,這一篇測的是把影片讀進去。
影片挑的是發表文範例程式碼裡那一支:https://youtu.be/7Z5Vy9JBANs,Google 的 I/O 2026 Gemini keynote。YouTube 頁面的 metadata 標的是 Google 頻道、2026 年 5 月 22 日上傳、長度 830 秒,也就是 13 分 50 秒;各次呼叫裡模型自己回報的長度落在 13:49 到 13:51 之間。內容三點是模型回報的:Gemini app 重新設計、Gemini Omni 進 app、Daily Brief 與 Gemini Spark 兩個代理功能,這三點沒有人工逐段核對。
題目只有一句:列出三個最重要的重點,各附首次提到的 MM:SS 時間戳,最後給總長度。另外準備了一題畫面題:描述 05:00 畫面上有什麼,不要靠字幕,80 個英文單字以內。七次呼叫的 usage 長這樣:
| 呼叫 | 模型 | 模式 | 秒 | 輸入(其中影片) | 工具載入(模態) | total_thought_tokens |
輸出 | 合計 |
|---|---|---|---|---|---|---|---|---|
| static-37 | 3.7 Flash | static | 15.2 | 75,571(75,533) | 0 | 458 | 174 | 76,203 |
| probe-37-agentic | 3.7 Flash | agentic | 11.0 | 109 | 155(text) | 554 | 258 | 1,076 |
| agentic-37-r2 | 3.7 Flash | agentic(重跑) | 8.2 | 146 | 192(text) | 470 | 280 | 1,088 |
| static-38 | 3.8 Flash | static | 13.4 | 75,571(75,533) | 0 | 538 | 206 | 76,315 |
| agentic-38 | 3.8 Flash | agentic | 9.9 | 171 | 217(text) | 885 | 263 | 1,536 |
| agentic-lite | 3.5 Flash-Lite | agentic | 9.2 | 38 | 84(text) | 0 | 187 | 309 |
| agentic-37-visual | 3.7 Flash | agentic(畫面題) | 10.6 | 130 | 458(text 194+image 264) | 241 | 148 | 977 |
(token 是 usage 欄位原值;秒數是含網路往返的 wall time。)
先看 static 那一列的分子分母:75,533 個影片 token 除以 830 秒等於每秒 91 個,跟官方寫的「約 100 個/秒」(預設低解析度)落在同一個量級。
公式沒有騙人。
再看減幅。前三個對照的是同一個模型的 static:Gemini 3.7 Flash 第一次 98.6%,重跑一次還是 98.6%;Gemini 3.8 Flash 98.0%。Flash-Lite 沒跑 static,對照 Gemini 3.7 Flash 的 static 是 99.6%。這四個數字全都超過文件對長片寫的那個上限——最多少 88% 的總 token——差別看起來在題目:問「講了什麼」,文字模態的資料就答得完,工具載入欄裡一張畫面都沒有。這一支、這一題如此,換一支影片、換一題就不是這個數字了。
六次回報了時間戳的呼叫,數字彼此接近但不相同:static-37 給 02:28/05:01/06:42,static-38 給 02:28/05:01/06:40,probe-37-agentic 給 02:26/05:00/06:41,agentic-37-r2 給 02:26(另提 02:30)/04:58(另提 05:00)/06:41,agentic-38 給 02:20/05:00/06:41,agentic-lite 給 02:26/04:54/06:41。最大的一筆差距是 8 秒——Gemini 3.8 Flash 的 agentic 回報 02:20,同一款模型的 static 回報 02:28。六次的三個重點內容相同。沒有第三方標準答案可以對,所以只能說彼此接近,不能說正確。
真正把省法攤開的是畫面題。問「講了什麼」時,工具載入欄只有 text 一種模態,四次分別是 155、192、217、84 個 token;問「05:00 畫面上有什麼」時,同一支影片、同一個模型,工具載入變成 text 194 加上 image 264。多出來的 264 很接近文件寫的高解析度每幀 258 tokens,推測是一張畫面。
換一個問題,模態就換了。
畫面題的答案是這樣(模型描述,未逐格核對):紅椅子的觀眾席、亮燈舞台上一名穿藍色 polo 衫與牛仔褲的男子站在大螢幕旁、螢幕上是 AI 生成圖(粉紅翅膀的豬、戴派對帽的貓、3D 的 HELLO 字)、淺色木牆與拱門。
還有一件看不到的事。processing_call 與 processing_result 這兩種 step 的內容是簽章字串,讀不出模型要求的是哪幾秒、哪一段;能看到的只有 usage 裡的模態與 token 數。省了多少看得到,怎麼省的看不到。真要追究模型漏掉了哪一段,目前沒有欄位可以查。
七次呼叫的 wall time 也有落差:agentic 的三次 Gemini 3.7 Flash 呼叫落在 8.2 到 11.0 秒,static 兩次是 13.4 到 15.2 秒。這幾次如此,樣本太少,不當延遲結論用。
一次實測裡,錢的減幅小於 token 的減幅,剩下的 token 是思考
把 token 換成錢,減幅就縮水。
static-37 那一次依牌價推算約 $0.059:輸入 75,571 個 token 乘以 $0.75/M 是 $0.0567,thought 加 output 共 632 個 token 乘以 $3.75/M 是 $0.0024。影片輸入吃掉這筆錢的 96%。
agentic 那一次依牌價推算約 $0.003。這裡卡著一個文件沒寫的東西:tool use tokens 到底以輸入價還是輸出價計,計價頁沒有說。三種假設各算一次——以輸入價計 $0.0032、完全不計 $0.0031、以輸出價計 $0.0037——估值落在 $0.0031 到 $0.0037 之間,對應的成本減幅是 94.5%、94.7%、93.7%。估值本身擺盪將近兩成,但不管 tool use 用哪個價算,減幅都在 94% 上下。
| 同一支影片、同一題 | static-37 | probe-37-agentic |
|---|---|---|
| 合計 token | 76,203 | 1,076 |
| 依牌價推算成本 | 約 $0.059 | 約 $0.003($0.0031–$0.0037) |
| 減幅 | — | token 98.6%、成本約 94% |
(依 2026 年 12 月 31 日之前的牌價,用 usage 欄位乘以牌價算出來,不是帳單。)
token 少 98.6%,錢少約 94%。那幾個百分點跑到哪裡去了?agentic 那一次的錢有約 94% 落在 thought 加 output 上(以輸入價計 tool use 的話是 $0.003045 對 $0.003243,93.9%),而計價頁的輸出價欄位標明包含思考 tokens,輸出價又是輸入價的五倍。影片輸入被砍掉之後,剩下的 token 大多是模型導航時想出來的,而那些 token 走的是貴的那一格。
把官方的兩個「最多」拿來倒推,方向一樣。token 剩 12%、錢剩 34%,34 除以 12,剩下的 token 平均單價是 static 平均單價的 2.8 倍。這是純算術,前提是兩個「最多」同時成立,官方沒有說它們會同時成立。
官方沒有解釋 66% 和 88% 為什麼不同,上面這條只是從計價表可推算出來的一個可能機制,不是官方給的原因,也不排除還有別的成分沒寫進文件。
所以 agentic 的帳光看 total 算不出來,還要另看 thought 與 tool use 兩欄。total 會讓人以為省了九成八,實際上付錢的結構已經整個換過:以前是一大堆便宜的影片輸入,現在是一小撮貴的思考輸出。影片長度翻倍,static 那一格會跟著翻倍,agentic 那一格未必跟著走——文件說它隨問題、內容複雜度與導航策略變動,不再像 static 那樣跟片長成正比。
這也是報價時最容易估錯的一格。用 static 的經驗去乘影片長度,會把 agentic 的成本估錯;用官方的 66% 去乘 static 的帳,又會忘記思考 token 是按輸出價走的。要有把握,就得把 total_thought_tokens 單獨拉出來看。
官方自己列了兩種該留在 static 的情況
文件的選用建議開頭就寫「start with agentic mode」(Gemini API Video understanding 文件),尤其在乎回應品質或 token 效率的時候。但同一段就把例外列出來:5 分鐘以下的短片而且在乎延遲,以及整支片每一幀都要精確的情況。static 那一列的形容詞也很直白——「Works well for short clips」(同一份文件)。
計價頁的註腳補了一個更具體的反向情況:token 數取決於問題複雜度與動態取樣深度,「which may exceed 1 FPS for detailed visual segments」(Gemini API 計價頁)。要模型細看畫面,它的取樣可以比 static 的預設幀率還密。
發表文的異常偵測用例說的其實是同一件事:先找出有趣的時間窗,再用更高的 FPS 重看那幾段。省不省,看你要它重看多少。
還有一個參數細節要先分開看:media_resolution 和 processing 彼此獨立,可以同時設。一個管解析度,一個管處理模式,兩件事分開調,不會互相蓋掉。
一題一題問長片最划算;要整支片逐幀全掃,agentic 未必省。
發表文列三款,文件列四款,YouTube 輸入還是 preview
9 月 1 日的發表文與同一天的 release note 都寫三款:Gemini 3.7 Flash、3.6 Flash、3.5 Flash-Lite。文件的模式表寫四款,第四款是 Gemini 3.8 Flash,9 月 2 日才正式推出,文件的模式表已經把它列進去。Gemini 3.7 Flash 的正式推出日是 8 月 13 日,Gemini 3.6 Flash 與 3.5 Flash-Lite 是 7 月 21 日。
開法只有一行——把 processing 設成 agentic——而 Interactions 與 GenerateContent 兩個 API 都支援。取得管道是 Gemini API(Google AI Studio)與 Gemini Enterprise Agent Platform,影片可以上傳,也可以直接餵 YouTube 連結;計價走標準 token 價,官方寫明「no additional feature fee」(Google 發表文)。Google AI Studio 本身的使用不收費。
YouTube 連結這條輸入路徑目前標著 Preview,而且免費——文件同時寫了價格與速率限制可能改變。免費層每天最多 8 小時 YouTube 影片,付費層沒有長度上限,只收公開影片。文件裡 preview 這個字只出現在 YouTube 連結那一段,agentic 模式本身沒有 preview 或 experimental 的標記。
回應結構多了兩種 step。processing_call 是模型要求某一段影片或字幕,帶一個 id;processing_result 是載入結果,用 call_id 對回去。兩者跟 thought steps 交錯出現,排在最終輸出之前,官方說可以拿來在介面上做進度顯示。
產品端的部分都是未來式:Gemini app 的 Flash 與 Flash-Lite 模型將很快全面推出,YouTube 觀看頁的「Ask YouTube」功能會在未來幾個月用上這套處理方式。
給非工程師的一句話
以前要 AI 看一支影片,做法是把整支片影印一份塞給它——每一頁都印,不管你問的是第幾頁。片子越長,影印費越貴,長度直接決定價錢。
現在的做法是給它目錄。它自己翻到需要的那幾頁,看完就回答。這次跑的一次實測裡,問「這支影片講了什麼」,它一頁畫面都沒翻,只拿了文字的部分,紙省了九成八。
錢沒有省九成八。翻頁要花腦力,而腦力比紙貴——這是價目表上寫著的事:想出來的東西,比讀進去的東西貴五倍。所以省下來的紙比省下來的錢多,這中間的落差不是誤差,是它換了一種工作方式。
回到開場那支 13 分 50 秒的影片。省下來的不是看得更快,是決定不看:問題用文字就答得完,它就沒有去翻那 830 秒的畫面。
常見問題
Gemini 的代理式影片理解(agentic video understanding)是什麼?
Google 在 2026 年 9 月 1 日發表的影片處理模式。static 模式固定幀率抽幀(預設 1 FPS),整支影片一次進 context;agentic 讓模型自己決定看哪一段、走畫面音軌還是字幕,只載入需要的片段。官方發表文的數字是跨標準影片分析基準測試:成本最多省 66%、token 最多省 88%、準確度最多升 7%。
哪些模型支援、怎麼開?
發表文列三款:Gemini 3.7 Flash、3.6 Flash、3.5 Flash-Lite;文件的模式表列四款,多的是 9 月 2 日推出的 Gemini 3.8 Flash。開法是把 processing 參數設成 agentic,Interactions 與 GenerateContent 兩個 API 都支援,計價走標準 token 價、沒有額外功能費。
token 省 88% 是不是錢也省 88%?
token 最多省 88% 與成本最多省 66% 是兩個各自的上限,不是同一次比較。錢省得比 token 少,目前只有一次實測撐得住:Gemini 3.7 Flash 的 token 少 98.6%,依牌價推算成本少約 94%,一支影片、一題。計價表上可推算出一個機制:思考記在 thought tokens,輸出價含思考 tokens。官方沒有解釋。
什麼情況該留在 static 模式?
文件的建議是一般情況先用 agentic,尤其在乎回應品質或 token 效率的時候;留給 static 的是兩種情況:5 分鐘以下的短片而且在乎延遲,以及整支片每一幀都要精確的工作。計價頁另外寫了,細看畫面時動態取樣可能超過 1 FPS。要整支片逐幀全掃,agentic 未必比較省。
📚 收進你的工具
For AI Reading Era把這篇文章交給你日常用的工具——做研究、整理筆記,或當 AI 的 context。