Google 為 Gemini 加入了代理式影片理解能力。模型不再以固定間隔從頭到尾掃過整段影片,而是自行尋找並取回回答問題所需的片段。在標準影片分析基準測試中,Token 消耗最多下降 88%,分析成本最多下降 66%,準確度最多提升 7%[1]。
不再每秒 1 格從頭讀起
過去的影片處理是靜態的。模型以固定影格率(預設每秒 1 格,可透過 API 調整)從頭載入影片,再依這一串靜止畫面組出答案[1]。作法直接,但面對 90 分鐘的講座或長達數小時的錄影,脈絡長度大半會被與答案無關的畫面吃掉。
代理式影片理解把順序反過來。它把模型的推理能力與 Gemini 原生的影片工具結合,讓模型從目標反推:要看哪裡、以多快的速度看、透過畫面、音訊還是逐字稿來看。只有真正需要的時刻與訊號才會被取回[1]。
在內部,模型透過一個代理迴圈呼叫內建工具,只載入影片檔案中的相關片段。這類流程開發者先前也能自行手動組出來,差別在於組裝的工作移到了模型這一側[1]。
這個思路的基礎,是 1 月進入 Gemini 3 Flash 的代理式視覺。在那裡,模型透過程式碼執行對影像進行放大、裁切、標註等操作,把答案錨定在視覺證據上,Google 表示在多數視覺基準上帶來 5% 至 10% 的品質提升[2]。這次則是把同樣的想法擴展到具有時間軸的影片。
更便宜,而且更準
Google 提出的效果有 3 項。在標準影片分析基準測試中,分析成本最多下降 66%,Token 消耗最多下降 88%,準確度最多提升 7%[1]。
值得注意的是,壓低成本並沒有以準確度為代價。與答案無關的片段不會被載入,輸入量因此縮小;而值得細看的片段可以用更高的影格率重新取樣,判斷依據反而更充足。
差距在長片上最明顯。從 10 分鐘的教學影片到 90 分鐘的講座,乃至數小時的錄影,開發者先前只能在支付高昂 Token 費用,與採用會捨棄關鍵細節的作法之間二選一[1]。
支援的模型有 3 個:Gemini 3.7 Flash、3.6 Flash 與 3.5 Flash-Lite。其中搭配代理式理解的 3.7 Flash 在整體品質以及品質與成本的平衡上都最出色,在受測模型中位於準確度對成本的柏拉圖前緣[1]。
4 個真正派得上用場的場景
Google 列出的用途,都是過去固定影格率作法難以應付的領域[1]。
- 次秒級片段檢索:找出每秒 1 格會漏掉的瞬間狀態變化與緊湊的鏡頭切點,讓精準的自動影片剪輯成為可能
- 長片中的大海撈針:在數小時的影片中回答複雜查詢,而不必消耗數百萬 Token
- 異常偵測:對感興趣的時間區間以更高影格率重新取樣,檢查快速動作與細微的視覺瑕疵
- 動作與物件計數:準確追蹤重複的肢體動作,以及跨時間出現的個別物件
讓機器讀懂影像,長久以來的設計前提都是「不是全部餵給模型,就是放棄」。當模型能自行決定觀看範圍,這個前提就變了。
啟用只需多加一項設定
代理式影片理解可透過 Google AI Studio 中的 Gemini API 以及 Gemini Enterprise Agent Platform 使用,涵蓋上傳影片與 YouTube 影片,不收取額外的功能費用,沿用 Gemini API 的標準 Token 計費[1]。
啟用方式是在 API 設定中把 processing 設為 agentic[1]。
from google import genai
client = genai.Client()
interaction = client.interactions.create(
model="gemini-3.7-flash",
input=[
{
"type": "video",
"uri": "https://youtu.be/7Z5Vy9JBANs",
"processing": "agentic"
},
{
"type": "text",
"text": "What are the 3 most important announcements in this keynote?",
},
],
)
print(interaction.output_text)
由於只是在現有程式碼上多加一行,正在處理長片的開發者可以直接跑一次手邊的工作負載,看看帳單會有什麼變化。
也會進到 Gemini 應用程式與 YouTube 的問答功能
這項能力並不侷限於開發者 API。Google 表示,該功能將逐步開放給 Gemini 應用程式中使用 Flash 與 Flash-Lite 模型的所有使用者,並在未來數個月內支撐 YouTube 觀看頁面的 Ask YouTube 功能,目標是提升以畫面為依據的回答品質[1]。
像 Ask YouTube 這種面向大眾的功能,單次提問的成本直接決定了能提供多少服務。若 Token 消耗下降接近一個數量級,先前算不過來的長片問答就會變成實際可行的選項。這也是本次發表不只是多了一個 API 開關的原因。
總結
Gemini 的代理式影片理解,把影片從以固定間隔整段讀取,改為由模型挑選所需的片段與訊號。在標準基準測試中,Token 消耗最多下降 88%,成本最多下降 66%,準確度最多提升 7%。支援的模型為 Gemini 3.7 Flash、3.6 Flash 與 3.5 Flash-Lite,無須額外付費,改一項 API 設定即可啟用。接下來,Gemini 應用程式與 YouTube 的 Ask YouTube 也將用上這項能力。
來源[2]:https://blog.google/innovation-and-ai/technology/developers-tools/agentic-vision-gemini-3-flash/
