Googleが、Geminiにエージェント型の動画理解を追加しました。動画を先頭から一定間隔で眺め続けるのではなく、答えを出すために必要な場面だけをモデル自身が探して取りに行く仕組みです。標準的な動画分析のベンチマークでは、トークン消費が最大88パーセント、分析コストが最大66パーセント下がり、精度は最大7パーセント上がったとしています[1]。

毎秒1コマで頭から読む方式をやめた

これまでの動画処理は静的なものでした。モデルは決められたフレームレート(既定は毎秒1コマ、APIで変更可能)で動画を頭から取り込み、その静止画の列を手掛かりに答えを組み立てます[1]。素直な作りではありますが、90分の講義や数時間の録画になると、大半が答えに関係しない静止画で文脈長を食い潰してしまいます。

エージェント型の動画理解は、この順番を入れ替えます。モデルの推論と、Geminiがもともと備えている動画ツールを組み合わせ、どこを見るか、どの速さで見るか、フレーム・音声・書き起こしのどれで見るかを、目的から逆算してモデル自身が決めます。必要な瞬間と必要な信号だけを取りに行く形です[1]。

内部では、動画ファイルの該当部分だけを読み込むツールをモデルが呼び出すエージェントループが回っています。同じことは以前から開発者が手作業で組むこともできましたが、その組み立てがモデル側へ移った、という整理になります[1]。

下敷きになっているのは、1月にGemini 3 Flashへ入ったエージェント型ビジョンです。こちらは画像に対して、拡大・切り出し・注釈といった操作をPythonコードの実行で行い、視覚的な根拠を確かめながら答える仕組みで、多くの画像ベンチマークで5〜10パーセントの品質向上が報告されていました[2]。今回はその発想が、時間軸を持つ動画へ広がった格好です。

安くなって、なお当たる

Googleが挙げた効果は3つです。標準的な動画分析ベンチマークで、分析コストが最大66パーセント減、トークン消費が最大88パーセント減、精度が最大7パーセント向上[1]。

コストを削ると精度も落ちる、という取引にならなかった点がこの発表の肝です。答えに関係しない場面を読み込まないので入力量が減り、逆に気になる場面は高いフレームレートで見直せるので判断材料は増える、という理屈になります。

差がはっきり出るのは長尺の動画です。10分のハウツー動画から90分の講義、数時間に及ぶ録画まで、これまでは高いトークン代を払うか、細部を削り落とす手法で妥協するかの二択になっていました[1]。

対応するのはGemini 3.7 Flash、3.6 Flash、3.5 Flash-Liteの3モデルです。このうち3.7 Flashにエージェント型の動画理解を組み合わせた構成が、総合的な品質でも品質とコストの釣り合いでも最も良く、検証したモデルの中で精度対コストのパレートフロンティアに位置するとしています[1]。

効いてくる4つの使いどころ

Googleが挙げている用途は、いずれも従来の毎秒1コマ方式が苦手としていた領域です[1]。

  • サブ秒単位の場面検索:毎秒1コマでは見落とす一瞬の状態変化やカットの切れ目を特定でき、自動での動画編集が現実味を帯びます
  • 長尺の中からの一点探し:数時間の動画に対する複雑な問い合わせを、何百万トークンも消費せずに処理できます
  • 異常検知:気になる時間帯だけを高いフレームレートで取り直し、素早い動きや細かな視覚的アーティファクトを確認します
  • 動作や物体の計数:繰り返される身体動作や、時間をまたいで現れる個別の物体を正確に追えます

映像の中身を機械に読ませる仕事は、これまで「全部見せるか、諦めるか」の設計になりがちでした。見る範囲をモデルが決められるようになると、この前提が変わります。

使い方は設定を1つ足すだけ

エージェント型の動画理解は、Google AI Studio内のGemini APIと、Gemini Enterprise Agent Platformから利用できます。対象は動画のアップロードとYouTube動画で、追加の機能料金はなく、通常のGemini APIのトークン課金がそのまま適用されます[1]。

有効化はAPIの設定で processing を agentic にするだけです[1]。

from google import genai
client = genai.Client()
interaction = client.interactions.create(
    model="gemini-3.7-flash",
    input=[
        {
            "type": "video",
            "uri": "https://youtu.be/7Z5Vy9JBANs",
            "processing": "agentic"
        },
        {
            "type": "text",
            "text": "What are the 3 most important announcements in this keynote?",
        },
    ],
)
print(interaction.output_text)

既存のコードに1行足すだけで切り替えられるため、長尺動画を扱っている開発者は、まず手元のワークロードで請求額の変化を見るのが早そうです。

GeminiアプリとYouTubeの回答機能にも降りてくる

この仕組みは開発者向けAPIに閉じません。GoogleはGeminiアプリのFlashおよびFlash-Liteモデルを使う全ユーザーへ順次展開するとしており、さらに数か月のうちに、YouTubeの視聴ページにあるAsk YouTube機能の裏側でも使われる予定です。映像そのものに根拠を置いた回答の質を上げる狙いだとしています[1]。

Ask YouTubeのように不特定多数が使う機能では、1問あたりのコストがそのまま提供可能な範囲を決めます。トークン消費が1桁近く下がるなら、これまで採算が合わなかった長尺動画への質問応答が現実的な選択肢に変わります。今回の発表がAPIの新機能にとどまらないのは、この点が理由でしょう。

まとめ

Geminiのエージェント型の動画理解は、動画を一定間隔で丸ごと読む方式から、モデルが必要な場面と信号を選んで取りに行く方式への切り替えです。標準ベンチマークではトークン消費が最大88パーセント、コストが最大66パーセント減り、精度は最大7パーセント上がったとしています。対応するのはGemini 3.7 Flash、3.6 Flash、3.5 Flash-Liteで、追加料金なしにAPIの設定1つで有効化できます。今後はGeminiアプリとYouTubeのAsk YouTubeにも広がる予定です。

出典[1]:https://blog.google/innovation-and-ai/models-and-research/gemini-models/introducing-agentic-video-in-gemini/

出典[2]:https://blog.google/innovation-and-ai/technology/developers-tools/agentic-vision-gemini-3-flash/