谷歌为 Gemini 增加了智能体式视频理解能力。模型不再按固定间隔从头到尾扫描整段视频,而是自己去检索并取回回答问题所需的片段。在标准视频分析基准测试中,令牌消耗最多下降 88%,分析成本最多下降 66%,准确率最多提升 7%[1]。
告别每秒 1 帧从头读的做法
以往的视频处理是静态的。模型按固定帧率(默认每秒 1 帧,可通过 API 调整)从头摄入视频,再依据这一串静止画面组织答案[1]。做法直接,但面对 90 分钟的讲座或数小时的录像,上下文窗口大半会被与答案无关的画面占满。
智能体式视频理解把顺序颠倒过来。它将模型的推理能力与 Gemini 原生的视频工具结合,让模型从目标出发反推:看哪里、以多快的速度看、通过画面、音频还是文字记录来看。只有真正需要的时刻和信号才会被取回[1]。
在内部,模型通过一个智能体循环调用内置工具,只加载视频文件中的相关部分。这类流程开发者此前也能手工搭建,变化在于组装工作转移到了模型一侧[1]。
这一思路的基础是 1 月进入 Gemini 3 Flash 的智能体式视觉。在那里,模型借助代码执行对图像进行放大、裁剪、标注等操作,把答案锚定在视觉证据上,谷歌称其在多数视觉基准上带来 5% 至 10% 的质量提升[2]。这次是把同样的思路扩展到带有时间轴的视频。
更便宜,而且更准
谷歌给出的效果有 3 项。在标准视频分析基准测试中,分析成本最多下降 66%,令牌消耗最多下降 88%,准确率最多提升 7%[1]。
值得注意的是,降低成本并没有以牺牲准确率为代价。无关片段不会被载入,输入量随之减少;而值得细看的片段可以用更高的帧率重新采样,判断依据反而更充分。
差距在长视频上体现得最清楚。从 10 分钟的教程视频到 90 分钟的讲座乃至数小时的录像,开发者此前只能在支付高昂令牌费用和采用会丢失关键细节的方法之间二选一[1]。
支持该能力的有 3 个模型:Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite。其中启用智能体式理解的 3.7 Flash 在整体质量和质量与成本的平衡上都表现最佳,在受测模型中处于准确率对成本的帕累托前沿[1]。
4 个真正见效的场景
谷歌列举的用途,都是过去固定帧率方式难以应付的领域[1]。
- 亚秒级片段检索:定位每秒 1 帧会漏掉的瞬间状态变化和紧凑的镜头切换点,让精确的自动视频剪辑成为可能
- 长视频中的大海捞针:在数小时的视频中回答复杂查询,而不必消耗数百万令牌
- 异常检测:对感兴趣的时间窗口以更高帧率重新采样,检查快速动作和细微的视觉伪影
- 动作与物体计数:准确追踪重复的肢体动作以及在时间轴上出现的各个物体
让机器读懂影像,长期以来的设计前提都是「要么全部喂给模型,要么放弃」。当模型能够自行决定观看范围,这个前提就变了。
启用只需增加一项设置
智能体式视频理解可通过 Google AI Studio 中的 Gemini API 以及 Gemini Enterprise Agent Platform 使用,覆盖上传视频和 YouTube 视频,不收取额外的功能费用,沿用 Gemini API 的标准令牌计费[1]。
启用方式是在 API 配置中把 processing 设为 agentic[1]。
from google import genai
client = genai.Client()
interaction = client.interactions.create(
model="gemini-3.7-flash",
input=[
{
"type": "video",
"uri": "https://youtu.be/7Z5Vy9JBANs",
"processing": "agentic"
},
{
"type": "text",
"text": "What are the 3 most important announcements in this keynote?",
},
],
)
print(interaction.output_text)
由于只是在现有代码上加一行,正在处理长视频的开发者可以直接跑一遍手头的工作负载,看看账单会有什么变化。
还会进入 Gemini 应用和 YouTube 的问答功能
这项能力并不局限于面向开发者的 API。谷歌表示,该功能将逐步向 Gemini 应用中使用 Flash 与 Flash-Lite 模型的全部用户开放,并在未来数月内支撑 YouTube 观看页面的 Ask YouTube 功能,目标是提升以画面为依据的回答质量[1]。
像 Ask YouTube 这样面向大众的功能,单次提问的成本直接决定了能提供多少服务。如果令牌消耗下降接近一个数量级,此前算不过账的长视频问答就会变成现实的选项。这也是本次发布不只是新增一个 API 开关的原因。
总结
Gemini 的智能体式视频理解,把视频从按固定间隔整段读取,转为由模型挑选所需的片段与信号。在标准基准测试中,令牌消耗最多下降 88%,成本最多下降 66%,准确率最多提升 7%。支持的模型为 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite,无需额外付费,改一项 API 设置即可启用。接下来,Gemini 应用和 YouTube 的 Ask YouTube 也将用上这项能力。
来源[2]:https://blog.google/innovation-and-ai/technology/developers-tools/agentic-vision-gemini-3-flash/
