Gemini 模型中的代理式视频理解
TECH

Gemini 模型中的代理式视频理解

15+
Signals

战略概览

  • 01.
    谷歌已在 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite 中推出代理式视频理解功能,使模型能够动态选择需检查的视频帧、音频和文字稿片段,而非以固定帧率处理整个视频。
  • 02.
    该功能现已通过 Google AI Studio 中的 Gemini API 和 Gemini 企业代理平台上线,支持上传的视频文件和 YouTube 视频链接。
  • 03.
    该功能最高可将 token 消耗减少 88%,分析成本降低 66%,同时准确率提升高达 7%。
  • 04.
    谷歌计划在未来几个月内将该功能扩展至消费者版 Gemini 应用的所有用户,并集成到 YouTube 视频播放页面的“向 YouTube 提问”功能中。

为何减少 88% 的 token 消耗不仅无损准确率,反而提升准确率

谷歌早期的“静态”视频处理方式意味着无论内容是否重要,都以固定的每秒帧数摄入视频。代理式视频理解则用一种能跨视频帧、音频和文字稿动态搜索、扫描和检查目标片段的模型取代了这一方式 [1]。谷歌报告称,与旧的静态方法相比,该方法最高可将 token 消耗减少 88%,分析成本降低 66%,同时准确率提升高达 7% [1]。在 1H-VideoQA 和 LVBench 等长视频基准测试中,每次查询的 token 使用量据称从大约 30 万至 40 万个降至不足 5 万个 [2]

廉价的 Flash 级模型超越更昂贵的旗舰模型

谷歌正借此发布做出一项不同寻常的竞争性声明:在长视频问答任务中,一个相对便宜的 Flash 级模型,而非高价旗舰模型,在成本与准确率的权衡上处于前沿,优于 OpenAI 的 GPT-5.6、Anthropic 的 Claude Opus 5 和 xAI 的 Grok 4.6 [2]。特别是在 Minerva 复杂推理基准测试中,该方法实现了约 58% 的 token 节省,同时准确率相对提升了约 7 个百分点 [2]。这一说法得到了独立验证的支持:Artificial Analysis 此前已将 Gemini 3.7 Flash 列为智能与速度帕累托前沿的模型,随后发现其在现实世界的电子表格和文档任务中,在其自有的 AA-AnalystAgent 基准测试中表现优于 Claude Opus 5 和 GPT-5.6 Sol [2]。Sundar Pichai 称 Gemini 3.7 Flash 是谷歌有史以来增长最快的模型 [2]

从 API 开关到 YouTube 的答案框

此次功能上线遵循了明确的步骤:目前代理式视频理解仅通过 Google AI Studio 和 Gemini 企业代理平台的 Gemini API 提供,支持上传的视频和 YouTube 链接 [1][3]。谷歌表示,将很快把该功能扩展至消费者版 Gemini 应用中的所有用户(涵盖 Flash 和 Flash-Lite 模型),并在未来几个月内将其用于 YouTube 视频播放页面的“向 YouTube 提问”功能,使对话式回答基于视频的实际画面,而不仅仅是元数据或文字稿 [1]。这种分阶段路径——先面向开发者,再面向消费者——与谷歌此前在 Gemini 2.5 中推出“静态”视频理解的方式一致,后者在被这种动态、工具化的方法取代前,已在 YouCook2 密集字幕和 QVHighlights 时刻检索等基准测试中达到业界领先水平 [4]

线上反响热烈,但尚无人填补可验证性的空白

社交媒体上的反应总体积极,突出的效率数据引发了大量讨论,独立 AI 评论员普遍认为这是实质性的能力提升,而非边际改进。技术导向的用户特别关注模型在演示中自动计数重复动作,并自主决定何时需要更多或更少帧数的场景,认为这消除了开发者此前必须手动管理的权衡,例如在其他代理工具中手动设定固定帧率。但并非所有人都认为此次发布具有即时意义:一些人指出,免费用户可能仍会停留在旧模型上,无法立即获得新功能;至少有一种质疑观点认为,此次发布依赖于能力声明,缺乏公开的基准测试或定价细节,并警告称,长视频代理在受控演示中可能看起来令人印象深刻,但在基础任务上仍可能出错——例如准确定位某个时刻、解释其重要性并准确引用其发生位置。随着该功能扩展至更多产品,演示的精致程度与日常可靠性之间的差距将成为真正的考验。

历史背景

Gemini 2.5 推进了以固定帧率进行的‘静态’视频理解,在 YouCook2 密集字幕和 QVHighlights 时刻检索等基准测试中取得业界领先成果,为这一动态、工具化的方法奠定了基础。
发布了正式公告,介绍为 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite 推出代理式视频理解功能。

关键关系图

关键玩家
主题

Gemini 模型中的代理式视频理解

GO

Google DeepMind

Gemini 模型的开发者;构建并发布了代理式视频理解功能,并控制其在 API、Gemini 应用和 YouTube 上的上线节奏。

YO

YouTube

将把代理式视频理解集成到其“向 YouTube 提问”的对话式搜索功能中,使回答基于视频画面而不仅仅是元数据。

GO

Google AI Studio 和 Gemini 企业代理平台上的 API 开发者

直接受益者,可立即为视频上传和 YouTube 链接输入开启代理处理模式。

竞争

竞争模型提供商(OpenAI、Anthropic、xAI)

在长视频问答任务的成本与准确率权衡上被直接与 Gemini 3.7 Flash 比较,谷歌将其 Flash 级模型定位为更高效的选项。

事实来源

4 条引用
  1. [1] Introducing agentic video understanding with Gemini
  2. [2] Google says Gemini 3.7 Flash is at the frontier of accuracy and cost at agentic video understanding
  3. [3] Google Gemini agentic video understanding
  4. [4] Video understanding with Gemini 2.5

来源文章

Top 3

THE SIGNAL.

Analysts

发现 Gemini 3.7 Flash 位于智能与速度的帕累托前沿,随后在其自有的 AA-AnalystAgent 基准测试中表现最佳,在现实世界的电子表格和文档任务中击败了 Claude Opus 5 和 GPT-5.6 Sol——这一结果被引用为该模型在此次发布中广泛势头的背景。

Artificial Analysis
独立 AI 基准测试公司

曾公开表示 Gemini 3.7 Flash 是谷歌有史以来增长最快的模型。

Sundar Pichai
谷歌/Alphabet 首席执行官
The Crowd

We're introducing a new capability to our latest Gemini models: agentic video understanding. This allows developers to process long-form video content with more accuracy, while using up to 88% less tokens. See how it works

@@Google4057

introducing agentic video understanding with Gemini instead of using static processing (ingesting media at a fixed frame rate), the model can now take an active, goal-directed role in determining what to watch, at what speed, and through which modality (frames, audio, or transcript), fetching only the moments and signals needed this new approach cuts costs by up to 66% and reduces token consumption by up to 88% while boosting accuracy available now via the Gemini API and in AI Studio: ai.studio

@@GoogleAIStudio2307

Agentic video understanding with Gemini 3.7 Flash is HUGE. Just reduced cost, less tokens, and higher accuracy. No biggie.

@@Saboo_Shubham_393

Introducing agentic video understanding with Gemini

@u/Gaiden20669
Broadcast
Agentic video understanding in Gemini

Agentic video understanding in Gemini

Sundar Pichai Unveils "Ask YouTube" And Revolutionary Voice-Powered "Docs Live" At Google I/O

Sundar Pichai Unveils "Ask YouTube" And Revolutionary Voice-Powered "Docs Live" At Google I/O

ChatGPT Connects Health Records & Gemini Gets Agentic Video | Midnight Signal AI

ChatGPT Connects Health Records & Gemini Gets Agentic Video | Midnight Signal AI

Gemini 模型中的代理式视频理解 — AI 新闻 | Agentic Brew