
Gemini 模型中的代理式视频理解
战略概览
- 01.谷歌已在 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite 中推出代理式视频理解功能,使模型能够动态选择需检查的视频帧、音频和文字稿片段,而非以固定帧率处理整个视频。
- 02.该功能现已通过 Google AI Studio 中的 Gemini API 和 Gemini 企业代理平台上线,支持上传的视频文件和 YouTube 视频链接。
- 03.该功能最高可将 token 消耗减少 88%,分析成本降低 66%,同时准确率提升高达 7%。
- 04.谷歌计划在未来几个月内将该功能扩展至消费者版 Gemini 应用的所有用户,并集成到 YouTube 视频播放页面的“向 YouTube 提问”功能中。
廉价的 Flash 级模型超越更昂贵的旗舰模型
谷歌正借此发布做出一项不同寻常的竞争性声明:在长视频问答任务中,一个相对便宜的 Flash 级模型,而非高价旗舰模型,在成本与准确率的权衡上处于前沿,优于 OpenAI 的 GPT-5.6、Anthropic 的 Claude Opus 5 和 xAI 的 Grok 4.6 [2]。特别是在 Minerva 复杂推理基准测试中,该方法实现了约 58% 的 token 节省,同时准确率相对提升了约 7 个百分点 [2]。这一说法得到了独立验证的支持:Artificial Analysis 此前已将 Gemini 3.7 Flash 列为智能与速度帕累托前沿的模型,随后发现其在现实世界的电子表格和文档任务中,在其自有的 AA-AnalystAgent 基准测试中表现优于 Claude Opus 5 和 GPT-5.6 Sol [2]。Sundar Pichai 称 Gemini 3.7 Flash 是谷歌有史以来增长最快的模型 [2]。
从 API 开关到 YouTube 的答案框
此次功能上线遵循了明确的步骤:目前代理式视频理解仅通过 Google AI Studio 和 Gemini 企业代理平台的 Gemini API 提供,支持上传的视频和 YouTube 链接 [1][3]。谷歌表示,将很快把该功能扩展至消费者版 Gemini 应用中的所有用户(涵盖 Flash 和 Flash-Lite 模型),并在未来几个月内将其用于 YouTube 视频播放页面的“向 YouTube 提问”功能,使对话式回答基于视频的实际画面,而不仅仅是元数据或文字稿 [1]。这种分阶段路径——先面向开发者,再面向消费者——与谷歌此前在 Gemini 2.5 中推出“静态”视频理解的方式一致,后者在被这种动态、工具化的方法取代前,已在 YouCook2 密集字幕和 QVHighlights 时刻检索等基准测试中达到业界领先水平 [4]。
线上反响热烈,但尚无人填补可验证性的空白
社交媒体上的反应总体积极,突出的效率数据引发了大量讨论,独立 AI 评论员普遍认为这是实质性的能力提升,而非边际改进。技术导向的用户特别关注模型在演示中自动计数重复动作,并自主决定何时需要更多或更少帧数的场景,认为这消除了开发者此前必须手动管理的权衡,例如在其他代理工具中手动设定固定帧率。但并非所有人都认为此次发布具有即时意义:一些人指出,免费用户可能仍会停留在旧模型上,无法立即获得新功能;至少有一种质疑观点认为,此次发布依赖于能力声明,缺乏公开的基准测试或定价细节,并警告称,长视频代理在受控演示中可能看起来令人印象深刻,但在基础任务上仍可能出错——例如准确定位某个时刻、解释其重要性并准确引用其发生位置。随着该功能扩展至更多产品,演示的精致程度与日常可靠性之间的差距将成为真正的考验。
历史背景
关键关系图
事实来源
来源文章
THE SIGNAL.
“发现 Gemini 3.7 Flash 位于智能与速度的帕累托前沿,随后在其自有的 AA-AnalystAgent 基准测试中表现最佳,在现实世界的电子表格和文档任务中击败了 Claude Opus 5 和 GPT-5.6 Sol——这一结果被引用为该模型在此次发布中广泛势头的背景。”
“曾公开表示 Gemini 3.7 Flash 是谷歌有史以来增长最快的模型。”
“We're introducing a new capability to our latest Gemini models: agentic video understanding. This allows developers to process long-form video content with more accuracy, while using up to 88% less tokens. See how it works”
“introducing agentic video understanding with Gemini instead of using static processing (ingesting media at a fixed frame rate), the model can now take an active, goal-directed role in determining what to watch, at what speed, and through which modality (frames, audio, or transcript), fetching only the moments and signals needed this new approach cuts costs by up to 66% and reduces token consumption by up to 88% while boosting accuracy available now via the Gemini API and in AI Studio: ai.studio”
“Agentic video understanding with Gemini 3.7 Flash is HUGE. Just reduced cost, less tokens, and higher accuracy. No biggie.”
“Introducing agentic video understanding with Gemini”

Agentic video understanding in Gemini

Sundar Pichai Unveils "Ask YouTube" And Revolutionary Voice-Powered "Docs Live" At Google I/O

ChatGPT Connects Health Records & Gemini Gets Agentic Video | Midnight Signal AI