Google发布Gemini Omni 1.1 Flash视频生成模型
TECH

Google发布Gemini Omni 1.1 Flash视频生成模型

29+
Signals

战略概览

  • 01.
    谷歌DeepMind于2026年8月27日发布了Gemini Omni 1.1 Flash,这是其生成式视频模型的一次生产级更新,可通过Gemini API、Google AI Studio以及Gemini企业代理平台获取。
  • 02.
    场景扩展功能现在可分析最多10秒的前置上下文(此前仅依赖最后一帧),以10秒为增量将视频片段延长至累计40秒,并新增首尾帧关键帧控制功能。
  • 03.
    一种新的360p草稿模式运行速度最高提升60%,成本约为标准720p生成的三分之一,输出可放大至1080p或4K;价格按分辨率分级,从360p的每秒0.03美元到4K的每秒0.30美元不等。
  • 04.
    此次更新也已上线Google Flow,使这款面向消费者和专业用户的视频编辑产品具备相同的场景扩展、关键帧控制和4K导出选项,全球范围内的Google AI Plus、Pro和Ultra订阅用户均可使用。

为何场景扩展终于奏效:上下文窗口的突破

1.1 Flash版本最引人注目的技术改进几乎平淡无奇却影响深远:场景扩展在生成下一段内容前,现在能读取最多10秒的先前画面,而非像初代Omni Flash那样仅依赖单帧末尾画面[1]。这听起来像是一个微小参数调整,但它直接解决了多段AI视频生成中最常见的失败模式——角色夹克颜色突变、房间灯光突然扁平化,或背景道具在剪辑间消失,因为模型对之前的内容几乎没有记忆。有了10秒的上下文窗口,模型可以以10秒为单位进行扩展,累计最长可达40秒,为创作者提供了足够的创作空间来构建短场景,而非孤立的单镜头。

与上下文窗口升级相辅相成的是首尾帧关键帧控制功能,允许创作者精确指定镜头的起始与结束状态——这对于需要精准落点的摄像机环绕、缩放或循环剪辑非常有用,避免了模型随机漂移的问题[2]。谷歌还增加了对最多三秒参考视频的支持,这些视频可来自最多三个不同片段,专门用于帮助模型在多次生成中保持角色外观或摄像机动态风格的一致性[2]。这些改进并未让Omni达到电影级水准,但明确承认了此前版本的瓶颈在于记忆能力,而非图像质量本身。

这种记忆升级在实际使用中表现得非常明显。线上发布的开发者演示普遍采用对话式、迭代式的编辑方式——例如,在保持场景、镜头和摄像机构图不变的前提下,要求模型中途改变一只猫的颜色。实操演示还突出了随视频同步生成的原生音频输出,以及创作者所描述的一种‘世界知识’——运动遵循物理规律,如重量、动量和接触,而非不自然地滑动或漂浮。这些演示中反复出现的一个实用案例是风格重置:保留原有角色动作、摄像机路径和构图的同时,改变现有片段的视觉风格,这正是扩展上下文窗口和参考视频支持所针对的工作流。

草稿再放大:迭代的经济逻辑

对于真正为此付费的用户而言,更具意义的变化是经济层面而非创意层面。一种新的360p草稿模式生成速度最高提升60%,成本约为标准720p生成的三分之一[3],这使得AI视频从一次性豪赌转变为可迭代的工作流程:先以低价快速生成粗糙的360p草稿,确定所需的构图和运动效果后,仅对最终选定的版本支付费用,将其放大至1080p或4K。谷歌公布的定价清晰体现了这一分级策略——360p每秒0.03美元,720p每秒0.10美元,1080p每秒0.15美元,4K每秒0.30美元,最便宜的草稿与最贵的成品之间存在10倍价差[4]

这种定价结构,加上针对混合文本、视频和输出令牌的API调用单独计费机制,显然是围绕生产思维设计的,而非一次性新奇生成[1]。对于营销团队或独立创作者而言,这意味着探索五到十个镜头变体的成本不再与最终渲染成本线性增长——你只为保留的版本支付全价。这种‘先草稿’的经济模式对普及的推动作用,可能远超任何单一创意功能,因为它消除了生成式视频因成本过高而难以迭代的主要障碍。

谷歌统一多模态战略对阵Sora 2与亚洲视频生成浪潮

Omni Flash的发布时间和功能集只有放在竞争背景下才能完全理解。评论指出该模型与OpenAI的Sora 2形成鲜明对比:Sora专注于更长、更高保真度的高端片段,而Omni Flash则强调工作流集成和高产量、对话式多模态输出,而非追逐纯粹的视觉保真度[6]。这是一种不同的押注——谷歌并非试图在单次生成的精致度上取胜,而是希望通过一个模型在单一对话流中完成重新打光、重构图、更换服装和文字叠加等功能,从而取代多个专用工具[5]

该模型的多语言支持(中文、日语、韩语)也被视为有意与字节跳动的Seedance、阿里巴巴的Wan以及快手的Kling正面竞争,而非将快速增长的亚洲视频生成市场拱手相让[6]。生产集成进一步强化了以工作流优先的战略:Adobe已将Omni Flash接入Firefly,支持使用纯英文进行视频编辑并保留来源元数据[8],Figma的Weave画布产品称其为可访问的最强视频模型之一[2]。这两项合作表明,谷歌优化的重点在于模型的嵌入场景,而不仅仅是单个片段的孤立表现。

基准测试冠军 vs 社区现实检验

Omni 1.1 Flash在排行榜上的表现与日常使用者的实际反馈之间存在明显张力。第三方基准测试结果积极,报道称该模型在文本到视频排名中位居榜首,在图像到视频比较中也名列前茅。然而,在创作者发布并排测试的论坛上,社区反应则更为复杂:场景扩展的扩展上下文窗口被欢迎为一项真正解决早期模型角色和光照一致性问题的技术飞跃,但许多实测者仍认为其在物理真实感方面明显落后于Seedance、Minimax和Kling——后空翻或快速动作等运动仍会出现伪影和不自然的慢动作故障。

VentureBeat面向企业的分析介于两者之间:它肯定了对话式多轮编辑对需要快速重新打光或更换服装的营销团队而言确实提升了生产力,但也指出原始片段长度仍然较短(扩展前为三到十秒),基础分辨率在放大前最高仅为720p,且仍不支持原生音频输入或深度伪造/唇形同步功能——这意味着高端、长篇幅制作工作仍可能继续依赖Veo 3.1或Sora 2[5]。‘基准上的最先进水平’与‘实践中媲美领先亚洲视频模型’之间的差距,是对Omni 1.1 Flash当前位置最诚实的评价。

强制水印作为新兴来源追踪基准

Omni生成的每个视频都带有谷歌不可见的SynthID数字水印,API中无法禁用,并与C2PA内容凭证共同用于来源追踪[7]。这一设计选择可追溯到2026年谷歌I/O大会上由Sundar Pichai和Demis Hassabis首次推出Omni时,当时该模型被介绍为谷歌首个任意输入-任意输出的多模态系统,而来源追踪堆栈在模型从仅限消费者的Gemini应用功能演变为完整的开发者API和企业平台的过程中始终保留[7]。值得注意的是,该模型存在的第一个公开线索出现在数周前,当泄密追踪者TestingCatalog在Gemini视频标签页内发现一条未发布的“Powered by Omni”字符串时[10]

随着SynthID和C2PA被固化到每个片段中且无法选择退出,谷歌实际上正试图将水印设为AI生成视频的默认预期,而非可选附加功能——这一点尤为重要,因为OpenAI也在其输出中采用了C2PA[7]。随着企业开始将Omni Flash等工具用于实际生产工作,这一来源追踪层与治理关切(如欧盟人工智能法案)产生交集,分析师已指出劳动力和合规问题对企业基于该模型构建创意工作流构成中期考量[6]

历史背景

AI泄密追踪者TestingCatalog在Gemini视频标签页内发现一条异常UI字符串“Powered by Omni”,经验证后成为Omni模型首次公开迹象。
Gemini Omni在2026年谷歌I/O大会上由Sundar Pichai和Demis Hassabis正式发布,作为谷歌首个任意输入-任意输出的多模态模型,最初仅通过Gemini应用、Google Flow和YouTube Shorts免费向消费者提供。
Gemini Omni Flash通过Gemini API、Google AI Studio和Gemini企业代理平台向开发者开放。
谷歌DeepMind发布Gemini Omni 1.1 Flash,新增40秒场景扩展、首尾帧控制、360p草稿模式和4K放大功能,并将相同控制引入Google Flow。

关键关系图

关键玩家
主题

Google发布Gemini Omni 1.1 Flash视频生成模型

GO

Google DeepMind

Gemini Omni 1.1 Flash 的开发者;将其定位为统一的多模态(支持文本/图像/音频/视频输入,视频输出)模型,旨在整合面向企业和开发者的视频制作工具。

AD

Adobe (Firefly)

将 Gemini Omni Flash 集成至 Adobe Firefly,使编辑人员能够使用普通英语发出编辑指令,并全程保留 C2PA/SynthID 来源信息。

FI

Figma (Weave)

生产级客户,称 Omni Flash 是其 Weave 画布产品中为创意团队提供的最强大的视频模型之一。

GO

Google Flow

谷歌面向消费者和专业用户的视频编辑产品,继承了 API 模型的场景扩展、关键帧、360p 草稿以及 4K 画质提升/导出控制功能。

OP

OpenAI (Sora 2)

主要竞争对手;战略对比体现在视觉保真度和更长的高质量视频片段(Sora)与工作流集成及高产量多模态输出(Omni)之间的差异。

BY

ByteDance (Seedance), Alibaba (Wan), Kuaishou (Kling)

多语言(中文/日语/韩语)支持表明谷歌正直接与这些亚洲视频生成平台竞争,而非放弃该市场。

事实来源

10 条引用
  1. [1] Google AI Releases Gemini Omni 1.1 Flash: 40-Second Scene Extension, First/Last-Frame Control, and 4K Upscaling
  2. [2] Build with Gemini Omni 1.1 Flash
  3. [3] Google Flow gets a big Gemini Omni 1.1 Flash video update
  4. [4] Google Gemini Omni 1.1 Flash AI video tools
  5. [5] Google's Gemini Omni Flash hits the API, turning enterprise video production into a conversation
  6. [6] What Gemini Omni signals about Google's AI strategy and the future of multimodal models
  7. [7] Gemini Omni: Google's any-to-any multimodal model
  8. [8] Google Gemini Omni Flash Adobe Firefly video integration
  9. [9] Gemini Omni Flash pricing guide
  10. [10] Google I/O 2026 testing: Omni model spotted early

来源文章

Top 5

THE SIGNAL.

Analysts

将Gemini Omni定位为一种通用的任意输入-任意输出创意模型,从视频开始,强调对话式自然语言视频编辑。

Koray Kavukcuoglu
谷歌DeepMind首席技术官兼谷歌首席AI架构师

称赞Omni Flash的输出质量和与画布集成的工作流,认为其对创意团队而言是一款高效的生产工具。

Itay Schiff
Figma Weave创意总监

认为该模型将多个专用工具(重新打光、重构图、更换服装)整合进一个对话式工作流,对营销团队极具价值,但10秒的片段长度及缺乏音频输入/深度伪造功能限制了其在高端场景的应用。

VentureBeat analysis
企业AI行业媒体

解读谷歌统一多模态架构的押注在于,同步质量和工作流简化(视频、语音、音乐、文本集成于一模型)胜过单一模态的边际质量提升,目标是实现企业级供应商整合。

AI Journal analysis
行业战略评论
The Crowd

Rev up your story by extending the scene with Gemini Omni 1.1 Flash. 🏎️ Now you can build longer stories or branch into new creative directions by creating or uploading a video and then asking Gemini to extend the scene from right where it left off.

@@GeminiApp1264

Big news: Gemini Omni 1.1 Flash has landed #1 in the Text-to-Video Arena and #2 in the Image-to-Video Arena! For Text-to-Video the latest 1.1 model is +20pts above FLUX 3 Video at #3 (1495 pts). For Image-to-Video the release is a strong +25pt improvement from Gemini Omni Flash

@@arena1060

Last week, we released Gemini Omni 1.1 Flash, our latest model that gives you more creative controls and generative video capabilities. Omni 1.1 Flash allows for even more creative control, including the ability to extend a scene, first and last frame interpolation, crisp 4K

@@Google369

Gemini Omni 1.1 Flash now available

@u/PandaElDiablo209
Broadcast
8 Insane Ways to Use Gemini Omni Flash

8 Insane Ways to Use Gemini Omni Flash

Google's New Video Model - Gemini Omni Flash - Demo for Devs

Google's New Video Model - Gemini Omni Flash - Demo for Devs

Introducing the Gemini Omni Flash API

Introducing the Gemini Omni Flash API