Google的Gemini Omni 1.1 Flash视频模型发布
TECH

Google的Gemini Omni 1.1 Flash视频模型发布

30+
Signals

战略概览

  • 01.
    Gemini Omni 1.1 Flash将其视频生成的上下文窗口从先前版本的1秒扩展至10秒,这一架构变更被Google归功于模型在更长、多镜头场景中保持一致性的新能力。此外,它还新增了最长3秒的视频参考输入功能,用于匹配风格和角色。
  • 02.
    此次升级取代了第一代Omni Flash——该版本最高仅支持720p分辨率,无1080p或4K选项,视频片段限制在10秒以内,且生成视频定价为每秒0.10美元。
  • 03.
    ComfyUI的新Gemini Omni 1.1 Flash合作伙伴节点将文本到视频、图像到视频、参考到视频、视频编辑和场景扩展整合进单一节点,并支持选择720p、1080p或4K输出以及自动生成音频。
  • 04.
    除了此前已宣布与Adobe Firefly、WPP和ComfyUI的集成外,Google表示Omni Flash还已内置于Figma Weave、Runway以及GMI Cloud的模型访问层中。

从一秒记忆到十秒:真正关键的升级

核心功能——如场景扩展、关键帧控制、4K超分——都源于一个架构上的改变:Omni 1.1 Flash现在可以在生成下一段视频时引用长达10秒的先前视频内容,而此前版本仅为1秒[1]。这个差距听起来不大,但实际上1秒的上下文几乎不足以将角色姿态延续到下一个镜头,更不用说灯光或摄像机构图的一致性;而10秒则足以让整个场景被视为连续拍摄,而非一系列断开的片段。这一跃迁也解释了为何模型现在能支持首帧和末帧的关键帧控制来实现摄像机运动——额外的上下文为其提供了可插值的基础。这项改进之所以意义重大,正是因为前一版本极为受限:原始Omni Flash通过Gemini API发布时,仅支持720p分辨率、10秒片段,完全不提供1080p或4K选项[2]。在YouTube上,像OpenArt这样的创作者甚至戏称其为“视频版Nano Banana”——描述的是通过自然语言提示替换服装、调整光照或重置场景风格的编辑流程,而非重新渲染,这反映出对话式编辑相较于单次文本到视频生成的巨大转变。

Google并未赢得基准测试之战——因此它选择了掌控工作流

就原始质量而言,Omni似乎并非排行榜领先者:据行业评论引用外部追踪数据,截至2026年5月,字节跳动的Seedance 2.0位居Artificial Analysis Video Arena榜首,领先于快手的Kling 3.0、Google自家的Veo 3.1以及OpenAI的Sora 2[4](此排名应视为低置信度的二手信息,而非经验证分数)。Google真正押注的是模型所处的位置:Omni Flash已直接接入Figma Weave、Runway、GMI Cloud的模型访问层,并且根据公司自身发布材料,还包括Adobe Firefly、WPP和ComfyUI[1]。ComfyUI的新合作伙伴节点最清晰地体现了这种以集成为先的战略:它将文本到视频、图像到视频、参考到视频、编辑和场景扩展整合为一个节点,支持选择720p、1080p或4K输出并自动生成功能[3]。Google不再单纯依赖生成质量竞争,而是将Omni定位为创意团队首选的模型,因为它已经存在于他们日常使用的工具之中——这是一种仅靠榜单高分无法获得的分发优势。

热情落差:发布日言论 vs. 开发者现实

Google在其发布文章中引用的所有评价都毫无保留地积极正面——Figma的Itay Schiff称其为Weave平台可用的最强视频模型之一,Runway的Jamie Umpherson则表示它能自然融入现有工作流。行业媒体报道同样乐观,认为这是从消费级玩具向生产级工具的转变,将企业视频制作从“安排补拍”简化为“发送一条备注”[2]。这种发布日的热情也延续到了X平台,Google自己的AI Studio账号及创意工具合作伙伴(包括当天即完成集成的Pika Labs)均以与官方发布稿一致的积极措辞宣传此次发布。然而,这种叙事并未完全经受住社区测试的检验。独立评测发现,即使在1.1版本中,跨编辑的一致性、复杂动作处理以及准确的文字渲染仍是未解决的问题[5]。而在实际使用该模型的开发者群体中,反响明显比Google的宣传冷淡得多——一些人认为此次改进难以与前一版本区分,甚至有评测者直言该模型因内容过滤过于激进而“几乎无法用于生产”,并将其与更宽松的开源权重替代方案进行不利对比。这是一个真实存在的矛盾:Figma和Runway高管所称赞的“创意灵活性”模型,在部分实际使用者眼中,更多体现为其“不允许生成的内容”。

为何是现在:推动背后的广告本地化经济逻辑

Omni企业级推广背后的紧迫性源自一个具体成本问题。据报道,品牌在五个以上市场开展本地化视频广告活动时,其总创意预算中有40%至60%仅用于适应性调整——即为每个市场重新拍摄、剪辑和版本化同一核心广告[6]。一个能够扩展场景、通过自然语言提示替换元素并按需提升至4K的单一模型,正是对此类支出的直接回应。正因如此,模型与代理机构及制作工具的集成,而非模型本身,才是本次发布最值得关注的部分。行业报道已指出可能引发的连锁反应:制作公司、后期制作公司、动态图形工作室和网红营销机构正处于最易受冲击的位置,因为一个对话式视频模型有可能将原本需要多个供应商协作的工作压缩为单一提示驱动的流程[7]

历史背景

Veo,Google最初的文本到视频模型,正式发布。
Veo 3发布,新增同步音频生成功能——这一音视频结合基础后来被Omni继承发展。
Veo 3.1(代号“Toucan”)发布,是Omni系列推出前最后一次重大视频更新。
Gemini Omni在2026年Google I/O大会上面向消费者发布,实现图像、音频和文本融合生成视频。
Gemini Omni Flash通过Gemini API和Google AI Studio向开发者开放,定价为每秒0.10美元,仅支持720p输出且片段上限为10秒。
Gemini Omni 1.1 Flash发布——即本次更新——将上下文窗口从1秒扩展至10秒,以增强长场景中的一致性。

关键关系图

关键玩家
主题

Google的Gemini Omni 1.1 Flash视频模型发布

FI

Figma (Weave)

将Omni Flash作为其Weave创意画布产品中可用的视频模型之一进行集成。

RU

Runway

将Omni Flash嵌入其面向创意团队的提示、图像和视频到生成的工作流程中。

GM

GMI Cloud

云服务与模型访问提供商,集中提供对Omni Flash的访问,并以其输出准确性作为营销重点。

BY

ByteDance (Seedance 2.0) and Kuaishou (Kling 3.0)

与中国竞争对手直接对标;据报截至2026年5月,Seedance 2.0在Artificial Analysis Video Arena排行榜上领先于Kling 3.0、Veo 3.1和Sora 2。

事实来源

7 条引用
  1. [1] Build with Gemini Omni 1.1 Flash
  2. [2] Google's Gemini Omni Flash hits the API, turning enterprise video production into a conversation
  3. [3] Gemini Omni 1.1 Flash in ComfyUI, faster
  4. [4] Google's Omni video model: impressive, but does it beat Seedance 2?
  5. [5] Gemini Omni Flash Review: Google AI Video Model 2026
  6. [6] Gemini Omni Flash for Localized Video Ad Production
  7. [7] Google's Gemini Omni Explained: What It Is, How It Works, and Why It Matters

来源文章

Top 5

THE SIGNAL.

Analysts

称Gemini Omni Flash是Figma Weave平台上最强的视频模型之一,画布功能帮助创意团队通过附加参考、分支版本和塑造独特内容持续深化创作。

Itay Schiff, Creative Director, Figma Weave
热情采用者

表示Gemini Omni Flash最突出的是其准确性——细节经得起推敲。

Louisa Guo, VP of Marketing, GMI Cloud
赞扬技术准确性

称Omni Flash能自然融入人们使用Runway的方式——从提示、图像或视频开始,然后在此基础上生成或编辑。

Jamie Umpherson, Chief Creative Officer, Runway
认为工作流契合自然

曾指出在API发布前,Omni因缺乏程序化接口而仅适用于消费者或专业消费者级别,不属于生产级工具,同时强调前1.1版本在跨编辑一致性与文字渲染方面仍存在问题。

VentureBeat enterprise analysis
谨慎乐观的行业媒体
The Crowd

introducing Gemini Omni 1.1 Flash this model brings a new suite of creative controls and generative video capabilities to developers - extend scenes for longer storytelling - specify first and last frames - draft videos more efficiently in 360p - upscale up to 4K resolution

@@GoogleAIStudio1782

Your clip no longer has to end where it started. Gemini Omni 1.1 Flash is here—video extension, first & end frame support, up to 3 reference videos, and output all the way to 4K.

@@pika_labs178

Sew any logo with Gemini Omni Flash 1.1 Made on the Pika API Club

@@TechieBySA521

Gemini Omni 1.1 Flash now available

@u/PandaElDiablo206
Broadcast
AI News: Omni 1.1, Claude Cowork Browser, Agentic Gemini Live, ChatGPT Stickers & More!

AI News: Omni 1.1, Claude Cowork Browser, Agentic Gemini Live, ChatGPT Stickers & More!

Gemini Omni Flash Makes Complex Edits Effortless

Gemini Omni Flash Makes Complex Edits Effortless

8 Insane Ways to Use Gemini Omni Flash

8 Insane Ways to Use Gemini Omni Flash