Google的Gemini Omni 1.1 Flash视频生成更新
TECH

Google的Gemini Omni 1.1 Flash视频生成更新

28+
Signals

战略概览

  • 01.
    Google正式发布了Gemini Omni 1.1 Flash,这是AI视频生成与编辑的更新版多模态模型,现已在Gemini API和Google AI Studio上线。
  • 02.
    场景扩展功能现在可分析最多10秒的前置画面(此前仅为1秒),并以10秒为增量将场景延长至累计40秒,同时保持角色身份、光照和叙事连贯性。
  • 03.
    此次更新新增了360p草稿模式,运行速度最高提升60%,成本约为720p渲染的三分之一,同时提供按秒计费的定价:360p为每秒0.03美元,720p为0.10美元,1080p为0.15美元,4K为0.30美元。
  • 04.
    开发者文档确认,Omni Flash支持文本到视频、图像到视频、帧插值以及360p/720p/1080p/4K分辨率下的视频扩展,所有生成内容均嵌入了不可见但可编程检测的SynthID水印。

从生成片段到真正导演视频

Google将1.1版本更新定位为从AI视频的一次性输出转向在真实创作控制下的可编辑媒介。核心变化是上下文记忆功能:场景扩展现在可分析最多10秒的前置画面,而此前仅为1秒,使模型在以10秒为增量拼接新画面时,能保持角色身份、光照和叙事连贯性,最终形成累计长达40秒的完整场景[1]。结合明确的起始帧与结束帧控制以及风格参考功能,开发者现在可以对生成过程进行艺术指导,而不仅仅是输入提示并寄希望于获得可用片段[1]。Figma Weave的创意总监直言不讳地指出,Omni Flash让团队“从生成视频迈向真正导演视频”[1]。这一说法与创作者日常使用Omni Flash编辑范式的方式一致——在保留角色和动作的前提下重置整个场景风格、在现有镜头中更换物体或服装,或通过后续提示就地修改当前生成内容而非从头开始——这正是开发者功能列表与真实制作流程之间的连接点。

先草稿再定稿:生成成本的经济逻辑

由于生成按输出秒数计费,迭代成本如今与原始质量同等重要。Omni 1.1 Flash的输出定价为:360p每秒0.03美元,720p为0.10美元,1080p为0.15美元,4K为0.30美元[2],而新的360p草稿模式运行速度最高提升60%,成本约为720p渲染的三分之一[1]。Google Flow的更新将这种分级机制直接集成到编辑界面中,允许创作者先以低成本的360p测试构图和运镜,再决定是否投入积分进行全分辨率渲染[3]。GMI Cloud的营销副总裁从商业角度评价称,Omni“使AI视频对原本无法依赖它的细分市场变得可行”[1]——这一说法与其说是慷慨,不如说是旨在扩大AI视频可触达市场的定价策略,为昂贵的最终渲染锁定用户。

对标Sora 2,并在当下最重要的排行榜上领先

Omni 1.1 Flash的发布正值特定竞争背景:OpenAI不久前发布了Sora 2,其负责人Bill Peebles称其为“视频领域的GPT-3.5时刻”[4],重新设定了人们对输出质量的预期。Google DeepMind的CTO也以类似代际术语描述Omni系列,称其为“新一代多模态模型,能从任意输入生成任意内容,从视频开始”[4],而产品负责人明确表示,早期的输出时长限制是分发策略而非技术瓶颈[4]——这暗示更长、更可编辑的视频一直是既定方向。独立社区追踪数据也印证了这一势头:发布后不久,Omni 1.1 Flash便在Text-to-Video Arena排行榜上超越FLUX 3 Video位列第一,并在Image-to-Video Arena中排名第二,相比前代Gemini Omni Flash提升了25分以上——这表明此次更新的提升已被外部基准测试验证,而不仅限于Google自身的宣传。

Flash疲劳:功能强大却令核心用户失望

在Google自身的高级用户社区中,反响比媒体报道更为矛盾。技术讨论线独立验证了主要功能——10秒上下文窗口、40秒累计上限以及360p草稿的经济性均在实际测试中得到确认,Google Flow的编辑功能也已对Plus、Pro和Ultra订阅用户开放。但最强烈的反馈是失望:在长期承诺的Pro版本仍未发布的情况下,Google再次推出Flash层级更新,引发用户嘲讽其模型命名体系而非关注功能本身。实际测试反馈也褒贬不一:一位用户用1.1版本扩展旧版Omni 1.0片段,称结果“相当不错”,但中途出现了一个异常黑手套;另一位用户的战斗场景生成测试则未见任何提升。另一波批评聚焦于内容审核:有评论者批评Google的内容安全过滤过于保守,指出Google自身宣传案例中一对情侣的场景标注“我看到了”也被过滤器不必要地标记。

为无处不在复制的模型设置护栏

Omni 1.1 Flash生成的每段视频都带有不可见的SynthID水印,可通过程序检测,这是Google为防止未标注合成媒体无限制传播所采取的措施[5]。这一防护机制在模型被大规模推向消费者端时尤为重要:Flow的免费每日额度以及YouTube的Shorts Remix和Create工具,将前沿视频编辑能力交到了大众手中,而不仅是API开发者[6]。监管机构也未被排除在设计之外——Google官方开发者文档指出,视频编辑和上传内容扩展功能在欧洲经济区、瑞士和英国不可用,尽管Omni的其他功能在这些地区普遍可用[5]。这种组合——在广泛消费者分发的同时,在严格监管市场中限制部分功能——表明Google将“编辑他人真实视频”这一风险最高的能力视为最需谨慎对待的部分。

历史背景

Veo 3和Veo 3.1曾是Google的旗舰视频生成模型,在Omni成为Gemini应用默认视频模型前,已具备同步音频、场景扩展和叙事控制功能。
Google在2026年Google I/O大会上宣布Gemini Omni模型系列,并于同日开始推出首个成员Gemini Omni Flash。
Google宣布通过Google AI Studio和Gemini API以模型名gemini-omni-flash-preview向公众预览开放Gemini Omni Flash的开发者访问。
Gemini Omni Flash通过Gemini应用、Google Flow、YouTube Shorts Remix和YouTube Create广泛上线。
Google发布Gemini Omni 1.1 Flash更新,新增累计40秒场景扩展、4K超分、风格参考和更便宜的360p草稿模式。

关键关系图

关键玩家
主题

Google的Gemini Omni 1.1 Flash视频生成更新

GO

Google DeepMind

Gemini Omni 模型系列的开发者;通过 Google AI Studio 和 Gemini API 设定发布节奏、定价和 API 访问权限。

GO

Google Flow (Google Labs)

创意视频编辑平台,集成 Omni 1.1 Flash 的起止帧控制、4K 导出和 360p 草稿模式,服务于电影制作人和创作者。

FI

Figma (Weave)

产品设计合作伙伴;创意总监 Itay Schiff 推荐 Omni Flash 的导演控制功能用于创意团队。

GM

GMI Cloud

云基础设施合作伙伴;市场副总裁 Louisa Guo 表示 Omni 使 AI 视频在以往未覆盖的细分市场实现商业可行性。

RU

Runway

竞争性 AI 视频公司;首席创意官 Jamie Umpherson 评论称 Omni 为用户提供了更快速迭代的方式。

OP

OpenAI (Sora)

AI 视频生成领域的主要竞争对手;Sora 2 在电影级画质和片段时长方面与 Omni Flash 较短且更易编辑的输出相竞争。

事实来源

6 条引用
  1. [1] Gemini Omni 1.1 Flash lets you build with more control
  2. [2] Google's Gemini Omni 1.1 Flash makes AI video generation cheaper and more flexible
  3. [3] New creative controls in Google Flow
  4. [4] AI Video Generation: Omni vs Sora vs Veo 3
  5. [5] Omni | Gemini API | Google AI for Developers
  6. [6] Google Adds Gemini Omni Video Editing to Flow

来源文章

Top 5

THE SIGNAL.

Analysts

将Gemini Omni系列定位为迈向任意输入、任意输出的多模态创作生成的代际转变,从视频开始。

Koray Kavukcuoglu
Google DeepMind首席技术官

表示早期输出时长限制是刻意的分发决策,而非硬性技术上限。

Nicole Brichtova
Google DeepMind产品管理总监

认为Omni Flash使创意团队从被动生成片段转向主动导演视频。

Itay Schiff
Figma Weave创意总监

表示Omni已扩大AI视频在先前无法依赖它的细分市场中的实际商业可行性。

Louisa Guo
GMI Cloud营销副总裁

将OpenAI的Sora 2发布描述为视频生成质量的分水岭事件,为Google的Omni更新提供了竞争背景。

Bill Peebles
OpenAI Sora项目负责人
The Crowd

Gemini Omni 1.1 Flash is our newest multimodal model for video generation and editing. It delivers a new suite of creative capabilities and controls for developers 🎥 With this update you can: 🎬 Extend your scenes 🎯 Specify starting and ending frames of a shot ➕ Add video

@@Google1577

introducing Gemini Omni 1.1 Flash this model brings a new suite of creative controls and generative video capabilities to developers - extend scenes for longer storytelling - specify first and last frames - draft videos more efficiently in 360p - upscale up to 4K resolution -

@@GoogleAIStudio1395

Big news: Gemini Omni 1.1 Flash has landed #1 in the Text-to-Video Arena and #2 in the Image-to-Video Arena! For Text-to-Video the latest 1.1 model is +20pts above FLUX 3 Video at #3 (1495 pts). For Image-to-Video the release is a strong +25pt improvement from Gemini Omni Flash

@@arena689

Gemini Omni 1.1 Flash now available

@u/PandaElDiablo162
Broadcast
8 Insane Ways to Use Gemini Omni Flash

8 Insane Ways to Use Gemini Omni Flash

I Tested Gemini Omni Flash so You Don't Have to...

I Tested Gemini Omni Flash so You Don't Have to...

NEW AI : Google Gemini Omni Flash | Best AI Video Generator & Editor 2026

NEW AI : Google Gemini Omni Flash | Best AI Video Generator & Editor 2026