Google Gemini Omni 1.1 Flash 视频模型发布
TECH

Google Gemini Omni 1.1 Flash 视频模型发布

31+
Signals

战略概览

  • 01.
    谷歌 DeepMind 于 2026 年 8 月 27 日宣布推出 Gemini Omni 1.1 Flash,这是一款更新的视频生成与编辑模型,可通过 Gemini API、Google AI Studio、Google Flow、ComfyUI 以及企业平台获取。
  • 02.
    该模型可将生成的视频以 10 秒为增量逐步延长,累计最长可达 40 秒,每次扩展时可分析最多 10 秒的先前内容——相比前代模型约 1 秒的上下文窗口,这是重大飞跃。
  • 03.
    新增的首尾帧控制功能允许用户指定起始和结束关键帧,模型将在两者之间生成连续视频,适用于镜头环绕和复杂运动场景。
  • 04.
    新的 360p 草稿模式可生成轻量级预览,渲染速度提升高达 60%,成本约为标准 720p 输出的三分之一,旨在最终渲染前实现快速迭代;输出内容随后可升级至 1080p 或 4K。
  • 05.
    定价按分辨率分级:360p 每秒 0.03 美元,720p 每秒 0.10 美元,1080p 每秒 0.15 美元,4K 每秒 0.30 美元。
  • 06.
    所有生成的视频均带有谷歌的 SynthID 水印以标识 AI 来源,尽管模型具备相应能力,谷歌已主动限制其在编辑过程中更改人物语音的功能。

谷歌如何将 10 秒模型扩展为 40 秒

“40 秒”这一标题数字并非指单次连续渲染。单个生成的片段仍为 3 至 10 秒——变化在于模型在扩展片段时可查看的先前视频长度:最多 10 秒上下文,而此前约为 1 秒 [1]。更大的上下文窗口使 Omni 1.1 能以 10 秒为增量将片段串联起来,累计最长可达 40 秒 [2]。此次更新还增加了首尾帧控制功能,用户可提供镜头的起始和结束关键帧,模型则填充两者之间的连续运动——这一功能明确针对仅靠文本提示难以实现的镜头环绕等复杂运动 [1]。在 Reddit 的 r/singularity 板块,热门评论称更宽的上下文窗口是“巨大飞跃”,超越了仅参考最后一帧的模型;而另一位用户在延长一段现有 Omni 1.0 视频时报告了一个具体故障——服务员在片段末尾意外出现了一只黑色手套——这提醒人们,更大的上下文窗口虽缩小了但并未消除模型的一致性问题。

排行榜冠军,但并非一致认可

Gemini Omni Flash 目前在 Artificial Analysis 的文本到视频竞技场(无音频)中以 1,323 的 Elo 分数位居榜首 [3],并在 LMArena 的文本到视频竞技场中以 1,527 分拔得头筹 [4]。但其他榜单的情况则不那么清晰:在 Artificial Analysis 自家竞技场的含音频版本中,Omni Flash 实际排名第二,落后于 Wan 3.0 [3];而在 Black Forest Labs 自行的初步人类偏好评估中,其竞争模型 FLUX 3 Video 在 52% 的一对一比较中优于 Gemini Omni Flash [5]。这种分歧很重要,因为它来自竞争对手实验室的内部测试而非中立基准,但仍削弱了 Omni 1.1 Flash 明确为当前最佳视频模型的说法——“最佳”答案高度依赖于你参考的是哪个竞技场、哪种音频设置以及你信任谁的评估。排名第一也是谷歌及其社区选择放大的叙事:官方发布帖以新控件而非基准测试为重点,但独立创作者迅速将其转化为一种新的内容类型,将 Omni 1.1 Flash 与 Seedance 2.5 等竞品在相同提示下进行直接对比,以检验排行榜位置是否经得起实际并排考验。

规格表与实际体验之间的差距

谷歌自身的文档比其营销标题更为谨慎:4K 输出明确标注为“升级版”,而非原生生成——模型在较低分辨率下渲染,然后对结果进行上采样 [2]。这种“官方规格与实际访问权限”之间的差距在实际测试和社区讨论中也独立显现。一位使用 Artlist 集成的 YouTube 评测者发现,该平台将输出限制在 720p 和 10 秒片段,远低于谷歌公告中提到的 40 秒、4K 数据,表明第三方平台可能仅提供该模型的降级版本,而非其全部功能。此外,Reddit 的 r/Bard 板块用户报告了对 Google Flow 中新场景扩展功能是否已上线的困惑,一位用户表示找不到该功能,另一位则报告在 Flow 中未见明显画质提升。三个独立来源——技术分析、实测视频评测和用户社区讨论——均指向同一主题(营销功能超前于实际可访问性,具体取决于访问途径),这表明这并非偶然投诉,而是此次发布的真实特征之一。

企业级整合,附带明确限制

VentureBeat 将此次 API 发布描述为将过去多个独立工具(生成、扩展、编辑)整合为单一对话模型,认为这减少了企业视频团队需要管理的供应商数量,并简化了数据处理和输出监控 [4]。谷歌自身的模型卡对此整合叙事提出了两点限制。首先,尽管该模型在技术上具备在视频编辑中更改人物语音的能力,但谷歌表示“目前”已限制该功能——这隐含承认了在一款使视频编辑变得对话化且快速的工具中,存在深度伪造和错误信息的风险 [6]。其次,模型卡承认“在整个编辑过程中保持完全一致性、生成复杂运动场景或渲染完全准确的文本仍是一项挑战”,这意味着通过此整合流程生成的输出在投入生产前仍需人工审核 [6]

历史背景

Gemini Omni 系列,包括基础版 Gemini Omni Flash,于 2026 年谷歌 I/O 大会发布,并于同日通过 Gemini 应用、Google Flow 和 YouTube Shorts 向公众开放。
Gemini Omni Flash 首次通过 Gemini API 和 Google AI Studio 作为预览模型向开发者开放。
谷歌宣布推出 Gemini Omni 1.1 Flash 更新,新增更长的场景扩展、首尾帧控制、360p 草稿模式和 4K 升级功能。
此前视频生成需通过 Veo 作为独立模型和流程步骤;Gemini Omni 将其整合为单一原生多模态模型,尽管谷歌仍将 Veo 定位为独立的专业视频产品线。

关键关系图

关键玩家
主题

Google Gemini Omni 1.1 Flash 视频模型发布

GO

Google DeepMind

Developer and publisher of Gemini Omni 1.1 Flash; controls model access via the Gemini API, AI Studio, and model card/safety disclosures.

AD

Adobe

Integration partner that has added Gemini Omni Flash into Adobe Firefly for AI video generation.

CO

ComfyUI / Comfy Org

Integration partner shipping partner nodes and workflows that let ComfyUI users call Gemini Omni Flash for text-to-video, image-to-video, and video-editing pipelines.

AR

Artificial Analysis

Independent benchmarking site running blind-vote leaderboards on which Gemini Omni Flash competes against Seedance 2.0, MiniMax H3, and Wan 3.0.

BL

Black Forest Labs

Competitor that ran preliminary human-preference evaluations comparing its FLUX 3 Video model against Gemini Omni Flash.

事实来源

7 条引用
  1. [1] Build with Gemini Omni 1.1 Flash
  2. [2] Google Gemini Omni Flash
  3. [3] Text-to-Video Arena Leaderboard
  4. [4] Google's Gemini Omni Flash Hits the API, Turning Enterprise Video Production Into a Conversation
  5. [5] Gemini Omni Flash Review
  6. [6] Gemini Omni Flash Model Card
  7. [7] Gemini API Docs: Omni

来源文章

Top 5

THE SIGNAL.

Analysts

对模型未来的发展轨迹表示乐观,将当前能力视为更长路线图的早期阶段。

Google Omni team
谷歌 DeepMind(来源中未归因于具体个人)

认为此次 API 发布对企业视频制作意义重大,因为它将独立工具的工作流程整合为单一的对话式管道,降低了制作长篇培训或解说视频的成本和门槛。

VentureBeat
科技媒体分析
The Crowd

Gemini Omni 1.1 Flash is our newest multimodal model for video generation and editing. It delivers a new suite of creative capabilities and controls for developers. With this update you can: Extend your scenes, Specify starting and ending frames of a shot, Add video input references, Upscale to 4K, Test ideas quickly in 360p.

@@Google2025

Gemini Omni 1.1 Flash vs Seedance 2.5. Omni 1.1 flash just landed at #1 in the Arena. So... let's put the new champion against Seedance 2.5. Same challenge. Same prompt. Two heavyweights. Can Seedance 2.5 take down the current #1? Watch the comparison and let me know...

@@JSFILMZ0412257

Google just upgraded Gemini Omni Flash with some pretty serious video controls. You can now: extend existing scenes, set the first AND last frame, use reference video for motion + consistency, test ideas cheaply in 360p, upscale the winners to 4K.

@@WesRoth27

Gemini Omni 1.1 Flash now available

@u/PandaElDiablo201
Broadcast
8 Insane Ways to Use Gemini Omni Flash

8 Insane Ways to Use Gemini Omni Flash

I Tested Gemini Omni Flash so You Don't Have to...

I Tested Gemini Omni Flash so You Don't Have to...

NEW AI : Google Gemini Omni Flash | Best AI Video Generator & Editor 2026

NEW AI : Google Gemini Omni Flash | Best AI Video Generator & Editor 2026