Google发布Gemini Omni 1.1 Flash视频模型
TECH

Google发布Gemini Omni 1.1 Flash视频模型

37+
Signals

战略概览

  • 01.
    Google DeepMind于2026年8月27日发布了Gemini Omni 1.1 Flash,这是其生成式视频模型的一次点更新,新增了更长的场景串联、首帧/末帧控制功能、更便宜的360p草稿模式以及原生4K超分能力。
  • 02.
    该模型通过每次扩展时读取最多10秒的前置上下文(而非仅最后一帧),将场景以10秒为增量延伸,最终可形成累计长达40秒的连续片段。
  • 03.
    该模型正通过Gemini API、Google AI Studio和Gemini企业代理平台向开发者推出,并已集成至Adobe Firefly、Figma Weave、Runway、GMI Cloud和ComfyUI中。
  • 04.
    每秒API定价按分辨率分级——360p草稿为0.03美元,最高至4K的0.30美元——与Google独立的Veo 3.1 Fast模型的编辑速率相匹配。

从生成片段到导演场景

Google DeepMind于2026年8月27日推出的Gemini Omni 1.1 Flash重新定义了生成式视频模型的用途:它不再局限于单个短片段,而是围绕连续性和控制性构建。现在的场景扩展每次可读取最多10秒的前置上下文,而非仅最后一帧,使得10秒的增量可堆叠成最长40秒的连续场景[1]——Reddit的r/singularity社区早期测试者称,这一变化是对旧有“仅末帧串联”方法的真正飞跃,而不仅仅是渐进式调整。首帧和末帧控制功能允许开发者固定镜头的起始和结束画面,由模型自动生成两者之间的摄像机环绕、缩放或无缝循环过渡[1]。另一个参考视频功能则允许开发者上传最多三秒的现有视频作为风格或角色锚点,将特定角色外观或动作模式延续至新生成内容中[2]。在制作层面,360p草稿模式渲染速度提升高达60%,成本约为标准720p层级的三分之一,专为快速迭代设计,供创作者在决定以1080p或原生4K进行最终高成本渲染前使用[3]。这些功能单独看是渐进式改进,但合在一起推动产品从‘输入提示词、获得片段’转向真正的剪辑与导演界面。

在Sora淡出的同一季,加倍投入视频领域

此次发布处于特定的竞争背景下。OpenAI已于2026年4月26日关闭其Sora消费者应用,Sora API本身也计划于2026年9月24日终止服务[10]。而Google的视频产品线却反向推进:Gemini Omni于2026年5月19日在I/O大会上宣布,作为DeepMind首个原生多模态、任意到任意的生成媒体模型,明确将此前独立的视频(Veo)和图像(Imagen/Nano Banana)流程统一到单一架构中[9],并于2026年6月30日进入公开开发者预览阶段[11],如今在不到两个月后便迎来首次点更新。这种节奏——宣布、发布预览、紧接着在主要竞争对手退出市场之际快速迭代同一系列模型——表明Google正利用Sora的退场来巩固自身地位,而非仅仅维持竞争。此次发布也不局限于Google自有平台:Omni 1.1 Flash同步上线Adobe Firefly、Figma Weave、Runway、GMI Cloud及专用ComfyUI合作伙伴节点,支持文本到视频、图像到视频、参考到视频、编辑和场景扩展等功能[5],并通过Gemini API、Google AI Studio和Gemini企业代理平台向开发者和企业开放[4]。Google自身账号也在X平台上大力宣传此次发布,甚至竞争对手Pika也公开承认该版本并指出自身产品具备类似功能,如场景扩展、首/末帧控制、多参考视频和4K输出——这相当于竞争对手默认Omni 1.1 Flash的功能集已成为行业新标杆。总体来看,这是一种刻意的“无处不在嵌入”策略——Google正在争夺专业创意工作流本身,而不仅仅是自家应用的流量。

排行榜与剪辑室之间的差距

关于该模型存在两种截然不同的图景。在基准测试方面,第三方基准追踪器将Omni 1.1 Flash列为Text-to-Video类别的第一名,领先第三名模型超过20分;在Image-to-Video类别中排名第二,比前代Omni Flash在同一类别的得分提升了约25分——表现强劲,虽未包揽双冠,但Google自身的定位正是基于其在编辑能力上的领先地位。而在实际操作层面,情况更为复杂,且因测试者和测试方式不同而分化。开发者反馈指出,廉价的360p草稿模式受到模型非确定性的削弱:由于生成过程不具备确定性,一个在低成本、快速分辨率下通过审批的提示词,在全分辨率重跑时可能产生显著差异,从而削弱了“先低价草稿再支付最终渲染”的意义[6]。独立实测对比Omni 1.1 Flash与竞品Seedance 2.0 Mini和VO3.1 Fast发现,简单、局部的编辑几乎完美,但更复杂的编辑——如身份替换、跨时代延时——仍会产生明显的扭曲和身份不一致,这表明Omni 1.1 Flash更像是旗舰级‘Omni’模型之前的轻量层级,而非万能工具。这类持怀疑态度的对比评测,与另一类精心制作的、类似广告公司风格的YouTube教程并存,后者展示诸如原生音频同步生成和对话式迭代编辑等创意工作流(例如提示模型‘把夜晚改为黄金时刻’)。这种“教学内容”与“压力测试”之间的分裂本身即是一种信号:该模型在现实世界中的可靠性仍在公开环境中被不断验证。第三个摩擦点来自Reddit上的真实用户,他们报告称,一些合法且非敏感的提示词(例如‘两人在太空打斗’)被过于激进的安全过滤器拒绝,有人甚至表示他们在实际生产中更倾向于使用Minimax H3。这些并不否定其基准测试的胜利,但确实说明,该模型的 headline 功能与其在复杂或敏感编辑任务中的日常可靠性,因测试者的不同而呈现出截然不同的评价。

价格、限制与真实产品形态

定价严格按分辨率分级:360p草稿每秒0.03美元,720p为0.10美元,1080p为0.15美元,4K为0.30美元[7],其中720p的费率刻意与Google独立的Veo 3.1 Fast编辑价格保持一致,确保开发者在选择Omni而非Veo执行编辑任务时不会因成本受罚[7]。这种按秒计费结构建立在原始Omni Flash的token计价基础上——输入token约每百万1.50美元,视频输出token约每百万17.50美元,折算下来720p视频每秒约消耗5,792个token,成本约为0.10美元[3]。在安全方面,DeepMind的模型卡确认所有输出均应用SynthID水印,且目前限制模型修改人物录音的能力,这是对如此强大可控连续视频模型潜在深度伪造滥用风险的直接承认[8]。综合定价、合作伙伴集成和功能限制来看,该产品的形态并非‘一个全能视频模型’,而是一个廉价、快速、可控的视频层,Google预期它将与其他生成模型串联,并嵌入其他公司的创意工具中,而非作为单一旗舰产品独立存在。

历史背景

关闭了其竞争产品Sora消费者应用,Sora API也计划于2026年9月24日终止服务,这一举动后来被评论人士与Google持续投资Omni形成对比。
Gemini Omni在2026年Google I/O大会上宣布,作为Google首个原生多模态、任意到任意的生成媒体模型,统一了此前独立的视频(Veo)和图像(Imagen/Nano Banana)流程。
Gemini Omni Flash通过Google AI Studio和Gemini API进入开发者公开预览阶段。
Gemini Omni 1.1 Flash发布,新增扩展场景串联、首/末帧控制、360p草稿模式和4K超分功能。

关键关系图

关键玩家
主题

Google发布Gemini Omni 1.1 Flash视频模型

GO

Google DeepMind

Developer of the Gemini Omni model family; ships Omni 1.1 Flash via the Gemini API, Google AI Studio and Gemini Enterprise Agent Platform, positioning it against OpenAI's discontinued Sora line.

AD

Adobe (Firefly)

Creative-software partner that integrated Gemini Omni Flash into Adobe Firefly, extending Google's video model into professional creative workflows.

FI

Figma (Weave)

Design platform embedding Omni Flash in Figma Weave's canvas, letting creative teams attach references and branch generations.

CO

ComfyUI

Node-based generative workflow tool that shipped a dedicated Gemini Video Omni Partner Node exposing text-to-video, image-to-video, reference-to-video, editing and scene extension in one node.

RU

Runway

Video-generation competitor/partner that also adopted Omni Flash access for its users, described as letting users move quickly between ideas.

OP

OpenAI (Sora)

Chief prior competitor in AI video generation; shut down the Sora app on April 26, 2026 with the API sunsetting September 24, 2026, leaving Google's continued Omni investment notable by contrast.

事实来源

11 条引用
  1. [1] Build with Gemini Omni 1.1 Flash
  2. [2] Google's Gemini Omni 1.1 Flash makes AI video generation cheaper and more flexible
  3. [3] Google AI Releases Gemini Omni 1.1 Flash: 40-Second Scene Extension, First/Last-Frame Control, and 4K Upscaling
  4. [4] Gemini Enterprise Agent Platform: Omni 1.1 Flash
  5. [5] Gemini Omni 1.1 Flash in ComfyUI, Faster
  6. [6] Gemini Omni 1.1 Flash
  7. [7] Gemini Omni Flash Pricing
  8. [8] Gemini Omni Flash Model Card
  9. [9] Google Gemini Omni Flash AI Video Editor
  10. [10] Gemini Omni vs Sora 2: AI Video Model Comparison
  11. [11] Gemini Omni Model Overview

来源文章

Top 5

THE SIGNAL.

Analysts

指出了OpenAI放弃Sora与Google持续大力投资自身视频生成产品线之间的鲜明对比。

Simon Willison
独立开发者/评论员,via Hacker News讨论

将Omni Flash的编辑性能和定价定位为业界最佳,成本与Veo 3.1 Fast相当,但在编辑质量上领先。

Logan Kilpatrick
Google AI负责人

认为真正的产品战略是将Google的图像和视频模型串联使用,而非单独依赖任一模型。

Rohan Paul
独立AI分析师

认为此次更新使创作者从单纯生成视频片段转向主动导演,归功于场景扩展、更丰富的参考功能和4K输出。

Itay Schiff
Figma Weave创意总监

批评360p草稿模式的实用性,因为输出具有非确定性,全分辨率重跑可能偏离已批准的草稿。

cube00
开发者评论者,Hacker News

在Google为发布举办的专家圆桌会上表示,对该模型系列的增长轨迹充满绝对信心,直言其发展潜力没有上限。

Mohammad Babaeizadeh
Google DeepMind,Gemini Omni团队
The Crowd

Rev up your story by extending the scene with Gemini Omni 1.1 Flash. Now you can build longer stories or branch into new creative directions by creating or uploading a video and then asking Gemini to extend the scene from right where it left off.

@@GeminiApp1259

Big news: Gemini Omni 1.1 Flash has landed #1 in the Text-to-Video Arena and #2 in the Image-to-Video Arena! For Text-to-Video the latest 1.1 model is +20pts above FLUX 3 Video at #3 (1495 pts). For Image-to-Video the release is a strong +25pt improvement from Gemini Omni Flash

@@arena1059

Your clip no longer has to end where it started. Gemini Omni 1.1 Flash is here—video extension, first & end frame support, up to 3 reference videos, and output all the way to 4K.

@@pika_labs180

Gemini Omni 1.1 Flash now available

@u/PandaElDiablo208
Broadcast
8 Insane Ways to Use Gemini Omni Flash

8 Insane Ways to Use Gemini Omni Flash

I Tested Gemini Omni Flash so You Don't Have to...

I Tested Gemini Omni Flash so You Don't Have to...

NEW AI : Google Gemini Omni Flash | Best AI Video Generator & Editor 2026

NEW AI : Google Gemini Omni Flash | Best AI Video Generator & Editor 2026