从一秒记忆到十秒:真正关键的升级
核心功能——如场景扩展、关键帧控制、4K超分——都源于一个架构上的改变:Omni 1.1 Flash现在可以在生成下一段视频时引用长达10秒的先前视频内容,而此前版本仅为1秒[1]。这个差距听起来不大,但实际上1秒的上下文几乎不足以将角色姿态延续到下一个镜头,更不用说灯光或摄像机构图的一致性;而10秒则足以让整个场景被视为连续拍摄,而非一系列断开的片段。这一跃迁也解释了为何模型现在能支持首帧和末帧的关键帧控制来实现摄像机运动——额外的上下文为其提供了可插值的基础。这项改进之所以意义重大,正是因为前一版本极为受限:原始Omni Flash通过Gemini API发布时,仅支持720p分辨率、10秒片段,完全不提供1080p或4K选项[2]。在YouTube上,像OpenArt这样的创作者甚至戏称其为“视频版Nano Banana”——描述的是通过自然语言提示替换服装、调整光照或重置场景风格的编辑流程,而非重新渲染,这反映出对话式编辑相较于单次文本到视频生成的巨大转变。



