为何场景扩展终于奏效:上下文窗口的突破
1.1 Flash版本最引人注目的技术改进几乎平淡无奇却影响深远:场景扩展在生成下一段内容前,现在能读取最多10秒的先前画面,而非像初代Omni Flash那样仅依赖单帧末尾画面[1]。这听起来像是一个微小参数调整,但它直接解决了多段AI视频生成中最常见的失败模式——角色夹克颜色突变、房间灯光突然扁平化,或背景道具在剪辑间消失,因为模型对之前的内容几乎没有记忆。有了10秒的上下文窗口,模型可以以10秒为单位进行扩展,累计最长可达40秒,为创作者提供了足够的创作空间来构建短场景,而非孤立的单镜头。
与上下文窗口升级相辅相成的是首尾帧关键帧控制功能,允许创作者精确指定镜头的起始与结束状态——这对于需要精准落点的摄像机环绕、缩放或循环剪辑非常有用,避免了模型随机漂移的问题[2]。谷歌还增加了对最多三秒参考视频的支持,这些视频可来自最多三个不同片段,专门用于帮助模型在多次生成中保持角色外观或摄像机动态风格的一致性[2]。这些改进并未让Omni达到电影级水准,但明确承认了此前版本的瓶颈在于记忆能力,而非图像质量本身。
这种记忆升级在实际使用中表现得非常明显。线上发布的开发者演示普遍采用对话式、迭代式的编辑方式——例如,在保持场景、镜头和摄像机构图不变的前提下,要求模型中途改变一只猫的颜色。实操演示还突出了随视频同步生成的原生音频输出,以及创作者所描述的一种‘世界知识’——运动遵循物理规律,如重量、动量和接触,而非不自然地滑动或漂浮。这些演示中反复出现的一个实用案例是风格重置:保留原有角色动作、摄像机路径和构图的同时,改变现有片段的视觉风格,这正是扩展上下文窗口和参考视频支持所针对的工作流。


