谷歌如何将 10 秒模型扩展为 40 秒
“40 秒”这一标题数字并非指单次连续渲染。单个生成的片段仍为 3 至 10 秒——变化在于模型在扩展片段时可查看的先前视频长度:最多 10 秒上下文,而此前约为 1 秒 [1]。更大的上下文窗口使 Omni 1.1 能以 10 秒为增量将片段串联起来,累计最长可达 40 秒 [2]。此次更新还增加了首尾帧控制功能,用户可提供镜头的起始和结束关键帧,模型则填充两者之间的连续运动——这一功能明确针对仅靠文本提示难以实现的镜头环绕等复杂运动 [1]。在 Reddit 的 r/singularity 板块,热门评论称更宽的上下文窗口是“巨大飞跃”,超越了仅参考最后一帧的模型;而另一位用户在延长一段现有 Omni 1.0 视频时报告了一个具体故障——服务员在片段末尾意外出现了一只黑色手套——这提醒人们,更大的上下文窗口虽缩小了但并未消除模型的一致性问题。



