字节跳动正在开发一种实时空间视频生成模型,由创始人张一鸣亲自监督,可能最早于2026年10月发布,正式加入与谷歌DeepMind的Genie和Meta之间的“世界模型”竞赛。
TECH

字节跳动正在开发一种实时空间视频生成模型,由创始人张一鸣亲自监督,可能最早于2026年10月发布,正式加入与谷歌DeepMind的Genie和Meta之间的“世界模型”竞赛。

29+
Signals

战略概览

  • 01.
    字节跳动创始人张一鸣正在亲自监督一款用于实时空间视频生成的AI模型的开发,可能最早于下月(2026年10月)发布。
  • 02.
    该模型基于字节跳动现有的Seedance视频系统,目标是实现约每秒20帧、延迟约50毫秒的性能,通过云端渲染,用户的声音或动作可实时重塑场景。
  • 03.
    该项目旨在服务于字节跳动的Pico VR头显(将计算任务卸载至云端以降低硬件成本)以及抖音平台,让创作者无需拥有昂贵的图形硬件即可制作直播、短剧和游戏。
  • 04.
    截至2026年初,字节跳动的世界模型性能仍落后于全球顶尖水平,在与谷歌Genie 3的基准对比中大约落后10%,公司目标是在2026年底前追平。

深度分析

50毫秒循环之内:‘实时空间视频’究竟意味着什么

据称在张一鸣直接监督下的模型基于字节跳动现有的Seedance视频系统,并设定了一个具体的技术门槛:约每秒20帧、延迟约50毫秒 [1]。这个数字比表面看起来更重要——它足够快,能让观众的声音或动作在场景展开过程中实时重塑画面,而非等待预渲染的视频片段。关键的是,渲染发生在云端,而非设备端 [1]。彭博社的消息来源称,发布窗口最早可能在2026年10月,即下个月,张一鸣本人亲自监督该项目的开发 [2]。两个明确的受益方揭示了其真正的商业逻辑:字节跳动的VR头显产品线Pico可以推出更便宜的硬件,因为繁重的计算任务已转移至服务器;而抖音则获得了一款新的创作者工具——无需拥有图形工作站即可制作直播、短剧和游戏 [1]。这不仅仅是一个研究性演示,而是计划将世界模型技术直接整合进字节跳动现有的两款产品中。

字节跳动投入3至4倍于竞争对手的资金,以弥补与Genie 3的10%差距

截至2026年,世界模型已成为字节跳动内部AI训练数据预算最高的模型方向——据报道达数千万元人民币,是同类竞争对手在相同问题上投入的3至4倍 [3]。这一巨额投入是对一个明确承认的差距的回应:截至2026年初,字节跳动的世界模型性能仍落后于全球顶尖水平约10%,这一差距是通过与谷歌DeepMind于2025年8月发布的Genie 3对比得出的 [4]。公司内部设定的目标是,到2026年底至少发布一个版本,性能达到与Genie 3持平 [3]。在组织架构上,字节跳动Seed团队将工作拆分为两条并行轨道,而非一个统一团队:由周畅负责的视觉-语言-行动(VLA)轨道,专注于具身智能和机器人技术;另一条由范浩奇(前Meta FAIR研究员)领导的3D仿真轨道,专注于游戏和娱乐 [3]。其机器人领域的野心已在其他方面显现——字节跳动已在中国单独投资人形机器人开发,这与VLA轨道的既定目标一致 [5]。在X平台上流传的独立AI行业评论也证实了10月发布窗口,并明确将这场竞赛定义为与谷歌Genie的竞争,指出Genie目前仍处于封闭测试阶段——这一细节与字节跳动试图在对手发布下一个公开基准前缩小差距的策略吻合。

对Meta和苹果头显的尴尬挑战

关于此事为何在中国以外地区引发关注,最尖锐的解读来自一段未具名的市场评论:云端渲染的世界模型并不会在画质上超越Vision Pro级别的头显,但它把画质问题变成了别人的问题 [1]。这种说法准确捕捉到了对Meta和苹果的真实威胁——并非字节跳动在渲染能力上超越了它们的头显,而是它可能让专用的、昂贵的头显硬件在大量应用场景中显得不再必要。字节跳动在这场赌局中的筹码也相当可观:据报道,公司已获得300亿美元贷款,并正在考虑高达700亿美元的AI资本支出,这是此次模型推进背后的更广泛资本支出背景 [1]。如果字节跳动能通过将渲染转移至云端,利用更便宜的硬件提供交互性强、低延迟的空间世界,那么竞争将被重新定义为围绕软件和云经济的较量,而非硬件画质——这是一场Meta和苹果此前从未真正面对过的竞争。

已有公开技术基础,但版权阴影如影随形

两项来自字节跳动关联研究的技术基础(独立于彭博社报道的旗舰模型)表明,该能力并非从零开始。其一是Helios,一种基于WAN-video自回归架构的实时长视频生成模型,以33帧为单位生成,可在消费级GPU上本地运行,其权衡在于牺牲分辨率以换取实时速度,而非追求照片级真实感。另一项是为多模态模型中的空间智能提出的四层层次结构——感知、心理映射、心理模拟和空间智能体——将物理空间中的行动作为最终目标,这与字节跳动VLA轨道的机器人野心直接相关。这两项技术均未被确认属于张一鸣领导的项目,但都表明字节跳动在该领域已有活跃且公开的研究。然而,这种势头也伴随着风险先例:字节跳动相关的Seedance 2.0视频模型已因未经授权使用角色和名人形象,遭到迪士尼、美国电影协会(MPA)、Netflix、派拉蒙、索尼和环球等公司的版权投诉,迫使公司增加防护措施 [6]。一款更具交互性、更逼真的空间视频产品将将在更高风险下引发同样的肖像权和知识产权问题。

历史背景

字节跳动Seed研究团队成立,旨在推进通用智能研究。
周畅从阿里巴巴加入字节跳动,并主导公司世界模型的研究工作。
通过两条独立的研究轨道,公司内部对世界模型的探索正式展开。
谷歌发布了Genie 3,这款实时交互式世界模型成为字节跳动的基准目标。
Seed团队将其世界模型工作整合为一个由范浩奇领导的新研究组,专注于3D仿真路线。
字节跳动发布了Seedance 2.0,一款物理精确的文本到视频模型,因好莱坞版权投诉而被迫增加防护措施。
字节跳动正式将世界模型列为2026年四大AI重点方向之一。
字节跳动发布了Seedance 2.5,支持30秒单次生成的音视频片段,并增强了空间控制能力。
彭博社报道称,张一鸣正在亲自监督一款实时空间视频模型的开发,目标是最早于下月发布。

关键关系图

关键玩家
主题

字节跳动正在开发一种实时空间视频生成模型,由创始人张一鸣亲自监督,可能最早于2026年10月发布,正式加入与谷歌DeepMind的Genie和Meta之间的“世界模型”竞赛。

ZH

Zhang Yiming

字节跳动创始人,亲自监督空间视频/世界模型项目的开发。

BY

ByteDance

在Seedance视频生成系统基础上开发该模型,与Meta和Alphabet在世界模型竞赛中竞争,应用场景涵盖机器人、自动驾驶系统、Pico VR和抖音。

ZH

Zhou Chang

字节跳动Seed团队多模态与世界模型研究负责人,2024年从阿里巴巴加入,领导专注于具身智能的视觉-语言-行动(VLA)团队。

FA

Fan Haoqi

前Meta FAIR实验室研究员,现领导字节跳动Seed新成立的世界模型研究组,专注于游戏与娱乐的3D仿真路线。

GO

Google / Alphabet (DeepMind Genie)

明确的基准目标——字节跳动将其世界模型性能与谷歌Genie 3(2025年8月发布)对比,并力争在2026年底实现性能持平。

ME

Meta Platforms

世界模型竞赛中的明确对手;字节跳动基于云端渲染的世界模型对其自身头显硬件投资构成竞争挑战。

事实来源

6 条引用
  1. [1] ByteDance's Real-Time Spatial Video Model Puts Zhang Yiming in the World-Model Race
  2. [2] ByteDance Founder Zhang Yiming Overseeing Real-Time Spatial Video AI Model
  3. [3] Inside ByteDance's World Model Push: Budget, Teams, and Targets
  4. [4] ByteDance's Four AI Priorities in 2026: World Models, Coding, Video, and Monetization
  5. [5] China's Humanoid Robot Backed by ByteDance
  6. [6] ByteDance Adds Safeguards to Seedance AI Amid Hollywood Copyright Complaints

来源文章

Top 3

THE SIGNAL.

Analysts

云端渲染的世界模型不会在画质上超越专用头显,但它把画质问题转嫁给了他人,这对Meta和苹果现有的头显布局构成了尴尬而非紧迫的挑战。

Unnamed market/industry commentary (TheNextWeb)
市场与竞争分析
The Crowd

ByteDance is readying an AI model geared for real-time spatial video generation, taking on Meta and Google

@@business131

JUST IN: ByteDance is reportedly developing an AI “world model” that can generate interactive 3D environments in real time.

@@Polymarket656

ByteDance is working on a world model to compete with Genie. They will be using Seedance as the foundation and are currently devoting a lot of their compute to the project. They aim to launch something in October. Genie is now in closed testing, perhaps news will arrive soon.

@@AndrewCurran_369
Broadcast
Why ByteDance's Seedance Has Triggered a Panic Mode in Hollywood | Vantage with Palki Sharma

Why ByteDance's Seedance Has Triggered a Panic Mode in Hollywood | Vantage with Palki Sharma

Helios - A 14B ByteDance Real-Time Long Video Generation Model Run Locally.

Helios - A 14B ByteDance Real-Time Long Video Generation Model Run Locally.

ByteDance Just Changed Spatial Intelligence Forever — Introducing SpatialTree AI

ByteDance Just Changed Spatial Intelligence Forever — Introducing SpatialTree AI