HiDream-O1-Embodied 世界模型发布
TECH

HiDream-O1-Embodied 世界模型发布

28+
Signals

战略概览

  • 01.
    智象未来(HiDream.ai)于2026年9月7日正式发布其具身世界模型 HiDream-O1-Embodied。
  • 02.
    该模型在标准化具身AI评估平台 RoboColiseum 的鲁棒性(抗干扰适应)子排行榜上排名第一,得分为0.692——这是该基准测试迄今最佳成绩。
  • 03.
    公司将此次发布视为打通图像、视频、3D与运动模态之间技术闭环的标志,标志着其‘原生全模态’战略正从模拟世界迈向真实世界部署。
  • 04.
    该模型的一项关键架构主张是,其功能兼具‘应试者’与‘出题者’,能自主生成针对性训练样本,构建数据与模型协同增长的飞轮。

深度分析

一个能自我批改作业的模型

HiDream-O1-Embodied 发布中最不寻常的设计主张并非其排行榜得分,而是实现该成绩的机制。报道指出,该模型同时扮演“应试者”与“出题者”角色,主动根据自身需求生成针对性训练样本,形成数据驱动模型增长的飞轮 [1]。实际上,这意味着系统不仅接受固定基准测试的评估,更被描述为能够识别自身薄弱环节,并合成新的训练场景加以弥补——原则上,每一次抗干扰适应测试的失败都会转化为新的训练信号,而非陷入死胡同。

据称,这一飞轮建立在三大技术支柱之上:超越关键词匹配的语义级语言理解、避免单点失效的多视角视觉感知,以及在刻意设置的不完美现实条件(如光照变化、遮挡和信号噪声)下的训练 [1]。其回报至少在纸面上体现为0.692的得分,使 HiDream-O1-Embodied 登顶 RoboColiseum 鲁棒性子排行榜,这一结果也在其他关于同一发布的报道中得到呼应 [1][2]

三个模型,同一架构,一年内完成

HiDream-O1-Embodied 并非孤立发布——它是基于统一变换器(Unified Transformer, UiT)架构快速推出的第三款模型。2026年5月,智象未来开源了图像模型 HiDream-O1-Image;8月24日推出交互式3D世界模型 HiDream-O1-World;9月7日则发布了具身模型,完成闭环 [1]。CTO 姚霆将背后的理念归结为架构层面:真正的世界模型基础需要多模态表达、因果推理与物理世界构建三者协同,而公司称其原生全模态设计从一开始就旨在统一图像、视频、3D乃至运动的表征 [1]

前代模型本身即是这一理念的证明。HiDream-O1-World 在发布时即以80.9分登顶 WBench 排行榜的 Navi 分类,并被 ECCV 2026 接收,这些独立第三方指标表明,该架构在具身版本测试前已具备泛化能力 [1][5]。综合来看,这一发布节奏更像是一种架构从像素到3D场景再到物理行动的系统性演进,而非三个独立产品。

在机器人淘金热中卖铲子

智象未来并不制造机器人——它将自己定位为机器人制造商所依赖的基础设施与数据层,这一立场在报道中十分明确:公司将自身与 ROBOTERA、LimX Dynamics 等人形机器人厂商并列,作为上游技术供应商,而非竞争对手 [8]。这一定位很大程度上依托于2026年3月与动捕公司 Noitom Robotics 的合作,据称,智象的生成视频技术可将 Noitom 的高精度动捕数据扩展约100倍,同时保留物理约束 [4]

Noitom 首席科学家韩磊直言不讳地指出,具身智能本质上是“一个‘数据驱动的系统工程挑战’”,而非纯粹的算法问题 [4]。这种说法也暗含对行业其他做法的批评——姚霆曾另指出,标准视频生成模型优化的是场景的视觉效果,而非其是否符合物理规律,而这正是智象声称其物理一致性生成视频旨在填补的空白 [4]

基准测试的智商提升对机器人意味着什么?

创始人梅涛提出了一个直指当前AI热潮要害的观点:2026年,领先模型的基准‘智商’分数从约130升至约140,但这一提升几乎无法说明系统能否在非受控环境中可靠执行物理任务 [3]。他的理由是:“没有高质量的世界模型,物理模拟无法接近真实世界,使得具身AI的数据飞轮难以真正激活” [3]——换言之,认知类基准与物理可靠性衡量的是两回事,而对一个在杂乱厨房中拿杯子的机器人而言,只有后者才真正重要。

这正是 RoboColiseum 旨在填补的空白:它被设计为一个标准化、多维度的评估框架,其模拟得分被明确设计为“与真实机器性能高度一致” [1]。按此逻辑,HiDream-O1-Embodied 的0.692抗干扰适应得分,比聊天机器人智商测试更具意义——尽管值得注意的是,这种‘与真实机器一致’的说法源自平台自身表述,而非独立审计。

一家独角兽的豪赌,以及尚在酝酿中的反响

具身模型的发布背后是真金白银的支持:2026年7月,智象未来完成15亿元人民币的C轮融资,累计融资额突破21亿元人民币,成为当年六家融资超10亿元人民币的中国具身机器人公司之一 [6][7]。如此规模的投资正是图像—世界—具身快速发布节奏的财务背景——这是一场对单一统一架构的重金押注,而非草根研究演示。

相比之下,公众反应目前几乎为零。社交讨论仅限于智象未来的官方账号及少数AI新闻聚合账号转发公告,互动量个位数,无自发讨论、质疑或反驳——对于一篇发布仅数小时的新闻而言并不意外。唯一提及 HiDream-O1 系列的YouTube视频聚焦于更早的 World 模型,而非 Embodied,且仅有58次观看。这些本身并非警示信号,仅说明该模型的主张——包括其鲁棒性得分——尚未经过外界声音的压力测试。

历史背景

公司由前京东副总裁梅涛在北京创立,团队成员来自微软、腾讯、华为和字节跳动。
两家公司宣布建立战略合作关系,结合动作捕捉与生成视频技术,以解决具身AI的数据稀缺问题。
开源了基于统一变换器(UiT)架构构建的图像生成基础模型 HiDream-O1-Image(8B),后在全球文本到图像排行榜上位列开源权重第一。
完成15亿元人民币C轮融资,正式成为AI独角兽。
在世界机器人大会上发布原生多模态交互式世界模型 HiDream-O1-World;发布即登顶 WBench 排行榜 Navi 分类,并被 ECCV 2026 接收。
发布 HiDream-O1-Embodied,该模型以0.692分登顶 RoboColiseum 鲁棒性(抗干扰适应)子排行榜。

关键关系图

关键玩家
主题

HiDream-O1-Embodied 世界模型发布

HI

HiDream.ai (智象未来)

Beijing-based multimodal AI company, founded 2023, that builds the HiDream-O1 model family (Image, World, Embodied) on its self-developed UiT (Unified Transformer) architecture, moving from simulated-world modeling toward real-world embodied deployment.

YA

Yao Ting (姚霆), Co-founder & CTO of HiDream.ai

Public face of the launch, framing HiDream-O1-Embodied as the milestone that moves the company's world-model strategy from 'simulated world' to 'real world'; previously led billion-scale image search and logistics robotic-arm vision systems at JD.com.

ME

Mei Tao (梅涛), Founder/CEO of HiDream.ai

Sets the strategy positioning world models as the 'cognitive hub' linking data, world models, agents, and embodied execution, arguing embodied AI's data flywheel cannot spin without a high-quality world model.

NO

Noitom Robotics (诺亦腾)

Motion-capture and physical-validation partner supplying high-precision mocap data that HiDream.ai's generative video technology expands roughly 100x while preserving physics constraints, feeding embodied-AI training data.

RO

RoboColiseum

Third-party embodied-AI evaluation platform, open to universities and research institutions worldwide, whose disturbance-adaptation sub-leaderboard ranking gives HiDream-O1-Embodied external, comparative validation.

事实来源

8 条引用
  1. [1] 智象未来发布具身世界模型HiDream-O1-Embodied,实现原生全模态技术战略闭环
  2. [2] HiDream-O1-Embodied登顶RoboColiseum鲁棒性榜单
  3. [3] 梅涛谈世界模型与具身智能数据飞轮
  4. [4] HiDream.ai and Noitom Robotics Announce Embodied AI Data Partnership
  5. [5] HiDream.ai Advances Its Native Omni-Modal Roadmap With HiDream-O1-World
  6. [6] 智象未来完成15亿元C轮融资
  7. [7] HiDream.ai Completes New Financing Round Exceeding 500 Million Yuan
  8. [8] HiDream.ai Positions Itself as Upstream Data Supplier to Embodied Robotics

来源文章

Top 3

THE SIGNAL.

Analysts

认为完整的世界模型基础需要三大能力同时具备——全模态表达、因果推理与物理世界构建,并将 HiDream-O1-Embodied 的发布视为公司战略从‘模拟世界’迈向‘真实世界’的关键里程碑。他指出:“我们相信,围绕真实世界的表达、理解和生成,构建同时具备全模态表达、因果推演与物理世界构建三大核心能力,才能建立完整的世界模型基座...HiDream-O1-Embodied的发布,是这一技术战略从‘模拟世界’迈向‘真实世界’的关键里程碑。”

Yao Ting (姚霆)
联合创始人兼CTO,HiDream.ai

另批评标准视频生成模型优先考虑视觉美学而非物理准确性,称“标准视频生成模型往往优先考虑美学效果而非物理准确性”——这正是智象聚焦于物理一致性生成视频作为具身训练数据的动机所在。

Yao Ting (姚霆)
联合创始人兼CTO,HiDream.ai

主张没有高质量的世界模型,物理模拟无法接近真实世界保真度,因此具身AI的数据飞轮难以真正激活:“没有高质量的世界模型,物理模拟就无法逼近真实世界,这使得具身AI的数据飞轮难以真正启动。”同时警示,领先AI模型基准‘智商’分数的上升并不等同于可靠的物理任务执行能力。

Mei Tao (梅涛)
创始人兼CEO,HiDream.ai

将具身智能从根本上视为数据工程问题而非纯粹算法问题,称之为“一项‘数据驱动的系统工程挑战’”——这正是 Noitom 与智象数据合作的底层前提。

Han Lei (韩磊)
首席科学家兼联合创始人,Noitom Robotics
The Crowd

HiDream.ai just launched HiDream-O1-Embodied, our new embodied world model — and it's already #1. Topped the Robustness leaderboard on RoboColiseum with a score of 0.692, outperforming the field in real-world unpredictability tests. Embodied AI just got a lot more...

@@HiDream_AI3

🤖 智象发布具身世界模型 HiDream-O1-Embodied,实现全模态技术闭环 Zhixiang unveils HiDream-O1-Embodied, an embodied world model achieving full-modal tech integration techub.news

@@Techub_News0

Artificial intelligence is finally stepping out of the screen and into the physical world. Zhixiang Future has just launched HiDream-O1-Embodied, a groundbreaking system that unifies text, images, video, and physical actions into a single native architecture. This completely...

@@AiquestAcademy0
Broadcast
HiDream O1 World Interactive World Model

HiDream O1 World Interactive World Model