商汤推出多模态模型SenseNova U1 Pro
TECH

商汤推出多模态模型SenseNova U1 Pro

24+
Signals

战略概览

  • 01.
    2026年7月18日,在上海举办的2026世界人工智能大会(WAIC)上,商汤正式发布了其‘SenseNova U’模型系列的旗舰产品SenseNova U1 Pro。
  • 02.
    U1 Pro 定位为面向长周期任务的交付级原生多模态智能体基础模型,统一了理解、生成与行动能力,标志着从‘内容生成’向‘系统级交付’的转变。
  • 03.
    该模型基于商汤自研的NEO-unify‘内核’架构,统一了语言与视觉表征,打破了理解与生成之间的壁垒。
  • 04.
    U1 Pro 提供四大核心能力:专业设计级图像生成、原生8K分辨率输出、高密度图文/信息图整合且文本渲染错误率低,以及长周期‘智能体生成循环’——可进行数十轮迭代的‘理解-规划-执行-检查-修正’流程。
  • 05.
    作为旗舰演示,U1 Pro 生成了一幅4:1超宽幅中国传统水墨风格山水长卷,描绘了WAIC九年发展历程(2018–2026),包含河流、山脉、地标建筑及密集文本信息。
  • 06.
    U1 Pro 预览版已开启邀请制测试;面向公众的版本预计将于2026年8月发布,届时将开放API接口并公布商业定价。
  • 07.
    开源基础模型SenseNova U1于2026年4月29日以Apache 2.0协议发布,早于U1 Pro,包含两个版本:8B稠密模型(U1-8B-MoT)与混合专家模型(U1-A3B-MoT)。

深度分析

架构之赌:NEO-unify

商汤在U1 Pro上的核心押注是架构层面的创新,而不仅仅是模型规模的扩大。NEO-unify最初由商汤与NTU在2026年3月的研究合作中提出 [1],其核心在于将语言与视觉表征统一于单一‘内核’中,而非在以文本为中心的大模型上外接图像生成模块 [3]。根据商汤在模型GitHub仓库中的架构说明,NEO-unify通过设计‘消除了视觉编码器(VE)和变分自编码器(VAE)’——这是一种从第一性原理出发的重构,而非渐进式修补 [4]。该架构同时支撑了2026年4月发布的开源基础U1模型 [2]与7月发布的旗舰U1 Pro [3],尽管VE/VAE消除的说法特指NEO-unify设计本身,尚未对每个下游变体独立验证。至少在基础模型的采用方面,这一押注似乎已初见成效:2026年5月至6月间,U1的日均图像生成量约增长三倍,截至7月,U1与SenseNova-Skills在GitHub上的总星标数已突破8,000个 [8]

林达华的‘代码vs视觉’论点

商汤首席科学家林达华将U1 Pro的发布置于更宏大的叙事中:他认为多模态而非代码生成,才是AI的下一个竞争主战场。在WAIC 2026期间,他指出‘大量感知细节无法通过语言穷尽’,并明确区分面向机器的接口与面向人类的接口——‘CLI面向机器,而视觉面向人类体验’ [5]。他以一个具体且可验证的例子支撑这一观点:代码模型的前端输出‘一眼就能看出是AI生成的’,在他看来,这暴露了纯文本/代码生成作为真正能力代理的局限性 [5]。林达华在WAIC 2026的论坛上直接向同行阐述了这一观点,与邱锡鹏(复旦)、赵德力(阿里巴巴达摩院)、张祥宇(StepFun)、刘子威(NTU)共同探讨多模态究竟是下一代AI的‘附加功能’还是‘灵魂’ [6]。U1 Pro正是商汤对这一争论的产品回应:其核心能力——8K分辨率、密集信息图文、多轮‘智能体生成循环’——均直指林达华所强调的人类感知维度 [3]

接受度落差:智能体框架 vs 图像生成框架

商汤将U1 Pro定位为‘交付级原生多模态智能体基础模型’,其语言围绕工作流、迭代循环与系统级输出展开 [3]。然而公众的反应却大多将其视为一款直接的图像生成模型。一条广泛传播的X平台帖子将U1 Pro简单描述为‘中国的图像模型……能输出8K图像,显然胜过GPT-Image-2’。在正式发布前约17天(约两个半月),Reddit的r/comfyui板块已出现早期预览中的类似比较:U1 Pro的原生8K输出与GPT-Image-2报道的4K上限对比,并附上一幅单次生成、分辨率超过16,000x24,000像素的电影分镜图,包含40至60个标注面板,涵盖镜头类型、摄像角度与情绪——这一独立于发布前的数据点,印证了商汤的原生8K主张。此外,独立评测者在测试开源基础U1模型(非U1 Pro)时确认其架构确为真正统一的系统——一个基于Qwen3的大模型,拥有单一视觉通路,而非LLM与独立图像生成适配器的拼接。其中xCreate的评测显示,基础U1在信息图与文本渲染任务上的得分为46.6分,领先于GPT-Image、谷歌Nano Banana与SeaDream(截至2026年6月)。这一结果证明了基础模型在特定基准上的真实竞争力,但并未延伸至U1 Pro独有的旗舰功能——真正的原生8K输出与多轮‘智能体生成循环’——这些主张目前仅存在于商汤自身的演示中,尚未有获得U1 Pro实际访问权限的独立评测者进行验证。

WAIC的竞争模式与验证鸿沟

WAIC已成为中国领先AI实验室发布竞争产品的年度竞技场。2025年WAIC上,商汤发布了SenseNova V6.5,声称其在部分基准上优于Gemini 2.5 Pro与Claude 4-Sonnet,同周腾讯推出了其Hunyuan 3D世界模型 [7]。U1 Pro在WAIC 2026的亮相延续了这一竞争模式,但转移了战场:商汤不再推出另一款追逐基准的文本/推理模型,而是将年度赌注押在多模态生成与‘交付’上——这正是林达华公开宣称的继代码之后的下一个主战场 [5][6]。2026年8月承诺推出的公开API与定价 [3],将是检验U1 Pro主张是否能在精心策划的展示之外成立的真正试金石。

历史背景

在WAIC 2025上,商汤发布了SenseNova V6.5,声称其在部分基准上优于Gemini 2.5 Pro与Claude 4-Sonnet,而腾讯同期推出了其Hunyuan 3D世界模型——确立了WAIC上竞争对手同步发布的模式,U1 Pro在2026年的亮相延续了这一传统。
商汤与NTU合作,在一项研究论文中首次提出了NEO-unify原生统一多模态范式。
商汤以Apache 2.0协议完全开源了基础SenseNova U1模型系列,包含8B稠密版本(U1-8B-MoT)与混合专家版本(U1-A3B-MoT)。两者均基于NEO-unify架构,商汤自身的架构说明将其描述为通过设计消除了独立的视觉编码器与变分自编码器组件。
SenseNova U1 Pro于WAIC 2026正式发布,作为SenseNova U系列的旗舰产品,标志着从‘内容生成’向‘系统级交付’的转变。

关键关系图

关键玩家
主题

商汤推出多模态模型SenseNova U1 Pro

SE

SenseTime (商汤科技)

Developer and publisher of SenseNova U1 Pro; positions the model as its flagship native multimodal agent foundation, competing directly on multimodal generation and delivery capability against domestic and international rivals.

LI

Lin Dahua (林达华), Chief Scientist, SenseTime

Public face of SenseTime's multimodal strategy; hosted the WAIC 2026 foundation-model architecture forum and argued in a dedicated interview that multimodality is the next major battleground after AI coding.

TE

Tencent

Unveiled its own new AI models (e.g., Hunyuan 3D World Model) at the prior year's WAIC Shanghai event, illustrating the competitive dynamic among Chinese tech firms that SenseTime's U1 Pro launch continues.

QI

Qiu Xipeng (Fudan University), Zhao Deli (Alibaba DAMO Academy), Zhang Xiangyu (StepFun), Liu Ziwei (NTU)

Co-panelists with Lin Dahua at the WAIC 2026 base-model architecture forum, debating multimodality's role in next-generation AI alongside SenseTime's product push.

事实来源

8 条引用
  1. [1] NEO-unify: SenseTime's Native Unified Multimodal Architecture
  2. [2] SenseTime Open-Sources SenseNova U1 Native Multimodal Model
  3. [3] SenseTime Unveils SenseNova U1 Pro Flagship Multimodal Model
  4. [4] SenseNova-U1 GitHub Repository
  5. [5] Lin Dahua Interview: Multimodality Is the Next Battleground After AI Coding
  6. [6] WAIC 2026 Chief Scientist Forum on Foundation Model Architecture
  7. [7] WAIC Shanghai: Tencent, SenseTime Launch New AI Models, Stir Industry Rivalry
  8. [8] SenseTime's U1 Pro Scroll Demo and Base-Model Adoption Figures

来源文章

Top 3

THE SIGNAL.

Analysts

认为多模态是继AI编码之后的下一个主要竞争战场,因为视觉能够捕捉语言无法表达的感知细节与人类体验。

Lin Dahua (林达华)
Chief Scientist, SenseTime

区分面向机器的接口(如编码/CLI)与面向人类的视觉,将多模态生成定位为根本上关乎人类体验,而非机器执行。

Lin Dahua (林达华)
Chief Scientist, SenseTime

指出当前以编码为中心的模型存在明显局限——AI生成的前端输出一眼即可识别——以此作为转向投资多模态能力的动因。

Lin Dahua (林达华)
Chief Scientist, SenseTime
The Crowd

🚨 Update: U1 Pro, the Chinese image model I talked about last month which can output 8K images and apparently beats GPT Image 2, is released today and they have a blog out

@@Lentils801994

SenseNova-U1 Pro is coming, possible ComfyUI integration in the future?

@u/Right_Hunt679012
Broadcast
SenseNova U1 First Test – A New Kind of Open Source Image Model!

SenseNova U1 First Test – A New Kind of Open Source Image Model!

SenseNovaU1: The Open-Source Model That Thinks in Images

SenseNovaU1: The Open-Source Model That Thinks in Images

New #1 Open Source Image AI? | SenseNova-U1 Mac & Windows Guide & TESTS

New #1 Open Source Image AI? | SenseNova-U1 Mac & Windows Guide & TESTS

商汤推出多模态模型SenseNova U1 Pro — AI 新闻 | Agentic Brew