商汤科技 SenseNova U1.5-Lite-Preview 开源发布
TECH

商汤科技 SenseNova U1.5-Lite-Preview 开源发布

26+
Signals

战略概览

  • 01.
    2026年8月3日,商汤科技开源了 SenseNova U1.5-Lite-Preview,这是一款基于其NEO-unify架构构建的轻量级8B-MoT统一多模态模型,该架构在一个表示空间内联合建模语言、视觉语义和像素生成。
  • 02.
    与2026年4月发布的原始SenseNova U1模型相比,该模型新增了原生4K图像输出、更精细的局部纹理与材质表现、更复杂的布局生成能力,以及在编辑过程中更稳定的主体保持性。
  • 03.
    模型权重已通过Apache 2.0许可证在GitHub、Hugging Face和ModelScope上免费提供,并在unify.light-ai.top托管了一个免费的浏览器版演示。
  • 04.
    商汤科技将此次发布定位为其高效架构能够匹敌Qwen-Image 2.0 Pro和Seedream 4.5等更大闭源模型的证明,而功能更强的商业版本U1 Pro目前仍处于闭源测试阶段。

架构之赌:为何商汤科技移除了编码器

SenseNova U1.5-Lite-Preview 最具决定性的设计选择并非参数数量——而是商汤科技删除的部分。该模型运行于商汤自研的NEO-unify架构之上,彻底摒弃了大多数多模态生成系统依赖的视觉编码器(VE)和变分自编码器(VAE),转而将像素与文字处理统一在一个共享的表示空间中 [1]。商汤科技解释称,拼接独立的编码器用于理解与生成会在每次编解码循环中引入信息损失;移除这一转换步骤旨在使像素与文字信息始终保持深层且内在的相关性 [1]

‘8B-MoT’这一名称容易被误解为一个80亿参数的模型。实际上它指的是两个约80亿参数的堆栈——一个用于理解,一个用于生成——以混合Transformer(Mixture-of-Transformers)方式运行 [1],简单相加后总参数量接近160亿,但每个部分仍保持紧凑结构。

在生成侧,U1.5引入了‘Patch-Joint Reconstruction’:使用ConvDecoder进行渐进式空间重建,取代大多数扩散类图像生成器中逐块独立预测的方式,商汤称此举可减少早期输出中可见的网格伪影 [2]。编辑功能也从附加特性升级为原生支持——模型可通过掩码、边界框和视觉标记实现区域可控编辑,并能在单次推理中融合多个参考图像生成新图 [2]

基准跃升背后的提示技巧

纸面数据显示,U1.5-Lite-Preview 相较四个月前发布的原始U1有明显提升。商汤科技提供的对比显示,其Qwen-Image-Bench得分从47.14升至55.20,ImgEdit-Bench从3.90升至4.37,GEdit-Bench分数则从7.47升至8.17(英文)和7.42升至8.05(中文)[3]

其中Qwen-Image-Bench分数从约50跃升至55的部分,归功于一项名为‘SenseNova Image PE Skill’(Prompt Enhance,提示增强)的功能,该功能在生成前将简短、模糊的创意请求重写为结构化、详细的提示词 [2]。这一点值得强调,因为它意味着显著的性能提升来自提示层技巧而非纯粹的架构改进——实践中虽有用,但也使得‘模型本身变强’这一说法难以进行公平比较。

现实检验:早期测试者的观察与评分表不符

商汤科技的基准表格描绘了一条清晰、线性的进步曲线,但最早的实际体验反馈——集中在Reddit的AI图像社区——却呈现出更混乱的画面。多位在Hugging Face Space试用免费演示版的早期用户报告称,原生4K输出看起来模糊或软化,而非真正锐利,甚至出现一种流行应对方案:先将图像下采样至1–2K分辨率,再通过锐化超分工具处理,而非直接信任原始4K文件。其他用户还指出了具体失败案例,包括解剖学错误(如多出肢体)以及至少一位评论者直接斥为‘AI垃圾’的输出结果;另有用户推测(无证据)展示样例可能由其他更大模型生成,而非U1.5本身。

这些现象并未直接否定商汤科技的基准数据,社区讨论也注意到编辑操作能准确局限在指定区域而不影响图像其余部分。但这提醒我们,‘preview’一词在模型名称中确有实质意义:商汤官方披露的限制包括对模糊提示生成意外文本、小字号或密集文本错误、复杂布局遵循不完整、小脸小手不稳定,以及多轮编辑中的漂移问题 [2]。评测集与社区自由测试之间的差距,正是这些已知限制所预示的结果。

商业逻辑:为何‘Lite’版开源而‘Pro’版不开放

将U1.5-Lite-Preview作为免费、Apache 2.0许可的下载版本公开,同时将功能更强的‘U1 Pro’——被描述为面向专业创作者和企业用户的交付级模型——保留在闭源测试中,背后存在明确的战略意图 [3][4]。商汤科技将开源发布视为效率的证明,而非单纯的慷慨之举:公司宣称U1/U1.5的图像质量可媲美Qwen-Image 2.0 Pro和Seedream 4.5等更大商业模型,尽管开源版本体积更小 [5]。媒体报道也将此次发布置于更广泛的行业叙事中——即从纯参数规模竞争转向效率、细粒度控制和实用可用性的新阶段 [4]

综合来看,这一发布顺序显得刻意为之:先开源轻量预览版以赢得开发者心智,公开验证架构效率主张,并收集真实世界压力测试反馈——包括Reddit已暴露的缺陷——再向付费企业客户推出商业级U1 Pro。

历史背景

商汤科技开发了NEO-unify原生统一多模态架构,该架构后来成为整个SenseNova U系列的基础。
商汤科技发布并完全开源了原始SenseNova U1模型,采用Apache 2.0许可,定位为2026年WAIC期间推出的‘日日新 SenseNova U’系列旗舰产品。
商汤科技在正式公开宣布前,率先在Hugging Face发布了SenseNova-U1.5-8B-MoT-Preview检查点。
商汤科技正式宣布在GitHub、Hugging Face和ModelScope上开源SenseNova U1.5-Lite-Preview,定位为针对4K生成和编辑稳定性优化的U1系统性迭代。

关键关系图

关键玩家
主题

商汤科技 SenseNova U1.5-Lite-Preview 开源发布

SE

SenseTime (商汤科技)

SenseNova U1.5-Lite-Preview及底层NEO-unify架构的开发者与发布方;通过开源模型扩大开发者采用率,并在商业版‘U1 Pro’发布前展示技术领导力。

HU

Hugging Face

托管SenseNova-U1.5-8B-MoT-Preview的模型权重、模型卡和README,使全球开发者可直接访问检查点。

GI

GitHub / OpenSenseNova organization

托管开源代码仓库(OpenSenseNova/SenseNova-U1),包含U1/U1.5系列的推理脚本、文档和基准结果。

MO

ModelScope (魔搭社区)

中国本土模型托管平台,为国内开发者镜像发布SenseNova U1.5-Lite-Preview。

QW

Qwen-Image / Seedream (competing model families)

被商汤科技用作对比基准;商汤声称U1/U1.5的图像质量可媲美Qwen-Image 2.0 Pro和Seedream 4.5,尽管开源版本体积更小。

事实来源

5 条引用
  1. [1] OpenSenseNova/SenseNova-U1 GitHub Repository
  2. [2] SenseNova-U1.5-8B-MoT-Preview Model Card
  3. [3] 商汤科技开源轻量级统一多模态模型预览版本SenseNova U1.5-Lite-Preview
  4. [4] SenseTime SenseNova U1.5-Lite-Preview Coverage (ITBear)
  5. [5] SenseNova U1 Research (SenseTime)

来源文章

Top 5

THE SIGNAL.

Analysts
The Crowd

𝗜𝗻𝘁𝗿𝗼𝗱𝘂𝗰𝗶𝗻𝗴 𝗗𝗲𝗻𝘀𝗲𝗡𝗼𝘃𝗮 𝗨𝟭.𝟬-𝗟𝗶𝘁𝗲-𝗣𝗿𝗲𝘃𝗶𝗲𝘄. An early open-source preview of our lightweight, natively unified multimodal model — built on the native NEO-Unify architecture to natively understand, reason, generate, and edit across modalities. 𝘄𝘪𝘵𝘩 [text truncated in UI, "Show more"]

@@SenseTime_AI20

SenseNova U1.5-Lite-Preview, an open-source lightweight multimodal model with 8B MoT parameters and NEO-unify architecture, supports native 4K image generation, fine textures, accurate Chinese/English text rendering, and stable image editing. It enhances long-form natural [truncated, "Show more"]

@@Awesome_AI_News0

Article: SenseTime Open-Sources SenseNova U1.5-Lite-Preview: Native 4K Direct Output, 8B-MoT Lightweight Unified [model]. SenseTime releases SenseNova U1.5-Lite-Preview with NEO-Unify architecture, native 4K generation, and precise editing that replicates design frameworks across infographics and creative content....

@@thePandaily0

SenseNova U1.5 Lite Preview is out: 4K generation, better text rendering, and native image editing

@u/Ok_Dependent905068
Broadcast