架构之赌:为何商汤科技移除了编码器
SenseNova U1.5-Lite-Preview 最具决定性的设计选择并非参数数量——而是商汤科技删除的部分。该模型运行于商汤自研的NEO-unify架构之上,彻底摒弃了大多数多模态生成系统依赖的视觉编码器(VE)和变分自编码器(VAE),转而将像素与文字处理统一在一个共享的表示空间中 [1]。商汤科技解释称,拼接独立的编码器用于理解与生成会在每次编解码循环中引入信息损失;移除这一转换步骤旨在使像素与文字信息始终保持深层且内在的相关性 [1]。
‘8B-MoT’这一名称容易被误解为一个80亿参数的模型。实际上它指的是两个约80亿参数的堆栈——一个用于理解,一个用于生成——以混合Transformer(Mixture-of-Transformers)方式运行 [1],简单相加后总参数量接近160亿,但每个部分仍保持紧凑结构。
在生成侧,U1.5引入了‘Patch-Joint Reconstruction’:使用ConvDecoder进行渐进式空间重建,取代大多数扩散类图像生成器中逐块独立预测的方式,商汤称此举可减少早期输出中可见的网格伪影 [2]。编辑功能也从附加特性升级为原生支持——模型可通过掩码、边界框和视觉标记实现区域可控编辑,并能在单次推理中融合多个参考图像生成新图 [2]。