拆掉视觉编码器和 VAE:商汤这套 8B 多模态模型改了什么
TL;DR 速览
- 事件:商汤发布SenseNova U1.5技术报告,一个8B-MoT 架构的原生统一多模态模型,不需要外部视觉编码器,也不需要 VAE,即可理解、推理和生成视觉内容
- 接口改法:用保持图像块之间空间连贯性的重建方式来改进视觉接口——这是"拆掉编码器"之后仍能理解图像的关键
- 后训练拆成四路专家:视觉美学、双语文字渲染、信息图生成、图像编辑,各自优化后再用多专家同策略蒸馏整合
- 训练规模:精选生成与编辑数据、改进任务建模、结构化提示增强,最高 4K 原生分辨率
- 开源范围:监督微调、强化学习、同策略蒸馏的训练代码;注意仓库
OpenSenseNova/SenseNova-U1创建于 2026-04-17,不是新项目
商汤发布了 SenseNova U1.5 的技术报告。这是一个 8B-MoT 架构的原生统一多模态模型,核心定位是理解、推理和生成视觉内容都用同一套结构完成,不依赖外部的视觉编码器,也不需要变分自编码器(VAE)。配套开放的包括监督微调、强化学习和同策略蒸馏在内的训练代码。
多模态领域这两年有一条明显的技术分叉:一类做法是"拼接式"——语言模型主干加一个视觉编码器,中间再加投影层把视觉特征转成主干能吃的表示;另一类做法是追求"原生统一",从一开始就让视觉和文本在同一个模型结构里表达。SenseNova U1.5 走的是后一条路,而这份报告里最值得拆的是它怎么处理"没有视觉编码器之后,图像表示从哪来"这个问题。
一、为什么"原生统一"要拆掉视觉编码器和 VAE
先说清这两个组件各自在干什么,以及拆掉它们的动机。
视觉编码器(常见的是 CLIP 或 SigLIP 这类)负责把图像转成一组特征向量。它的优点是成熟、稳定、有大量预训练权重可用;但它的输出是为"理解"服务的抽象表示——它被训练来对齐图文,而不是为了精确重建像素。
VAE负责在像素空间和潜在空间之间来回转换,是扩散类生成模型的标准配件。它带来的是压缩效率,代价是在编解码过程中丢失细节——这也是为什么很多生成模型需要额外的精修环节。
两者组合起来的结果是:理解和生成走的是两条不同的表示通道。模型"看懂"的图像和它能"画出"的图像,中间隔着一层翻译。这在需要精确编辑、或者要求生成结果与参考图严格一致的任务上会出问题。
原生统一路线的目标就是让这两条通道合并。报告中的表述是:无需外部视觉编码器和 VAE,即可理解、推理和生成视觉内容。而要做到这一点,必须自己解决"图像块该怎么表示"这个问题。
二、关键的一步:保持图像块空间连贯性的重建
报告里对视觉接口的说明只有一句,但信息量很大:通过保持图像块之间空间连贯性的重建方式改进视觉接口。
拆开理解这句话:
"图像块"意味着模型仍然是把图像切块处理。这一点和主流做法一致——把图像切成 patch 序列,和文本 token 一起进模型。
"空间连贯性"是重建时的约束。如果每个图像块被独立地重建,块与块之间的边界会出现不连续——视觉上表现为拼接痕迹、纹理突变、网格感。而这些痕迹会直接伤害后续的编辑能力:模型学到的表示里,每个块是孤立的,它就无法理解"改这里会影响旁边的区域"。
"重建方式"说明接口本身是被训练出来的。没有外部编码器提供现成表示,所以视觉接口必须用一个重建目标来自己学——而重建目标里加不加空间连贯性约束,决定了学到的表示是"能拼回图像"还是"真正理解图像结构"。
这一条也解释了为什么报告后面会特意强调"保持主体身份特征、几何结构与非编辑区域的一致性"。这三个一致性要求,本质上都是空间连贯性约束在任务层面的体现。
三、后训练:四路专家,再蒸馏回一个
后训练策略是这份报告里工程含量最高的部分。它的结构是先分工、再合并:
第一,分别优化四类专家—— 视觉美学、双语文字渲染、信息图生成、图像编辑。
这四类都在标准的多模态训练里容易被平均掉,但各自有不同的能力侧重:视觉美学偏主观质量,双语文字渲染要求字形准确(这一点对中文尤其难),信息图生成需要把结构化信息转成图形布局,图像编辑则要求局部修改不影响其他区域。用通用目标一起训,很容易出现"每项都及格、没有一项能打"的结果。
第二,用多专家同策略蒸馏把它们整合回一个模型。
同策略蒸馏(on-policy distillation)的要点在于:让学生模型生成自己的输出,由教师模型对这些学生自己产生的序列给出监督信号,而不是只学教师的输出分布。相比离线蒸馏,它对"学生实际会走到的状态"覆盖得更好——对生成类任务,这一点尤其重要,因为生成过程中任何一步的偏差都会累积。
这套"分专家 + 蒸馏合并"的路径,和前面 MiMo 那篇讲的 RL 工程是同一个思路的两个方向:一个是在训练信号上做精细化分工,一个是在能力维度上做精细化分工,共同点是承认"一个通用目标训不出全部能力"。
我处理这类"多能力整合"的方案时会记两件事:分了几路、用什么方式合回去。分开容易,合回去不损失才是难点。墨衍 里我把素材、选题和分发记录攒在一处,核对这类方案细节时不用来回翻文件。
四、训练配方里的四个变量
报告点到的训练侧改动,逐个看:
数据:精选的生成与编辑数据。生成和编辑被当成两类数据分别准备,这与后训练里的专家拆分是对应的。
任务建模:官方称改进了任务建模。这一项在报告里没有展开细节,但从结果看,它对应的是"如何把不同类型的视觉任务统一成同一套输入输出契约"——统一建模做得不好,多专家蒸馏就会失去共同基础。
结构化提示增强:用结构化的方式增强提示。这对应着信息图生成这类任务的需求——排版、层级、布局信息必须能被精确表达,纯自然语言描述容易产生歧义。
分辨率:最高 4K 原生分辨率训练。分辨率的提升不只是"更清晰",它改变了模型能处理的信息密度上限——海报、信息图、细粒度文字排版这些场景,本质上是高分辨率任务。
五、一个值得单独记的泛化现象
报告里有一条"意外收获"式的结论:尽管生成训练数据对结构化格式的覆盖有限,模型仍然能有效泛化到长而复杂的结构化视觉指令,官方据此认为多模态理解能力能够迁移至视觉规划与创作。
这个现象的工程意义在于:它说明理解和生成共用一个表示空间之后,"看懂复杂结构"和"按复杂结构生成"变成了同一件事的两个方向。如果两者是分离的(编码器 + VAE 的拼接式结构),这种迁移就不容易发生——因为结构信息在两条通道里被各自压缩过一遍。
对使用者的实际影响:处理"复杂布局要求"的提示词时,这类原生统一模型的表现可能明显好于拼接式模型,而且对提示的结构化程度更宽容。
六、怎么用,以及该观察什么
获取方式:模型与代码在 GitHub 的OpenSenseNova/SenseNova-U1(Apache 2.0),技术报告在 Hugging Face Papers,在线体验走商汤小浣熊。需要注意这个仓库创建于 2026 年 4 月,U1.5 是在既有项目上的版本推进,不是全新开源——引用时不要写成"刚发布的新仓库"。
如果你的场景是这几类,值得试:需要中文文字准确渲染的图片生成(双语文字渲染是四路专家之一)、信息图与海报类内容、需要局部编辑且要求非编辑区域不变的任务。
观察点有三个:
第一,编辑任务的一致性实测。"保持主体身份特征、几何结构与非编辑区域一致性"是官方口径,这类指标最需要在真实素材上验证——尤其是多轮编辑之后的一致性衰减。
第二,4K 原生分辨率的实际收益与成本。高分辨率训练带来的推理开销是实打实的,要算清"哪些任务真的需要 4K"。
第三,蒸馏后的能力保留率。四路专家整合回一个模型时,各方向的损失分布是这套方案的关键指标——和前面三值量化那篇的逻辑一样,平均分掩盖不了分项差异。
最后,这份报告最值得学的不是某个数字,而是那条路径选择:当"拼接式"架构在编辑和一致性上遇到天花板时,回去解决"表示从哪来"这个更底层的问题。这类决定通常不便宜,但它决定了后面的能力上限。