大家好,我是PaperAgent,不是Agent!
这两天刷 alphaXiv,好家伙,DeepSeek 带着最新的 V4.1-Flash 在 KV 缓存压缩上大杀四方,霸榜。往下滑,旁边同一天发的 SenseNova-U1.5,也是国产,仔细扒完技术报告,我直接愣住了。
商汤日日新 SenseNova这波很能打:8B-MoT、统一、4K、原生多模态。
它不是把理解模型和生成模型硬拼在一起,而是从像素和词出发,在一条共享视觉基座上,把看、想、画、改全打通。
更离谱的是,这还是个 8B-MoT 模型。说实话,真有点惊艳。
模型已开源,官方宣布将开源训练代码。
https://arxiv.org/abs/2609.11929
GitHub:https://github.com/OpenSenseNova/SenseNova-U1
HuggingFace:https://huggingface.co/collections/sensenova/sensenova-u15
接下来,我们一起详细聊聊。
01 过去多模态的老路子翻篇了
传统多模态系统有个老毛病:理解走一条路,生成走另一条路。
传统多模态系统通常采用两套视觉表征路径:理解图像时依赖预训练视觉编码器,将图像转换为语义特征;生成图像时则通常借助 VAE 将像素映射到更紧凑的潜空间,并在潜空间中完成生成建模。一个偏向语义理解,一个偏向视觉保真,两套表征空间之间存在割裂。
SenseNova-U1 之前已经用 NEO-unify 证明过:不靠外部视觉编码器、不靠 VAE,也能做原生统一模型。但 SenseNova-U1 有个问题:每个视觉 token 独立重建 RGB patch,到了高分辨率,接缝、纹理断裂、几何不一致就会越来越明显。
而 SenseNova-U1.5,第一刀就砍在这里。
02 从独立拼图到空间联合重建
SenseNova-U1.5 不再让每个视觉 token 单独预测像素,而是先把 token 投到二维特征场,再通过 3×3 卷积和 Pixel Shuffle 逐级上采样,上采样因子是 2、2、8。
这就是说:相邻区域在像素最终确定前,能先交换信息。颜色、纹理、几何不再各画各的,而是一起解。
它依然保持极高压缩率:每 32×32 像素区域只对应一个视觉 token。但输出端不再是 patch-wise MLP,而是轻量空间解码器。这样既保留紧凑序列的效率,又显著提升空间连贯性,还能原生支持最高 4K 分辨率。
03 MoT:共享注意力,但保留专业分工
SenseNova-U1.5 沿用原生 Mixture-of-Transformers设计。
干净图文上下文和噪声视觉状态,被交错放进同一个序列。文本 token 只做因果注意力;干净图像块内部双向交互;生成 token 也能双向看自己所在的图像块,并访问前面所有干净多模态上下文。反向路径被遮住,防止干净表示被随机生成状态污染。
但统一不等于全都共享。理解流和生成流仍然保留各自的注意力投影、归一化层和前馈模块,按 token 类型动态路由。共享注意力是跨流通信接口,专用参数保留感知和合成的不同计算需求。
训练目标也是三合一的:
自回归语言建模,负责语义理解和多模态推理; 像素空间 flow matching,直接在 RGB 空间学噪声到图像; LPIPS 感知监督,约束结构一致性和局部视觉连贯。
04 训练:先专精,再统一
SenseNova-U1.5 的后训练策略很有意思:不是把所有任务塞进一个奖励里联合优化,而是“先专精,再统一”。
Stage 1 是生成预训练,分三阶段:180K 步、100K 步、185K 步。分辨率从 256²–1024² 一路推到 512²–4096²,并引入图像编辑和交错生成。
Stage 2 是统一 mid-training,80K 步。数据配比大致是:30% 理解数据、40% 文生图、20% 图像编辑、10% 交错数据。
Stage 3 是统一 SFT,10.5K 步,继续强化指令跟随。
Stage 4 是四专家强化学习,分别针对:
视觉美学; 双语文字渲染; 信息图生成; 图像编辑。
美学专家用 HPSv3++ 和 OCR 奖励交替;OCR 专家用 PaddleOCR 做多集合 IoU;编辑专家用五维奖励,最后取最小值,专门暴露最弱项,防止某一项高分掩盖关键错误;信息图专家则先 OCR 后 DPO,再交替文本和美学奖励。
Stage 5 是多专家 on-policy distillation。学生模型先自己生成轨迹,再按能力硬路由到对应的冻结专家,用速度场蒸馏把四个专家的能力合并进一个统一模型。800 个优化步,每域 25,600 个样本,冻结理解分支、最后三个生成层和生成输出头。
这套先专精,再统一的思路,比一锅乱炖的联合奖励优化靠谱得多。
05 数据:不是小打小闹
图像生成侧,SenseNova-U1.5 新增约 5900 万图文对,来自 78 个来源。更关键的是高分辨率占比:约 88.2% 的有效训练量超过 1024²,64.4% 超过 2048²。
图像编辑数据约 3800 万条,覆盖通用编辑、信息图编辑、参考条件编辑、空间控制编辑。交错数据里,约 44% 是生活方式轨迹,29% 信息图,19% 视频派生序列,8% 推理密集型样本。RL 数据包括约 28 万美学 prompt、6 万 OCR prompt、12 万编辑样本、12 万 DPO 偏好对。
06 评测:8B-MoT 把桌子掀了
通用图像生成,在 Qwen-Image-Bench 上,SenseNova-U1.5 加 prompt enhancement 后,英文和中文分别达到 60.22 和 60.13,开源模型里整体最佳。
在GenEval上,它拿下了 0.92 的整体高分,具备与领先闭源模型(GPT-Image-2)同台竞争的实力,在计数、位置和属性绑定等维度都表现优异。
在 CVTG-2K 密集文本渲染测试中,平均分达到 0.948,四个和五个区域的词准确率依然稳在 0.95 以上。这直接拿下全场最佳。
编辑侧,ImgEdit 整体 4.59,超过所有参评模型,包括Nano-Banana-Pro与GPT-Image-1;WeEdit 平均 7.46,在开源模型里相当能打。
再看交错生成。OpenING 上,带 CoT 的 U1.5 拿下 9.18 的最高分,图像-文本连贯性、人类对齐、多步一致性都稳得一批。
理解能力没有被生成能力拖垮。MMMU、MMBench、OCRBench等基准上保持竞争力;语言侧 MMLU-Pro 86.67、IFEval 93.35。
这说明它不是为了生成牺牲理解,而是试图让两边互相加强。
07 最后
SenseNova-U1.5 最让我在意的,不是某个单项分数,而是它给出的路线信号:
多模态统一,不一定非要靠视觉编码器 + VAE 的旧范式。像素空间原生建模,也能同时撑起理解、推理、生成、编辑和交错生成。
更关键的是,推理可以改善生成,生成也可以成为模型内部推理的一部分。
感知与创造的边界,正在被这种原生统一的架构一点点抹平。视觉 AI 的新一轮内卷,才刚刚开始。