阅读,与值得关注的内容Readance

我天,彻底被SenseNova-U1.5技术深度惊到了

大家好,我是PaperAgent,不是Agent!

这两天刷 alphaXiv,好家伙,DeepSeek 带着最新的 V4.1-Flash 在 KV 缓存压缩上大杀四方,霸榜。往下滑,旁边同一天发的 SenseNova-U1.5,也是国产,仔细扒完技术报告,我直接愣住了。

商汤日日新 SenseNova这波很能打:8B-MoT、统一、4K、原生多模态。

它不是把理解模型和生成模型硬拼在一起,而是从像素和词出发,在一条共享视觉基座上,把看、想、画、改全打通。

更离谱的是,这还是个 8B-MoT 模型。说实话,真有点惊艳。

模型已开源,官方宣布将开源训练代码。

https://arxiv.org/abs/2609.11929
GitHub:https://github.com/OpenSenseNova/SenseNova-U1  
HuggingFace:https://huggingface.co/collections/sensenova/sensenova-u15

接下来,我们一起详细聊聊。

01 过去多模态的老路子翻篇了

传统多模态系统有个老毛病:理解走一条路,生成走另一条路。

传统多模态系统通常采用两套视觉表征路径:理解图像时依赖预训练视觉编码器,将图像转换为语义特征;生成图像时则通常借助 VAE 将像素映射到更紧凑的潜空间,并在潜空间中完成生成建模。一个偏向语义理解,一个偏向视觉保真,两套表征空间之间存在割裂。

SenseNova-U1 之前已经用 NEO-unify 证明过:不靠外部视觉编码器、不靠 VAE,也能做原生统一模型。但 SenseNova-U1 有个问题:每个视觉 token 独立重建 RGB patch,到了高分辨率,接缝、纹理断裂、几何不一致就会越来越明显。

Figure 3:架构总览
Figure 3:架构总览

而 SenseNova-U1.5,第一刀就砍在这里。

02 从独立拼图到空间联合重建

SenseNova-U1.5 不再让每个视觉 token 单独预测像素,而是先把 token 投到二维特征场,再通过 3×3 卷积和 Pixel Shuffle 逐级上采样,上采样因子是 2、2、8。

这就是说:相邻区域在像素最终确定前,能先交换信息。颜色、纹理、几何不再各画各的,而是一起解。

Table 1:SenseNova-U1.5配置
Table 1:SenseNova-U1.5配置

它依然保持极高压缩率:每 32×32 像素区域只对应一个视觉 token。但输出端不再是 patch-wise MLP,而是轻量空间解码器。这样既保留紧凑序列的效率,又显著提升空间连贯性,还能原生支持最高 4K 分辨率。

03 MoT:共享注意力,但保留专业分工

SenseNova-U1.5 沿用原生 Mixture-of-Transformers设计。

干净图文上下文和噪声视觉状态,被交错放进同一个序列。文本 token 只做因果注意力;干净图像块内部双向交互;生成 token 也能双向看自己所在的图像块,并访问前面所有干净多模态上下文。反向路径被遮住,防止干净表示被随机生成状态污染。

但统一不等于全都共享。理解流和生成流仍然保留各自的注意力投影、归一化层和前馈模块,按 token 类型动态路由。共享注意力是跨流通信接口,专用参数保留感知和合成的不同计算需求。

训练目标也是三合一的:

  • 自回归语言建模,负责语义理解和多模态推理;
  • 像素空间 flow matching,直接在 RGB 空间学噪声到图像;
  • LPIPS 感知监督,约束结构一致性和局部视觉连贯。

04 训练:先专精,再统一

SenseNova-U1.5 的后训练策略很有意思:不是把所有任务塞进一个奖励里联合优化,而是“先专精,再统一”。

Stage 1 是生成预训练,分三阶段:180K 步、100K 步、185K 步。分辨率从 256²–1024² 一路推到 512²–4096²,并引入图像编辑和交错生成。

Stage 2 是统一 mid-training,80K 步。数据配比大致是:30% 理解数据、40% 文生图、20% 图像编辑、10% 交错数据。

Stage 3 是统一 SFT,10.5K 步,继续强化指令跟随。

Table 2:训练配方
Table 2:训练配方

Stage 4 是四专家强化学习,分别针对:

  • 视觉美学;
  • 双语文字渲染;
  • 信息图生成;
  • 图像编辑。

美学专家用 HPSv3++ 和 OCR 奖励交替;OCR 专家用 PaddleOCR 做多集合 IoU;编辑专家用五维奖励,最后取最小值,专门暴露最弱项,防止某一项高分掩盖关键错误;信息图专家则先 OCR 后 DPO,再交替文本和美学奖励。

Figure 4:后训练流程
Figure 4:后训练流程

Stage 5 是多专家 on-policy distillation。学生模型先自己生成轨迹,再按能力硬路由到对应的冻结专家,用速度场蒸馏把四个专家的能力合并进一个统一模型。800 个优化步,每域 25,600 个样本,冻结理解分支、最后三个生成层和生成输出头。

这套先专精,再统一的思路,比一锅乱炖的联合奖励优化靠谱得多。

05 数据:不是小打小闹

图像生成侧,SenseNova-U1.5 新增约 5900 万图文对,来自 78 个来源。更关键的是高分辨率占比:约 88.2% 的有效训练量超过 1024²,64.4% 超过 2048²。

Figure 5:训练语料构成
Figure 5:训练语料构成

图像编辑数据约 3800 万条,覆盖通用编辑、信息图编辑、参考条件编辑、空间控制编辑。交错数据里,约 44% 是生活方式轨迹,29% 信息图,19% 视频派生序列,8% 推理密集型样本。RL 数据包括约 28 万美学 prompt、6 万 OCR prompt、12 万编辑样本、12 万 DPO 偏好对。

06 评测:8B-MoT 把桌子掀了

通用图像生成,在 Qwen-Image-Bench 上,SenseNova-U1.5 加 prompt enhancement 后,英文和中文分别达到 60.22 和 60.13,开源模型里整体最佳。

Table 4:Qwen-Image-Bench EN
Table 4:Qwen-Image-Bench EN
Table 5:Qwen-Image-Bench ZH
Table 5:Qwen-Image-Bench ZH

在GenEval上,它拿下了 0.92 的整体高分,具备与领先闭源模型(GPT-Image-2)同台竞争的实力,在计数、位置和属性绑定等维度都表现优异。

Table 6:GenEval
Table 6:GenEval
Table 7: GenEval2
Table 7: GenEval2

在 CVTG-2K 密集文本渲染测试中,平均分达到 0.948,四个和五个区域的词准确率依然稳在 0.95 以上。这直接拿下全场最佳。

Table 11:CVTG-2K
Table 11:CVTG-2K

编辑侧,ImgEdit 整体 4.59,超过所有参评模型,包括Nano-Banana-Pro与GPT-Image-1;WeEdit 平均 7.46,在开源模型里相当能打。

Table 16:ImgEdit
Table 16:ImgEdit
Table 18:WeEdit
Table 18:WeEdit

再看交错生成。OpenING 上,带 CoT 的 U1.5 拿下 9.18 的最高分,图像-文本连贯性、人类对齐、多步一致性都稳得一批。

Table 21:OpenING
Table 21:OpenING

理解能力没有被生成能力拖垮。MMMU、MMBench、OCRBench等基准上保持竞争力;语言侧 MMLU-Pro 86.67、IFEval 93.35。

Table 3:理解/语言
Table 3:理解/语言

这说明它不是为了生成牺牲理解,而是试图让两边互相加强。

07 最后

SenseNova-U1.5 最让我在意的,不是某个单项分数,而是它给出的路线信号:

多模态统一,不一定非要靠视觉编码器 + VAE 的旧范式。像素空间原生建模,也能同时撑起理解、推理、生成、编辑和交错生成。

更关键的是,推理可以改善生成,生成也可以成为模型内部推理的一部分。

感知与创造的边界,正在被这种原生统一的架构一点点抹平。视觉 AI 的新一轮内卷,才刚刚开始。

前往微信阅读全文

内容来自公众号,可前往微信查看原文。

查看作者的更多文章 →