作者: vivo BlueImage Lab
本文入选 CVPR 2026
ECCV(European Conference on Computer Vision) 是计算机视觉与人工智能领域的国际顶级会议,与 CVPR、ICCV 并称"计算机视觉三大顶会"。会议由欧洲计算机视觉协会(ECVA)主办,每两年举办一次。主要内容是计算机视觉与模式识别技术。
ECCV 2026 约10,473 篇投稿,接收率约27.5%。
摘要:
vivo 蓝图实验室提出妆容迁移框架 ART,通过两阶段训练将监督信号从合成伪目标逐步锚定到真实参考图像。该方法有效解决了复杂妆容迁移中的细节丢失与身份漂移问题,在多个数据集上取得 SOTA 效果,并发布首个 2K 妆容数据集 MF2K。
设想一个具体的需求:把一张参考照片里的妆容,完整迁移到另一张人像上。不是替换口红色号这种程度,而是连舞台妆亮片的分布、脸绘花纹的走向、眼角水钻的位置都一一对应,同时严格保持被迁移者的五官结构、表情和背景。
这正是妆容迁移(makeup transfer)要解决的问题。经过近十年发展,日常淡妆、眼影、唇色的迁移已经比较成熟。但一旦面对贴纸、亮片、艺术脸绘这类复杂妆容,现有方法普遍失效:纹理模糊、图案缺失,甚至人物身份被一并改变。
我们的 ECCV 2026 论文 ART 想回答两个问题:这个领域究竟被什么卡住了,以及如何突破它。
图 1:从日常淡妆到复杂艺术妆,从夸张表情到面部遮挡,ART 都能完整迁移参考妆容,同时稳定保持人物身份。右栏为与现有最优方法的对比。
动图:左下角为参考妆容,展示从源图到迁移结果的转变——亮片分布、脸绘线条与文字细节均被完整保留。
01
问题的根源:
没有真实配对,就没有真正的监督
训练一个换妆模型,最理想的数据是配对样本:同一个人、同一角度、同一表情,一张素颜、一张带妆,两张图之间只差一层妆容。有足够多这样的样本,监督学习自然收敛。
问题是这种数据在物理上几乎不存在。你不可能让几千个人化好妆再卸掉,在完全相同的光线和姿势下各拍一张照片。
没有配对数据,行业走了两条替代路线。
路线一:用弱先验代替监督。
以循环一致性、域对抗为代表的 GAN 方法,不直接告诉模型目标是什么,而是用"化了妆再卸掉应当还原"这类间接约束来训练。这类方法能学到颜色和整体氛围,但学不到"在眼角特定位置贴一颗钻"这种有明确形状和空间坐标的妆容——因为监督信号里从来不包含这些信息。
路线二:用大模型生成伪目标(pseudo-target)。
这是近年扩散模型时代的主流做法:请一个大型图像编辑模型,根据素颜照和参考妆容照合成一张"带妆结果图",把它当作监督目标来训练学生模型。妆容迁移由此从无监督变成了有监督,效果大幅提升。
这就是论文提出的 "伪目标天花板"(pseudo-target ceiling):用来提供监督的合成图像,最终成为模型质量的上限。
ART 的核心想法可以一句话说完:监督信号不应该来自合成的伪目标,而应该来自真实照片本身。 伪目标可以用,但只能用来起步。
02
方法:
两阶段训练,把真实参考图变成监督信号
ART 没有抛弃伪目标,而是重新定义了它在训练中的位置:从最终的监督目标,降级为初始化的起点。
Stage I:伪目标初始化。
用"源图—参考图—伪目标"三元组训练迁移模型,让模型先掌握基本能力:妆容在脸上的空间分布、色彩映射、贴纸的大致位置。同时训练一个辅助的卸妆模型,负责从带妆图像还原素颜人像——它在下一阶段承担关键角色。这一阶段结束时,模型已经可用,但能力边界仍由伪目标决定。
Stage II:现实锚定细化(reality-anchored refinement)。
这是论文的核心。我们让模型做这样一件事:
迁移模型输出的结果,不被当作最终图像,而是被保留为一层可微分的妆容载体(makeup carrier)——可以理解为一张独立的、数学上可求导的"妆容图层"。然后,把这层妆容从源人脸上"取下来",叠加到参考图的素颜版本上(由 Stage I 的卸妆模型生成),并问一个问题:用迁移出来的这层妆容,能否重建出真实的参考图?
如果迁移是完整、准确的,重建结果应当与参考图一致。只要有任何遗漏——亮片少了、花纹位置偏了、边界出现伪影——重建误差就会暴露出来。这个误差就是监督信号:它沿着可微分的载体反向传播回迁移模型,精确指出哪一处妆容被遗漏或画错。
图 2:Stage I 用伪目标建立基础迁移能力并训练卸妆模型;Stage II 将迁移结果保留为可微的妆容载体,通过重建真实参考图,让真实图像的监督信号反向修正迁移结果。
这个设计的关键价值在于:监督信号直接来自真实图像本身,而不是对伪目标的模仿。真实图像中的每一处妆容细节——纹理、边界、空间布局——都成为可直接学习的信号。模型的学习目标从"模仿合成结果"变成了"对齐真实图像"。
Stage II 中还有一个需要标定的旋钮:细化从什么起点开始。ART 从施加了受控噪声的伪目标出发进行细化。噪声强度决定模型保留多少伪目标先验:噪声太小,细化被草稿束缚,难以摆脱其中的错误;噪声太大,自由度过高,人物结构和背景容易漂移。实验表明 0.6 是最优点——足以放开细节修正,又不至于动摇身份结构。
03
MF2K:
第一个 2K 分辨率真实场景妆容数据集
方法之外,我们还补齐了这个领域长期缺失的一块基础设施。
已有妆容数据集有两个短板:分辨率低——睫毛、亮片这类精细结构在低分辨率下物理上不存在,模型无从学习;覆盖面窄——艺术脸绘、密集贴纸、男性人像等真实场景严重缺失。
我们从互联网收集了约 10 万张高分辨率人像,并补充 FFHQ 数据集在 Flickr 上的原始图像,经过人脸对齐裁剪、CLIP 特征去重、质量与姿态过滤、视觉语言模型标注和人工复核,最终构建出 MakeupFaces2K(MF2K):8,573 张 2048×2048 人像,覆盖素颜(3,139 张)、淡妆(2,063 张)、浓妆(1,798 张)和艺术妆(1,573 张)四个类别。
图 3:MF2K 的类别构成,以及与现有数据集的局部细节对比。睫毛、亮片、唇纹这类高频细节,只有在高分辨率下才能完整保留。
04
实验:
复杂妆容还原度与身份稳定性同时提升
我们在 MT、LADN、MT-Wild、MF2K 四个测试集上评测,共 400 组身份不重叠的源图—参考图组合,其中 MF2K 测试集的参考图全部来自艺术妆子集,专门考察复杂图案的迁移能力。对比方法覆盖三代技术路线:GAN 方法(PSGAN、EleGANt),专用扩散模型(StableMakeup、SHMT、MAD),以及通用商业模型(Nano Banana Pro、GPT Image 1.5)。
定性结果。日常妆容上,GAN 方法常见边缘生硬与肤色偏移,通用大模型虽图像质量高,但经常改变人物面部结构。复杂妆容上差距进一步扩大:多数方法只能迁移整体色调,贴纸与脸绘这类有像素级标准答案的内容普遍丢失或变形。
图 4:日常妆容的定性对比。
图 5:复杂妆容的定性对比。可重点观察骷髅嘴缝线、亮片分布、贴纸形状等高频细节。
定量结果。评测覆盖五个维度:两个视觉大模型分别评估妆容相似度(MSimG / MSimQ),人脸识别模型评估身份一致性(ID),像素差异评估背景改动量(L2-M),FID 评估整体画质。ART 的 MSimG 在四个测试集上全部第一,L2-M 全部最低。在难度最高的 MF2K 艺术妆测试集上,ART 的 MSimG 为 9.22,对比方法最高为 8.43。需要说明的是,ART 并未包揽全部指标——MSimQ 与 FID 上各有方法占优;ART 的实际优势在于:把妆容忠实度和背景稳定性同时显著推高,且身份一致性与图像质量保持在第一梯队。
表 1:四个测试集上的完整定量对比。
用户研究。 21 名参与者、864 次匿名盲评,ART 在妆容相似度、身份一致性、图像质量三个维度均排名第一,平均得分分别为 3.67、4.03、3.83(满分 5 分)。
表 2:用户研究结果。
05
直接验证:天花板是否真的被打破
优于其他方法,不等于突破了伪目标天花板——也可能只是伪目标本身更好。为此论文设计了两组直接验证。
验证一:输出与训练用的伪目标直接对比。
面对相同的训练样本,ART 能够纠正伪目标中的头部姿态变化、错误图案与语义幻觉(伪目标曾在额头生成不存在的英文字母),并恢复更清晰的妆容细节。模型的最终输出,质量超过了它训练时模仿的对象。
图 6:红框标注伪目标中的姿态偏移、错误图案与语义幻觉,ART 逐一修正。
验证二:更换更弱的伪目标生成器。
将伪目标来源从 Nano Banana Pro 换成能力明显更弱的 StableMakeup:后者在 MF2K 上的 MSimG 仅为 6.73,但用其生成结果训练出的 ART 变体达到 8.56;换回强伪目标,ART 达到 9.22。伪目标的质量影响起点,但不再决定终点。
图 7:即使从低质量伪目标出发,ART 仍能恢复清晰、准确的复杂妆容。
另一个需要排除的解释是数据优势。我们将 StableMakeup 用 MF2K 重新训练,其 MSimG 为 6.58,并未获得同等提升。两阶段消融同样指向方法本身:仅 Stage I 时 MSimG、ID、L2-M 分别为 8.82、0.57、7.68,加入 Stage II 后改善至 9.22、0.74、4.31——提升来自真实图像监督,而非数据或初始化。
分辨率扩展。 ART 是首个支持 2048×2048 输出的妆容迁移框架。我们对比了 512、1024、2048 三种训练分辨率:随着分辨率上升,贴纸边缘、亮片颗粒与睫毛细节逐级变清晰,且高分辨率训练中引入的小波变换损失进一步强化了高频妆容结构的学习。这说明 2K 输出是训练出来的,不是放大出来的。
图 8:512 → 1024 → 2048,红框内眼妆细节逐级清晰。
06
局限
ART 目前没有显式建模光照与材质。当源图与参考图的光照条件差异较大时,参考妆容中的强高光可能被迁移到不匹配的光照环境中,产生不真实的局部效果。这是后续工作的方向之一。
图 9:失败案例:参考图中的强高光被迁移到光照不匹配的源图上。
07
我们对这项工作的两点判断
最后谈谈我们认为这项工作真正的价值所在。
第一,人像美化的竞争焦点正在从"通用滤镜"转向"细节质感"。
用户的需求早已越过磨皮美白阶段,进入"还原某种具体妆容"的阶段,而贴纸、亮片、脸绘恰恰是其中最精细、最容易暴露算法短板的场景。2K 分辨率同理:在手机上双指放大看细节是用户的本能动作,妆容细节是否成立,一眼可见。这类能力比拼的不是营销话术,是监督信号的质量。
第二,配对数据稀缺是整个现实图像编辑领域的共性瓶颈,ART 提供了一种可迁移的解法。
换发型、去皱纹、年龄变换——几乎所有现实编辑任务都卡在同一个地方:无法获得"同一个人、只改变单一属性"的成对数据。ART 证明了一条可行路径:用合成数据完成初始化,用真实数据完成监督。 大模型生成的伪目标用来起步没有错,错的是把它当作终点。真实图像中包含比任何生成模型都丰富的监督信号,关键在于设计一条可微的通路,让"与真实图像不一致"本身成为损失函数。
合成的伪目标不是答案,只是通往真实分布的第一步。这句话适用于妆容迁移,我们相信也适用于更多被配对数据稀缺困住的问题。
vivo BlueImage Lab
蓝图实验室,主要负责移动影像算法创新,包括图像/视频处理、图像/视频交互、图像/视频增强、多模态理解大模型等方面的技术前沿探索。
致力于不断提升vivo移动影像的算法能力,使用户能够拍摄出更加清晰、美观的照片和视频。同时积极探索增强现实、具身智能等新兴技术领域的应用,努力为用户提供更加丰富和便捷的影像体验。
欢迎持续关注 vivo 影像技术,获取前沿技术创新经验分享与热招岗位信息。
END
猜你喜欢