Qwen-Image-2.1 开放权重,视觉生成组件为 7B 参数规模。它把文生图、图像编辑、透明 RGBA 图像和最多 10 张参考图放进同一个模型。
7B
视觉生成组件。
10 张
参考图上限。
2K
原生分辨率。
图注:Qwen 官方账号发布的 Qwen-Image-2.1 开放权重公告配图。
Qwen 在 9 月 20 日公布 Qwen-Image-2.1,并同步提供 Hugging Face 和 ModelScope 权重。发布页面还列出了本地调用、节点式工作流和服务化推理的接入方式。
7B 规模承担了哪些工作?
这里的 7B 指视觉生成组件,不等于整套使用链路的全部参数。官方 README 写明,模型采用 32 层单流 DiT,并通过混合粒度注意力和前缀 KV 缓存复用来减少重复计算。对使用者来说,核心变化是同一个生成模型同时处理图像生成和编辑,部署时不必先为两类任务寻找两套模型。
图注:Qwen 官方展示的 Qwen-Image-2.1 注意力与前缀 KV 缓存结构示意图。
官方也给出了 CPU offload、vLLM-Omni 和 SGLang 等路径。它们解决的是显存、缓存、并行和服务化问题,实际速度仍取决于显卡、精度、推理步数和部署配置。7B 这个数字可以说明模型的规模,不能直接替代一台具体机器上的速度测试。
透明图像进入了主流程
透明图像进入了主流程。Qwen-Image-2.1 原生支持带透明通道的 RGBA 图像,也支持编辑透明图层和从照片中提取主体。
图注:Qwen 官方展示的透明图像生成示例,画面包含人物、花卉和透明背景区域。
这个功能对应一组明确的制作动作:生成贴纸、把主体放进新的场景、为产品图更换背景,以及继续编辑已经抠出的对象。
官方示例要求在提示词中写明图像包含 alpha 通道和透明背景。输出是否适合直接进入后续设计流程,还要看边缘、阴影和透明区域的处理质量。模型支持透明输出,和每一张图都能无缝用于生产,是两个不同层面的判断。
十张参考图解决的是组合关系
多图输入最多支持 10 张参考图。用户可以把不同人物、产品或视觉资产交给模型,再用文字描述它们如何出现在同一幅画面里。官方示例让三张人物图围绕篝火组合,README 还提供了人物、产品和局部编辑的使用方式。
图注:Qwen 官方展示的多人参考生成示例,左侧保留多张人物参考图,右侧为合成后的合照。
图注:Qwen 官方展示的家居多图参考示例,左侧为参考素材,右侧为组合后的室内场景。
这类能力的价值在于减少反复拼接和重绘的次数,尤其适合需要保留人物身份或产品外观的场景。输入图越多,主体之间的遮挡、比例和光线关系也越复杂,最终效果仍然需要逐张检查。
开源权重之外,接入入口也同步出现
这次发布的另一个具体信息,是多个开源工具在同一天给出支持。Diffusers 提供 QwenImage21Pipeline。ComfyUI 提供文生图和图像编辑工作流模板,vLLM-Omni 与 SGLang 面向服务化推理。
图注:Qwen 官方展示的复杂信息图生成示例,画面包含人物、服装信息和版式文字。
这让发布信息形成三层入口:权重已经开放,模型把生成和编辑合并,工具链提供本地调用、节点式工作流和服务部署。真正适不适合某个项目,还要回到显存、推理时延、透明边缘质量和多图一致性这些可测试条件上。
当前可观察信号。 如果你关心本地部署,先看模型能否在目标显卡上稳定完成一张 2K 图的生成。再分别测试透明输出、单图编辑和多图组合。具体工作流仍需要设备与任务级验证。
SOURCES。
Qwen 官方博客:Qwen-Image-2.1 发布说明。
Qwen 官方 GitHub:模型结构、使用方式与工具链支持。
Alibaba_Qwen 官方 X 帖:开放权重公告。