前两天刷 Hugging Face,看到 Qwen 团队把 Qwen-Image-2.1 的权重放了出来。上次开源图像模型还是去年 12 月底的 Qwen-Image-2512,中间隔了差不多 9 个月,这期间闭源的 2.0 和今年夏天的 3.0 都只能去 Qwen Chat 用。
9 月 20 日正式开源,权重上了 Hugging Face 和 ModelScope,代码仓库在 QwenLM/Qwen-Image-2.1。同天 Diffusers、ComfyUI 原生支持,vLLM-Omni、SGLang、stable-diffusion.cpp 都在首日名单里,还有 AMD ROCm 和 FlagOS 覆盖的 8 个芯片平台适配。
Qwen-Image-2.1 是什么
官方博客标题是 Compact, Efficient, and Unified,定位系列里最均衡、性价比最高的成员。视觉生成部分 7B 参数,32 层 Single-Stream DiT,文本编码器另用 Qwen3-VL 8B,所以整个模型不止 7B。
VAE 是 64 通道 RGBA 自编码器,透明通道在 latent 空间原生存在,抠图是模型层面的事,不靠后期。默认 40 步推理,Flow Matching 加 Euler 调度。原生 2K 输出,默认 2048x2048,7 种宽高比最大到 2752x1536,不用靠放大硬凑。效率靠混合粒度注意力加 Prefix KV Cache,条件图和指令只在第一步编码一次,后面 39 步复用,多图编辑提速和省显存主要靠这里。
许可证要说清楚。Qwen-Image-2.1 用的是 Qwen Research License Agreement,仅限非商业和研究用途,商用需另行联系 Qwen 授权。发布当天有它是 Apache-2.0 的传闻,实际没有这回事,1.0 代的 20B 模型才用 Apache-2.0,这次权限是收紧的,HN 上已经有 license trap 的讨论。拿来跑业务前先确认授权。
表现如何
能力集中在四块。
RGBA 透明图是最大卖点。提示词决定输出 RGB 还是 RGBA,官方给了模板,照抄就能出透明背景。透明图层可以单独编辑,比如保住背景只换表情、换图层里的文字,也能把普通照片的主体抠成透明图层。ComfyUI 官方博客的原话是 "No other major open model does this",目前没有别的主流开源模型原生支持这个。
参考图最多吃 10 张。官方案例有 6 张人像合成合影、5 件单品合成穿搭做虚拟试穿、10 张家具图排室内布置。局部编辑给三种方式,彩色圆圈标注一次能圈三个区域下指令,还有涂画标注和原图加独立 mask 双输入。文字渲染有升级,字体、排版、文图关系都比前代好,带 CJK 文字的图一直是我选 Qwen 系的理由。
社区评价是分裂的。好评那边,Sandlers 评它为目前最强开源图像模型,写实超过 Z-Image,高分辨率下表现一致。Reddit 有人生成 200 多张测试图,认为 7B 里质量相当好,编辑和参考图扎实。HN 上不少人也觉得 7B 出这个质量、CJK 文字能打、本地能跑,很难得。
差评集中在写实度。有用户在 ComfyUI 工作流下对比 GPT Image,认为质量低一截,错误和伪影多,但快,RTX 5080 出 4K 约 90 秒。有人在 CFG 1、40 步、Euler 参数下觉得艺术风格可以,写实不行。多人参考合成时人脸不稳定,复杂排版和 3D 文字遵循差也有提到。出图略噪是多源印证的通病。
所以别照单全收「最强开源」,按场景看更稳。编辑、参考图合成、透明图是公认强项,写实摄影是最大短板,纯写实需求看 FLUX.2,带文字的图选 Qwen 系这个共识依然成立。对比方面,Z-Image 6B 用 Apache-2.0,Turbo 主打速度,2.1 写实更强但慢。FLUX.2 有 32B,写实纹理强,本地要量化加 4090 才跑得动,2.1 用四分之一参数换来编辑加透明图的差异化。和前代 Edit-2511 比,2.1 把生成、编辑、透明图收进一个 checkpoint,不用再串多模型管线。Qwen-Image-Bench 得分 60.28 排开源第一,超过 Nano Banana 2,注意这是官方自建榜,自家模型打分,没有第三方。
本地部署
ComfyUI 最省事,Day-0 原生支持,Templates 面板有文生图和编辑模板,参考图节点逐张加到 10 张。Comfy-Org 提供分包权重,DiT bf16 约 14.2 GB,int8_convrot 约 7.26 GB,文本编码器分 BF16、INT8、W4A8 三档,低配机器先更新 ComfyUI。
pip install git+https://github.com/huggingface/diffusers
Diffusers 要 torch 2.4.0 以上、transformers 5.17 以上,加载 QwenImage21Pipeline 后调 enable_model_cpu_offload() 省显存。
显存没有官方数字,以下都是社区实测。全量 bf16 约 27 到 30 GB,Q8 量化总占用约 15.6 GB,16GB 的卡能跑。速度方面 RTX 4090 出 1024x1024 约 7.5 秒,2048x2048 约 30 秒,3072 约 95 秒,4096 超 3 分钟还有纹理伪影,实用上限在 3K 左右,3090 再翻一倍。参数推荐 CFG 1、40 步,Euler 或 Simple 调度。
怎么体验
在线渠道不少。Qwen Chat 和 Hugging Face Space 能直接玩,Comfy Cloud 也上了。国内可以看 wuli.art,免费开放全部功能含透明图,官方 README 都在推荐。ModelScope 支持在线生成加 LoRA 训练。
要上手的话,编辑、参考图和透明图工作流可以直接进,写实生图先多看社区出图再定。商用前记得确认 Research License 的授权条件,许可以官方页面为准。
未经允许不得转载:w3h5前端开发资源网 » Qwen-Image-2.1 回归开源,7B 模型搞定生成编辑和透明图
w3h5前端开发资源网