
做设计或运营的朋友大概率经历过这种工作流:生图开一个工具,精修切到另一个工具,要做透明底贴纸再开一个抠图软件,三个软件之间来回导出导入。闭源模型效果是好,按张计费的账单也真实。有没有可能一个模型把这些活全干了,还能在自己电脑上离线跑?
云栖大会上阿里开源的 Qwen-Image-2.1(https://qwen.ai/blog?id=qwen-image-2.1) 给了一个相当有诚意的答案。官方博客和权重都已放出,可在 Hugging Face 和 ModelScope 下载,模型架构与使用说明在官方 GitHub 仓库能查到。

规格先划重点
- 7B 参数:视觉生成部分采用 32 层 Single-Stream DiT,消费级显卡轻松部署,3090 就能跑;
- Arena 双榜开源第一:图像编辑 1367 分、文生图 1228 分,在 Arena 公开评测里超过所有开源竞品,也压过了不少闭源模型;
- 推理加速:混合粒度注意力加 KV Cache,文本走 Token 级掩码、图像走 Chunk 级掩码,输入图像和编辑指令第一步就预计算缓存。实测单卡 4090 出 1K 图约 18-22 秒,双 4090 出高清约 21 秒,原生 2K 大约两分钟;
- 三合一:生成、编辑、透明背景图由同一个模型原生学会,不是两套系统拼起来,透明能力整合了 Qwen-Image-Layered 的积累。

本地部署路径
在 Comfy 桌面端加载模型权重即可跑通全部案例。步骤不复杂:
- 从 Hugging Face 或 ModelScope 下载 Qwen-Image-2.1 权重;
- ComfyUI 桌面端安装并挂载模型;
- 文生图直接写提示词;需要透明图时在提示词里说明"背景完全透明",模型会自行判断输出普通图还是透明图;
- 修图场景喂入原图加编辑指令,多图参考最高支持 10 张。
8GB 显存有用户跑通了生成与编辑,显存紧张的建议从量化版本入手。
四个真正好用的能力
原生透明输出。这是我认为它对开源社区最有价值的一点。以前做一张透明底贴纸,流程是先生成带背景的图再抠;现在提示词写清楚需求,直接输出透明底 PNG,带阴影、描边、半透明光效的多元素贴纸,每个元素的透明边缘都是干净的。透明图还能继续编辑——改表情、改图层文字,背景依旧透明。更实用的是能把 RGB 实拍照片直接转成 RGBA,发丝、玻璃杯这种难啃的边缘也能处理,等于省掉一款抠图工具。
多图参考最多 10 张。实测两个高频场景都成立:把几个人各自的单人照合成一张自然合照,面孔区分清晰;给电商做上身图,模特图加外套、衬衫、牛仔裤、皮包四张单品图,一句话让模特穿戴整齐,材质纹理和版型都忠实于单品图,直接能当详情页成片用。
局部编辑与保真。圈选或涂抹要改的区域,掩码之外无损保留;编辑后人像的脸保持一致,商品图的文字、纹理、形态不跑偏。连续编辑还能做出简单的逐帧动画。扩图效果同样在线,建筑透视和消失点都遵循原图。
中文文字渲染。这一代的文字渲染被官方总结为"字雅、人美",实测海报场景里大标题汉字笔画结构完整、书法手写体不糊,信息图、三视图这类以前只有闭源模型能稳定做的事现在也能出。



用之前注意三件事
- 许可协议:Qwen Research License,公开权重默认只能做研究和评估,要放进商业产品需要另行申请授权,商用项目别直接上生产环境;
- 抽卡率:开源模型出图稳定性比闭源头部产品略差,重要项目多留几次生成的余量;
- 显存与速度:3090 是流畅基线,更低配置可用量化版但出图速度和精度会有折损。
我的看法
Qwen-Image-2.1 的价值不在某一张图多惊艳,而在把三件原本要三个工具的事压进了一个 7B 模型。对独立设计师和小团队来说,这是工作流的实质简化:本地离线、无按张计费、数据不出门。开源模型与闭源的差距在图像这条赛道已经缩到肉眼难辨的程度,Arena 上开源第一和闭源头部只差零点几分。
可以预期的是,本地跑起来的人多了,衍生模型、插件和成熟工作流会快速跟进——开源生态落到图像模型上,向来是这个剧本。趁现在上手把工作流搭起来,等生态起来时你已经在前排了。
文章标题:阿里开源 Qwen-Image-2.1 上手实测:生图修图抠透明底一个模型全包,3090 就能跑
文章链接:https://www.muooy.cn/15702.html
更新时间:2026年10月01日
1.本站大部分内容均收集于网络!若内容若侵犯到您的权益,请发送邮件至:305582964@qq.com,我们将第一时间处理!2.资源所需价格并非资源售卖价格,是收集、整理、编辑详情以及本站运营的适当补贴,并且本站不提供任何免费技术支持。
3.所有资源仅限于参考和学习,版权归原作者所有,更多请阅读用户协议和免责声明。

