云端部署阿里 Qwen-Image-2.1 保姆级教程

不需要本地显卡、不占 C 盘、不装 CUDA。租一台 32GB 显存的云主机,从零到跑通 Gradio 出图页面,全程约 20 分钟,实际花费不到 5 毛钱。

这篇教程面向完全没碰过 Linux 和 GPU 服务器的人:每一步都给命令,每一条命令都解释在干什么,并标注了新手最容易翻车的三个坑(系统盘写满、显存 OOM、忘关机持续扣费)。

Qwen-Image-2.1 是阿里通义千问团队在 2026 年 9 月下旬开源的图像生成 + 图像编辑一体化模型,视觉生成分支为 7B 参数,文本编码器换成了 Qwen3-VL 8B。官方要点:

一个关键前提:满血 BF16 权重的体积在 30GB 量级,推理时显存占用逼近 30GB。这个前提决定了后面所有的选型和避坑动作。

很多人第一反应是"买张显卡放家里跑最划算"。用真实数据对比一次:

云端真正的价值不是"快",而是把三件最痛的事直接抹掉了:不用装环境、不用解决下载线路、不用担心显存差一点点。

而本地 8GB 卡跑 7B 级图像模型,权重必然要往系统内存切片,速度掉到分钟级,风扇狂转还动不动崩——这条路能通,但不适合新手第一篇教程。

综合首推 AutoDL,原因只有三条,都是新手会真切碰到的:扫码 5 元起充不用信用卡;内置 ModelScope 高速专线,拉 30GB 权重不用梯子;关机免费保留环境 15 天,下次开机一切都在。

如果你本来就要接生产流量,PAI 的 ComfyUI 模型服务部署是更正规的路子,只是对个人尝鲜来说成本结构不友好。

有别的更合适的平台,欢迎告诉我,我把这张表更新掉。

进算力市场你会发现 4090 长期显示 0 张空闲,价格还被炒到 2.2 元以上/小时。

核心判断:满血 BF16 显存占用逼近 30GB,24GB 卡跑满血是有风险的。多花的等待时间和爆显存的报错,比每小时省下的 0.6 元贵得多。

创建成功后状态变为绿色「运行中」,控制台会给出专属 SSH 命令与端口,形如:

原因很直白:AutoDL 系统根目录 / 默认只有 30GB,而满血权重体积在 30GB 量级,直接下到默认缓存目录必然撑爆系统盘,而且爆完之后连系统都卡。

平台额外挂了 50GB 免费临时数据盘 /root/autodl-tmp/ ,正确做法是把两个缓存路径都指过去:

注意:export 只在当前 shell 会话生效。 关掉终端再进来要重新执行,否则缓存又会写回系统盘。想一劳永逸就写进 /root/.bashrc:

新建文件 /root/autodl-tmp/gen.py:

第一次跑会先下载权重(几分钟,取决于线路),之后直接复用缓存。脚本会加载模型再出图,冷启动到出图之间那段时间显存和 GPU 利用率拉满是正常的。

出图后用 image.mode 应当是 RGBA——这就是原生透明底的证据,不需要任何抠图插件。

新建 /root/autodl-tmp/app.py:

安全提醒:网上很多教程会让你写 server_name="0.0.0.0"。按量计费的云主机 IP 是公网可达的,WebUI 又没有任何鉴权,端口暴露出去等于把 GPU 免费送给扫描器,别人拿去刷图扣的是你的余额。上面的脚本用 127.0.0.1 + SSH 隧道(或 AutoDL 自定义服务入口)访问;确实需要监听全网时,务必给 Gradio 加 auth=("user", "强密码")。

参考原教程在 AutoDL 西北 B 区 vGPU-32GB(RTX 4080 SUPER 32GB)上的联调结果:

这些数字是单次实测,你的结果会受机房负载、分辨率、步数影响。想追求秒级出图,可以再叠加注意力优化与步数压缩(Turbo/Lightning 类方案),但那属于另一篇教程。

满血 BF16 不是唯一选择。社区量化版本可直接用:

来源:稀土掘金 原文