阿里巴巴的Qwen团队发布了 Qwen-Image-2.1-Turbo,这是其开放权重模型Qwen-Image-2.1的加速检查点。它 以8个去噪步骤生成和编辑图像 而不是基础模型的 40步默认设置。对开发者而言,这意味着在相同的7B架构上去噪步骤减少5倍,此外还提供托管API选项。
TL;DR
- 大小: 视觉生成器为7B参数,搭配 Qwen3-VL 8B文本编码器.
- 运行环境: 通过Diffusers在BF16下运行于CUDA GPU。Qwen未公布Turbo的最低VRAM要求。Unsloth估计基础模型可在 GGUF下以11 GB VRAM运行,INT8/FP8下需24 GB.
- 性能: 与Qwen-Image-2.1相同的2K输出和编辑功能集,但只需8步而非40步。
- 最佳之处: 基础版Qwen-Image-2.1在Qwen-Image-Bench上得分为60.28,是Qwen报告的开放权重最高分。
- 结论(最佳): 在一个开放检查点中实现8步2K生成和编辑。
- 结论(最差): 仅限研究许可,因此商业自托管需要另行获得许可。
什么是Qwen-Image-2.1-Turbo?
Qwen-Image-2.1-Turbo是阿里巴巴Qwen团队推出的一个8步图像生成和编辑检查点。它基于 Qwen-Image-2.1构建。Turbo保留了相同的7B视觉生成架构。它可直接配合 QwenImage21Pipeline 在Diffusers中加载。
该检查点内置了推荐的8步采样计划。生成默认使用CFG=1。前缀KV缓存在去噪步骤间复用文本和参考图像的上下文。
Qwen-Image-2.1-Turbo是如何工作的?
底层 架构 是一个单流DiT,具有32层和7B参数。它使用块级因果注意力。文本标记采用标记级因果掩码,而图像则使用块级双向掩码。
- 文本编码器: Qwen3-VL 8B 同时对指令和条件图像进行编码。
- VAE: 一个具有16倍空间压缩的64通道RGBA自动编码器,可支持原生透明度。
- 调度器: 使用Euler离散调度和动态偏移的流匹配。
注意力设计是前缀缓存得以奏效的关键。输入图像和文本在第一步只计算一次。后续每一步都复用该缓存。由于只有 8 步,缓存的前缀覆盖了大部分条件计算成本。
它能生成和编辑什么?
Turbo 模型卡展示 覆盖8个类别。其中包括肖像、人体姿势、透明图像、排版与海报,以及UI布局。编辑示例包括单图转换、多参考合成和4图像室内合成。基础模型支持最多 10 张参考图像 以及通过圆圈、绘制标注或遮罩进行的局部编辑。
如何运行 Qwen-Image-2.1-Turbo?
设置 需要从源码安装 Diffusers,连同 transformers>=5.17.0。该检查点需要 Diffusers PR #14950,它添加了由 pipeline 配置的采样 sigma。
import torch
from diffusers import QwenImage21Pipeline
pipe = QwenImage21Pipeline.from_pretrained(
"Qwen/Qwen-Image-2.1-Turbo", dtype=torch.bfloat16
).to("cuda")
image = pipe(
prompt="A ceramic teapot on a wooden table, soft window light",
width=2048, height=2048, use_kv_cache=True,
).images[0]
对于编辑,传入 image=input_image 并附带指令提示词。支持的预设范围从 2048×2048 正方形到 16:9 的 2752×1536。
这里有一点需要注意。仅设置 num_inference_steps 本身并 不会 覆盖已保存的调度。只有显式的 sigmas 参数才能做到,而且 Qwen 指出其他调度尚未经过测试。
这个 API 的费用是多少?
阿里云Model Studio现已同时托管Turbo和Pro两个版本。 qwen-image-2.1-turbo 在大多数地区每张图片收费0.1元人民币,限制为120 RPM。 qwen-image-2.1-pro 每张图片收费0.25元人民币,限制为20 RPM。Turbo每张图片便宜2.5倍,且允许6倍的请求速率。
Qwen-Image-2.1-Turbo对比其他快速图像模型
| 功能 | Qwen-Image-2.1-Turbo | Qwen-Image-2.1 | Z-Image-Turbo | FLUX.2 klein 9B |
|---|---|---|---|---|
| 组织 | Alibaba Qwen | Alibaba Qwen | Alibaba Tongyi-MAI | Black Forest Labs |
| 生成器规模 | 7B | 7B | 6B | 9B |
| 文本编码器 | Qwen3-VL 8B | Qwen3-VL 8B | 未披露 | Qwen3 8B |
| 默认步数 | 8 | 40 | 8 NFEs | 4 |
| 编辑 | 是,支持多参考 | 是,最多10个参考 | 否(需单独的 Edit 模型) | 是,支持多参考 |
| 透明 RGBA 输出 | 是 | 是 | 未披露 | 未披露 |
| 原生分辨率 | 2K(2048×2048) | 2K (2048×2048) | 示例中为 1024×1024 | 示例中为 1024×1024 |
| 硬件指南 | 未公开 | 11 GB GGUF / 24 GB FP8(Unsloth) | 可容纳于 16 GB 显存 | 约 29 GB 显存,RTX 4090+ |
| 许可证 | Qwen Research License | Qwen Research License | Apache 2.0 | FLUX 非商业许可 |
| Qwen-Image-Bench | 未公开 | 60.28(厂商数据) | 未公开 | 未公开 |
| 托管 API | 每张图 0.1 元人民币 | Pro: 每张图 0.25 元人民币 | 未公开 | BFL API |
要点总结
- Qwen-Image-2.1-Turbo 在相同的 7B 架构上将去噪步数从 40 步缩减至 8 步。
- 单一检查点即可处理 2K 文生图、多参考图编辑以及透明 RGBA 输出。
- API 每张图价格为 0.1 元人民币,比 Pro 便宜 2.5 倍。
- 权重采用研究许可授权,因此商业自托管需要单独获得许可。
- 目前尚无针对 Turbo 的基准测试;基础版 Qwen-Image-2.1 在 Qwen-Image-Bench 上得分为 60.28。
请查看 ModelScope 页面, Hugging Face 页面, Pro API 以及 Turbo API。所有功劳归于该项目的研发人员。此外,欢迎在 Twitter 上关注我们,别忘了加入我们的 150k+ML SubReddit 并订阅 我们的 Newsletter。等等!你在用 Telegram 吗? 现在你也可以在 Telegram 上加入我们了。
本文《 Alibaba Qwen 发布 Qwen-Image-2.1-Turbo:一个 8 步 7B 图像模型 》首发于 MarkTechPost.