MarkTechPost

阿里巴巴Qwen发布Qwen-Image-2.1-Turbo:一个8步7B图像模型

阿里Qwen团队发布Qwen-Image-2.1-Turbo,在同规模架构上把去噪步骤从40步降到8步。API每张CNY 0.1,但权重仅限研究许可,商用自托管需另行授权,且尚无Turbo专属基准。

阿里巴巴的Qwen团队发布了 Qwen-Image-2.1-Turbo,这是其开放权重模型Qwen-Image-2.1的加速检查点。它 以8个去噪步骤生成和编辑图像 而不是基础模型的 40步默认设置。对开发者而言,这意味着在相同的7B架构上去噪步骤减少5倍,此外还提供托管API选项。

TL;DR

  • 大小: 视觉生成器为7B参数,搭配 Qwen3-VL 8B文本编码器.
  • 运行环境: 通过Diffusers在BF16下运行于CUDA GPU。Qwen未公布Turbo的最低VRAM要求。Unsloth估计基础模型可在 GGUF下以11 GB VRAM运行,INT8/FP8下需24 GB.
  • 性能: 与Qwen-Image-2.1相同的2K输出和编辑功能集,但只需8步而非40步。
  • 最佳之处: 基础版Qwen-Image-2.1在Qwen-Image-Bench上得分为60.28,是Qwen报告的开放权重最高分。
  • 结论(最佳): 在一个开放检查点中实现8步2K生成和编辑。
  • 结论(最差): 仅限研究许可,因此商业自托管需要另行获得许可。

什么是Qwen-Image-2.1-Turbo?

Qwen-Image-2.1-Turbo是阿里巴巴Qwen团队推出的一个8步图像生成和编辑检查点。它基于 Qwen-Image-2.1构建。Turbo保留了相同的7B视觉生成架构。它可直接配合 QwenImage21Pipeline 在Diffusers中加载。

该检查点内置了推荐的8步采样计划。生成默认使用CFG=1。前缀KV缓存在去噪步骤间复用文本和参考图像的上下文。

Qwen-Image-2.1-Turbo是如何工作的?

底层 架构 是一个单流DiT,具有32层和7B参数。它使用块级因果注意力。文本标记采用标记级因果掩码,而图像则使用块级双向掩码。

  • 文本编码器: Qwen3-VL 8B 同时对指令和条件图像进行编码。
  • VAE: 一个具有16倍空间压缩的64通道RGBA自动编码器,可支持原生透明度。
  • 调度器: 使用Euler离散调度和动态偏移的流匹配。

注意力设计是前缀缓存得以奏效的关键。输入图像和文本在第一步只计算一次。后续每一步都复用该缓存。由于只有 8 步,缓存的前缀覆盖了大部分条件计算成本。

它能生成和编辑什么?

Turbo 模型卡展示 覆盖8个类别。其中包括肖像、人体姿势、透明图像、排版与海报,以及UI布局。编辑示例包括单图转换、多参考合成和4图像室内合成。基础模型支持最多 10 张参考图像 以及通过圆圈、绘制标注或遮罩进行的局部编辑。

如何运行 Qwen-Image-2.1-Turbo?

设置 需要从源码安装 Diffusers,连同 transformers>=5.17.0。该检查点需要 Diffusers PR #14950,它添加了由 pipeline 配置的采样 sigma。

复制代码
import torch
from diffusers import QwenImage21Pipeline

pipe = QwenImage21Pipeline.from_pretrained(
    "Qwen/Qwen-Image-2.1-Turbo", dtype=torch.bfloat16
).to("cuda")

image = pipe(
    prompt="A ceramic teapot on a wooden table, soft window light",
    width=2048, height=2048, use_kv_cache=True,
).images[0]

对于编辑,传入 image=input_image 并附带指令提示词。支持的预设范围从 2048×2048 正方形到 16:9 的 2752×1536。

这里有一点需要注意。仅设置 num_inference_steps 本身并 不会 覆盖已保存的调度。只有显式的 sigmas 参数才能做到,而且 Qwen 指出其他调度尚未经过测试。

这个 API 的费用是多少?

阿里云Model Studio现已同时托管Turbo和Pro两个版本。 qwen-image-2.1-turbo 在大多数地区每张图片收费0.1元人民币,限制为120 RPM。 qwen-image-2.1-pro 每张图片收费0.25元人民币,限制为20 RPM。Turbo每张图片便宜2.5倍,且允许6倍的请求速率。

Qwen-Image-2.1-Turbo对比其他快速图像模型

功能Qwen-Image-2.1-TurboQwen-Image-2.1Z-Image-TurboFLUX.2 klein 9B
组织Alibaba QwenAlibaba QwenAlibaba Tongyi-MAIBlack Forest Labs
生成器规模7B7B6B9B
文本编码器Qwen3-VL 8BQwen3-VL 8B未披露Qwen3 8B
默认步数8408 NFEs4
编辑是,支持多参考是,最多10个参考否(需单独的 Edit 模型)是,支持多参考
透明 RGBA 输出是是未披露未披露
原生分辨率2K(2048×2048)2K (2048×2048)示例中为 1024×1024示例中为 1024×1024
硬件指南未公开11 GB GGUF / 24 GB FP8(Unsloth)可容纳于 16 GB 显存约 29 GB 显存,RTX 4090+
许可证Qwen Research LicenseQwen Research LicenseApache 2.0FLUX 非商业许可
Qwen-Image-Bench未公开60.28(厂商数据)未公开未公开
托管 API每张图 0.1 元人民币Pro: 每张图 0.25 元人民币未公开BFL API

要点总结

  • Qwen-Image-2.1-Turbo 在相同的 7B 架构上将去噪步数从 40 步缩减至 8 步。
  • 单一检查点即可处理 2K 文生图、多参考图编辑以及透明 RGBA 输出。
  • API 每张图价格为 0.1 元人民币,比 Pro 便宜 2.5 倍。
  • 权重采用研究许可授权,因此商业自托管需要单独获得许可。
  • 目前尚无针对 Turbo 的基准测试;基础版 Qwen-Image-2.1 在 Qwen-Image-Bench 上得分为 60.28。


请查看 ModelScope 页面, Hugging Face 页面, Pro API 以及 Turbo API。所有功劳归于该项目的研发人员。此外,欢迎在 Twitter 上关注我们,别忘了加入我们的 150k+ML SubReddit 并订阅 我们的 Newsletter。等等!你在用 Telegram 吗? 现在你也可以在 Telegram 上加入我们了。

本文《 Alibaba Qwen 发布 Qwen-Image-2.1-Turbo:一个 8 步 7B 图像模型 》首发于 MarkTechPost.

原始出处

MarkTechPost

内容说明

原始发布及相关权利归来源方。

机器翻译 · 请以原文为准