Alibabas Qwen-Team hat Qwen-Image-2.1-Turboveröffentlicht, einen beschleunigten Checkpoint seines Open-Weight-Modells Qwen-Image-2.1. Es erzeugt und bearbeitet Bilder in 8 Denoising-Schritten statt der 40-Schritte-Standardeinstellung des Basismodells. Für Entwickler bedeutet das 5x weniger Denoising-Schritte auf derselben 7B-Architektur, plus eine gehostete API-Option.
TL;DR
- Größe: 7B Parameter im visuellen Generator, gepaart mit einem Qwen3-VL 8B Text-Encoder.
- Läuft auf: CUDA-GPUs in BF16 via Diffusers. Qwen veröffentlicht keine Turbo-VRAM-Mindestanforderung. Unsloth schätzt, dass das Basismodell läuft auf 11 GB VRAM mit GGUF und 24 GB mit INT8/FP8.
- Leistung: Dieselbe 2K-Ausgabe und derselbe Funktionsumfang bei der Bearbeitung wie Qwen-Image-2.1, mit 8 Schritten statt 40.
- Am besten: Das Basis-Modell Qwen-Image-2.1 erreicht 60.28 auf Qwen-Image-Bench, den höchsten Open-Weight-Score, den Qwen berichtet.
- Fazit (beste Eigenschaft): 8-Schritte-2K-Generierung und -Bearbeitung in einem Open-Weight-Checkpoint.
- Fazit (schlechteste Eigenschaft): Nur Forschungslizenz, daher benötigt kommerzielles Self-Hosting eine separate Genehmigung.
Was ist Qwen-Image-2.1-Turbo?
Qwen-Image-2.1-Turbo ist ein 8-Schritte-Checkpoint für Bildgenerierung und -bearbeitung aus Alibabas Qwen-Team. Er basiert auf Qwen-Image-2.1. Turbo behält dieselbe 7B-Architektur zur visuellen Generierung bei. Er lässt sich direkt laden mit QwenImage21Pipeline in Diffusers.
Der Checkpoint wird mit seinem empfohlenen 8-Schritte-Sampling-Zeitplan ausgeliefert, der darin gespeichert ist. Die Generierung verwendet standardmäßig CFG=1. Prefix-KV-Caching nutzt den Text- und Referenzbild-Kontext über die Denoising-Schritte hinweg wieder.
Wie funktioniert Qwen-Image-2.1-Turbo?
Die zugrundeliegende Architektur ist ein Single-Stream-DiT mit 32 Schichten und 7B Parametern. Sie verwendet Block-Kausal-Attention. Text-Tokens erhalten eine Token-Level-Kausal-Maske, während Bilder eine Chunk-Level-bidirektionale Maske verwenden.
- Text-Encoder: Qwen3-VL 8B kodiert sowohl Anweisungen als auch Bedingungsbilder.
- VAE: ein 64-Kanal-RGBA-Autoencoder mit 16x räumlicher Kompression, der native Transparenz ermöglicht.
- Scheduler: Flow Matching mit Euler-Discrete-Scheduling und dynamischem Shifting.
Das Attention-Design ist das, was Prefix Caching möglich macht. Eingabebilder und Text werden einmal im ersten Schritt berechnet. Jeder spätere Schritt wiederverwendet diesen Cache. Mit nur 8 Schritten deckt der gecachte Prefix den Großteil der Konditionierungskosten ab.
Was kann es generieren und bearbeiten?
Die Turbo- Model-Card-Schau umfasst 8 Kategorien. Dazu gehören Porträts, menschliche Posen, transparente Bilder, Typografie und Poster sowie UI-Layouts. Bearbeitungsbeispiele umfassen Einzelbild-Transformation, Multi-Referenz-Komposition und 4-Bild-Innenraum-Komposition. Das Basismodell unterstützt bis zu 10 Referenzbilder und lokale Bearbeitungen über Kreise, gemalte Anmerkungen oder Masken.
Wie führt man Qwen-Image-2.1-Turbo aus?
Das Setup erfordert Diffusers aus dem Quellcodezusammen mit transformers>=5.17.0. Der Checkpoint benötigt Diffusers PR #14950, das pipeline-konfigurierte Sampling-Sigmas hinzufügt.
import torch
from diffusers import QwenImage21Pipeline
pipe = QwenImage21Pipeline.from_pretrained(
"Qwen/Qwen-Image-2.1-Turbo", dtype=torch.bfloat16
).to("cuda")
image = pipe(
prompt="A ceramic teapot on a wooden table, soft window light",
width=2048, height=2048, use_kv_cache=True,
).images[0]
Für die Bearbeitung übergibt man image=input_image mit einem Instruktions-Prompt. Unterstützte Presets reichen von 2048×2048 Quadrat bis 2752×1536 bei 16:9.
Eine Sache ist hier zu beachten. Das bloße Setzen von num_inference_steps allein überschreibt nicht den gespeicherten Zeitplan. Nur ein explizites sigmas Argument tut dies, und Qwen weist darauf hin, dass andere Zeitpläne ungetestet sind.
Was kostet die API?
Alibaba Cloud Model Studio bietet jetzt sowohl Turbo als auch Pro an. qwen-image-2.1-turbo kostet in den meisten Regionen CNY 0.1 pro Bild, mit einem Limit von 120 RPM. qwen-image-2.1-pro kostet CNY 0.25 pro Bild, mit 20 RPM. Turbo ist 2.5x günstiger pro Bild und erlaubt die 6-fache Anforderungsrate.
Qwen-Image-2.1-Turbo im Vergleich zu konkurrierenden schnellen Bildmodellen
| Funktion | Qwen-Image-2.1-Turbo | Qwen-Image-2.1 | Z-Image-Turbo | FLUX.2 klein 9B |
|---|---|---|---|---|
| Org | Alibaba Qwen | Alibaba Qwen | Alibaba Tongyi-MAI | Black Forest Labs |
| Generatorgröße | 7B | 7B | 6B | 9B |
| Text-Encoder | Qwen3-VL 8B | Qwen3-VL 8B | Nicht offengelegt | Qwen3 8B |
| Standard-Schritte | 8 | 40 | 8 NFEs | 4 |
| Bearbeitung | Ja, Mehrfachreferenz | Ja, bis zu 10 Referenzen | Nein (separates Edit-Modell) | Ja, Mehrfachreferenz |
| Transparentes RGBA-Format | Ja | Ja | Nicht offengelegt | Nicht offengelegt |
| Native Auflösung | 2K (2048×2048) | 2K (2048×2048) | 1024×1024 in Beispielen | 1024×1024 in Beispielen |
| Hardware-Hinweise | Nicht offengelegt | 11 GB GGUF / 24 GB FP8 (Unsloth) | Passt in 16 GB VRAM | ~29 GB VRAM, RTX 4090+ |
| Lizenz | Qwen Research License | Qwen Research License | Apache 2.0 | FLUX Non-Commercial |
| Qwen-Image-Bench | Nicht offengelegt | 60.28 (Herstellerangabe) | Nicht offengelegt | Nicht offengelegt |
| Gehostete API | CNY 0.1/Bild | Pro: CNY 0.25/Bild | Nicht offengelegt | BFL API |
Kernerkenntnisse
- Qwen-Image-2.1-Turbo reduziert die Denoising-Schritte von 40 auf 8 bei derselben 7B-Architektur.
- Ein Checkpoint bewältigt 2K-Text-zu-Bild, Multi-Reference-Bearbeitung und transparente RGBA-Ausgabe.
- Die API kostet CNY 0.1 pro Bild, 2.5x günstiger als Pro.
- Die Gewichte sind forschungslizenziert, daher benötigt kommerzielles Self-Hosting eine separate Genehmigung.
- Es gibt noch keinen Turbo-spezifischen Benchmark; das Basis-Modell Qwen-Image-2.1 erreicht 60.28 auf dem Qwen-Image-Bench.
Schauen Sie sich die ModelScope-Seite, Hugging Face-Seite, Pro API und Turbo API. All credit gebührt der Forscherin bzw. dem Forscher dieses Projekts. Folgen Sie uns gerne außerdem auf Twitter und vergessen Sie nicht, unserem 150k+ ML SubReddit beizutreten und unseren Newsletterzu abonnieren. Moment! Sind Sie auf Telegram? jetzt können Sie uns auch auf Telegram beitreten.
Der Beitrag Alibaba Qwen veröffentlicht Qwen-Image-2.1-Turbo, ein 8-Schritte-7B-Bildmodell erschien zuerst auf MarkTechPost.