MarkTechPost

Alibaba Qwen veröffentlicht Qwen-Image-2.1-Turbo, ein 8-Schritte-7B-Bildmodell

Alibabas Qwen-Team hat Qwen-Image-2.1-Turbo veröffentlicht, einen beschleunigten Checkpoint seines Open-Weight-Modells Qwen-Image-2.1. Es erzeugt und bearbeitet Bilder in 8 Denoising-Schritten statt der 40 Schritte des…

Alibabas Qwen-Team hat Qwen-Image-2.1-Turboveröffentlicht, einen beschleunigten Checkpoint seines Open-Weight-Modells Qwen-Image-2.1. Es erzeugt und bearbeitet Bilder in 8 Denoising-Schritten statt der 40-Schritte-Standardeinstellung des Basismodells. Für Entwickler bedeutet das 5x weniger Denoising-Schritte auf derselben 7B-Architektur, plus eine gehostete API-Option.

TL;DR

  • Größe: 7B Parameter im visuellen Generator, gepaart mit einem Qwen3-VL 8B Text-Encoder.
  • Läuft auf: CUDA-GPUs in BF16 via Diffusers. Qwen veröffentlicht keine Turbo-VRAM-Mindestanforderung. Unsloth schätzt, dass das Basismodell läuft auf 11 GB VRAM mit GGUF und 24 GB mit INT8/FP8.
  • Leistung: Dieselbe 2K-Ausgabe und derselbe Funktionsumfang bei der Bearbeitung wie Qwen-Image-2.1, mit 8 Schritten statt 40.
  • Am besten: Das Basis-Modell Qwen-Image-2.1 erreicht 60.28 auf Qwen-Image-Bench, den höchsten Open-Weight-Score, den Qwen berichtet.
  • Fazit (beste Eigenschaft): 8-Schritte-2K-Generierung und -Bearbeitung in einem Open-Weight-Checkpoint.
  • Fazit (schlechteste Eigenschaft): Nur Forschungslizenz, daher benötigt kommerzielles Self-Hosting eine separate Genehmigung.

Was ist Qwen-Image-2.1-Turbo?

Qwen-Image-2.1-Turbo ist ein 8-Schritte-Checkpoint für Bildgenerierung und -bearbeitung aus Alibabas Qwen-Team. Er basiert auf Qwen-Image-2.1. Turbo behält dieselbe 7B-Architektur zur visuellen Generierung bei. Er lässt sich direkt laden mit QwenImage21Pipeline in Diffusers.

Der Checkpoint wird mit seinem empfohlenen 8-Schritte-Sampling-Zeitplan ausgeliefert, der darin gespeichert ist. Die Generierung verwendet standardmäßig CFG=1. Prefix-KV-Caching nutzt den Text- und Referenzbild-Kontext über die Denoising-Schritte hinweg wieder.

Wie funktioniert Qwen-Image-2.1-Turbo?

Die zugrundeliegende Architektur ist ein Single-Stream-DiT mit 32 Schichten und 7B Parametern. Sie verwendet Block-Kausal-Attention. Text-Tokens erhalten eine Token-Level-Kausal-Maske, während Bilder eine Chunk-Level-bidirektionale Maske verwenden.

  • Text-Encoder: Qwen3-VL 8B kodiert sowohl Anweisungen als auch Bedingungsbilder.
  • VAE: ein 64-Kanal-RGBA-Autoencoder mit 16x räumlicher Kompression, der native Transparenz ermöglicht.
  • Scheduler: Flow Matching mit Euler-Discrete-Scheduling und dynamischem Shifting.

Das Attention-Design ist das, was Prefix Caching möglich macht. Eingabebilder und Text werden einmal im ersten Schritt berechnet. Jeder spätere Schritt wiederverwendet diesen Cache. Mit nur 8 Schritten deckt der gecachte Prefix den Großteil der Konditionierungskosten ab.

Was kann es generieren und bearbeiten?

Die Turbo- Model-Card-Schau umfasst 8 Kategorien. Dazu gehören Porträts, menschliche Posen, transparente Bilder, Typografie und Poster sowie UI-Layouts. Bearbeitungsbeispiele umfassen Einzelbild-Transformation, Multi-Referenz-Komposition und 4-Bild-Innenraum-Komposition. Das Basismodell unterstützt bis zu 10 Referenzbilder und lokale Bearbeitungen über Kreise, gemalte Anmerkungen oder Masken.

Wie führt man Qwen-Image-2.1-Turbo aus?

Das Setup erfordert Diffusers aus dem Quellcodezusammen mit transformers>=5.17.0. Der Checkpoint benötigt Diffusers PR #14950, das pipeline-konfigurierte Sampling-Sigmas hinzufügt.

Code kopieren
import torch
from diffusers import QwenImage21Pipeline

pipe = QwenImage21Pipeline.from_pretrained(
    "Qwen/Qwen-Image-2.1-Turbo", dtype=torch.bfloat16
).to("cuda")

image = pipe(
    prompt="A ceramic teapot on a wooden table, soft window light",
    width=2048, height=2048, use_kv_cache=True,
).images[0]

Für die Bearbeitung übergibt man image=input_image mit einem Instruktions-Prompt. Unterstützte Presets reichen von 2048×2048 Quadrat bis 2752×1536 bei 16:9.

Eine Sache ist hier zu beachten. Das bloße Setzen von num_inference_steps allein überschreibt nicht den gespeicherten Zeitplan. Nur ein explizites sigmas Argument tut dies, und Qwen weist darauf hin, dass andere Zeitpläne ungetestet sind.

Was kostet die API?

Alibaba Cloud Model Studio bietet jetzt sowohl Turbo als auch Pro an. qwen-image-2.1-turbo kostet in den meisten Regionen CNY 0.1 pro Bild, mit einem Limit von 120 RPM. qwen-image-2.1-pro kostet CNY 0.25 pro Bild, mit 20 RPM. Turbo ist 2.5x günstiger pro Bild und erlaubt die 6-fache Anforderungsrate.

Qwen-Image-2.1-Turbo im Vergleich zu konkurrierenden schnellen Bildmodellen

FunktionQwen-Image-2.1-TurboQwen-Image-2.1Z-Image-TurboFLUX.2 klein 9B
OrgAlibaba QwenAlibaba QwenAlibaba Tongyi-MAIBlack Forest Labs
Generatorgröße7B7B6B9B
Text-EncoderQwen3-VL 8BQwen3-VL 8BNicht offengelegtQwen3 8B
Standard-Schritte8408 NFEs4
BearbeitungJa, MehrfachreferenzJa, bis zu 10 ReferenzenNein (separates Edit-Modell)Ja, Mehrfachreferenz
Transparentes RGBA-FormatJaJaNicht offengelegtNicht offengelegt
Native Auflösung2K (2048×2048)2K (2048×2048)1024×1024 in Beispielen1024×1024 in Beispielen
Hardware-HinweiseNicht offengelegt11 GB GGUF / 24 GB FP8 (Unsloth)Passt in 16 GB VRAM~29 GB VRAM, RTX 4090+
LizenzQwen Research LicenseQwen Research LicenseApache 2.0FLUX Non-Commercial
Qwen-Image-BenchNicht offengelegt60.28 (Herstellerangabe)Nicht offengelegtNicht offengelegt
Gehostete APICNY 0.1/BildPro: CNY 0.25/BildNicht offengelegtBFL API

Kernerkenntnisse

  • Qwen-Image-2.1-Turbo reduziert die Denoising-Schritte von 40 auf 8 bei derselben 7B-Architektur.
  • Ein Checkpoint bewältigt 2K-Text-zu-Bild, Multi-Reference-Bearbeitung und transparente RGBA-Ausgabe.
  • Die API kostet CNY 0.1 pro Bild, 2.5x günstiger als Pro.
  • Die Gewichte sind forschungslizenziert, daher benötigt kommerzielles Self-Hosting eine separate Genehmigung.
  • Es gibt noch keinen Turbo-spezifischen Benchmark; das Basis-Modell Qwen-Image-2.1 erreicht 60.28 auf dem Qwen-Image-Bench.


Schauen Sie sich die ModelScope-Seite, Hugging Face-Seite, Pro API und Turbo API. All credit gebührt der Forscherin bzw. dem Forscher dieses Projekts. Folgen Sie uns gerne außerdem auf Twitter und vergessen Sie nicht, unserem 150k+ ML SubReddit beizutreten und unseren Newsletterzu abonnieren. Moment! Sind Sie auf Telegram? jetzt können Sie uns auch auf Telegram beitreten.

Der Beitrag Alibaba Qwen veröffentlicht Qwen-Image-2.1-Turbo, ein 8-Schritte-7B-Bildmodell erschien zuerst auf MarkTechPost.

Originalquelle

MarkTechPost

Hinweise zum Inhalt

Originalveröffentlichung und Rechte liegen bei der Quelle.

Maschinelle Übersetzung · Original beachten