L’équipe Qwen d’Alibaba a lancé Qwen-Image-2.1-Turbo, une version accélérée du modèle Qwen-Image-2.1 de poids ouvert. Elle génère et modifie des images en 8 étapes de débruitage, contrairement aux 40 étapes par défaut du modèle de base. Pour les développeurs, cela signifie 5 fois moins d’étapes de débruitage sur la même architecture 7B, ainsi qu’une option d’API hébergée.
TL;DR
- Dimensions : 7B de paramètres dans le générateur visuel, associé à un Qwen3-VL 8B encodage de texte.
- Exécution sur : GPU CUDA en BF16 via Diffusers. Qwen ne fixe aucune minimum de VRAM Turbo. Unsloth estime que le modèle de base fonctionne avec 11 GB de VRAM avec GGUF et 24 GB avec INT8/FP8.
- Performance : Même ensemble de fonctionnalités d’affichage et d’édition de 2K, comme Qwen-Image-2.1, mais avec 8 étapes au lieu de 40.
- Meilleur : La base Qwen-Image-2.1 obtient 60.28 sur Qwen-Image-Bench, le meilleur score de poids ouvert que Qwen mentionne.
- Conclusion (meilleure solution) : Génération et édition en 8 étapes avec 2K, dans un seul point de contrôle ouvert.
- Conclusion (pire cas) : Seulement une licence de recherche, donc pour l'hébergement commercial individuel, une autorisation distincte est nécessaire.
Qu'est-ce que Qwen-Image-2.1-Turbo ?
Qwen-Image-2.1-Turbo est un point de contrôle de génération et d’édition d’images en 8 étapes provenant de l’équipe Qwen d’Alibaba. Il est basé sur Qwen-Image-2.1. Turbo conserve la même architecture de génération visuelle de 7B. Il est chargé directement avec QwenImage21Pipeline dans Diffusers.
Le point de contrôle inclut un programme de sampling recommandé de 8 étapes, qui est sauvegardé à l’intérieur. La génération utilise par défaut CFG=1. Le stockage en cache KV préfixe réutilise le contexte de texte et d’image de référence entre les différentes étapes de débruitage.
Comment fonctionne Qwen-Image-2.1-Turbo ?
L’architecture sous-jacente est un DiT à flux unique avec 32 couches et 7B paramètres. Elle utilise l’attention causal block-causal. Les tokens de texte reçoivent une masque causale au niveau du token, tandis que les images utilisent une masque bidirectionnelle au niveau des blocs.
- Encodage de texte : Qwen3-VL 8B encode à la fois les instructions et les images de conditions.
- VAE : un encodage auto de 64 canaux RGBA avec une compression spatiale 16 fois plus efficace, permettant ainsi une transparence native.
- Planificateur : Matching de flux avec un planification discrète d’Euler et un déplacement dynamique.
Le design d’attention est ce qui fait fonctionner le stockage en préfixe. Les images et le texte d’entrée sont calculés une fois au premier étape. Chaque étape ultérieure utilise cette cache. Avec seulement 8 étapes, le préfixe stocké couvre la plupart du coût de conditionnement.
Qu’est-ce qu’il peut générer et éditer ?
La carte de modèle Turbo couvre 8 catégories. Celles-ci incluent des portraits, des poses humaines, des images transparentes, la typographie et les affiches, ainsi que les agencements d’interface utilisateur. Les exemples d’édition comprennent la transformation d’une seule image, la composition multi-référence et la composition intérieure de 4 images. Le modèle de base prend en charge jusqu’10 images de référence et des éditions locales via des cercles, des annotations peintes ou des masques.
Comment exécuter Qwen-Image-2.1-Turbo ?
Configuration exige les Diffusers provenant de la source, ainsi que transformers>=5.17.0. Le checkpoint nécessite Diffusers PR #14950, qui ajoute les sigmas de sampling configurés dans le pipeline.
import torch
from diffusers import QwenImage21Pipeline
pipe = QwenImage21Pipeline.from_pretrained(
"Qwen/Qwen-Image-2.1-Turbo", dtype=torch.bfloat16
).to("cuda")
image = pipe(
prompt="A ceramic teapot on a wooden table, soft window light",
width=2048, height=2048, use_kv_cache=True,
).images[0]
Pour l’édition, passez image=input_image avec un prompt d’instruction. Les préférences supportées couvrent des dimensions de 2048×2048 carré à 2752×1536 en format 16:9.
Une chose à noter ici : la définition de num_inference_steps seule n’annule pas le programme stocké. Seul un argument explicite sigmas peut le faire, et Qwen note que les autres programmes ne sont pas testés.
Quel est le coût de l’API ?
Le Model Studio de Alibaba Cloud propose désormais les deux versions : Turbo et Pro. qwen-image-2.1-turbo coûte 0,1 CNY par image dans la plupart des régions, avec une limite de 120 RPM. qwen-image-2.1-pro coûte 0,25 CNY par image, avec 20 RPM. La version Turbo est 2,5 fois moins chère par image et permet une fréquence de requête 6 fois plus élevée.
Qwen-Image-2.1-Turbo contre les modèles d'images rapides concurrents
| Caractéristique | Qwen-Image-2.1-Turbo | Qwen-Image-2.1 | Z-Image-Turbo | FLUX.2 klein 9B |
|---|---|---|---|---|
| Org | Alibaba Qwen | Alibaba Qwen | Alibaba Tongyi-MAI | Black Forest Labs |
| Taille du générateur | 7B | 7B | 6B | 9B |
| Encodage de texte | Qwen3-VL 8B | Qwen3-VL 8B | Non divulgué | Qwen3 8B |
| Étapes par défaut | 8 | 40 | 8 NFEs | 4 |
| Sélectionner | Oui, multi-référence | Oui, jusqu’à 10 références | Non (modèle d’édition distinct) | Oui, multi-référence |
| Output RGBA transparent | Oui | Oui | Non divulgué | Non divulgué |
| Résolution native | 2K (2048×2048) | 2K (2048×2048) | 1024×1024 dans les exemples | 1024×1024 dans les exemples |
| Conseils sur le matériel | Non divulgué | 11 GB GGUF / 24 GB FP8 (Unsloth) | Adapté pour 16 Go de VRAM | ~29 Go de VRAM, RTX 4090+ |
| Licence | Licence de recherche Qwen | Licence de recherche Qwen | Apache 2.0 | FLUX Non-Commercial |
| Qwen-Image-Bench | Non divulgué | 60.28 (vendeur) | Non divulgué | Non divulgué |
| API hébergée | CNY 0.1/image | Avantages : 0,25 image par année nouvelle | Non divulgué | BFL API |
Points clés
- Qwen-Image-2.1-Turbo réduit le nettoyage de l’image de 40 étapes à 8 sur la même architecture 7B.
- Un point de contrôle gère 2K de texte à image, l’édition multi-références et la sortie RGBA transparente.
- L’API coûte 0,1 CNY par image, soit 2,5 fois moins cher que Pro.
- Les poids sont autorisés par la recherche, donc les installations commerciales nécessitent une autorisation distincte.
- Aucun benchmark spécifique à Turbo n’existe encore ; les scores de base de Qwen-Image-2.1 sont de 60.28 sur Qwen-Image-Bench.
Vérifiez la page ModelScope, page Hugging Face, API Pro et API Turbo. Tout le crédit revient au chercheur de ce projet. Veuillez également nous suivre sur Twitter et n’oubliez pas de rejoindre notre subreddit 150k+ML et de vous abonner à nos newsletter. Attendez ! êtes-vous sur Telegram ? Maintenant, vous pouvez également nous rejoindre sur Telegram.
La publication Alibaba Qwen publie Qwen-Image-2.1-Turbo, un modèle d’image de 7B à 8 étapes a été publiée en premier sur MarkTechPost.