El equipo de Qwen de Alibaba ha lanzado Qwen-Image-2.1-Turbo, un checkpoint acelerado de su modelo Qwen-Image-2.1 de peso abierto. Genera y edita imágenes en 8 pasos de denoización, en lugar de los 40 pasos por defecto del modelo base. Para los desarrolladores, eso significa 5 veces menos pasos de denoización en la misma arquitectura 7B, además de una opción de API alojada.
TL;DR
- Tamaño: 7B parámetros en el generador visual, combinados con un Qwen3-VL 8B codificador de texto.
- Funciona en: GPU CUDA en BF16 a través de Diffusers. Qwen no establece un mínimo de VRAM Turbo. Unsloth estima que el modelo base funciona con 11 GB de VRAM con GGUF y 24 GB con INT8/FP8.
- Rendimiento: Mismo conjunto de características de salida y edición de 2K que Qwen-Image-2.1, con 8 pasos en lugar de 40.
- Mejor: La base Qwen-Image-2.1 obtiene un puntaje de 60.28 en Qwen-Image-Bench, el mejor puntaje de peso abierto que Qwen reporta.
- Conclusión (mejor opción): Generación y edición de 2K en 8 pasos, todo en un punto de control abierto.
- Conclusión (peor caso): Solo se necesita una licencia de investigación, por lo que las instalaciones comerciales independientes requieren permiso separado.
¿Qué es Qwen-Image-2.1-Turbo?
Qwen-Image-2.1-Turbo es un punto de control de generación y edición de imágenes en 8 pasos del equipo Qwen de Alibaba. Está construido sobre Qwen-Image-2.1. Turbo mantiene la misma arquitectura de generación visual de 7B. Se carga directamente con QwenImage21Pipeline en Diffusers.
El punto de control incluye el programa de muestreo de 8 pasos recomendado, guardado dentro. La generación utiliza CFG=1 por defecto. El almacenamiento en caché KV prefijo reutiliza el contexto de texto y imagen de referencia a lo largo de los pasos de denoising.
¿Cómo funciona Qwen-Image-2.1-Turbo?
La arquitectura subyacente es un DiT de flujo único con 32 capas y 7B parámetros. Utiliza atención causal de bloques. Los tokens de texto reciben una máscara causal a nivel de token, mientras que las imágenes utilizan una máscara bidireccional a nivel de fragmento.
- Codificador de texto: Qwen3-VL 8B codifica tanto las instrucciones como las imágenes de condición.
- VAE: un codificador automático RGBA de 64 canales con compresión espacial 16x, que permite la transparencia nativa.
- Programador de horarios: Alineación de flujo con programación discreta de Euler y desplazamiento dinámico.
El diseño de atención es lo que hace que el caché de prefijos funcione. Las imágenes y el texto de entrada se calculan una vez en el primer paso. Cada paso posterior reutiliza ese caché. Con solo 8 pasos, el prefijo almacenado cubre la mayor parte del coste de condicionamiento.
¿Qué puede generar y editar?
La tarjeta de modelo de Turbo abarca 8 categorías. Estas incluyen retratos, poses humanas, imágenes transparentes, tipografía y pósters, así como diseños de interfaz de usuario. Los ejemplos de edición incluyen la transformación de una sola imagen, composiciones con múltiples referencias y composiciones internas con 4 imágenes. El modelo base admite hasta 10 imágenes de referencia y ediciones locales mediante círculos, anotaciones dibujadas o máscaras.
¿Cómo se ejecuta Qwen-Image-2.1-Turbo?
Configurar requiere Diffusers desde la fuente, junto con transformers>=5.17.0. El checkpoint necesita PR de Diffusers #14950, que añade sigmas de muestreo configurados por pipeline.
import torch
from diffusers import QwenImage21Pipeline
pipe = QwenImage21Pipeline.from_pretrained(
"Qwen/Qwen-Image-2.1-Turbo", dtype=torch.bfloat16
).to("cuda")
image = pipe(
prompt="A ceramic teapot on a wooden table, soft window light",
width=2048, height=2048, use_kv_cache=True,
).images[0]
Para edición, utilice image=input_image con un prompt de instrucción. Los ajustes soportados abarcan desde 2048×2048 en cuadrado hasta 2752×1536 en formato 16:9.
Una cosa que hay que tener en cuenta. El establecimiento de num_inference_steps por sí solo no supera el horario guardado. Solo un argumento explícito de sigmas lo hace, y Qwen señala que otros horarios no han sido probados.
¿Cuánto cuesta la API?
El Alibaba Cloud Model Studio ahora ofrece tanto Turbo como Pro. qwen-image-2.1-turbo cuesta 0.1 CNY por imagen en la mayoría de las regiones, con un límite de 120 RPM. qwen-image-2.1-pro cuesta 0.25 CNY por imagen, con un límite de 20 RPM. Turbo es 2.5 veces más barato por imagen y permite 6 veces más tasa de solicitudes.
Qwen-Image-2.1-Turbo contra modelos de imágenes rápidos competidores
| Característica | Qwen-Image-2.1-Turbo | Qwen-Image-2.1 | Z-Image-Turbo | FLUX.2 klein 9B |
|---|---|---|---|---|
| Org | Alibaba Qwen | Alibaba Qwen | Alibaba Tongyi-MAI | Black Forest Labs |
| Tamaño del generador | 7B | 7B | 6B | 9B |
| Codificador de texto | Qwen3-VL 8B | Qwen3-VL 8B | No divulgado | Qwen3 8B |
| Pasos por defecto | 8 | 40 | 8 NFEs | 4 |
| Edición | Sí, múltiples referencias | Sí, hasta 10 referencias | No (modelo de edición separado) | Sí, múltiples referencias |
| Salida Transparente RGBA | Sí | Sí | No divulgado | No divulgado |
| Resolución nativa | 2K (2048×2048) | 2K (2048×2048) | 1024×1024 en ejemplos | 1024×1024 en ejemplos |
| Guía de hardware | No divulgado | 11 GB GGUF / 24 GB FP8 (Unsloth) | Compatible con 16 GB de VRAM | ~29 GB de VRAM, RTX 4090+ |
| Licencia | Licencia de Investigación Qwen | Licencia de Investigación Qwen | Apache 2.0 | FLUX No Comercial |
| Qwen-Image-Bench | No divulgado | 60.28 (vendedor) | No divulgado | No divulgado |
| API alojada | CNY 0.1/image | Pros: CNY 0.25/image | No divulgado | API de BFL |
Principales puntos clave
- Qwen-Image-2.1-Turbo reduce el desenfoque de 40 pasos a 8 en la misma arquitectura 7B.
- Un punto de control maneja 2K de edición texto-a-imagen, edición con múltiples referencias y salida RGBA transparente.
- La API cuesta 0.1 CNY por imagen, lo que es 2.5 veces más barato que Pro.
- Los pesos están licenciados para investigación, por lo que la alojación comercial independiente requiere permiso separado.
- Aún no existe un benchmark específico para Turbo; las puntuaciones básicas de Qwen-Image-2.1 son 60.28 en Qwen-Image-Bench.
Echa un vistazo a la página de ModelScope, página de Hugging Face, API Pro y API Turbo. Todo el crédito pertenece al investigador de este proyecto. También, no dude en seguirnos en Twitter y no olvide unirse a nuestro subreddit de 150k+ ML y suscribirse a nuestro boletín informativo. ¡Espera! ¿Estás en Telegram? Ahora puedes unirte a nosotros en Telegram también.
El artículo Alibaba Qwen lanza Qwen-Image-2.1-Turbo, un modelo de imagen de 7B con 8 pasos apareció primero en MarkTechPost.