MarkTechPost

Alibaba Qwen lanza Qwen-Image-2.1-Turbo, un modelo de imagen de 7B con 8 pasos

El equipo de Qwen de Alibaba ha lanzado Qwen-Image-2.1-Turbo, un checkpoint acelerado de su modelo Qwen-Image-2.1 de peso abierto. Genera y edita imágenes en 8 pasos de denoización, en lugar de los 40 pasos por defecto…

El equipo de Qwen de Alibaba ha lanzado Qwen-Image-2.1-Turbo, un checkpoint acelerado de su modelo Qwen-Image-2.1 de peso abierto. Genera y edita imágenes en 8 pasos de denoización, en lugar de los 40 pasos por defecto del modelo base. Para los desarrolladores, eso significa 5 veces menos pasos de denoización en la misma arquitectura 7B, además de una opción de API alojada.

TL;DR

  • Tamaño: 7B parámetros en el generador visual, combinados con un Qwen3-VL 8B codificador de texto.
  • Funciona en: GPU CUDA en BF16 a través de Diffusers. Qwen no establece un mínimo de VRAM Turbo. Unsloth estima que el modelo base funciona con 11 GB de VRAM con GGUF y 24 GB con INT8/FP8.
  • Rendimiento: Mismo conjunto de características de salida y edición de 2K que Qwen-Image-2.1, con 8 pasos en lugar de 40.
  • Mejor: La base Qwen-Image-2.1 obtiene un puntaje de 60.28 en Qwen-Image-Bench, el mejor puntaje de peso abierto que Qwen reporta.
  • Conclusión (mejor opción): Generación y edición de 2K en 8 pasos, todo en un punto de control abierto.
  • Conclusión (peor caso): Solo se necesita una licencia de investigación, por lo que las instalaciones comerciales independientes requieren permiso separado.

¿Qué es Qwen-Image-2.1-Turbo?

Qwen-Image-2.1-Turbo es un punto de control de generación y edición de imágenes en 8 pasos del equipo Qwen de Alibaba. Está construido sobre Qwen-Image-2.1. Turbo mantiene la misma arquitectura de generación visual de 7B. Se carga directamente con QwenImage21Pipeline en Diffusers.

El punto de control incluye el programa de muestreo de 8 pasos recomendado, guardado dentro. La generación utiliza CFG=1 por defecto. El almacenamiento en caché KV prefijo reutiliza el contexto de texto y imagen de referencia a lo largo de los pasos de denoising.

¿Cómo funciona Qwen-Image-2.1-Turbo?

La arquitectura subyacente es un DiT de flujo único con 32 capas y 7B parámetros. Utiliza atención causal de bloques. Los tokens de texto reciben una máscara causal a nivel de token, mientras que las imágenes utilizan una máscara bidireccional a nivel de fragmento.

  • Codificador de texto: Qwen3-VL 8B codifica tanto las instrucciones como las imágenes de condición.
  • VAE: un codificador automático RGBA de 64 canales con compresión espacial 16x, que permite la transparencia nativa.
  • Programador de horarios: Alineación de flujo con programación discreta de Euler y desplazamiento dinámico.

El diseño de atención es lo que hace que el caché de prefijos funcione. Las imágenes y el texto de entrada se calculan una vez en el primer paso. Cada paso posterior reutiliza ese caché. Con solo 8 pasos, el prefijo almacenado cubre la mayor parte del coste de condicionamiento.

¿Qué puede generar y editar?

La tarjeta de modelo de Turbo abarca 8 categorías. Estas incluyen retratos, poses humanas, imágenes transparentes, tipografía y pósters, así como diseños de interfaz de usuario. Los ejemplos de edición incluyen la transformación de una sola imagen, composiciones con múltiples referencias y composiciones internas con 4 imágenes. El modelo base admite hasta 10 imágenes de referencia y ediciones locales mediante círculos, anotaciones dibujadas o máscaras.

¿Cómo se ejecuta Qwen-Image-2.1-Turbo?

Configurar requiere Diffusers desde la fuente, junto con transformers>=5.17.0. El checkpoint necesita PR de Diffusers #14950, que añade sigmas de muestreo configurados por pipeline.

Copiar código
import torch
from diffusers import QwenImage21Pipeline

pipe = QwenImage21Pipeline.from_pretrained(
    "Qwen/Qwen-Image-2.1-Turbo", dtype=torch.bfloat16
).to("cuda")

image = pipe(
    prompt="A ceramic teapot on a wooden table, soft window light",
    width=2048, height=2048, use_kv_cache=True,
).images[0]

Para edición, utilice image=input_image con un prompt de instrucción. Los ajustes soportados abarcan desde 2048×2048 en cuadrado hasta 2752×1536 en formato 16:9.

Una cosa que hay que tener en cuenta. El establecimiento de num_inference_steps por sí solo no supera el horario guardado. Solo un argumento explícito de sigmas lo hace, y Qwen señala que otros horarios no han sido probados.

¿Cuánto cuesta la API?

El Alibaba Cloud Model Studio ahora ofrece tanto Turbo como Pro. qwen-image-2.1-turbo cuesta 0.1 CNY por imagen en la mayoría de las regiones, con un límite de 120 RPM. qwen-image-2.1-pro cuesta 0.25 CNY por imagen, con un límite de 20 RPM. Turbo es 2.5 veces más barato por imagen y permite 6 veces más tasa de solicitudes.

Qwen-Image-2.1-Turbo contra modelos de imágenes rápidos competidores

CaracterísticaQwen-Image-2.1-TurboQwen-Image-2.1Z-Image-TurboFLUX.2 klein 9B
OrgAlibaba QwenAlibaba QwenAlibaba Tongyi-MAIBlack Forest Labs
Tamaño del generador7B7B6B9B
Codificador de textoQwen3-VL 8BQwen3-VL 8BNo divulgadoQwen3 8B
Pasos por defecto8408 NFEs4
EdiciónSí, múltiples referenciasSí, hasta 10 referenciasNo (modelo de edición separado)Sí, múltiples referencias
Salida Transparente RGBASíSíNo divulgadoNo divulgado
Resolución nativa2K (2048×2048)2K (2048×2048)1024×1024 en ejemplos1024×1024 en ejemplos
Guía de hardwareNo divulgado11 GB GGUF / 24 GB FP8 (Unsloth)Compatible con 16 GB de VRAM~29 GB de VRAM, RTX 4090+
LicenciaLicencia de Investigación QwenLicencia de Investigación QwenApache 2.0FLUX No Comercial
Qwen-Image-BenchNo divulgado60.28 (vendedor)No divulgadoNo divulgado
API alojadaCNY 0.1/imagePros: CNY 0.25/imageNo divulgadoAPI de BFL

Principales puntos clave

  • Qwen-Image-2.1-Turbo reduce el desenfoque de 40 pasos a 8 en la misma arquitectura 7B.
  • Un punto de control maneja 2K de edición texto-a-imagen, edición con múltiples referencias y salida RGBA transparente.
  • La API cuesta 0.1 CNY por imagen, lo que es 2.5 veces más barato que Pro.
  • Los pesos están licenciados para investigación, por lo que la alojación comercial independiente requiere permiso separado.
  • Aún no existe un benchmark específico para Turbo; las puntuaciones básicas de Qwen-Image-2.1 son 60.28 en Qwen-Image-Bench.


Echa un vistazo a la página de ModelScope, página de Hugging Face, API Pro y API Turbo. Todo el crédito pertenece al investigador de este proyecto. También, no dude en seguirnos en Twitter y no olvide unirse a nuestro subreddit de 150k+ ML y suscribirse a nuestro boletín informativo. ¡Espera! ¿Estás en Telegram? Ahora puedes unirte a nosotros en Telegram también.

El artículo Alibaba Qwen lanza Qwen-Image-2.1-Turbo, un modelo de imagen de 7B con 8 pasos apareció primero en MarkTechPost.

Fuente original

MarkTechPost

Notas sobre el contenido

La publicación original y los derechos pertenecen a la fuente.

Traducción automática · Consulte el original