알리바바의 Qwen 팀이 출시했습니다 Qwen-Image-2.1-Turbo오픈 웰티지 Qwen-Image-2.1 모델의 가속화된 체크포인트입니다. 8단계 디노이징 단계를 통해 이미지를 생성하고 편집합니다. 기본 모델 대신에 40단계 기본 설정. 개발자들에게는 같은 7B 아키텍처에서 5배 더 적은 디노이징 단계가 가능하며, 호스팅된 API 옵션도 제공됩니다.
TL;DR
- 크기: 시각 생성기에 사용되는 7B 파라미터와, Qwen3-VL 8B 텍스트 인코더가 조합되어 있습니다.
- 실행 가능한 환경: Diffusers를 통해 BF16 형식으로 CUDA GPU에서 실행됩니다. Qwen은 Turbo VRAM 최소 요구 사항을 명시하지 않습니다. Unsloth는 기본 모델이 GGUF 형식으로 11 GB VRAM에서, INT8/FP8 형식으로 24 GB VRAM에서 실행된다고 추정합니다.
- 성능: 40단계 대신 8단계로 작동하며, Qwen-Image-2.1과 동일한 2K 출력 및 편집 기능 세트를 제공합니다.
- 최고: Base Qwen-Image-2.1은 Qwen-Image-Bench에서 60.28점을 얻었으며, 이는 Qwen이 발표한 최고의 오픈-웰 점수입니다.
- 결론 (최적): 8단계 2K 생성 및 편집이 하나의 열린 체크포인트에서 이루어짐.
- 최악의 상황: 연구용 라이선스만 필요하므로, 상업적 자체 호스팅에는 별도의 허가가 필요합니다.
Qwen-Image-2.1-Turbo는 무엇인가요?
Qwen-Image-2.1-Turbo는 알리바바의 Qwen 팀에서 개발한 8단계 이미지 생성 및 편집 체크포인트입니다. 이는 Qwen-Image-2.1를 기반으로 구축되었습니다. Turbo는 동일한 7B 시각적 생성 아키텍처를 유지합니다. Diffusers에서 QwenImage21Pipeline를 사용하여 직접 로드할 수 있습니다.
체크포인트에는 권장되는 8단계 샘플링 일정이 저장되어 있습니다. 생성 과정에서는 기본적으로 CFG=1을 사용합니다. 프리픽스 KV 캐싱은 디노이징 단계 간에 텍스트와 참조 이미지의 맥락을 재사용합니다.
Qwen-Image-2.1-Turbo는 어떻게 작동하나요?
기반이 되는 아키텍처는 32층, 7B 파라미터를 가진 단일 스트림 DiT입니다. 블록-캐리어적 관심을 사용합니다. 텍스트 토큰은 토큰 수준의 캐리어 마스크를 받고, 이미지는 블록 수준의 양방향 마스크를 받습니다.
- 텍스트 인코더: Qwen3-VL 8B은 지시와 조건 이미지 모두를 인코딩합니다.
- VAE: 16배 공간 압축을 적용한 64채널 RGBA 자동인코더로, 원본 형태의 투명성을 구현합니다.
- 스케줄러: 에우허이 디스크립트 스케줄링 및 동적 이동 기능을 갖춘 플로우 매칭.
주의 설계가 프리픽스 캐싱이 작동하는 원인입니다. 입력 이미지와 텍스트는 첫 번째 단계에서 한 번만 계산됩니다. 이후 모든 단계에서는 그 캐시를 재사용합니다. 8단계만으로도 캐시된 프리픽스가 대부분의 조건화 비용을 커버합니다.
무엇을 생성하고 편집할 수 있나요?
Turbo 모델 카드 쇼케이스는 8가지 범주를 포함합니다. 여기에는 초상화, 인간 포즈, 투명 이미지, 타이포그래피 및 포스터, UI 레이아웃 등이 포함됩니다. 편집 예시로는 단일 이미지 변형, 다중 참조 구성, 4개 이미지 내부 구성이 포함됩니다. 기본 모델은 10개의 참조 이미지와 원, 그린 주석 또는 마스크를 통한 로컬 편집을 지원합니다.
Qwen-Image-2.1-Turbo를 어떻게 실행하나요?
설정은 소스에서 Diffusers를 필요로 합니다, 그리고 transformers>=5.17.0도 필요합니다. 체크포인트는Diffusers PR #14950가 필요하며, 이 PR에는 파이프라인으로 구성된 샘플링 sigmas가 추가됩니다.
import torch
from diffusers import QwenImage21Pipeline
pipe = QwenImage21Pipeline.from_pretrained(
"Qwen/Qwen-Image-2.1-Turbo", dtype=torch.bfloat16
).to("cuda")
image = pipe(
prompt="A ceramic teapot on a wooden table, soft window light",
width=2048, height=2048, use_kv_cache=True,
).images[0]
편집을 위해 image=input_image를 지시문과 함께 전달하세요. 지원되는 프리셋은 2048×2048 사각형부터 2752×1536, 16:9 비율까지 사용할 수 있습니다.
여기서 주목해야 할 한 가지 점입니다. 설정 num_inference_steps 혼자서 아니요 저장된 일정을 무효화합니다. 명시적인 방식으로만 가능함 sigmas 주장은 그렇게 하고, Qwen은 다른 일정들이 테스트되지 않았다고 지적합니다.
API 비용은 얼마인가요?
알리바바 클라우드 모델 스튜디오는 Turbo와 Pro 모두를 제공합니다. qwen-image-2.1-turbo는 대부분의 지역에서 이미지당 CNY 0.1의 비용이 듭니다. 120 RPM의 제한이 있습니다. qwen-image-2.1-pro는 이미지당 CNY 0.25의 비용이 듭니다. 20 RPM의 제한이 있습니다. Turbo는 이미지당 2.5배 저렴하며 요청률은 6배 더 높습니다.
Qwen-Image-2.1-Turbo vs 경쟁하는 빠른 이미지 모델들
| 기능 | Qwen-Image-2.1-Turbo | Qwen-Image-2.1 | Z-Image-Turbo | FLUX.2 klein 9B |
|---|---|---|---|---|
| Org | 알리바바 큐웬 | 알리바바 큐웬 | 알리바바 통이-마이 | 블랙 포레스트 랩스 |
| 생성기 크기 | 7B | 7B | 6B | 9B |
| 텍스트 인코더 | Qwen3-VL 8B | Qwen3-VL 8B | 공개되지 않았습니다 | Qwen3 8B |
| 기본 단계 | 8 | 40 | 8개의 NFE | 4 |
| 편집 | 네, 다중 참조가 있습니다 | 네, 최대 10개의 참조가 가능합니다 | 아니요 (별도의 편집 모델) | 네, 다중 참조가 있습니다 |
| 투명한 RGBA 출력 | 예 | 예 | 공개되지 않았습니다 | 공개되지 않았습니다 |
| 네이티브 해상도 | 2K (2048×2048) | 2K (2048×2048) | 1024×1024 예시에서 | 1024×1024 예시에서 |
| 하드웨어 지침 | 공개되지 않았습니다 | 11 GB GGUF / 24 GB FP8 (Unsloth) | 16GB VRAM을 지원합니다 | ~29 기가바이트 VRAM, RTX 4090+ |
| 라이선스 | 궁연 연구 라이선스 | 궁연 연구 라이선스 | Apache 2.0 | FLUX 비상업적 |
| Qwen-Image-Bench | 공개되지 않았습니다 | 60.28 (공급업체) | 공개되지 않았습니다 | 공개되지 않았습니다 |
| 호스팅된 API | CNY 0.1/image | 프로 버전: CNY 0.25/image | 공개되지 않았습니다 | BFL API |
주요 요점
- Qwen-Image-2.1-Turbo는 동일한 7B 아키텍처에서 디노이징 제거 단계를 40단계에서 8단계로 줄였습니다.
- 한 점검소는 2K 텍스트에서 이미지로의 변환, 다중 참조 편집 및 투명 RGBA 출력을 처리합니다.
- API는 이미지당 CNY 0.1의 비용이며, Pro보다 2.5배 저렴합니다.
- 무게 값은 연구 허가를 받았으므로, 상업적 자체 호스팅에는 별도의 허가가 필요합니다.
- Turbo에 특화된 벤치마크는 아직 존재하지 않습니다; 기본 Qwen-Image-2.1 점수는 Qwen-Image-Bench에서 60.28입니다.
ModelScope 페이지, Hugging Face 페이지, Pro API 및 Turbo API를 확인해 보세요. 모든 공로는 이 프로젝트의 연구원에게 있습니다. 또한, Twitter에서 저희를 팔로우하시고, 150k+ML SubReddit에 참여하고 저희 뉴스레터를 구독하시기 바랍니다. 잠깐! Telegram에도 있나요? 이제 Telegram에서도 저희와 함께할 수 있습니다.
Alibaba Qwen이 8단계 7B 이미지 모델인 Qwen-Image-2.1-Turbo를 출시했습니다라는 글이 MarkTechPost에 처음 게시되었습니다.