アリババのQwenチームが発表した Qwen-Image-2.1-TurboオープンウェイトのQwen-Image-2.1モデルの加速されたチェックポイント。 8段階のノイズ除去ステップで画像を生成し、編集する ベースモデルの代わりに 40段階のデフォルト開発者にとっては、同じ7Bアーキテクチャで5倍少ないデノイズングステップが可能となり、さらにホストされたAPIオプションも利用できる。
TL;DR
- サイズ: ビジュアル生成器で7Bパラメータ、これにQwen3-VL 8Bテキストエンコーダを組み合わせています。
- 動作する環境: Diffusersを通じてBF16でのCUDA GPU。QwenはTurbo VRAMの最低値を公表していない。Unslothはベースモデルが動作すると推定している 11GBのVRAMを搭載し、GGUF形式で使用可能。INT8/FP8形式では24GBの容量が利用可能。.
- パフォーマンス: 40ステップではなく8ステップで、Qwen-Image-2.1と同じ2Kの出力と編集機能セットを提供します。
- 最優秀: Base Qwen-Image-2.1は、Qwenが報告する最高のオープン重量スコアであるQwen-Image-Benchで60.28点を獲得した。
- 結論(最良): 8ステップの2K生成と編集を一つのオープンチェックポイントで行う。
- 結論(最悪の場合):研究用ライセンスのみであり、商用での自己ホスティングには別途許可が必要です。
Qwen-Image-2.1-Turboとは何ですか?
Qwen-Image-2.1-Turboは、アリババのQwenチームによる8ステップの画像生成および編集のチェックポイントです。これはQwen-Image-2.1を基に構築されています。Turboは同じ7Bの視覚生成アーキテクチャを保持しています。Diffusers内のQwenImage21Pipelineを使用して直接読み込まれます。
チェックポイントには推奨される8ステップのサンプリングスケジュールが保存されている。生成時はデフォルトでCFG=1を使用する。プレフィックスKVキャッシュにより、ディノイズ化ステップ間でテキストと参照画像のコンテキストを再利用する。
Qwen-Image-2.1-Turboはどのように動作するのか?
基盤となるアーキテクチャは、32層、7Bパラメータを持つ単一ストリームDiTです。ブロック因果注意を使用しています。テキストトークンにはトークンレベルの因果マスクが、画像にはブロックレベルの双方向マスクが適用されます。
- テキストエンコーダ: Qwen3-VL 8Bは、指示と条件画像の両方をエンコードします。
- VAE: 16倍の空間圧縮を実施する64チャンネルRGBA自動エンコーダで、ネイティブな透明性を実現する。
- スケジューラー: エウレル式離散スケジュールと動的シフトによるフローモッチング。
アテンションデザインがプレフィックスキャッチングを機能させるものです。入力された画像とテキストは最初のステップで一度計算されます。その後の各ステップではそのキャッシュを再利用します。8ステップだけで、キャッシュされたプレフィックスがほとんどの条件付けコストをカバーします。
何を生成し、編集できますか?
Turbo モデルカード展示は8つのカテゴリーを含んでいます。これにはポートレート、人物のポーズ、透明画像、タイポグラフィ、ポスター、UIレイアウトが含まれます。編集例には、単一画像の変形、複数参照画像の組み合わせ、4枚の画像による内部構成が含まれます。ベースモデルは10枚の参照画像までのサポートを提供し、円、塗りつぶされた注釈、マスクを使ったローカル編集も可能です。
Qwen-Image-2.1-Turboをどのように実行しますか?
設定するには、ソースからDiffusersを使用する必要があります、またtransformers>=5.17.0も必要です。チェックポイントにはDiffusers PR #14950が必要で、これによりパイプラインで設定されたサンプリングシグマが追加されます。
import torch
from diffusers import QwenImage21Pipeline
pipe = QwenImage21Pipeline.from_pretrained(
"Qwen/Qwen-Image-2.1-Turbo", dtype=torch.bfloat16
).to("cuda")
image = pipe(
prompt="A ceramic teapot on a wooden table, soft window light",
width=2048, height=2048, use_kv_cache=True,
).images[0]
編集するには、image=input_imageを指示パターンと共に渡してください。サポートされているプレスットは、16:9で2048×2048ピクセルの画像から2752×1536ピクセルまで対応します。
ここで注意すべき点です。設定 num_inference_steps 一人で ない 保存されたスケジュールを無効にする。明示的なもののみ sigmas アグレンダントはそうするが、Qwenは他のスケジュールは未検証であると指摘している。
APIの料金はいくらですか?
Alibaba Cloud Model Studioは、TurboとProの両方を提供しています。qwen-image-2.1-turboは、ほとんどの地域で画像1枚あたりCNY 0.1の費用がかかり、120 RPMの制限があります。qwen-image-2.1-proは画像1枚あたりCNY 0.25の費用がかかり、20 RPMです。Turboは画像1枚あたり2.5倍安く、リクエスト率は6倍です。
Qwen-Image-2.1-Turbo vs 競合する高速画像モデル
| 機能 | Qwen-Image-2.1-Turbo | Qwen-Image-2.1 | Z-Image-Turbo | FLUX.2 klein 9B |
|---|---|---|---|---|
| Org | アリババ・クウェン | アリババ・クウェン | アルバイブ・トンイー-マイ | ブラック・フォレスト・ラボス |
| 生成器のサイズ | 7B | 7B | 6B | 9B |
| テキストエンコーダー | Qwen3-VL 8B | Qwen3-VL 8B | 明らかにされていない | Qwen3 8B |
| デフォルトの手順 | 8 | 40 | 8件のNFE | 4 |
| 編集 | はい、複数の参照 | はい、最大10件の参考文献 | いいえ(別の編集モデル) | はい、複数の参照 |
| 透明なRGBA出力 | はい | はい | 明らかにされていない | 明らかにされていない |
| ネイティブ解像度 | 2K(2048×2048) | 2K(2048×2048) | 1024×1024の例 | 1024×1024の例 |
| ハードウェアに関するガイダンス | 明らかにされていない | 11 GB GGUF / 24 GB FP8 (Unsloth) | 16GBのVRAMに対応 | ~29ギガバイトのVRAM、RTX 4090以上 |
| ライセンス | Qwen Researchライセンス | Qwen Researchライセンス | Apache 2.0 | FLUX 非商用 |
| Qwen-Image-Bench | 明らかにされていない | 60.28 (ベンダー) | 明らかにされていない | 明らかにされていない |
| ホストされたAPI | CNY 0.1/image | プロ版:CNY 0.25/image | 明らかにされていない | BFL API |
重要なポイント
- Qwen-Image-2.1-Turboは、同じ7Bアーキテクチャで、デノイズ除去のステップ数を40ステップから8ステップに削減します。
- 1つのチェックポイントが、2Kのテキストから画像への生成、複数参照の編集、透明なRGBA出力を処理する。
- APIの料金は画像1枚あたり0.1元で、Proより2.5倍安いです。
- 重量は研究許可が必要なため、商業的な自己ホストには別途許可が必要です。
- Turbo特有のベンチマークはまだ存在しない。基準のQwen-Image-2.1のスコアはQwen-Image-Benchで60.28である。
ModelScopeページ、Hugging Faceページ、Pro APIおよびTurbo APIをご覧ください。すべての功績はこのプロジェクトの研究者にあります。また、Twitterで私たちをフォローしてくだされば構いません。また、150k+ML SubRedditに参加し、ニュースレターを購読するのも忘れないでください。待って!Telegramにいますか?今ならTelegramでも私たちと参加できます。
Alibaba Qwenが8ステップ7B画像モデルであるQwen-Image-2.1-Turboを公開したという記事が、MarkTechPostに初めて掲載されました。