MarkTechPost

アリババ・Qwenが、8ステップの7BイメージモデルであるQwen-Image-2.1-Turboを公開

アリババのQwenチームは、オープンウェイトのQwen-Image-2.1モデルの加速化チェックポイントであるQwen-Image-2.1-Turboを公開しました。これは、ベースモデルの40ステップのデフォルトと比べて、8段階のデノイズングステップで画像を生成・編集することができます。開発者にとっては、同じ7Bアーキテクチャで5倍少ないデノイズングステップが可能であり、ホストされたAPIオプションも提供されています。TL;DR…

アリババのQwenチームが発表した Qwen-Image-2.1-TurboオープンウェイトのQwen-Image-2.1モデルの加速されたチェックポイント。 8段階のノイズ除去ステップで画像を生成し、編集する ベースモデルの代わりに 40段階のデフォルト開発者にとっては、同じ7Bアーキテクチャで5倍少ないデノイズングステップが可能となり、さらにホストされたAPIオプションも利用できる。

TL;DR

  • サイズ: ビジュアル生成器で7Bパラメータ、これにQwen3-VL 8Bテキストエンコーダを組み合わせています。
  • 動作する環境: Diffusersを通じてBF16でのCUDA GPU。QwenはTurbo VRAMの最低値を公表していない。Unslothはベースモデルが動作すると推定している 11GBのVRAMを搭載し、GGUF形式で使用可能。INT8/FP8形式では24GBの容量が利用可能。.
  • パフォーマンス: 40ステップではなく8ステップで、Qwen-Image-2.1と同じ2Kの出力と編集機能セットを提供します。
  • 最優秀: Base Qwen-Image-2.1は、Qwenが報告する最高のオープン重量スコアであるQwen-Image-Benchで60.28点を獲得した。
  • 結論(最良): 8ステップの2K生成と編集を一つのオープンチェックポイントで行う。
  • 結論(最悪の場合):研究用ライセンスのみであり、商用での自己ホスティングには別途許可が必要です。

Qwen-Image-2.1-Turboとは何ですか?

Qwen-Image-2.1-Turboは、アリババのQwenチームによる8ステップの画像生成および編集のチェックポイントです。これはQwen-Image-2.1を基に構築されています。Turboは同じ7Bの視覚生成アーキテクチャを保持しています。Diffusers内のQwenImage21Pipelineを使用して直接読み込まれます。

チェックポイントには推奨される8ステップのサンプリングスケジュールが保存されている。生成時はデフォルトでCFG=1を使用する。プレフィックスKVキャッシュにより、ディノイズ化ステップ間でテキストと参照画像のコンテキストを再利用する。

Qwen-Image-2.1-Turboはどのように動作するのか?

基盤となるアーキテクチャは、32層、7Bパラメータを持つ単一ストリームDiTです。ブロック因果注意を使用しています。テキストトークンにはトークンレベルの因果マスクが、画像にはブロックレベルの双方向マスクが適用されます。

  • テキストエンコーダ: Qwen3-VL 8Bは、指示と条件画像の両方をエンコードします。
  • VAE: 16倍の空間圧縮を実施する64チャンネルRGBA自動エンコーダで、ネイティブな透明性を実現する。
  • スケジューラー: エウレル式離散スケジュールと動的シフトによるフローモッチング。

アテンションデザインがプレフィックスキャッチングを機能させるものです。入力された画像とテキストは最初のステップで一度計算されます。その後の各ステップではそのキャッシュを再利用します。8ステップだけで、キャッシュされたプレフィックスがほとんどの条件付けコストをカバーします。

何を生成し、編集できますか?

Turbo モデルカード展示は8つのカテゴリーを含んでいます。これにはポートレート、人物のポーズ、透明画像、タイポグラフィ、ポスター、UIレイアウトが含まれます。編集例には、単一画像の変形、複数参照画像の組み合わせ、4枚の画像による内部構成が含まれます。ベースモデルは10枚の参照画像までのサポートを提供し、円、塗りつぶされた注釈、マスクを使ったローカル編集も可能です。

Qwen-Image-2.1-Turboをどのように実行しますか?

設定するには、ソースからDiffusersを使用する必要があります、またtransformers>=5.17.0も必要です。チェックポイントにはDiffusers PR #14950が必要で、これによりパイプラインで設定されたサンプリングシグマが追加されます。

コードをコピー
import torch
from diffusers import QwenImage21Pipeline

pipe = QwenImage21Pipeline.from_pretrained(
    "Qwen/Qwen-Image-2.1-Turbo", dtype=torch.bfloat16
).to("cuda")

image = pipe(
    prompt="A ceramic teapot on a wooden table, soft window light",
    width=2048, height=2048, use_kv_cache=True,
).images[0]

編集するには、image=input_imageを指示パターンと共に渡してください。サポートされているプレスットは、16:9で2048×2048ピクセルの画像から2752×1536ピクセルまで対応します。

ここで注意すべき点です。設定 num_inference_steps 一人で ない 保存されたスケジュールを無効にする。明示的なもののみ sigmas アグレンダントはそうするが、Qwenは他のスケジュールは未検証であると指摘している。

APIの料金はいくらですか?

Alibaba Cloud Model Studioは、TurboとProの両方を提供しています。qwen-image-2.1-turboは、ほとんどの地域で画像1枚あたりCNY 0.1の費用がかかり、120 RPMの制限があります。qwen-image-2.1-proは画像1枚あたりCNY 0.25の費用がかかり、20 RPMです。Turboは画像1枚あたり2.5倍安く、リクエスト率は6倍です。

Qwen-Image-2.1-Turbo vs 競合する高速画像モデル

機能Qwen-Image-2.1-TurboQwen-Image-2.1Z-Image-TurboFLUX.2 klein 9B
Orgアリババ・クウェンアリババ・クウェンアルバイブ・トンイー-マイブラック・フォレスト・ラボス
生成器のサイズ7B7B6B9B
テキストエンコーダーQwen3-VL 8BQwen3-VL 8B明らかにされていないQwen3 8B
デフォルトの手順8408件のNFE4
編集はい、複数の参照はい、最大10件の参考文献いいえ(別の編集モデル)はい、複数の参照
透明なRGBA出力はいはい明らかにされていない明らかにされていない
ネイティブ解像度2K(2048×2048)2K(2048×2048)1024×1024の例1024×1024の例
ハードウェアに関するガイダンス明らかにされていない11 GB GGUF / 24 GB FP8 (Unsloth)16GBのVRAMに対応~29ギガバイトのVRAM、RTX 4090以上
ライセンスQwen ResearchライセンスQwen ResearchライセンスApache 2.0FLUX 非商用
Qwen-Image-Bench明らかにされていない60.28 (ベンダー)明らかにされていない明らかにされていない
ホストされたAPICNY 0.1/imageプロ版:CNY 0.25/image明らかにされていないBFL API

重要なポイント

  • Qwen-Image-2.1-Turboは、同じ7Bアーキテクチャで、デノイズ除去のステップ数を40ステップから8ステップに削減します。
  • 1つのチェックポイントが、2Kのテキストから画像への生成、複数参照の編集、透明なRGBA出力を処理する。
  • APIの料金は画像1枚あたり0.1元で、Proより2.5倍安いです。
  • 重量は研究許可が必要なため、商業的な自己ホストには別途許可が必要です。
  • Turbo特有のベンチマークはまだ存在しない。基準のQwen-Image-2.1のスコアはQwen-Image-Benchで60.28である。


ModelScopeページ、Hugging Faceページ、Pro APIおよびTurbo APIをご覧ください。すべての功績はこのプロジェクトの研究者にあります。また、Twitterで私たちをフォローしてくだされば構いません。また、150k+ML SubRedditに参加し、ニュースレターを購読するのも忘れないでください。待って!Telegramにいますか?今ならTelegramでも私たちと参加できます。

Alibaba Qwenが8ステップ7B画像モデルであるQwen-Image-2.1-Turboを公開したという記事が、MarkTechPostに初めて掲載されました。

原文の出典

MarkTechPost

内容について

原文の公開と権利は出典元に帰属します。

機械翻訳 · 原文をご参照ください