vLLM Releases

v0.31.0

# v0.31.0 ## ハイライト 今回のリリースには、307名の貢献者(うち96名が新規)による717件のコミットが含まれています。 * **DeepSeek-V4.1-Flash のパフォーマンス**: V4.1 NVFP4 圧縮 KV キャッシュを用いた FlashMLA メガアテンションが SM100 のデフォルトになりました(#56935)。インデクサー向けの DeepGEMM スパース MQA…

v0.31.0

ハイライト

今回のリリースには、307人のコントリビューター(96人が新規)による717件のコミットが含まれています!

  • DeepSeek-V4.1-Flash のパフォーマンス: V4.1 NVFP4圧縮KVキャッシュを用いたFlashMLAメガattentionがSM100のデフォルトになりました(#56935); インデクサー向けのDeepGEMMスパースMQAロジット(#56254)と、ゲートGEMMをエキスパート選択と融合させたMega-Gate(#56266); デコーダー境界ではTP all-reduce、mHC入力準備(#57643)、MoEファイナライズ(#58586)を融合; SM100/SM103上で逆RoPEとMXFP8量子化を組み合わせた融合small-batch WO-A(#58634); MXFP8 wo_b シーケンス並列 reduce-scatter と融合された GEMM (#57428); Engram wkv TPランク間でシャーディング(#58678)、およびデフォルトで同一配置のDPレプリカ間で共有されるEngramホストテーブル(#57651)、ビジョンタワー向けのエンコーダCUDAグラフ(#56625)、そしてスライディングウィンドウKVをプレフィックスキャッシュの対象外に保つSWA有界リプレイ(#56227)。
  • 高速再起動: 新しい vllm preload CLIは、量子化後の重みをエンジン再起動後もGPUメモリに常駐させるweight-cacheデーモンを起動し(#56680)、データ並列化(#57386)、MTPドラフトモデル(#57312)、a /health エンドポイント(#58552)とレディネス待機(#58370)。実験的な初期化済みエンジンのスナップショット(vllm snapshot create/restoreでは CRIU を使用して完全に初期化された TP1 エンジンを復元します(#51360)。
  • Model Runner V2 と speculative decoding: Model Runner V2 上での draft-model による speculative decoding(#43091)および custom logits processors(#56497);新しい LiLiCorr drafter(#57934);DFlash の非同期スケジューリング(#58065)で、draft CUDA graph 内に context K/V の事前計算を取り込み(#57632);Gemma4 向けの DSpark adaptive verification(#57263)と Kimi-K3 向けの可変長 decode(#52988);非 DCP の DSpark draft を持つ DCP ターゲット(#56723);そして MoE メモリが MRV2 のプロファイリング中にカウントされるようになり、WideEP デプロイでの OOM を回避(#57270、#58411)。
  • 大規模なサービス提供: MoonEP balanced EP all2all backend 経由で --all2all-backend moonep (#52101)、データ並列と組み合わせたプリフィルコンテキスト並列(#57075)、SM100/SM103向けの低SM multimem reduce-scatter(#55072)、シーケンス並列を含むDeepEPv2(#57210)および共有エキスパートオーバーラップを含むEPLB(#57236)、RL向けのシャーディング対応NCCL M2N重み転送バックエンド(#51520)、そしてKVオフローディングのバックプレッシャー検出(#50045)。
  • スケジューリング制御: --max-num-active-seqs RUNNINGの入学を〜とは独立に上限で制限する max_num_seqs (#56758), --long-prefill-token-threshold 待機中のプレフィルの数に適応するようになり、単一のリクエストをチャンク分割しなくなり(#57951、#58459)、KVブロックをすでに保持しているリクエストが優先的にスケジュールされるよう待機キューが再構築され(#58947)、さらにKV圧力下でのKVコネクタ + MTPのデッドロックが修正されました(#57104)。
  • HiSparseハードニング: ユニオンレジデンシーカーネルによるMTP検証行の解決(#59235)、FULLグラフ下でのMTP受理崩壊の修正(#59309)、ホストバッキングなしのGPUページの禁止(#59036)、チャンクドプリフィルのプリエンプション livelock の修正(#59494)、HiSparseが確保するグループに基づくKVキャッシュのサイズ設定(#59450)、そしてホストプリフィックス公開とGPUプリフィックス採用の修正(#59007、#59282)。
  • セキュリティ: リクエストごとの mm_processor_kwargs および media_io_kwargs は拒否されます。ただし --trust-request-mm-kwargs 設定されている(#58830)。プレフィックスキャッシュの追加キーはソースごとにタグ付けされるため、LoRA名と cache_salt 衝突できなくなりました(#51899)。また、LoRAパスはブロックハッシュの一部になりました(#59335)。マルチモーダルのレシーバーキャッシュの古いエントリが新しいペイロードを置き換えることはできなくなりました(#57833)。
  • 破壊的変更: リクエストごとのマルチモーダルkwargsをゲート化 (#58830); tokenizer_mode="slow" 削除されました (#58545); --enable-mamba-fine-grained-prefix-cache 名称変更後: --enable-mamba-shared-prefix-checkpoint (#57382); オンライン量子化による quantization="fp8" 「以下に置き換えられます:」 fp8_per_tensor 省略記法(#53585)および Quark サイレントオンライン量子化の削除(#51800);AllSpark INT8 W8A16 バックエンドの削除(#58001); --enforce-eager 現在、JITカーネルのウォームアップも無効化されるようになりました(#58197)。XPUグラフはデフォルトで有効になり、 VLLM_XPU_ENABLE_XPU_GRAPH 削除されました (#51600)。

リリース成果物

Python Wheels

プラットフォーム インストール
PyPI(CUDA 13.0) pip install vllm
PyPI (CUDA 13.0、uv) uv pip install vllm --torch-backend=auto
ROCm pip install vllm --extra-index-url https://wheels.vllm.ai/rocm/0.31.0/rocm723
XPU uv pip install vllm --extra-index-url https://wheels.vllm.ai/0.31.0/xpu --extra-index-url https://download.pytorch.org/whl/xpu --index-strategy unsafe-best-match

Docker イメージ

プラットフォーム Docker イメージ
CUDA 13.0(デフォルト) docker pull vllm/vllm-openai:v0.31.0
CUDA 12.9 docker pull vllm/vllm-openai:v0.31.0-cu129
ROCm docker pull vllm/vllm-openai-rocm:v0.31.0
CPU docker pull vllm/vllm-openai-cpu:v0.31.0
XPU docker pull vllm/vllm-openai-xpu:v0.31.0

その他のアーティファクト

ビルド済みリリースアーティファクトは、このページの下部にある Assets セクションから入手できます。内容は以下のとおりです: - ソース配布 tarball - x86_64 および arm64 用 CUDA 12.9 Python wheel - x86_64 および arm64 用 CUDA 13.0 Python wheel - x86_64、arm64、macOS 用 CPU Python wheel - x86_64 用 XPU Python wheel

モデルサポート

  • 新しいモデル機能: 有限の単一トークン選択による DiffusionGemma 構造化生成モード(#57250)、MiMo V2 MXFP4 MoE、BF16 MoE ルーターと DFlash ドラフト(#57784)、EAGLE3/DFlash ドラフター向けの Cohere2MoE 補助隠れ状態(#49819)、ROCm DeepSeek-V3.2 パス上の GLM-5.2-MXFP4(#51915)、AMD-Quark 混合精度 DeepSeek-V4.1-Flash-MXFP4(#57071)および GLM-5.3-Flash Quark MXFP4(#56176)チェックポイント、さらに Granite 4.2 向けの組み込み granite_thinking_parser Granite 4.2 向け(#55957)。
  • DeepSeek-V4.1-Flash: NVFP4 圧縮 KV キャッシュを SM100 のデフォルトとする FlashMLA メガアテンション(#56935)、インデクサーにおける DeepGEMM スパース MQA ロジット(#56254)、Mega-Gate(#56266)、MoE ファイナライズを折り込んだ融合 TP all-reduce + mHC 入力準備(#57643、#58586)、融合スモールバッチ WO-A(#58634)、MXFP8 wo_b GEMM + reduce-scatter(#57428)、FULL CUDA グラフに限定した(#57874)スモール TP バッチ向けのオーバーラップ mHC 係数(#57603)、Engram wkv (#58678)、ヒュージページホストテーブルによる逐次化された Engram ルックアップ(#56926)、デフォルトで DP レプリカ間で共有される Engram テーブル(#57651、#57914、#59068)、パディングなしのネイティブ共有エキスパート MegaMoE 融合(#56568、#57204)、より高速な MegaMoE ステージングと NVFP4 キャッシュギャザー(#57604)、復元された融合クエリ RMSNorm + MXFP8 パス(#57679)、KV のみの DSpark コンテキスト挿入(#56441)、ビジョンエンコーダー CUDA グラフ(#56625、#58499)、SWA 境界付きリプレイ(#56227)、リファレンス実装に一致するよう復元された因果的画像 SWA(#57152)、更新された推論 effort マッピング(#58316)、NaN スコア付き候補ブロック(#57454)、DeepSelect センチネル(#58215)、FlashInfer 上の DSpark 非因果アテンション(#57432)、オフセット候補バッファの実行時 JIT(#57667)、および Triton なしでのインポート(#57654)に関する起動時の修正。
  • DeepSeek V4: 融合逆 RoPE + FP8 量子化を備えた FlashInfer スパース MLA(#58621)、スタックされた DSpark コンテキスト WKV 射影(#54674)、EP グループから計算される融合 MoE エキスパート分布(#57465)、 suffix を介した FIM 補完(#44229)、ツール呼び出しで解析される欠落していた string= (#56271)、既存のシステムメッセージに添付されたリクエストツール(#51856)、画像ブロックのスペーシング保持(#56882)、および MTP ステージ検証から分離された DSpark 幅(#54631)。
  • GLM-5.3-Flash: SM90 でのオプトインの FlashAttention および FlashMLA スパースバックエンド(#55385)、FlashInfer SM120 バックエンド上の NoPE スパース MLA(#55277)、スモールデコードバッチ向けの協調 top-k(#57327)、プール長でサイズ決定されるインデクサーデコードワークスペース(3 GiB 削減、#57701)、1.6〜4.8 倍高速化されたメタデータ操作(#58450)、融合 kpool テールスロットマッピング(#57534)、共有ディスパッチャーを経由する kpool top-k(#57546)、低減されたスパース MLA 準備オーバーヘッド(#57458)、非同期スケジューリング下の SM90 スパース MLA プランにおける D2H 同期の廃止(#58684)、長いプリフィルのために FP32 でリカレント状態を保持する FlashKDA(#58846)、およびスペキュレーティブデコーディング時の kpool 破損(#58454)、SM90 index_kpool の不一致(#58704)、kpool テールストライド(#57477)、500k トークンのプロンプト(#57317)、シーケンス並列化下の dense MLP レイヤー(#58061)、インデクサー top-k バックエンド選択(#58594)、varlen ページド MQA 起動(#55270)に関する正確性修正。
  • Qwen3.8-Flash-Next (Qwen4Exp): QSA パス上の FP8 メイン KV キャッシュ(#55557)、FlashInfer TRTLLM MoE を用いた FP8 TP(#55867)、SM90 QSA チューニング(#57273)、融合 HC ダウンプロジェクション + SiLU(#58957)、低減された PLE メタデータオーバーヘッド(#58114)、修正された QSA インデクサーワークスペース断片化(#57105)、解放されたプロファイリング用 KV キャッシュ(#58961)、CUDA グラフプールから除外されたピン留め PLE プリフェッチ ID(#58489)、および DGX Spark での重み読み込み時間を約 25 秒短縮するインデックス化エキスパートマッピングルックアップ(#58720)。
  • Kimi K3 と MiniMax-M3: GEMM として実装された Kimi-K3 ビジョンパッチエンベッダー(#58527)、融合 KimiViT QK RoPE(最大 29 倍、#58651)、ルーティングエキスパート量子化(#57430)、推論パーサー(#57098)と推論トークンカウント(#58372)の修正、再バインド後に更新された DSpark コンテキスト KV ポインター(#58814)、デコードとして分類されなくなったステートレスな最初のチャンク(#51483)、および外部プレフィックスヒット時にアドミッションを停滞させなくなった Mamba ブロック推定(#57050);MiniMax-M3 エンコーダー CUDA グラフ(#58673)、 Conv3dLayer パッチエンベディング(約 62 倍、#58512)、 triton_mrope ビジョンタワーにおける修正 (#58526)、非単位スケーリングを伴う MiniMax2 ルーティングの融合 (#58880)、およびプロセッサの修正 (#58460、#59613)。
  • DiffusionGemma: 1パスのサンプラー統計カーネル (#58226)、 diffusion_constrained reads over の読み取り logprob_token_ids (約25% 高速化、#58216)、prefill-only バッチにおける logit 行数の削減 (#57416)、 logprob_token_ids サポート (#57417)、および同時 logprobs (#57414)、eager フォールバックの dtype (#57462)、マルチモーダル入力 (#57589)、量子化 LM ヘッド (#48521)、CPU 実行 (#58964) に対する修正。
  • マルチモーダル: Triton mm_input_norm カーネル (#56798, #56711)、DPシャーディングされたViTパスを通じて生ピクセルを保持 (#56872)、時間的M-RoPEのためにQwen2.5-VLのビデオfpsを尊重 (#47736)、30秒を超えるWhisperおよびQwen2-Audioクリップ (#57769, #56912)、Mistral3プレースホルダーグリッド (#53758)、Idefics3の非分割パッチ (#48760)、Ovis2.5トークン (#52623)、Ariaエキスパート重み (#57487)、MiMo-V2.5融合FP8 qkv_proj シャーディング (#57508)、Gemma4 AutoWeightsLoader (#55911) およびバッファースカラー (#54213)、ヘッド次元512におけるFA4とのGemma4 FP8 KV (#53175)、Laguna RoPE (#57189)、Mistral-Large-3の精度リグレッション (#57563)、不正な形式のEXIF (#56527, #57234)、JinaVLラベル (#57347)、FP32ルーターロジットを用いるSarvam MLAルーティング (#56034)、融合CohereASRアテンションスコア (#55190)、および融合DFlash2グループ化畳み込み (#55960)。
  • LoRA: Nemotron VL言語モデル (#56231)、ModernBert (#57148)、VoyageQwen3埋め込み (#57708)、RoBERTaシーケンス分類 (#58884)、およびアダプターごとの modules_to_save シーケンス分類ヘッド (#53555)。 num_labels (#57766).

エンジンコア

  • モデルランナーV2: ドラフトモデルによる投機的デコーディング (#43091)、アドミッション時に検証されるカスタムロジットプロセッサー (#56497) (#57728)、ランダム化ダミー入力 (#58411)、プロファイリング中にMoEエキスパートへルーティングされるダミートークン (#57270)、1トークンのプロンプト末尾に対するFULLデコードグラフ (#58400)、トークンからリクエストへのマッピングの共有 (#57102)、およびKVキャッシュグループ間で再利用されるMamba/GDNメタデータ (#58762)、エンコーダーのみのViT CUDAグラフ (#56922)、シャットダウン時に解放されるウェイトオフローダー (#57834) およびプーリングモデル (#57737)、ならびにP/DにおけるマルチレイヤーMTP KV (#55055)、LoRA付きfast-prefill (#56456)、ダミードラフトステップからの古いブロックテーブル書き込み (#56734)、ハイブリッドモデルにおけるパディングされたプロンプト末尾 (#58434)、決して提案されないドラフトスロット (#58784)、自動フィット max_model_len (#58149)、および intermediate_tensors キャプチャ中 (#57745) の修正。
  • 投機的デコーディング: LiLiCorrドラフター (#57934)、DFlash非同期スケジューリング (#58065) およびドラフトCUDAグラフ内のコンテキストK/V (#57632)、Gemma4 DSpark適応的検証 (#57263)、Kimi-K3可変長適応的検証 (#52988)、異種語彙に対するCPU-GPU同期の削除 (#57396)、アクセプタンス推定器におけるTriton再コンパイルの回避 (#57107)、ならびにEP付きEAGLE/密ドラフト (#56930)、DFlash/DSparkプロファイリングバッチ (#56448)、GLM MTPヘッドメモリ (#55442)、ドラフト付きプロンプト埋め込み (#57356)、およびTritonMLA因果的マルチトークンデコード (#51065) の修正。
  • スケジューラー: --max-num-active-seqs (#56758)、適応的 --long-prefill-token-threshold (#57951, #58459), skipped_waiting がKVを保持する待機キューに置き換え (#58947)、 n > 1 リクエストのアトミックなアドミッション (#53936)、KVコネクター + MTPデッドロック (#57104)、 max_num_seqs が8の倍数でない場合のスループットの崖 (#57355)、logprobsを保持しmaxトークンを更新するストリーミング継続 (#57447, #57676)、再開可能リクエスト + 非同期スケジューリングのレース (#58259)、および非ブロッキングの構造化出力グラマーポール (#55931) の修正。
  • プレフィックスキャッシングとハイブリッドモデル: ソースごとにタグ付けされた追加キー (#51899) およびハッシュ化されたLoRAパス (#59335)、 --enable-mamba-shared-prefix-checkpoint (#57382)、MTPで復元されたプロンプト末尾ヒット (#58368)、スパースリテンション下で保持されるプロンプト終端チェックポイント (#59146)、alignモードのチェックポイント予約 (#59175)、ステートレスGDNの最初のチャンク (#51565)、ハイブリッドグルーピングパス上で注釈付けされるMTPドラフトKVキャッシュグループ (#55390)、一般化されたプリフィルチェックポイントビルダー (#57783)、GPU-CPU同期なしのバッチ化Mamba2プリフィル状態保存 (#49371)、 skip_reading_prefix_cache コネクターヒットに対して尊重 (#57269)、増分マルチモーダルブロックハッシング (#51694)、すべてのアテンションバックエンドが対応するKVブロックサイズ (#49845) とより明確なエラー (#58557)、および CacheConfig.effective_attention_block_size DCP向け (#56538)。
  • 起動とメモリ: 並列Tritonウォームアップコンパイル (#58582)、 --enforce-eager 下で無効化されるJITウォームアップ (#58197)、ただしフォールトトレランスが有効な場合を除く (#58593)、MoEワークスペースを再利用するDeepGEMMウォームアップ (#57268)、プロファイリング中にKVキャッシュを縮小しなくなったアロケーターフラグメンテーション (#58430)、KVサイズ決定前に予約されるスパースプリフィルバッファー (#57575)、解放された古いFlashMLAワークスペースビュー (#56902)、半減されたDeepGEMM FP8ワークスペース (#53914)、共有Marlin/Hummingワークスペース (#57421)、インプレースで変換されるFlashInfer BF16 MoE重み (#54699)、CPUクォータによって制限されるUniProc起動スレッド (#58946)、およびプロファイリング前に設定されるランタイムスレッド (#55891)。
  • カーネル: 永続的top-kのためのサンプリングフィルタリング (#56346)、Gumbelサンプリング用のMurmur3 RNG (#51367)、レジスタ常駐のトークングループごとの8ビット量子化 (#55330)、ベクトル化されたテンソルごとのFP8 abs-max (#58194)、プラットフォーム固有オーバーライドのためのTritonカーネルディスパッチャー (#43048)、 GateLinear すべてのMoEモデル向け (#58234)、 TritonExperts でスキップされる非ローカルエキスパートスロット (#58051)、モジュラーパス上で延期されるTRT-LLM-Gen top-kファイナライズ (#58635)、SM120バッチ不変matmul設定 (#57456)、境界設定されたFlashInferプリフィルデクオントスクラッチ (#57918)、ならびにTriton softcap NaN (#56579)、QuIP Hadamard変換 (#43462)、A100上のCUTLASS FP8 linear (#55884)、未対応GPU上のFlashInferサンプリング (#48956)、SM100 FP8ブロックワイズスケールパディング (#57377)、混合FULLグラフプリフィルキャプチャ (#58275)、Inductorカスタムオプパターンマッチング (#58189)、Qwen3.5でFLAから逸脱するCuteDSL BF16 GDNプリフィル (#53864)、SM100 fp8_ds_mla キャッシュのスケーリング(#49435)、sparse indexer における ragged な decode バッチ(#52500)、バッチ並べ替え後の古い allowed_token_ids マスク(#48419、#43931)、そして prompt_embeds リクエスト完了後も保持されるテンソル(#57988)を修正しました。
  • バッチ不変性 (Batch invariance): torch.compile なしで既定では壊れうる CUDA グラフ (#57586)、シーケンス並列と async TP は無効化 (#56377)、NCCL 2.31 コレクティブは有効のまま (#58179)。 VLLM_BATCH_INVARIANT (#57586)、シーケンス並列と async TP を無効化 (#56377)、NCCL 2.31 コレクティブは引き続き有効 (#58179)。
  • : KV キャッシュメモリのみ解放 (#44890)、: release_kv_cache_memory() KV キャッシュメモリのみを解放し (#44890)、 --sleep-preserve-parameter-names レベル 2 スリープをまたいで凍結重みを保持し (#57891)、NCCL M2N 重み転送 (#51520)、DP インデックスによる dense DP 重み更新 (#56950)、expandable segments の切り替え時にもアロケータ設定を維持 (#57982)、スリープ中のキャッシュリセット失敗を伝播 (#54581)。
  • (#56680)、DP (#57386)、MTP ドラフト (#57312)、準備完了待ち (#58370)、: vllm preload (#56680)、DP (#57386)、MTP ドラフト (#57312)、準備完了待ち (#58370)、 /health (#58552)、ModelOpt MXFP8 事前処理済み重み (#57316)、初期化済みエンジンのスナップショット (#51360)。
  • :: LoggingConfig および --logging-config (#57205)、JSON ロギング修正 (#57957, #58747)、起動時ログ抑制の修正 (#51366)、プラットフォーム対応に統一された torch プロファイリング (#57460)、クエリが一切ない場合に 0.0% のプレフィックスキャッシュヒット率を表示しない (#54990)、KV 転送メトリクスのフォーマット (#57068)、モデルの dtype に基づく MFU アクティベーションサイズ計算 (#57070)、プラットフォームでオーバーライド可能な環境変数チェック (#48599)、 --log-level (#57205)、JSON ロギングの修正 (#57957、#58747)、起動時ログ抑制の修正 (#51366)、プラットフォーム対応 torch プロファイリングの統一 (#57460)、クエリ前のプレフィックスキャッシュヒット率が 0.0% と表示されないよう修正 (#54990)、KV 転送メトリクスのフォーマット (#57068)、モデル dtype に基づく MFU アクティベーションサイズ計算 (#57070)、プラットフォームで上書き可能な環境変数チェック (#48599)、 VLLM_TARGET_DEVICE=empty pip install vllm (#41074)、ソースからインストールした際に正しい vLLM バージョンを報告 (#57295, #57744)。

大規模サービング (Large Scale Serving)

  • MoE 通信: MoonEP バックエンド (#52101)、シーケンス並列付き DeepEPv2 (#57210) と EPLB + 共有エキスパートオーバーラップ (#57236)、低 SM multimem reduce-scatter (#55072)、Elastic EP スケーリング中の EPLB 負荷統計 (#58473)、グループ化ルーティングで SP のパディング行をスキップし rank 0 が prefill の遅延者にならないように (#56079)、非対応のモノリシックバックエンドでのハッシュルーティングを拒否 (#57867)、エンジンを離れるリクエストに対する PP 下での sampled-token ブロードキャストをスキップ (#58542)、DeepEP 低レイテンシプロファイリング付き DBO (#57502)、ノードを共有するレプリカでの外部 LB (#53743)、エンジンハンドシェイク中のブロッキング RPC を排除 (#57226)、および無制限のドラフトトークン待ちを排除 (#58779)。
  • コンテキスト並列 (Context parallelism): DP、EP、MTP と組み合わせた PCP (#57075)、非 DCP の DSpark/DFlash ドラフトを対象とする DCP (#56723)、CPU-GPU 同期なしの DCP シーケンス長 (#58169)、MLA キャッシュ領域をまたぐ NIXL DCP プル (#57389)。
  • KV コネクタ: attention-HMA 向けの NIXL パイプライン並列プッシュ prefill (#50494) およびパック化 MLA レイアウト (#50499)、KV 期限切れから輸送失敗メトリクスを分離 (#55854)、TTL を待たずに死んだピアの状態を解放 (#50047)、ハートビート付きヘッドの背後で期限切れリースを回収 (#58292)、プッシュ完了の復元 (#58188)、D 側アクティビティの記録 (#52245); Mooncake CUSTOM_MEM_POOL (#49300)、HMA 下でのリクエストレベルの負荷失敗 (#56855, #57174) とブートストラップリトライ (#58919); MoRIIO の READ モードでのハイブリッド Mamba/KDA 状態 (#51052) とマルチデコードのルーティング競合 (#51681); prompt_tokens_details における prefill キャッシュヒット (#54222); ポート 0 にバインドされた KV イベントパブリッシャー (#55844); 外部コンシューマー向けの KV キャッシュメタデータ GET の復元 (#56925); 部分ブロック KV イベントがすべてのマルチモーダル機能を維持 (#58288); フォワードのないステップでの保存の確定 (#57775); アボート安全な ExampleHiddenStatesConnector (#56841); DecodeBench FP8 フィル (#58472); KvHints リクエストエンベロープ (#53423); およびルーティングされたエキスパート出力向けの AuxOutput コネクタ (#45635, #58150, #58205)。
  • KV オフロード: リクエストごとの max_load_tokens (#55885)、バックプレッシャー検出 (#50045)、 SimpleCPUOffloadConnector Prometheus メトリクス (#57251)、プレフィックスキャッシュ不可 (#56810) およびスクラッチ (#57145) グループのスキップ、マルチグループ MLA 向けの複製レイアウト (#57652)、512 GiB 以上の領域をチャンクで登録 (#51081)、SHM 割り当て前の cgroup メモリチェック (#54014)、キャッシュ新しさ (#51787)、MTP 保持スライディングウィンドウ (#56709)、正規 MLA 行 (#56799)、イベントメタデータ (#57453)、ROCcm ピン留めメモリ (#57160) の修正。
  • HiSparse: MTP 行向けの union residency カーネル (#59235)、FULL グラフ下での MTP 受理 (#59309)、ホストバックドアロケーション (#59036)、プリエンプションのライブロック (#59494)、KV キャッシュサイズ計算 (#59450)、ホストプレフィックス公開 (#59007)、GPU プレフィックス採用 (#59282)、residency メトリクス (#58725)。
  • エンコーダ分離 (Encoder disaggregation, EPD): launcherが管理する登録を備えた動的EPDプロキシ (#54176)、エンコーダーごとにバッチ化された画像リクエスト (#57095)、Mooncakeを経由するクロスエンコーダーキャッシング (#56242)、メタデータのみのオーディオ入力 (#57887)、言語モデルシャードのスキップ --mm-encoder-only (#58086)、ECコネクタメトリクス (#54960)、およびエンコーダーのみの修正 (#58490, #58287, #57696)。

ハードウェア & パフォーマンス

  • NVIDIA: FlashInfer 0.7.0.post1 (#58069, #59323)、SM120修正を含むDeepGEMMピン更新 (#57218)、Rubin CUDA 13.4ナイトリーイメージ (#55953)、およびPyTorch 2.13向けQuTLASSビルド (#58173)。
  • AMD ROCm: AITER v0.1.23(#56885、#58867)、torch 2.13 および Triton 3.8(#50605、#58006)、 triton_kernels 3.8 MXFP4 MoE for gpt-oss および DeepSeek-V4(#55934)、ROCR ホストのセグメンテーション違反を修正(#57328);DeepSeek-V4/V4.1 の HCA デュアルストリーム(#56853)およびレイヤー対応の CSA2 オーバーラップ(#57407)、FP8 wo_a (#54894)、スパースデコード reduce に逆 RoPE を融合(#57435、#57451)、これはグループ化された FP8 の MXFP8 を出力するようになりました wo_a (#58456)、gfx950 上のネイティブ 32x32 スケールによる MXFP8 GEMM(#58510)、top-k ragged メタデータの再利用(#57434)、より高速な候補ブロック選択(#58208)、ホストメモリ内の Engram テーブル(#57491)、およびホストメモリへオフロードされた Qwen3.8-Flash-Next PLE テーブル(#57497)、DCP + スペキュレーティブデコーディング向けのオプトインの AITER ASM デコード経路(#56861)、 get_top_tokens() DeepSeek V4 MTP ドラフター上の(#57568)、DSpark 適応型検証(#52362)、オプトインの VLLM_DSV4_LOGITS_FIX gfx950/gfx942 上のスパースインデクサーロジット向け(#50455)、#56433 と #51692 の精度リバート(#57132)、DPA+ETP を使用した FSE に対する明確なエラー(#57919);Kimi-K3 の a4w4 FlyDSL カーネル(#53940)に伴う VLLM_ROCM_USE_AITER_MOE_SITUV2=a16w4|a8w4|a4w4 (#58201)、低同時実行数でのスペキュレーティブ KDA(#58045)、EP 下でのシャーディングされた潜在 MoE(#54956)および射影コピーの削減(#50592);torch.compile を用いた ROCm Hy4 経路(デコードレイテンシ 13 倍低減、#57526);MiniMax-M3 の AITER QK-norm 融合(#54535)、コピー不要の K/V 挿入(#56849)および MXFP8 修正(#53674、#58089);GLM-5.3-Flash の起動修正(#57192、#57252、#57425);AITER QuickReduce + RMSNorm(#48249)、BF16 AsyncTP(#58098)、静的 FP8 attention 出力融合(#58099)、MRoPE 向け QK-norm/RoPE/KV-cache 融合(#50212)、フラットレイアウト向け AITER GDN デコード(#53623)、 wvSplitK 単一出力 GEMM 向け(#53283)、スキニー GEMM 経路でのデコードステップあたり 69 コピーの削減(#58566)、AITER を通じたチューニング済み GEMM ルックアップ(#55001)、RDNA3/RDNA4 上のより狭い Triton プリフィル KV タイル(#58225)、段階化された大きなページング可能 H2D コピー(#56343)、および KV キャッシュを枯渇させる MXFP4 MoE パディング(#56359)、AITER MLA FP8 プリフィルの OOM(#57923)、非量子化キャッシュの descale(#56726)、AITER MoE フォールバック(#56590、#57866、#57426)の修正。 VLLM_ROCM_USE_AITER_FP4_ASM_GEMM が復元され、デフォルトでオフになりました(#57055);SWA 有界リプレイは ROCm で無効化されています(#57906)。
  • Intel XPU: PyTorch 2.14(#56013)、デフォルトで有効な XPU グラフ(#51600)、EPLB(#44987)、Triton 上の int8 W8A8 MoE(#53162)、バッチ不変性(#55881)、SYCL 回転埋め込み(#55721)、融合された QK RMSNorm + RoPE + gate(デコード領域が 55% 高速化、#56096)、Model Runner V2 サンプラー(#57277)および PP マイクロバッチ制御(#55145)、 --device-ids が尊重されるように(#56015)、およびデバイスポインターオーバーフローの修正(#54514)。
  • CPU: Intel Diamond Rapids 向け FP8 W8A8 linear および MoE(#49942)、最大 25% 高速化された Arm ページドアテンション(#56045)、dense および MoE レイヤー向け Zen DA8W4 int4(#54024)、エンコーダーアテンション向け zentorch SDPA(#54508)および MLA プリフィル(#54967)、FP32 attention sinks(#56252)、POWER 上の W8A8 INT8 MoE(#55316)、W4A16 Whisper(#58268)、AMX-FP8 対応の Ubuntu 22.04(glibc 2.34)上でビルドされた wheels(#58515)、コンパイラーサポートに基づく AVX10.2 のゲーティング(#58133)、事前ビルドされた Triton CPU(#58140)、 --device-memory-utilization エイリアス(#56547)、CPU イメージ内の vLLM Recipes(#58796、#57306)、s390x の protobuf ピン(#54978)および torchcodec ビデオ(#58693)、ならびに Ministral FP8(#56985)、FP32 ルーター重み(#56168)、zentorch のインポート失敗(#54923)、macOS マルチモーダル SHM(#57142)、ローカルランクごとの CPU アフィニティ(#53636)、NIXL GDN 状態レイアウト(#53300)の修正。

Quantization

  • Humming: Hadamard 変換および NVFP4/MXFP4/MXFP8 オンライン量子化(#56685)、compressed-tensors を通じた非対称 wNaM(#46528)、humming-kernels 0.1.16(#58054)、および W4A8 (INT4xFP8) MoE オラクルにおける Humming(#58427)。
  • New capabilities: ネイティブ Quark W4A16 INT4/UINT4 エクスポート(#48606)、オプトインのロード時 MXFP4 逆量子化(#50814)、明示的なトークンごとの NVFP4 MoE バックエンド(#57176)、および compressed-tensors WNA16 MoE 向けの正準な N-first レイアウト(#52798)。
  • Fixes: 以下より下のレイヤーでの MXFP8 mm_mxfp8 形状制限(#54223)、リロード時のオンライン NVFP4 スケール(#57954)、LM head linear メタデータ(#58444)、および SwiGLU clamp 下でスキップされる融合 SiLU-mul ブロック量子化経路(#57984)。

API & フロントエンド

  • 新しいオプションとエンドポイント: --tool-strict-level (#56268), response_format と tool_choice=auto (#56086)、DeepSeek-V4 FIM 補完(#44229)、 release_kv_cache_memory() および POST /release_kv_cache_memory (#44890)、 prompt_logprob_token_ids を介した固定トークンプリフィルスコアリング(#54335)、 /inference/v1/generate 内のリクエストごとのスペキュレーティブデコーディングメトリクス(#43310)、リクエストごとのメトリクス(#55084)および cache_write_tokens Responses APIにおける (#57222)、Anthropic thinking における /v1/messages (#58613)、derenderエンドポイントからのオフロードされたdetokenization (#57528) を伴うreasoningとtool callsのストリーミング (#50550)、 vllm chat thinking出力のストリーミング (#57045)、リクエストボディのデバッグログを --enable-log-requests (#58163) で、さらにconfig docstringsのサマリー行のみを --help (#57357).
  • 構造化出力とパーサー:xgrammarバックエンドでのネイティブLark文法 (#58321)、XGrammar 0.2.7 (#57272)、GraniteをストリーミングParser Engineへ移行 (#49648)、reasoning境界の修正 (#56635)、制御文字を含むxgrammar choicesの修正 (#48115)、リスト型JSON Schemaの修正 (#48416)、空の structural_tag (#47450)、outlinesのEOS処理 (#58612, #57743)、パーサーによって抑制されたストリーミングlogprobs (#58583)、reasoning後のInklingツール名 (#58792)、および長さ finish_reason :切り捨てられたストリーミングtool callsに対する修正 (#46303)。
  • OpenAI、AnthropicおよびHarmony互換性: Harmony、DeepSeek-V3、Step3 の reasoning トークン数(#58626)、および Responses ツールの各ラウンドごとの数(#58927)、Harmony max_output_tokens ツールループ内の処理(#58551)、調整済みリクエストを用いたバッチチャット補完(#58929、#58958)、選択肢ごとの新規パーサー(#58939)、遅延された推論の再カウント(#56067)、Responses MCPのクリーンアップ(#56988)、および画像 detail default (#57241)、Anthropic インラインシステム検出 (#58754)、および P/D 付きの無効化された思考 (#58786)、ストップ文字列は拒否 --tokens-only servers (#57058)、無効 prompt_embeds 400 を返す問題(#55451、#57006)、マルチモーダル展開後のプロンプトの上限設定(#57076)、 --override-generation-config penalties (#50769)、Hubリビジョン (#56092, #57461)、token-in/token-outレスポンスでの完全なlogprobs (#58488)、生成スコアリングのキャンセル (#57729, #58788)、gRPC keepalive ping (#55102)、および run-batch 文字起こしの話者分離(#57948)。
  • プーリング: チャンク化embeddingのパディング(#56505)と正規化(#57498)、ドキュメント上限付きのリランカートークン化(#57666)、raw logitsを返すBERT系ヘッド(#57664)。
  • Rust フロントエンド: --hf-overrides (#56931), --sse-keep-alive-interval (#58306)、カスタムチャットロール(#58311)、MiMo V2.5パーサー(#57933)、正規化された推論制御(#56998)、パーサー所有の出力文法(#55269、#57340)、gRPC上のサンプリングマスク(#56777)、gRPCメタデータ内のローカルDPサイズと vllm-proto 0.3.0(#57116、#57233)、リクエストごとのプリエンプションヒストグラム(#57033)、ロックフリーヒストグラム(#58574)、Nemotron-H ビジョンコンテキスト(#57634)、モデル所有のビジョンプロセッサ(#58109)、 mm-processor ベンチマーク(#51922、#58084、#58378)、サポートされていないserve引数が認識されるように(#58330)、NaNのlogprobsがエンジンクライアントを強制終了しなくなり(#51026)、追加された EngineCoreOutput fields accepted (#56533)、および vllm-rs オン PATH CUDAイメージ内(#57606)。
  • ベンチマーク: ある openai-responses 「backend for」のバックエンド vllm bench serve (#54628) および model_id レイテンシ/スループットのJSON内(#58112)。

セキュリティ

  • リクエストごと mm_processor_kwargs および media_io_kwargs デフォルトでは拒否されます。信頼されたデプロイメントはオプトインします(opt in with) --trust-request-mm-kwargs (#58830).
  • プリフィックスキャッシュのブロックハッシュは、ソースごとに追加キーにタグを付け(#51899)、LoRAパスを含め(#59335)ます。マルチモーダルのハッシュ入力はフレーム化され(#54283)、インクリメンタルなブロックハッシュは重複するすべての機能をカバーします(#51694)。
  • 新鮮なマルチモーダルペイロードは古いレシーバーキャッシュに優先し(#57833)、埋め込み数が一致しないエンコーダーキャッシュのヒットは拒否されます(#57696)。
  • min_tokens 満たされた部分の上 max_tokens デフォルトが拒否され、エンジンが固まる代わりに拒否されるようになりました(#57731)。メッセージのサニタイズにより大文字のメモリアドレスがフィルタリングされます(#58832)。提供済みモデルと同じ名前の LoRA アダプタは拒否されます(#59286)。

依存関係

  • FlashInfer 0.7.0.post1(#58069、#59323)、上限付きの requirements での Transformers 5.17.0(#56108)(#59614)、XGrammar 0.2.7(#57272)、 oss-harmony 置き換え openai-harmony (#55128)、DeepGEMM fork pin の更新 (#57218)、FlashKDA の更新 (#58846)、humming-kernels 0.1.16 (#58054)。
  • CUDA 12 イメージは LMCache 0.4.4 と CuPy CUDA 12 を使用 (#57945)。別タグの zstd Docker Hub イメージ (-x86_64-zstd) が公開され (#55608)、Rubin CUDA 13.4 nightly イメージも提供 (#55953)。
  • ROCm: AITER v0.1.23 (#58867)、torch 2.13、Triton 3.8 (#50605, #58006)、パッチ適用済み ROCR (#57328)、LMCache OpenTelemetry pins (#59056)。
  • XPU: PyTorch 2.14 (#56013)。CPU: Ubuntu 22.04 上でビルドされた wheel (#58515)、事前ビルド済み Triton CPU (#58140)。

破壊的変更 & 非推奨化

  • リクエストごとの mm_processor_kwargs と media_io_kwargs は、サーバーが --trust-request-mm-kwargs付きで起動されていない限りエラーを返すようになりました。サーバーレベルの --mm-processor-kwargs / --media-io-kwargs およびオフラインの LLM は変更されていません (#58830)。
  • tokenizer_mode="slow" は削除されました。Transformers v5 ではすでに "hf" Transformers v5 (#58545) の場合と同様に動作します。
  • --enable-mamba-fine-grained-prefix-cache は --enable-mamba-shared-prefix-checkpoint (#57382).
  • に改名されました。 quantization="fp8" を経由するオンライン量子化は、 fp8_per_tensor オンラインの省略形にリダイレクトされるようになりました (#53585)。Quark 固有のサイレントなオンライン MXFP4 量子化は削除され、オンライン量子化 API に置き換えられました (#51800)。
  • AllSpark INT8 W8A16 GEMM バックエンドは削除されました (#58001)。 return_assistant_tokens_mask の /render オプションと assistant_tokens_mask レスポンスフィールドは削除されました (#57520)。
  • VLLM_PLE_CPU_OFFLOAD は削除されました。代わりに --engram-config (#57937). VLLM_XPU_ENABLE_XPU_GRAPH は削除され、XPU グラフがデフォルトで有効になりました (#51600)。
  • は削除され、XPU グラフはデフォルトで有効になりました (#51600)。 --collect-detailed-traces のカンマ区切り形式は削除されました。リスト構文を使用してください (#55702)。
  • 新しいデフォルト: --enforce-eager は、フォールトトレランスが有効でない限り JIT カーネルのウォームアップも無効化します (#58197, #58593)。 VLLM_BATCH_INVARIANT=1 は torch.compile なしで breakable CUDA グラフを使用し (#57586)、シーケンス並列と非同期 TP を無効化します (#56377)。DeepSeek-V4.1 SWA bounded replay は有効です (#56227) が、ROCm では除きます (#57906)。Engram ホストテーブルは可能な場合、同一配置の DP レプリカ間で共有されます (#57651)。FlashMLA mega attention は SM100 での DeepSeek-V4.1 のデフォルトです (#56935)。AITER w4a4 ASM GEMM は ROCm ではデフォルトでオフです (#57055)。
  • Model Runner V1 + PP > 1 + 非同期スケジューリング + 構造化出力の組み合わせは、起動時に拒否されるようになりました (#56250)。 json_object は outlines バックエンド使用時にバリデーションで拒否されます (#57743)。
  • transformers 要件に上限が設けられました (#59614)。

新規コントリビューター

  • @0z5a が https://github.com/vllm-project/vllm/pull/56441 で初のコントリビューションを行いました
  • @200lz が https://github.com/vllm-project/vllm/pull/55528 で初のコントリビューションを行いました
  • @AARONKANG04 が https://github.com/vllm-project/vllm/pull/48521 で初のコントリビューションを行いました
  • @acsoto が https://github.com/vllm-project/vllm/pull/57314 で初のコントリビューションを行いました
  • @adenzhou1350 が https://github.com/vllm-project/vllm/pull/56882 で初のコントリビューションを行いました
  • @adtygan が https://github.com/vllm-project/vllm/pull/56325 で初のコントリビューションを行いました
  • @amasen02 が https://github.com/vllm-project/vllm/pull/56576 で初のコントリビューションを行いました
  • @amd-sriram が https://github.com/vllm-project/vllm/pull/53792 で初のコントリビューションを行いました
  • @andrewor14 が https://github.com/vllm-project/vllm/pull/52956 で初のコントリビューションを行いました
  • @Ankit-Jaiswal-AMD が https://github.com/vllm-project/vllm/pull/56252 で初のコントリビューションを行いました
  • @baljinderhothi-cohere が https://github.com/vllm-project/vllm/pull/58792 で初のコントリビューションを行いました
  • @BaoYunkai が https://github.com/vllm-project/vllm/pull/57568 で初のコントリビューションを行いました
  • @blipbyte が https://github.com/vllm-project/vllm/pull/55612 で初のコントリビューションを行いました
  • @BPbruce が https://github.com/vllm-project/vllm/pull/46466 で初のコントリビューションを行いました
  • @chuan932 が https://github.com/vllm-project/vllm/pull/55330 で初のコントリビューションを行いました
  • @coderfornow が https://github.com/vllm-project/vllm/pull/54978 で初のコントリビューションを行いました
  • @CZT0 が https://github.com/vllm-project/vllm/pull/51694 で初のコントリビューションを行いました
  • @devtyagi3909 が https://github.com/vllm-project/vllm/pull/56635 で初のコントリビューションを行いました
  • @dilberx が https://github.com/vllm-project/vllm/pull/57076 で初のコントリビューションを行いました
  • @divyvasal が https://github.com/vllm-project/vllm/pull/49845 で初のコントリビューションを行いました
  • @equiluxe が https://github.com/vllm-project/vllm/pull/48115 で初のコントリビューションを行いました
  • @errmakov が https://github.com/vllm-project/vllm/pull/58583 で初のコントリビューションを行いました
  • @farzad-elastix が https://github.com/vllm-project/vllm/pull/56168 で初のコントリビューションを行いました
  • @freyfwt が https://github.com/vllm-project/vllm/pull/51367 で初のコントリビューションを行いました
  • @garrett361 が https://github.com/vllm-project/vllm/pull/57984 で初のコントリビューションを行いました
  • @git-jxj が https://github.com/vllm-project/vllm/pull/55702 で初のコントリビューションを行いました
  • @gokay-ai が https://github.com/vllm-project/vllm/pull/58292 で初のコントリビューションを行いました
  • @gongwei-130 が https://github.com/vllm-project/vllm/pull/55102 で初のコントリビューションを行いました
  • @haosenwang1018 が https://github.com/vllm-project/vllm/pull/58288 で初のコントリビューションを行いました
  • @harshit-sarvam が https://github.com/vllm-project/vllm/pull/56034 で初のコントリビューションを行いました
  • @HieDean が https://github.com/vllm-project/vllm/pull/57356 で初のコントリビューションを行いました
  • @huthvincent が https://github.com/vllm-project/vllm/pull/48419 で初のコントリビューションを行いました
  • @i-m-aditya が https://github.com/vllm-project/vllm/pull/57447 で初のコントリビューションを行いました
  • @jayzuccarelli が https://github.com/vllm-project/vllm/pull/58557 で初のコントリビューションを行いました
  • @jiakangkangfuzhe が https://github.com/vllm-project/vllm/pull/55146 で初のコントリビューションを行いました
  • @jiangLLM が https://github.com/vllm-project/vllm/pull/57487 で初のコントリビューションを行いました
  • @jiaran-king が https://github.com/vllm-project/vllm/pull/56242 で初のコントリビューションを行いました
  • @jz-yolo が https://github.com/vllm-project/vllm/pull/58884 で初のコントリビューションを行いました
  • @kaijunli-infr が https://github.com/vllm-project/vllm/pull/52101 で初のコントリビューションを行いました
  • @karya0 が https://github.com/vllm-project/vllm/pull/57453 で初のコントリビューションを行いました
  • @KEYS-A15 が https://github.com/vllm-project/vllm/pull/57528 で初のコントリビューションを行いました
  • @kwen2501 が https://github.com/vllm-project/vllm/pull/51520 で初のコントリビューションを行いました
  • @laulopezreal が https://github.com/vllm-project/vllm/pull/57189 で初のコントリビューションを行いました
  • @lijipeng787 が https://github.com/vllm-project/vllm/pull/58225 で初のコントリビューションを行いました
  • @limitmhw が https://github.com/vllm-project/vllm/pull/48606 で初のコントリビューションを行いました
  • @linnea-lin-00638949 が https://github.com/vllm-project/vllm/pull/47450 で初のコントリビューションを行いました
  • @LinzeShi が https://github.com/vllm-project/vllm/pull/57347 で初のコントリビューションを行いました
  • @mahird3 が https://github.com/vllm-project/vllm/pull/57708 で初のコントリビューションを行いました
  • @melcheikh が https://github.com/vllm-project/vllm/pull/48956 で初のコントリビューションを行いました
  • @MichaelLapshin が https://github.com/vllm-project/vllm/pull/57396 で初のコントリビューションを行いました
  • @mjkvaak-amd が https://github.com/vllm-project/vllm/pull/48249 で初のコントリビューションを行いました
  • @mkunredd が https://github.com/vllm-project/vllm/pull/58244 で初のコントリビューションを行いました
  • @mmastrac が https://github.com/vllm-project/vllm/pull/57414 で初のコントリビューションを行いました
  • @mustafayildirim が https://github.com/vllm-project/vllm/pull/57252 で初のコントリビューションを行いました
  • @Navjot10 が https://github.com/vllm-project/vllm/pull/55390 で初のコントリビューションを行いました
  • @olka-amd が https://github.com/vllm-project/vllm/pull/51065 で初のコントリビューションを行いました
  • @PeganovAnton が https://github.com/vllm-project/vllm/pull/55128 で初のコントリビューションを行いました
  • @Rakul-Chauhan が https://github.com/vllm-project/vllm/pull/54967 で初のコントリビューションを行いました
  • @Ricardo-M-L が https://github.com/vllm-project/vllm/pull/52580 で初のコントリビューションを行いました
  • @Ronnie-Rui が https://github.com/vllm-project/vllm/pull/54581 で初のコントリビューションを行いました
  • @RyanMa29 が https://github.com/vllm-project/vllm/pull/57295 で初のコントリビューションを行いました
  • @sammaji が https://github.com/vllm-project/vllm/pull/58626 で初のコントリビューションを行いました
  • @sawsa307 が https://github.com/vllm-project/vllm/pull/56497 で初のコントリビューションを行いました
  • @ScarWar が https://github.com/vllm-project/vllm/pull/49435 で初のコントリビューションを行いました
  • @sdougbrown さんが https://github.com/vllm-project/vllm/pull/49819 で初のコントリビューションを行いました
  • @semerandre さんが https://github.com/vllm-project/vllm/pull/55557 で初のコントリビューションを行いました
  • @sergiofigueras さんが https://github.com/vllm-project/vllm/pull/57948 で初のコントリビューションを行いました
  • @shallow10 さんが https://github.com/vllm-project/vllm/pull/58336 で初のコントリビューションを行いました
  • @SIDDARTHAREDDY8 さんが https://github.com/vllm-project/vllm/pull/57743 で初のコントリビューションを行いました
  • @simpleqt さんが https://github.com/vllm-project/vllm/pull/55936 で初のコントリビューションを行いました
  • @tangzzycc さんが https://github.com/vllm-project/vllm/pull/53283 で初のコントリビューションを行いました
  • @touch869 さんが https://github.com/vllm-project/vllm/pull/55844 で初のコントリビューションを行いました
  • @tripathiarpan20 さんが https://github.com/vllm-project/vllm/pull/57140 で初のコントリビューションを行いました
  • @twu3202 さんが https://github.com/vllm-project/vllm/pull/57769 で初のコントリビューションを行いました
  • @ubwzwd さんが https://github.com/vllm-project/vllm/pull/55931 で初のコントリビューションを行いました
  • @UNIDY2002 さんが https://github.com/vllm-project/vllm/pull/58370 で初のコントリビューションを行いました
  • @valarLip さんが https://github.com/vllm-project/vllm/pull/58659 で初のコントリビューションを行いました
  • @vcave さんが https://github.com/vllm-project/vllm/pull/51681 で初のコントリビューションを行いました
  • @voidxb さんが https://github.com/vllm-project/vllm/pull/49300 で初のコントリビューションを行いました
  • @vorapolsiloai さんが https://github.com/vllm-project/vllm/pull/50212 で初のコントリビューションを行いました
  • @vschandramourya さんが https://github.com/vllm-project/vllm/pull/58779 で初のコントリビューションを行いました
  • @weitliao さんが https://github.com/vllm-project/vllm/pull/54535 で初のコントリビューションを行いました
  • @wenjinhust さんが https://github.com/vllm-project/vllm/pull/51366 で初のコントリビューションを行いました
  • @Willian-Zhang さんが https://github.com/vllm-project/vllm/pull/58720 で初のコントリビューションを行いました
  • @wtdcode さんが https://github.com/vllm-project/vllm/pull/56268 で初のコントリビューションを行いました
  • @xinnywinne さんが https://github.com/vllm-project/vllm/pull/55084 で初のコントリビューションを行いました
  • @YannikHinteregger さんが https://github.com/vllm-project/vllm/pull/50047 で初のコントリビューションを行いました
  • @YashasviChaurasia さんが https://github.com/vllm-project/vllm/pull/58112 で初のコントリビューションを行いました
  • @Yatimai さんが https://github.com/vllm-project/vllm/pull/43462 で初のコントリビューションを行いました
  • @YCH188 さんが https://github.com/vllm-project/vllm/pull/57190 で初のコントリビューションを行いました
  • @yousafshah さんが https://github.com/vllm-project/vllm/pull/55957 で初のコントリビューションを行いました
  • @ys2025-AI さんが https://github.com/vllm-project/vllm/pull/56841 で初のコントリビューションを行いました
  • @yuchenwang3 さんが https://github.com/vllm-project/vllm/pull/54699 で初のコントリビューションを行いました
  • @zhecfy さんが https://github.com/vllm-project/vllm/pull/58316 で初のコントリビューションを行いました
  • @Zoe923 さんが https://github.com/vllm-project/vllm/pull/53864 で初のコントリビューションを行いました
  • @Zyann7 さんが https://github.com/vllm-project/vllm/pull/57784 で初のコントリビューションを行いました

コントリビューター

以下のユーザーへのメンションです: @AndreasKaratzas, @khluu, @mgoin, @njhill, @BugenZhao, @stefankoncarevic, @robertgshaw2-redhat, @taneem-ibrahim, @Thangnguyenvn98, @hmellor, @Juntian777, @WoosukKwon, @yewentao256, @gau-nernst, @mmastrac, @LucasWilkinson, @Fangzhou-Ai, @NickLucche, @aoshen02, @JaredforReal, @mawong-amd, @DarkLight1337, @zyongye, @sfeng33, @vllm-agent, @okorzh-amd, @ZJY0516, @shen-shanshan, @gty111, @Isotr0py, @djramic, @zixi-qi, @wzhao18, @alec-flowers, @aarushjain29, @Rohan138, @yma11, @mjkvaak-amd, @ivanium, @yisustc, @MatthewBonanni, @wangxiyuan, @reidliu41, @chaojun-zhang, @shaohuaxi, @gcanlin, @ganeshr10, @linitra24, @yzong-rh, @divakar-amd, @atalman, @ShuoleiWang, @simondanielsson, @rasmith, @chaunceyjiang, @micah-wil, @liusy58, @LioEinaudi, @louie-tsai, @LiuYinfeng01, @jeejeelee, @zhenwei-intel, @jperezdealgaba, @hlin99, @zxd1997066, @lucamotz, @lucifer1004, @eopXD, @ashraf-bhuiyan, @TheEpicDolphin, @JulienDarve, @mayuyuace, @danisereb, @bigPYJ1151, @Etelis, @JohnQinAMD, @jiangkuaixue123, @tianmu-li, @akii96, @vllmellm, @RyanMa29, @afriedri, @elvircrn, @mustafayildirim, @yuzhouo7, @wtdcode, @biswapanda, @adtygan, @hickeyma, @itayalroy, @jiangLLM, @Hotragn, @faaany, @xhx1022, @jinzhen-lin, @sheralskumar, @Wauplin, @matteso1, @wjabbour, @Sunt-ing, @arpera, @hclsys, @S1ro1, @HDCharles, @fxmarty-amd, @liuzijing2014, @UNIDY2002, @samuelkim7, @markmc, @errmakov, @zhejiangxiaomai, @KernelClint, @i-m-aditya, @ColinZ22, @ppalanga, @franciscojavierarceo, @maithilijoshi20, @mfylcek, @almersawi, @albertoperdomo2, @0z5a, @jacklin78911-collab, @lzhan011, @Alex-ai-future, @freyfwt, @ZhengGong-amd, @mindungil, @amasen02, @devtyagi3909, @wenjinhust, @jbyczkow, @AdaAibaby, @harshit-sarvam, @vineethsaivs, @tripathiarpan20, @sashko-zakharchuk, @semerandre, @rebklee, @git-jxj, @cjackal, @xinnywinne, @andrewor14, @kyleliang-nv, @thillai-c, @dongluw, @ChuanLi1101, @omerpaz95, @jiaran-king, @liuyao0322, @coderfornow, @drakosha, @laulopezreal, @melcheikh, @shantipriya-amd, @Rukhaiya2004, さらに、次のユーザーへのメンションも続きます: @yuchenwang3, @lxy-alexander, @tlrmchlsmth, @HieDean, @Zoe923, @YCH188, @amd-sriram, @andylolu2, @MicheleCampi, @sdougbrown, @vMaroon, @shimib, @andakai, @thegoldenflow, @Levius-Fubuki, @olka-amd, @limitmhw, @yuwenzho, @adenzhou1350, @Josephasafg, @kylesayrs, @jdebache, @kaijunli-infr, @afierka-intel, @frida-andersson, @bnellnm, @ys2025-AI, @waizuichougou, @touch869, @rjrock, @sawsa307, @pavelzak, @ScarWar, @fadara01, @Mi-Jiazhi, @dilberx, @mahird3, @Zyann7, @roikoren755, @YukioZzz, @Ronnie-Rui, @acsoto, @czhu-cohere, @twu3202, @oliverholworthy, @weitliao, @sergiofigueras, @tuukkjs, @Sip4818, @karen-sy, @garrett361, @GirasoleY, @Navjot10, @taking-lying-flat, @wangyicong52, @majunze2001, @gangula-karthik, @ubwzwd, @linnea-lin-00638949, @kushaldabbe, @Yatimai, @guanxingithub, @jiakangkangfuzhe, @MichaelLapshin, @jhu960213, @tpopp, @mganczarenko, @qiching, @tangzzycc, @lijipeng787, @nikhilkulkarni1755, @QwertyJack, @Ankit-Jaiswal-AMD, @vorapolsiloai, @Dao007forever, @BPbruce, @divyvasal, @simpleqt, @blipbyte, @jhaotingc, @karya0, @farzad-elastix, @grYe99, @talorabr, @jackLei0901, @Yejing-Lai, @Priyjain-amd, @KEYS-A15, @LinzeShi, @bohnstingl, @nightcityblade, @vcave, @AARONKANG04, @CZT0, @snadampal, @microslaw, @haosenwang1018, @netanel-haber, @khushali9, @sammaji, @SIDDARTHAREDDY8, @100milliongold, @gongwei-130, @fululi12, @mkunredd, @mrodden, @noooop, @valarLip, @shallow10, @200lz, @askliar, @chuan932, @Monishver11, @YashasviChaurasia, @gokay-ai, @jiacao-amd, @yousafshah, @positive666, @TQCB, @lk-chen, @Ricardo-M-L, @huthvincent, @baljinderhothi-cohere, @vschandramourya, @kwen2501, @xiao-llm, @zhecfy, @Willian-Zhang, @simon-veitner-redhat, @mevince, @voidxb, @hongxiayang, @YannikHinteregger, @V-3604, @Rakul-Chauhan, @frankwang28, @LCAIZJ, @PeganovAnton, @jz-yolo, @QHarshil, @R3hankhan123, @jayzuccarelli, @yannicks1, @BaoYunkai, @xaguilar-amd, @xiaohuguo2023, @wxsIcey, @harshaladhav-amd, @varun-sundar-rabindranath, @kliuae, @LostFox11

原文の出典

vLLM Releases

内容について

原文の公開と権利は出典元に帰属します。

機械翻訳 · 原文をご参照ください