vLLM Releases

v0.31.0

# v0.31.0 ## Highlights Dieses Release umfasst 717 Commits von 307 Beitragenden (96 neu)! * **DeepSeek-V4.1-Flash-Leistung**: FlashMLA mega attention mit dem V4.1 NVFP4 compressed KV cache ist jetzt der SM100-Standard…

v0.31.0

Highlights

Dieses Release umfasst 717 Commits von 307 Beitragenden (96 neu)!

  • DeepSeek-V4.1-Flash-Leistung: FlashMLA mega attention mit dem V4.1 NVFP4 compressed KV cache ist jetzt der SM100-Standard (#56935); DeepGEMM sparse MQA logits für den Indexer (#56254) und Mega-Gate, das die gate GEMM mit der expert selection verschmilzt (#56266); an den Decoder-Grenzen werden der TP all-reduce, die mHC input preparation (#57643) und das MoE finalize (#58586) verschmolzen; ein verschmolzenes small-batch WO-A mit inverse RoPE und MXFP8 quant auf SM100/SM103 (#58634); die MXFP8 wo_b GEMM verschmolzen mit dem sequence-parallel reduce-scatter (#57428); Engram wkv shardet über TP-Ranks (#58678) und Engram host tables werden standardmäßig über co-lokale DP-Replikate geteilt (#57651); encoder CUDA graphs für den vision tower (#56625); und SWA bounded replay, das das sliding-window KV aus dem prefix caching heraushält (#56227).
  • Schneller Neustart: die neue vllm preload CLI startet den weight-cache daemon, der post-quantisierte Gewichte über Engine-Neustarts hinweg im GPU-Speicher hält (#56680), jetzt mit data parallelism (#57386), MTP draft models (#57312), einem /health -Endpoint (#58552) und einem readiness wait (#58370). Experimental initialized-engine snapshots (vllm snapshot create/restore) verwenden CRIU, um eine vollständig initialisierte TP1-Engine wiederherzustellen (#51360).
  • Model Runner V2 und speculative decoding: draft-model speculative decoding (#43091) und custom logits processors (#56497) auf Model Runner V2; der neue LiLiCorr drafter (#57934); async scheduling für DFlash (#58065) mit der im draft CUDA graph erfassten context K/V precompute (#57632); DSpark adaptive verification für Gemma4 (#57263) und variable-length decode für Kimi-K3 (#52988); ein DCP target mit einem non-DCP DSpark draft (#56723); und MoE-Speicher wird jetzt während des MRV2-Profiling mitgezählt, wodurch OOMs auf WideEP-Deployments vermieden werden (#57270, #58411).
  • Large scale serving: MoonEP balanced EP all2all backend via --all2all-backend moonep (#52101), prefill context parallelism mit data parallelism (#57075), ein low-SM multimem reduce-scatter für SM100/SM103 (#55072), DeepEPv2 mit sequence parallelism (#57210) und EPLB mit shared-expert overlap (#57236), ein sharding-aware NCCL M2N weight-transfer backend für RL (#51520) und KV offloading back-pressure detection (#50045).
  • Scheduling controls: --max-num-active-seqs begrenzt die RUNNING-Aufnahme unabhängig von max_num_seqs (#56758), --long-prefill-token-threshold passt sich jetzt an die Anzahl wartender Prefills an, statt eine einzelne Anfrage zu chunking (#57951, #58459), die waiting queue wurde überarbeitet, sodass Anfragen, die bereits KV-Blöcke halten, zuerst geplant werden (#58947), und der KV connector + MTP deadlock unter KV-Druck wurde behoben (#57104).
  • HiSparse hardening: MTP verification rows, aufgelöst mit einem union residency kernel (#59235), MTP acceptance collapse unter FULL graphs behoben (#59309), keine GPU-Pages ohne host backing (#59036), ein chunked-prefill preemption livelock behoben (#59494), KV cache dimensioniert nach den Gruppen, die HiSparse allokiert (#59450), sowie Fixes für host prefix publication und GPU prefix adoption (#59007, #59282).
  • Sicherheit: pro Anfrage werden mm_processor_kwargs und media_io_kwargs abgelehnt, es sei denn, --trust-request-mm-kwargs ist gesetzt (#58830); prefix-cache extra keys werden nach Quelle markiert, sodass ein LoRA-Name und ein cache_salt nicht mehr kollidieren können (#51899), und der LoRA-Pfad ist Teil des block hash (#59335); veraltete multimodal receiver-cache-Einträge können keine frischen Payloads mehr ersetzen (#57833).
  • Breaking changes: pro-Request multimodale kwargs durch (#58830) beschränkt; tokenizer_mode="slow" entfernt (#58545); --enable-mamba-fine-grained-prefix-cache umbenannt in --enable-mamba-shared-prefix-checkpoint (#57382); Online-Quantisierung durch quantization="fp8" ersetzt durch die fp8_per_tensor Kurzform (#53585) und die stille Quark-Online-Quantisierung entfernt (#51800); das AllSpark INT8 W8A16-Backend entfernt (#58001); --enforce-eager deaktiviert jetzt auch das JIT-Kernel-Warmup (#58197); XPU Graphs standardmäßig aktiviert mit VLLM_XPU_ENABLE_XPU_GRAPH entfernt (#51600).

Release-Artefakte

Python-Wheels

Plattform Installation
PyPI (CUDA 13.0) pip install vllm
PyPI (CUDA 13.0, uv) uv pip install vllm --torch-backend=auto
ROCm pip install vllm --extra-index-url https://wheels.vllm.ai/rocm/0.31.0/rocm723
XPU uv pip install vllm --extra-index-url https://wheels.vllm.ai/0.31.0/xpu --extra-index-url https://download.pytorch.org/whl/xpu --index-strategy unsafe-best-match

Docker-Images

Plattform Docker-Image
CUDA 13.0 (Standard) docker pull vllm/vllm-openai:v0.31.0
CUDA 12.9 docker pull vllm/vllm-openai:v0.31.0-cu129
ROCm docker pull vllm/vllm-openai-rocm:v0.31.0
CPU docker pull vllm/vllm-openai-cpu:v0.31.0
XPU docker pull vllm/vllm-openai-xpu:v0.31.0

Weitere Artefakte

Vorgefertigte Release-Artefakte sind im Assets -Abschnitt am Ende dieser Seite verfügbar, darunter: - Quellcode-Distributions-Tarball - CUDA 12.9 Python Wheels für x86_64 und arm64 - CUDA 13.0 Python Wheels für x86_64 und arm64 - CPU Python Wheels für x86_64, arm64 und macOS - XPU Python Wheel für x86_64

Modellunterstützung

  • Neue Modellfunktionen: DiffusionGemma strukturierter Generierungsmodus mit begrenzten Einzeltoken-Auswahlen (#57250), MiMo V2 MXFP4 MoE, BF16 MoE Router und DFlash Drafts (#57784), Cohere2MoE auxiliary hidden states für EAGLE3/DFlash Drafters (#49819), GLM-5.2-MXFP4 auf dem ROCm DeepSeek-V3.2-Pfad (#51915), AMD-Quark Mixed-Precision DeepSeek-V4.1-Flash-MXFP4 (#57071) und GLM-5.3-Flash Quark MXFP4 (#56176) Checkpoints sowie ein integrierter granite_thinking_parser für Granite 4.2 (#55957).
  • DeepSeek-V4.1-Flash: FlashMLA Mega Attention mit dem NVFP4 komprimierten KV-Cache als SM100-Standard (#56935), DeepGEMM sparse MQA Logits im Indexer (#56254), Mega-Gate (#56266), fused TP all-reduce + mHC Eingangsvorbereitung (#57643) mit eingefaltetem MoE finalize (#58586), fused Small-Batch WO-A (#58634), MXFP8 wo_b GEMM + reduce-scatter (#57428), überlappende mHC-Koeffizienten für kleine TP-Batches (#57603), beschränkt auf FULL CUDA Graphs (#57874), Engram wkv aufgeteilt über TP (#58678), serialisierte Engram-Lookups mit Huge-Page-Host-Tabellen (#56926), Engram-Tabellen standardmäßig über DP-Replikate geteilt (#57651, #57914, #59068), native Shared-Expert-MegaMoE-Fusion ohne Padding (#56568, #57204), schnelleres MegaMoE Staging und NVFP4 Cache Gathers (#57604), der wiederhergestellte fused Query RMSNorm + MXFP8-Pfad (#57679), KV-only DSpark Context Insertion (#56441), Vision-Encoder-CUDA-Graphs (#56625, #58499), SWA bounded replay (#56227), kausales Bild-SWA wiederhergestellt, damit es zur Referenz passt (#57152), aktualisierte Reasoning-Effort-Mappings (#58316) sowie Start-Fixes für NaN-scored Candidate Blocks (#57454), DeepSelect Sentinels (#58215), DSpark nicht-kausale Attention auf FlashInfer (#57432), Runtime-JIT von Offset-Candidate-Buffers (#57667) und Imports ohne Triton (#57654).
  • DeepSeek V4: FlashInfer sparse MLA mit fused inverse RoPE + FP8-Quantisierung (#58621), gestapelte DSpark Context WKV-Projektionen (#54674), fused MoE Expert Distribution berechnet aus der EP-Gruppe (#57465), FIM-Vervollständigung über suffix (#44229), fehlende string= in Tool-Aufrufen geparst (#56271), an eine bestehende Systemnachricht angehängte Request-Tools (#51856), bewahrter Bildblock-Abstand (#56882) und von der MTP-Stage-Validierung getrennte DSpark-Breite (#54631).
  • GLM-5.3-Flash: opt-in FlashAttention- und FlashMLA-Sparse-Backends auf SM90 (#55385), NoPE sparse MLA auf dem FlashInfer-SM120-Backend (#55277), kooperatives Top-k für kleine Decode-Batches (#57327), durch die Pool-Länge dimensionierter Indexer-Decode-Workspace (3 GiB eingespart, #57701), Metadata-Operationen 1,6-4,8x schneller (#58450), fused kpool tail slot mapping (#57534), kpool top-k über den gemeinsamen Dispatcher (#57546), geringerer Sparse-MLA-Preparation-Overhead (#57458), keine D2H-Synchronisation im SM90 Sparse-MLA-Plan unter async scheduling (#58684), FlashKDA, das den rekurrenten Zustand bei langen Prefills in FP32 hält (#58846), sowie Korrektheits-Fixes für kpool-Korruption mit Speculative Decoding (#58454), SM90 index_kpool -Mismatch (#58704), kpool tail strides (#57477), 500k-Token-Prompts (#57317), dense MLP-Layer unter Sequence Parallelism (#58061), Indexer-Top-k-Backend-Auswahl (#58594) und varlen paged MQA Launches (#55270).
  • Qwen3.8-Flash-Next (Qwen4Exp): FP8-Haupt-KV-Cache auf dem QSA-Pfad (#55557), FP8 TP mit FlashInfer TRTLLM MoE (#55867), SM90 QSA-Tuning (#57273), fused HC down projection + SiLU (#58957), geringerer PLE-Metadata-Overhead (#58114), behobene QSA-Indexer-Workspace-Fragmentierung (#57105), freigegebener Profiling-KV-Cache (#58961), pinned PLE prefetch ids, die aus dem CUDA-Graph-Pool herausgehalten werden (#58489), sowie indizierte Expert-Mapping-Lookups, die beim Laden der Gewichte auf DGX Spark etwa 25 s sparen (#58720).
  • Kimi K3 und MiniMax-M3: Kimi-K3 Vision Patch Embedder als GEMM (#58527), fused KimiViT QK RoPE (bis zu 29x, #58651), geroutete Experten-Quantisierung (#57430), Reasoning-Parser (#57098) und Reasoning-Token-Zählung (#58372) Fixes, DSpark Context KV-Zeiger nach Re-Binding aktualisiert (#58814), zustandslose erste Chunks werden nicht länger als Decodes klassifiziert (#51483) und Mamba-Block-Schätzungen, die die Zulassung bei externen Prefix-Treffern nicht länger blockieren (#57050); MiniMax-M3 Encoder-CUDA-Graphs (#58673), Conv3dLayer Patch Embedding (etwa 62x, #58512), triton_mrope im Vision Tower (#58526), fusioniertes MiniMax2-Routing mit Nicht-Unit-Skalierung (#58880) und Prozessor-Korrekturen (#58460, #59613).
  • DiffusionGemma: Sampler-Statistik-Kernel im Einzeldurchlauf (#58226), diffusion_constrained Lesevorgänge über logprob_token_ids (etwa 25% schneller, #58216), weniger Logit-Zeilen für Prefill-only-Batches (#57416), logprob_token_ids Unterstützung (#57417) sowie Korrekturen für gleichzeitige logprobs (#57414), Eager-Fallback-Dtype (#57462), multimodale Eingaben (#57589), quantisierte LM-Köpfe (#48521) und CPU-Ausführung (#58964).
  • Multimodal: Triton mm_input_norm kernel (#56798, #56711), rohe Pixel werden durch den DP-sharded ViT-Pfad beibehalten (#56872), Qwen2.5-VL video fps für temporales M-RoPE beachtet (#47736), Whisper- und Qwen2-Audio-Clips länger als 30s (#57769, #56912), Mistral3-Platzhalter-Raster (#53758), Idefics3 ungeteilte Patches (#48760), Ovis2.5 Tokens (#52623), Aria-Experten-Gewichte (#57487), MiMo-V2.5 fused FP8 qkv_proj sharding (#57508), Gemma4 AutoWeightsLoader (#55911) und Buffer-Skalare (#54213), Gemma4 FP8 KV mit FA4 bei Head-Dim 512 (#53175), Laguna RoPE (#57189), Mistral-Large-3 Genauigkeitsregression (#57563), fehlerhafte EXIF-Daten (#56527, #57234), JinaVL-Labels (#57347), Sarvam MLA-Routing mit FP32-Router-Logits (#56034), fused CohereASR Attention-Scores (#55190) und fused DFlash2 Grouped Convolution (#55960).
  • LoRA„: Nemotron VL Sprachmodelle (#56231), ModernBert (#57148), VoyageQwen3 Embeddings (#57708), RoBERTa Sequenzklassifikation (#58884) und“ modules_to_save Sequence-Classification-Heads (#53555) mit per-Adapter num_labels (#57766).

Engine Core

  • Model Runner V2: Draft-Modell-Speculative-Decoding (#43091), benutzerdefinierte Logits-Prozessoren (#56497), validiert bei der Aufnahme (#57728), randomisierte Dummy-Eingaben (#58411), während des Profilings an MoE-Experten geroutete Dummy-Tokens (#57270), FULL-Decode-Graphen für Prompt-Schlüsse mit einem Token (#58400), geteilte Token-zu-Request-Zuordnungen (#57102) und über KV-Cache-Gruppen hinweg wiederverwendete Mamba/GDN-Metadaten (#58762), CUDA-Graphen für reine Encoder-ViT (#56922), Weight-Offloader (#57834) und Pooling-Modell (#57737) beim Herunterfahren freigegeben sowie Fixes für Multi-Layer-MTP-KV in P/D (#55055), Fast-Prefill mit LoRA (#56456), veraltete Block-Table-Schreibvorgänge durch Dummy-Draft-Schritte (#56734), gepolsterte Prompt-Schlüsse in hybriden Modellen (#58434), nie vorgeschlagene Draft-Slots (#58784), Auto-Fit max_model_len (#58149) und intermediate_tensors während der Erfassung (#57745).
  • Spekulatives Dekodieren: LiLiCorr-Drafter (#57934), DFlash async scheduling (#58065) und Kontext-K/V im Draft-CUDA-Graphen (#57632), Gemma4 DSpark adaptive Verifizierung (#57263), Kimi-K3 variable-length adaptive Verifizierung (#52988), CPU-GPU-Synchronisierung für heterogene Vokabulare entfernt (#57396), Triton-Rekompilierungen im Acceptance-Estimator vermieden (#57107), sowie Fixes für EAGLE/dense Drafts mit EP (#56930), DFlash/DSpark-Profiling-Batches (#56448), GLM-MTP-Head-Speicher (#55442), Prompt-Embeddings mit Drafts (#57356) und TritonMLA causal multi-token decode (#51065).
  • Scheduler: --max-num-active-seqs (#56758), adaptives --long-prefill-token-threshold (#57951, #58459), skipped_waiting wird durch eine KV-haltende Warteschlange ersetzt (#58947), atomare Zulassung von n > 1 Requests (#53936), KV-Connector + MTP Deadlock (#57104), eine Durchsatzklippe, wenn max_num_seqs kein Vielfaches von 8 ist (#57355), Streaming-Fortsetzungen, die Logprobs beibehalten und max tokens aktualisieren (#57447, #57676), ein Resumable-Request- + Async-Scheduling-Race (#58259) und ein nicht-blockierender Structured-Output-Grammatik-Poll (#55931).
  • Prefix-Caching und hybride Modelle: zusätzliche, nach Quelle markierte Schlüssel (#51899) und gehashte LoRA-Pfade (#59335), --enable-mamba-shared-prefix-checkpoint (#57382), Prompt-Tail-Treffer mit MTP wiederhergestellt (#58368), Prompt-End-Checkpoints unter sparse retention beibehalten (#59146), Align-Mode-Checkpoint-Reservierung (#59175), zustandslose GDN-Erstblöcke (#51565), MTP-Draft-KV-Cache-Gruppen, die auf dem Hybrid-Gruppierungspfad annotiert werden (#55390), ein verallgemeinerter Prefill-Checkpoint-Builder (#57783), batchweise Mamba2-Prefill-State-Saves ohne GPU-CPU-Synchronisierungen (#49371), skip_reading_prefix_cache wird bei Connector-Treffern beachtet (#57269), inkrementelles multimodales Block-Hashing (#51694), eine KV-Blockgröße, die jedes Attention-Backend unterstützt (#49845) mit klareren Fehlermeldungen (#58557), und CacheConfig.effective_attention_block_size für DCP (#56538).
  • Start und Speicher: parallele Triton-Warmup-Kompilierung (#58582), JIT-Warmup deaktiviert unter --enforce-eager (#58197), sofern keine Fehlertoleranz aktiv ist (#58593), DeepGEMM-Warmup, das den MoE-Workspace wiederverwendet (#57268), Allocator-Fragmentierung schrumpft den KV-Cache während des Profilings nicht mehr (#58430), sparse Prefill-Puffer werden vor der KV-Größenbestimmung reserviert (#57575), veraltete FlashMLA-Workspace-Views freigegeben (#56902), DeepGEMM-FP8-Workspace halbiert (#53914), gemeinsame Marlin/Humming-Workspaces (#57421), FlashInfer-BF16-MoE-Gewichte werden in-place konvertiert (#54699), UniProc-Startthreads durch das CPU-Kontingent begrenzt (#58946) und Laufzeit-Threads werden vor dem Profiling festgelegt (#55891).
  • Kernels: sampled filtering für persistentes Top-k (#56346), Murmur3-RNG für Gumbel-Sampling (#51367), register-residentes Per-Token-Group-8-Bit-Quant (#55330), vektorisiertes Per-Tensor-FP8-Abs-Max (#58194), ein Triton-Kernel-Dispatcher für plattformspezifische Overrides (#43048), GateLinear für alle MoE-Modelle (#58234), nicht-lokale Expert-Slots werden übersprungen in TritonExperts (#58051), verzögertes TRT-LLM-Gen-Top-k-Finalize auf dem modularen Pfad (#58635), SM120 batch-invariante Matmul-Konfigurationen (#57456), begrenzter FlashInfer-Prefill-Dequant-Scratch (#57918) sowie Fixes für Triton-Softcap-NaNs (#56579), QuIP-Hadamard-Transformationen (#43462), CUTLASS FP8 linear auf A100 (#55884), FlashInfer-Sampling auf nicht unterstützten GPUs (#48956), SM100 FP8 blockwise scale padding (#57377), mixed FULL graph prefill capture (#58275), Inductor-Custom-Op-Pattern-Matching (#58189), CuteDSL-BF16-GDN-Prefill, das auf Qwen3.5 von FLA abweicht (#53864), SM100 fp8_ds_mla Cache-Skalierung (#49435), verzerrte Decode-Batches im Sparse-Indexer (#52500), veraltete allowed_token_ids Masken nach der Batch-Neuanordnung (#48419, #43931) sowie prompt_embeds Tensoren, die nach Abschluss von Anfragen gehalten werden (#57988).
  • Batch-Invarianz: brechbare CUDA-Graphen ohne torch.compile standardmäßig unter VLLM_BATCH_INVARIANT (#57586), Sequence Parallelism und async TP deaktiviert (#56377), und NCCL-2.31-Kollektive aktiviert gelassen (#58179).
  • Sleep und RL: release_kv_cache_memory() gibt nur KV-Cache-Speicher frei (#44890), --sleep-preserve-parameter-names behält eingefrorene Gewichte über Level-2-Sleep hinweg bei (#57891), NCCL-M2N-Gewichtsübertragung (#51520), dense-DP-Gewichtsaktualisierungen nach DP-Index (#56950), Allocator-Konfiguration beim Umschalten von expandable segments beibehalten (#57982), und Fehler beim Cache-Reset werden während des Sleeps propagiert (#54581).
  • Schneller Neustart: vllm preload (#56680), DP (#57386), MTP-Entwürfe (#57312), Warten auf Bereitschaft (#58370), /health (#58552), ModelOpt-MXFP8-vorverarbeitete Gewichte (#57316) und Snapshots initialisierter Engines (#51360).
  • Logging und Observability: LoggingConfig über --logging-config und --log-level (#57205), Fehlerbehebungen beim JSON-Logging (#57957, #58747), Unterdrückung von Startprotokollen behoben (#51366), vereinheitlichtes plattformabhängiges torch-Profiling (#57460), keine 0.0%-Prefix-Cache-Trefferquote vor der ersten Anfrage (#54990), Formatierung der KV-Transfer-Metriken (#57068), MFU-Aktivierungsgröße aus dem Model-Dtype (#57070), plattformüberschreibbare Umgebungsvariablen-Prüfungen (#48599), VLLM_TARGET_DEVICE=empty pip install vllm für Out-of-Tree-Backends (#41074) und die korrekte vLLM-Version bei Installation aus dem Quellcode gemeldet (#57295, #57744).

Large Scale Serving

  • MoE-Kommunikation: MoonEP-Backend (#52101), DeepEPv2 mit Sequence Parallelism (#57210) und EPLB + Shared-Expert-Overlap (#57236), Low-SM-multimem-Reduce-Scatter (#55072), EPLB-Laststatistiken während des Elastic-EP-Scalings (#58473), SP-gepolsterte Zeilen im grouped Routing übersprungen, sodass Rank 0 kein Prefill-Straggler mehr ist (#56079), Hash-Routing auf nicht unterstützten monolithischen Backends abgelehnt (#57867), Sampled-Token-Broadcasts unter PP für Anfragen übersprungen, die die Engine verlassen (#58542), DBO mit DeepEP-Low-Latency-Profiling (#57502), externer LB mit Replikaten, die sich Knoten teilen (#53743), und keine blockierenden RPCs während des Engine-Handshakes (#57226) oder unbegrenzte Wartezeiten auf Draft-Tokens (#58779).
  • Context Parallelism: PCP mit DP, EP und MTP (#57075), ein DCP-Ziel mit nicht-DCP-DSpark/DFlash-Entwürfen (#56723), DCP-Sequenzlängen ohne CPU-GPU-Synchronisation (#58169) und NIXL-DCP-Pulls über MLA-Cache-Regionen hinweg (#57389).
  • KV-Connectors: NIXL-Pipeline-Parallel-Push-Prefill für Attention-HMA (#50494) und gepackte MLA-Layouts (#50499), Metriken für Transportfehler von KV-Ablauf getrennt (#55854), Zustand toter Peers freigegeben, ohne auf TTL zu warten (#50047), abgelaufene Leases hinter einem mit Heartbeat versorgten Head eingesammelt (#58292), Push-Completion wiederhergestellt (#58188), D-seitige Aktivität aufgezeichnet (#52245); Mooncake CUSTOM_MEM_POOL (#49300), Anfrage-Level-Lastverteilungsfehler unter HMA (#56855, #57174) und Bootstrap-Retries (#58919); MoRIIO-Hybrid-Mamba/KDA-Zustand im READ-Modus (#51052) und eine Multi-Decode-Routing-Race-Condition (#51681); Prefill-Cache-Treffer in prompt_tokens_details (#54222); KV-Event-Publisher an Port 0 gebunden (#55844); KV-Cache-Metadaten-GET für externe Konsumenten wiederhergestellt (#56925); Partial-Block-KV-Events behalten jede multimodale Funktion (#58288); Speicherungen auf Schritten ohne Forward abgeschlossen (#57775); abort-sicheres ExampleHiddenStatesConnector (#56841); DecodeBench-FP8-Fills (#58472); ein KvHints -Anfrage-Envelope (#53423); und der AuxOutput-Connector für Routed-Expert-Outputs (#45635, #58150, #58205).
  • KV-Offloading: pro Anfrage max_load_tokens (#55885), Back-Pressure-Erkennung (#50045), SimpleCPUOffloadConnector Prometheus-Metriken (#57251), nicht-Prefix-Cacheable-Gruppen (#56810) und Scratch-Gruppen (#57145) übersprungen, replizierte Layouts für Multi-Group-MLA (#57652), Regionen von 512 GiB oder mehr in Blöcken registriert (#51081), cgroup-Speicher vor SHM-Allokation geprüft (#54014) sowie Fehlerbehebungen für Cache-Recency (#51787), MTP-behaltene Sliding Windows (#56709), kanonische MLA-Zeilen (#56799), Event-Metadaten (#57453) und ROCm-Pinned Memory (#57160).
  • HiSparse: Union-Residency-Kernel für MTP-Zeilen (#59235), MTP-Akzeptanz unter FULL-Graphen (#59309), Host-basierte Allokation (#59036), Preemption-Livelock (#59494), KV-Cache-Größenbestimmung (#59450), Host-Prefix-Veröffentlichung (#59007), GPU-Prefix-Übernahme (#59282) und Residency-Metriken (#58725).
  • Encoder-Disaggregation (EPD): dynamischer EPD-Proxy mit launcher-verwalteter Registrierung (#54176), Bildanfragen gebündelt pro Encoder (#57095), Cross-Encoder-Caching über Mooncake (#56242), nur-Metadaten-Audioeingaben (#57887), übersprungene Language-Model-Shards für --mm-encoder-only (#58086), EC-Connector-Metriken (#54960) und Encoder-only-Fixes (#58490, #58287, #57696).

Hardware & Performance

  • NVIDIA: FlashInfer 0.7.0.post1 (#58069, #59323), DeepGEMM-Pin-Aktualisierung mit SM120-Fixes (#57218), Rubin CUDA 13.4 Nightly-Images (#55953) und QuTLASS-Builds mit PyTorch 2.13 (#58173).
  • AMD ROCm: AITER v0.1.23 (#56885, #58867), torch 2.13 und Triton 3.8 (#50605, #58006), triton_kernels 3.8 MXFP4 MoE für gpt-oss und DeepSeek-V4 (#55934), ein ROCR-Host-Segfault behoben (#57328); DeepSeek-V4/V4.1 HCA Dual-Stream (#56853) und layer-aware CSA2 Overlap (#57407), FP8 wo_a (#54894), inverse RoPE in den Sparse-Decode-Reduce fusioniert (#57435, #57451), der nun MXFP8 für ein gruppiertes FP8 ausgibt wo_a (#58456), MXFP8 GEMM auf nativen 32x32 Skalen auf gfx950 (#58510), wiederverwendetes Top-k Ragged-Metadaten (#57434), schnellere Kandidatenblock-Auswahl (#58208), Engram-Tabellen im Host-Speicher (#57491) und Qwen3.8-Flash-Next PLE-Tabellen in den Host-Speicher ausgelagert (#57497), eine opt-in AITER ASM-Decode-Route für DCP + Speculative Decoding (#56861), get_top_tokens() auf dem DeepSeek V4 MTP Drafter (#57568), DSpark adaptive Verifikation (#52362), opt-in VLLM_DSV4_LOGITS_FIX für Sparse-Indexer-Logits auf gfx950/gfx942 (#50455), eine Genauigkeits-Rücksetzung von #56433 und #51692 (#57132), sowie klare Fehlermeldungen für FSE mit DPA+ETP (#57919); Kimi-K3 a4w4 FlyDSL-Kernel (#53940) mit VLLM_ROCM_USE_AITER_MOE_SITUV2=a16w4|a8w4|a4w4 (#58201), Speculative KDA bei niedriger Konkurrenz (#58045), sharded latent MoE unter EP (#54956) und weniger Projektkopien (#50592); ein ROCm Hy4-Pfad mit torch.compile (13x niedrigere Decode-Latenz, #57526); MiniMax-M3 AITER QK-Norm-Fusion (#54535), copy-freies K/V-Einfügen (#56849) und MXFP8-Fixes (#53674, #58089); GLM-5.3-Flash Boot-Fixes (#57192, #57252, #57425); AITER QuickReduce + RMSNorm (#48249), BF16 AsyncTP (#58098), statische FP8-Attention-Output-Fusion (#58099), QK-Norm/RoPE/KV-Cache-Fusion für MRoPE (#50212), AITER GDN Decode für flache Layouts (#53623), wvSplitK für Single-Output-GEMMs (#53283), 69 Kopien weniger pro Decode-Schritt auf dem Skinny-GEMM-Pfad (#58566), abgestimmte GEMM-Lookup über AITER (#55001), ein schmaleres Triton-Prefill-KV-Tile auf RDNA3/RDNA4 (#58225), gestaffelte große pageable H2D-Kopien (#56343), sowie Fixes für MXFP4-MoE-Padding, das den KV-Cache aushungerte (#56359), AITER MLA FP8 Prefill OOM (#57923), unquantisierte Cache-Descales (#56726) und AITER-MoE-Fallbacks (#56590, #57866, #57426). VLLM_ROCM_USE_AITER_FP4_ASM_GEMM wird wiederhergestellt und ist standardmäßig aus (#57055); SWA bounded replay ist auf ROCm deaktiviert (#57906).
  • Intel XPU: PyTorch 2.14 (#56013), XPU Graphs standardmäßig aktiviert (#51600), EPLB (#44987), int8 W8A8 MoE auf Triton (#53162), Batch-Invarianz (#55881), SYCL Rotary Embedding (#55721), fusioniertes QK RMSNorm + RoPE + Gate (Decode-Region 55% schneller, #56096), Model Runner V2 Sampler (#57277) und PP-Microbatch-Kontrolle (#55145), --device-ids berücksichtigt (#56015), sowie ein Device-Pointer-Overflow behoben (#54514).
  • CPU: FP8 W8A8 Linear und MoE für Intel Diamond Rapids (#49942), Arm Paged Attention bis zu 25% schneller (#56045), Zen DA8W4 int4 für Dense- und MoE-Schichten (#54024), zentorch SDPA für Encoder-Attention (#54508) und MLA Prefill (#54967), FP32 Attention Sinks (#56252), W8A8 INT8 MoE auf POWER (#55316), W4A16 Whisper (#58268), Wheels gebaut auf Ubuntu 22.04 (glibc 2.34) mit AMX-FP8 (#58515), AVX10.2 an Compiler-Unterstützung gekoppelt (#58133), vorgebautes Triton CPU (#58140), --device-memory-utilization Alias (#56547), vLLM Recipes im CPU-Image (#58796, #57306), s390x protobuf Pin (#54978) und torchcodec Video (#58693), sowie Fixes für Ministral FP8 (#56985), FP32-Router-Gewichte (#56168), zentorch-Importfehler (#54923), macOS multimodale SHM (#57142), CPU-Affinität pro lokalem Rank (#53636) und NIXL GDN State-Layout (#53300).

Quantisierung

  • Humming: Hadamard-Transformationen und NVFP4/MXFP4/MXFP8-Online-Quantisierung (#56685), asymmetrisches wNaM über compressed-tensors (#46528), humming-kernels 0.1.16 (#58054), sowie Humming im W4A8 (INT4xFP8) MoE-Oracle (#58427).
  • Neue Funktionen: native Quark W4A16 INT4/UINT4-Exporte (#48606), opt-in MXFP4-Dequantisierung zur Ladezeit (#50814), explizite Per-Token-NVFP4-MoE-Backends (#57176), sowie ein kanonisches N-first-Layout für compressed-tensors WNA16 MoE (#52798).
  • Fixes: MXFP8 auf Schichten unter mm_mxfp8 Shape-Limits (#54223), Online-NVFP4-Skalen beim Neuladen (#57954), LM-Head-Linear-Metadaten (#58444), sowie der unter einem SwiGLU-Clamp übersprungene fused SiLU-Mul Block-Quant-Pfad (#57984).

API & Frontend

  • Neue Optionen und Endpunkte: --tool-strict-level (#56268), response_format mit tool_choice=auto (#56086), DeepSeek-V4 FIM Completions (#44229), release_kv_cache_memory() und POST /release_kv_cache_memory (#44890), Fixed-Token-Prefill-Scoring über prompt_logprob_token_ids (#54335), Per-Request-Speculative-Decoding-Metriken in /inference/v1/generate (#43310), Per-Request-Metriken (#55084) und cache_write_tokens (#57222) in der Responses API, Anthropic thinking in /v1/messages (#58613), Streaming von Reasoning- und Tool-Aufrufen vom Derender-Endpunkt (#50550) mit ausgelagerter Detokenisierung (#57528), vllm chat Streaming von Thinking-Ausgaben (#57045), Debug-Logging des Request-Bodys mit --enable-log-requests (#58163), und nur die Zusammenfassungszeile von Config-Docstrings in --help (#57357).
  • Structured Output und Parser: native Lark-Grammatiken im xgrammar-Backend (#58321), XGrammar 0.2.7 (#57272), Granite migriert zur Streaming Parser Engine (#49648), sowie Fixes für Reasoning-Grenzen (#56635), xgrammar choices mit Steuerzeichen (#48115), JSON Schema mit List-Typ (#48416), leere structural_tag (#47450), outlines-EOS-Behandlung (#58612, #57743), vom Parser unterdrückte Streaming-Logprobs (#58583), Inkling-Tool-Namen nach Reasoning (#58792), und Länge finish_reason für abgeschnittene Streaming-Tool-Aufrufe (#46303).
  • OpenAI-, Anthropic- und Harmony-Kompatibilität: Reasoning-Token-Zählungen für Harmony, DeepSeek-V3 und Step3 (#58626) sowie pro Responses-Tool-Runde (#58927), Harmony max_output_tokens in der Tool-Schleife (#58551), gestapelte Chat-Completions mit den angepassten Anfragen (#58929, #58958), ein frischer Parser pro Choice (#58939), verzögerte Reasoning-Neuzählungen (#56067), Responses-MCP-Aufräumarbeiten (#56988) und Bild- detail Standard (#57241), Anthropic-Inline-System-Erkennung (#58754) und deaktiviertes Thinking mit P/D (#58786), Stop-Strings abgelehnt auf --tokens-only Servern (#57058), ungültige prompt_embeds geben 400 zurück (#55451, #57006), Prompt-Begrenzung nach multimodaler Expansion (#57076), --override-generation-config Penalties (#50769), Hub-Revisionen (#56092, #57461), vollständige Logprobs in Token-in/Token-out-Antworten (#58488), Abbruch generativen Scorings (#57729, #58788), gRPC-Keepalive-Pings (#55102) und run-batch diarisierte Transkriptionen (#57948).
  • Pooling: Chunked-Embedding-Padding (#56505) und Normalisierung (#57498), Reranker-Tokenisierung mit Dokumentgrenzen (#57666) und Köpfe der BERT-Familie, die für rohe Logits erhalten bleiben (#57664).
  • Rust-Frontend: --hf-overrides (#56931), --sse-keep-alive-interval (#58306), benutzerdefinierte Chat-Rollen (#58311), MiMo-V2.5-Parser (#57933), normalisierte Reasoning-Steuerungen (#56998), parser-eigene Output-Grammatiken (#55269, #57340), Sampling-Masken über gRPC (#56777), lokale DP-Größe in gRPC-Metadaten mit vllm-proto 0.3.0 (#57116, #57233), ein Preemption-Histogramm pro Anfrage (#57033), lock-freie Histogramme (#58574), Nemotron-H-Vision-Kontext (#57634), modell-eigene Vision-Prozessoren (#58109), ein mm-processor Benchmark (#51922, #58084, #58378), nicht unterstützte Serve-Argumente werden erkannt (#58330), NaN-Logprobs töten den Engine-Client nicht mehr (#51026), angehängte EngineCoreOutput Felder werden akzeptiert (#56533), und vllm-rs auf PATH im CUDA-Image (#57606).
  • Benchmarks: ein openai-responses Backend für vllm bench serve (#54628) und model_id in Latenz-/Durchsatz-JSON (#58112).

Sicherheit

  • Pro Anfrage mm_processor_kwargs und media_io_kwargs werden standardmäßig abgelehnt; vertrauenswürdige Deployments aktivieren dies mit --trust-request-mm-kwargs (#58830).
  • Prefix-Cache-Block-Hashes kennzeichnen zusätzliche Schlüssel nach Quelle (#51899) und enthalten den LoRA-Pfad (#59335); multimodale Hash-Eingaben werden gerahmt (#54283) und inkrementelles Block-Hashing deckt jedes überlappende Feature ab (#51694).
  • Frische multimodale Payloads haben Vorrang vor einem veralteten Empfänger-Cache (#57833), und Encoder-Cache-Treffer mit nicht übereinstimmenden Embedding-Anzahlen werden abgelehnt (#57696).
  • min_tokens über dem gefüllten max_tokens Standardwert wird abgelehnt, statt die Engine zu blockieren (#57731); die Nachrichten-Sanitisierung filtert Speicheradressen in Großbuchstaben (#58832); LoRA-Adapter, die nach einem servierten Modell benannt sind, werden abgelehnt (#59286).

Abhängigkeiten

  • FlashInfer 0.7.0.post1 (#58069, #59323), Transformers 5.17.0 (#56108) mit einer oberen Grenze in requirements (#59614), XGrammar 0.2.7 (#57272), oss-harmony Ersetzen von openai-harmony (#55128), DeepGEMM-Fork-Pin-Bump (#57218), FlashKDA-Bump (#58846) und humming-kernels 0.1.16 (#58054).
  • CUDA-12-Images verwenden LMCache 0.4.4 und CuPy CUDA 12 (#57945); ein separat getaggtes zstd-Docker-Hub-Image (-x86_64-zstd) wird veröffentlicht (#55608); Rubin CUDA 13.4 Nightly-Images (#55953).
  • ROCm: AITER v0.1.23 (#58867), torch 2.13, Triton 3.8 (#50605, #58006), gepatchtes ROCR (#57328), LMCache-OpenTelemetry-Pins (#59056).
  • XPU: PyTorch 2.14 (#56013). CPU: Wheels gebaut auf Ubuntu 22.04 (#58515), vorgebautes Triton CPU (#58140).

Breaking Changes & Deprecations

  • Pro Anfrage mm_processor_kwargs und media_io_kwargs geben nun einen Fehler zurück, sofern der Server nicht mit --trust-request-mm-kwargsgestartet wurde; serverweite --mm-processor-kwargs / --media-io-kwargs und Offline- LLM sind unverändert (#58830).
  • tokenizer_mode="slow" wurde entfernt; es verhielt sich bereits wie "hf" unter Transformers v5 (#58545).
  • --enable-mamba-fine-grained-prefix-cache wurde umbenannt in --enable-mamba-shared-prefix-checkpoint (#57382).
  • Online-Quantisierung durch quantization="fp8" leitet nun auf die fp8_per_tensor Online-Kurzform um (#53585); Quark-spezifische stille Online-MXFP4-Quantisierung wurde zugunsten der Online-Quantisierungs-API entfernt (#51800).
  • Das AllSpark INT8 W8A16 GEMM-Backend wurde entfernt (#58001). Die return_assistant_tokens_mask Option von /render und das assistant_tokens_mask Antwortfeld wurden entfernt (#57520).
  • VLLM_PLE_CPU_OFFLOAD wurde entfernt; verwenden Sie --engram-config (#57937). VLLM_XPU_ENABLE_XPU_GRAPH wurde entfernt und XPU-Graphs sind standardmäßig aktiviert (#51600).
  • Die kommagetrennte Form von --collect-detailed-traces wurde entfernt; verwenden Sie die Listensyntax (#55702).
  • Neue Standardwerte: --enforce-eager deaktiviert außerdem das JIT-Kernel-Warmup, sofern keine Fehlertoleranz aktiviert ist (#58197, #58593); VLLM_BATCH_INVARIANT=1 verwendet unterbrechbare CUDA-Graphs ohne torch.compile (#57586) und deaktiviert Sequence Parallelism und async TP (#56377); DeepSeek-V4.1 SWA bounded replay ist aktiviert (#56227), außer auf ROCm (#57906); Engram-Host-Tabellen werden, wenn möglich, über ko-lokale DP-Replikate geteilt (#57651); FlashMLA mega attention ist der Standard für DeepSeek-V4.1 auf SM100 (#56935); der AITER w4a4 ASM GEMM ist auf ROCm standardmäßig deaktiviert (#57055).
  • Model Runner V1 + PP > 1 + async scheduling + structured output wird nun beim Start abgelehnt (#56250); json_object wird bei der Validierung mit dem outlines-Backend abgelehnt (#57743).
  • transformers hat nun eine obere Grenze in den Anforderungen (#59614).

Neue Mitwirkende

  • @0z5a hat ihren ersten Beitrag in https://github.com/vllm-project/vllm/pull/56441 geleistet
  • @200lz hat ihren ersten Beitrag in https://github.com/vllm-project/vllm/pull/55528 geleistet
  • @AARONKANG04 hat ihren ersten Beitrag in https://github.com/vllm-project/vllm/pull/48521 geleistet
  • @acsoto hat ihren ersten Beitrag in https://github.com/vllm-project/vllm/pull/57314 geleistet
  • @adenzhou1350 hat ihren ersten Beitrag in https://github.com/vllm-project/vllm/pull/56882 geleistet
  • @adtygan hat ihren ersten Beitrag in https://github.com/vllm-project/vllm/pull/56325 geleistet
  • @amasen02 hat ihren ersten Beitrag in https://github.com/vllm-project/vllm/pull/56576 geleistet
  • @amd-sriram hat ihren ersten Beitrag in https://github.com/vllm-project/vllm/pull/53792 geleistet
  • @andrewor14 hat ihren ersten Beitrag in https://github.com/vllm-project/vllm/pull/52956 geleistet
  • @Ankit-Jaiswal-AMD hat ihren ersten Beitrag in https://github.com/vllm-project/vllm/pull/56252 geleistet
  • @baljinderhothi-cohere hat ihren ersten Beitrag in https://github.com/vllm-project/vllm/pull/58792 geleistet
  • @BaoYunkai hat ihren ersten Beitrag in https://github.com/vllm-project/vllm/pull/57568 geleistet
  • @blipbyte hat ihren ersten Beitrag in https://github.com/vllm-project/vllm/pull/55612 geleistet
  • @BPbruce hat ihren ersten Beitrag in https://github.com/vllm-project/vllm/pull/46466 geleistet
  • @chuan932 hat ihren ersten Beitrag in https://github.com/vllm-project/vllm/pull/55330 geleistet
  • @coderfornow hat ihren ersten Beitrag in https://github.com/vllm-project/vllm/pull/54978 geleistet
  • @CZT0 hat ihren ersten Beitrag in https://github.com/vllm-project/vllm/pull/51694 geleistet
  • @devtyagi3909 hat ihren ersten Beitrag in https://github.com/vllm-project/vllm/pull/56635 geleistet
  • @dilberx hat ihren ersten Beitrag in https://github.com/vllm-project/vllm/pull/57076 geleistet
  • @divyvasal hat ihren ersten Beitrag in https://github.com/vllm-project/vllm/pull/49845 geleistet
  • @equiluxe hat ihren ersten Beitrag in https://github.com/vllm-project/vllm/pull/48115 geleistet
  • @errmakov hat ihren ersten Beitrag in https://github.com/vllm-project/vllm/pull/58583 geleistet
  • @farzad-elastix hat ihren ersten Beitrag in https://github.com/vllm-project/vllm/pull/56168 geleistet
  • @freyfwt hat ihren ersten Beitrag in https://github.com/vllm-project/vllm/pull/51367 geleistet
  • @garrett361 hat ihren ersten Beitrag in https://github.com/vllm-project/vllm/pull/57984 geleistet
  • @git-jxj hat ihren ersten Beitrag in https://github.com/vllm-project/vllm/pull/55702 geleistet
  • @gokay-ai hat ihren ersten Beitrag in https://github.com/vllm-project/vllm/pull/58292 geleistet
  • @gongwei-130 hat ihren ersten Beitrag in https://github.com/vllm-project/vllm/pull/55102 geleistet
  • @haosenwang1018 hat ihren ersten Beitrag in https://github.com/vllm-project/vllm/pull/58288 geleistet
  • @harshit-sarvam hat ihren ersten Beitrag in https://github.com/vllm-project/vllm/pull/56034 geleistet
  • @HieDean hat ihren ersten Beitrag in https://github.com/vllm-project/vllm/pull/57356 geleistet
  • @huthvincent hat ihren ersten Beitrag in https://github.com/vllm-project/vllm/pull/48419 geleistet
  • @i-m-aditya hat ihren ersten Beitrag in https://github.com/vllm-project/vllm/pull/57447 geleistet
  • @jayzuccarelli hat ihren ersten Beitrag in https://github.com/vllm-project/vllm/pull/58557 geleistet
  • @jiakangkangfuzhe hat ihren ersten Beitrag in https://github.com/vllm-project/vllm/pull/55146 geleistet
  • @jiangLLM hat ihren ersten Beitrag in https://github.com/vllm-project/vllm/pull/57487 geleistet
  • @jiaran-king hat ihren ersten Beitrag in https://github.com/vllm-project/vllm/pull/56242 geleistet
  • @jz-yolo hat ihren ersten Beitrag in https://github.com/vllm-project/vllm/pull/58884 geleistet
  • @kaijunli-infr hat ihren ersten Beitrag in https://github.com/vllm-project/vllm/pull/52101 geleistet
  • @karya0 hat ihren ersten Beitrag in https://github.com/vllm-project/vllm/pull/57453 geleistet
  • @KEYS-A15 hat ihren ersten Beitrag in https://github.com/vllm-project/vllm/pull/57528 geleistet
  • @kwen2501 hat ihren ersten Beitrag in https://github.com/vllm-project/vllm/pull/51520 geleistet
  • @laulopezreal hat ihren ersten Beitrag in https://github.com/vllm-project/vllm/pull/57189 geleistet
  • @lijipeng787 hat ihren ersten Beitrag in https://github.com/vllm-project/vllm/pull/58225 geleistet
  • @limitmhw hat ihren ersten Beitrag in https://github.com/vllm-project/vllm/pull/48606 geleistet
  • @linnea-lin-00638949 hat ihren ersten Beitrag in https://github.com/vllm-project/vllm/pull/47450 geleistet
  • @LinzeShi hat ihren ersten Beitrag in https://github.com/vllm-project/vllm/pull/57347 geleistet
  • @mahird3 hat ihren ersten Beitrag in https://github.com/vllm-project/vllm/pull/57708 geleistet
  • @melcheikh hat ihren ersten Beitrag in https://github.com/vllm-project/vllm/pull/48956 geleistet
  • @MichaelLapshin hat ihren ersten Beitrag in https://github.com/vllm-project/vllm/pull/57396 geleistet
  • @mjkvaak-amd hat ihren ersten Beitrag in https://github.com/vllm-project/vllm/pull/48249 geleistet
  • @mkunredd hat ihren ersten Beitrag in https://github.com/vllm-project/vllm/pull/58244 geleistet
  • @mmastrac hat ihren ersten Beitrag in https://github.com/vllm-project/vllm/pull/57414 geleistet
  • @mustafayildirim hat ihren ersten Beitrag in https://github.com/vllm-project/vllm/pull/57252 geleistet
  • @Navjot10 hat ihren ersten Beitrag in https://github.com/vllm-project/vllm/pull/55390 geleistet
  • @olka-amd hat ihren ersten Beitrag in https://github.com/vllm-project/vllm/pull/51065 geleistet
  • @PeganovAnton hat ihren ersten Beitrag in https://github.com/vllm-project/vllm/pull/55128 geleistet
  • @Rakul-Chauhan hat ihren ersten Beitrag in https://github.com/vllm-project/vllm/pull/54967 geleistet
  • @Ricardo-M-L hat ihren ersten Beitrag in https://github.com/vllm-project/vllm/pull/52580 geleistet
  • @Ronnie-Rui hat ihren ersten Beitrag in https://github.com/vllm-project/vllm/pull/54581 geleistet
  • @RyanMa29 hat ihren ersten Beitrag in https://github.com/vllm-project/vllm/pull/57295 geleistet
  • @sammaji hat ihren ersten Beitrag in https://github.com/vllm-project/vllm/pull/58626 geleistet
  • @sawsa307 hat ihren ersten Beitrag in https://github.com/vllm-project/vllm/pull/56497 geleistet
  • @ScarWar hat ihren ersten Beitrag in https://github.com/vllm-project/vllm/pull/49435 geleistet
  • @sdougbrown hat seinen ersten Beitrag in https://github.com/vllm-project/vllm/pull/49819 geleistet
  • @semerandre hat seinen ersten Beitrag in https://github.com/vllm-project/vllm/pull/55557 geleistet
  • @sergiofigueras hat seinen ersten Beitrag in https://github.com/vllm-project/vllm/pull/57948 geleistet
  • @shallow10 hat seinen ersten Beitrag in https://github.com/vllm-project/vllm/pull/58336 geleistet
  • @SIDDARTHAREDDY8 hat seinen ersten Beitrag in https://github.com/vllm-project/vllm/pull/57743 geleistet
  • @simpleqt hat seinen ersten Beitrag in https://github.com/vllm-project/vllm/pull/55936 geleistet
  • @tangzzycc hat seinen ersten Beitrag in https://github.com/vllm-project/vllm/pull/53283 geleistet
  • @touch869 hat seinen ersten Beitrag in https://github.com/vllm-project/vllm/pull/55844 geleistet
  • @tripathiarpan20 hat seinen ersten Beitrag in https://github.com/vllm-project/vllm/pull/57140 geleistet
  • @twu3202 hat seinen ersten Beitrag in https://github.com/vllm-project/vllm/pull/57769 geleistet
  • @ubwzwd hat seinen ersten Beitrag in https://github.com/vllm-project/vllm/pull/55931 geleistet
  • @UNIDY2002 hat seinen ersten Beitrag in https://github.com/vllm-project/vllm/pull/58370 geleistet
  • @valarLip hat seinen ersten Beitrag in https://github.com/vllm-project/vllm/pull/58659 geleistet
  • @vcave hat seinen ersten Beitrag in https://github.com/vllm-project/vllm/pull/51681 geleistet
  • @voidxb hat seinen ersten Beitrag in https://github.com/vllm-project/vllm/pull/49300 geleistet
  • @vorapolsiloai hat seinen ersten Beitrag in https://github.com/vllm-project/vllm/pull/50212 geleistet
  • @vschandramourya hat seinen ersten Beitrag in https://github.com/vllm-project/vllm/pull/58779 geleistet
  • @weitliao hat seinen ersten Beitrag in https://github.com/vllm-project/vllm/pull/54535 geleistet
  • @wenjinhust hat seinen ersten Beitrag in https://github.com/vllm-project/vllm/pull/51366 geleistet
  • @Willian-Zhang hat seinen ersten Beitrag in https://github.com/vllm-project/vllm/pull/58720 geleistet
  • @wtdcode hat seinen ersten Beitrag in https://github.com/vllm-project/vllm/pull/56268 geleistet
  • @xinnywinne hat seinen ersten Beitrag in https://github.com/vllm-project/vllm/pull/55084 geleistet
  • @YannikHinteregger hat seinen ersten Beitrag in https://github.com/vllm-project/vllm/pull/50047 geleistet
  • @YashasviChaurasia hat seinen ersten Beitrag in https://github.com/vllm-project/vllm/pull/58112 geleistet
  • @Yatimai hat seinen ersten Beitrag in https://github.com/vllm-project/vllm/pull/43462 geleistet
  • @YCH188 hat seinen ersten Beitrag in https://github.com/vllm-project/vllm/pull/57190 geleistet
  • @yousafshah hat seinen ersten Beitrag in https://github.com/vllm-project/vllm/pull/55957 geleistet
  • @ys2025-AI hat seinen ersten Beitrag in https://github.com/vllm-project/vllm/pull/56841 geleistet
  • @yuchenwang3 hat seinen ersten Beitrag in https://github.com/vllm-project/vllm/pull/54699 geleistet
  • @zhecfy hat seinen ersten Beitrag in https://github.com/vllm-project/vllm/pull/58316 geleistet
  • @Zoe923 hat seinen ersten Beitrag in https://github.com/vllm-project/vllm/pull/53864 geleistet
  • @Zyann7 hat seinen ersten Beitrag in https://github.com/vllm-project/vllm/pull/57784 geleistet

Beitragende

@AndreasKaratzas, @khluu, @mgoin, @njhill, @BugenZhao, @stefankoncarevic, @robertgshaw2-redhat, @taneem-ibrahim, @Thangnguyenvn98, @hmellor, @Juntian777, @WoosukKwon, @yewentao256, @gau-nernst, @mmastrac, @LucasWilkinson, @Fangzhou-Ai, @NickLucche, @aoshen02, @JaredforReal, @mawong-amd, @DarkLight1337, @zyongye, @sfeng33, @vllm-agent, @okorzh-amd, @ZJY0516, @shen-shanshan, @gty111, @Isotr0py, @djramic, @zixi-qi, @wzhao18, @alec-flowers, @aarushjain29, @Rohan138, @yma11, @mjkvaak-amd, @ivanium, @yisustc, @MatthewBonanni, @wangxiyuan, @reidliu41, @chaojun-zhang, @shaohuaxi, @gcanlin, @ganeshr10, @linitra24, @yzong-rh, @divakar-amd, @atalman, @ShuoleiWang, @simondanielsson, @rasmith, @chaunceyjiang, @micah-wil, @liusy58, @LioEinaudi, @louie-tsai, @LiuYinfeng01, @jeejeelee, @zhenwei-intel, @jperezdealgaba, @hlin99, @zxd1997066, @lucamotz, @lucifer1004, @eopXD, @ashraf-bhuiyan, @TheEpicDolphin, @JulienDarve, @mayuyuace, @danisereb, @bigPYJ1151, @Etelis, @JohnQinAMD, @jiangkuaixue123, @tianmu-li, @akii96, @vllmellm, @RyanMa29, @afriedri, @elvircrn, @mustafayildirim, @yuzhouo7, @wtdcode, @biswapanda, @adtygan, @hickeyma, @itayalroy, @jiangLLM, @Hotragn, @faaany, @xhx1022, @jinzhen-lin, @sheralskumar, @Wauplin, @matteso1, @wjabbour, @Sunt-ing, @arpera, @hclsys, @S1ro1, @HDCharles, @fxmarty-amd, @liuzijing2014, @UNIDY2002, @samuelkim7, @markmc, @errmakov, @zhejiangxiaomai, @KernelClint, @i-m-aditya, @ColinZ22, @ppalanga, @franciscojavierarceo, @maithilijoshi20, @mfylcek, @almersawi, @albertoperdomo2, @0z5a, @jacklin78911-collab, @lzhan011, @Alex-ai-future, @freyfwt, @ZhengGong-amd, @mindungil, @amasen02, @devtyagi3909, @wenjinhust, @jbyczkow, @AdaAibaby, @harshit-sarvam, @vineethsaivs, @tripathiarpan20, @sashko-zakharchuk, @semerandre, @rebklee, @git-jxj, @cjackal, @xinnywinne, @andrewor14, @kyleliang-nv, @thillai-c, @dongluw, @ChuanLi1101, @omerpaz95, @jiaran-king, @liuyao0322, @coderfornow, @drakosha, @laulopezreal, @melcheikh, @shantipriya-amd, @Rukhaiya2004, @yuchenwang3, @lxy-alexander, @tlrmchlsmth, @HieDean, @Zoe923, @YCH188, @amd-sriram, @andylolu2, @MicheleCampi, @sdougbrown, @vMaroon, @shimib, @andakai, @thegoldenflow, @Levius-Fubuki, @olka-amd, @limitmhw, @yuwenzho, @adenzhou1350, @Josephasafg, @kylesayrs, @jdebache, @kaijunli-infr, @afierka-intel, @frida-andersson, @bnellnm, @ys2025-AI, @waizuichougou, @touch869, @rjrock, @sawsa307, @pavelzak, @ScarWar, @fadara01, @Mi-Jiazhi, @dilberx, @mahird3, @Zyann7, @roikoren755, @YukioZzz, @Ronnie-Rui, @acsoto, @czhu-cohere, @twu3202, @oliverholworthy, @weitliao, @sergiofigueras, @tuukkjs, @Sip4818, @karen-sy, @garrett361, @GirasoleY, @Navjot10, @taking-lying-flat, @wangyicong52, @majunze2001, @gangula-karthik, @ubwzwd, @linnea-lin-00638949, @kushaldabbe, @Yatimai, @guanxingithub, @jiakangkangfuzhe, @MichaelLapshin, @jhu960213, @tpopp, @mganczarenko, @qiching, @tangzzycc, @lijipeng787, @nikhilkulkarni1755, @QwertyJack, @Ankit-Jaiswal-AMD, @vorapolsiloai, @Dao007forever, @BPbruce, @divyvasal, @simpleqt, @blipbyte, @jhaotingc, @karya0, @farzad-elastix, @grYe99, @talorabr, @jackLei0901, @Yejing-Lai, @Priyjain-amd, @KEYS-A15, @LinzeShi, @bohnstingl, @nightcityblade, @vcave, @AARONKANG04, @CZT0, @snadampal, @microslaw, @haosenwang1018, @netanel-haber, @khushali9, @sammaji, @SIDDARTHAREDDY8, @100milliongold, @gongwei-130, @fululi12, @mkunredd, @mrodden, @noooop, @valarLip, @shallow10, @200lz, @askliar, @chuan932, @Monishver11, @YashasviChaurasia, @gokay-ai, @jiacao-amd, @yousafshah, @positive666, @TQCB, @lk-chen, @Ricardo-M-L, @huthvincent, @baljinderhothi-cohere, @vschandramourya, @kwen2501, @xiao-llm, @zhecfy, @Willian-Zhang, @simon-veitner-redhat, @mevince, @voidxb, @hongxiayang, @YannikHinteregger, @V-3604, @Rakul-Chauhan, @frankwang28, @LCAIZJ, @PeganovAnton, @jz-yolo, @QHarshil, @R3hankhan123, @jayzuccarelli, @yannicks1, @BaoYunkai, @xaguilar-amd, @xiaohuguo2023, @wxsIcey, @harshaladhav-amd, @varun-sundar-rabindranath, @kliuae, @LostFox11

Originalquelle

vLLM Releases

Hinweise zum Inhalt

Originalveröffentlichung und Rechte liegen bei der Quelle.

Maschinelle Übersetzung · Original beachten