vLLM Releases

v0.31.0

# v0.31.0 ## Points forts Cette version comprend 717 commits de 307 contributeurs (96 nouveaux) ! * **Performances de DeepSeek-V4.1-Flash** : l'attention méga FlashMLA avec le cache KV compressé NVFP4 V4.1 est désormais…

v0.31.0

Points forts

Cette version comprend 717 commits de 307 contributeurs (96 nouveaux) !

  • Performances de DeepSeek-V4.1-Flash: l'attention méga FlashMLA avec le cache KV compressé NVFP4 V4.1 est désormais la valeur par défaut sur SM100 (#56935) ; les logits MQA épars DeepGEMM pour l'indexeur (#56254) et Mega-Gate fusionnant le GEMM de gate avec la sélection d'experts (#56266) ; les frontières du décodeur fusionnent le all-reduce TP, la préparation des entrées mHC (#57643) et la finalisation MoE (#58586) ; un WO-A petit lot fusionné avec RoPE inverse et quantification MXFP8 sur SM100/SM103 (#58634) ; le GEMM MXFP8 wo_b fusionné avec le reduce-scatter à parallélisme de séquence (#57428) ; Engram wkv réparti entre les rangs TP (#58678) et les tables hôtes Engram partagées par défaut entre les réplicas DP colocalisés (#57651) ; des graphes CUDA pour l'encodeur de la tour de vision (#56625) ; et le SWA bounded replay qui exclut le KV à fenêtre glissante du cache de préfixe (#56227).
  • Redémarrage rapide: la nouvelle vllm preload lance le démon de cache de poids qui maintient les poids post-quantifiés résidents en mémoire GPU entre les redémarrages du moteur (#56680), désormais avec parallélisme de données (#57386), modèles de brouillon MTP (#57312), un point de terminaison /health (#58552) et une attente de disponibilité (#58370). Les instantanés expérimentaux de moteur initialisé (vllm snapshot create/restore) utilisent CRIU pour restaurer un moteur TP1 entièrement initialisé (#51360).
  • Model Runner V2 et décodage spéculatif: décodage spéculatif avec modèle de brouillon (#43091) et processeurs de logits personnalisés (#56497) sur Model Runner V2 ; le nouveau rédacteur LiLiCorr (#57934) ; ordonnancement asynchrone pour DFlash (#58065) avec le précalcul du K/V de contexte capturé dans le graphe CUDA de brouillon (#57632) ; vérification adaptative DSpark pour Gemma4 (#57263) et décodage à longueur variable pour Kimi-K3 (#52988) ; une cible DCP avec un brouillon DSpark non-DCP (#56723) ; et la mémoire MoE est désormais comptée pendant le profilage MRV2, évitant les OOM sur les déploiements WideEP (#57270, #58411).
  • Service à grande échelle: backend all2all EP équilibré MoonEP via --all2all-backend moonep (#52101), parallélisme de contexte de préremplissage avec parallélisme de données (#57075), un reduce-scatter multimem à faible SM pour SM100/SM103 (#55072), DeepEPv2 avec parallélisme de séquence (#57210) et EPLB avec chevauchement des experts partagés (#57236), un backend de transfert de poids NCCL M2N conscient du sharding pour l'apprentissage par renforcement (#51520), et la détection de contre-pression du déchargement KV (#50045).
  • Contrôles d'ordonnancement: --max-num-active-seqs contrôle l'admission RUNNING indépendamment de max_num_seqs (#56758), --long-prefill-token-threshold s'adapte désormais au nombre de préremplissages en attente au lieu de découper une requête isolée (#57951, #58459), la file d'attente a été retravaillée afin que les requêtes détenant déjà des blocs KV soient ordonnancées en premier (#58947), et l'interblocage du connecteur KV + MTP sous pression KV a été corrigé (#57104).
  • Durcissement de HiSparse: lignes de vérification MTP résolues avec un noyau union residency (#59235), effondrement d'acceptation MTP sous graphes FULL corrigé (#59309), plus de pages GPU sans support hôte (#59036), un verrouillage actif (livelock) de préemption en préremplissage par morceaux corrigé (#59494), cache KV dimensionné à partir des groupes que HiSparse alloue (#59450), et corrections de la publication des préfixes hôtes et de l'adoption des préfixes GPU (#59007, #59282).
  • Sécurité: par requête, mm_processor_kwargs et media_io_kwargs sont rejetés sauf si --trust-request-mm-kwargs est défini (#58830) ; les clés supplémentaires du cache de préfixe sont étiquetées par source afin qu'un nom de LoRA et un cache_salt ne puissent plus entrer en collision (#51899), et le chemin de la LoRA fait partie du hachage de bloc (#59335) ; les entrées obsolètes du cache de réception multimodal ne peuvent plus remplacer des charges utiles fraîches (#57833).
  • Changements incompatibles: kwargs multimodaux par requête soumis à contrôle d'accès (#58830) ; tokenizer_mode="slow" supprimé (#58545) ; --enable-mamba-fine-grained-prefix-cache renommé en --enable-mamba-shared-prefix-checkpoint (#57382) ; quantification en ligne via quantization="fp8" remplacé par le fp8_per_tensor raccourci (#53585) et quantification en ligne silencieuse Quark supprimée (#51800) ; le backend AllSpark INT8 W8A16 supprimé (#58001) ; --enforce-eager désactive désormais également l'échauffement des noyaux JIT (#58197) ; XPU graphs activés par défaut avec VLLM_XPU_ENABLE_XPU_GRAPH supprimé (#51600).

Artefacts de version

Roues Python

Plateforme Installation
PyPI (CUDA 13.0) pip install vllm
PyPI (CUDA 13.0, uv) uv pip install vllm --torch-backend=auto
ROCm pip install vllm --extra-index-url https://wheels.vllm.ai/rocm/0.31.0/rocm723
XPU uv pip install vllm --extra-index-url https://wheels.vllm.ai/0.31.0/xpu --extra-index-url https://download.pytorch.org/whl/xpu --index-strategy unsafe-best-match

Images Docker

Plateforme Image Docker
CUDA 13.0 (par défaut) docker pull vllm/vllm-openai:v0.31.0
CUDA 12.9 docker pull vllm/vllm-openai:v0.31.0-cu129
ROCm docker pull vllm/vllm-openai-rocm:v0.31.0
CPU docker pull vllm/vllm-openai-cpu:v0.31.0
XPU docker pull vllm/vllm-openai-xpu:v0.31.0

Autres artefacts

Des artefacts de version préconstruits sont disponibles dans la section Assets en bas de cette page, notamment : - Archive tar de la distribution source - Wheels Python CUDA 12.9 pour x86_64 et arm64 - Wheels Python CUDA 13.0 pour x86_64 et arm64 - Wheels Python CPU pour x86_64, arm64 et macOS - Wheel Python XPU pour x86_64

Prise en charge des modèles

  • Nouvelles capacités de modèles: mode de génération structurée DiffusionGemma avec des choix à jeton unique bornés (#57250), MiMo V2 MXFP4 MoE, routeur MoE BF16 et brouillons DFlash (#57784), états cachés auxiliaires Cohere2MoE pour les drafters EAGLE3/DFlash (#49819), GLM-5.2-MXFP4 sur le chemin ROCm DeepSeek-V3.2 (#51915), checkpoints AMD-Quark en précision mixte DeepSeek-V4.1-Flash-MXFP4 (#57071) et GLM-5.3-Flash Quark MXFP4 (#56176), et un granite_thinking_parser intégré pour Granite 4.2 (#55957).
  • DeepSeek-V4.1-Flash: méga attention FlashMLA avec le cache KV compressé NVFP4 par défaut sur SM100 (#56935), logits MQA éparses DeepGEMM dans l'indexeur (#56254), Mega-Gate (#56266), all-reduce TP fusionné + préparation d'entrée mHC (#57643) avec la finalisation MoE intégrée (#58586), WO-A par petits lots fusionné (#58634), MXFP8 wo_b GEMM + reduce-scatter (#57428), coefficients mHC chevauchés pour les petits lots TP (#57603) limités aux graphes CUDA FULL (#57874), Engram wkv partagé à travers TP (#58678), requêtes Engram sérialisées avec des tables hôtes en huge-page (#56926), tables Engram partagées par défaut entre réplicas DP (#57651, #57914, #59068), fusion MegaMoE native des shared-experts sans padding (#56568, #57204), staging MegaMoE plus rapide et gathers du cache NVFP4 (#57604), chemin requête RMSNorm + MXFP8 fusionné rétabli (#57679), insertion de contexte DSpark KV uniquement (#56441), graphes CUDA de l'encodeur de vision (#56625, #58499), rejeu SWA borné (#56227), image causale SWA rétablie pour correspondre à la référence (#57152), mappings d'effort de raisonnement mis à jour (#58316), et correctifs de démarrage pour les blocs candidats avec score NaN (#57454), sentinelles DeepSelect (#58215), attention DSpark non causale sur FlashInfer (#57432), JIT à l'exécution des tampons de candidats avec offsets (#57667) et imports sans Triton (#57654).
  • DeepSeek V4: MLA éparse FlashInfer avec RoPE inverse fusionné + quantification FP8 (#58621), projections WKP de contexte DSpark empilées (#54674), distribution d'experts MoE fusionnée calculée à partir du groupe EP (#57465), complétion FIM via suffix (#44229), string= manquants dans les appels d'outils analysés (#56271), outils de requête attachés à un message système existant (#51856), espacement des blocs d'image préservé (#56882), et largeur DSpark séparée de la validation d'étape MTP (#54631).
  • GLM-5.3-Flash: backends épars FlashAttention et FlashMLA optionnels sur SM90 (#55385), sparse MLA NoPE sur le backend FlashInfer SM120 (#55277), top-k coopératif pour les petits lots de décodage (#57327), espace de travail de décodage de l'indexeur dimensionné par la longueur regroupée (3 GiB économisés, #57701), opérations de métadonnées 1.6 à 4.8 fois plus rapides (#58450), mapping fusionné des emplacements de fin de kpool (#57534), top-k kpool via le dispatcher partagé (#57546), surcharge de préparation sparse MLA réduite (#57458), pas de synchronisation D2H dans le plan sparse MLA SM90 sous ordonnancement asynchrone (#58684), FlashKDA conservant l'état récurrent en FP32 pour les longs prefills (#58846), et correctifs de correction pour la corruption kpool avec décodage spéculatif (#58454), SM90 index_kpool (#58704), strides de fin de kpool (#57477), prompts de 500k jetons (#57317), couches MLP denses sous parallélisme de séquence (#58061), sélection du backend top-k de l'indexeur (#58594) et lancements varlen paged MQA (#55270).
  • Qwen3.8-Flash-Next (Qwen4Exp): cache KV principal FP8 sur le chemin QSA (#55557), FP8 TP avec FlashInfer TRTLLM MoE (#55867), réglage QSA SM90 (#57273), projection descendante HC + SiLU fusionnée (#58957), surcharge de métadonnées PLE réduite (#58114), fragmentation de l'espace de travail de l'indexeur QSA corrigée (#57105), cache KV de profilage libéré (#58961), identifiants de prélecture PLE épinglés tenus hors du pool de graphes CUDA (#58489), et recherches de mapping d'experts indexées économisant environ 25 s de chargement des poids sur DGX Spark (#58720).
  • Kimi K3 et MiniMax-M3: embedder de patchs vision Kimi-K3 sous forme de GEMM (#58527), QK RoPE KimiViT fusionné (jusqu'à 29x, #58651), quantification des experts routés (#57430), correctifs du parseur de raisonnement (#57098) et du comptage des jetons de raisonnement (#58372), pointeurs KV de contexte DSpark rafraîchis après re-liaison (#58814), premiers chunks sans état ne plus être classés comme décodages (#51483), et estimations de blocs Mamba ne bloquant plus l'admission sur les correspondances de préfixe externes (#57050) ; graphes CUDA de l'encodeur MiniMax-M3 (#58673), Conv3dLayer patch embedding (environ 62x, #58512), triton_mrope dans la vision tower (#58526), du routage MiniMax2 fusionné avec un scaling non unitaire (#58880), et des corrections de processeur (#58460, #59613).
  • DiffusionGemma: un kernel de statistiques d'échantillonneur en une seule passe (#58226), diffusion_constrained reads over logprob_token_ids (environ 25% plus rapide, #58216), moins de lignes de logits pour les batchs prefill-only (#57416), logprob_token_ids support (#57417), et des correctifs pour les logprobs concurrents (#57414), le dtype de fallback eager (#57462), les entrées multimodales (#57589), les têtes LM quantifiées (#48521) et l'exécution CPU (#58964).
  • Multimodal: noyau Triton mm_input_norm (#56798, #56711), pixels bruts conservés sur le chemin ViT partitionné en DP (#56872), fps vidéo de Qwen2.5-VL respecté pour le M-RoPE temporel (#47736), clips Whisper et Qwen2-Audio de plus de 30s (#57769, #56912), grille de placeholder Mistral3 (#53758), patchs non découpés pour Idefics3 (#48760), tokens Ovis2.5 (#52623), poids d'experts Aria (#57487), FP8 fusionné de MiMo-V2.5 qkv_proj (#57508), Gemma4 AutoWeightsLoader (#55911) et scalaires de buffer (#54213), KV FP8 de Gemma4 avec FA4 à une head dim de 512 (#53175), RoPE de Laguna (#57189), régression de précision de Mistral-Large-3 (#57563), EXIF malformés (#56527, #57234), labels JinaVL (#57347), routage MLA de Sarvam avec logits du routeur en FP32 (#56034), scores d'attention CohereASR fusionnés (#55190), et convolution groupée fusionnée de DFlash2 (#55960).
  • LoRA: modèles de langage Nemotron VL (#56231), ModernBert (#57148), embeddings VoyageQwen3 (#57708), classification de séquences RoBERTa (#58884), et modules_to_save têtes de classification de séquences (#53555) avec par adaptateur num_labels (#57766).

Engine Core

  • Model Runner V2: décodage spéculatif avec modèle brouillon (#43091), processeurs de logits personnalisés (#56497) validés à l'admission (#57728), entrées fictives randomisées (#58411), tokens fictifs routés vers les experts MoE pendant le profiling (#57270), graphes FULL de décode pour les fins de prompt d'un seul token (#58400), mappages token-vers-requête partagés (#57102) et métadonnées Mamba/GDN réutilisées entre groupes de KV cache (#58762), graphes CUDA ViT encoder-only (#56922), déchargement de poids (#57834) et modèle de pooling (#57737) libérés à l'arrêt, et correctifs pour le KV MTP multi-couches en P/D (#55055), le fast-prefill avec LoRA (#56456), les écritures obsolètes de block-table dues aux étapes de draft fictives (#56734), les fins de prompt rembourrées dans les modèles hybrides (#58434), les slots de draft jamais proposés (#58784), l'auto-ajustement max_model_len (#58149) et intermediate_tensors pendant la capture (#57745).
  • Décodage spéculatif: drafter LiLiCorr (#57934), ordonnancement asynchrone DFlash (#58065) et K/V de contexte dans le graphe CUDA de draft (#57632), vérification adaptative DSpark de Gemma4 (#57263), vérification adaptative à longueur variable de Kimi-K3 (#52988), suppression de la synchronisation CPU-GPU pour les vocabulaires hétérogènes (#57396), recompilations Triton évitées dans l'estimateur d'acceptation (#57107), et correctifs pour les drafts EAGLE/denses avec EP (#56930), les batches de profiling DFlash/DSpark (#56448), la mémoire de la tête MTP de GLM (#55442), les embeddings de prompt avec drafts (#57356), et le décode multi-token causal TritonMLA (#51065).
  • Ordonnanceur: --max-num-active-seqs (#56758), file d'attente adaptative --long-prefill-token-threshold (#57951, #58459), skipped_waiting remplacée par une file d'attente conservant le KV (#58947), admission atomique des n > 1 requêtes (#53936), interblocage connecteur KV + MTP (#57104), un effondrement de débit quand max_num_seqs n'est pas un multiple de 8 (#57355), continuations en streaming conservant les logprobs et rafraîchissant les max tokens (#57447, #57676), une course entre requête reprenable et ordonnancement asynchrone (#58259), et un sondage de grammaire de sortie structurée non bloquant (#55931).
  • Cache de préfixes et modèles hybrides: clés supplémentaires étiquetées par source (#51899) et chemins LoRA hachés (#59335), --enable-mamba-shared-prefix-checkpoint (#57382), correspondances de fin de prompt avec MTP rétablies (#58368), checkpoints de fin de prompt conservés sous rétention sparse (#59146), réservation de checkpoint en mode align (#59175), premiers chunks GDN sans état (#51565), groupes de KV cache de draft MTP annotés sur le chemin de groupement hybride (#55390), un constructeur de checkpoint de préfill généralisé (#57783), sauvegardes d'état de préfill Mamba2 par lots sans synchronisations GPU-CPU (#49371), skip_reading_prefix_cache respecté pour les correspondances du connecteur (#57269), hachage incrémental des blocs multimodaux (#51694), une taille de bloc KV prise en charge par tous les backends d'attention (#49845) avec des erreurs plus claires (#58557), et CacheConfig.effective_attention_block_size pour DCP (#56538).
  • Démarrage et mémoire: compilation de warmup Triton en parallèle (#58582), warmup JIT désactivé sous --enforce-eager (#58197) sauf si la tolérance aux pannes est activée (#58593), warmup DeepGEMM réutilisant l'espace de travail MoE (#57268), la fragmentation de l'allocateur ne réduit plus le KV cache pendant le profiling (#58430), buffers de préfill sparse réservés avant le dimensionnement du KV (#57575), vues obsolètes de l'espace de travail FlashMLA libérées (#56902), espace de travail FP8 de DeepGEMM réduit de moitié (#53914), espaces de travail partagés Marlin/Humming (#57421), poids MoE BF16 de FlashInfer convertis en place (#54699), threads de démarrage d'UniProc bornés par le quota CPU (#58946), et threads d'exécution configurés avant le profiling (#55891).
  • Noyaux: filtrage par échantillonnage pour le top-k persistant (#56346), RNG Murmur3 pour l'échantillonnage de Gumbel (#51367), quantification 8 bits par groupe de tokens résidente en registre (#55330), abs-max FP8 par tenseur vectorisé (#58194), un dispatcheur de noyaux Triton pour les surcharges spécifiques à la plateforme (#43048), GateLinear pour tous les modèles MoE (#58234), slots d'experts non locaux ignorés dans TritonExperts (#58051), finalisation top-k TRT-LLM-Gen différée sur le chemin modulaire (#58635), configurations de matmul invariants par batch pour SM120 (#57456), scratch de déquant de préfill FlashInfer borné (#57918), et correctifs pour les NaN de softcap Triton (#56579), les transformations Hadamard de QuIP (#43462), le linéaire FP8 de CUTLASS sur A100 (#55884), l'échantillonnage FlashInfer sur GPU non pris en charge (#48956), le remplissage d'échelle par blocs FP8 SM100 (#57377), la capture de préfill de graphe FULL mixte (#58275), la correspondance de motifs de custom-op Inductor (#58189), le préfill GDN BF16 de CuteDSL divergeant de FLA sur Qwen3.5 (#53864), SM100 fp8_ds_mla le cache scales (#49435), les lots de décode ragged dans le sparse indexer (#52500), les allowed_token_ids masks obsolètes après la réordonnancement des lots (#48419, #43931), et les prompt_embeds tensors conservés après la fin des requêtes (#57988).
  • Invariance par lot: graphes CUDA sécables sans torch.compile par défaut sous VLLM_BATCH_INVARIANT (#57586), parallélisme de séquence et TP asynchrone désactivés (#56377), et collectives NCCL 2.31 conservées activées (#58179).
  • Sommeil et RL: release_kv_cache_memory() ne libère que la mémoire du cache KV (#44890), --sleep-preserve-parameter-names conserve les poids gelés entre les sommeils de niveau 2 (#57891), transfert de poids NCCL M2N (#51520), mises à jour de poids DP denses par indice DP (#56950), configuration de l'allocateur conservée lors du basculement des segments extensibles (#57982), et échecs de réinitialisation du cache propagés pendant le sommeil (#54581).
  • Redémarrage rapide: vllm preload (#56680), DP (#57386), brouillons MTP (#57312), attente de disponibilité (#58370), /health (#58552), poids pré-traités MXFP8 de ModelOpt (#57316), et instantanés de moteur initialisé (#51360).
  • Journalisation et observabilité: LoggingConfig via --logging-config et --log-level (#57205), corrections de la journalisation JSON (#57957, #58747), suppression du journal de démarrage corrigée (#51366), profilage torch unifié tenant compte de la plateforme (#57460), plus de taux de succès du cache de préfixe de 0.0 % avant toute requête (#54990), formatage des métriques de transfert KV (#57068), dimensionnement de l'activation MFU à partir du dtype du modèle (#57070), vérifications des variables d'environnement pouvant être remplacées par plateforme (#48599), VLLM_TARGET_DEVICE=empty pip install vllm pour les backends hors arborescence (#41074), et la version correcte de vLLM signalée lors d'une installation depuis les sources (#57295, #57744).

Service à grande échelle

  • Communication MoE: backend MoonEP (#52101), DeepEPv2 avec parallélisme de séquence (#57210) et chevauchement EPLB + expert partagé (#57236), reduce-scatter multimem à faible SM (#55072), statistiques de charge EPLB pendant la mise à l'échelle Elastic EP (#58473), lignes rembourrées SP ignorées dans le routage groupé afin que le rang 0 ne soit plus un traînard de préfill (#56079), routage par hachage rejeté sur les backends monolithiques non pris en charge (#57867), diffusions de sampled-token ignorées sous PP pour les requêtes quittant le moteur (#58542), DBO avec profilage low-latency de DeepEP (#57502), équilibreur de charge externe avec réplicas partageant des nœuds (#53743), et aucun RPC bloquant pendant la poignée de main du moteur (#57226) ni attente illimitée de draft-token (#58779).
  • Parallélisme de contexte: PCP avec DP, EP et MTP (#57075), une cible DCP avec brouillons DSpark/DFlash non-DCP (#56723), longueurs de séquence DCP sans synchronisation CPU-GPU (#58169), et tirages NIXL DCP à travers les régions de cache MLA (#57389).
  • Connecteurs KV: push prefill pipeline-parallèle NIXL pour attention-HMA (#50494) et dispositions MLA compactées (#50499), métriques d'échec de transport séparées de l'expiration KV (#55854), état des pairs morts libéré sans attendre le TTL (#50047), baux expirés purgés derrière une tête à battements de cœur (#58292), achèvement de push restauré (#58188), activité côté D enregistrée (#52245) ; Mooncake CUSTOM_MEM_POOL (#49300), échecs de charge au niveau de la requête sous HMA (#56855, #57174) et nouvelles tentatives de bootstrap (#58919) ; état hybride Mamba/KDA MoRIIO en mode READ (#51052) et une condition de course de routage multi-décodage (#51681) ; succès de cache de préfill dans prompt_tokens_details (#54222) ; éditeurs d'événements KV liés au port 0 (#55844) ; requête GET de métadonnées de cache KV restaurée pour les consommateurs externes (#56925) ; les événements KV de bloc partiel conservent chaque fonctionnalité multimodale (#58288) ; sauvegardes finalisées aux étapes sans forward (#57775) ; ExampleHiddenStatesConnector à l'abri des abandons (#56841) ; remplissages FP8 de DecodeBench (#58472) ; une KvHints enveloppe de requête (#53423) ; et le connecteur AuxOutput pour les sorties d'experts routés (#45635, #58150, #58205).
  • Déchargement KV: max_load_tokens par requête (#55885), détection de contre-pression (#50045), SimpleCPUOffloadConnector métriques Prometheus (#57251), groupes non mise en cache de préfixe (#56810) et scratch (#57145) ignorés, dispositions répliquées pour MLA multi-groupes (#57652), régions de 512 GiB ou plus enregistrées par tranches (#51081), mémoire cgroup vérifiée avant l'allocation SHM (#54014), et correctifs pour la récence du cache (#51787), les fenêtres glissantes retenues par MTP (#56709), les lignes MLA canoniques (#56799), les métadonnées d'événement (#57453) et la mémoire épinglée ROCm (#57160).
  • HiSparse: noyau de résidence en union pour les lignes MTP (#59235), acceptation MTP sous graphes FULL (#59309), allocation adossée à l'hôte (#59036), interblocage de préemption (#59494), dimensionnement du cache KV (#59450), publication des préfixes côté hôte (#59007), adoption des préfixes GPU (#59282), et métriques de résidence (#58725).
  • Désagrégation des encodeurs (EPD): proxy EPD dynamique avec enregistrement géré par le lanceur (#54176), requêtes d'images groupées par encodeur (#57095), cache inter-encodeurs via Mooncake (#56242), entrées audio avec métadonnées seules (#57887), shards de modèle de langue ignorés pour --mm-encoder-only (#58086), métriques des connecteurs EC (#54960), et corrections réservées aux encodeurs (#58490, #58287, #57696).

Matériel & Performances

  • NVIDIA: FlashInfer 0.7.0.post1 (#58069, #59323), mise à jour de l'épinglage de DeepGEMM avec correctifs SM120 (#57218), images nocturnes Rubin CUDA 13.4 (#55953), et builds QuTLASS avec PyTorch 2.13 (#58173).
  • AMD ROCm: AITER v0.1.23 (#56885, #58867), torch 2.13 et Triton 3.8 (#50605, #58006), triton_kernels 3.8 MXFP4 MoE pour gpt-oss et DeepSeek-V4 (#55934), un segfault hôte ROCR corrigé (#57328) ; DeepSeek-V4/V4.1 HCA double flux (#56853) et chevauchement CSA2 sensible aux couches (#57407), FP8 wo_a (#54894), RoPE inverse fusionné dans le reduce du sparse decode (#57435, #57451) qui émet désormais du MXFP8 pour un FP8 groupé wo_a (#58456), GEMM MXFP8 sur échelles natives 32x32 sur gfx950 (#58510), métadonnées ragged top-k réutilisées (#57434), sélection de blocs candidats plus rapide (#58208), tables Engram en mémoire hôte (#57491) et tables PLE de Qwen3.8-Flash-Next déchargées en mémoire hôte (#57497), un chemin de décodage ASM AITER optionnel pour DCP + décodage spéculatif (#56861), get_top_tokens() sur le drafter MTP du DeepSeek V4 (#57568), vérification adaptative DSpark (#52362), optionnel VLLM_DSV4_LOGITS_FIX pour les logits du sparse-indexer sur gfx950/gfx942 (#50455), un revert de précision de #56433 et #51692 (#57132), et des erreurs claires pour FSE avec DPA+ETP (#57919) ; Kimi-K3 noyaux FlyDSL a4w4 (#53940) avec VLLM_ROCM_USE_AITER_MOE_SITUV2=a16w4|a8w4|a4w4 (#58201), KDA spéculatif à faible concurrence (#58045), MoE latent shardé sous EP (#54956) et moins de copies de projection (#50592) ; un chemin Hy4 ROCm avec torch.compile (latence de décodage réduite de 13x, #57526) ; MiniMax-M3 fusion QK-norm AITER (#54535), insertion K/V sans copie (#56849) et corrections MXFP8 (#53674, #58089) ; corrections de démarrage GLM-5.3-Flash (#57192, #57252, #57425) ; AITER QuickReduce + RMSNorm (#48249), AsyncTP BF16 (#58098), fusion statique de sortie d'attention FP8 (#58099), fusion QK-norm/RoPE/KV-cache pour MRoPE (#50212), décodage GDN AITER pour les layouts plats (#53623), wvSplitK pour les GEMM à sortie unique (#53283), 69 copies en moins par étape de décodage sur le chemin skinny GEMM (#58566), recherche de GEMM ajustée via AITER (#55001), tuile KV de préfill Triton plus étroite sur RDNA3/RDNA4 (#58225), copies H2D paginables volumineuses par étapes (#56343), et des correctifs pour le padding MXFP4 MoE affamant le cache KV (#56359), l'OOM du préfill FP8 MLA AITER (#57923), les descales de cache non quantisé (#56726) et les replis MoE AITER (#56590, #57866, #57426). VLLM_ROCM_USE_AITER_FP4_ASM_GEMM est restauré et désactivé par défaut (#57055) ; le replay borné SWA est désactivé sur ROCm (#57906).
  • Intel XPU: PyTorch 2.14 (#56013), graphes XPU activés par défaut (#51600), EPLB (#44987), MoE int8 W8A8 sur Triton (#53162), invariance par lot (#55881), rotary embedding SYCL (#55721), QK RMSNorm + RoPE + gate fusionnés (région de décodage 55% plus rapide, #56096), sampler du Model Runner V2 (#57277) et contrôle des microbatchs PP (#55145), --device-ids respecté (#56015), et débordement de pointeur de périphérique corrigé (#54514).
  • CPU: FP8 W8A8 linéaire et MoE pour Intel Diamond Rapids (#49942), attention pagée Arm jusqu'à 25% plus rapide (#56045), Zen DA8W4 int4 pour les couches denses et MoE (#54024), SDPA zentorch pour l'attention d'encodeur (#54508) et le préfill MLA (#54967), attention sinks FP32 (#56252), MoE INT8 W8A8 sur POWER (#55316), Whisper W4A16 (#58268), wheels construites sur Ubuntu 22.04 (glibc 2.34) avec AMX-FP8 (#58515), AVX10.2 conditionné au support du compilateur (#58133), Triton CPU pré-construit (#58140), --device-memory-utilization alias (#56547), vLLM Recipes dans l'image CPU (#58796, #57306), épinglage protobuf s390x (#54978) et torchcodec vidéo (#58693), et des correctifs pour Ministral FP8 (#56985), les poids FP32 du routeur (#56168), les échecs d'import zentorch (#54923), le SHM multimodal macOS (#57142), l'affinité CPU par rang local (#53636) et le layout d'état NIXL GDN (#53300).

Quantization

  • Humming: transformations de Hadamard et quantization en ligne NVFP4/MXFP4/MXFP8 (#56685), wNaM asymétrique via compressed-tensors (#46528), humming-kernels 0.1.16 (#58054), et Humming dans l'oracle MoE W4A8 (INT4xFP8) (#58427).
  • Nouvelles capacités: exports natifs Quark W4A16 INT4/UINT4 (#48606), déquantization MXFP4 au chargement optionnelle (#50814), backends MoE NVFP4 explicites par token (#57176), et un layout canonique N-first pour le MoE WNA16 de compressed-tensors (#52798).
  • Correctifs: MXFP8 sur les couches en dessous de mm_mxfp8 limites de forme (#54223), échelles NVFP4 en ligne lors du rechargement (#57954), métadonnées linéaires de la tête LM (#58444), et le chemin de quantization par blocs SiLU-mul fusionné ignoré sous un clamp SwiGLU (#57984).

API & Frontend

  • Nouvelles options et points de terminaison: --tool-strict-level (#56268), response_format avec tool_choice=auto (#56086), complétions FIM DeepSeek-V4 (#44229), release_kv_cache_memory() et POST /release_kv_cache_memory (#44890), scoring de préfill à tokens fixes via prompt_logprob_token_ids (#54335), métriques de décodage spéculatif par requête dans /inference/v1/generate (#43310), métriques par requête (#55084) et cache_write_tokens (#57222) dans l'API Responses, Anthropic thinking dans /v1/messages (#58613), le streaming du raisonnement et des appels d'outils depuis l'endpoint derender (#50550) avec détokenisation déléguée (#57528), vllm chat la sortie du raisonnement en streaming (#57045), la journalisation de débogage du corps des requêtes avec --enable-log-requests (#58163), et uniquement la ligne de résumé des docstrings de configuration dans --help (#57357).
  • Sortie structurée et parseurs: grammaires Lark natives dans le backend xgrammar (#58321), XGrammar 0.2.7 (#57272), Granite migré vers le Parser Engine en streaming (#49648), et corrections pour les limites de raisonnement (#56635), xgrammar choices avec des caractères de contrôle (#48115), JSON Schema de type liste (#48416), structural_tag vide (#47450), la gestion EOS d'outlines (#58612, #57743), les logprobs de streaming supprimés par le parseur (#58583), les noms d'outils Inkling après le raisonnement (#58792), et la longueur finish_reason pour les appels d'outils en streaming tronqués (#46303).
  • Compatibilité OpenAI, Anthropic et Harmony: comptages de tokens de raisonnement pour Harmony, DeepSeek-V3 et Step3 (#58626) et par tour d'outil Responses (#58927), Harmony max_output_tokens dans la boucle d'outils (#58551), complétions de chat par lots utilisant les requêtes ajustées (#58929, #58958), un parseur frais par choix (#58939), recomptages de raisonnement différés (#56067), nettoyage MCP de Responses (#56988) et image detail par défaut (#57241), détection de système inline Anthropic (#58754) et pensée désactivée avec P/D (#58786), chaînes d'arrêt rejetées sur les --tokens-only serveurs (#57058), prompt_embeds invalides renvoyant 400 (#55451, #57006), prompts bornés après expansion multimodale (#57076), --override-generation-config de pénalités (#50769), révisions du Hub (#56092, #57461), logprobs complets dans les réponses token-in/token-out (#58488), annulation du scoring génératif (#57729, #58788), pings keepalive gRPC (#55102), et run-batch transcriptions diarisées (#57948).
  • Pooling: padding d'embeddings par chunks (#56505) et normalisation (#57498), tokenisation du reranker avec limites de documents (#57666), et têtes de la famille BERT conservées pour les logits bruts (#57664).
  • Frontend Rust: --hf-overrides (#56931), --sse-keep-alive-interval (#58306), rôles de chat personnalisés (#58311), parseurs MiMo V2.5 (#57933), contrôles de raisonnement normalisés (#56998), grammaires de sortie possédées par le parseur (#55269, #57340), masques d'échantillonnage via gRPC (#56777), taille DP locale dans les métadonnées gRPC avec vllm-proto 0.3.0 (#57116, #57233), un histogramme de préemption par requête (#57033), histogrammes sans verrou (#58574), contexte vision Nemotron-H (#57634), processeurs vision possédés par le modèle (#58109), un mm-processor benchmark (#51922, #58084, #58378), arguments serve non pris en charge reconnus (#58330), les logprobs NaN ne tuent plus le client du moteur (#51026), champs EngineCoreOutput ajoutés acceptés (#56533), et vllm-rs sur PATH dans l'image CUDA (#57606).
  • Benchmarks: un openai-responses backend pour vllm bench serve (#54628) et model_id dans le JSON latence/débit (#58112).

Sécurité

  • Par requête, mm_processor_kwargs et media_io_kwargs sont rejetés par défaut ; les déploiements de confiance peuvent l'activer avec --trust-request-mm-kwargs (#58830).
  • Les hash de blocs de préfixe-cache étiquettent les clés supplémentaires par source (#51899) et incluent le chemin LoRA (#59335) ; l'entrée de hash multimodale est cadrée (#54283) et le hachage incrémental de blocs couvre chaque fonctionnalité chevauchante (#51694).
  • Les charges utiles multimodales fraîches priment sur un cache récepteur obsolète (#57833), et les correspondances du cache d'encodeur avec des nombres d'embeddings incompatibles sont rejetées (#57696).
  • min_tokens au-dessus de la valeur max_tokens par défaut est rejeté au lieu de bloquer le moteur (#57731) ; l'assainissement des messages filtre les adresses mémoire en majuscules (#58832) ; les adaptateurs LoRA nommés d'après un modèle servi sont rejetés (#59286).

Dépendances

  • FlashInfer 0.7.0.post1 (#58069, #59323), Transformers 5.17.0 (#56108) avec une borne supérieure dans requirements (#59614), XGrammar 0.2.7 (#57272), oss-harmony remplacement de openai-harmony (#55128), mise à jour du pin du fork DeepGEMM (#57218), mise à jour de FlashKDA (#58846) et humming-kernels 0.1.16 (#58054).
  • Les images CUDA 12 utilisent LMCache 0.4.4 et CuPy CUDA 12 (#57945) ; une image zstd Docker Hub étiquetée séparément (-x86_64-zstd) est publiée (#55608) ; images nightly Rubin CUDA 13.4 (#55953).
  • ROCm : AITER v0.1.23 (#58867), torch 2.13, Triton 3.8 (#50605, #58006), ROCR corrigé (#57328), pins LMCache OpenTelemetry (#59056).
  • XPU : PyTorch 2.14 (#56013). CPU : wheels construits sur Ubuntu 22.04 (#58515), Triton CPU pré-construit (#58140).

Changements incompatibles et dépréciations

  • Par requête, mm_processor_kwargs et media_io_kwargs renvoient désormais une erreur sauf si le serveur est démarré avec --trust-request-mm-kwargs; au niveau du serveur, --mm-processor-kwargs / --media-io-kwargs et hors ligne LLM sont inchangés (#58830).
  • tokenizer_mode="slow" a été supprimé ; il se comportait déjà comme "hf" sous Transformers v5 (#58545).
  • --enable-mamba-fine-grained-prefix-cache a été renommé en --enable-mamba-shared-prefix-checkpoint (#57382).
  • La quantification en ligne via quantization="fp8" redirige désormais vers le raccourci en ligne fp8_per_tensor (#53585) ; la quantification MXFP4 en ligne silencieuse propre à Quark a été supprimée au profit de l'API de quantification en ligne (#51800).
  • Le backend GEMM AllSpark INT8 W8A16 a été supprimé (#58001). L'option return_assistant_tokens_mask de /render et le champ de réponse assistant_tokens_mask ont été supprimés (#57520).
  • VLLM_PLE_CPU_OFFLOAD a été supprimé ; utilisez --engram-config (#57937). VLLM_XPU_ENABLE_XPU_GRAPH a été supprimé et les graphes XPU sont activés par défaut (#51600).
  • La forme séparée par des virgules de --collect-detailed-traces a été supprimée ; utilisez la syntaxe de liste (#55702).
  • Nouveaux comportements par défaut : --enforce-eager désactive également l'échauffement des noyaux JIT sauf si la tolérance aux pannes est activée (#58197, #58593) ; VLLM_BATCH_INVARIANT=1 utilise des graphes CUDA rompables sans torch.compile (#57586) et désactive le parallélisme de séquence et le TP asynchrone (#56377) ; le replay borné SWA de DeepSeek-V4.1 est activé (#56227) sauf sur ROCm (#57906) ; les tables hôtes Engram sont partagées entre réplicas DP colocalisés lorsque possible (#57651) ; FlashMLA mega attention est le défaut pour DeepSeek-V4.1 sur SM100 (#56935) ; le GEMM ASM w4a4 AITER est désactivé par défaut sur ROCm (#57055).
  • Model Runner V1 + PP > 1 + ordonnancement asynchrone + sortie structurée est désormais rejeté au démarrage (#56250) ; json_object est rejeté lors de la validation avec le backend outlines (#57743).
  • transformers a désormais une borne supérieure dans les exigences (#59614).

Nouveaux contributeurs

  • @0z5a a effectué sa première contribution dans https://github.com/vllm-project/vllm/pull/56441
  • @200lz a effectué sa première contribution dans https://github.com/vllm-project/vllm/pull/55528
  • @AARONKANG04 a effectué sa première contribution dans https://github.com/vllm-project/vllm/pull/48521
  • @acsoto a effectué sa première contribution dans https://github.com/vllm-project/vllm/pull/57314
  • @adenzhou1350 a effectué sa première contribution dans https://github.com/vllm-project/vllm/pull/56882
  • @adtygan a effectué sa première contribution dans https://github.com/vllm-project/vllm/pull/56325
  • @amasen02 a effectué sa première contribution dans https://github.com/vllm-project/vllm/pull/56576
  • @amd-sriram a effectué sa première contribution dans https://github.com/vllm-project/vllm/pull/53792
  • @andrewor14 a effectué sa première contribution dans https://github.com/vllm-project/vllm/pull/52956
  • @Ankit-Jaiswal-AMD a effectué sa première contribution dans https://github.com/vllm-project/vllm/pull/56252
  • @baljinderhothi-cohere a effectué sa première contribution dans https://github.com/vllm-project/vllm/pull/58792
  • @BaoYunkai a effectué sa première contribution dans https://github.com/vllm-project/vllm/pull/57568
  • @blipbyte a effectué sa première contribution dans https://github.com/vllm-project/vllm/pull/55612
  • @BPbruce a effectué sa première contribution dans https://github.com/vllm-project/vllm/pull/46466
  • @chuan932 a effectué sa première contribution dans https://github.com/vllm-project/vllm/pull/55330
  • @coderfornow a effectué sa première contribution dans https://github.com/vllm-project/vllm/pull/54978
  • @CZT0 a effectué sa première contribution dans https://github.com/vllm-project/vllm/pull/51694
  • @devtyagi3909 a effectué sa première contribution dans https://github.com/vllm-project/vllm/pull/56635
  • @dilberx a effectué sa première contribution dans https://github.com/vllm-project/vllm/pull/57076
  • @divyvasal a effectué sa première contribution dans https://github.com/vllm-project/vllm/pull/49845
  • @equiluxe a effectué sa première contribution dans https://github.com/vllm-project/vllm/pull/48115
  • @errmakov a effectué sa première contribution dans https://github.com/vllm-project/vllm/pull/58583
  • @farzad-elastix a effectué sa première contribution dans https://github.com/vllm-project/vllm/pull/56168
  • @freyfwt a effectué sa première contribution dans https://github.com/vllm-project/vllm/pull/51367
  • @garrett361 a effectué sa première contribution dans https://github.com/vllm-project/vllm/pull/57984
  • @git-jxj a effectué sa première contribution dans https://github.com/vllm-project/vllm/pull/55702
  • @gokay-ai a effectué sa première contribution dans https://github.com/vllm-project/vllm/pull/58292
  • @gongwei-130 a effectué sa première contribution dans https://github.com/vllm-project/vllm/pull/55102
  • @haosenwang1018 a effectué sa première contribution dans https://github.com/vllm-project/vllm/pull/58288
  • @harshit-sarvam a effectué sa première contribution dans https://github.com/vllm-project/vllm/pull/56034
  • @HieDean a effectué sa première contribution dans https://github.com/vllm-project/vllm/pull/57356
  • @huthvincent a effectué sa première contribution dans https://github.com/vllm-project/vllm/pull/48419
  • @i-m-aditya a effectué sa première contribution dans https://github.com/vllm-project/vllm/pull/57447
  • @jayzuccarelli a effectué sa première contribution dans https://github.com/vllm-project/vllm/pull/58557
  • @jiakangkangfuzhe a effectué sa première contribution dans https://github.com/vllm-project/vllm/pull/55146
  • @jiangLLM a effectué sa première contribution dans https://github.com/vllm-project/vllm/pull/57487
  • @jiaran-king a effectué sa première contribution dans https://github.com/vllm-project/vllm/pull/56242
  • @jz-yolo a effectué sa première contribution dans https://github.com/vllm-project/vllm/pull/58884
  • @kaijunli-infr a effectué sa première contribution dans https://github.com/vllm-project/vllm/pull/52101
  • @karya0 a effectué sa première contribution dans https://github.com/vllm-project/vllm/pull/57453
  • @KEYS-A15 a effectué sa première contribution dans https://github.com/vllm-project/vllm/pull/57528
  • @kwen2501 a effectué sa première contribution dans https://github.com/vllm-project/vllm/pull/51520
  • @laulopezreal a effectué sa première contribution dans https://github.com/vllm-project/vllm/pull/57189
  • @lijipeng787 a effectué sa première contribution dans https://github.com/vllm-project/vllm/pull/58225
  • @limitmhw a effectué sa première contribution dans https://github.com/vllm-project/vllm/pull/48606
  • @linnea-lin-00638949 a effectué sa première contribution dans https://github.com/vllm-project/vllm/pull/47450
  • @LinzeShi a effectué sa première contribution dans https://github.com/vllm-project/vllm/pull/57347
  • @mahird3 a effectué sa première contribution dans https://github.com/vllm-project/vllm/pull/57708
  • @melcheikh a effectué sa première contribution dans https://github.com/vllm-project/vllm/pull/48956
  • @MichaelLapshin a effectué sa première contribution dans https://github.com/vllm-project/vllm/pull/57396
  • @mjkvaak-amd a effectué sa première contribution dans https://github.com/vllm-project/vllm/pull/48249
  • @mkunredd a effectué sa première contribution dans https://github.com/vllm-project/vllm/pull/58244
  • @mmastrac a effectué sa première contribution dans https://github.com/vllm-project/vllm/pull/57414
  • @mustafayildirim a effectué sa première contribution dans https://github.com/vllm-project/vllm/pull/57252
  • @Navjot10 a effectué sa première contribution dans https://github.com/vllm-project/vllm/pull/55390
  • @olka-amd a effectué sa première contribution dans https://github.com/vllm-project/vllm/pull/51065
  • @PeganovAnton a effectué sa première contribution dans https://github.com/vllm-project/vllm/pull/55128
  • @Rakul-Chauhan a effectué sa première contribution dans https://github.com/vllm-project/vllm/pull/54967
  • @Ricardo-M-L a effectué sa première contribution dans https://github.com/vllm-project/vllm/pull/52580
  • @Ronnie-Rui a effectué sa première contribution dans https://github.com/vllm-project/vllm/pull/54581
  • @RyanMa29 a effectué sa première contribution dans https://github.com/vllm-project/vllm/pull/57295
  • @sammaji a effectué sa première contribution dans https://github.com/vllm-project/vllm/pull/58626
  • @sawsa307 a effectué sa première contribution dans https://github.com/vllm-project/vllm/pull/56497
  • @ScarWar a effectué sa première contribution dans https://github.com/vllm-project/vllm/pull/49435
  • @sdougbrown a fait sa première contribution dans https://github.com/vllm-project/vllm/pull/49819
  • @semerandre a fait sa première contribution dans https://github.com/vllm-project/vllm/pull/55557
  • @sergiofigueras a fait sa première contribution dans https://github.com/vllm-project/vllm/pull/57948
  • @shallow10 a fait sa première contribution dans https://github.com/vllm-project/vllm/pull/58336
  • @SIDDARTHAREDDY8 a fait sa première contribution dans https://github.com/vllm-project/vllm/pull/57743
  • @simpleqt a fait sa première contribution dans https://github.com/vllm-project/vllm/pull/55936
  • @tangzzycc a fait sa première contribution dans https://github.com/vllm-project/vllm/pull/53283
  • @touch869 a fait sa première contribution dans https://github.com/vllm-project/vllm/pull/55844
  • @tripathiarpan20 a fait sa première contribution dans https://github.com/vllm-project/vllm/pull/57140
  • @twu3202 a fait sa première contribution dans https://github.com/vllm-project/vllm/pull/57769
  • @ubwzwd a fait sa première contribution dans https://github.com/vllm-project/vllm/pull/55931
  • @UNIDY2002 a fait sa première contribution dans https://github.com/vllm-project/vllm/pull/58370
  • @valarLip a fait sa première contribution dans https://github.com/vllm-project/vllm/pull/58659
  • @vcave a fait sa première contribution dans https://github.com/vllm-project/vllm/pull/51681
  • @voidxb a fait sa première contribution dans https://github.com/vllm-project/vllm/pull/49300
  • @vorapolsiloai a fait sa première contribution dans https://github.com/vllm-project/vllm/pull/50212
  • @vschandramourya a fait sa première contribution dans https://github.com/vllm-project/vllm/pull/58779
  • @weitliao a fait sa première contribution dans https://github.com/vllm-project/vllm/pull/54535
  • @wenjinhust a fait sa première contribution dans https://github.com/vllm-project/vllm/pull/51366
  • @Willian-Zhang a fait sa première contribution dans https://github.com/vllm-project/vllm/pull/58720
  • @wtdcode a fait sa première contribution dans https://github.com/vllm-project/vllm/pull/56268
  • @xinnywinne a fait sa première contribution dans https://github.com/vllm-project/vllm/pull/55084
  • @YannikHinteregger a fait sa première contribution dans https://github.com/vllm-project/vllm/pull/50047
  • @YashasviChaurasia a fait sa première contribution dans https://github.com/vllm-project/vllm/pull/58112
  • @Yatimai a fait sa première contribution dans https://github.com/vllm-project/vllm/pull/43462
  • @YCH188 a fait sa première contribution dans https://github.com/vllm-project/vllm/pull/57190
  • @yousafshah a fait sa première contribution dans https://github.com/vllm-project/vllm/pull/55957
  • @ys2025-AI a fait sa première contribution dans https://github.com/vllm-project/vllm/pull/56841
  • @yuchenwang3 a fait sa première contribution dans https://github.com/vllm-project/vllm/pull/54699
  • @zhecfy a fait sa première contribution dans https://github.com/vllm-project/vllm/pull/58316
  • @Zoe923 a fait sa première contribution dans https://github.com/vllm-project/vllm/pull/53864
  • @Zyann7 a fait sa première contribution dans https://github.com/vllm-project/vllm/pull/57784

Contributeurs

@AndreasKaratzas, @khluu, @mgoin, @njhill, @BugenZhao, @stefankoncarevic, @robertgshaw2-redhat, @taneem-ibrahim, @Thangnguyenvn98, @hmellor, @Juntian777, @WoosukKwon, @yewentao256, @gau-nernst, @mmastrac, @LucasWilkinson, @Fangzhou-Ai, @NickLucche, @aoshen02, @JaredforReal, @mawong-amd, @DarkLight1337, @zyongye, @sfeng33, @vllm-agent, @okorzh-amd, @ZJY0516, @shen-shanshan, @gty111, @Isotr0py, @djramic, @zixi-qi, @wzhao18, @alec-flowers, @aarushjain29, @Rohan138, @yma11, @mjkvaak-amd, @ivanium, @yisustc, @MatthewBonanni, @wangxiyuan, @reidliu41, @chaojun-zhang, @shaohuaxi, @gcanlin, @ganeshr10, @linitra24, @yzong-rh, @divakar-amd, @atalman, @ShuoleiWang, @simondanielsson, @rasmith, @chaunceyjiang, @micah-wil, @liusy58, @LioEinaudi, @louie-tsai, @LiuYinfeng01, @jeejeelee, @zhenwei-intel, @jperezdealgaba, @hlin99, @zxd1997066, @lucamotz, @lucifer1004, @eopXD, @ashraf-bhuiyan, @TheEpicDolphin, @JulienDarve, @mayuyuace, @danisereb, @bigPYJ1151, @Etelis, @JohnQinAMD, @jiangkuaixue123, @tianmu-li, @akii96, @vllmellm, @RyanMa29, @afriedri, @elvircrn, @mustafayildirim, @yuzhouo7, @wtdcode, @biswapanda, @adtygan, @hickeyma, @itayalroy, @jiangLLM, @Hotragn, @faaany, @xhx1022, @jinzhen-lin, @sheralskumar, @Wauplin, @matteso1, @wjabbour, @Sunt-ing, @arpera, @hclsys, @S1ro1, @HDCharles, @fxmarty-amd, @liuzijing2014, @UNIDY2002, @samuelkim7, @markmc, @errmakov, @zhejiangxiaomai, @KernelClint, @i-m-aditya, @ColinZ22, @ppalanga, @franciscojavierarceo, @maithilijoshi20, @mfylcek, @almersawi, @albertoperdomo2, @0z5a, @jacklin78911-collab, @lzhan011, @Alex-ai-future, @freyfwt, @ZhengGong-amd, @mindungil, @amasen02, @devtyagi3909, @wenjinhust, @jbyczkow, @AdaAibaby, @harshit-sarvam, @vineethsaivs, @tripathiarpan20, @sashko-zakharchuk, @semerandre, @rebklee, @git-jxj, @cjackal, @xinnywinne, @andrewor14, @kyleliang-nv, @thillai-c, @dongluw, @ChuanLi1101, @omerpaz95, @jiaran-king, @liuyao0322, @coderfornow, @drakosha, @laulopezreal, @melcheikh, @shantipriya-amd, @Rukhaiya2004, @yuchenwang3, @lxy-alexander, @tlrmchlsmth, @HieDean, @Zoe923, @YCH188, @amd-sriram, @andylolu2, @MicheleCampi, @sdougbrown, @vMaroon, @shimib, @andakai, @thegoldenflow, @Levius-Fubuki, @olka-amd, @limitmhw, @yuwenzho, @adenzhou1350, @Josephasafg, @kylesayrs, @jdebache, @kaijunli-infr, @afierka-intel, @frida-andersson, @bnellnm, @ys2025-AI, @waizuichougou, @touch869, @rjrock, @sawsa307, @pavelzak, @ScarWar, @fadara01, @Mi-Jiazhi, @dilberx, @mahird3, @Zyann7, @roikoren755, @YukioZzz, @Ronnie-Rui, @acsoto, @czhu-cohere, @twu3202, @oliverholworthy, @weitliao, @sergiofigueras, @tuukkjs, @Sip4818, @karen-sy, @garrett361, @GirasoleY, @Navjot10, @taking-lying-flat, @wangyicong52, @majunze2001, @gangula-karthik, @ubwzwd, @linnea-lin-00638949, @kushaldabbe, @Yatimai, @guanxingithub, @jiakangkangfuzhe, @MichaelLapshin, @jhu960213, @tpopp, @mganczarenko, @qiching, @tangzzycc, @lijipeng787, @nikhilkulkarni1755, @QwertyJack, @Ankit-Jaiswal-AMD, @vorapolsiloai, @Dao007forever, @BPbruce, @divyvasal, @simpleqt, @blipbyte, @jhaotingc, @karya0, @farzad-elastix, @grYe99, @talorabr, @jackLei0901, @Yejing-Lai, @Priyjain-amd, @KEYS-A15, @LinzeShi, @bohnstingl, @nightcityblade, @vcave, @AARONKANG04, @CZT0, @snadampal, @microslaw, @haosenwang1018, @netanel-haber, @khushali9, @sammaji, @SIDDARTHAREDDY8, @100milliongold, @gongwei-130, @fululi12, @mkunredd, @mrodden, @noooop, @valarLip, @shallow10, @200lz, @askliar, @chuan932, @Monishver11, @YashasviChaurasia, @gokay-ai, @jiacao-amd, @yousafshah, @positive666, @TQCB, @lk-chen, @Ricardo-M-L, @huthvincent, @baljinderhothi-cohere, @vschandramourya, @kwen2501, @xiao-llm, @zhecfy, @Willian-Zhang, @simon-veitner-redhat, @mevince, @voidxb, @hongxiayang, @YannikHinteregger, @V-3604, @Rakul-Chauhan, @frankwang28, @LCAIZJ, @PeganovAnton, @jz-yolo, @QHarshil, @R3hankhan123, @jayzuccarelli, @yannicks1, @BaoYunkai, @xaguilar-amd, @xiaohuguo2023, @wxsIcey, @harshaladhav-amd, @varun-sundar-rabindranath, @kliuae, @LostFox11

Source originale

vLLM Releases

À propos du contenu

La publication originale et les droits appartiennent à la source.

Traduction automatique · Consultez l’original