vLLM Releases

v0.31.0

# v0.31.0 ## Aspectos destacados Esta versión incluye 717 commits de 307 colaboradores (96 nuevos)! * **Rendimiento de DeepSeek-V4.1-Flash**: la mega atención FlashMLA con la caché KV comprimida NVFP4 de V4.1 es ahora el…

v0.31.0

Aspectos destacados

Esta versión incluye 717 commits de 307 colaboradores (96 nuevos)!

  • Rendimiento de DeepSeek-V4.1-Flash: la mega atención FlashMLA con la caché KV comprimida NVFP4 de V4.1 es ahora el valor predeterminado en SM100 (#56935); logits MQA dispersos de DeepGEMM para el indexador (#56254) y Mega-Gate que fusiona el GEMM de la gate con la selección de expertos (#56266); los límites del decodificador fusionan el all-reduce de TP, la preparación de entrada de mHC (#57643) y el finalize de MoE (#58586); un WO-A de lote pequeño fusionado con RoPE inverso y cuantización MXFP8 en SM100/SM103 (#58634); el GEMM de MXFP8 wo_b fusionado con el reduce-scatter en paralelo de secuencia (#57428); Engram wkv particionado entre rangos TP (#58678) y tablas host de Engram compartidas por defecto entre réplicas DP co-localizadas (#57651); CUDA graphs del codificador para la vision tower (#56625); y SWA bounded replay que mantiene la KV de ventana deslizante fuera del prefix caching (#56227).
  • Reinicio rápido: el nuevo vllm preload lanza el daemon de caché de pesos que mantiene los pesos post-cuantizados residentes en la memoria de la GPU a través de los reinicios del motor (#56680), ahora con paralelismo de datos (#57386), modelos borrador MTP (#57312), un /health endpoint (#58552) y una espera de preparación (#58370). Las instantáneas experimentales de motor inicializado (vllm snapshot create/restore) usan CRIU para restaurar un motor TP1 completamente inicializado (#51360).
  • Model Runner V2 y decodificación especulativa: decodificación especulativa con modelo borrador (#43091) y procesadores de logits personalizados (#56497) en Model Runner V2; el nuevo borrador LiLiCorr (#57934); planificación asíncrona para DFlash (#58065) con el precompute de K/V de contexto capturado en el CUDA graph del borrador (#57632); verificación adaptativa DSpark para Gemma4 (#57263) y decodificación de longitud variable para Kimi-K3 (#52988); un objetivo DCP con un borrador DSpark no DCP (#56723); y la memoria MoE ahora se cuenta durante el profiling de MRV2, evitando OOM en despliegues WideEP (#57270, #58411).
  • Servicio a gran escala: backend all2all EP balanceado de MoonEP vía --all2all-backend moonep (#52101), paralelismo de contexto de prefill con paralelismo de datos (#57075), un reduce-scatter multimem de SM bajo para SM100/SM103 (#55072), DeepEPv2 con paralelismo de secuencia (#57210) y EPLB con solapamiento de shared-expert (#57236), un backend de transferencia de pesos NCCL M2N consciente del sharding para RL (#51520), y detección de contrapresión en la descarga de KV (#50045).
  • Controles de planificación: --max-num-active-seqs admite la admisión RUNNING de forma independiente de max_num_seqs (#56758), --long-prefill-token-threshold ahora se adapta al número de prefills en espera en lugar de fragmentar una única solicitud (#57951, #58459), la cola de espera fue rediseñada para que las solicitudes que ya retienen bloques KV se planifiquen primero (#58947), y se corrigió el deadlock del conector KV + MTP bajo presión de KV (#57104).
  • Refuerzo de HiSparse: filas de verificación MTP resueltas con un kernel de residencia de unión (#59235), colapso de aceptación MTP bajo graphs FULL corregido (#59309), sin páginas de GPU sin respaldo en host (#59036), un livelock de preemptión en chunked-prefill corregido (#59494), caché KV dimensionada a partir de los grupos que HiSparse asigna (#59450), y correcciones de publicación de prefijos en host y de adopción de prefijos en GPU (#59007, #59282).
  • Seguridad: por solicitud, mm_processor_kwargs y media_io_kwargs se rechazan a menos que --trust-request-mm-kwargs esté configurado (#58830); las claves extra de la caché de prefijos se etiquetan por fuente, de modo que un nombre de LoRA y un cache_salt ya no pueden colisionar (#51899), y la ruta de LoRA es parte del block hash (#59335); las entradas obsoletas de la caché de recepción multimodal ya no pueden reemplazar payloads frescos (#57833).
  • Cambios importantes: kwargs multimodales por solicitud gated (#58830); tokenizer_mode="slow" eliminado (#58545); --enable-mamba-fine-grained-prefix-cache renombrado a --enable-mamba-shared-prefix-checkpoint (#57382); cuantización en línea a través de quantization="fp8" reemplazado por la fp8_per_tensor forma abreviada (#53585) y se eliminó la cuantización silenciosa en línea de Quark (#51800); el backend AllSpark INT8 W8A16 eliminado (#58001); --enforce-eager ahora también desactiva el calentamiento de kernels JIT (#58197); los XPU graphs habilitados por defecto con VLLM_XPU_ENABLE_XPU_GRAPH eliminado (#51600).

Artefactos de la versión

Ruedas de Python

Plataforma Instalación
PyPI (CUDA 13.0) pip install vllm
PyPI (CUDA 13.0, uv) uv pip install vllm --torch-backend=auto
ROCm pip install vllm --extra-index-url https://wheels.vllm.ai/rocm/0.31.0/rocm723
XPU uv pip install vllm --extra-index-url https://wheels.vllm.ai/0.31.0/xpu --extra-index-url https://download.pytorch.org/whl/xpu --index-strategy unsafe-best-match

Imágenes de Docker

Plataforma Imagen de Docker
CUDA 13.0 (predeterminada) docker pull vllm/vllm-openai:v0.31.0
CUDA 12.9 docker pull vllm/vllm-openai:v0.31.0-cu129
ROCm docker pull vllm/vllm-openai-rocm:v0.31.0
CPU docker pull vllm/vllm-openai-cpu:v0.31.0
XPU docker pull vllm/vllm-openai-xpu:v0.31.0

Otros artefactos

Los artefactos de versión preconstruidos están disponibles en la sección Assets al final de esta página, incluyendo: - Tarball de distribución de código fuente - Ruedas de Python CUDA 12.9 para x86_64 y arm64 - Ruedas de Python CUDA 13.0 para x86_64 y arm64 - Ruedas de Python CPU para x86_64, arm64 y macOS - Rueda de Python XPU para x86_64

Soporte de modelos

  • Nuevas capacidades de modelos: Modo de generación estructurada DiffusionGemma con elecciones de un solo token acotadas (#57250), MiMo V2 MXFP4 MoE, enrutador MoE BF16 y borradores DFlash (#57784), estados ocultos auxiliares de Cohere2MoE para borradores EAGLE3/DFlash (#49819), GLM-5.2-MXFP4 en la ruta ROCm DeepSeek-V3.2 (#51915), puntos de control AMD-Quark de precisión mixta DeepSeek-V4.1-Flash-MXFP4 (#57071) y GLM-5.3-Flash Quark MXFP4 (#56176), y un granite_thinking_parser integrado para Granite 4.2 (#55957).
  • DeepSeek-V4.1-Flash: Mega atención FlashMLA con la caché KV comprimida NVFP4 como predeterminada en SM100 (#56935), logits MQA dispersos de DeepGEMM en el indexador (#56254), Mega-Gate (#56266), all-reduce TP fusionado + preparación de entrada mHC (#57643) con la finalización MoE incorporada (#58586), WO-A de lotes pequeños fusionado (#58634), MXFP8 wo_b GEMM + reduce-scatter (#57428), coeficientes mHC superpuestos para lotes TP pequeños (#57603) limitados a grafos CUDA FULL (#57874), Engram wkv distribuido entre TP (#58678), búsquedas Engram serializadas con tablas de host de páginas enormes (#56926), tablas Engram compartidas entre réplicas DP por defecto (#57651, #57914, #59068), fusión MegaMoE de expertos compartidos nativa sin relleno (#56568, #57204), preparación MegaMoE más rápida y recolecciones de caché NVFP4 (#57604), la ruta de consulta RMSNorm + MXFP8 fusionada restaurada (#57679), inserción de contexto DSpark solo KV (#56441), grafos CUDA del codificador de visión (#56625, #58499), reproducción acotada SWA (#56227), SWA de imagen causal restaurado para coincidir con la referencia (#57152), mapeos de esfuerzo de razonamiento actualizados (#58316), y correcciones de arranque para bloques candidatos con puntuación NaN (#57454), centinelas DeepSelect (#58215), atención DSpark no causal en FlashInfer (#57432), JIT en tiempo de ejecución de búferes candidatos de desplazamiento (#57667) e importaciones sin Triton (#57654).
  • DeepSeek V4: MLA dispersa de FlashInfer con RoPE inversa fusionada + cuantización FP8 (#58621), proyecciones WKV de contexto DSpark apiladas (#54674), distribución de expertos MoE fusionada calculada desde el grupo EP (#57465), completado FIM mediante suffix (#44229), string= faltantes en llamadas a herramientas analizadas (#56271), herramientas de solicitud adjuntas a un mensaje de sistema existente (#51856), espaciado de bloques de imagen preservado (#56882), y ancho DSpark separado de la validación de etapas MTP (#54631).
  • GLM-5.3-Flash: backends dispersos FlashAttention y FlashMLA opcionales en SM90 (#55385), MLA dispersa NoPE en el backend FlashInfer SM120 (#55277), top-k cooperativo para lotes de decodificación pequeños (#57327), espacio de trabajo de decodificación del indexador dimensionado por longitud agrupada (3 GiB ahorrados, #57701), operaciones de metadatos 1.6-4.8x más rápidas (#58450), mapeo de ranuras finales kpool fusionado (#57534), kpool top-k a través del despachador compartido (#57546), menor sobrecarga de preparación de MLA dispersa (#57458), sin sincronización D2H en el plan de MLA dispersa SM90 bajo programación asíncrona (#58684), FlashKDA manteniendo el estado recurrente en FP32 para prellenos largos (#58846), y correcciones de corrección para corrupción de kpool con decodificación especulativa (#58454), SM90 index_kpool de discrepancia SM90 (#58704), pasos finales de kpool (#57477), avisos de 500k tokens (#57317), capas MLP densas bajo paralelismo de secuencia (#58061), selección de backend top-k del indexador (#58594) y lanzamientos varlen paginados MQA (#55270).
  • Qwen3.8-Flash-Next (Qwen4Exp): caché KV principal FP8 en la ruta QSA (#55557), FP8 TP con FlashInfer TRTLLM MoE (#55867), ajuste QSA SM90 (#57273), proyección descendente HC + SiLU fusionada (#58957), menor sobrecarga de metadatos PLE (#58114), fragmentación del espacio de trabajo del indexador QSA corregida (#57105), caché KV de perfilado liberada (#58961), ids de precarga PLE fijados mantenidos fuera del pool de grafos CUDA (#58489), y búsquedas de mapeo de expertos indexadas que ahorran alrededor de 25 s de carga de pesos en DGX Spark (#58720).
  • Kimi K3 y MiniMax-M3: incrustador de parches de visión Kimi-K3 como un GEMM (#58527), QK RoPE de KimiViT fusionado (hasta 29x, #58651), cuantización de expertos enrutados (#57430), correcciones del analizador de razonamiento (#57098) y del conteo de tokens de razonamiento (#58372), punteros KV de contexto DSpark actualizados tras re-vincular (#58814), primeros fragmentos sin estado ya no clasificados como decodificaciones (#51483), y estimaciones de bloques Mamba que ya no detienen la admisión en aciertos de prefijo externos (#57050); grafos CUDA del codificador MiniMax-M3 (#58673), Conv3dLayer incrustación de parches (alrededor de 62x, #58512), triton_mrope en la vision tower (#58526), enrutamiento MiniMax2 fusionado con escalado no unitario (#58880), y correcciones del processor (#58460, #59613).
  • DiffusionGemma: kernel de estadísticas del sampler de una sola pasada (#58226), diffusion_constrained lecturas sobre logprob_token_ids (aproximadamente 25% más rápido, #58216), menos filas de logit para lotes de solo prefill (#57416), logprob_token_ids soporte (#57417), y correcciones para logprobs concurrentes (#57414), dtype de fallback eager (#57462), entradas multimodales (#57589), cabezas LM cuantizadas (#48521) y ejecución en CPU (#58964).
  • Multimodal: Triton mm_input_norm kernel (#56798, #56711), píxeles raw conservados a través de la ruta ViT con sharding DP (#56872), fps de video de Qwen2.5-VL respetados para M-RoPE temporal (#47736), clips de Whisper y Qwen2-Audio de más de 30s (#57769, #56912), cuadrícula de marcadores de posición de Mistral3 (#53758), parches sin dividir de Idefics3 (#48760), tokens de Ovis2.5 (#52623), pesos de expertos de Aria (#57487), FP8 fusionado de MiMo-V2.5 qkv_proj sharding (#57508), Gemma4 AutoWeightsLoader (#55911) y escalares de buffer (#54213), Gemma4 FP8 KV con FA4 a head dim 512 (#53175), Laguna RoPE (#57189), regresión de precisión de Mistral-Large-3 (#57563), EXIF malformado (#56527, #57234), etiquetas JinaVL (#57347), enrutamiento Sarvam MLA con logits de router en FP32 (#56034), puntuaciones de atención de CohereASR fusionadas (#55190), y convolución agrupada DFlash2 fusionada (#55960).
  • LoRA: modelos de lenguaje Nemotron VL (#56231), ModernBert (#57148), embeddings VoyageQwen3 (#57708), clasificación de secuencias RoBERTa (#58884), y modules_to_save cabezas de clasificación de secuencias (#53555) con por adaptador num_labels (#57766).

Engine Core

  • Model Runner V2: decodificación especulativa con draft-model (#43091), procesadores de logits personalizados (#56497) validados en la admisión (#57728), entradas dummy aleatorizadas (#58411), tokens dummy enrutados a expertos MoE durante el profiling (#57270), grafos FULL de decodificación para colas de prompt de un token (#58400), mapeos token-a-request compartidos (#57102) y metadatos Mamba/GDN reutilizados entre grupos de caché KV (#58762), grafos CUDA de ViT solo encoder (#56922), offloader de pesos (#57834) y modelo de pooling (#57737) liberados al apagar, y correcciones para KV MTP multialcance en P/D (#55055), fast-prefill con LoRA (#56456), escrituras obsoletas de block-table de pasos dummy de draft (#56734), colas de prompt rellenadas en modelos híbridos (#58434), slots de draft nunca propuestos (#58784), auto-fit max_model_len (#58149) y intermediate_tensors durante la captura (#57745).
  • Speculative decoding: drafter LiLiCorr (#57934), planificación asíncrona DFlash (#58065) y K/V de contexto en el grafo CUDA de draft (#57632), verificación adaptativa DSpark de Gemma4 (#57263), verificación adaptativa de longitud variable de Kimi-K3 (#52988), sincronización CPU-GPU eliminada para vocabularios heterogéneos (#57396), recompilaciones de Triton evitadas en el estimador de aceptación (#57107), y correcciones para drafts EAGLE/densos con EP (#56930), lotes de profiling DFlash/DSpark (#56448), memoria del head MTP de GLM (#55442), embeddings de prompt con drafts (#57356), y decodificación causal multitoken TritonMLA (#51065).
  • Scheduler: --max-num-active-seqs (#56758), adaptativo --long-prefill-token-threshold (#57951, #58459), skipped_waiting sustituido por una cola de espera que retiene KV (#58947), admisión atómica de n > 1 requests (#53936), deadlock de conector KV + MTP (#57104), un desplome de rendimiento cuando max_num_seqs no es múltiplo de 8 (#57355), continuaciones en streaming que mantienen logprobs y refrescan max tokens (#57447, #57676), una carrera entre request reanudable + planificación asíncrona (#58259), y un sondeo de gramática de salida estructurada sin bloqueo (#55931).
  • Prefijo caching y modelos híbridos: claves extra etiquetadas por origen (#51899) y rutas LoRA con hash (#59335), --enable-mamba-shared-prefix-checkpoint (#57382), aciertos de cola de prompt con MTP restaurados (#58368), checkpoints de fin de prompt conservados bajo retención dispersa (#59146), reserva de checkpoints en modo align (#59175), primeros chunks de GDN sin estado (#51565), grupos de caché KV de draft MTP anotados en la ruta de agrupación híbrida (#55390), un constructor de checkpoints de prefill generalizado (#57783), guardados de estado de prefill Mamba2 por lotes sin sincronizaciones GPU-CPU (#49371), skip_reading_prefix_cache respetado para aciertos del conector (#57269), hashing incremental de bloques multimodales (#51694), un tamaño de bloque KV que todos los backends de atención soportan (#49845) con errores más claros (#58557), y CacheConfig.effective_attention_block_size para DCP (#56538).
  • Arranque y memoria: compilación paralela de warmup de Triton (#58582), warmup JIT deshabilitado bajo --enforce-eager (#58197) salvo que la tolerancia a fallos esté activada (#58593), warmup de DeepGEMM reutilizando el workspace de MoE (#57268), la fragmentación del allocator ya no reduce la caché KV durante el profiling (#58430), buffers de prefill dispersos reservados antes del dimensionado de KV (#57575), vistas obsoletas del workspace de FlashMLA liberadas (#56902), workspace FP8 de DeepGEMM reducido a la mitad (#53914), workspaces compartidos Marlin/Humming (#57421), pesos BF16 MoE de FlashInfer convertidos in situ (#54699), hilos de arranque de UniProc acotados por la cuota de CPU (#58946), e hilos de runtime fijados antes del profiling (#55891).
  • Kernels: filtrado muestreado para top-k persistente (#56346), RNG Murmur3 para muestreo Gumbel (#51367), cuantización de 8 bits por grupo de tokens residente en registros (#55330), abs-max FP8 por tensor vectorizado (#58194), un dispatcher de kernels Triton para overrides específicos de plataforma (#43048), GateLinear para todos los modelos MoE (#58234), slots de expertos no locales omitidos en TritonExperts (#58051), finalización top-k de TRT-LLM-Gen diferida en la ruta modular (#58635), configuraciones matmul invariantes por lote en SM120 (#57456), scratch de dequant de prefill de FlashInfer acotado (#57918), y correcciones para NaNs de softcap en Triton (#56579), transformaciones Hadamard de QuIP (#43462), FP8 lineal de CUTLASS en A100 (#55884), muestreo FlashInfer en GPUs no soportadas (#48956), relleno de escalas blockwise FP8 en SM100 (#57377), captura de prefill de grafo FULL mixta (#58275), pattern matching de custom-ops de Inductor (#58189), divergencia del prefill GDN BF16 de CuteDSL respecto a FLA en Qwen3.5 (#53864), SM100 fp8_ds_mla la caché escala (#49435), lotes de decodificación ragged en el indexador disperso (#52500), máscaras obsoletas allowed_token_ids tras el reordenamiento de lotes (#48419, #43931), y prompt_embeds tensores retenidos después de que las solicitudes finalicen (#57988).
  • Invariancia de lote: gráficos CUDA interrumpibles sin torch.compile por defecto bajo VLLM_BATCH_INVARIANT (#57586), paralelismo de secuencia y TP asíncrono deshabilitados (#56377), y colectivas de NCCL 2.31 mantenidas habilitadas (#58179).
  • Suspensión y RL: release_kv_cache_memory() libera solo la memoria de la caché KV (#44890), --sleep-preserve-parameter-names conserva los pesos congelados entre suspensiones de nivel 2 (#57891), transferencia de pesos NCCL M2N (#51520), actualizaciones de pesos DP denso por índice DP (#56950), configuración del asignador conservada al alternar segmentos expandibles (#57982), y fallos de reinicio de caché propagados durante la suspensión (#54581).
  • Reinicio rápido: vllm preload (#56680), DP (#57386), borradores MTP (#57312), espera de disponibilidad (#58370), /health (#58552), pesos preprocesados ModelOpt MXFP8 (#57316), e instantáneas de motor inicializado (#51360).
  • Registro y observabilidad: LoggingConfig vía --logging-config y --log-level (#57205), correcciones de registro JSON (#57957, #58747), supresión del registro de inicio corregida (#51366), perfilado torch unificado consciente de la plataforma (#57460), sin tasa de aciertos de caché de prefijo de 0.0% antes de cualquier consulta (#54990), formateo de métricas de transferencia KV (#57068), dimensionamiento de activación MFU según el dtype del modelo (#57070), comprobaciones de variables de entorno sobrescribibles por plataforma (#48599), VLLM_TARGET_DEVICE=empty pip install vllm para backends externos al árbol (#41074), y la versión correcta de vLLM reportada al instalar desde el código fuente (#57295, #57744).

Servicio a gran escala

  • Comunicación MoE: backend MoonEP (#52101), DeepEPv2 con paralelismo de secuencia (#57210) y solapamiento EPLB + experto compartido (#57236), reduce-scatter multimem de bajo SM (#55072), estadísticas de carga EPLB durante el escalado de Elastic EP (#58473), filas rellenadas de SP omitidas en el enrutamiento agrupado para que el rango 0 ya no sea un rezagado de prefill (#56079), enrutamiento por hash rechazado en backends monolíticos no compatibles (#57867), difusiones de sampled-token omitidas bajo PP para solicitudes que abandonan el motor (#58542), DBO con perfilado de baja latencia de DeepEP (#57502), LB externo con réplicas que comparten nodos (#53743), y sin RPC de bloqueo durante el handshake del motor (#57226) ni esperas ilimitadas de draft-token (#58779).
  • Paralelismo de contexto: PCP con DP, EP y MTP (#57075), un objetivo DCP con borradores DSpark/DFlash no DCP (#56723), longitudes de secuencia DCP sin una sincronización CPU-GPU (#58169), y extracciones NIXL DCP a través de regiones de caché MLA (#57389).
  • Conectores KV: push prefill pipeline-parallel NIXL para attention-HMA (#50494) y diseños MLA empaquetados (#50499), métricas de fallo de transporte separadas de la expiración KV (#55854), estado de pares muertos liberado sin esperar el TTL (#50047), arrendamientos expirados recolectados detrás de un encabezado con latido (#58292), finalización de push restaurada (#58188), actividad D-side registrada (#52245); Mooncake CUSTOM_MEM_POOL (#49300), fallos de carga a nivel de solicitud bajo HMA (#56855, #57174) y reintentos de bootstrap (#58919); estado híbrido Mamba/KDA de MoRIIO en modo READ (#51052) y una condición de carrera de enrutamiento multi-decode (#51681); aciertos de caché de prefill en prompt_tokens_details (#54222); publicadores de eventos KV vinculados en el puerto 0 (#55844); GET de metadatos de caché KV restaurado para consumidores externos (#56925); eventos KV de bloque parcial conservan todas las funciones multimodales (#58288); guardados finalizados en pasos sin forward (#57775); ExampleHiddenStatesConnector seguro ante abortos (#56841); rellenos FP8 de DecodeBench (#58472); un KvHints de sobre de solicitud (#53423); y el conector AuxOutput para salidas de expertos enrutados (#45635, #58150, #58205).
  • Descarga KV: max_load_tokens por solicitud (#55885), detección de contrapresión (#50045), SimpleCPUOffloadConnector métricas de Prometheus (#57251), grupos no almacenables en caché de prefijo (#56810) y scratch (#57145) omitidos, diseños replicados para MLA de múltiples grupos (#57652), regiones de 512 GiB o más registradas en fragmentos (#51081), memoria de cgroup comprobada antes de la asignación SHM (#54014), y correcciones para la recencia de caché (#51787), ventanas deslizantes retenidas por MTP (#56709), filas MLA canónicas (#56799), metadatos de eventos (#57453) y memoria fijada ROCm (#57160).
  • HiSparse: kernel de residencia de unión para filas MTP (#59235), aceptación MTP bajo gráficos FULL (#59309), asignación respaldada por el host (#59036), interbloqueo vivo de preemption (#59494), dimensionamiento de la caché KV (#59450), publicación de prefijos en el host (#59007), adopción de prefijos en GPU (#59282), y métricas de residencia (#58725).
  • Desagregación de encoder (EPD): proxy EPD dinámico con registro gestionado por el lanzador (#54176), solicitudes de imagen agrupadas por codificador (#57095), caché entre codificadores mediante Mooncake (#56242), entradas de audio de solo metadatos (#57887), fragmentos del modelo de lenguaje omitidos para --mm-encoder-only (#58086), métricas del conector EC (#54960) y correcciones solo de codificador (#58490, #58287, #57696).

Hardware y rendimiento

  • NVIDIA: FlashInfer 0.7.0.post1 (#58069, #59323), actualización del pin de DeepGEMM con correcciones para SM120 (#57218), imágenes nocturnas de Rubin con CUDA 13.4 (#55953) y compilaciones de QuTLASS con PyTorch 2.13 (#58173).
  • AMD ROCm: AITER v0.1.23 (#56885, #58867), torch 2.13 y Triton 3.8 (#50605, #58006), triton_kernels 3.8 MXFP4 MoE para gpt-oss y DeepSeek-V4 (#55934), un segfault de host ROCR corregido (#57328); DeepSeek-V4/V4.1 HCA dual-stream (#56853) y solapamiento CSA2 consciente de capas (#57407), FP8 wo_a (#54894), RoPE inverso fusionado en el reduce del decode disperso (#57435, #57451) que ahora emite MXFP8 para un GEMM agrupado FP8 wo_a (#58456), GEMM MXFP8 sobre escalas nativas 32x32 en gfx950 (#58510), metadatos ragged top-k reutilizados (#57434), selección de bloques candidatos más rápida (#58208), tablas Engram en memoria del host (#57491) y tablas PLE de Qwen3.8-Flash-Next descargadas a la memoria del host (#57497), una ruta de decode ASM de AITER opcional para DCP + decodificación especulativa (#56861), get_top_tokens() en el borrador MTP de DeepSeek V4 (#57568), verificación adaptativa de DSpark (#52362), VLLM_DSV4_LOGITS_FIX para logits de sparse-indexer en gfx950/gfx942 (#50455), una reversión de precisión de #56433 y #51692 (#57132), y errores claros para FSE con DPA+ETP (#57919); Kimi-K3 kernels FlyDSL a4w4 (#53940) con VLLM_ROCM_USE_AITER_MOE_SITUV2=a16w4|a8w4|a4w4 (#58201), KDA especulativo de baja concurrencia (#58045), MoE latente particionado bajo EP (#54956) y menos copias de proyección (#50592); una ruta Hy4 de ROCm con torch.compile (13x menor latencia de decode, #57526); fusión QK-norm AITER de MiniMax-M3 (#54535), inserción K/V sin copias (#56849) y correcciones MXFP8 (#53674, #58089); correcciones de arranque de GLM-5.3-Flash (#57192, #57252, #57425); AITER QuickReduce + RMSNorm (#48249), AsyncTP BF16 (#58098), fusión estática de salida de atención FP8 (#58099), fusión QK-norm/RoPE/KV-cache para MRoPE (#50212), AITER GDN decode para diseños planos (#53623), wvSplitK para GEMMs de salida única (#53283), 69 copias menos por paso de decode en la ruta GEMM estrecha (#58566), búsqueda de GEMM ajustada a través de AITER (#55001), un tile KV de prefill Triton más estrecho en RDNA3/RDNA4 (#58225), copias H2D grandes paginadas por etapas (#56343), y correcciones para el padding MXFP4 MoE que agotaba la caché KV (#56359), OOM de AITER MLA FP8 prefill (#57923), desescalados de caché sin cuantizar (#56726) y fallbacks de AITER MoE (#56590, #57866, #57426). VLLM_ROCM_USE_AITER_FP4_ASM_GEMM se restaura y queda desactivado por defecto (#57055); la reproducción acotada SWA está deshabilitada en ROCm (#57906).
  • Intel XPU: PyTorch 2.14 (#56013), XPU graphs activados por defecto (#51600), EPLB (#44987), MoE int8 W8A8 en Triton (#53162), invariancia por lotes (#55881), rotary embedding SYCL (#55721), QK RMSNorm + RoPE + gate fusionados (región de decode 55% más rápida, #56096), sampler de Model Runner V2 (#57277) y control de microbatch PP (#55145), --device-ids respetado (#56015), y desbordamiento de puntero de dispositivo corregido (#54514).
  • CPU: FP8 W8A8 lineal y MoE para Intel Diamond Rapids (#49942), paged attention de Arm hasta 25% más rápida (#56045), Zen DA8W4 int4 para capas densas y MoE (#54024), zentorch SDPA para atención de encoder (#54508) y MLA prefill (#54967), attention sinks FP32 (#56252), MoE W8A8 INT8 en POWER (#55316), Whisper W4A16 (#58268), wheels construidos en Ubuntu 22.04 (glibc 2.34) con AMX-FP8 (#58515), AVX10.2 condicionado a soporte del compilador (#58133), Triton CPU precompilado (#58140), --device-memory-utilization alias (#56547), vLLM Recipes en la imagen de CPU (#58796, #57306), pin de protobuf s390x (#54978) y torchcodec video (#58693), y correcciones para Ministral FP8 (#56985), pesos FP32 del router (#56168), fallos de importación de zentorch (#54923), SHM multimodal en macOS (#57142), afinidad de CPU por rango local (#53636) y el diseño de estado NIXL GDN (#53300).

Cuantización

  • Humming: transformadas de Hadamard y cuantización online NVFP4/MXFP4/MXFP8 (#56685), wNaM asimétrico mediante compressed-tensors (#46528), humming-kernels 0.1.16 (#58054), y Humming en el oráculo MoE W4A8 (INT4xFP8) (#58427).
  • Nuevas capacidades: exportaciones nativas Quark W4A16 INT4/UINT4 (#48606), descuantización MXFP4 en la carga opcional (#50814), backends MoE NVFP4 por token explícitos (#57176), y un diseño canónico N-first para MoE WNA16 de compressed-tensors (#52798).
  • Correcciones: MXFP8 en capas por debajo de mm_mxfp8 límites de forma (#54223), escalas online NVFP4 al recargar (#57954), metadatos lineales del LM head (#58444), y la ruta de cuantización por bloques SiLU-mul fusionada que se omitía bajo un clamp SwiGLU (#57984).

API & Frontend

  • Nuevas opciones y endpoints: --tool-strict-level (#56268), response_format con tool_choice=auto (#56086), completaciones FIM de DeepSeek-V4 (#44229), release_kv_cache_memory() y POST /release_kv_cache_memory (#44890), puntuación de prefill de tokens fijos mediante prompt_logprob_token_ids (#54335), métricas de decodificación especulativa por solicitud en /inference/v1/generate (#43310), métricas por solicitud (#55084) y cache_write_tokens (#57222) en la API de Responses, Anthropic thinking en /v1/messages (#58613), razonamiento y llamadas a herramientas en streaming desde el endpoint derender (#50550) con destokenización descargada (#57528), vllm chat salida de thinking en streaming (#57045), registro de depuración del cuerpo de la solicitud con --enable-log-requests (#58163), y solo la línea de resumen de los docstrings de configuración en --help (#57357).
  • Salida estructurada y parsers: gramáticas Lark nativas en el backend xgrammar (#58321), XGrammar 0.2.7 (#57272), Granite migrado al Parser Engine de streaming (#49648), y correcciones para los límites de razonamiento (#56635), xgrammar choices con caracteres de control (#48115), JSON Schema de tipo lista (#48416), structural_tag vacío (#47450), manejo de EOS en outlines (#58612, #57743), logprobs de streaming suprimidos por el parser (#58583), nombres de herramientas Inkling tras el razonamiento (#58792), y longitud finish_reason para llamadas a herramientas en streaming truncadas (#46303).
  • Compatibilidad con OpenAI, Anthropic y Harmony: recuentos de tokens de razonamiento para Harmony, DeepSeek-V3 y Step3 (#58626) y por ronda de herramienta de Responses (#58927), Harmony max_output_tokens en el bucle de herramientas (#58551), completaciones de chat por lotes usando las solicitudes ajustadas (#58929, #58958), un parser nuevo por elección (#58939), recuentos diferidos de razonamiento (#56067), limpieza de MCP de Responses (#56988) e imagen detail por defecto (#57241), detección de sistema en línea de Anthropic (#58754) y pensamiento deshabilitado con P/D (#58786), cadenas de stop rechazadas en --tokens-only servidores (#57058), prompt_embeds no válidos que devuelven 400 (#55451, #57006), prompts acotados tras la expansión multimodal (#57076), --override-generation-config penalizaciones (#50769), revisiones de Hub (#56092, #57461), logprobs completos en respuestas de token de entrada/token de salida (#58488), cancelación de puntuación generativa (#57729, #58788), pings de keepalive de gRPC (#55102), y run-batch transcripciones diarizadas (#57948).
  • Pooling: relleno de embeddings por fragmentos (#56505) y normalización (#57498), tokenización del reranker con límites de documentos (#57666), y cabezas de la familia BERT conservadas para logits crudos (#57664).
  • Frontend de Rust: --hf-overrides (#56931), --sse-keep-alive-interval (#58306), roles de chat personalizados (#58311), parsers de MiMo V2.5 (#57933), controles de razonamiento normalizados (#56998), gramáticas de salida propiedad del parser (#55269, #57340), máscaras de muestreo sobre gRPC (#56777), tamaño de DP local en metadatos de gRPC con vllm-proto 0.3.0 (#57116, #57233), un histograma de preempción por solicitud (#57033), histogramas sin bloqueos (#58574), contexto de visión de Nemotron-H (#57634), procesadores de visión propiedad del modelo (#58109), un mm-processor benchmark (#51922, #58084, #58378), argumentos de serve no soportados reconocidos (#58330), los logprobs NaN ya no matan al cliente del motor (#51026), campos EngineCoreOutput añadidos aceptados (#56533), y vllm-rs sobre PATH en la imagen CUDA (#57606).
  • Benchmarks: un openai-responses backend para vllm bench serve (#54628) y model_id en el JSON de latencia/rendimiento (#58112).

Seguridad

  • Por solicitud, mm_processor_kwargs y media_io_kwargs se rechazan por defecto; los despliegues confiables pueden activarlo con --trust-request-mm-kwargs (#58830).
  • Los hashes de bloques de caché de prefijo etiquetan las claves extra por fuente (#51899) e incluyen la ruta de LoRA (#59335); la entrada de hash multimodal está delimitada (#54283) y el hash incremental de bloques cubre cada característica superpuesta (#51694).
  • Los payloads multimodales frescos tienen prioridad sobre una caché de receptor obsoleta (#57833), y los aciertos de caché del codificador con recuentos de embeddings no coincidentes se rechazan (#57696).
  • min_tokens por encima del max_tokens de relleno por defecto se rechaza en lugar de bloquear el motor (#57731); la sanitización de mensajes filtra direcciones de memoria en mayúsculas (#58832); los adaptadores LoRA nombrados como un modelo servido se rechazan (#59286).

Dependencias

  • FlashInfer 0.7.0.post1 (#58069, #59323), Transformers 5.17.0 (#56108) con un límite superior en requirements (#59614), XGrammar 0.2.7 (#57272), oss-harmony reemplazando openai-harmony (#55128), actualización del pin del fork de DeepGEMM (#57218), actualización de FlashKDA (#58846) y humming-kernels 0.1.16 (#58054).
  • Las imágenes de CUDA 12 usan LMCache 0.4.4 y CuPy CUDA 12 (#57945); se publica una imagen de Docker Hub de zstd etiquetada por separado (-x86_64-zstd) (#55608); imágenes nightly de Rubin CUDA 13.4 (#55953).
  • ROCm: AITER v0.1.23 (#58867), torch 2.13, Triton 3.8 (#50605, #58006), ROCR parcheado (#57328), pins de LMCache OpenTelemetry (#59056).
  • XPU: PyTorch 2.14 (#56013). CPU: wheels compilados en Ubuntu 22.04 (#58515), Triton CPU precompilado (#58140).

Cambios incompatibles y obsolescencias

  • Por solicitud mm_processor_kwargs y media_io_kwargs ahora devuelven un error a menos que el servidor se inicie con --trust-request-mm-kwargs; a nivel de servidor, --mm-processor-kwargs / --media-io-kwargs y sin conexión LLM no cambian (#58830).
  • tokenizer_mode="slow" fue eliminado; ya se comportaba como "hf" bajo Transformers v5 (#58545).
  • --enable-mamba-fine-grained-prefix-cache fue renombrado a --enable-mamba-shared-prefix-checkpoint (#57382).
  • La cuantización en línea a través de quantization="fp8" ahora redirige a la abreviatura en línea fp8_per_tensor (#53585); la cuantización silenciosa MXFP4 en línea específica de Quark fue eliminada en favor de la API de cuantización en línea (#51800).
  • El backend GEMM AllSpark INT8 W8A16 fue eliminado (#58001). La opción return_assistant_tokens_mask de /render y el campo de respuesta assistant_tokens_mask fueron eliminados (#57520).
  • VLLM_PLE_CPU_OFFLOAD fue eliminado; use --engram-config (#57937). VLLM_XPU_ENABLE_XPU_GRAPH fue eliminado y los XPU graphs están activados por defecto (#51600).
  • Se eliminó la forma separada por comas de --collect-detailed-traces ; use la sintaxis de lista (#55702).
  • Nuevos valores por defecto: --enforce-eager también desactiva el calentamiento de kernels JIT a menos que la tolerancia a fallos esté habilitada (#58197, #58593); VLLM_BATCH_INVARIANT=1 usa CUDA graphs interrumpibles sin torch.compile (#57586) y desactiva el paralelismo de secuencia y async TP (#56377); la reproducción acotada SWA de DeepSeek-V4.1 está activada (#56227) excepto en ROCm (#57906); las tablas de host de Engram se comparten entre réplicas DP co-localizadas cuando es posible (#57651); FlashMLA mega attention es el valor por defecto para DeepSeek-V4.1 en SM100 (#56935); el GEMM ASM w4a4 de AITER está desactivado por defecto en ROCm (#57055).
  • Model Runner V1 + PP > 1 + planificación asíncrona + salida estructurada ahora se rechaza al inicio (#56250); json_object se rechaza en la validación con el backend outlines (#57743).
  • transformers ahora tiene un límite superior en los requisitos (#59614).

Nuevos colaboradores

  • @0z5a hizo su primera contribución en https://github.com/vllm-project/vllm/pull/56441
  • @200lz hizo su primera contribución en https://github.com/vllm-project/vllm/pull/55528
  • @AARONKANG04 hizo su primera contribución en https://github.com/vllm-project/vllm/pull/48521
  • @acsoto hizo su primera contribución en https://github.com/vllm-project/vllm/pull/57314
  • @adenzhou1350 hizo su primera contribución en https://github.com/vllm-project/vllm/pull/56882
  • @adtygan hizo su primera contribución en https://github.com/vllm-project/vllm/pull/56325
  • @amasen02 hizo su primera contribución en https://github.com/vllm-project/vllm/pull/56576
  • @amd-sriram hizo su primera contribución en https://github.com/vllm-project/vllm/pull/53792
  • @andrewor14 hizo su primera contribución en https://github.com/vllm-project/vllm/pull/52956
  • @Ankit-Jaiswal-AMD hizo su primera contribución en https://github.com/vllm-project/vllm/pull/56252
  • @baljinderhothi-cohere hizo su primera contribución en https://github.com/vllm-project/vllm/pull/58792
  • @BaoYunkai hizo su primera contribución en https://github.com/vllm-project/vllm/pull/57568
  • @blipbyte hizo su primera contribución en https://github.com/vllm-project/vllm/pull/55612
  • @BPbruce hizo su primera contribución en https://github.com/vllm-project/vllm/pull/46466
  • @chuan932 hizo su primera contribución en https://github.com/vllm-project/vllm/pull/55330
  • @coderfornow hizo su primera contribución en https://github.com/vllm-project/vllm/pull/54978
  • @CZT0 hizo su primera contribución en https://github.com/vllm-project/vllm/pull/51694
  • @devtyagi3909 hizo su primera contribución en https://github.com/vllm-project/vllm/pull/56635
  • @dilberx hizo su primera contribución en https://github.com/vllm-project/vllm/pull/57076
  • @divyvasal hizo su primera contribución en https://github.com/vllm-project/vllm/pull/49845
  • @equiluxe hizo su primera contribución en https://github.com/vllm-project/vllm/pull/48115
  • @errmakov hizo su primera contribución en https://github.com/vllm-project/vllm/pull/58583
  • @farzad-elastix hizo su primera contribución en https://github.com/vllm-project/vllm/pull/56168
  • @freyfwt hizo su primera contribución en https://github.com/vllm-project/vllm/pull/51367
  • @garrett361 hizo su primera contribución en https://github.com/vllm-project/vllm/pull/57984
  • @git-jxj hizo su primera contribución en https://github.com/vllm-project/vllm/pull/55702
  • @gokay-ai hizo su primera contribución en https://github.com/vllm-project/vllm/pull/58292
  • @gongwei-130 hizo su primera contribución en https://github.com/vllm-project/vllm/pull/55102
  • @haosenwang1018 hizo su primera contribución en https://github.com/vllm-project/vllm/pull/58288
  • @harshit-sarvam hizo su primera contribución en https://github.com/vllm-project/vllm/pull/56034
  • @HieDean hizo su primera contribución en https://github.com/vllm-project/vllm/pull/57356
  • @huthvincent hizo su primera contribución en https://github.com/vllm-project/vllm/pull/48419
  • @i-m-aditya hizo su primera contribución en https://github.com/vllm-project/vllm/pull/57447
  • @jayzuccarelli hizo su primera contribución en https://github.com/vllm-project/vllm/pull/58557
  • @jiakangkangfuzhe hizo su primera contribución en https://github.com/vllm-project/vllm/pull/55146
  • @jiangLLM hizo su primera contribución en https://github.com/vllm-project/vllm/pull/57487
  • @jiaran-king hizo su primera contribución en https://github.com/vllm-project/vllm/pull/56242
  • @jz-yolo hizo su primera contribución en https://github.com/vllm-project/vllm/pull/58884
  • @kaijunli-infr hizo su primera contribución en https://github.com/vllm-project/vllm/pull/52101
  • @karya0 hizo su primera contribución en https://github.com/vllm-project/vllm/pull/57453
  • @KEYS-A15 hizo su primera contribución en https://github.com/vllm-project/vllm/pull/57528
  • @kwen2501 hizo su primera contribución en https://github.com/vllm-project/vllm/pull/51520
  • @laulopezreal hizo su primera contribución en https://github.com/vllm-project/vllm/pull/57189
  • @lijipeng787 hizo su primera contribución en https://github.com/vllm-project/vllm/pull/58225
  • @limitmhw hizo su primera contribución en https://github.com/vllm-project/vllm/pull/48606
  • @linnea-lin-00638949 hizo su primera contribución en https://github.com/vllm-project/vllm/pull/47450
  • @LinzeShi hizo su primera contribución en https://github.com/vllm-project/vllm/pull/57347
  • @mahird3 hizo su primera contribución en https://github.com/vllm-project/vllm/pull/57708
  • @melcheikh hizo su primera contribución en https://github.com/vllm-project/vllm/pull/48956
  • @MichaelLapshin hizo su primera contribución en https://github.com/vllm-project/vllm/pull/57396
  • @mjkvaak-amd hizo su primera contribución en https://github.com/vllm-project/vllm/pull/48249
  • @mkunredd hizo su primera contribución en https://github.com/vllm-project/vllm/pull/58244
  • @mmastrac hizo su primera contribución en https://github.com/vllm-project/vllm/pull/57414
  • @mustafayildirim hizo su primera contribución en https://github.com/vllm-project/vllm/pull/57252
  • @Navjot10 hizo su primera contribución en https://github.com/vllm-project/vllm/pull/55390
  • @olka-amd hizo su primera contribución en https://github.com/vllm-project/vllm/pull/51065
  • @PeganovAnton hizo su primera contribución en https://github.com/vllm-project/vllm/pull/55128
  • @Rakul-Chauhan hizo su primera contribución en https://github.com/vllm-project/vllm/pull/54967
  • @Ricardo-M-L hizo su primera contribución en https://github.com/vllm-project/vllm/pull/52580
  • @Ronnie-Rui hizo su primera contribución en https://github.com/vllm-project/vllm/pull/54581
  • @RyanMa29 hizo su primera contribución en https://github.com/vllm-project/vllm/pull/57295
  • @sammaji hizo su primera contribución en https://github.com/vllm-project/vllm/pull/58626
  • @sawsa307 hizo su primera contribución en https://github.com/vllm-project/vllm/pull/56497
  • @ScarWar hizo su primera contribución en https://github.com/vllm-project/vllm/pull/49435
  • @sdougbrown hizo su primera contribución en https://github.com/vllm-project/vllm/pull/49819
  • @semerandre hizo su primera contribución en https://github.com/vllm-project/vllm/pull/55557
  • @sergiofigueras hizo su primera contribución en https://github.com/vllm-project/vllm/pull/57948
  • @shallow10 hizo su primera contribución en https://github.com/vllm-project/vllm/pull/58336
  • @SIDDARTHAREDDY8 hizo su primera contribución en https://github.com/vllm-project/vllm/pull/57743
  • @simpleqt hizo su primera contribución en https://github.com/vllm-project/vllm/pull/55936
  • @tangzzycc hizo su primera contribución en https://github.com/vllm-project/vllm/pull/53283
  • @touch869 hizo su primera contribución en https://github.com/vllm-project/vllm/pull/55844
  • @tripathiarpan20 hizo su primera contribución en https://github.com/vllm-project/vllm/pull/57140
  • @twu3202 hizo su primera contribución en https://github.com/vllm-project/vllm/pull/57769
  • @ubwzwd hizo su primera contribución en https://github.com/vllm-project/vllm/pull/55931
  • @UNIDY2002 hizo su primera contribución en https://github.com/vllm-project/vllm/pull/58370
  • @valarLip hizo su primera contribución en https://github.com/vllm-project/vllm/pull/58659
  • @vcave hizo su primera contribución en https://github.com/vllm-project/vllm/pull/51681
  • @voidxb hizo su primera contribución en https://github.com/vllm-project/vllm/pull/49300
  • @vorapolsiloai hizo su primera contribución en https://github.com/vllm-project/vllm/pull/50212
  • @vschandramourya hizo su primera contribución en https://github.com/vllm-project/vllm/pull/58779
  • @weitliao hizo su primera contribución en https://github.com/vllm-project/vllm/pull/54535
  • @wenjinhust hizo su primera contribución en https://github.com/vllm-project/vllm/pull/51366
  • @Willian-Zhang hizo su primera contribución en https://github.com/vllm-project/vllm/pull/58720
  • @wtdcode hizo su primera contribución en https://github.com/vllm-project/vllm/pull/56268
  • @xinnywinne hizo su primera contribución en https://github.com/vllm-project/vllm/pull/55084
  • @YannikHinteregger hizo su primera contribución en https://github.com/vllm-project/vllm/pull/50047
  • @YashasviChaurasia hizo su primera contribución en https://github.com/vllm-project/vllm/pull/58112
  • @Yatimai hizo su primera contribución en https://github.com/vllm-project/vllm/pull/43462
  • @YCH188 hizo su primera contribución en https://github.com/vllm-project/vllm/pull/57190
  • @yousafshah hizo su primera contribución en https://github.com/vllm-project/vllm/pull/55957
  • @ys2025-AI hizo su primera contribución en https://github.com/vllm-project/vllm/pull/56841
  • @yuchenwang3 hizo su primera contribución en https://github.com/vllm-project/vllm/pull/54699
  • @zhecfy hizo su primera contribución en https://github.com/vllm-project/vllm/pull/58316
  • @Zoe923 hizo su primera contribución en https://github.com/vllm-project/vllm/pull/53864
  • @Zyann7 hizo su primera contribución en https://github.com/vllm-project/vllm/pull/57784

Colaboradores

@AndreasKaratzas, @khluu, @mgoin, @njhill, @BugenZhao, @stefankoncarevic, @robertgshaw2-redhat, @taneem-ibrahim, @Thangnguyenvn98, @hmellor, @Juntian777, @WoosukKwon, @yewentao256, @gau-nernst, @mmastrac, @LucasWilkinson, @Fangzhou-Ai, @NickLucche, @aoshen02, @JaredforReal, @mawong-amd, @DarkLight1337, @zyongye, @sfeng33, @vllm-agent, @okorzh-amd, @ZJY0516, @shen-shanshan, @gty111, @Isotr0py, @djramic, @zixi-qi, @wzhao18, @alec-flowers, @aarushjain29, @Rohan138, @yma11, @mjkvaak-amd, @ivanium, @yisustc, @MatthewBonanni, @wangxiyuan, @reidliu41, @chaojun-zhang, @shaohuaxi, @gcanlin, @ganeshr10, @linitra24, @yzong-rh, @divakar-amd, @atalman, @ShuoleiWang, @simondanielsson, @rasmith, @chaunceyjiang, @micah-wil, @liusy58, @LioEinaudi, @louie-tsai, @LiuYinfeng01, @jeejeelee, @zhenwei-intel, @jperezdealgaba, @hlin99, @zxd1997066, @lucamotz, @lucifer1004, @eopXD, @ashraf-bhuiyan, @TheEpicDolphin, @JulienDarve, @mayuyuace, @danisereb, @bigPYJ1151, @Etelis, @JohnQinAMD, @jiangkuaixue123, @tianmu-li, @akii96, @vllmellm, @RyanMa29, @afriedri, @elvircrn, @mustafayildirim, @yuzhouo7, @wtdcode, @biswapanda, @adtygan, @hickeyma, @itayalroy, @jiangLLM, @Hotragn, @faaany, @xhx1022, @jinzhen-lin, @sheralskumar, @Wauplin, @matteso1, @wjabbour, @Sunt-ing, @arpera, @hclsys, @S1ro1, @HDCharles, @fxmarty-amd, @liuzijing2014, @UNIDY2002, @samuelkim7, @markmc, @errmakov, @zhejiangxiaomai, @KernelClint, @i-m-aditya, @ColinZ22, @ppalanga, @franciscojavierarceo, @maithilijoshi20, @mfylcek, @almersawi, @albertoperdomo2, @0z5a, @jacklin78911-collab, @lzhan011, @Alex-ai-future, @freyfwt, @ZhengGong-amd, @mindungil, @amasen02, @devtyagi3909, @wenjinhust, @jbyczkow, @AdaAibaby, @harshit-sarvam, @vineethsaivs, @tripathiarpan20, @sashko-zakharchuk, @semerandre, @rebklee, @git-jxj, @cjackal, @xinnywinne, @andrewor14, @kyleliang-nv, @thillai-c, @dongluw, @ChuanLi1101, @omerpaz95, @jiaran-king, @liuyao0322, @coderfornow, @drakosha, @laulopezreal, @melcheikh, @shantipriya-amd, @Rukhaiya2004, @yuchenwang3, @lxy-alexander, @tlrmchlsmth, @HieDean, @Zoe923, @YCH188, @amd-sriram, @andylolu2, @MicheleCampi, @sdougbrown, @vMaroon, @shimib, @andakai, @thegoldenflow, @Levius-Fubuki, @olka-amd, @limitmhw, @yuwenzho, @adenzhou1350, @Josephasafg, @kylesayrs, @jdebache, @kaijunli-infr, @afierka-intel, @frida-andersson, @bnellnm, @ys2025-AI, @waizuichougou, @touch869, @rjrock, @sawsa307, @pavelzak, @ScarWar, @fadara01, @Mi-Jiazhi, @dilberx, @mahird3, @Zyann7, @roikoren755, @YukioZzz, @Ronnie-Rui, @acsoto, @czhu-cohere, @twu3202, @oliverholworthy, @weitliao, @sergiofigueras, @tuukkjs, @Sip4818, @karen-sy, @garrett361, @GirasoleY, @Navjot10, @taking-lying-flat, @wangyicong52, @majunze2001, @gangula-karthik, @ubwzwd, @linnea-lin-00638949, @kushaldabbe, @Yatimai, @guanxingithub, @jiakangkangfuzhe, @MichaelLapshin, @jhu960213, @tpopp, @mganczarenko, @qiching, @tangzzycc, @lijipeng787, @nikhilkulkarni1755, @QwertyJack, @Ankit-Jaiswal-AMD, @vorapolsiloai, @Dao007forever, @BPbruce, @divyvasal, @simpleqt, @blipbyte, @jhaotingc, @karya0, @farzad-elastix, @grYe99, @talorabr, @jackLei0901, @Yejing-Lai, @Priyjain-amd, @KEYS-A15, @LinzeShi, @bohnstingl, @nightcityblade, @vcave, @AARONKANG04, @CZT0, @snadampal, @microslaw, @haosenwang1018, @netanel-haber, @khushali9, @sammaji, @SIDDARTHAREDDY8, @100milliongold, @gongwei-130, @fululi12, @mkunredd, @mrodden, @noooop, @valarLip, @shallow10, @200lz, @askliar, @chuan932, @Monishver11, @YashasviChaurasia, @gokay-ai, @jiacao-amd, @yousafshah, @positive666, @TQCB, @lk-chen, @Ricardo-M-L, @huthvincent, @baljinderhothi-cohere, @vschandramourya, @kwen2501, @xiao-llm, @zhecfy, @Willian-Zhang, @simon-veitner-redhat, @mevince, @voidxb, @hongxiayang, @YannikHinteregger, @V-3604, @Rakul-Chauhan, @frankwang28, @LCAIZJ, @PeganovAnton, @jz-yolo, @QHarshil, @R3hankhan123, @jayzuccarelli, @yannicks1, @BaoYunkai, @xaguilar-amd, @xiaohuguo2023, @wxsIcey, @harshaladhav-amd, @varun-sundar-rabindranath, @kliuae, @LostFox11

Fuente original

vLLM Releases

Notas sobre el contenido

La publicación original y los derechos pertenecen a la fuente.

Traducción automática · Consulte el original