Aspectos destacados
Esta versión incluye 717 commits de 307 colaboradores (96 nuevos)!
- Rendimiento de DeepSeek-V4.1-Flash: la mega atención FlashMLA con la caché KV comprimida NVFP4 de V4.1 es ahora el valor predeterminado en SM100 (#56935); logits MQA dispersos de DeepGEMM para el indexador (#56254) y Mega-Gate que fusiona el GEMM de la gate con la selección de expertos (#56266); los límites del decodificador fusionan el all-reduce de TP, la preparación de entrada de mHC (#57643) y el finalize de MoE (#58586); un WO-A de lote pequeño fusionado con RoPE inverso y cuantización MXFP8 en SM100/SM103 (#58634); el GEMM de MXFP8
wo_bfusionado con el reduce-scatter en paralelo de secuencia (#57428); Engramwkvparticionado entre rangos TP (#58678) y tablas host de Engram compartidas por defecto entre réplicas DP co-localizadas (#57651); CUDA graphs del codificador para la vision tower (#56625); y SWA bounded replay que mantiene la KV de ventana deslizante fuera del prefix caching (#56227). - Reinicio rápido: el nuevo
vllm preloadlanza el daemon de caché de pesos que mantiene los pesos post-cuantizados residentes en la memoria de la GPU a través de los reinicios del motor (#56680), ahora con paralelismo de datos (#57386), modelos borrador MTP (#57312), un/healthendpoint (#58552) y una espera de preparación (#58370). Las instantáneas experimentales de motor inicializado (vllm snapshot create/restore) usan CRIU para restaurar un motor TP1 completamente inicializado (#51360). - Model Runner V2 y decodificación especulativa: decodificación especulativa con modelo borrador (#43091) y procesadores de logits personalizados (#56497) en Model Runner V2; el nuevo borrador LiLiCorr (#57934); planificación asíncrona para DFlash (#58065) con el precompute de K/V de contexto capturado en el CUDA graph del borrador (#57632); verificación adaptativa DSpark para Gemma4 (#57263) y decodificación de longitud variable para Kimi-K3 (#52988); un objetivo DCP con un borrador DSpark no DCP (#56723); y la memoria MoE ahora se cuenta durante el profiling de MRV2, evitando OOM en despliegues WideEP (#57270, #58411).
- Servicio a gran escala: backend all2all EP balanceado de MoonEP vía
--all2all-backend moonep(#52101), paralelismo de contexto de prefill con paralelismo de datos (#57075), un reduce-scatter multimem de SM bajo para SM100/SM103 (#55072), DeepEPv2 con paralelismo de secuencia (#57210) y EPLB con solapamiento de shared-expert (#57236), un backend de transferencia de pesos NCCL M2N consciente del sharding para RL (#51520), y detección de contrapresión en la descarga de KV (#50045). - Controles de planificación:
--max-num-active-seqsadmite la admisión RUNNING de forma independiente demax_num_seqs(#56758),--long-prefill-token-thresholdahora se adapta al número de prefills en espera en lugar de fragmentar una única solicitud (#57951, #58459), la cola de espera fue rediseñada para que las solicitudes que ya retienen bloques KV se planifiquen primero (#58947), y se corrigió el deadlock del conector KV + MTP bajo presión de KV (#57104). - Refuerzo de HiSparse: filas de verificación MTP resueltas con un kernel de residencia de unión (#59235), colapso de aceptación MTP bajo graphs FULL corregido (#59309), sin páginas de GPU sin respaldo en host (#59036), un livelock de preemptión en chunked-prefill corregido (#59494), caché KV dimensionada a partir de los grupos que HiSparse asigna (#59450), y correcciones de publicación de prefijos en host y de adopción de prefijos en GPU (#59007, #59282).
- Seguridad: por solicitud,
mm_processor_kwargsymedia_io_kwargsse rechazan a menos que--trust-request-mm-kwargsesté configurado (#58830); las claves extra de la caché de prefijos se etiquetan por fuente, de modo que un nombre de LoRA y uncache_saltya no pueden colisionar (#51899), y la ruta de LoRA es parte del block hash (#59335); las entradas obsoletas de la caché de recepción multimodal ya no pueden reemplazar payloads frescos (#57833). - Cambios importantes: kwargs multimodales por solicitud gated (#58830);
tokenizer_mode="slow"eliminado (#58545);--enable-mamba-fine-grained-prefix-cacherenombrado a--enable-mamba-shared-prefix-checkpoint(#57382); cuantización en línea a través dequantization="fp8"reemplazado por lafp8_per_tensorforma abreviada (#53585) y se eliminó la cuantización silenciosa en línea de Quark (#51800); el backend AllSpark INT8 W8A16 eliminado (#58001);--enforce-eagerahora también desactiva el calentamiento de kernels JIT (#58197); los XPU graphs habilitados por defecto conVLLM_XPU_ENABLE_XPU_GRAPHeliminado (#51600).
Artefactos de la versión
Ruedas de Python
| Plataforma | Instalación |
|---|---|
| PyPI (CUDA 13.0) | pip install vllm |
| PyPI (CUDA 13.0, uv) | uv pip install vllm --torch-backend=auto |
| ROCm | pip install vllm --extra-index-url https://wheels.vllm.ai/rocm/0.31.0/rocm723 |
| XPU | uv pip install vllm --extra-index-url https://wheels.vllm.ai/0.31.0/xpu --extra-index-url https://download.pytorch.org/whl/xpu --index-strategy unsafe-best-match |
Imágenes de Docker
| Plataforma | Imagen de Docker |
|---|---|
| CUDA 13.0 (predeterminada) | docker pull vllm/vllm-openai:v0.31.0 |
| CUDA 12.9 | docker pull vllm/vllm-openai:v0.31.0-cu129 |
| ROCm | docker pull vllm/vllm-openai-rocm:v0.31.0 |
| CPU | docker pull vllm/vllm-openai-cpu:v0.31.0 |
| XPU | docker pull vllm/vllm-openai-xpu:v0.31.0 |
Otros artefactos
Los artefactos de versión preconstruidos están disponibles en la sección Assets al final de esta página, incluyendo: - Tarball de distribución de código fuente - Ruedas de Python CUDA 12.9 para x86_64 y arm64 - Ruedas de Python CUDA 13.0 para x86_64 y arm64 - Ruedas de Python CPU para x86_64, arm64 y macOS - Rueda de Python XPU para x86_64
Soporte de modelos
- Nuevas capacidades de modelos: Modo de generación estructurada DiffusionGemma con elecciones de un solo token acotadas (#57250), MiMo V2 MXFP4 MoE, enrutador MoE BF16 y borradores DFlash (#57784), estados ocultos auxiliares de Cohere2MoE para borradores EAGLE3/DFlash (#49819), GLM-5.2-MXFP4 en la ruta ROCm DeepSeek-V3.2 (#51915), puntos de control AMD-Quark de precisión mixta DeepSeek-V4.1-Flash-MXFP4 (#57071) y GLM-5.3-Flash Quark MXFP4 (#56176), y un
granite_thinking_parserintegrado para Granite 4.2 (#55957). - DeepSeek-V4.1-Flash: Mega atención FlashMLA con la caché KV comprimida NVFP4 como predeterminada en SM100 (#56935), logits MQA dispersos de DeepGEMM en el indexador (#56254), Mega-Gate (#56266), all-reduce TP fusionado + preparación de entrada mHC (#57643) con la finalización MoE incorporada (#58586), WO-A de lotes pequeños fusionado (#58634), MXFP8
wo_bGEMM + reduce-scatter (#57428), coeficientes mHC superpuestos para lotes TP pequeños (#57603) limitados a grafos CUDA FULL (#57874), Engramwkvdistribuido entre TP (#58678), búsquedas Engram serializadas con tablas de host de páginas enormes (#56926), tablas Engram compartidas entre réplicas DP por defecto (#57651, #57914, #59068), fusión MegaMoE de expertos compartidos nativa sin relleno (#56568, #57204), preparación MegaMoE más rápida y recolecciones de caché NVFP4 (#57604), la ruta de consulta RMSNorm + MXFP8 fusionada restaurada (#57679), inserción de contexto DSpark solo KV (#56441), grafos CUDA del codificador de visión (#56625, #58499), reproducción acotada SWA (#56227), SWA de imagen causal restaurado para coincidir con la referencia (#57152), mapeos de esfuerzo de razonamiento actualizados (#58316), y correcciones de arranque para bloques candidatos con puntuación NaN (#57454), centinelas DeepSelect (#58215), atención DSpark no causal en FlashInfer (#57432), JIT en tiempo de ejecución de búferes candidatos de desplazamiento (#57667) e importaciones sin Triton (#57654). - DeepSeek V4: MLA dispersa de FlashInfer con RoPE inversa fusionada + cuantización FP8 (#58621), proyecciones WKV de contexto DSpark apiladas (#54674), distribución de expertos MoE fusionada calculada desde el grupo EP (#57465), completado FIM mediante
suffix(#44229),string=faltantes en llamadas a herramientas analizadas (#56271), herramientas de solicitud adjuntas a un mensaje de sistema existente (#51856), espaciado de bloques de imagen preservado (#56882), y ancho DSpark separado de la validación de etapas MTP (#54631). - GLM-5.3-Flash: backends dispersos FlashAttention y FlashMLA opcionales en SM90 (#55385), MLA dispersa NoPE en el backend FlashInfer SM120 (#55277), top-k cooperativo para lotes de decodificación pequeños (#57327), espacio de trabajo de decodificación del indexador dimensionado por longitud agrupada (3 GiB ahorrados, #57701), operaciones de metadatos 1.6-4.8x más rápidas (#58450), mapeo de ranuras finales kpool fusionado (#57534), kpool top-k a través del despachador compartido (#57546), menor sobrecarga de preparación de MLA dispersa (#57458), sin sincronización D2H en el plan de MLA dispersa SM90 bajo programación asíncrona (#58684), FlashKDA manteniendo el estado recurrente en FP32 para prellenos largos (#58846), y correcciones de corrección para corrupción de kpool con decodificación especulativa (#58454), SM90
index_kpoolde discrepancia SM90 (#58704), pasos finales de kpool (#57477), avisos de 500k tokens (#57317), capas MLP densas bajo paralelismo de secuencia (#58061), selección de backend top-k del indexador (#58594) y lanzamientos varlen paginados MQA (#55270). - Qwen3.8-Flash-Next (Qwen4Exp): caché KV principal FP8 en la ruta QSA (#55557), FP8 TP con FlashInfer TRTLLM MoE (#55867), ajuste QSA SM90 (#57273), proyección descendente HC + SiLU fusionada (#58957), menor sobrecarga de metadatos PLE (#58114), fragmentación del espacio de trabajo del indexador QSA corregida (#57105), caché KV de perfilado liberada (#58961), ids de precarga PLE fijados mantenidos fuera del pool de grafos CUDA (#58489), y búsquedas de mapeo de expertos indexadas que ahorran alrededor de 25 s de carga de pesos en DGX Spark (#58720).
- Kimi K3 y MiniMax-M3: incrustador de parches de visión Kimi-K3 como un GEMM (#58527), QK RoPE de KimiViT fusionado (hasta 29x, #58651), cuantización de expertos enrutados (#57430), correcciones del analizador de razonamiento (#57098) y del conteo de tokens de razonamiento (#58372), punteros KV de contexto DSpark actualizados tras re-vincular (#58814), primeros fragmentos sin estado ya no clasificados como decodificaciones (#51483), y estimaciones de bloques Mamba que ya no detienen la admisión en aciertos de prefijo externos (#57050); grafos CUDA del codificador MiniMax-M3 (#58673),
Conv3dLayerincrustación de parches (alrededor de 62x, #58512),triton_mropeen la vision tower (#58526), enrutamiento MiniMax2 fusionado con escalado no unitario (#58880), y correcciones del processor (#58460, #59613). - DiffusionGemma: kernel de estadísticas del sampler de una sola pasada (#58226),
diffusion_constrainedlecturas sobrelogprob_token_ids(aproximadamente 25% más rápido, #58216), menos filas de logit para lotes de solo prefill (#57416),logprob_token_idssoporte (#57417), y correcciones para logprobs concurrentes (#57414), dtype de fallback eager (#57462), entradas multimodales (#57589), cabezas LM cuantizadas (#48521) y ejecución en CPU (#58964). - Multimodal: Triton
mm_input_normkernel (#56798, #56711), píxeles raw conservados a través de la ruta ViT con sharding DP (#56872), fps de video de Qwen2.5-VL respetados para M-RoPE temporal (#47736), clips de Whisper y Qwen2-Audio de más de 30s (#57769, #56912), cuadrícula de marcadores de posición de Mistral3 (#53758), parches sin dividir de Idefics3 (#48760), tokens de Ovis2.5 (#52623), pesos de expertos de Aria (#57487), FP8 fusionado de MiMo-V2.5qkv_projsharding (#57508), Gemma4AutoWeightsLoader(#55911) y escalares de buffer (#54213), Gemma4 FP8 KV con FA4 a head dim 512 (#53175), Laguna RoPE (#57189), regresión de precisión de Mistral-Large-3 (#57563), EXIF malformado (#56527, #57234), etiquetas JinaVL (#57347), enrutamiento Sarvam MLA con logits de router en FP32 (#56034), puntuaciones de atención de CohereASR fusionadas (#55190), y convolución agrupada DFlash2 fusionada (#55960). - LoRA: modelos de lenguaje Nemotron VL (#56231), ModernBert (#57148), embeddings VoyageQwen3 (#57708), clasificación de secuencias RoBERTa (#58884), y
modules_to_savecabezas de clasificación de secuencias (#53555) con por adaptadornum_labels(#57766).
Engine Core
- Model Runner V2: decodificación especulativa con draft-model (#43091), procesadores de logits personalizados (#56497) validados en la admisión (#57728), entradas dummy aleatorizadas (#58411), tokens dummy enrutados a expertos MoE durante el profiling (#57270), grafos FULL de decodificación para colas de prompt de un token (#58400), mapeos token-a-request compartidos (#57102) y metadatos Mamba/GDN reutilizados entre grupos de caché KV (#58762), grafos CUDA de ViT solo encoder (#56922), offloader de pesos (#57834) y modelo de pooling (#57737) liberados al apagar, y correcciones para KV MTP multialcance en P/D (#55055), fast-prefill con LoRA (#56456), escrituras obsoletas de block-table de pasos dummy de draft (#56734), colas de prompt rellenadas en modelos híbridos (#58434), slots de draft nunca propuestos (#58784), auto-fit
max_model_len(#58149) yintermediate_tensorsdurante la captura (#57745). - Speculative decoding: drafter LiLiCorr (#57934), planificación asíncrona DFlash (#58065) y K/V de contexto en el grafo CUDA de draft (#57632), verificación adaptativa DSpark de Gemma4 (#57263), verificación adaptativa de longitud variable de Kimi-K3 (#52988), sincronización CPU-GPU eliminada para vocabularios heterogéneos (#57396), recompilaciones de Triton evitadas en el estimador de aceptación (#57107), y correcciones para drafts EAGLE/densos con EP (#56930), lotes de profiling DFlash/DSpark (#56448), memoria del head MTP de GLM (#55442), embeddings de prompt con drafts (#57356), y decodificación causal multitoken TritonMLA (#51065).
- Scheduler:
--max-num-active-seqs(#56758), adaptativo--long-prefill-token-threshold(#57951, #58459),skipped_waitingsustituido por una cola de espera que retiene KV (#58947), admisión atómica den > 1requests (#53936), deadlock de conector KV + MTP (#57104), un desplome de rendimiento cuandomax_num_seqsno es múltiplo de 8 (#57355), continuaciones en streaming que mantienen logprobs y refrescan max tokens (#57447, #57676), una carrera entre request reanudable + planificación asíncrona (#58259), y un sondeo de gramática de salida estructurada sin bloqueo (#55931). - Prefijo caching y modelos híbridos: claves extra etiquetadas por origen (#51899) y rutas LoRA con hash (#59335),
--enable-mamba-shared-prefix-checkpoint(#57382), aciertos de cola de prompt con MTP restaurados (#58368), checkpoints de fin de prompt conservados bajo retención dispersa (#59146), reserva de checkpoints en modo align (#59175), primeros chunks de GDN sin estado (#51565), grupos de caché KV de draft MTP anotados en la ruta de agrupación híbrida (#55390), un constructor de checkpoints de prefill generalizado (#57783), guardados de estado de prefill Mamba2 por lotes sin sincronizaciones GPU-CPU (#49371),skip_reading_prefix_cacherespetado para aciertos del conector (#57269), hashing incremental de bloques multimodales (#51694), un tamaño de bloque KV que todos los backends de atención soportan (#49845) con errores más claros (#58557), yCacheConfig.effective_attention_block_sizepara DCP (#56538). - Arranque y memoria: compilación paralela de warmup de Triton (#58582), warmup JIT deshabilitado bajo
--enforce-eager(#58197) salvo que la tolerancia a fallos esté activada (#58593), warmup de DeepGEMM reutilizando el workspace de MoE (#57268), la fragmentación del allocator ya no reduce la caché KV durante el profiling (#58430), buffers de prefill dispersos reservados antes del dimensionado de KV (#57575), vistas obsoletas del workspace de FlashMLA liberadas (#56902), workspace FP8 de DeepGEMM reducido a la mitad (#53914), workspaces compartidos Marlin/Humming (#57421), pesos BF16 MoE de FlashInfer convertidos in situ (#54699), hilos de arranque de UniProc acotados por la cuota de CPU (#58946), e hilos de runtime fijados antes del profiling (#55891). - Kernels: filtrado muestreado para top-k persistente (#56346), RNG Murmur3 para muestreo Gumbel (#51367), cuantización de 8 bits por grupo de tokens residente en registros (#55330), abs-max FP8 por tensor vectorizado (#58194), un dispatcher de kernels Triton para overrides específicos de plataforma (#43048),
GateLinearpara todos los modelos MoE (#58234), slots de expertos no locales omitidos enTritonExperts(#58051), finalización top-k de TRT-LLM-Gen diferida en la ruta modular (#58635), configuraciones matmul invariantes por lote en SM120 (#57456), scratch de dequant de prefill de FlashInfer acotado (#57918), y correcciones para NaNs de softcap en Triton (#56579), transformaciones Hadamard de QuIP (#43462), FP8 lineal de CUTLASS en A100 (#55884), muestreo FlashInfer en GPUs no soportadas (#48956), relleno de escalas blockwise FP8 en SM100 (#57377), captura de prefill de grafo FULL mixta (#58275), pattern matching de custom-ops de Inductor (#58189), divergencia del prefill GDN BF16 de CuteDSL respecto a FLA en Qwen3.5 (#53864), SM100fp8_ds_mlala caché escala (#49435), lotes de decodificación ragged en el indexador disperso (#52500), máscaras obsoletasallowed_token_idstras el reordenamiento de lotes (#48419, #43931), yprompt_embedstensores retenidos después de que las solicitudes finalicen (#57988). - Invariancia de lote: gráficos CUDA interrumpibles sin torch.compile por defecto bajo
VLLM_BATCH_INVARIANT(#57586), paralelismo de secuencia y TP asíncrono deshabilitados (#56377), y colectivas de NCCL 2.31 mantenidas habilitadas (#58179). - Suspensión y RL:
release_kv_cache_memory()libera solo la memoria de la caché KV (#44890),--sleep-preserve-parameter-namesconserva los pesos congelados entre suspensiones de nivel 2 (#57891), transferencia de pesos NCCL M2N (#51520), actualizaciones de pesos DP denso por índice DP (#56950), configuración del asignador conservada al alternar segmentos expandibles (#57982), y fallos de reinicio de caché propagados durante la suspensión (#54581). - Reinicio rápido:
vllm preload(#56680), DP (#57386), borradores MTP (#57312), espera de disponibilidad (#58370),/health(#58552), pesos preprocesados ModelOpt MXFP8 (#57316), e instantáneas de motor inicializado (#51360). - Registro y observabilidad:
LoggingConfigvía--logging-configy--log-level(#57205), correcciones de registro JSON (#57957, #58747), supresión del registro de inicio corregida (#51366), perfilado torch unificado consciente de la plataforma (#57460), sin tasa de aciertos de caché de prefijo de 0.0% antes de cualquier consulta (#54990), formateo de métricas de transferencia KV (#57068), dimensionamiento de activación MFU según el dtype del modelo (#57070), comprobaciones de variables de entorno sobrescribibles por plataforma (#48599),VLLM_TARGET_DEVICE=empty pip install vllmpara backends externos al árbol (#41074), y la versión correcta de vLLM reportada al instalar desde el código fuente (#57295, #57744).
Servicio a gran escala
- Comunicación MoE: backend MoonEP (#52101), DeepEPv2 con paralelismo de secuencia (#57210) y solapamiento EPLB + experto compartido (#57236), reduce-scatter multimem de bajo SM (#55072), estadísticas de carga EPLB durante el escalado de Elastic EP (#58473), filas rellenadas de SP omitidas en el enrutamiento agrupado para que el rango 0 ya no sea un rezagado de prefill (#56079), enrutamiento por hash rechazado en backends monolíticos no compatibles (#57867), difusiones de sampled-token omitidas bajo PP para solicitudes que abandonan el motor (#58542), DBO con perfilado de baja latencia de DeepEP (#57502), LB externo con réplicas que comparten nodos (#53743), y sin RPC de bloqueo durante el handshake del motor (#57226) ni esperas ilimitadas de draft-token (#58779).
- Paralelismo de contexto: PCP con DP, EP y MTP (#57075), un objetivo DCP con borradores DSpark/DFlash no DCP (#56723), longitudes de secuencia DCP sin una sincronización CPU-GPU (#58169), y extracciones NIXL DCP a través de regiones de caché MLA (#57389).
- Conectores KV: push prefill pipeline-parallel NIXL para attention-HMA (#50494) y diseños MLA empaquetados (#50499), métricas de fallo de transporte separadas de la expiración KV (#55854), estado de pares muertos liberado sin esperar el TTL (#50047), arrendamientos expirados recolectados detrás de un encabezado con latido (#58292), finalización de push restaurada (#58188), actividad D-side registrada (#52245); Mooncake
CUSTOM_MEM_POOL(#49300), fallos de carga a nivel de solicitud bajo HMA (#56855, #57174) y reintentos de bootstrap (#58919); estado híbrido Mamba/KDA de MoRIIO en modo READ (#51052) y una condición de carrera de enrutamiento multi-decode (#51681); aciertos de caché de prefill enprompt_tokens_details(#54222); publicadores de eventos KV vinculados en el puerto 0 (#55844); GET de metadatos de caché KV restaurado para consumidores externos (#56925); eventos KV de bloque parcial conservan todas las funciones multimodales (#58288); guardados finalizados en pasos sin forward (#57775);ExampleHiddenStatesConnectorseguro ante abortos (#56841); rellenos FP8 de DecodeBench (#58472); unKvHintsde sobre de solicitud (#53423); y el conector AuxOutput para salidas de expertos enrutados (#45635, #58150, #58205). - Descarga KV:
max_load_tokenspor solicitud (#55885), detección de contrapresión (#50045),SimpleCPUOffloadConnectormétricas de Prometheus (#57251), grupos no almacenables en caché de prefijo (#56810) y scratch (#57145) omitidos, diseños replicados para MLA de múltiples grupos (#57652), regiones de 512 GiB o más registradas en fragmentos (#51081), memoria de cgroup comprobada antes de la asignación SHM (#54014), y correcciones para la recencia de caché (#51787), ventanas deslizantes retenidas por MTP (#56709), filas MLA canónicas (#56799), metadatos de eventos (#57453) y memoria fijada ROCm (#57160). - HiSparse: kernel de residencia de unión para filas MTP (#59235), aceptación MTP bajo gráficos FULL (#59309), asignación respaldada por el host (#59036), interbloqueo vivo de preemption (#59494), dimensionamiento de la caché KV (#59450), publicación de prefijos en el host (#59007), adopción de prefijos en GPU (#59282), y métricas de residencia (#58725).
- Desagregación de encoder (EPD): proxy EPD dinámico con registro gestionado por el lanzador (#54176), solicitudes de imagen agrupadas por codificador (#57095), caché entre codificadores mediante Mooncake (#56242), entradas de audio de solo metadatos (#57887), fragmentos del modelo de lenguaje omitidos para
--mm-encoder-only(#58086), métricas del conector EC (#54960) y correcciones solo de codificador (#58490, #58287, #57696).
Hardware y rendimiento
- NVIDIA: FlashInfer 0.7.0.post1 (#58069, #59323), actualización del pin de DeepGEMM con correcciones para SM120 (#57218), imágenes nocturnas de Rubin con CUDA 13.4 (#55953) y compilaciones de QuTLASS con PyTorch 2.13 (#58173).
- AMD ROCm: AITER v0.1.23 (#56885, #58867), torch 2.13 y Triton 3.8 (#50605, #58006),
triton_kernels3.8 MXFP4 MoE para gpt-oss y DeepSeek-V4 (#55934), un segfault de host ROCR corregido (#57328); DeepSeek-V4/V4.1 HCA dual-stream (#56853) y solapamiento CSA2 consciente de capas (#57407), FP8wo_a(#54894), RoPE inverso fusionado en el reduce del decode disperso (#57435, #57451) que ahora emite MXFP8 para un GEMM agrupado FP8wo_a(#58456), GEMM MXFP8 sobre escalas nativas 32x32 en gfx950 (#58510), metadatos ragged top-k reutilizados (#57434), selección de bloques candidatos más rápida (#58208), tablas Engram en memoria del host (#57491) y tablas PLE de Qwen3.8-Flash-Next descargadas a la memoria del host (#57497), una ruta de decode ASM de AITER opcional para DCP + decodificación especulativa (#56861),get_top_tokens()en el borrador MTP de DeepSeek V4 (#57568), verificación adaptativa de DSpark (#52362),VLLM_DSV4_LOGITS_FIXpara logits de sparse-indexer en gfx950/gfx942 (#50455), una reversión de precisión de #56433 y #51692 (#57132), y errores claros para FSE con DPA+ETP (#57919); Kimi-K3 kernels FlyDSL a4w4 (#53940) conVLLM_ROCM_USE_AITER_MOE_SITUV2=a16w4|a8w4|a4w4(#58201), KDA especulativo de baja concurrencia (#58045), MoE latente particionado bajo EP (#54956) y menos copias de proyección (#50592); una ruta Hy4 de ROCm con torch.compile (13x menor latencia de decode, #57526); fusión QK-norm AITER de MiniMax-M3 (#54535), inserción K/V sin copias (#56849) y correcciones MXFP8 (#53674, #58089); correcciones de arranque de GLM-5.3-Flash (#57192, #57252, #57425); AITER QuickReduce + RMSNorm (#48249), AsyncTP BF16 (#58098), fusión estática de salida de atención FP8 (#58099), fusión QK-norm/RoPE/KV-cache para MRoPE (#50212), AITER GDN decode para diseños planos (#53623),wvSplitKpara GEMMs de salida única (#53283), 69 copias menos por paso de decode en la ruta GEMM estrecha (#58566), búsqueda de GEMM ajustada a través de AITER (#55001), un tile KV de prefill Triton más estrecho en RDNA3/RDNA4 (#58225), copias H2D grandes paginadas por etapas (#56343), y correcciones para el padding MXFP4 MoE que agotaba la caché KV (#56359), OOM de AITER MLA FP8 prefill (#57923), desescalados de caché sin cuantizar (#56726) y fallbacks de AITER MoE (#56590, #57866, #57426).VLLM_ROCM_USE_AITER_FP4_ASM_GEMMse restaura y queda desactivado por defecto (#57055); la reproducción acotada SWA está deshabilitada en ROCm (#57906). - Intel XPU: PyTorch 2.14 (#56013), XPU graphs activados por defecto (#51600), EPLB (#44987), MoE int8 W8A8 en Triton (#53162), invariancia por lotes (#55881), rotary embedding SYCL (#55721), QK RMSNorm + RoPE + gate fusionados (región de decode 55% más rápida, #56096), sampler de Model Runner V2 (#57277) y control de microbatch PP (#55145),
--device-idsrespetado (#56015), y desbordamiento de puntero de dispositivo corregido (#54514). - CPU: FP8 W8A8 lineal y MoE para Intel Diamond Rapids (#49942), paged attention de Arm hasta 25% más rápida (#56045), Zen DA8W4 int4 para capas densas y MoE (#54024), zentorch SDPA para atención de encoder (#54508) y MLA prefill (#54967), attention sinks FP32 (#56252), MoE W8A8 INT8 en POWER (#55316), Whisper W4A16 (#58268), wheels construidos en Ubuntu 22.04 (glibc 2.34) con AMX-FP8 (#58515), AVX10.2 condicionado a soporte del compilador (#58133), Triton CPU precompilado (#58140),
--device-memory-utilizationalias (#56547), vLLM Recipes en la imagen de CPU (#58796, #57306), pin de protobuf s390x (#54978) y torchcodec video (#58693), y correcciones para Ministral FP8 (#56985), pesos FP32 del router (#56168), fallos de importación de zentorch (#54923), SHM multimodal en macOS (#57142), afinidad de CPU por rango local (#53636) y el diseño de estado NIXL GDN (#53300).
Cuantización
- Humming: transformadas de Hadamard y cuantización online NVFP4/MXFP4/MXFP8 (#56685), wNaM asimétrico mediante compressed-tensors (#46528), humming-kernels 0.1.16 (#58054), y Humming en el oráculo MoE W4A8 (INT4xFP8) (#58427).
- Nuevas capacidades: exportaciones nativas Quark W4A16 INT4/UINT4 (#48606), descuantización MXFP4 en la carga opcional (#50814), backends MoE NVFP4 por token explícitos (#57176), y un diseño canónico N-first para MoE WNA16 de compressed-tensors (#52798).
- Correcciones: MXFP8 en capas por debajo de
mm_mxfp8límites de forma (#54223), escalas online NVFP4 al recargar (#57954), metadatos lineales del LM head (#58444), y la ruta de cuantización por bloques SiLU-mul fusionada que se omitía bajo un clamp SwiGLU (#57984).
API & Frontend
- Nuevas opciones y endpoints:
--tool-strict-level(#56268),response_formatcontool_choice=auto(#56086), completaciones FIM de DeepSeek-V4 (#44229),release_kv_cache_memory()yPOST /release_kv_cache_memory(#44890), puntuación de prefill de tokens fijos medianteprompt_logprob_token_ids(#54335), métricas de decodificación especulativa por solicitud en/inference/v1/generate(#43310), métricas por solicitud (#55084) ycache_write_tokens(#57222) en la API de Responses, Anthropicthinkingen/v1/messages(#58613), razonamiento y llamadas a herramientas en streaming desde el endpoint derender (#50550) con destokenización descargada (#57528),vllm chatsalida de thinking en streaming (#57045), registro de depuración del cuerpo de la solicitud con--enable-log-requests(#58163), y solo la línea de resumen de los docstrings de configuración en--help(#57357). - Salida estructurada y parsers: gramáticas Lark nativas en el backend xgrammar (#58321), XGrammar 0.2.7 (#57272), Granite migrado al Parser Engine de streaming (#49648), y correcciones para los límites de razonamiento (#56635), xgrammar choices con caracteres de control (#48115), JSON Schema de tipo lista (#48416),
structural_tagvacío (#47450), manejo de EOS en outlines (#58612, #57743), logprobs de streaming suprimidos por el parser (#58583), nombres de herramientas Inkling tras el razonamiento (#58792), y longitudfinish_reasonpara llamadas a herramientas en streaming truncadas (#46303). - Compatibilidad con OpenAI, Anthropic y Harmony: recuentos de tokens de razonamiento para Harmony, DeepSeek-V3 y Step3 (#58626) y por ronda de herramienta de Responses (#58927), Harmony
max_output_tokensen el bucle de herramientas (#58551), completaciones de chat por lotes usando las solicitudes ajustadas (#58929, #58958), un parser nuevo por elección (#58939), recuentos diferidos de razonamiento (#56067), limpieza de MCP de Responses (#56988) e imagendetailpor defecto (#57241), detección de sistema en línea de Anthropic (#58754) y pensamiento deshabilitado con P/D (#58786), cadenas de stop rechazadas en--tokens-onlyservidores (#57058),prompt_embedsno válidos que devuelven 400 (#55451, #57006), prompts acotados tras la expansión multimodal (#57076),--override-generation-configpenalizaciones (#50769), revisiones de Hub (#56092, #57461), logprobs completos en respuestas de token de entrada/token de salida (#58488), cancelación de puntuación generativa (#57729, #58788), pings de keepalive de gRPC (#55102), yrun-batchtranscripciones diarizadas (#57948). - Pooling: relleno de embeddings por fragmentos (#56505) y normalización (#57498), tokenización del reranker con límites de documentos (#57666), y cabezas de la familia BERT conservadas para logits crudos (#57664).
- Frontend de Rust:
--hf-overrides(#56931),--sse-keep-alive-interval(#58306), roles de chat personalizados (#58311), parsers de MiMo V2.5 (#57933), controles de razonamiento normalizados (#56998), gramáticas de salida propiedad del parser (#55269, #57340), máscaras de muestreo sobre gRPC (#56777), tamaño de DP local en metadatos de gRPC convllm-proto0.3.0 (#57116, #57233), un histograma de preempción por solicitud (#57033), histogramas sin bloqueos (#58574), contexto de visión de Nemotron-H (#57634), procesadores de visión propiedad del modelo (#58109), unmm-processorbenchmark (#51922, #58084, #58378), argumentos de serve no soportados reconocidos (#58330), los logprobs NaN ya no matan al cliente del motor (#51026), camposEngineCoreOutputañadidos aceptados (#56533), yvllm-rssobrePATHen la imagen CUDA (#57606). - Benchmarks: un
openai-responsesbackend paravllm bench serve(#54628) ymodel_iden el JSON de latencia/rendimiento (#58112).
Seguridad
- Por solicitud,
mm_processor_kwargsymedia_io_kwargsse rechazan por defecto; los despliegues confiables pueden activarlo con--trust-request-mm-kwargs(#58830). - Los hashes de bloques de caché de prefijo etiquetan las claves extra por fuente (#51899) e incluyen la ruta de LoRA (#59335); la entrada de hash multimodal está delimitada (#54283) y el hash incremental de bloques cubre cada característica superpuesta (#51694).
- Los payloads multimodales frescos tienen prioridad sobre una caché de receptor obsoleta (#57833), y los aciertos de caché del codificador con recuentos de embeddings no coincidentes se rechazan (#57696).
min_tokenspor encima delmax_tokensde relleno por defecto se rechaza en lugar de bloquear el motor (#57731); la sanitización de mensajes filtra direcciones de memoria en mayúsculas (#58832); los adaptadores LoRA nombrados como un modelo servido se rechazan (#59286).
Dependencias
- FlashInfer 0.7.0.post1 (#58069, #59323), Transformers 5.17.0 (#56108) con un límite superior en requirements (#59614), XGrammar 0.2.7 (#57272),
oss-harmonyreemplazandoopenai-harmony(#55128), actualización del pin del fork de DeepGEMM (#57218), actualización de FlashKDA (#58846) y humming-kernels 0.1.16 (#58054). - Las imágenes de CUDA 12 usan LMCache 0.4.4 y CuPy CUDA 12 (#57945); se publica una imagen de Docker Hub de zstd etiquetada por separado (
-x86_64-zstd) (#55608); imágenes nightly de Rubin CUDA 13.4 (#55953). - ROCm: AITER v0.1.23 (#58867), torch 2.13, Triton 3.8 (#50605, #58006), ROCR parcheado (#57328), pins de LMCache OpenTelemetry (#59056).
- XPU: PyTorch 2.14 (#56013). CPU: wheels compilados en Ubuntu 22.04 (#58515), Triton CPU precompilado (#58140).
Cambios incompatibles y obsolescencias
- Por solicitud
mm_processor_kwargsymedia_io_kwargsahora devuelven un error a menos que el servidor se inicie con--trust-request-mm-kwargs; a nivel de servidor,--mm-processor-kwargs/--media-io-kwargsy sin conexiónLLMno cambian (#58830). tokenizer_mode="slow"fue eliminado; ya se comportaba como"hf"bajo Transformers v5 (#58545).--enable-mamba-fine-grained-prefix-cachefue renombrado a--enable-mamba-shared-prefix-checkpoint(#57382).- La cuantización en línea a través de
quantization="fp8"ahora redirige a la abreviatura en líneafp8_per_tensor(#53585); la cuantización silenciosa MXFP4 en línea específica de Quark fue eliminada en favor de la API de cuantización en línea (#51800). - El backend GEMM AllSpark INT8 W8A16 fue eliminado (#58001). La opción
return_assistant_tokens_maskde/rendery el campo de respuestaassistant_tokens_maskfueron eliminados (#57520). VLLM_PLE_CPU_OFFLOADfue eliminado; use--engram-config(#57937).VLLM_XPU_ENABLE_XPU_GRAPHfue eliminado y los XPU graphs están activados por defecto (#51600).- Se eliminó la forma separada por comas de
--collect-detailed-traces; use la sintaxis de lista (#55702). - Nuevos valores por defecto:
--enforce-eagertambién desactiva el calentamiento de kernels JIT a menos que la tolerancia a fallos esté habilitada (#58197, #58593);VLLM_BATCH_INVARIANT=1usa CUDA graphs interrumpibles sin torch.compile (#57586) y desactiva el paralelismo de secuencia y async TP (#56377); la reproducción acotada SWA de DeepSeek-V4.1 está activada (#56227) excepto en ROCm (#57906); las tablas de host de Engram se comparten entre réplicas DP co-localizadas cuando es posible (#57651); FlashMLA mega attention es el valor por defecto para DeepSeek-V4.1 en SM100 (#56935); el GEMM ASM w4a4 de AITER está desactivado por defecto en ROCm (#57055). - Model Runner V1 + PP > 1 + planificación asíncrona + salida estructurada ahora se rechaza al inicio (#56250);
json_objectse rechaza en la validación con el backend outlines (#57743). transformersahora tiene un límite superior en los requisitos (#59614).
Nuevos colaboradores
- @0z5a hizo su primera contribución en https://github.com/vllm-project/vllm/pull/56441
- @200lz hizo su primera contribución en https://github.com/vllm-project/vllm/pull/55528
- @AARONKANG04 hizo su primera contribución en https://github.com/vllm-project/vllm/pull/48521
- @acsoto hizo su primera contribución en https://github.com/vllm-project/vllm/pull/57314
- @adenzhou1350 hizo su primera contribución en https://github.com/vllm-project/vllm/pull/56882
- @adtygan hizo su primera contribución en https://github.com/vllm-project/vllm/pull/56325
- @amasen02 hizo su primera contribución en https://github.com/vllm-project/vllm/pull/56576
- @amd-sriram hizo su primera contribución en https://github.com/vllm-project/vllm/pull/53792
- @andrewor14 hizo su primera contribución en https://github.com/vllm-project/vllm/pull/52956
- @Ankit-Jaiswal-AMD hizo su primera contribución en https://github.com/vllm-project/vllm/pull/56252
- @baljinderhothi-cohere hizo su primera contribución en https://github.com/vllm-project/vllm/pull/58792
- @BaoYunkai hizo su primera contribución en https://github.com/vllm-project/vllm/pull/57568
- @blipbyte hizo su primera contribución en https://github.com/vllm-project/vllm/pull/55612
- @BPbruce hizo su primera contribución en https://github.com/vllm-project/vllm/pull/46466
- @chuan932 hizo su primera contribución en https://github.com/vllm-project/vllm/pull/55330
- @coderfornow hizo su primera contribución en https://github.com/vllm-project/vllm/pull/54978
- @CZT0 hizo su primera contribución en https://github.com/vllm-project/vllm/pull/51694
- @devtyagi3909 hizo su primera contribución en https://github.com/vllm-project/vllm/pull/56635
- @dilberx hizo su primera contribución en https://github.com/vllm-project/vllm/pull/57076
- @divyvasal hizo su primera contribución en https://github.com/vllm-project/vllm/pull/49845
- @equiluxe hizo su primera contribución en https://github.com/vllm-project/vllm/pull/48115
- @errmakov hizo su primera contribución en https://github.com/vllm-project/vllm/pull/58583
- @farzad-elastix hizo su primera contribución en https://github.com/vllm-project/vllm/pull/56168
- @freyfwt hizo su primera contribución en https://github.com/vllm-project/vllm/pull/51367
- @garrett361 hizo su primera contribución en https://github.com/vllm-project/vllm/pull/57984
- @git-jxj hizo su primera contribución en https://github.com/vllm-project/vllm/pull/55702
- @gokay-ai hizo su primera contribución en https://github.com/vllm-project/vllm/pull/58292
- @gongwei-130 hizo su primera contribución en https://github.com/vllm-project/vllm/pull/55102
- @haosenwang1018 hizo su primera contribución en https://github.com/vllm-project/vllm/pull/58288
- @harshit-sarvam hizo su primera contribución en https://github.com/vllm-project/vllm/pull/56034
- @HieDean hizo su primera contribución en https://github.com/vllm-project/vllm/pull/57356
- @huthvincent hizo su primera contribución en https://github.com/vllm-project/vllm/pull/48419
- @i-m-aditya hizo su primera contribución en https://github.com/vllm-project/vllm/pull/57447
- @jayzuccarelli hizo su primera contribución en https://github.com/vllm-project/vllm/pull/58557
- @jiakangkangfuzhe hizo su primera contribución en https://github.com/vllm-project/vllm/pull/55146
- @jiangLLM hizo su primera contribución en https://github.com/vllm-project/vllm/pull/57487
- @jiaran-king hizo su primera contribución en https://github.com/vllm-project/vllm/pull/56242
- @jz-yolo hizo su primera contribución en https://github.com/vllm-project/vllm/pull/58884
- @kaijunli-infr hizo su primera contribución en https://github.com/vllm-project/vllm/pull/52101
- @karya0 hizo su primera contribución en https://github.com/vllm-project/vllm/pull/57453
- @KEYS-A15 hizo su primera contribución en https://github.com/vllm-project/vllm/pull/57528
- @kwen2501 hizo su primera contribución en https://github.com/vllm-project/vllm/pull/51520
- @laulopezreal hizo su primera contribución en https://github.com/vllm-project/vllm/pull/57189
- @lijipeng787 hizo su primera contribución en https://github.com/vllm-project/vllm/pull/58225
- @limitmhw hizo su primera contribución en https://github.com/vllm-project/vllm/pull/48606
- @linnea-lin-00638949 hizo su primera contribución en https://github.com/vllm-project/vllm/pull/47450
- @LinzeShi hizo su primera contribución en https://github.com/vllm-project/vllm/pull/57347
- @mahird3 hizo su primera contribución en https://github.com/vllm-project/vllm/pull/57708
- @melcheikh hizo su primera contribución en https://github.com/vllm-project/vllm/pull/48956
- @MichaelLapshin hizo su primera contribución en https://github.com/vllm-project/vllm/pull/57396
- @mjkvaak-amd hizo su primera contribución en https://github.com/vllm-project/vllm/pull/48249
- @mkunredd hizo su primera contribución en https://github.com/vllm-project/vllm/pull/58244
- @mmastrac hizo su primera contribución en https://github.com/vllm-project/vllm/pull/57414
- @mustafayildirim hizo su primera contribución en https://github.com/vllm-project/vllm/pull/57252
- @Navjot10 hizo su primera contribución en https://github.com/vllm-project/vllm/pull/55390
- @olka-amd hizo su primera contribución en https://github.com/vllm-project/vllm/pull/51065
- @PeganovAnton hizo su primera contribución en https://github.com/vllm-project/vllm/pull/55128
- @Rakul-Chauhan hizo su primera contribución en https://github.com/vllm-project/vllm/pull/54967
- @Ricardo-M-L hizo su primera contribución en https://github.com/vllm-project/vllm/pull/52580
- @Ronnie-Rui hizo su primera contribución en https://github.com/vllm-project/vllm/pull/54581
- @RyanMa29 hizo su primera contribución en https://github.com/vllm-project/vllm/pull/57295
- @sammaji hizo su primera contribución en https://github.com/vllm-project/vllm/pull/58626
- @sawsa307 hizo su primera contribución en https://github.com/vllm-project/vllm/pull/56497
- @ScarWar hizo su primera contribución en https://github.com/vllm-project/vllm/pull/49435
- @sdougbrown hizo su primera contribución en https://github.com/vllm-project/vllm/pull/49819
- @semerandre hizo su primera contribución en https://github.com/vllm-project/vllm/pull/55557
- @sergiofigueras hizo su primera contribución en https://github.com/vllm-project/vllm/pull/57948
- @shallow10 hizo su primera contribución en https://github.com/vllm-project/vllm/pull/58336
- @SIDDARTHAREDDY8 hizo su primera contribución en https://github.com/vllm-project/vllm/pull/57743
- @simpleqt hizo su primera contribución en https://github.com/vllm-project/vllm/pull/55936
- @tangzzycc hizo su primera contribución en https://github.com/vllm-project/vllm/pull/53283
- @touch869 hizo su primera contribución en https://github.com/vllm-project/vllm/pull/55844
- @tripathiarpan20 hizo su primera contribución en https://github.com/vllm-project/vllm/pull/57140
- @twu3202 hizo su primera contribución en https://github.com/vllm-project/vllm/pull/57769
- @ubwzwd hizo su primera contribución en https://github.com/vllm-project/vllm/pull/55931
- @UNIDY2002 hizo su primera contribución en https://github.com/vllm-project/vllm/pull/58370
- @valarLip hizo su primera contribución en https://github.com/vllm-project/vllm/pull/58659
- @vcave hizo su primera contribución en https://github.com/vllm-project/vllm/pull/51681
- @voidxb hizo su primera contribución en https://github.com/vllm-project/vllm/pull/49300
- @vorapolsiloai hizo su primera contribución en https://github.com/vllm-project/vllm/pull/50212
- @vschandramourya hizo su primera contribución en https://github.com/vllm-project/vllm/pull/58779
- @weitliao hizo su primera contribución en https://github.com/vllm-project/vllm/pull/54535
- @wenjinhust hizo su primera contribución en https://github.com/vllm-project/vllm/pull/51366
- @Willian-Zhang hizo su primera contribución en https://github.com/vllm-project/vllm/pull/58720
- @wtdcode hizo su primera contribución en https://github.com/vllm-project/vllm/pull/56268
- @xinnywinne hizo su primera contribución en https://github.com/vllm-project/vllm/pull/55084
- @YannikHinteregger hizo su primera contribución en https://github.com/vllm-project/vllm/pull/50047
- @YashasviChaurasia hizo su primera contribución en https://github.com/vllm-project/vllm/pull/58112
- @Yatimai hizo su primera contribución en https://github.com/vllm-project/vllm/pull/43462
- @YCH188 hizo su primera contribución en https://github.com/vllm-project/vllm/pull/57190
- @yousafshah hizo su primera contribución en https://github.com/vllm-project/vllm/pull/55957
- @ys2025-AI hizo su primera contribución en https://github.com/vllm-project/vllm/pull/56841
- @yuchenwang3 hizo su primera contribución en https://github.com/vllm-project/vllm/pull/54699
- @zhecfy hizo su primera contribución en https://github.com/vllm-project/vllm/pull/58316
- @Zoe923 hizo su primera contribución en https://github.com/vllm-project/vllm/pull/53864
- @Zyann7 hizo su primera contribución en https://github.com/vllm-project/vllm/pull/57784
Colaboradores
@AndreasKaratzas, @khluu, @mgoin, @njhill, @BugenZhao, @stefankoncarevic, @robertgshaw2-redhat, @taneem-ibrahim, @Thangnguyenvn98, @hmellor, @Juntian777, @WoosukKwon, @yewentao256, @gau-nernst, @mmastrac, @LucasWilkinson, @Fangzhou-Ai, @NickLucche, @aoshen02, @JaredforReal, @mawong-amd, @DarkLight1337, @zyongye, @sfeng33, @vllm-agent, @okorzh-amd, @ZJY0516, @shen-shanshan, @gty111, @Isotr0py, @djramic, @zixi-qi, @wzhao18, @alec-flowers, @aarushjain29, @Rohan138, @yma11, @mjkvaak-amd, @ivanium, @yisustc, @MatthewBonanni, @wangxiyuan, @reidliu41, @chaojun-zhang, @shaohuaxi, @gcanlin, @ganeshr10, @linitra24, @yzong-rh, @divakar-amd, @atalman, @ShuoleiWang, @simondanielsson, @rasmith, @chaunceyjiang, @micah-wil, @liusy58, @LioEinaudi, @louie-tsai, @LiuYinfeng01, @jeejeelee, @zhenwei-intel, @jperezdealgaba, @hlin99, @zxd1997066, @lucamotz, @lucifer1004, @eopXD, @ashraf-bhuiyan, @TheEpicDolphin, @JulienDarve, @mayuyuace, @danisereb, @bigPYJ1151, @Etelis, @JohnQinAMD, @jiangkuaixue123, @tianmu-li, @akii96, @vllmellm, @RyanMa29, @afriedri, @elvircrn, @mustafayildirim, @yuzhouo7, @wtdcode, @biswapanda, @adtygan, @hickeyma, @itayalroy, @jiangLLM, @Hotragn, @faaany, @xhx1022, @jinzhen-lin, @sheralskumar, @Wauplin, @matteso1, @wjabbour, @Sunt-ing, @arpera, @hclsys, @S1ro1, @HDCharles, @fxmarty-amd, @liuzijing2014, @UNIDY2002, @samuelkim7, @markmc, @errmakov, @zhejiangxiaomai, @KernelClint, @i-m-aditya, @ColinZ22, @ppalanga, @franciscojavierarceo, @maithilijoshi20, @mfylcek, @almersawi, @albertoperdomo2, @0z5a, @jacklin78911-collab, @lzhan011, @Alex-ai-future, @freyfwt, @ZhengGong-amd, @mindungil, @amasen02, @devtyagi3909, @wenjinhust, @jbyczkow, @AdaAibaby, @harshit-sarvam, @vineethsaivs, @tripathiarpan20, @sashko-zakharchuk, @semerandre, @rebklee, @git-jxj, @cjackal, @xinnywinne, @andrewor14, @kyleliang-nv, @thillai-c, @dongluw, @ChuanLi1101, @omerpaz95, @jiaran-king, @liuyao0322, @coderfornow, @drakosha, @laulopezreal, @melcheikh, @shantipriya-amd, @Rukhaiya2004, @yuchenwang3, @lxy-alexander, @tlrmchlsmth, @HieDean, @Zoe923, @YCH188, @amd-sriram, @andylolu2, @MicheleCampi, @sdougbrown, @vMaroon, @shimib, @andakai, @thegoldenflow, @Levius-Fubuki, @olka-amd, @limitmhw, @yuwenzho, @adenzhou1350, @Josephasafg, @kylesayrs, @jdebache, @kaijunli-infr, @afierka-intel, @frida-andersson, @bnellnm, @ys2025-AI, @waizuichougou, @touch869, @rjrock, @sawsa307, @pavelzak, @ScarWar, @fadara01, @Mi-Jiazhi, @dilberx, @mahird3, @Zyann7, @roikoren755, @YukioZzz, @Ronnie-Rui, @acsoto, @czhu-cohere, @twu3202, @oliverholworthy, @weitliao, @sergiofigueras, @tuukkjs, @Sip4818, @karen-sy, @garrett361, @GirasoleY, @Navjot10, @taking-lying-flat, @wangyicong52, @majunze2001, @gangula-karthik, @ubwzwd, @linnea-lin-00638949, @kushaldabbe, @Yatimai, @guanxingithub, @jiakangkangfuzhe, @MichaelLapshin, @jhu960213, @tpopp, @mganczarenko, @qiching, @tangzzycc, @lijipeng787, @nikhilkulkarni1755, @QwertyJack, @Ankit-Jaiswal-AMD, @vorapolsiloai, @Dao007forever, @BPbruce, @divyvasal, @simpleqt, @blipbyte, @jhaotingc, @karya0, @farzad-elastix, @grYe99, @talorabr, @jackLei0901, @Yejing-Lai, @Priyjain-amd, @KEYS-A15, @LinzeShi, @bohnstingl, @nightcityblade, @vcave, @AARONKANG04, @CZT0, @snadampal, @microslaw, @haosenwang1018, @netanel-haber, @khushali9, @sammaji, @SIDDARTHAREDDY8, @100milliongold, @gongwei-130, @fululi12, @mkunredd, @mrodden, @noooop, @valarLip, @shallow10, @200lz, @askliar, @chuan932, @Monishver11, @YashasviChaurasia, @gokay-ai, @jiacao-amd, @yousafshah, @positive666, @TQCB, @lk-chen, @Ricardo-M-L, @huthvincent, @baljinderhothi-cohere, @vschandramourya, @kwen2501, @xiao-llm, @zhecfy, @Willian-Zhang, @simon-veitner-redhat, @mevince, @voidxb, @hongxiayang, @YannikHinteregger, @V-3604, @Rakul-Chauhan, @frankwang28, @LCAIZJ, @PeganovAnton, @jz-yolo, @QHarshil, @R3hankhan123, @jayzuccarelli, @yannicks1, @BaoYunkai, @xaguilar-amd, @xiaohuguo2023, @wxsIcey, @harshaladhav-amd, @varun-sundar-rabindranath, @kliuae, @LostFox11