vLLM Releases

v0.31.0

# v0.31.0 ## 亮点 本次发布包含来自307位贡献者(96位新贡献者)的717个提交! * **DeepSeek-V4.1-Flash 性能**:带有 V4.1 NVFP4 压缩 KV 缓存的 FlashMLA 超级注意力现在是 SM100 的默认配置(#56935);用于索引器的 DeepGEMM 稀疏 MQA logits(#56254),以及将门控 GEMM 与专家选择融合的…

v0.31.0

要闻

本次发布包含来自307位贡献者(其中96位为新贡献者)的717次提交!

  • DeepSeek-V4.1-Flash 性能: FlashMLA mega attention 搭配 V4.1 NVFP4 压缩 KV cache 现已成为 SM100 默认设置(#56935);DeepGEMM 为 indexer 提供稀疏 MQA logits(#56254),以及 Mega-Gate 将门控 GEMM 与专家选择融合(#56266);decoder 边界融合了 TP all-reduce、mHC 输入准备(#57643)和 MoE finalize(#58586);在 SM100/SM103 上将小批量 WO-A 与逆 RoPE 和 MXFP8 量化融合(#58634);MXFP8 wo_b 与序列并行 reduce-scatter 融合的 GEMM(#57428);Engram wkv 在 TP rank 之间分片(#58678),Engram 宿主表默认在共置的 DP 副本之间共享(#57651);为视觉塔提供 encoder CUDA graphs(#56625);以及 SWA 有界重放,使滑动窗口 KV 不进入前缀缓存(#56227)。
  • 快速重启:新的 vllm preload CLI 启动权重缓存守护进程,使量化后的权重在引擎重启期间常驻 GPU 内存(#56680),现在支持数据并行(#57386)、MTP draft 模型(#57312)、一个 /health 端点(#58552)以及就绪等待(#58370)。实验性的已初始化引擎快照(vllm snapshot create/restore)使用 CRIU 来恢复一个完全初始化的 TP1 引擎(#51360)。
  • Model Runner V2 与投机解码:Model Runner V2 上的 draft 模型投机解码(#43091)和自定义 logits 处理器(#56497);新的 LiLiCorr drafter(#57934);DFlash 的异步调度(#58065),其上下文 K/V 预计算被捕获到 draft CUDA graph 中(#57632);面向 Gemma4 的 DSpark 自适应验证(#57263)以及面向 Kimi-K3 的可变长度解码(#52988);一个带非 DCP DSpark draft 的 DCP 目标(#56723);以及 MoE 内存现在在 MRV2 性能分析期间被计入,避免 WideEP 部署出现 OOM(#57270、#58411)。
  • 大规模服务:MoonEP balanced EP all2all 后端,通过 --all2all-backend moonep 的 MoonEP 均衡 EP all2all 后端(#52101)、支持数据并行的 prefill 上下文并行(#57075)、面向 SM100/SM103 的低 SM multimem reduce-scatter(#55072)、支持序列并行的 DeepEPv2(#57210)以及支持共享专家重叠的 EPLB(#57236)、面向 RL 的支持分片感知的 NCCL M2N 权重传输后端(#51520),以及 KV 卸载背压检测(#50045)。
  • 调度控制: --max-num-active-seqs 使 RUNNING 准入独立于 max_num_seqs (#56758), --long-prefill-token-threshold 进行控制,现在会根据等待中的 prefill 数量自适应调整,而不是对单个请求进行分块(#57951、#58459),等待队列被重构,使已持有 KV 块的请求优先被调度(#58947),并修复了 KV 压力下的 KV connector + MTP 死锁(#57104)。
  • HiSparse 加固:通过 union residency kernel 解析 MTP 验证行(#59235),修复 FULL graphs 下的 MTP acceptance collapse(#59309),不再允许没有宿主后备的 GPU 页(#59036),修复 chunked-prefill 抢占导致的活锁(#59494),KV cache 大小依据 HiSparse 分配的组来计算(#59450),以及宿主前缀发布与 GPU 前缀采纳的修复(#59007、#59282)。
  • 安全:除非设置了 mm_processor_kwargs ,否则每个请求的 media_io_kwargs 和 --trust-request-mm-kwargs 都会被拒绝(#58830);前缀缓存的额外键现在按来源打标签,因此 LoRA 名称与一个 cache_salt 不再可能冲突(#51899),并且 LoRA 路径成为块哈希的一部分(#59335);过期的多模态接收缓存条目不能再替换新的载荷(#57833)。
  • 破坏性变更:按请求的多模态 kwargs 已被门控 (#58830); tokenizer_mode="slow" 已移除 (#58545); --enable-mamba-fine-grained-prefix-cache 已重命名为 --enable-mamba-shared-prefix-checkpoint (#57382);通过以下方式进行的在线量化 quantization="fp8" 已被 fp8_per_tensor 简写形式取代 (#53585),并移除了 Quark 静默在线量化 (#51800);AllSpark INT8 W8A16 后端已移除 (#58001); --enforce-eager 现在也会禁用 JIT kernel 预热 (#58197);XPU graphs 默认启用,并已 VLLM_XPU_ENABLE_XPU_GRAPH 移除 (#51600)。

发布产物

Python Wheels

平台 安装
PyPI(CUDA 13.0) pip install vllm
PyPI(CUDA 13.0,uv) uv pip install vllm --torch-backend=auto
ROCm pip install vllm --extra-index-url https://wheels.vllm.ai/rocm/0.31.0/rocm723
XPU uv pip install vllm --extra-index-url https://wheels.vllm.ai/0.31.0/xpu --extra-index-url https://download.pytorch.org/whl/xpu --index-strategy unsafe-best-match

Docker 镜像

平台 Docker 镜像
CUDA 13.0(默认) docker pull vllm/vllm-openai:v0.31.0
CUDA 12.9 docker pull vllm/vllm-openai:v0.31.0-cu129
ROCm docker pull vllm/vllm-openai-rocm:v0.31.0
CPU docker pull vllm/vllm-openai-cpu:v0.31.0
XPU docker pull vllm/vllm-openai-xpu:v0.31.0

其他制品

预构建的发布制品可在本页面底部的 Assets 部分获取,包括: - 源码分发包 - 适用于 x86_64 和 arm64 的 CUDA 12.9 Python wheels - 适用于 x86_64 和 arm64 的 CUDA 13.0 Python wheels - 适用于 x86_64、arm64 和 macOS 的 CPU Python wheels - 适用于 x86_64 的 XPU Python wheel

模型支持

  • 新模型能力:DiffusionGemma 具有有界单 token 选项的结构化生成模式(#57250)、MiMo V2 MXFP4 MoE、BF16 MoE 路由器和 DFlash 草稿(#57784)、Cohere2MoE 用于 EAGLE3/DFlash 草稿器的辅助隐藏状态(#49819)、ROCm DeepSeek-V3.2 路径上的 GLM-5.2-MXFP4(#51915)、AMD-Quark 混合精度 DeepSeek-V4.1-Flash-MXFP4(#57071)和 GLM-5.3-Flash Quark MXFP4(#56176)检查点,以及内置的 granite_thinking_parser (适用于 Granite 4.2,#55957)。
  • DeepSeek-V4.1-Flash:FlashMLA mega attention 搭配作为 SM100 默认的 NVFP4 压缩 KV cache(#56935)、indexer 中的 DeepGEMM 稀疏 MQA logits(#56254)、Mega-Gate(#56266)、融合的 TP all-reduce + mHC 输入准备(#57643)并折叠了 MoE finalize(#58586)、融合的小批量 WO-A(#58634)、MXFP8 wo_b GEMM + reduce-scatter(#57428)、针对小 TP 批次的重叠 mHC 系数(#57603),仅限于 FULL CUDA graphs(#57874)、跨 TP 分片的 Engram wkv (#58678)、使用大页主机表的串行化 Engram 查找(#56926)、默认跨 DP 副本共享 Engram 表(#57651、#57914、#59068)、无需填充的原生共享专家 MegaMoE 融合(#56568、#57204)、更快的 MegaMoE staging 和 NVFP4 cache gathers(#57604)、恢复的融合查询 RMSNorm + MXFP8 路径(#57679)、仅 KV 的 DSpark context 插入(#56441)、视觉编码器 CUDA graphs(#56625、#58499)、SWA 有界重放(#56227)、恢复因果图像 SWA 以匹配参考实现(#57152)、更新的推理力度映射(#58316),以及针对 NaN 评分候选块(#57454)、DeepSelect 哨兵(#58215)、FlashInfer 上的 DSpark 非因果注意力(#57432)、偏移候选缓冲区的运行时 JIT(#57667)以及无需 Triton 的导入(#57654)的启动修复。
  • DeepSeek V4:FlashInfer 稀疏 MLA 搭配融合的逆 RoPE + FP8 量化(#58621)、堆叠的 DSpark context WKV 投影(#54674)、从 EP 组计算的融合 MoE 专家分布(#57465)、通过 suffix 进行的 FIM 补全(#44229)、解析工具调用中缺失的 string= (#56271)、附加到现有系统消息的请求工具(#51856)、保留的图像块间距(#56882),以及与 MTP 阶段验证分离的 DSpark 宽度(#54631)。
  • GLM-5.3-Flash:SM90 上可选择启用的 FlashAttention 和 FlashMLA 稀疏后端(#55385)、FlashInfer SM120 后端上的 NoPE 稀疏 MLA(#55277)、用于小解码批次的协作式 top-k(#57327)、按池化长度设定大小的 indexer 解码工作区(节省 3 GiB,#57701)、快 1.6-4.8 倍的元数据操作(#58450)、融合的 kpool 尾部槽映射(#57534)、通过共享调度器的 kpool top-k(#57546)、更低的稀疏 MLA 准备开销(#57458)、异步调度下 SM90 稀疏 MLA 计划中无 D2H 同步(#58684)、在长 prefill 期间将循环状态保持在 FP32 的 FlashKDA(#58846),以及针对投机解码下的 kpool 损坏(#58454)、SM90 index_kpool 不匹配(#58704)、kpool 尾部步长(#57477)、500k-token 提示(#57317)、序列并行下的稠密 MLP 层(#58061)、indexer top-k 后端选择(#58594)和 varlen 分页 MQA 启动(#55270)的正确性修复。
  • Qwen3.8-Flash-Next(Qwen4Exp):QSA 路径上的 FP8 主 KV cache(#55557)、搭配 FlashInfer TRTLLM MoE 的 FP8 TP(#55867)、SM90 QSA 调优(#57273)、融合的 HC down projection + SiLU(#58957)、更低的 PLE 元数据开销(#58114)、修复的 QSA indexer 工作区分片(#57105)、已释放的剖析 KV cache(#58961)、被排除在 CUDA graph 池之外的固定 PLE 预取 id(#58489),以及在 DGX Spark 上节省约 25 s 权重加载时间的索引专家映射查找(#58720)。
  • Kimi K3 与 MiniMax-M3:作为 GEMM 的 Kimi-K3 视觉补丁嵌入器(#58527)、融合的 KimiViT QK RoPE(最高 29 倍,#58651)、路由专家量化(#57430)、推理解析器(#57098)和推理 token 计数(#58372)修复、重新绑定后刷新的 DSpark context KV 指针(#58814)、不再被归类为解码的无状态首批块(#51483),以及不再因外部前缀命中而阻塞准入的 Mamba 块估计(#57050);MiniMax-M3 编码器 CUDA graphs(#58673)、 Conv3dLayer 补丁嵌入(约 62 倍,#58512)、 triton_mrope 在视觉塔中的改进(#58526)、融合了非单位缩放的 MiniMax2 路由(#58880),以及处理器修复(#58460、#59613)。
  • DiffusionGemma:单次采样器统计内核(#58226)、 diffusion_constrained 读取 logprob_token_ids (速度提升约 25%,#58216)、仅为 prefill 批次减少 logit 行数(#57416)、 logprob_token_ids 支持(#57417),以及针对并发 logprobs(#57414)、eager 回退 dtype(#57462)、多模态输入(#57589)、量化 LM 头(#48521)和 CPU 执行(#58964)的修复。
  • 多模态: Triton mm_input_norm kernel (#56798, #56711),DP 分片 ViT 路径中保留原始像素(#56872),Qwen2.5-VL 视频 fps 在时间 M-RoPE 中得到遵循(#47736),超过 30s 的 Whisper 和 Qwen2-Audio 音频片段(#57769, #56912),Mistral3 占位网格(#53758),Idefics3 不再拆分 patch(#48760),Ovis2.5 token(#52623),Aria 专家权重(#57487),MiMo-V2.5 融合 FP8 qkv_proj 分片(#57508),Gemma4 AutoWeightsLoader (#55911)和 buffer 标量(#54213),head dim 为 512 时 Gemma4 FP8 KV 配合 FA4(#53175),Laguna RoPE(#57189),Mistral-Large-3 精度回归(#57563),格式错误的 EXIF(#56527, #57234),JinaVL 标签(#57347),使用 FP32 路由器 logits 的 Sarvam MLA 路由(#56034),融合的 CohereASR 注意力分数(#55190),以及融合的 DFlash2 分组卷积(#55960)。
  • LoRA: Nemotron VL 语言模型(#56231)、ModernBert(#57148)、VoyageQwen3 嵌入(#57708)、RoBERTa 序列分类(#58884),以及 modules_to_save 带每个 adapter 的序列分类头(#53555) num_labels (#57766).

引擎核心

  • Model Runner V2:草稿模型投机解码(#43091),在准入时校验的自定义 logits 处理器(#56497,#57728),随机化的虚拟输入(#58411),profiling 期间路由到 MoE 专家的虚拟 token(#57270),为单 token prompt 尾部提供 FULL 解码图(#58400),共享的 token 到请求映射(#57102),以及跨 KV cache 组复用的 Mamba/GDN 元数据(#58762),仅编码器 ViT CUDA 图(#56922),权重卸载器(#57834)和池化模型(#57737)在关闭时释放,以及对 P/D 中多层 MTP KV(#55055)、带 LoRA 的 fast-prefill(#56456)、虚拟草稿步骤产生的过期 block-table 写入(#56734)、混合模型中填充的 prompt 尾部(#58434)、从未被提议的草稿槽位(#58784)、自动适配 max_model_len (#58149)以及 intermediate_tensors 捕获期间(#57745)的修复。
  • 投机解码:LiLiCorr 起草器(#57934)、DFlash 异步调度(#58065)和草稿 CUDA 图中的上下文 K/V(#57632)、Gemma4 DSpark 自适应验证(#57263)、Kimi-K3 可变长度自适应验证(#52988),为异构词表移除了 CPU-GPU 同步(#57396),在验收估计器中避免了 Triton 重新编译(#57107),以及对 EP 下 EAGLE/稠密草稿(#56930)、DFlash/DSpark profiling 批次(#56448)、GLM MTP 头内存(#55442)、带草稿的 prompt 嵌入(#57356)和 TritonMLA 因果多 token 解码(#51065)的修复。
  • 调度器: --max-num-active-seqs (#56758)、自适应 --long-prefill-token-threshold (#57951, #58459), skipped_waiting 被持有 KV 的等待队列取代(#58947)、 n > 1 请求的原子准入(#53936)、KV connector + MTP 死锁(#57104)、当 max_num_seqs 不是 8 的倍数时的吞吐量悬崖(#57355)、流式续写保留 logprobs 并刷新最大 token 数(#57447, #57676)、可恢复请求 + 异步调度竞态(#58259),以及非阻塞的结构化输出文法轮询(#55931)的修复。
  • 前缀缓存与混合模型:按来源标记的额外键(#51899)和对 LoRA 路径进行哈希(#59335), --enable-mamba-shared-prefix-checkpoint (#57382)、恢复了 MTP 下 prompt 尾部命中(#58368)、稀疏保留下保留 prompt 末端检查点(#59146)、align-mode 检查点预留(#59175)、无状态 GDN 首个 chunk(#51565)、在混合分组路径上标注 MTP 草稿 KV cache 组(#55390)、通用的 prefill 检查点构建器(#57783)、无需 GPU-CPU 同步的批量 Mamba2 prefill 状态保存(#49371)、 skip_reading_prefix_cache 对 connector 命中得到遵循(#57269)、增量多模态块哈希(#51694)、所有注意力后端都支持的 KV block size(#49845)以及更清晰的错误信息(#58557),还有 CacheConfig.effective_attention_block_size for DCP(#56538)。
  • 启动与内存:并行的 Triton 预热编译(#58582),在 --enforce-eager 下禁用 JIT 预热(#58197),除非启用了容错(#58593),复用 MoE 工作区的 DeepGEMM 预热(#57268),分配器碎片化不再在 profiling 期间缩小 KV cache(#58430),在 KV 大小计算之前预留稀疏 prefill 缓冲区(#57575),释放过期的 FlashMLA 工作区视图(#56902),DeepGEMM FP8 工作区减半(#53914),共享的 Marlin/Humming 工作区(#57421),FlashInfer BF16 MoE 权重就地转换(#54699),UniProc 启动线程受 CPU 配额限制(#58946),以及在 profiling 之前设置运行时线程(#55891)。
  • 内核:持久化 top-k 的采样过滤(#56346),Gumbel 采样的 Murmur3 RNG(#51367),寄存器驻留的每 token 组 8-bit 量化(#55330),向量化的每张量 FP8 abs-max(#58194),用于平台特定覆盖的 Triton 内核分发器(#43048), GateLinear 为所有 MoE 模型(#58234),在 TritonExperts 中跳过非本地专家槽位(#58051),模块化路径上延迟的 TRT-LLM-Gen top-k 完成(#58635),SM120 批次不变 matmul 配置(#57456),FlashInfer prefill 反量化暂存区受限制(#57918),以及对 Triton softcap NaN(#56579)、QuIP Hadamard 变换(#43462)、A100 上的 CUTLASS FP8 linear(#55884)、不支持 GPU 上的 FlashInfer 采样(#48956)、SM100 FP8 块级 scale 填充(#57377)、混合 FULL 图 prefill 捕获(#58275)Inductor 自定义算子模式匹配(#58189)、CuteDSL BF16 GDN prefill 在 Qwen3.5 上与 FLA 不一致(#53864)、SM100 的修复。 fp8_ds_mla 缓存扩展(#49435)、稀疏索引器中参差不齐的解码批次(#52500)、 allowed_token_ids 批次重排序后的过期掩码(#48419、#43931),以及 prompt_embeds 请求完成后仍被持有的张量(#57988)。
  • 批处理不变性:在默认情况下可在无 torch.compile 时中断的 CUDA graphs VLLM_BATCH_INVARIANT (#57586)、序列并行与异步 TP 默认禁用 (#56377)、NCCL 2.31 集合通信保持启用 (#58179)。
  • 睡眠与强化学习: release_kv_cache_memory() 仅释放 KV cache 内存 (#44890), --sleep-preserve-parameter-names 在 level-2 睡眠期间保留冻结权重 (#57891)、NCCL M2N 权重传输 (#51520)、按 DP 索引进行 dense DP 权重更新 (#56950)、切换 expandable segments 时保留分配器配置 (#57982),以及在睡眠期间传播 cache 重置失败 (#54581)。
  • 快速重启: vllm preload (#56680)、DP (#57386)、MTP drafts (#57312)、就绪等待 (#58370)、 /health (#58552)、ModelOpt MXFP8 预处理权重 (#57316),以及已初始化引擎的快照 (#51360)。
  • 日志与可观测性: LoggingConfig 通过 --logging-config 和 --log-level (#57205)、JSON 日志修复 (#57957, #58747)、修复启动日志抑制 (#51366)、统一的平台感知 torch profiling (#57460)、在有任何查询之前不再显示 0.0% 前缀 cache 命中率 (#54990)、KV transfer 指标格式化 (#57068)、基于模型 dtype 的 MFU 激活大小计算 (#57070)、平台可覆盖的环境变量检查 (#48599)、 VLLM_TARGET_DEVICE=empty pip install vllm 用于 out-of-tree 后端 (#41074),以及从源码安装时报告正确的 vLLM 版本 (#57295, #57744)。

大规模服务

  • MoE 通信:MoonEP 后端 (#52101)、支持序列并行的 DeepEPv2 (#57210) 与 EPLB + 共享专家重叠 (#57236)、低 SM multimem reduce-scatter (#55072)、Elastic EP 扩缩期间的 EPLB 负载统计 (#58473)、分组路由中跳过 SP 填充行从而 rank 0 不再是 prefill 掉队者 (#56079)、在不支持的单体后端上拒绝哈希路由 (#57867)、在 PP 下为离开引擎的请求跳过采样 token 广播 (#58542)、结合 DeepEP 低延迟 profiling 的 DBO (#57502)、副本共享节点的外部 LB (#53743),以及引擎握手期间不再有阻塞 RPC (#57226) 或无限制的 draft-token 等待 (#58779)。
  • 上下文并行:PCP 与 DP、EP 和 MTP (#57075)、具有非 DCP DSpark/DFlash drafts 的 DCP 目标 (#56723)、无需 CPU-GPU 同步的 DCP 序列长度 (#58169),以及跨 MLA cache 区域的 NIXL DCP 拉取 (#57389)。
  • KV connectors:面向 attention-HMA 的 NIXL 流水线并行 push prefill (#50494) 与 packed MLA 布局 (#50499)、将传输失败指标与 KV 过期分离 (#55854)、释放死对端状态而无需等待 TTL (#50047)、在带心跳的头之后回收过期租约 (#58292)、恢复 push 完成 (#58188)、记录 D 侧活动 (#52245);Mooncake CUSTOM_MEM_POOL (#49300)、HMA 下的请求级加载失败 (#56855, #57174) 以及 bootstrap 重试 (#58919);MoRIIO READ 模式下的混合 Mamba/KDA 状态 (#51052) 和多 decode 路由竞态 (#51681); prompt_tokens_details 中的 prefill cache 命中 (#54222);绑定在端口 0 的 KV-event 发布者 (#55844);为外部消费者恢复 KV cache 元数据 GET (#56925);partial-block KV 事件保留所有多模态特性 (#58288);在没有前向传播的步骤上完成保存 (#57775);abort 安全的 ExampleHiddenStatesConnector (#56841);DecodeBench FP8 填充 (#58472); KvHints 请求封装 (#53423);以及用于路由专家输出的 AuxOutput connector (#45635, #58150, #58205)。
  • KV 卸载:按请求的 max_load_tokens (#55885)、背压检测 (#50045)、 SimpleCPUOffloadConnector Prometheus 指标 (#57251)、跳过非前缀可缓存的 (#56810) 和临时 (scratch) (#57145) 组、多组 MLA 的复制布局 (#57652)、以分块方式注册 512 GiB 或更大的区域 (#51081)、在 SHM 分配前检查 cgroup 内存 (#54014),以及针对 cache 新近度 (#51787)、MTP 保留的滑动窗口 (#56709)、规范 MLA 行 (#56799)、事件元数据 (#57453) 和 ROCm 固定内存 (#57160) 的修复。
  • HiSparse:面向 MTP 行的 union residency kernel (#59235)、FULL graphs 下的 MTP 接受 (#59309)、基于主机的分配 (#59036)、抢占活锁 (#59494)、KV cache 大小计算 (#59450)、主机前缀发布 (#59007)、GPU 前缀采用 (#59282),以及 residency 指标 (#58725)。
  • 编码器分离 (EPD):带启动器托管注册的动态 EPD 代理(#54176)、按编码器批量处理的图像请求(#57095)、通过 Mooncake 的跨编码器缓存(#56242)、仅元数据的音频输入(#57887)、为…跳过语言模型分片 --mm-encoder-only (#58086)、EC 连接器指标(#54960),以及仅编码器修复(#58490、#58287、#57696)。

硬件与性能

  • NVIDIA:FlashInfer 0.7.0.post1(#58069、#59323)、包含 SM120 修复的 DeepGEMM 版本锁定提升(#57218)、Rubin CUDA 13.4 每夜构建镜像(#55953),以及支持 PyTorch 2.13 的 QuTLASS 构建(#58173)。
  • AMD ROCm: AITER v0.1.23(#56885、#58867),torch 2.13 和 Triton 3.8(#50605、#58006), triton_kernels 3.8 MXFP4 MoE 支持 gpt-oss 和 DeepSeek-V4(#55934),修复了一个 ROCR 主机端段错误(#57328);DeepSeek-V4/V4.1 HCA 双流(#56853)和层感知 CSA2 重叠(#57407),FP8 wo_a (#54894),将逆 RoPE 融合进稀疏解码归约(#57435、#57451),其现在可为分组的 FP8 输出 MXFP8 wo_a (#58456),gfx950 上基于原生 32x32 缩放因子的 MXFP8 GEMM(#58510),复用 top-k 不规则元数据(#57434),更快的候选块选择(#58208),位于主机内存的 Engram 表(#57491)以及卸载到主机内存的 Qwen3.8-Flash-Next PLE 表(#57497),针对 DCP + 投机解码的可选 AITER ASM 解码路径(#56861), get_top_tokens() 位于 DeepSeek V4 MTP drafter 上(#57568),DSpark 自适应验证(#52362),可选的 VLLM_DSV4_LOGITS_FIX 用于 gfx950/gfx942 上的 sparse-indexer logits(#50455),#56433 和 #51692 的精度回退(#57132),以及 DPA+ETP 下 FSE 的清晰错误提示(#57919);Kimi-K3 a4w4 FlyDSL 内核(#53940),附带 VLLM_ROCM_USE_AITER_MOE_SITUV2=a16w4|a8w4|a4w4 (#58201),低并发投机 KDA(#58045),EP 下的分片潜在 MoE(#54956)以及更少的投影拷贝(#50592);支持 torch.compile 的 ROCm Hy4 路径(解码延迟降低 13 倍,#57526);MiniMax-M3 AITER QK-norm 融合(#54535),免拷贝 K/V 插入(#56849)和 MXFP8 修复(#53674、#58089);GLM-5.3-Flash 启动修复(#57192、#57252、#57425);AITER QuickReduce + RMSNorm(#48249),BF16 AsyncTP(#58098),静态 FP8 注意力输出融合(#58099),MRoPE 的 QK-norm/RoPE/KV-cache 融合(#50212),支持扁平布局的 AITER GDN 解码(#53623), wvSplitK 用于单输出 GEMM(#53283),瘦 GEMM 路径上每个解码步骤减少 69 次拷贝(#58566),通过 AITER 调优的 GEMM 查找(#55001),RDNA3/RDNA4 上更窄的 Triton prefill KV tile(#58225),分阶段的大页化 H2D 拷贝(#56343),以及针对 MXFP4 MoE 填充耗尽 KV cache(#56359)、AITER MLA FP8 prefill OOM(#57923)、未量化缓存反缩放(#56726)和 AITER MoE 回退(#56590、#57866、#57426)的修复。 VLLM_ROCM_USE_AITER_FP4_ASM_GEMM 已恢复且默认关闭(#57055);SWA 有界回放在 ROCm 上被禁用(#57906)。
  • Intel XPU: PyTorch 2.14(#56013),默认启用的 XPU graphs(#51600),EPLB(#44987),Triton 上的 int8 W8A8 MoE(#53162),批不变性(#55881),SYCL 旋转位置编码(#55721),融合的 QK RMSNorm + RoPE + gate(解码区域快 55%,#56096),Model Runner V2 采样器(#57277)和 PP 微批次控制(#55145), --device-ids 被遵循(#56015),并修复了设备指针溢出(#54514)。
  • CPU: Intel Diamond Rapids 的 FP8 W8A8 linear 和 MoE(#49942),Arm paged attention 快最多 25%(#56045),用于 dense 和 MoE 层的 Zen DA8W4 int4(#54024),用于编码器注意力(#54508)和 MLA prefill(#54967)的 zentorch SDPA,FP32 attention sinks(#56252),POWER 上的 W8A8 INT8 MoE(#55316),W4A16 Whisper(#58268),在 Ubuntu 22.04(glibc 2.34)上构建并带 AMX-FP8 的 wheels(#58515),根据编译器支持启用的 AVX10.2(#58133),预构建的 Triton CPU(#58140), --device-memory-utilization 别名(#56547),CPU 镜像中的 vLLM Recipes(#58796、#57306),s390x protobuf 固定版本(#54978)和 torchcodec 视频(#58693),以及针对 Ministral FP8(#56985)、FP32 路由器权重(#56168)、zentorch 导入失败(#54923)、macOS 多模态 SHM(#57142)、每个本地 rank 的 CPU 亲和性(#53636)和 NIXL GDN 状态布局(#53300)的修复。

量化

  • Humming: Hadamard 变换和 NVFP4/MXFP4/MXFP8 在线量化(#56685),通过 compressed-tensors 的非对称 wNaM(#46528),humming-kernels 0.1.16(#58054),以及 W4A8(INT4xFP8)MoE oracle 中的 Humming(#58427)。
  • 新功能: 原生 Quark W4A16 INT4/UINT4 导出(#48606),可选的加载时 MXFP4 反量化(#50814),显式的 per-token NVFP4 MoE 后端(#57176),以及 compressed-tensors WNA16 MoE 的规范 N 优先布局(#52798)。
  • 修复: 低于以下层的 MXFP8 mm_mxfp8 形状限制(#54223),重新加载时的在线 NVFP4 缩放因子(#57954),LM head linear 元数据(#58444),以及在 SwiGLU clamp 下跳过融合 SiLU-mul 块量化路径(#57984)。

API & 前端

  • 新选项与端点: --tool-strict-level (#56268), response_format 配合 tool_choice=auto (#56086),DeepSeek-V4 FIM 补全(#44229), release_kv_cache_memory() 以及 POST /release_kv_cache_memory (#44890),通过以下方式进行的固定 token prefill 评分 prompt_logprob_token_ids (#54335),在以下位置提供的每请求投机解码指标 /inference/v1/generate (#43310),每请求指标(#55084)和 cache_write_tokens Responses API 中的 (#57222),Anthropic thinking 在 /v1/messages (#58613)、derender 端点的流式推理和工具调用(#50550)以及卸载的 detokenization(#57528), vllm chat 流式思考输出(#57045)、请求体调试日志,包含 --enable-log-requests (#58163),以及配置文档字符串中仅保留摘要行,位于 --help (#57357).
  • 结构化输出和解析器:xgrammar 后端中的原生 Lark 语法(#58321)、XGrammar 0.2.7(#57272)、Granite 迁移至流式 Parser Engine(#49648),以及针对推理边界(#56635)、含控制字符的 xgrammar choices(#48115)、列表类型 JSON Schema(#48416)、空 structural_tag (#47450)、outlines EOS 处理(#58612, #57743)、被解析器抑制的流式 logprobs(#58583)、推理后的 Inkling 工具名称(#58792)以及长度的修复 finish_reason 针对被截断的流式工具调用(#46303)。
  • OpenAI、Anthropic 与 Harmony 兼容性: Harmony、DeepSeek-V3 和 Step3 的推理 token 计数(#58626)以及每个 Responses 工具轮次的计数(#58927),Harmony max_output_tokens tool 循环中的优化 (#58551)、使用调整后请求的批量聊天补全 (#58929, #58958)、每个 choice 使用全新解析器 (#58939)、延迟的推理重述 (#56067)、Responses MCP 清理 (#56988) 以及图像 detail default (#57241)、Anthropic inline system detection (#58754) 以及使用 P/D 时禁用 thinking (#58786),stop strings 在 --tokens-only servers 上被拒绝 (#57058),无效的 prompt_embeds 返回 400 (#55451, #57006),多模态扩展后的 prompt 有界 (#57076), --override-generation-config penalties (#50769)、Hub revisions (#56092, #57461)、token-in/token-out 响应中的完整 logprobs (#58488)、生成式评分取消 (#57729, #58788)、gRPC keepalive pings (#55102),以及 run-batch diarized transcriptions (#57948)。
  • Pooling:分块 embedding padding (#56505) 和 normalization (#57498)、带文档限制的 reranker 分词 (#57666),以及为原始 logits 保留的 BERT 系列 heads (#57664)。
  • Rust frontend: --hf-overrides (#56931), --sse-keep-alive-interval (#58306)、自定义 chat roles (#58311)、MiMo V2.5 parsers (#57933)、标准化的 reasoning controls (#56998)、parser 持有的 output grammars (#55269, #57340)、基于 gRPC 的 sampling masks (#56777)、gRPC 元数据中的本地 DP 大小(需 vllm-proto 0.3.0 (#57116, #57233))、每请求 preemption 直方图 (#57033)、无锁直方图 (#58574)、Nemotron-H 视觉上下文 (#57634)、模型持有的 vision processors (#58109)、一个 mm-processor benchmark (#51922, #58084, #58378)、可识别的不受支持的 serve args (#58330)、NaN logprobs 不再导致 engine client 崩溃 (#51026)、接受追加的 EngineCoreOutput fields (#56533),以及 vllm-rs 在 PATH CUDA 镜像中 (#57606)。
  • Benchmarks:一个 openai-responses backend 用于 vllm bench serve (#54628),以及 model_id 包含在 latency/throughput JSON 中 (#58112)。

Security

  • Per-request mm_processor_kwargs 和 media_io_kwargs 默认被拒绝;受信任的部署可通过 --trust-request-mm-kwargs (#58830).
  • 选择启用。Prefix-cache block hashes 按来源标记 extra keys (#51899),并包含 LoRA 路径 (#59335);multimodal hash 输入被框定 (#54283),增量 block hashing 覆盖每个重叠的 feature (#51694)。
  • 新的 multimodal 负载优先于过期的接收方缓存 (#57833),embedding 数量不匹配的 encoder-cache 命中会被拒绝 (#57696)。
  • min_tokens 高于已填充的 max_tokens 默认值会被拒绝,而不是使 engine 卡死 (#57731);消息清理会过滤大写内存地址 (#58832);以已服务的模型命名的 LoRA adapters 会被拒绝 (#59286)。

Dependencies

  • FlashInfer 0.7.0.post1 (#58069, #59323)、Transformers 5.17.0 (#56108) 并在 requirements 中设置上界 (#59614)、XGrammar 0.2.7 (#57272), oss-harmony 替换 openai-harmony (#55128)、DeepGEMM fork pin bump (#57218)、FlashKDA bump (#58846)以及 humming-kernels 0.1.16 (#58054)。
  • CUDA 12 镜像使用 LMCache 0.4.4 和 CuPy CUDA 12(#57945);另一个单独标记的 zstd Docker Hub 镜像(-x86_64-zstd)已发布(#55608);Rubin CUDA 13.4 nightly 镜像(#55953)。
  • ROCm:AITER v0.1.23(#58867)、torch 2.13、Triton 3.8(#50605、#58006)、打过补丁的 ROCR(#57328)、LMCache OpenTelemetry 固定版本(#59056)。
  • XPU:PyTorch 2.14(#56013)。CPU:基于 Ubuntu 22.04 构建的 wheel(#58515)、预构建的 Triton CPU(#58140)。

破坏性变更与弃用

  • 按请求计费 mm_processor_kwargs 以及 media_io_kwargs 现在会返回错误,除非服务器启动时使用 --trust-request-mm-kwargs; 服务器级 --mm-processor-kwargs / --media-io-kwargs 以及线下 LLM 保持不变(#58830)。
  • tokenizer_mode="slow" 已被移除;它的表现本来就像 "hf" 在 Transformers v5 下(#58545)。
  • --enable-mamba-fine-grained-prefix-cache 被重命名为 --enable-mamba-shared-prefix-checkpoint (#57382).
  • 通过在线量化 quantization="fp8" 现在重定向到 fp8_per_tensor 在线简写 (#53585);Quark 特有的静默在线 MXFP4 量化已被移除,改为使用在线量化 API (#51800)。
  • AllSpark INT8 W8A16 GEMM 后端已被移除(#58001)。 return_assistant_tokens_mask ……的选项 /render 以及 assistant_tokens_mask response 字段已被移除(#57520)。
  • VLLM_PLE_CPU_OFFLOAD 已被移除;请使用 --engram-config (#57937). VLLM_XPU_ENABLE_XPU_GRAPH 已被移除,且 XPU graphs 默认开启(#51600)。
  • 的逗号分隔形式 --collect-detailed-traces 已被移除;请使用列表语法(#55702)。
  • 新默认值: --enforce-eager 同时禁用 JIT kernel warmup,除非启用了容错(fault tolerance)(#58197, #58593); VLLM_BATCH_INVARIANT=1 在不使用 torch.compile 的情况下使用可中断的 CUDA graphs(#57586),并禁用 sequence parallelism 和 async TP(#56377);DeepSeek-V4.1 SWA bounded replay 已开启(#56227),但 ROCm 除外(#57906);在可能的情况下,Engram host tables 在共置的 DP 副本之间共享(#57651);FlashMLA mega attention 是 SM100 上 DeepSeek-V4.1 的默认选项(#56935);AITER w4a4 ASM GEMM 在 ROCm 上默认关闭(#57055)。
  • Model Runner V1 + PP > 1 + async scheduling + structured output 现在会在启动时被拒绝(#56250); json_object 会在验证时被 outlines 后端拒绝(#57743)。
  • transformers 现在在需求上有上限 (#59614)。

新贡献者

  • @0z5a 在 https://github.com/vllm-project/vllm/pull/56441 完成了他们的首次贡献
  • @200lz 在 https://github.com/vllm-project/vllm/pull/55528 完成了他们的首次贡献
  • @AARONKANG04 在 https://github.com/vllm-project/vllm/pull/48521 完成了他们的首次贡献
  • @acsoto 在 https://github.com/vllm-project/vllm/pull/57314 完成了他们的首次贡献
  • @adenzhou1350 在 https://github.com/vllm-project/vllm/pull/56882 完成了他们的首次贡献
  • @adtygan 在 https://github.com/vllm-project/vllm/pull/56325 完成了他们的首次贡献
  • @amasen02 在 https://github.com/vllm-project/vllm/pull/56576 完成了他们的首次贡献
  • @amd-sriram 在 https://github.com/vllm-project/vllm/pull/53792 完成了他们的首次贡献
  • @andrewor14 在 https://github.com/vllm-project/vllm/pull/52956 完成了他们的首次贡献
  • @Ankit-Jaiswal-AMD 在 https://github.com/vllm-project/vllm/pull/56252 完成了他们的首次贡献
  • @baljinderhothi-cohere 在 https://github.com/vllm-project/vllm/pull/58792 完成了他们的首次贡献
  • @BaoYunkai 在 https://github.com/vllm-project/vllm/pull/57568 完成了他们的首次贡献
  • @blipbyte 在 https://github.com/vllm-project/vllm/pull/55612 完成了他们的首次贡献
  • @BPbruce 在 https://github.com/vllm-project/vllm/pull/46466 完成了他们的首次贡献
  • @chuan932 在 https://github.com/vllm-project/vllm/pull/55330 完成了他们的首次贡献
  • @coderfornow 在 https://github.com/vllm-project/vllm/pull/54978 完成了他们的首次贡献
  • @CZT0 在 https://github.com/vllm-project/vllm/pull/51694 完成了他们的首次贡献
  • @devtyagi3909 在 https://github.com/vllm-project/vllm/pull/56635 完成了他们的首次贡献
  • @dilberx 在 https://github.com/vllm-project/vllm/pull/57076 完成了他们的首次贡献
  • @divyvasal 在 https://github.com/vllm-project/vllm/pull/49845 完成了他们的首次贡献
  • @equiluxe 在 https://github.com/vllm-project/vllm/pull/48115 完成了他们的首次贡献
  • @errmakov 在 https://github.com/vllm-project/vllm/pull/58583 完成了他们的首次贡献
  • @farzad-elastix 在 https://github.com/vllm-project/vllm/pull/56168 完成了他们的首次贡献
  • @freyfwt 在 https://github.com/vllm-project/vllm/pull/51367 完成了他们的首次贡献
  • @garrett361 在 https://github.com/vllm-project/vllm/pull/57984 完成了他们的首次贡献
  • @git-jxj 在 https://github.com/vllm-project/vllm/pull/55702 完成了他们的首次贡献
  • @gokay-ai 在 https://github.com/vllm-project/vllm/pull/58292 完成了他们的首次贡献
  • @gongwei-130 在 https://github.com/vllm-project/vllm/pull/55102 完成了他们的首次贡献
  • @haosenwang1018 在 https://github.com/vllm-project/vllm/pull/58288 完成了他们的首次贡献
  • @harshit-sarvam 在 https://github.com/vllm-project/vllm/pull/56034 完成了他们的首次贡献
  • @HieDean 在 https://github.com/vllm-project/vllm/pull/57356 完成了他们的首次贡献
  • @huthvincent 在 https://github.com/vllm-project/vllm/pull/48419 完成了他们的首次贡献
  • @i-m-aditya 在 https://github.com/vllm-project/vllm/pull/57447 完成了他们的首次贡献
  • @jayzuccarelli 在 https://github.com/vllm-project/vllm/pull/58557 完成了他们的首次贡献
  • @jiakangkangfuzhe 在 https://github.com/vllm-project/vllm/pull/55146 完成了他们的首次贡献
  • @jiangLLM 在 https://github.com/vllm-project/vllm/pull/57487 完成了他们的首次贡献
  • @jiaran-king 在 https://github.com/vllm-project/vllm/pull/56242 完成了他们的首次贡献
  • @jz-yolo 在 https://github.com/vllm-project/vllm/pull/58884 完成了他们的首次贡献
  • @kaijunli-infr 在 https://github.com/vllm-project/vllm/pull/52101 完成了他们的首次贡献
  • @karya0 在 https://github.com/vllm-project/vllm/pull/57453 完成了他们的首次贡献
  • @KEYS-A15 在 https://github.com/vllm-project/vllm/pull/57528 完成了他们的首次贡献
  • @kwen2501 在 https://github.com/vllm-project/vllm/pull/51520 完成了他们的首次贡献
  • @laulopezreal 在 https://github.com/vllm-project/vllm/pull/57189 完成了他们的首次贡献
  • @lijipeng787 在 https://github.com/vllm-project/vllm/pull/58225 完成了他们的首次贡献
  • @limitmhw 在 https://github.com/vllm-project/vllm/pull/48606 完成了他们的首次贡献
  • @linnea-lin-00638949 在 https://github.com/vllm-project/vllm/pull/47450 完成了他们的首次贡献
  • @LinzeShi 在 https://github.com/vllm-project/vllm/pull/57347 完成了他们的首次贡献
  • @mahird3 在 https://github.com/vllm-project/vllm/pull/57708 完成了他们的首次贡献
  • @melcheikh 在 https://github.com/vllm-project/vllm/pull/48956 完成了他们的首次贡献
  • @MichaelLapshin 在 https://github.com/vllm-project/vllm/pull/57396 完成了他们的首次贡献
  • @mjkvaak-amd 在 https://github.com/vllm-project/vllm/pull/48249 完成了他们的首次贡献
  • @mkunredd 在 https://github.com/vllm-project/vllm/pull/58244 完成了他们的首次贡献
  • @mmastrac 在 https://github.com/vllm-project/vllm/pull/57414 完成了他们的首次贡献
  • @mustafayildirim 在 https://github.com/vllm-project/vllm/pull/57252 完成了他们的首次贡献
  • @Navjot10 在 https://github.com/vllm-project/vllm/pull/55390 完成了他们的首次贡献
  • @olka-amd 在 https://github.com/vllm-project/vllm/pull/51065 完成了他们的首次贡献
  • @PeganovAnton 在 https://github.com/vllm-project/vllm/pull/55128 完成了他们的首次贡献
  • @Rakul-Chauhan 在 https://github.com/vllm-project/vllm/pull/54967 完成了他们的首次贡献
  • @Ricardo-M-L 在 https://github.com/vllm-project/vllm/pull/52580 完成了他们的首次贡献
  • @Ronnie-Rui 在 https://github.com/vllm-project/vllm/pull/54581 完成了他们的首次贡献
  • @RyanMa29 在 https://github.com/vllm-project/vllm/pull/57295 完成了他们的首次贡献
  • @sammaji 在 https://github.com/vllm-project/vllm/pull/58626 完成了他们的首次贡献
  • @sawsa307 在 https://github.com/vllm-project/vllm/pull/56497 完成了他们的首次贡献
  • @ScarWar 在 https://github.com/vllm-project/vllm/pull/49435 完成了他们的首次贡献
  • @sdougbrown 在 https://github.com/vllm-project/vllm/pull/49819 完成了他们的首次贡献
  • @semerandre 在 https://github.com/vllm-project/vllm/pull/55557 完成了他们的首次贡献
  • @sergiofigueras 在 https://github.com/vllm-project/vllm/pull/57948 完成了他们的首次贡献
  • @shallow10 在 https://github.com/vllm-project/vllm/pull/58336 完成了他们的首次贡献
  • @SIDDARTHAREDDY8 在 https://github.com/vllm-project/vllm/pull/57743 完成了他们的首次贡献
  • @simpleqt 在 https://github.com/vllm-project/vllm/pull/55936 完成了他们的首次贡献
  • @tangzzycc 在 https://github.com/vllm-project/vllm/pull/53283 完成了他们的首次贡献
  • @touch869 在 https://github.com/vllm-project/vllm/pull/55844 完成了他们的首次贡献
  • @tripathiarpan20 在 https://github.com/vllm-project/vllm/pull/57140 完成了他们的首次贡献
  • @twu3202 在 https://github.com/vllm-project/vllm/pull/57769 完成了他们的首次贡献
  • @ubwzwd 在 https://github.com/vllm-project/vllm/pull/55931 完成了他们的首次贡献
  • @UNIDY2002 在 https://github.com/vllm-project/vllm/pull/58370 完成了他们的首次贡献
  • @valarLip 在 https://github.com/vllm-project/vllm/pull/58659 完成了他们的首次贡献
  • @vcave 在 https://github.com/vllm-project/vllm/pull/51681 完成了他们的首次贡献
  • @voidxb 在 https://github.com/vllm-project/vllm/pull/49300 完成了他们的首次贡献
  • @vorapolsiloai 在 https://github.com/vllm-project/vllm/pull/50212 完成了他们的首次贡献
  • @vschandramourya 在 https://github.com/vllm-project/vllm/pull/58779 完成了他们的首次贡献
  • @weitliao 在 https://github.com/vllm-project/vllm/pull/54535 完成了他们的首次贡献
  • @wenjinhust 在 https://github.com/vllm-project/vllm/pull/51366 完成了他们的首次贡献
  • @Willian-Zhang 在 https://github.com/vllm-project/vllm/pull/58720 完成了他们的首次贡献
  • @wtdcode 在 https://github.com/vllm-project/vllm/pull/56268 完成了他们的首次贡献
  • @xinnywinne 在 https://github.com/vllm-project/vllm/pull/55084 完成了他们的首次贡献
  • @YannikHinteregger 在 https://github.com/vllm-project/vllm/pull/50047 完成了他们的首次贡献
  • @YashasviChaurasia 在 https://github.com/vllm-project/vllm/pull/58112 完成了他们的首次贡献
  • @Yatimai 在 https://github.com/vllm-project/vllm/pull/43462 完成了他们的首次贡献
  • @YCH188 在 https://github.com/vllm-project/vllm/pull/57190 完成了他们的首次贡献
  • @yousafshah 在 https://github.com/vllm-project/vllm/pull/55957 完成了他们的首次贡献
  • @ys2025-AI 在 https://github.com/vllm-project/vllm/pull/56841 完成了他们的首次贡献
  • @yuchenwang3 在 https://github.com/vllm-project/vllm/pull/54699 完成了他们的首次贡献
  • @zhecfy 在 https://github.com/vllm-project/vllm/pull/58316 完成了他们的首次贡献
  • @Zoe923 在 https://github.com/vllm-project/vllm/pull/53864 完成了他们的首次贡献
  • @Zyann7 在 https://github.com/vllm-project/vllm/pull/57784 完成了他们的首次贡献

贡献者

提及:@AndreasKaratzas, @khluu, @mgoin, @njhill, @BugenZhao, @stefankoncarevic, @robertgshaw2-redhat, @taneem-ibrahim, @Thangnguyenvn98, @hmellor, @Juntian777, @WoosukKwon, @yewtao256, @gau-nernst, @mmastrac, @LucasWilkinson, @Fangzhou-Ai, @NickLucche, @aoshen02, @JaredforReal, @mawong-amd, @DarkLight1337, @zyongye, @sfeng33, @vllm-agent, @okorzh-amd, @ZJY0516, @shen-shanshan, @gty111, @Isotr0py, @djramic, @zixi-qi, @wzhao18, @alec-flowers, @aarushjain29, @Rohan138, @yma11, @mjkvaak-amd, @ivanium, @yisustc, @MatthewBonanni, @wangxiyuan, @reidliu41, @chaojun-zhang, @shaohuaxi, @gcanlin, @ganeshr10, @linitra24, @yzong-rh, @divakar-amd, @atalman, @ShuoleiWang, @simondanielsson, @rasmith, @chaunceyjiang, @micah-wil, @liusy58, @LioEinaudi, @louie-tsai, @LiuYinfeng01, @jeejeelee, @zhenwei-intel, @jperezdealgaba, @hlin99, @zxd1997066, @lucamotz, @lucifer1004, @eopXD, @ashraf-bhuiyan, @TheEpicDolphin, @JulienDarve, @mayuyuace, @danisereb, @bigPYJ1151, @Etelis, @JohnQinAMD, @jiangkuaixue123, @tianmu-li, @akii96, @vllmellm, @RyanMa29, @afriedri, @elvircrn, @mustafayildirim, @yuzhouo7, @wtdcode, @biswapanda, @adtygan, @hickeyma, @itayalroy, @jiangLLM, @Hotragn, @faaany, @xhx1022, @jinzhen-lin, @sheralskumar, @Wauplin, @matteso1, @wjabbour, @Sunt-ing, @arpera, @hclsys, @S1ro1, @HDCharles, @fxmarty-amd, @liuzijing2014, @UNIDY2002, @samuelkim7, @markmc, @errmakov, @zhejiangxiaomai, @KernelClint, @i-m-aditya, @ColinZ22, @ppalanga, @franciscojavierarceo, @maithilijoshi20, @mfylcek, @almersawi, @albertoperdomo2, @0z5a, @jacklin78911-collab, @lzhan011, @Alex-ai-future, @freyfwt, @ZhengGong-amd, @mindungil, @amasen02, @devtyagi3909, @wenjinhust, @jbyczkow, @AdaAibaby, @harshit-sarvam, @vineethsaivs, @tripathiarpan20, @sashko-zakharchuk, @semerandre, @rebklee, @git-jxj, @cjackal, @xinnywinne, @andrewor14, @kyleliang-nv, @thillai-c, @dongluw, @ChuanLi1101, @omerpaz95, @jiaran-king, @liuyao0322, @coderfornow, @drakosha, @laulopezreal, @melcheikh, @shantipriya-amd, @Rukhaiya2004, 提及:@yuchenwang3, @lxy-alexander, @tlrmchlsmth, @HieDean, @Zoe923, @YCH188, @amd-sriram, @andylolu2, @MicheleCampi, @sdougbrown, @vMaroon, @shimib, @andakai, @thegoldenflow, @Levius-Fubuki, @olka-amd, @limitmhw, @yuwenzho, @adenzhou1350, @Josephasafg, @kylesayrs, @jdebache, @kaijunli-infr, @afierka-intel, @frida-andersson, @bnellnm, @ys2025-AI, @waizuichougou, @touch869, @rjrock, @sawsa307, @pavelzak, @ScarWar, @fadara01, @Mi-Jiazhi, @dilberx, @mahird3, @Zyann7, @roikoren755, @YukioZzz, @Ronnie-Rui, @acsoto, @czhu-cohere, @twu3202, @oliverholworthy, @weitliao, @sergiofigueras, @tuukkjs, @Sip4818, @karen-sy, @garrett361, @GirasoleY, @Navjot10, @taking-lying-flat, @wangyicong52, @majunze2001, @gangula-karthik, @ubwzwd, @linnea-lin-00638949, @kushaldabbe, @Yatimai, @guanxingithub, @jiakangkangfuzhe, @MichaelLapshin, @jhu960213, @tpopp, @mganczarenko, @qiching, @tangzzycc, @lijipeng787, @nikhilkulkarni1755, @QwertyJack, @Ankit-Jaiswal-AMD, @vorapolsiloai, @Dao007forever, @BPbruce, @divyvasal, @simpleqt, @blipbyte, @jhaotingc, @karya0, @farzad-elastix, @grYe99, @talorabr, @jackLei0901, @Yejing-Lai, @Priyjain-amd, @KEYS-A15, @LinzeShi, @bohnstingl, @nightcityblade, @vcave, @AARONKANG04, @CZT0, @snadampal, @microslaw, @haosenwang1018, @netanel-haber, @khushali9, @sammaji, @SIDDARTHAREDDY8, @100milliongold, @gongwei-130, @fululi12, @mkunredd, @mrodden, @noooop, @valarLip, @shallow10, @200lz, @askliar, @chuan932, @Monishver11, @YashasviChaurasia, @gokay-ai, @jiacao-amd, @yousafshah, @positive666, @TQCB, @lk-chen, @Ricardo-M-L, @huthvincent, @baljinderhothi-cohere, @vschandramourya, @kwen2501, @xiao-llm, @zhecfy, @Willian-Zhang, @simon-veitner-redhat, @mevince, @voidxb, @hongxiayang, @YannikHinteregger, @V-3604, @Rakul-Chauhan, @frankwang28, @LCAIZJ, @PeganovAnton, @jz-yolo, @QHarshil, @R3hankhan123, @jayzuccarelli, @yannicks1, @BaoYunkai, @xaguilar-amd, @xiaohuguo2023, @wxsIcey, @harshaladhav-amd, @varun-sundar-rabindranath, @kliuae, @LostFox11

原始出处

vLLM Releases

内容说明

原始发布及相关权利归来源方。

机器翻译 · 请以原文为准