vLLM Releases

v0.31.0

# v0.31.0 ## 주요 하이라이트 이번 릴리스는 307명의 기여자(신규 96명)가 만든 717개의 커밋을 담고 있습니다! * **DeepSeek-V4.1-Flash 성능**: V4.1 NVFP4 압축 KV 캐시를 사용하는 FlashMLA 메가 어텐션이 이제 SM100 기본값입니다(#56935); 인덱서를 위한 DeepGEMM 희소 MQA 로짓(#56254)과 게이트 GEMM을 전문가…

v0.31.0

주요 내용

이번 릴리스에는 307명의 기여자(신규 96명 포함)가 참여한 717개의 커밋이 포함되어 있습니다!

  • DeepSeek-V4.1-Flash 성능: V4.1 NVFP4 압축 KV 캐시를 사용하는 FlashMLA 메가 어텐션이 이제 SM100 기본값입니다(#56935); 인덱서를 위한 DeepGEMM 희소 MQA 로짓(#56254)과 게이트 GEMM을 전문가 선택과 융합하는 Mega-Gate(#56266); 디코더 경계에서는 TP all-reduce, mHC 입력 준비(#57643) 및 MoE finalize(#58586)가 융합됩니다; 역 RoPE와 MXFP8 양자화를 적용한 융합된 소규모 배치 WO-A가 SM100/SM103에서 제공됩니다(#58634); MXFP8 wo_b GEMM이 시퀀스-병렬 reduce-scatter(#57428)와 퓨전됨; Engram wkv TP 랭크에 분산 샤딩되고(#58678), 기본적으로 동일 위치 DP 레플리카 간에 Engram 호스트 테이블이 공유되며(#57651); 비전 타워용 인코더 CUDA 그래프(#56625); 그리고 슬라이딩 윈도우 KV를 접두사 캐싱에서 제외하는 SWA bounded replay(#56227)가 포함됩니다.
  • 빠른 재시작: 새로운 vllm preload CLI가 엔진 재시작 후에도 post-quantized 가중치를 GPU 메모리에 유지하는 weight-cache 데몬을 실행하며(#56680), 이제 데이터 병렬 처리(#57386), MTP draft 모델(#57312) 등을 지원합니다. /health 엔드포인트(#58552) 및 준비 대기(#58370). 실험적인 초기화된 엔진 스냅샷(vllm snapshot create/restore)는 CRIU를 사용하여 완전히 초기화된 TP1 엔진을 복원합니다(#51360).
  • 모델 러너 V2 및 추측 디코딩: Model Runner V2의 draft-model speculative decoding(#43091) 및 custom logits processors(#56497); 새로운 LiLiCorr drafter(#57934); draft CUDA graph에 컨텍스트 K/V 사전 계산이 캡처되는 DFlash의 비동기 스케줄링(#58065)(#57632); Gemma4를 위한 DSpark 적응형 검증(#57263) 및 Kimi-K3를 위한 가변 길이 디코딩(#52988); non-DCP DSpark draft를 갖는 DCP 타겟(#56723); 그리고 MoE 메모리가 이제 MRV2 프로파일링 중에 계산되어 WideEP 배포에서 OOM을 방지합니다(#57270, #58411).
  • 대규모 서빙: MoonEP 밸런스드 EP all2all 백엔드 via --all2all-backend moonep (#52101), 데이터 병렬화와 결합된 프리필 컨텍스트 병렬화(#57075), SM100/SM103용 저-SM multimem reduce-scatter(#55072), 시퀀스 병렬화를 적용한 DeepEPv2(#57210)와 공유 전문가 오버랩이 적용된 EPLB(#57236), RL을 위한 샤딩 인식 NCCL M2N 가중치 전송 백엔드(#51520), 그리고 KV 오프로딩 백프레셔 감지(#50045).
  • 일정 관리 설정: --max-num-active-seqs ~와 무관하게 RUNNING의 입학을 상한선으로 제한 max_num_seqs (#56758), --long-prefill-token-threshold 이제 대기 중인 prefills 수에 적응하여 단일 요청을 청크로 나누지 않고(#57951, #58459), KV 블록을 이미 확보한 요청이 먼저 스케줄되도록 대기 큐가 재작성되었으며(#58947), KV 압박 상황에서 KV connector + MTP 데드락이 수정되었습니다(#57104).
  • HiSparse 강화: union residency 커널로 해결된 MTP 검증 행(#59235), FULL 그래프에서 수정된 MTP 수용 붕괴(#59309), 호스트 백킹 없는 GPU 페이지 금지(#59036), 수정된 chunked-prefill 선점 라이브락(#59494), HiSparse가 할당하는 그룹 기준으로 크기 조정된 KV 캐시(#59450), 그리고 호스트 접두사 게시 및 GPU 접두사 채택 수정(#59007, #59282).
  • 보안: 요청당 mm_processor_kwargs 그리고 media_io_kwargs 거부됩니다. 단, --trust-request-mm-kwargs 로 설정되어 있습니다(#58830); prefix-cache 추가 키는 소스별로 태그가 지정되어 LoRA 이름과 cache_salt 더 이상 충돌할 수 없고(#51899), LoRA 경로가 블록 해시의 일부가 되며(#59335), 오래된 멀티모달 수신기 캐시 항목이 더 이상 새 페이로드를 대체할 수 없습니다(#57833).
  • 호환성이 깨지는 변경 사항: 요청별 멀티모달 kwargs 게이팅 (#58830); tokenizer_mode="slow" 제거됨 (#58545); --enable-mamba-fine-grained-prefix-cache 다음으로 이름 변경 --enable-mamba-shared-prefix-checkpoint (#57382); 을 통한 온라인 양자화 quantization="fp8" 다음으로 대체됨 fp8_per_tensor 단축 표기 (#53585) 및 Quark 자동 온라인 양자화 제거됨 (#51800); AllSpark INT8 W8A16 백엔드 제거됨 (#58001); --enforce-eager 이제 JIT 커널 워밍업도 비활성화함 (#58197); XPU 그래프가 기본적으로 활성화됨, 다음과 함께 VLLM_XPU_ENABLE_XPU_GRAPH 제거됨 (#51600).

릴리스 아티팩트

Python 휠

플랫폼 설치
PyPI (CUDA 13.0) pip install vllm
PyPI (CUDA 13.0, uv) uv pip install vllm --torch-backend=auto
ROCm pip install vllm --extra-index-url https://wheels.vllm.ai/rocm/0.31.0/rocm723
XPU uv pip install vllm --extra-index-url https://wheels.vllm.ai/0.31.0/xpu --extra-index-url https://download.pytorch.org/whl/xpu --index-strategy unsafe-best-match

Docker 이미지

플랫폼 Docker 이미지
CUDA 13.0 (기본) docker pull vllm/vllm-openai:v0.31.0
CUDA 12.9 docker pull vllm/vllm-openai:v0.31.0-cu129
ROCm docker pull vllm/vllm-openai-rocm:v0.31.0
CPU docker pull vllm/vllm-openai-cpu:v0.31.0
XPU docker pull vllm/vllm-openai-xpu:v0.31.0

기타 아티팩트

사전 빌드된 릴리스 아티팩트는 이 페이지 하단의 Assets 섹션에서 제공되며, 다음을 포함합니다: - 소스 배포 tarball - x86_64 및 arm64용 CUDA 12.9 Python 휠 - x86_64 및 arm64용 CUDA 13.0 Python 휠 - x86_64, arm64 및 macOS용 CPU Python 휠 - x86_64용 XPU Python 휠

모델 지원

  • 새로운 모델 기능: 유계 단일 토큰 선택을 갖춘 DiffusionGemma 구조화 생성 모드(#57250), MiMo V2 MXFP4 MoE, BF16 MoE 라우터 및 DFlash 드래프트(#57784), EAGLE3/DFlash 드래프터를 위한 Cohere2MoE 보조 히든 스테이트(#49819), ROCm DeepSeek-V3.2 경로에서의 GLM-5.2-MXFP4(#51915), AMD-Quark 혼합 정밀도 DeepSeek-V4.1-Flash-MXFP4(#57071) 및 GLM-5.3-Flash Quark MXFP4(#56176) 체크포인트, 그리고 Granite 4.2를 위한 내장 granite_thinking_parser Granite 4.2(#55957) 관련.
  • DeepSeek-V4.1-Flash: NVFP4 압축 KV 캐시를 SM100 기본값으로 사용하는 FlashMLA 메가 어텐션(#56935), 인덱서의 DeepGEMM 희소 MQA 로짓(#56254), 메가 게이트(Mega-Gate, #56266), MoE finalize가 통합된(#58586) 융합 TP all-reduce + mHC 입력 준비(#57643), 융합 소규모 배치 WO-A(#58634), MXFP8 wo_b GEMM + reduce-scatter(#57428), FULL CUDA 그래프로 제한된(#57874) 소규모 TP 배치를 위한 오버랩 mHC 계수(#57603), TP에 걸쳐 샤딩된 Engram wkv TP 샤딩(#58678), huge-page 호스트 테이블을 사용한 직렬화된 Engram 룩업(#56926), 기본적으로 DP 레플리카 간에 공유되는 Engram 테이블(#57651, #57914, #59068), 패딩 없이 네이티브 shared-expert MegaMoE 융합(#56568, #57204), 더 빠른 MegaMoE 스테이징 및 NVFP4 캐시 수집(#57604), 융합된 query RMSNorm + MXFP8 경로 복원(#57679), KV 전용 DSpark 컨텍스트 삽입(#56441), 비전 인코더 CUDA 그래프(#56625, #58499), SWA bounded replay(#56227), 참조 구현과 일치하도록 복원된 causal image SWA(#57152), 갱신된 reasoning effort 매핑(#58316), 그리고 NaN 점수를 받은 후보 블록(#57454), DeepSelect 센티널(#58215), FlashInfer에서의 DSpark 비인과 어텐션(#57432), 오프셋 후보 버퍼의 런타임 JIT(#57667), 그리고 Triton 없이 임포트(#57654)에 대한 시작 수정.
  • DeepSeek V4: 융합 역 RoPE + FP8 양자화를 갖춘 FlashInfer 희소 MLA(#58621), 스택형 DSpark 컨텍스트 WKV 프로젝션(#54674), EP 그룹에서 계산된 융합 MoE 익스퍼트 분포(#57465), 다음을 통한 FIM 완성 suffix (#44229), 툴 호출에서 누락된 string= 파싱(#56271), 기존 시스템 메시지에 첨부된 요청 툴(#51856), 이미지 블록 간격 보존(#56882), 그리고 MTP 스테이지 검증에서 분리된 DSpark 폭(#54631).
  • GLM-5.3-Flash: SM90에서 옵트인 방식의 FlashAttention 및 FlashMLA 희소 백엔드(#55385), FlashInfer SM120 백엔드에서의 NoPE 희소 MLA(#55277), 소규모 디코드 배치를 위한 협력적 top-k(#57327), 풀링된 길이로 크기가 결정되는 인덱서 디코드 워크스페이스(3 GiB 절감, #57701), 1.6-4.8배 더 빠른 메타데이터 연산(#58450), 융합 kpool 테일 슬롯 매핑(#57534), 공유 디스패처를 통한 kpool top-k(#57546), 낮아진 희소 MLA 준비 오버헤드(#57458), 비동기 스케줄링 하에서 SM90 희소 MLA 플랜의 D2H 동기화 제거(#58684), 긴 프리필을 위해 FP32로 순환 상태를 유지하는 FlashKDA(#58846), 그리고 speculative decoding 시 kpool 손상(#58454), SM90 index_kpool 불일치(#58704), kpool 테일 스트라이드(#57477), 500k 토큰 프롬프트(#57317), 시퀀스 병렬화 하의 dense MLP 레이어(#58061), 인덱서 top-k 백엔드 선택(#58594) 및 varlen paged MQA 런치(#55270)에 대한 정확성 수정.
  • Qwen3.8-Flash-Next (Qwen4Exp): QSA 경로에서의 FP8 메인 KV 캐시(#55557), FlashInfer TRTLLM MoE를 사용한 FP8 TP(#55867), SM90 QSA 튜닝(#57273), 융합 HC 다운 프로젝션 + SiLU(#58957), 낮아진 PLE 메타데이터 오버헤드(#58114), 수정된 QSA 인덱서 워크스페이스 파편화(#57105), 프로파일링 KV 캐시 해제(#58961), CUDA 그래프 풀에서 제외된 고정 PLE 프리페치 ID(#58489), 그리고 DGX Spark에서 약 25 s의 가중치 로딩 시간을 절감하는 인덱싱된 익스퍼트 매핑 룩업(#58720).
  • Kimi K3 및 MiniMax-M3: GEMM으로 구현된 Kimi-K3 비전 패치 임베더(#58527), 융합 KimiViT QK RoPE(최대 29배, #58651), 라우팅 익스퍼트 양자화(#57430), 추론 파서(#57098) 및 추론 토큰 카운팅(#58372) 수정, 재바인딩 후 갱신된 DSpark 컨텍스트 KV 포인터(#58814), 더 이상 디코드로 분류되지 않는 스테이트리스 첫 청크(#51483), 그리고 외부 프리픽스 히트 시 더 이상 어드미션을 정체시키지 않는 Mamba 블록 추정(#57050); MiniMax-M3 인코더 CUDA 그래프(#58673), Conv3dLayer 패치 임베딩(약 62배, #58512), triton_mrope 비전 타워 관련 (#58526), 비단위 스케일링(non-unit scaling)이 적용된 fused MiniMax2 라우팅 (#58880), 그리고 프로세서 수정 (#58460, #59613).
  • DiffusionGemma: 원패스 샘플러 통계 커널 (#58226), diffusion_constrained 오버 리드 logprob_token_ids (약 25% 더 빠름, #58216), prefill-only 배치를 위한 더 적은 로짓 행 (#57416), logprob_token_ids 지원 (#57417), 그리고 동시 logprobs (#57414), eager fallback dtype (#57462), 멀티모달 입력 (#57589), 양자화된 LM 헤드 (#48521) 및 CPU 실행 (#58964)에 대한 수정 사항.
  • 멀티모달: Triton mm_input_norm 커널 (#56798, #56711), DP-샤딩 ViT 경로에서 원본 픽셀 유지 (#56872), temporal M-RoPE를 위한 Qwen2.5-VL 비디오 fps 준수 (#47736), 30초보다 긴 Whisper 및 Qwen2-Audio 클립 (#57769, #56912), Mistral3 플레이스홀더 그리드 (#53758), Idefics3 패치 분할 금지 (#48760), Ovis2.5 토큰 (#52623), Aria 전문가 가중치 (#57487), MiMo-V2.5 융합 FP8 qkv_proj 샤딩 (#57508), Gemma4 AutoWeightsLoader (#55911) 및 버퍼 스칼라 (#54213), head dim 512에서 FA4와 함께하는 Gemma4 FP8 KV (#53175), Laguna RoPE (#57189), Mistral-Large-3 정확도 회귀 (#57563), 잘못된 형식의 EXIF (#56527, #57234), JinaVL 레이블 (#57347), FP32 라우터 로짓을 사용하는 Sarvam MLA 라우팅 (#56034), 융합된 CohereASR 어텐션 스코어 (#55190), 그리고 융합된 DFlash2 그룹 컨볼루션 (#55960).
  • LoRA: Nemotron VL 언어 모델 (#56231), ModernBert (#57148), VoyageQwen3 임베딩 (#57708), RoBERTa 시퀀스 분류 (#58884), 그리고 어댑터별 modules_to_save 시퀀스-분류 헤드 (#53555) num_labels (#57766).

엔진 코어

  • Model Runner V2: 드래프트 모델 추측 디코딩 (#43091), 입단 시 검증되는 커스텀 로짓 프로세서 (#56497) (#57728), 무작위 더미 입력 (#58411), 프로파일링 중 MoE 전문가로 라우팅되는 더미 토큰 (#57270), 단일 토큰 프롬프트 꼬리를 위한 FULL 디코드 그래프 (#58400), 토큰-요청 매핑 공유 (#57102) 및 KV 캐시 그룹 간 Mamba/GDN 메타데이터 재사용 (#58762), 인코더 전용 ViT CUDA 그래프 (#56922), 종료 시 해제되는 웨이트 오프로더(#57834) 및 풀링 모델 (#57737), 그리고 P/D에서 멀티레이어 MTP KV 수정 (#55055), LoRA를 사용한 빠른 프리필 수정 (#56456), 더미 드래프트 스텝으로 인한 오래된 블록 테이블 쓰기 수정 (#56734), 하이브리드 모델의 패딩된 프롬프트 꼬리 수정 (#58434), 제안되지 않는 드래프트 슬롯 수정 (#58784), 자동 맞춤 max_model_len (#58149) 및 intermediate_tensors 캡처 중 수정 (#57745).
  • 추측 디코딩: LiLiCorr 드래프터 (#57934), DFlash 비동기 스케줄링 (#58065) 및 드래프트 CUDA 그래프의 컨텍스트 K/V (#57632), Gemma4 DSpark 적응형 검증 (#57263), Kimi-K3 가변 길이 적응형 검증 (#52988), 이기종 어휘를 위한 CPU-GPU 동기화 제거 (#57396), 승인 추정기에서 Triton 재컴파일 방지 (#57107), 그리고 EP를 사용하는 EAGLE/밀집 드래프트 수정 (#56930), DFlash/DSpark 프로파일링 배치 수정 (#56448), GLM MTP 헤드 메모리 수정 (#55442), 드래프트가 있는 프롬프트 임베딩 수정 (#57356), 그리고 TritonMLA 인과적 멀티 토큰 디코드 수정 (#51065).
  • 스케줄러: --max-num-active-seqs (#56758), 적응형 --long-prefill-token-threshold (#57951, #58459), skipped_waiting KV 보유 대기 큐로 대체됨 (#58947), n > 1 요청의 원자적 입단 (#53936), KV 커넥터 + MTP 교착 상태 (#57104), max_num_seqs 이 8의 배수가 아닐 때의 처리량 절벽 (#57355), 로그확률을 유지하고 최대 토큰을 갱신하는 스트리밍 연속 (#57447, #57676), 재개 가능한 요청 + 비동기 스케줄링 경쟁 상태 (#58259), 그리고 논블로킹 구조화된 출력 문법 폴링 (#55931) 수정.
  • 프리픽스 캐싱 및 하이브리드 모델: 소스별로 태깅된 추가 키 (#51899) 및 해시된 LoRA 경로 (#59335), --enable-mamba-shared-prefix-checkpoint (#57382), MTP로 복원된 프롬프트-꼬리 히트 (#58368), 희소 보존 하에서 유지되는 프롬프트-끝 체크포인트 (#59146), 정렬 모드 체크포인트 예약 (#59175), 스테이트리스 GDN 첫 청크 (#51565), 하이브리드 그룹핑 경로에서 주석 처리된 MTP 드래프트 KV 캐시 그룹 (#55390), 일반화된 프리필 체크포인트 빌더 (#57783), GPU-CPU 동기화 없이 배치 처리된 Mamba2 프리필 상태 저장 (#49371), skip_reading_prefix_cache 커넥터 히트에 대해 준수됨 (#57269), 증분 멀티모달 블록 해싱 (#51694), 모든 어텐션 백엔드가 지원하는 KV 블록 크기 (#49845)와 더 명확한 오류 (#58557), 그리고 CacheConfig.effective_attention_block_size DCP를 위한 수정 (#56538).
  • 시작 및 메모리: 병렬 Triton 워밍업 컴파일 (#58582), --enforce-eager 하에서 장애 허용 기능이 켜져 있지 않으면 비활성화되는 JIT 워밍업 (#58197) (#58593), MoE 워크스페이스를 재사용하는 DeepGEMM 워밍업 (#57268), 프로파일링 중 KV 캐시를 더 이상 축소하지 않는 할당자 단편화 (#58430), KV 크기 산정 전에 예약된 희소 프리필 버퍼 (#57575), 해제된 오래된 FlashMLA 워크스페이스 뷰 (#56902), 절반으로 줄어든 DeepGEMM FP8 워크스페이스 (#53914), 공유 Marlin/Humming 워크스페이스 (#57421), 제자리에서 변환된 FlashInfer BF16 MoE 가중치 (#54699), CPU 쿼터로 제한된 UniProc 시작 스레드 (#58946), 그리고 프로파일링 전에 설정된 런타임 스레드 (#55891).
  • 커널: 영구 top-k를 위한 샘플링 필터링 (#56346), Gumbel 샘플링을 위한 Murmur3 RNG (#51367), 레지스터 상주 per-token-group 8비트 양자화 (#55330), 벡터화된 per-tensor FP8 abs-max (#58194), 플랫폼별 오버라이드를 위한 Triton 커널 디스패처 (#43048), GateLinear 모든 MoE 모델에 적용 (#58234), TritonExperts 에서 비로컬 전문가 슬롯 건너뜀 (#58051), 모듈러 경로에서 지연된 TRT-LLM-Gen top-k 마무리 (#58635), SM120 배치 불변 matmul 구성 (#57456), 경계가 지정된 FlashInfer 프리필 디양자화 스크래치 (#57918), 그리고 Triton softcap NaN 수정 (#56579), QuIP Hadamard 변환 수정 (#43462), A100에서 CUTLASS FP8 선형 수정 (#55884), 지원되지 않는 GPU에서 FlashInfer 샘플링 수정 (#48956), SM100 FP8 블록별 스케일 패딩 수정 (#57377), 혼합 FULL 그래프 프리필 캡처 수정 (#58275), Inductor 커스텀 연산 패턴 매칭 수정 (#58189), Qwen3.5에서 FLA와 발산하는 CuteDSL BF16 GDN 프리필 수정 (#53864), SM100 fp8_ds_mla 캐시 스케일링(#49435), sparse 인덱서의 ragged decode 배치(#52500), 배치 재정렬 후의 오래된(stale) allowed_token_ids 마스크(#48419, #43931), 그리고 prompt_embeds 요청이 끝난 후에도 유지되는 텐서(#57988).
  • 배치 불변성(Batch invariance): 기본적으로 torch.compile 없이 끊기는 CUDA 그래프( VLLM_BATCH_INVARIANT (#57586), 시퀀스 병렬화 및 비동기 TP 비활성화(#56377), 그리고 NCCL 2.31 컬렉티브는 활성화 유지(#58179).
  • Sleep 및 RL: release_kv_cache_memory() 은 KV 캐시 메모리만 해제하고(#44890), --sleep-preserve-parameter-names 레벨-2 sleep 전반에서 고정된 가중치를 유지하며(#57891), NCCL M2N 가중치 전송(#51520), DP 인덱스별 dense DP 가중치 업데이트(#56950), expandable segments 토글 시 할당자 설정 유지(#57982), 그리고 sleep 중 캐시 리셋 실패 전파(#54581)를 포함합니다.
  • 빠른 재시작: vllm preload (#56680), DP(#57386), MTP 드래프트(#57312), 준비 대기(#58370), /health (#58552), ModelOpt MXFP8 사전 처리된 가중치(#57316), 그리고 초기화된 엔진 스냅샷(#51360).
  • 로깅 및 관측 가능성: LoggingConfig 를 통해 --logging-config 및 --log-level (#57205), JSON 로깅 수정(#57957, #58747), 시작 로그 억제 수정(#51366), 통합 플랫폼 인식 torch 프로파일링(#57460), 쿼리 전 0.0% 프리픽스 캐시 히트율 미출력(#54990), KV 전송 메트릭 포맷팅(#57068), 모델 dtype 기반 MFU 활성화 크기 계산(#57070), 플랫폼 오버라이드 가능한 환경 변수 검사(#48599), VLLM_TARGET_DEVICE=empty pip install vllm 아웃오브트리 백엔드용(#41074), 그리고 소스에서 설치 시 올바른 vLLM 버전 보고(#57295, #57744).

대규모 서빙(Large Scale Serving)

  • MoE 통신: MoonEP 백엔드(#52101), 시퀀스 병렬화를 갖춘 DeepEPv2(#57210) 및 EPLB + 공유 전문가 오버랩(#57236), 저-SM multimem reduce-scatter(#55072), Elastic EP 스케일링 중 EPLB 부하 통계(#58473), grouped routing에서 SP 패딩 행을 건너뛰어 rank 0이 더 이상 prefill 지연자가 아님(#56079), 지원되지 않는 모놀리식 백엔드에서 해시 라우팅 거부(#57867), 엔진을 떠나는 요청에 대해 PP 하에서 sampled-token 브로드캐스트 생략(#58542), DeepEP 저지연 프로파일링을 갖춘 DBO(#57502), 노드를 공유하는 복제본을 갖춘 외부 LB(#53743), 그리고 엔진 핸드셰이크 중 블로킹 RPC 없음(#57226) 또는 무제한 드래프트 토큰 대기 없음(#58779).
  • 컨텍스트 병렬성(Context parallelism): DP, EP 및 MTP와 함께하는 PCP(#57075), 비-DCP DSpark/DFlash 드래프트를 위한 DCP 대상(#56723), CPU-GPU 동기화 없이 DCP 시퀀스 길이 처리(#58169), 그리고 MLA 캐시 영역 전반의 NIXL DCP 풀(#57389).
  • KV 커넥터: attention-HMA를 위한 NIXL 파이프라인 병렬 push prefill(#50494) 및 packed MLA 레이아웃(#50499), KV 만료에서 분리된 전송 실패 메트릭(#55854), TTL 대기 없이 죽은 피어 상태 해제(#50047), 하트비트가 적용된 헤드 뒤에서 만료된 리스 회수(#58292), push 완료 복원(#58188), D 측 활동 기록(#52245); Mooncake CUSTOM_MEM_POOL (#49300), HMA 하의 요청 수준 로드 실패(#56855, #57174) 및 부트스트랩 재시도(#58919); MoRIIO READ 모드의 하이브리드 Mamba/KDA 상태(#51052) 및 다중 디코드 라우팅 경쟁 상태(#51681); prompt_tokens_details 에서의 prefill 캐시 히트(#54222); 포트 0에 바인딩된 KV 이벤트 퍼블리셔(#55844); 외부 소비자를 위한 KV 캐시 메타데이터 GET 복원(#56925); 부분 블록 KV 이벤트가 모든 멀티모달 기능을 유지(#58288); forward 없는 단계에서 완료되는 저장(#57775); abort-안전한 ExampleHiddenStatesConnector (#56841); DecodeBench FP8 채움(#58472); KvHints 요청 엔벨로프(#53423); 그리고 라우팅된 전문가 출력을 위한 AuxOutput 커넥터(#45635, #58150, #58205).
  • KV 오프로딩: 요청별 max_load_tokens (#55885), 역압 감지(#50045), SimpleCPUOffloadConnector Prometheus 메트릭(#57251), 프리픽스 캐시 불가(#56810) 및 스크래치(#57145) 그룹 건너뛰기, 다중 그룹 MLA를 위한 복제 레이아웃(#57652), 512 GiB 이상 영역을 청크로 등록(#51081), SHM 할당 전 cgroup 메모리 확인(#54014), 그리고 캐시 최신성(#51787), MTP 유지 슬라이딩 윈도우(#56709), 정규 MLA 행(#56799), 이벤트 메타데이터(#57453) 및 ROCm 고정 메모리(#57160)에 대한 수정.
  • HiSparse: MTP 행을 위한 union residency 커널(#59235), FULL 그래프 하의 MTP 수용(#59309), 호스트 기반 할당(#59036), 선점 라이브락(#59494), KV 캐시 크기 계산(#59450), 호스트 프리픽스 게시(#59007), GPU 프리픽스 채택(#59282), 그리고 residency 메트릭(#58725).
  • 인코더 분리(Encoder disaggregation, EPD): 런처 관리 등록을 갖춘 동적 EPD 프록시(#54176), 인코더별로 배치 처리되는 이미지 요청(#57095), Mooncake를 통한 크로스 인코더 캐싱(#56242), 메타데이터 전용 오디오 입력(#57887), 다음을 위한 언어 모델 샤드 건너뛰기 --mm-encoder-only (#58086), EC 커넥터 메트릭(#54960), 그리고 인코더 전용 수정 사항(#58490, #58287, #57696).

하드웨어 & 성능

  • NVIDIA: FlashInfer 0.7.0.post1(#58069, #59323), SM120 수정이 포함된 DeepGEMM 핀 버전 업데이트(#57218), Rubin CUDA 13.4 나이틀리 이미지(#55953), 그리고 PyTorch 2.13과 함께하는 QuTLASS 빌드(#58173).
  • AMD ROCm: AITER v0.1.23 (#56885, #58867), torch 2.13 및 Triton 3.8 (#50605, #58006), triton_kernels 3.8 MXFP4 MoE for gpt-oss와 DeepSeek-V4 (#55934), ROCR 호스트 세그먼테이션 오류 수정 (#57328); DeepSeek-V4/V4.1 HCA 듀얼 스트림 (#56853) 및 레이어 인지 CSA2 오버랩 (#57407), FP8 wo_a (#54894), 역 RoPE가 스파스 디코드 리듀스(#57435, #57451)에 퓨즈되었으며, 이제 그룹화된 FP8을 위해 MXFP8을 출력함 wo_a (#58456), gfx950에서 네이티브 32x32 스케일을 사용하는 MXFP8 GEMM (#58510), 재사용되는 top-k 래그드 메타데이터 (#57434), 더 빠른 후보 블록 선택 (#58208), 호스트 메모리의 Engram 테이블 (#57491) 및 호스트 메모리로 오프로드되는 Qwen3.8-Flash-Next PLE 테이블 (#57497), DCP + 스페클레이티브 디코딩을 위한 옵트인 AITER ASM 디코드 경로 (#56861), get_top_tokens() DeepSeek V4 MTP drafter에서 (#57568), DSpark 적응형 검증 (#52362), 옵트인 VLLM_DSV4_LOGITS_FIX gfx950/gfx942의 스파스 인덱서 로짓용 (#50455), #56433과 #51692의 정확도 리버트 (#57132), 그리고 DPA+ETP와 함께 FSE에 대한 명확한 오류 (#57919); Kimi-K3 a4w4 FlyDSL 커널 (#53940)과 함께 VLLM_ROCM_USE_AITER_MOE_SITUV2=a16w4|a8w4|a4w4 (#58201), 낮은 동시성 스페클레이티브 KDA (#58045), EP 하에서 샤딩된 잠재 MoE (#54956) 및 더 적은 프로젝션 복사 (#50592); torch.compile을 사용하는 ROCm Hy4 경로 (디코드 지연 13배 감소, #57526); MiniMax-M3 AITER QK-norm 퓨전 (#54535), 복사 없는 K/V 삽입 (#56849) 및 MXFP8 수정 (#53674, #58089); GLM-5.3-Flash 부팅 수정 (#57192, #57252, #57425); AITER QuickReduce + RMSNorm (#48249), BF16 AsyncTP (#58098), 정적 FP8 어텐션 출력 퓨전 (#58099), MRoPE를 위한 QK-norm/RoPE/KV-캐시 퓨전 (#50212), 플랫 레이아웃용 AITER GDN 디코드 (#53623), wvSplitK 단일 출력 GEMM용 (#53283), 스키니 GEMM 경로에서 디코드 스텝당 69회 적은 복사 (#58566), AITER을 통한 튜닝된 GEMM 조회 (#55001), RDNA3/RDNA4에서 더 좁은 Triton 프리필 KV 타일 (#58225), 단계적 대형 페이지블 H2D 복사 (#56343), 그리고 KV 캐시를 고갈시키는 MXFP4 MoE 패딩 (#56359), AITER MLA FP8 프리필 OOM (#57923), 비양자화 캐시 디스케일 (#56726) 및 AITER MoE 폴백 (#56590, #57866, #57426)에 대한 수정. VLLM_ROCM_USE_AITER_FP4_ASM_GEMM 가 복원되었으며 기본적으로 비활성화됨 (#57055); SWA 바운디드 리플레이는 ROCm에서 비활성화됩니다 (#57906).
  • Intel XPU: PyTorch 2.14 (#56013), 기본 활성화되는 XPU 그래프 (#51600), EPLB (#44987), Triton의 int8 W8A8 MoE (#53162), 배치 불변성 (#55881), SYCL 회전 임베딩 (#55721), 퓨즈된 QK RMSNorm + RoPE + gate (디코드 영역 55% 더 빠름, #56096), Model Runner V2 샘플러 (#57277) 및 PP 마이크로배치 제어 (#55145), --device-ids 준수됨 (#56015), 그리고 디바이스 포인터 오버플로우 수정 (#54514).
  • CPU: Intel Diamond Rapids용 FP8 W8A8 linear 및 MoE (#49942), 최대 25% 더 빠른 Arm 페이즈드 어텐션 (#56045), dense 및 MoE 레이어용 Zen DA8W4 int4 (#54024), 인코더 어텐션용 zentorch SDPA (#54508) 및 MLA 프리필 (#54967), FP32 어텐션 싱크 (#56252), POWER의 W8A8 INT8 MoE (#55316), W4A16 Whisper (#58268), AMX-FP8을 포함하여 Ubuntu 22.04 (glibc 2.34)에서 빌드된 휠 (#58515), 컴파일러 지원에 따라 게이트되는 AVX10.2 (#58133), 사전 빌드된 Triton CPU (#58140), --device-memory-utilization 별칭 (#56547), CPU 이미지의 vLLM Recipes (#58796, #57306), s390x protobuf 핀 (#54978) 및 torchcodec 비디오 (#58693), 그리고 Ministral FP8 (#56985), FP32 라우터 가중치 (#56168), zentorch 임포트 실패 (#54923), macOS 멀티모달 SHM (#57142), 로컬 랭크별 CPU 어피니티 (#53636) 및 NIXL GDN 상태 레이아웃 (#53300)에 대한 수정.

양자화

  • Humming: Hadamard 변환 및 NVFP4/MXFP4/MXFP8 온라인 양자화 (#56685), compressed-tensors를 통한 비대칭 wNaM (#46528), humming-kernels 0.1.16 (#58054), 그리고 W4A8 (INT4xFP8) MoE 오라클의 Humming (#58427).
  • 새로운 기능: 네이티브 Quark W4A16 INT4/UINT4 내보내기 (#48606), 옵트인 로드 시점 MXFP4 디양자화 (#50814), 명시적 토큰별 NVFP4 MoE 백엔드 (#57176), 그리고 compressed-tensors WNA16 MoE를 위한 표준 N-우선 레이아웃 (#52798).
  • 수정: 이하 레이어의 MXFP8 mm_mxfp8 형태 한계 (#54223), 리로드 시 온라인 NVFP4 스케일 (#57954), LM head linear 메타데이터 (#58444), 그리고 SwiGLU 클램프 하에서 건너뛰어지는 퓨즈된 SiLU-mul 블록 양자화 경로 (#57984).

API & Frontend

  • 새로운 옵션 및 엔드포인트: --tool-strict-level (#56268), response_format with tool_choice=auto (#56086), DeepSeek-V4 FIM completions (#44229), release_kv_cache_memory() 그리고 POST /release_kv_cache_memory (#44890), 를 통한 고정 토큰 프리필 스코어링 prompt_logprob_token_ids (#54335), 내 요청별 스페클레이티브 디코딩 메트릭 /inference/v1/generate (#43310), 요청별 메트릭 (#55084) 및 cache_write_tokens (#57222), Responses API의 Anthropic thinking 지원, /v1/messages (#58613), 오프로드된 detokenization(#57528)과 함께 derender 엔드포인트(#50550)에서 reasoning 및 tool call을 스트리밍, vllm chat thinking 출력 스트리밍(#57045), 요청 본문 디버그 로깅, --enable-log-requests (#58163), 그리고 config docstring의 요약 줄만 표시하는 기능은 --help (#57357).
  • 구조화된 출력 및 파서분야: xgrammar 백엔드의 네이티브 Lark 문법(#58321), XGrammar 0.2.7(#57272), Granite을 streaming Parser Engine으로 마이그레이션(#49648), 그리고 reasoning 경계(#56635), 제어 문자가 포함된 xgrammar choices(#48115), list 타입 JSON Schema(#48416), 빈 structural_tag (#47450), outlines EOS 처리(#58612, #57743), 파서가 억제한 스트리밍 logprobs(#58583), reasoning 이후의 Inkling 도구 이름(#58792), 그리고 잘린 스트리밍 tool call을 위한 length finish_reason 관련 수정 사항(#46303)이 있습니다.
  • OpenAI, Anthropic 및 Harmony 호환성: Harmony, DeepSeek-V3 및 Step3의 추론 토큰 수(#58626) 및 Responses 도구 라운드별(#58927), Harmony max_output_tokens 툴 루프(#58551), 조정된 요청을 사용한 배치 채팅 완료(#58929, #58958), choice별 새 파서(#58939), 지연된 reasoning 재계산(#56067), Responses MCP 정리(#56988) 및 이미지 detail default (#57241), Anthropic inline system detection (#58754) 및 P/D가 포함된 비활성화된 thinking (#58786), stop strings가 거부된 --tokens-only servers (#57058), invalid prompt_embeds 400 반환 (#55451, #57006), 멀티모달 확장 후 프롬프트 제한 적용 (#57076), --override-generation-config penalties (#50769), Hub revisions (#56092, #57461), token-in/token-out 응답의 전체 logprobs (#58488), generative scoring 취소 (#57729, #58788), gRPC keepalive ping (#55102), 그리고 run-batch 화자 분리 전사 (#57948).
  • 풀링: 청크 임베딩 패딩(#56505) 및 정규화(#57498), 문서 제한이 있는 리랭커 토큰화(#57666), 그리고 raw logits를 위해 유지된 BERT 계열 헤드(#57664)입니다.
  • Rust 프런트엔드: --hf-overrides (#56931), --sse-keep-alive-interval (#58306), 사용자 지정 채팅 역할 (#58311), MiMo V2.5 파서 (#57933), 정규화된 추론 제어 (#56998), 파서 소유 출력 문법 (#55269, #57340), gRPC를 통한 샘플링 마스크 (#56777), gRPC 메타데이터의 로컬 DP 크기와 함께 vllm-proto 0.3.0(#57116, #57233), 요청별 선점 히스토그램(#57033), 락 프리 히스토그램(#58574), Nemotron-H 비전 컨텍스트(#57634), 모델 소유 비전 프로세서(#58109), an mm-processor 벤치마크(#51922, #58084, #58378), 지원되지 않는 serve 인자 인식(#58330), NaN logprobs가 더 이상 엔진 클라이언트를 죽이지 않음(#51026), 추가된 EngineCoreOutput 필드를 허용합니다(#56533), 그리고 vllm-rs 켜짐 PATH CUDA 이미지에서 (#57606).
  • 벤치마크: 어느 openai-responses 백엔드 vllm bench serve (#54628) 및 model_id 지연 시간/처리량 JSON에 추가되었습니다 (#58112).

보안

  • 요청별 mm_processor_kwargs 그리고 media_io_kwargs 기본적으로 거부되며, 신뢰할 수 있는 배포만 옵트인할 수 있습니다 --trust-request-mm-kwargs (#58830).
  • Prefix-cache 블록 해시가 소스별로 extra keys에 태그를 붙이고(#51899) LoRA 경로를 포함하며(#59335); 멀티모달 해시 입력이 프레임화되고(#54283) 증분 블록 해싱이 모든 겹치는 기능을 다룹니다(#51694).
  • 새로운 멀티모달 페이로드는 오래된 수신자 캐시보다 우선하며(#57833), 임베딩 수가 일치하지 않는 인코더-캐시 히트는 거부됩니다(#57696).
  • min_tokens 채워진 부분 위에 max_tokens 기본값이 거부되어 엔진이 멈추는 대신 적절히 처리됩니다 (#57731); 메시지 정화(sanitization) 과정에서 대문자 메모리 주소가 필터링됩니다 (#58832); 서빙 중인 모델의 이름을 딴 LoRA 어댑터는 거부됩니다 (#59286).

종속성

  • FlashInfer 0.7.0.post1(#58069, #59323), 요구 사항에 상한이 지정된 Transformers 5.17.0(#56108)(#59614), XGrammar 0.2.7(#57272), oss-harmony 교체 openai-harmony (#55128), DeepGEMM fork pin bump (#57218), FlashKDA bump (#58846), 그리고 humming-kernels 0.1.16 (#58054)입니다.
  • CUDA 12 이미지는 LMCache 0.4.4 및 CuPy CUDA 12를 사용합니다(#57945); 별도로 태그된 zstd Docker Hub 이미지(-x86_64-zstd)가 게시됩니다(#55608); Rubin CUDA 13.4 nightly 이미지(#55953).
  • ROCm: AITER v0.1.23(#58867), torch 2.13, Triton 3.8(#50605, #58006), 패치된 ROCR(#57328), LMCache OpenTelemetry 고정 버전(#59056).
  • XPU: PyTorch 2.14(#56013). CPU: Ubuntu 22.04에서 빌드된 wheels(#58515), 사전 빌드된 Triton CPU(#58140).

주요 변경 사항 및 지원 중단

  • 요청별 mm_processor_kwargs 및 media_io_kwargs 는 이제 서버가 --trust-request-mm-kwargs옵션으로 시작되지 않으면 오류를 반환합니다; 서버 수준의 --mm-processor-kwargs / --media-io-kwargs 및 오프라인 LLM 는 변경되지 않았습니다(#58830).
  • tokenizer_mode="slow" 가 제거되었습니다; Transformers v5에서는 이미 "hf" Transformers v5(#58545)에서.
  • --enable-mamba-fine-grained-prefix-cache 가 --enable-mamba-shared-prefix-checkpoint (#57382).
  • 으로 이름이 변경되었습니다. quantization="fp8" 를 통한 온라인 양자화는 이제 fp8_per_tensor 온라인 단축 표기로 리다이렉트됩니다(#53585); Quark 전용 무음 온라인 MXFP4 양자화는 온라인 양자화 API로 대체되어 제거되었습니다(#51800).
  • The AllSpark INT8 W8A16 GEMM 백엔드가 제거되었습니다(#58001). return_assistant_tokens_mask 의 /render 옵션과 assistant_tokens_mask 응답 필드가 제거되었습니다(#57520).
  • VLLM_PLE_CPU_OFFLOAD 가 제거되었습니다; --engram-config (#57937). VLLM_XPU_ENABLE_XPU_GRAPH 제거되었으며 XPU 그래프가 기본적으로 활성화됩니다(#51600).
  • 가 제거되었으며 XPU 그래프는 기본적으로 활성화됩니다(#51600). --collect-detailed-traces 의 쉼표로 구분된 형식이 제거되었습니다; 리스트 문법을 사용하십시오(#55702).
  • 새로운 기본값: --enforce-eager 는 내결함성이 활성화되지 않은 경우 JIT 커널 워밍업도 비활성화합니다(#58197, #58593); VLLM_BATCH_INVARIANT=1 는 torch.compile 없이 중단 가능한 CUDA 그래프를 사용하며(#57586) 시퀀스 병렬화와 async TP를 비활성화합니다(#56377); DeepSeek-V4.1 SWA bounded replay가 기본 활성화되며(#56227) ROCm에서는 예외입니다(#57906); Engram 호스트 테이블은 가능한 경우 공동 배치된 DP 복제본 간에 공유됩니다(#57651); FlashMLA mega attention이 SM100에서 DeepSeek-V4.1의 기본값입니다(#56935); AITER w4a4 ASM GEMM은 ROCm에서 기본적으로 비활성화되어 있습니다(#57055).
  • Model Runner V1 + PP > 1 + 비동기 스케줄링 + 구조화된 출력 조합은 이제 시작 시 거부됩니다(#56250); json_object 는 outlines 백엔드에서 검증 시 거부됩니다(#57743).
  • transformers 이제 요구 사항에 상한이 있습니다 (#59614).

새 기여자

  • @0z5a님이 https://github.com/vllm-project/vllm/pull/56441에서 첫 기여를 했습니다
  • @200lz님이 https://github.com/vllm-project/vllm/pull/55528에서 첫 기여를 했습니다
  • @AARONKANG04님이 https://github.com/vllm-project/vllm/pull/48521에서 첫 기여를 했습니다
  • @acsoto님이 https://github.com/vllm-project/vllm/pull/57314에서 첫 기여를 했습니다
  • @adenzhou1350님이 https://github.com/vllm-project/vllm/pull/56882에서 첫 기여를 했습니다
  • @adtygan님이 https://github.com/vllm-project/vllm/pull/56325에서 첫 기여를 했습니다
  • @amasen02님이 https://github.com/vllm-project/vllm/pull/56576에서 첫 기여를 했습니다
  • @amd-sriram님이 https://github.com/vllm-project/vllm/pull/53792에서 첫 기여를 했습니다
  • @andrewor14님이 https://github.com/vllm-project/vllm/pull/52956에서 첫 기여를 했습니다
  • @Ankit-Jaiswal-AMD님이 https://github.com/vllm-project/vllm/pull/56252에서 첫 기여를 했습니다
  • @baljinderhothi-cohere님이 https://github.com/vllm-project/vllm/pull/58792에서 첫 기여를 했습니다
  • @BaoYunkai님이 https://github.com/vllm-project/vllm/pull/57568에서 첫 기여를 했습니다
  • @blipbyte님이 https://github.com/vllm-project/vllm/pull/55612에서 첫 기여를 했습니다
  • @BPbruce님이 https://github.com/vllm-project/vllm/pull/46466에서 첫 기여를 했습니다
  • @chuan932님이 https://github.com/vllm-project/vllm/pull/55330에서 첫 기여를 했습니다
  • @coderfornow님이 https://github.com/vllm-project/vllm/pull/54978에서 첫 기여를 했습니다
  • @CZT0님이 https://github.com/vllm-project/vllm/pull/51694에서 첫 기여를 했습니다
  • @devtyagi3909님이 https://github.com/vllm-project/vllm/pull/56635에서 첫 기여를 했습니다
  • @dilberx님이 https://github.com/vllm-project/vllm/pull/57076에서 첫 기여를 했습니다
  • @divyvasal님이 https://github.com/vllm-project/vllm/pull/49845에서 첫 기여를 했습니다
  • @equiluxe님이 https://github.com/vllm-project/vllm/pull/48115에서 첫 기여를 했습니다
  • @errmakov님이 https://github.com/vllm-project/vllm/pull/58583에서 첫 기여를 했습니다
  • @farzad-elastix님이 https://github.com/vllm-project/vllm/pull/56168에서 첫 기여를 했습니다
  • @freyfwt님이 https://github.com/vllm-project/vllm/pull/51367에서 첫 기여를 했습니다
  • @garrett361님이 https://github.com/vllm-project/vllm/pull/57984에서 첫 기여를 했습니다
  • @git-jxj님이 https://github.com/vllm-project/vllm/pull/55702에서 첫 기여를 했습니다
  • @gokay-ai님이 https://github.com/vllm-project/vllm/pull/58292에서 첫 기여를 했습니다
  • @gongwei-130님이 https://github.com/vllm-project/vllm/pull/55102에서 첫 기여를 했습니다
  • @haosenwang1018님이 https://github.com/vllm-project/vllm/pull/58288에서 첫 기여를 했습니다
  • @harshit-sarvam님이 https://github.com/vllm-project/vllm/pull/56034에서 첫 기여를 했습니다
  • @HieDean님이 https://github.com/vllm-project/vllm/pull/57356에서 첫 기여를 했습니다
  • @huthvincent님이 https://github.com/vllm-project/vllm/pull/48419에서 첫 기여를 했습니다
  • @i-m-aditya님이 https://github.com/vllm-project/vllm/pull/57447 에서 첫 기여를 했습니다
  • @jayzuccarelli님이 https://github.com/vllm-project/vllm/pull/58557 에서 첫 기여를 했습니다
  • @jiakangkangfuzhe님이 https://github.com/vllm-project/vllm/pull/55146 에서 첫 기여를 했습니다
  • @jiangLLM님이 https://github.com/vllm-project/vllm/pull/57487 에서 첫 기여를 했습니다
  • @jiaran-king님이 https://github.com/vllm-project/vllm/pull/56242 에서 첫 기여를 했습니다
  • @jz-yolo님이 https://github.com/vllm-project/vllm/pull/58884 에서 첫 기여를 했습니다
  • @kaijunli-infr님이 https://github.com/vllm-project/vllm/pull/52101 에서 첫 기여를 했습니다
  • @karya0님이 https://github.com/vllm-project/vllm/pull/57453 에서 첫 기여를 했습니다
  • @KEYS-A15님이 https://github.com/vllm-project/vllm/pull/57528 에서 첫 기여를 했습니다
  • @kwen2501님이 https://github.com/vllm-project/vllm/pull/51520 에서 첫 기여를 했습니다
  • @laulopezreal님이 https://github.com/vllm-project/vllm/pull/57189 에서 첫 기여를 했습니다
  • @lijipeng787님이 https://github.com/vllm-project/vllm/pull/58225 에서 첫 기여를 했습니다
  • @limitmhw님이 https://github.com/vllm-project/vllm/pull/48606 에서 첫 기여를 했습니다
  • @linnea-lin-00638949님이 https://github.com/vllm-project/vllm/pull/47450 에서 첫 기여를 했습니다
  • @LinzeShi님이 https://github.com/vllm-project/vllm/pull/57347 에서 첫 기여를 했습니다
  • @mahird3님이 https://github.com/vllm-project/vllm/pull/57708 에서 첫 기여를 했습니다
  • @melcheikh님이 https://github.com/vllm-project/vllm/pull/48956 에서 첫 기여를 했습니다
  • @MichaelLapshin님이 https://github.com/vllm-project/vllm/pull/57396 에서 첫 기여를 했습니다
  • @mjkvaak-amd님이 https://github.com/vllm-project/vllm/pull/48249 에서 첫 기여를 했습니다
  • @mkunredd님이 https://github.com/vllm-project/vllm/pull/58244 에서 첫 기여를 했습니다
  • @mmastrac님이 https://github.com/vllm-project/vllm/pull/57414 에서 첫 기여를 했습니다
  • @mustafayildirim님이 https://github.com/vllm-project/vllm/pull/57252 에서 첫 기여를 했습니다
  • @Navjot10님이 https://github.com/vllm-project/vllm/pull/55390 에서 첫 기여를 했습니다
  • @olka-amd님이 https://github.com/vllm-project/vllm/pull/51065 에서 첫 기여를 했습니다
  • @PeganovAnton님이 https://github.com/vllm-project/vllm/pull/55128 에서 첫 기여를 했습니다
  • @Rakul-Chauhan님이 https://github.com/vllm-project/vllm/pull/54967 에서 첫 기여를 했습니다
  • @Ricardo-M-L님이 https://github.com/vllm-project/vllm/pull/52580 에서 첫 기여를 했습니다
  • @Ronnie-Rui님이 https://github.com/vllm-project/vllm/pull/54581 에서 첫 기여를 했습니다
  • @RyanMa29님이 https://github.com/vllm-project/vllm/pull/57295 에서 첫 기여를 했습니다
  • @sammaji님이 https://github.com/vllm-project/vllm/pull/58626 에서 첫 기여를 했습니다
  • @sawsa307님이 https://github.com/vllm-project/vllm/pull/56497 에서 첫 기여를 했습니다
  • @ScarWar님이 https://github.com/vllm-project/vllm/pull/49435 에서 첫 기여를 했습니다
  • @sdougbrown님이 https://github.com/vllm-project/vllm/pull/49819 에서 첫 기여를 했습니다
  • @semerandre님이 https://github.com/vllm-project/vllm/pull/55557 에서 첫 기여를 했습니다
  • @sergiofigueras님이 https://github.com/vllm-project/vllm/pull/57948 에서 첫 기여를 했습니다
  • @shallow10님이 https://github.com/vllm-project/vllm/pull/58336 에서 첫 기여를 했습니다
  • @SIDDARTHAREDDY8님이 https://github.com/vllm-project/vllm/pull/57743 에서 첫 기여를 했습니다
  • @simpleqt님이 https://github.com/vllm-project/vllm/pull/55936 에서 첫 기여를 했습니다
  • @tangzzycc님이 https://github.com/vllm-project/vllm/pull/53283 에서 첫 기여를 했습니다
  • @touch869님이 https://github.com/vllm-project/vllm/pull/55844 에서 첫 기여를 했습니다
  • @tripathiarpan20님이 https://github.com/vllm-project/vllm/pull/57140 에서 첫 기여를 했습니다
  • @twu3202님이 https://github.com/vllm-project/vllm/pull/57769 에서 첫 기여를 했습니다
  • @ubwzwd님이 https://github.com/vllm-project/vllm/pull/55931 에서 첫 기여를 했습니다
  • @UNIDY2002님이 https://github.com/vllm-project/vllm/pull/58370 에서 첫 기여를 했습니다
  • @valarLip님이 https://github.com/vllm-project/vllm/pull/58659 에서 첫 기여를 했습니다
  • @vcave님이 https://github.com/vllm-project/vllm/pull/51681 에서 첫 기여를 했습니다
  • @voidxb님이 https://github.com/vllm-project/vllm/pull/49300 에서 첫 기여를 했습니다
  • @vorapolsiloai님이 https://github.com/vllm-project/vllm/pull/50212 에서 첫 기여를 했습니다
  • @vschandramourya님이 https://github.com/vllm-project/vllm/pull/58779 에서 첫 기여를 했습니다
  • @weitliao님이 https://github.com/vllm-project/vllm/pull/54535 에서 첫 기여를 했습니다
  • @wenjinhust님이 https://github.com/vllm-project/vllm/pull/51366 에서 첫 기여를 했습니다
  • @Willian-Zhang님이 https://github.com/vllm-project/vllm/pull/58720 에서 첫 기여를 했습니다
  • @wtdcode님이 https://github.com/vllm-project/vllm/pull/56268 에서 첫 기여를 했습니다
  • @xinnywinne님이 https://github.com/vllm-project/vllm/pull/55084 에서 첫 기여를 했습니다
  • @YannikHinteregger님이 https://github.com/vllm-project/vllm/pull/50047 에서 첫 기여를 했습니다
  • @YashasviChaurasia님이 https://github.com/vllm-project/vllm/pull/58112 에서 첫 기여를 했습니다
  • @Yatimai님이 https://github.com/vllm-project/vllm/pull/43462 에서 첫 기여를 했습니다
  • @YCH188님이 https://github.com/vllm-project/vllm/pull/57190 에서 첫 기여를 했습니다
  • @yousafshah님이 https://github.com/vllm-project/vllm/pull/55957 에서 첫 기여를 했습니다
  • @ys2025-AI님이 https://github.com/vllm-project/vllm/pull/56841 에서 첫 기여를 했습니다
  • @yuchenwang3님이 https://github.com/vllm-project/vllm/pull/54699 에서 첫 기여를 했습니다
  • @zhecfy님이 https://github.com/vllm-project/vllm/pull/58316 에서 첫 기여를 했습니다
  • @Zoe923님이 https://github.com/vllm-project/vllm/pull/53864 에서 첫 기여를 했습니다
  • @Zyann7님이 https://github.com/vllm-project/vllm/pull/57784 에서 첫 기여를 했습니다

기여자

태그: @AndreasKaratzas, @khluu, @mgoin, @njhill, @BugenZhao, @stefankoncarevic, @robertgshaw2-redhat, @taneem-ibrahim, @Thangnguyenvn98, @hmellor, @Juntian777, @WoosukKwon, @yewentao256, @gau-nernst, @mmastrac, @LucasWilkinson, @Fangzhou-Ai, @NickLucche, @aoshen02, @JaredforReal, @mawong-amd, @DarkLight1337, @zyongye, @sfeng33, @vllm-agent, @okorzh-amd, @ZJY0516, @shen-shanshan, @gty111, @Isotr0py, @djramic, @zixi-qi, @wzhao18, @alec-flowers, @aarushjain29, @Rohan138, @yma11, @mjkvaak-amd, @ivanium, @yisustc, @MatthewBonanni, @wangxiyuan, @reidliu41, @chaojun-zhang, @shaohuaxi, @gcanlin, @ganeshr10, @linitra24, @yzong-rh, @divakar-amd, @atalman, @ShuoleiWang, @simondanielsson, @rasmith, @chaunceyjiang, @micah-wil, @liusy58, @LioEinaudi, @louie-tsai, @LiuYinfeng01, @jeejeelee, @zhenwei-intel, @jperezdealgaba, @hlin99, @zxd1997066, @lucamotz, @lucifer1004, @eopXD, @ashraf-bhuiyan, @TheEpicDolphin, @JulienDarve, @mayuyuace, @danisereb, @bigPYJ1151, @Etelis, @JohnQinAMD, @jiangkuaixue123, @tianmu-li, @akii96, @vllmellm, @RyanMa29, @afriedri, @elvircrn, @mustafayildirim, @yuzhouo7, @wtdcode, @biswapanda, @adtygan, @hickeyma, @itayalroy, @jiangLLM, @Hotragn, @faaany, @xhx1022, @jinzhen-lin, @sheralskumar, @Wauplin, @matteso1, @wjabbour, @Sunt-ing, @arpera, @hclsys, @S1ro1, @HDCharles, @fxmarty-amd, @liuzijing2014, @UNIDY2002, @samuelkim7, @markmc, @errmakov, @zhejiangxiaomai, @KernelClint, @i-m-aditya, @ColinZ22, @ppalanga, @franciscojavierarceo, @maithilijoshi20, @mfylcek, @almersawi, @albertoperdomo2, @0z5a, @jacklin78911-collab, @lzhan011, @Alex-ai-future, @freyfwt, @ZhengGong-amd, @mindungil, @amasen02, @devtyagi3909, @wenjinhust, @jbyczkow, @AdaAibaby, @harshit-sarvam, @vineethsaivs, @tripathiarpan20, @sashko-zakharchuk, @semerandre, @rebklee, @git-jxj, @cjackal, @xinnywinne, @andrewor14, @kyleliang-nv, @thillai-c, @dongluw, @ChuanLi1101, @omerpaz95, @jiaran-king, @liuyao0322, @coderfornow, @drakosha, @laulopezreal, @melcheikh, @shantipriya-amd, @Rukhaiya2004, 계속: @yuchenwang3, @lxy-alexander, @tlrmchlsmth, @HieDean, @Zoe923, @YCH188, @amd-sriram, @andylolu2, @MicheleCampi, @sdougbrown, @vMaroon, @shimib, @andakai, @thegoldenflow, @Levius-Fubuki, @olka-amd, @limitmhw, @yuwenzho, @adenzhou1350, @Josephasafg, @kylesayrs, @jdebache, @kaijunli-infr, @afierka-intel, @frida-andersson, @bnellnm, @ys2025-AI, @waizuichougou, @touch869, @rjrock, @sawsa307, @pavelzak, @ScarWar, @fadara01, @Mi-Jiazhi, @dilberx, @mahird3, @Zyann7, @roikoren755, @YukioZzz, @Ronnie-Rui, @acsoto, @czhu-cohere, @twu3202, @oliverholworthy, @weitliao, @sergiofigueras, @tuukkjs, @Sip4818, @karen-sy, @garrett361, @GirasoleY, @Navjot10, @taking-lying-flat, @wangyicong52, @majunze2001, @gangula-karthik, @ubwzwd, @linnea-lin-00638949, @kushaldabbe, @Yatimai, @guanxingithub, @jiakangkangfuzhe, @MichaelLapshin, @jhu960213, @tpopp, @mganczarenko, @qiching, @tangzzycc, @lijipeng787, @nikhilkulkarni1755, @QwertyJack, @Ankit-Jaiswal-AMD, @vorapolsiloai, @Dao007forever, @BPbruce, @divyvasal, @simpleqt, @blipbyte, @jhaotingc, @karya0, @farzad-elastix, @grYe99, @talorabr, @jackLei0901, @Yejing-Lai, @Priyjain-amd, @KEYS-A15, @LinzeShi, @bohnstingl, @nightcityblade, @vcave, @AARONKANG04, @CZT0, @snadampal, @microslaw, @haosenwang1018, @netanel-haber, @khushali9, @sammaji, @SIDDARTHAREDDY8, @100milliongold, @gongwei-130, @fululi12, @mkunredd, @mrodden, @noooop, @valarLip, @shallow10, @200lz, @askliar, @chuan932, @Monishver11, @YashasviChaurasia, @gokay-ai, @jiacao-amd, @yousafshah, @positive666, @TQCB, @lk-chen, @Ricardo-M-L, @huthvincent, @baljinderhothi-cohere, @vschandramourya, @kwen2501, @xiao-llm, @zhecfy, @Willian-Zhang, @simon-veitner-redhat, @mevince, @voidxb, @hongxiayang, @YannikHinteregger, @V-3604, @Rakul-Chauhan, @frankwang28, @LCAIZJ, @PeganovAnton, @jz-yolo, @QHarshil, @R3hankhan123, @jayzuccarelli, @yannicks1, @BaoYunkai, @xaguilar-amd, @xiaohuguo2023, @wxsIcey, @harshaladhav-amd, @varun-sundar-rabindranath, @kliuae, @LostFox11

원문 출처

vLLM Releases

내용 안내

원문 발행 및 권리는 출처에 있습니다.

기계 번역 · 원문을 참고하세요