أبرز الملامح
يتضمن هذا الإصدار 717 عمليتا إيداع من 307 مساهمين (96 منهم جدد)!
- أداء DeepSeek-V4.1-Flash: أصبح انتباه FlashMLA الضخم مع ذاكرة KV المؤقتة المضغوطة بصيغة NVFP4 من V4.1 هو الافتراضي الآن على SM100 (#56935)؛ أعداد DeepGEMM sparse MQA logits للفهرس (#56254) وMega-Gate الذي يدمج GEMM الخاصة بالبوابة مع اختيار الخبراء (#56266)؛ تدمج حدود فك الترميز الـTP all-reduce وإعداد مدخلات mHC (#57643) وإتمام MoE (#58586)؛ WO-A مدموجة للدفعات الصغيرة مع RoPE العكسي وترميز MXFP8 على SM100/SM103 (#58634)؛ الـMXFP8
wo_bبصيغة MXFP8 مع reduce-scatter متوازي التسلسل (#57428)؛ توزيعwkvفي Engram عبر رتب TP (#58678) ومشاركة جداول Engram المضيفة عبر نسخ DP المتموضعة معًا افتراضيًا (#57651)؛ رسوم CUDA للمرمِّز لبرج الرؤية (#56625)؛ وإعادة تشغيل SWA المحدودة التي تُبقي KV ذات النافذة المنزلقة خارج التخزين المؤقت للبادئات (#56227). - إعادة التشغيل السريعة: واجهة الأوامر الجديدة
vllm preloadتُشغِّل عفريت ذاكرة الأوزان المؤقتة الذي يُبقي الأوزان ما بعد التكميم مقيمة في ذاكرة GPU عبر إعادة تشغيل المحرك (#56680)، والآن مع توازي البيانات (#57386)، ونماذج MTP المسودة (#57312)، ونقطة نهاية/health(#58552) وانتظار الجاهزية (#58370). لقطات تجريبية للمحرك المهيأ (vllm snapshot create/restore) تستخدم CRIU لاستعادة محرك TP1 مُهيأ بالكامل (#51360). - Model Runner V2 وفك الترميز التخميني: فك الترميز التخميني بنموذج المسودة (#43091) ومعالجات الأعداد المنطقية المخصصة (#56497) على Model Runner V2؛ المُسوِّد الجديد LiLiCorr (#57934)؛ الجدولة غير المتزامنة لـ DFlash (#58065) مع التقاط الحساب المسبق لسياق K/V في رسم CUDA للمسودة (#57632)؛ التحقق التكيفي DSpark لـ Gemma4 (#57263) وفك الترميز متغير الطول لـ Kimi-K3 (#52988)؛ هدف DCP مع مسودة DSpark غير DCP (#56723)؛ ويُحسب الآن ذاكرة MoE أثناء تنميط MRV2، متجنبًا نفاد الذاكرة على نشرات WideEP (#57270, #58411).
- الخدمة على نطاق واسع: الواجهة الخلفية المتوازنة لـall2all في MoonEP لـEP عبر
--all2all-backend moonep(#52101)، توازي سياق التعبئة المسبقة مع توازي البيانات (#57075)، تقليل reduce-scatter متعدد الذاكرة منخفض SM للـ SM100/SM103 (#55072)، وDeepEPv2 مع توازي التسلسل (#57210) وEPLB مع تداخل الخبراء المشتركين (#57236)، واجهة خلفية لنقل الأوزان M2N عبر NCCL واعية للتقسيم للتعلم المعزز (#51520)، واكتشاف ضغط الظهر لتفريغ KV (#50045). - ضوابط الجدولة:
--max-num-active-seqsتتحكم في قبول RUNNING بشكل مستقل عنmax_num_seqs(#56758),--long-prefill-token-thresholdيتكيف الآن مع عدد التعبئات المسبقة المنتظرة بدلًا من تقسيم طلب منفرد (#57951, #58459)، وأُعيدت هيكلة قائمة الانتظار بحيث تُجدول الطلبات التي تحتفظ مسبقًا بكتل KV أولًا (#58947)، وأُصلح طريق مسدود بين موصل KV وMTP تحت ضغط KV (#57104). - تحصين HiSparse: صفوف تحقق MTP تُحل عبر نواة إقامة موحدة (#59235)، إصلاح انهيار قبول MTP تحت الرسوم الكاملة FULL (#59309)، لا صفحات GPU دون دعم مضيف (#59036)، إصلاح جمود حي للإيقاف المسبق في التعبئة المسبقة المقسمة (#59494)، تحجيم ذاكرة KV المؤقتة من المجموعات التي يخصصها HiSparse (#59450)، وإصلاحات نشر البادئة على المضيف وتبني البادئة على GPU (#59007, #59282).
- الأمان: يُرفض كل من
mm_processor_kwargsوmedia_io_kwargsلكل طلب ما لم يُضبط--trust-request-mm-kwargs(#58830)؛ تُوسم مفاتيح ذاكرة البادئة الإضافية بالمصدر بحيث لم يعد بإمكان اسم LoRA وcache_saltالتصادم (#51899)، ومسار LoRA أصبح جزءًا من هاش الكتلة (#59335)؛ لم تعد مدخلات ذاكرة الاستقبال متعددة الوسائط القديمة قادرة على استبدال الحمولات الطازجة (#57833). - تغييرات جوهرية: وسائط kwargs متعددة الوسائط لكل طلب تم تقييدها (#58830)؛
tokenizer_mode="slow"تمت إزالته (#58545)؛--enable-mamba-fine-grained-prefix-cacheأُعيدت تسميته إلى--enable-mamba-shared-prefix-checkpoint(#57382)؛ التكميم عبر الإنترنت من خلالquantization="fp8"استُبدل بالاختصارfp8_per_tensor(#53585) وأُزيل التكميم الصامت عبر الإنترنت من Quark (#51800)؛ وأُزيل الواجهة الخلفية AllSpark INT8 W8A16 (#58001)؛--enforce-eagerأصبح يعطّل أيضًا التسخين المسبق لنواة JIT (#58197)؛ رسوم XPU مُمكّنة افتراضيًا معVLLM_XPU_ENABLE_XPU_GRAPHتمت إزالته (#51600).
مخرجات الإصدار
حزم Python Wheels
| المنصة | التثبيت |
|---|---|
| PyPI (CUDA 13.0) | pip install vllm |
| PyPI (CUDA 13.0, uv) | uv pip install vllm --torch-backend=auto |
| ROCm | pip install vllm --extra-index-url https://wheels.vllm.ai/rocm/0.31.0/rocm723 |
| XPU | uv pip install vllm --extra-index-url https://wheels.vllm.ai/0.31.0/xpu --extra-index-url https://download.pytorch.org/whl/xpu --index-strategy unsafe-best-match |
صور Docker
| المنصة | صورة Docker |
|---|---|
| CUDA 13.0 (الافتراضي) | docker pull vllm/vllm-openai:v0.31.0 |
| CUDA 12.9 | docker pull vllm/vllm-openai:v0.31.0-cu129 |
| ROCm | docker pull vllm/vllm-openai-rocm:v0.31.0 |
| CPU | docker pull vllm/vllm-openai-cpu:v0.31.0 |
| XPU | docker pull vllm/vllm-openai-xpu:v0.31.0 |
ملفات أخرى
ملفات الإصدار الجاهزة متوفرة في قسم Assets أسفل هذه الصفحة، بما في ذلك: - حزمة tarball للتوزيع المصدري - حزم Python الخاصة بـ CUDA 129.9 — ملاحظة: حزم CUDA 12.9 Python لمعماري x86_64 و arm64 - حزم CUDA 13.0 Python لمعماري x86_64 و arm64 - حزم CPU Python لمعماري x86_64 و arm64 و macOS - حزمة XPU Python لمعمارية x86_64
دعم النماذج
- قدرات النماذج الجديدة: وضع التوليد المهيكل DiffusionGemma مع خيارات أحادية الرمز محدودة (#57250)، MiMo V2 MXFP4 MoE، موجه BF16 MoE ومسودات DFlash (#57784)، الحالات المخفية المساعدة في Cohere2MoE لمولدات المسودات EAGLE3/DFlash (#49819)، GLM-5.2-MXFP4 على مسار ROCm الخاص بـ DeepSeek-V3.2 (#51915)، نقاط التحقق AMD-Quark مختلطة الدقة DeepSeek-V4.1-Flash-MXFP4 (#57071) و GLM-5.3-Flash Quark MXFP4 (#56176)، و
granite_thinking_parserمدمج لـ Granite 4.2 (#55957). - DeepSeek-V4.1-Flash: انتباه FlashMLA mega مع ذاكرة KV المؤقتة المضغوطة NVFP4 كافتراضي لـ SM100 (#56935)، لوغاريتمات DeepGEMM sparse MQA في المفهرس (#56254)، Mega-Gate (#56266)، دمج TP all-reduce + إعداد مدخلات mHC (#57643) مع دمج MoE finalize فيه (#58586)، WO-A مدمج للدفعات الصغيرة (#58634)، MXFP8
wo_bGEMM + reduce-scatter (#57428)، معاملات mHC متداخلة للدفعات الصغيرة في TP (#57603) مقتصرة على رسومات CUDA الكاملة FULL (#57874)، Engramwkvمقسم عبر TP (#58678)، عمليات بحث Engram متسلسلة مع جداول مضيف huge-page (#56926)، جداول Engram مشتركة افتراضيًا عبر نسخ DP (#57651، #57914، #59068)، دمج MegaMoE أصلي للخبراء المشتركين دون حشو (#56568، #57204)، تجهيز MegaMoE أسرع وجمع NVFP4 cache (#57604)، استعادة مسار RMSNorm + MXFP8 المدمج للاستعلام (#57679)، إدراج سياق DSpark للـ KV فقط (#56441)، رسومات CUDA لمرمز الرؤية (#56625، #58499)، إعادة تشغيل SWA محدودة (#56227)، استعادة SWA السببية للصور لمطابقة المرجع (#57152)، خرائط جهد الاستدلال المحدّثة (#58316)، وإصلاحات بدء التشغيل لكتل المرشحين ذات درجات NaN (#57454)، مؤشرات DeepSelect (#58215)، انتباه DSpark غير السببي على FlashInfer (#57432)، JIT في وقت التشغيل لمخازن المرشحين المؤقتة (#57667) والاستيراد دون Triton (#57654). - DeepSeek V4: FlashInfer sparse MLA مع RoPE عكسي مدمج + تكميم FP8 (#58621)، إسقاطات WKV للسياق DSpark مكدسة (#54674)، توزيع خبراء MoE مدمج محسوب من مجموعة EP (#57465)، إكمال FIM عبر
suffix(#44229)، تحليلstring=المفقودة في استدعاءات الأدوات (#56271)، إرفاق أدوات الطلب برسالة نظام قائمة (#51856)، الحفاظ على تباعد كتل الصور (#56882)، وفصل عرض DSpark عن التحقق من مراحل MTP (#54631). - GLM-5.3-Flash: خلفيات sparse اختيارية FlashAttention و FlashMLA على SM90 (#55385)، NoPE sparse MLA على خلفية FlashInfer SM120 (#55277)، top-k تعاوني للدفعات الصغيرة في فك الترميز (#57327)، مساحة عمل مفهرس فك الترميز محسوبة حسب الطول المجمّع (توفير 3 GiB، #57701)، عمليات بيانات وصفية أسرع بـ 1.6-4.8x (#58450)، تعيين خانة ذيل kpool مدمج (#57534)، kpool top-k عبر المرسل المشترك (#57546)، تقليل عبء تحضير sparse MLA (#57458)، لا مزامنة D2H في خطة SM90 sparse MLA تحت الجدولة غير المتزامنة (#58684)، FlashKDA يحافظ على الحالة المتكررة بدقة FP32 للـ prefills الطويلة (#58846)، وإصلاحات صحّية لـ kpool corruption مع فك الترميز التخميني (#58454)، عدم تطابق SM90
index_kpoolmismatch (#58704)، خطوات ذيل kpool (#57477)، مطالبات من 500k token (#57317)، طبقات MLP الكثيفة تحت التوازي التسلسلي (#58061)، اختيار خلفية المفهرس top-k (#58594) وإطلاقات varlen paged MQA (#55270). - Qwen3.8-Flash-Next (Qwen4Exp): ذاكرة KV رئيسية FP8 على مسار QSA (#55557)، FP8 TP مع FlashInfer TRTLLM MoE (#55867)، ضبط SM90 QSA (#57273)، دمج HC down projection + SiLU (#58957)، تقليل عبء بيانات PLE الوصفية (#58114)، إصلاح تجزئة مساحة عمل مفهرس QSA (#57105)، تحرير ذاكرة KV المؤقتة أثناء التنميط (#58961)، إبقاء معرفات الجلب المسبق PLE المثبتة خارج مخزن CUDA graph (#58489)، وبحث تعيين الخبراء المفهرس موفرًا حوالي 25 ثانية من تحميل الأوزان على DGX Spark (#58720).
- Kimi K3 و MiniMax-M3: مدمج رقع الرؤية Kimi-K3 كـ GEMM (#58527)، QK RoPE مدمج لـ KimiViT (حتى 29x، #58651)، تكميم الخبراء الموجهين (#57430)، إصلاحات محلل الاستدلال (#57098) وعدّ رموز الاستدلال (#58372)، تحديث مؤشرات KV لسياق DSpark بعد إعادة الربط (#58814)، الكتل الأولى عديمة الحالة لم تعد تُصنّف كـ decodes (#51483)، وتقديرات كتل Mamba التي لم تعد تعيق القبول عند إصابات البادئات الخارجية (#57050)؛ رسومات CUDA لمرمز MiniMax-M3 (#58673)،
Conv3dLayerدمج الرقع (حوالي 62x، #58512)،triton_mropeفي برج الرؤية (#58526)، وتوجيه MiniMax2 مدمج مع تحجيم غير وحدوي (#58880)، وإصلاحات المعالج (#58460، #59613). - DiffusionGemma: نواة إحصاءات أخذ العينات بتمريرة واحدة (#58226)،
diffusion_constrainedقراءات فوقlogprob_token_ids(أسرع بنحو 25%، #58216)، صفوف لوغيت أقل للدفعات ذات التعبئة المسبقة فقط (#57416)،logprob_token_idsدعم (#57417)، وإصلاحات للـ logprobs المتزامنة (#57414)، وdtype الاحتياطي في وضع eager (#57462)، والمدخلات متعددة الوسائط (#57589)، ورؤوس LM المُكمَّمة (#48521) والتنفيذ على CPU (#58964). - متعدد الوسائط: Triton
mm_input_normkernel (#56798، #56711)، والحفاظ على البكسلات الخام عبر مسار ViT المجزأ بـ DP (#56872)، واحترام fps لفيديو Qwen2.5-VL في M-RoPE الزمني (#47736)، ومقاطع Whisper وQwen2-Audio الأطول من 30 ثانية (#57769، #56912)، وشبكة العناصر النائبة لـ Mistral3 (#53758)، والرقع غير المقسمة لـ Idefics3 (#48760)، ورموز Ovis2.5 (#52623)، وأوزان الخبراء لـ Aria (#57487)، وFP8 المدمج لـ MiMo-V2.5qkv_projالتقسيم الشرائحي (sharding) (#57508)، Gemma4AutoWeightsLoader(#55911) والمقاسات القياسية للـ buffer (#54213)، وGemma4 FP8 KV مع FA4 عند head dim بقيمة 512 (#53175)، وLaguna RoPE (#57189)، وتراجع دقة Mistral-Large-3 (#57563)، وEXIF التالفة (#56527, #57234)، وتسميات JinaVL (#57347)، وتوجيه Sarvam MLA مع logits للموجه FP32 (#56034)، ودرجات انتباه CohereASR المدمجة (#55190)، والالتفاف المجموعاتي المدمج DFlash2 (#55960). - LoRA: نماذج لغة Nemotron VL (#56231)، وModernBert (#57148)، وتضمينات VoyageQwen3 (#57708)، وتصنيف المتتاليات RoBERTa (#58884)، و
modules_to_saveرؤوس التصنيف التسلسلي (#53555) مع لكل مُحوِّلnum_labels(#57766).
نواة المحرك
- مشغّل النماذج V2: فك التشفير التخميني بنموذج المسودة (#43091)، ومعالجات logits مخصصة (#56497) تم التحقق منها عند القبول (#57728)، ومدخلات وهمية عشوائية (#58411)، ورموز وهمية موجهة إلى خبراء MoE أثناء التنميط (#57270)، ورسوم FULL decode لنهايات المطالبات ذات الرمز الواحد (#58400)، وخرائط token-to-request مشتركة (#57102) وإعادة استخدام بيانات Mamba/GDN الوصفية عبر مجموعات ذاكرة التخزين المؤقت KV (#58762)، ورسوم CUDA للمرمِّز فقط لـ ViT (#56922)، ومزيل الأوزان (#57834) ونموذج التجميع (#57737) تم إطلاقهما عند الإغلاق، وإصلاحات لـ MTP KV متعدد الطبقات في P/D (#55055)، والقبل السريع مع LoRA (#56456)، وكتابات جدول الكتل القديمة من خطوات المسودة الوهمية (#56734)، ونهايات المطالبات المبطنة في النماذج الهجينة (#58434)، وخانات المسودة التي لم تُقترح مطلقًا (#58784)، والملاءمة التلقائية
max_model_len(#58149) وintermediate_tensorsأثناء الالتقاط (#57745). - فك التشفير التخميني: مسوّدة LiLiCorr (#57934)، والجدولة غير المتزامنة لـ DFlash (#58065) وسياق K/V في رسم CUDA الخاص بالمسودة (#57632)، والتحقق التكيّفي DSpark لـ Gemma4 (#57263)، والتحقق التكيّفي متغير الطول لـ Kimi-K3 (#52988)، وإزالة المزامنة بين CPU وGPU للمفردات غير المتجانسة (#57396)، وتجنّب إعادة ترجمة Triton في مقدّر القبول (#57107)، وإصلاحات للمسودات EAGLE/الكثيفة مع EP (#56930)، ودفعات التنميح لـ DFlash/DSpark (#56448)، وذاكرة رأس MTP لـ GLM (#55442)، وتضمينات المطالب مع المسودات (#57356)، وفك الترميز السببي متعدد الرموز في TritonMLA (#51065).
- المجدول:
--max-num-active-seqs(#56758)، تكيّفي--long-prefill-token-threshold(#57951, #58459),skipped_waitingاستُبدلت بقائمة انتظار تنتظر ومتحفظة بـ KV (#58947)، والقبول الذري لـn > 1طلبات (#53936)، وموصل KV + حالة توقف تام في MTP (#57104)، وهاوية في معدل النقل عندماmax_num_seqsليس من مضاعفات الرقم 8 (#57355)، واستمرارات البث التي تحتفظ بـ logprobs وتحدّث الحد الأقصى للرموز (#57447، #57676)، وسباق بين طلب قابل للاستئناف والجدولة غير المتزامنة (#58259)، واستطلاع غير محجوب لقواعد المخرجات المهيكلة (#55931). - التخزين المؤقت للبادئات والنماذج الهجينة: مفاتيح إضافية موسومة بالمصدر (#51899) ومسارات LoRA مُلبَّدة (#59335),
--enable-mamba-shared-prefix-checkpoint(#57382)، وإصابات ذيل المطالبة مع استعادة MTP (#58368)، ونقاط تفتيش نهاية المطالبة محفوظة ضمن الاحتفاظ المتناثر (#59146)، وحجز نقاط تفتيش في وضع align (#59175)، وقطع GDN الأولى عديمة الحالة (#51565)، ومجموعات مسودة MTP لذاكرة KV المؤقتة موسومة على مسار التجميع الهجين (#55390)، وبانٍ معمَّم لنقاط تفتيش prefill (#57783)، وحفظ حالات Mamba2 لتعبئة prefill على دفعات دون مزامنة GPU-CPU (#49371),skip_reading_prefix_cacheمحترمة لإصابات الموصل (#57269)، وتلبيد كتل متعدد الوسائط تزايدي (#51694)، وحجم كتلة KV تدعمه جميع خلفيات الانتباه (#49845) مع رسائل أخطاء أوضح (#58557), وCacheConfig.effective_attention_block_sizeلـ DCP (#56538). - الإقلاع والذاكرة: ترجمة إحماء Triton متوازية (#58582)، وتعطيل الإحماء عبر JIT في ظل
--enforce-eager(#58197) ما لم تكن التسامح مع الأخطاء مفعّلاً (#58593)، وإحماء DeepGEMM يعيد استخدام مساحة عمل MoE (#57268)، وتجزئة المُخصِّص لم تعد تقلص ذاكرة KV المؤقتة أثناء التنميط (#58430)، ومخازن prefill المتناثرة محجوزة قبل تحديد حجم KV (#57575)، وإطلاق مشاهدات مساحة عمل FlashMLA القديمة (#56902)، ومساحة عمل DeepGEMM FP8 مُنقَصة إلى النصف (#53914)، ومساحات عمل Marlin/Humming مشتركة (#57421)، وتحويل أوزان FlashInfer BF16 MoE في المكان (#54699)، وخيوط إقلاع UniProc محدودة بحصة المعالج (#58946)، وخيوط وقت التشغيل تُضبط قبل التنميط (#55891). - الأنوية: الترشيح المُعايَن لـ top-k الدائم (#56346)، ومولّد عشوائي Murmur3 لأخذ عينات Gumbel (#51367)، وتكميم 8-بت لكل مجموعة رموز مقيّم بالسجلات (#55330)، وحساب abs-max لـ FP8 لكل موتر متجهي (#58194)، وموزِّع أنوية Triton لتجاوزات خاصة بالمنصات (#43048),
GateLinearلجميع نماذج MoE (#58234)، وتخطي خانات الخبراء غير المحلية فيTritonExperts(#58051)، وتأجيل إنهاء top-k في TRT-LLM-Gen على المسار المعياري (#58635)، وإعدادات matmul ثابتة تجاه الدفعات لـ SM120 (#57456)، ومخدش إزالة التكميم لـ prefill في FlashInfer محدود الحجم (#57918)، وإصلاحات لـ NaNs في softcap في Triton (#56579)، وتحويلات QuIP Hadamard (#43462)، وCUTLASS FP8 linear على A100 (#55884)، وأخذ عينات FlashInfer على وحدات معالجة رسومية غير مدعومة (#48956)، وحشو مقاييس FP8 كتلية لـ SM100 (#57377)، والتقاط prefill للرسوم المختلطة FULL (#58275)، ومطابقة أنماط العمليات المخصصة في Inductor (#58189)، واختلاف CuteDSL BF16 GDN prefill عن FLA على Qwen3.5 (#53864)، وSM100fp8_ds_mlaذاكرة التخزين المؤقت (#49435)، ودفعات فك الترميز غير المنتظمة في مفهرس المصفوفات المتناثرة (#52500)، والأقنعةallowed_token_idsالقديمة بعد إعادة ترتيب الدفعة (#48419، #43931)، وprompt_embedsالموترات المحتفظ بها بعد انتهاء الطلبات (#57988). - ثبات الدفعة (Batch invariance): رسوم CUDA قابلة للتعطل دون torch.compile افتراضيًا تحت
VLLM_BATCH_INVARIANT(#57586)، وتوازي التسلسل وTP غير المتزامن معطّلان (#56377)، مع بقاء تجميعات NCCL 2.31 مفعّلة (#58179). - السكون والتعلم المعزز (Sleep and RL):
release_kv_cache_memory()يحرر ذاكرة KV cache فقط (#44890)،--sleep-preserve-parameter-namesيحتفظ بالأوزان المجمدة عبر سكون المستوى 2 (#57891)، ونقل أوزان NCCL M2N (#51520)، وتحديثات أوزان DP الكثيفة حسب فهرس DP (#56950)، وإبقاء إعداد الموزّع عند تبديل المقاطع القابلة للتوسيع (#57982)، ونشر حالات فشل إعادة تعيين الذاكرة المؤقتة أثناء السكون (#54581). - إعادة التشغيل السريع:
vllm preload(#56680)، وDP (#57386)، ومسودات MTP (#57312)، وانتظار الجاهزية (#58370)،/health(#58552)، وأوزان ModelOpt MXFP8 المعالجة مسبقًا (#57316)، ولقطات المحرك المهيأ (#51360). - التسجيل والرصد:
LoggingConfigعبر--logging-configو--log-level(#57205)، وإصلاحات تسجيل JSON (#57957، #58747)، وإصلاح قمع سجل بدء التشغيل (#51366)، وتوصيف torch موحّد واعٍ بالمنصة (#57460)، وعدم ظهور معدل إصابة بادئة 0.0% قبل أي استعلام (#54990)، وتنسيق مقاييس نقل KV (#57068)، وحساب حجم تنشيط MFU من نوع بيانات النموذج (#57070)، وفحوصات متغيرات البيئة القابلة للتجاوز حسب المنصة (#48599)،VLLM_TARGET_DEVICE=empty pip install vllmللواجهات الخلفية خارج الشجرة (#41074)، والإبلاغ عن إصدار vLLM الصحيح عند التثبيت من المصدر (#57295، #57744).
الخدمة على نطاق واسع
- اتصالات MoE: واجهة MoonEP الخلفية (#52101)، وDeepEPv2 مع توازي التسلسل (#57210) وتداخل EPLB + الخبير المشترك (#57236)، وreduce-scatter متعدد الوسائط منخفض SM (#55072)، وإحصاءات حمل EPLB أثناء توسيع Elastic EP (#58473)، وتخطي الصفوف المبطنة لـ SP في التوجيه المجمّع بحيث لم يعد المرتبة 0 متأخرة في المعالجة التمهيدية (#56079)، ورفض التوجيه بالتجزئة على الواجهات الخلفية الأحادية غير المدعومة (#57867)، وتخطي بث الرموز المعيّنة تحت PP للطلبات المغادرة للمحرك (#58542)، وDBO مع توصيف DeepEP منخفض الزمن (#57502)، وموازن تحميل خارجي مع نسخ مكررة تتشارك العقد (#53743)، وعدم وجود RPC حاجز أثناء مصافحة المحرك (#57226) أو انتظارات غير محدودة لرموز المسودات (#58779).
- توازي السياق: PCP مع DP وEP وMTP (#57075)، وهدف DCP مع مسودات DSpark/DFlash غير DCP (#56723)، وأطوال تسلسل DCP دون مزامنة CPU-GPU (#58169)، وسحبات NIXL DCP عبر مناطق MLA cache (#57389).
- موصلات KV: دفع المعالجة التمهيدية بتوازي الأنابيب عبر NIXL لـ attention-HMA (#50494) وتخطيطات MLA المعبأة (#50499)، وفصل مقاييس فشل النقل عن انتهاء صلاحية KV (#55854)، وتحرير حالة الأقران الميتة دون انتظار TTL (#50047)، وحصاد العهود منتهية الصلاحية خلف رأس نابض بالنبضات (#58292)، واستعادة إتمام الدفع (#58188)، وتسجيل نشاط الجانب D (#52245)؛ وMooncake
CUSTOM_MEM_POOL(#49300)، وحالات فشل التحميل على مستوى الطلب تحت HMA (#56855، #57174) وإعادة محاولة bootstrap (#58919)؛ وحالة Mamba/KDA الهجينة في MoRIIO بوضع READ (#51052) وتسابق توجيه متعدد فك الترميز (#51681)؛ وإصابات ذاكرة المعالجة التمهيدية فيprompt_tokens_details(#54222)؛ وناشرو أحداث KV المرتبطون بالمنفذ 0 (#55844)؛ واستعادة GET لبيانات وصف KV cache للمستهلكين الخارجيين (#56925)؛ وأحداث KV للأجزاء الجزئية التي تحتفظ بكل ميزات الوسائط المتعددة (#58288)؛ والحفظ المكتمل في خطوات بدون تمرير أمامي (#57775)؛ وآمن الإجهاضExampleHiddenStatesConnector(#56841)؛ وتعبئات FP8 في DecodeBench (#58472)؛ ومغلف طلبKvHints(#53423)؛ وموصل AuxOutput لمخرجات الخبراء الموجّهين (#45635، #58150، #58205). - تفريغ KV: لكل طلب
max_load_tokens(#55885)، وكشف الضغط العكسي (#50045)،SimpleCPUOffloadConnectorمقاييس Prometheus (#57251)، وتخطي مجموعات non-prefix-cacheable (#56810) وscratch (#57145)، وتخطيطات مكررة لـ MLA متعدد المجموعات (#57652)، وتسجيل المناطق التي تبلغ 512 GiB أو أكثر على شكل أجزاء (#51081)، وفحص ذاكرة cgroup قبل تخصيص SHM (#54014)، وإصلاحات لحداثة الذاكرة المؤقتة (#51787)، والنوافذ المنزلقة المحتفظ بها بواسطة MTP (#56709)، وصفوف MLA القياسية (#56799)، وبيانات وصف الأحداث (#57453) وذاكرة ROCm المثبتة (#57160). - HiSparse: نواة الإقامة الموحدة لصفوف MTP (#59235)، وقبول MTP تحت الرسوم الكاملة FULL (#59309)، وتخصيص مدعوم من المضيف (#59036)، والجمود في الاستباق (#59494)، وحجم KV cache (#59450)، ونشر البادئات من المضيف (#59007)، وتبنّي البادئات على GPU (#59282)، ومقاييس الإقامة (#58725).
- توزيع المشفّر (EPD): وكيل EPD ديناميكي مع تسجيل مُدار عبر المشغّل (#54176)، وتجميع طلبات الصور لكل مُرمِّز (#57095)، وتخزين مؤقت عبر المُرمِّزات من خلال Mooncake (#56242)، ومدخلات صوتية للبيانات الوصفية فقط (#57887)، وتخطي شظايا نموذج اللغة لـ
--mm-encoder-only(#58086)، ومقاييس موصل EC (#54960)، وإصلاحات خاصة بالمُرمِّز فقط (#58490، #58287، #57696).
العتاد & الأداء
- NVIDIA: FlashInfer 0.7.0.post1 (#58069، #59323)، وترقية تثبيت DeepGEMM مع إصلاحات SM120 (#57218)، وصور ليلية لـ Rubin مع CUDA 13.4 (#55953)، وبناءات QuTLASS مع PyTorch 2.13 (#58173).
- AMD ROCm: AITER v0.1.23 (#56885, #58867)، وtorch 2.13 وTriton 3.8 (#50605, #58006)،
triton_kernels3.8 MXFP4 MoE لـgpt-oss وDeepSeek-V4 (#55934)، وإصلاح انهيار مقطعي (segfault) في مضيف ROCR (#57328)؛ وتدفق مزدوج HCA لـDeepSeek-V4/V4.1 (#56853) وتداخل CSA2 واعٍ للطبقات (#57407)، وFP8wo_a(#54894)، ودمج RoPE العكسي في تقليل فك الترميز المتناثر (#57435، #57451) والذي يُصدر الآن MXFP8 لمجموعة FP8wo_aمجمّعة FP8 (#58456)، وMXFP8 GEMM بمقاييس 32x32 أصلية على gfx950 (#58510)، وإعادة استخدام بيانات top-k الرّثّة (ragged) الوصفية (#57434)، واختيار أسرع لكتل المرشحين (#58208)، وجداول Engram في ذاكرة المضيف (#57491) وجداول Qwen3.8-Flash-Next PLE منقولة إلى ذاكرة المضيف (#57497)، ومسار AITER ASM اختياري لفك الترميز مع DCP + فك الترميز التخميني (#56861)،get_top_tokens()على مُسوّد MTP في DeepSeek V4 (#57568)، وتحقّق تكيّفي DSpark (#52362)، واختياريVLLM_DSV4_LOGITS_FIXلـlogits المفهرس المتناثر على gfx950/gfx942 (#50455)، وتراجع عن #56433 و#51692 لأسباب دقة (#57132)، وأخطاء واضحة لـFSE مع DPA+ETP (#57919)؛ وkernels Kimi-K3 a4w4 FlyDSL (#53940) معVLLM_ROCM_USE_AITER_MOE_SITUV2=a16w4|a8w4|a4w4(#58201)، وفك ترميز تخميني KDA بتزامن منخفض (#58045)، وMoE كامن مجزّأ تحت EP (#54956) ونسخ إسقاط أقل (#50592)؛ ومسار ROCm Hy4 مع torch.compile (زمن فك ترميز أقل بـ13 مرة، #57526)؛ ودمج QK-norm لـAITER في MiniMax-M3 (#54535)، وإدخال K/V بدون نسخ (#56849) وإصلاحات MXFP8 (#53674, #58089)؛ وإصلاحات إقلاع GLM-5.3-Flash (#57192, #57252, #57425)؛ وAITER QuickReduce + RMSNorm (#48249)، وBF16 AsyncTP (#58098)، ودمج ثابت لمخرجات انتباه FP8 (#58099)، ودمج QK-norm/RoPE/KV-cache لـMRoPE (#50212)، وAITER GDN decode للتخطيطات المسطحة (#53623)،wvSplitKلـGEMMs بمخرج واحد (#53283)، و69 نسخة أقل في كل خطوة فك ترميز على مسار skinny GEMM (#58566)، وlookup GEMM مضبوط عبر AITER (#55001)، وبلاطة KV prefill أضيق لـTriton على RDNA3/RDNA4 (#58225)، ونسخ H2D كبيرة قابلة للترحيل على مراحل (#56343)، وإصلاحات لحشو MXFP4 MoE الذي يستنزف KV cache (#56359)، وAITER MLA FP8 prefill OOM (#57923)، وإزالة المقاييس لذاكرة تخزين غير مكمّاة (#56726) وAITER MoE fallbacks (#56590, #57866, #57426).VLLM_ROCM_USE_AITER_FP4_ASM_GEMMمُستعاد ومعطّل افتراضيًا (#57055)؛ وإعادة التشغيل المحدودة SWA معطّلة على ROCm (#57906). - Intel XPU: PyTorch 2.14 (#56013)، ورسوم XPU مفعّلة افتراضيًا (#51600)، وEPLB (#44987)، وint8 W8A8 MoE على Triton (#53162)، وثبات الدُفعات (#55881)، وتضمين دواري SYCL (#55721)، ودمج QK RMSNorm + RoPE + gate (منطقة فك الترميز أسرع بنسبة 55%، #56096)، ومُعيّن العينات Model Runner V2 (#57277) وتحكم PP microbatch (#55145)،
--device-idsمُراعاةً (#56015)، وإصلاح تجاوز مؤشر الجهاز (#54514). - CPU: FP8 W8A8 خطي وMoE لـIntel Diamond Rapids (#49942)، وانتباه صفحات Arm أسرع بنسبة تصل إلى 25% (#56045)، وZen DA8W4 int4 للطبقات الكثيفة وMoE (#54024)، وzentorch SDPA لانتباه المُشفّر (#54508) وMLA prefill (#54967)، ومصاريد انتباه FP32 (#56252)، وW8A8 INT8 MoE على POWER (#55316)، وW4A16 Whisper (#58268)، وحزم wheels مبنية على Ubuntu 22.04 (glibc 2.34) مع AMX-FP8 (#58515)، وAVX10.2 مشروط بدعم المُجمّع (#58133)، وTriton CPU مُعدّ مسبقًا (#58140)،
--device-memory-utilizationalias (#56547)، وvLLM Recipes في صورة CPU (#58796, #57306)، وتثبيت protobuf لـs390x (#54978) وtorchcodec للفيديو (#58693)، وإصلاحات لـMinistral FP8 (#56985)، وأوزان موجّه FP32 (#56168)، وإخفاقات استيراد zentorch (#54923)، وmacOS multimodal SHM (#57142)، وتقارب CPU لكل رتبة محلية (#53636) وتخطيط حالة NIXL GDN (#53300).
الكمّنة (Quantization)
- Humming: تحويلات Hadamard والكمّنة الفورية NVFP4/MXFP4/MXFP8 (#56685)، وwNaM غير متماثل عبر compressed-tensors (#46528)، وhumming-kernels 0.1.16 (#58054)، وHumming في وسيط MoE لـW4A8 (INT4xFP8) (#58427).
- قدرات جديدة: تصديرات Quark W4A16 INT4/UINT4 أصلية (#48606)، وإزالة كمّنة MXFP4 وقت التحميل اختيارية (#50814)، وواجهات خلفية NVFP4 MoE صريحة لكل رمز (#57176)، وتخطيط N-first قياسي لـcompressed-tensors WNA16 MoE (#52798).
- الإصلاحات: MXFP8 على الطبقات دون حدود
mm_mxfp8الأبعاد (#54223)، ومقاييس NVFP4 الفورية عند إعادة التحميل (#57954)، وبيانات وصفية خطية لرأس LM (#58444)، ومسار الكمّنة الكتلية المدمج SiLU-mul المتجاهل تحت SwiGLU clamp (#57984).
API و&الواجهة الأمامية
- خيارات ونقاط نهاية جديدة:
--tool-strict-level(#56268),response_formatمعtool_choice=auto(#56086)، وإكمالات FIM لـDeepSeek-V4 (#44229)،release_kv_cache_memory()وPOST /release_kv_cache_memory(#44890)، وتقييم prefill برموز ثابتة عبرprompt_logprob_token_ids(#54335)، ومقاييس فك الترميز التخميني لكل طلب في/inference/v1/generate(#43310)، ومقاييس لكل طلب (#55084) وcache_write_tokens(#57222) في Responses API، Anthropicthinkingفي/v1/messages(#58613)، البث التدفق للتفكير واستدعاءات الأدوات من نقطة النهاية derender (#50550) مع إزاحة إلغاء الترميز (#57528)،vllm chatالمخرجات التدفقية للتفكير (#57045)، تسجيل تصحيح الأخطاء لنص الطلب مع--enable-log-requests(#58163)، والسطر التلخيصي فقط لسلاسل التوثيق الخاصة بالإعدادات في--help(#57357). - Structured output and parsers: قواعد Lark أصلية في الواجهة الخلفية xgrammar (#58321)، XGrammar 0.2.7 (#57272)، ترحيل Granite إلى محرك المحلل التدفقي (#49648)، وإصلاحات لحدود التفكير (#56635)، وخيارات xgrammar مع أحرف التحكم (#48115)، ومخطط JSON من نوع القائمة (#48416)، وفارغ
structural_tag(#47450)، ومعالجة EOS في outlines (#58612، #57743)، وسجلات logprobs التدفقية الممنوعة من المحلل (#58583)، وأسماء أدوات Inkling بعد التفكير (#58792)، والطولfinish_reasonلاستدعاءات الأدوات التدفقية المبتورة (#46303). - توافق OpenAI وAnthropic وHarmony: أعداد رموز الاستدلال لـ Harmony وDeepSeek-V3 وStep3 (#58626) ولكل جولة أدوات في Responses (#58927)، Harmony
max_output_tokensفي حلقة الأدوات (#58551)، إكمالات الدردشة المجمّعة باستخدام الطلبات المعدّلة (#58929، #58958)، محلل جديد لكل اختيار (#58939)، إعادة عدّ الاستدلال المؤجّلة (#56067)، تنظيف MCP في Responses (#56988) وقيمة افتراضية لـdetailالصور (#57241)، اكتشاف النظام المضمّن في Anthropic (#58754) والتفكير المعطّل مع P/D (#58786)، رفض سلاسل الإيقاف في--tokens-onlyالخوادم (#57058)، رفضprompt_embedsبإرجاع 400 (#55451، #57006)، حدود المطالبات بعد التوسيع متعدد الوسائط (#57076)،--override-generation-configالعقوبات (#50769)، مراجعات Hub (#56092، #57461)، logprobs الكاملة في استجابات token-in/token-out (#58488)، إلغاء التقييم التوليدي (#57729، #58788)، نبضات keepalive عبر gRPC (#55102)، وrun-batchالتفريغ الصوتي المميّز للمتحدثين (#57948). - التجميع (Pooling): حشو التضمين المقطّع (#56505) والتطبيع (#57498)، ترميز رموز إعادة الترتيب مع حدود المستندات (#57666)، والإبقاء على رؤوس عائلة BERT للحصول على logits الخام (#57664).
- الواجهة الأمامية Rust:
--hf-overrides(#56931),--sse-keep-alive-interval(#58306)، أدوار دردشة مخصصة (#58311)، محللات MiMo V2.5 (#57933)، ضوابط استدلال مقيسة (#56998)، قواعد إخراج مملوكة للمحلل (#55269، #57340)، أقنعة أخذ العينات عبر gRPC (#56777)، حجم DP محلي في بيانات gRPC الوصفية معvllm-proto0.3.0 (#57116، #57233)، مدرّج استباق لكل طلب (#57033)، مدرّجات خالية من الأقفال (#58574)، سياق رؤية Nemotron-H (#57634)، معالجات رؤية مملوكة للنموذج (#58109)،mm-processorمعيار أداء (#51922، #58084، #58378)، التعرّف على وسائط serve غير المدعومة (#58330)، لم يعد NaN في logprobs يقتل عميل المحرك (#51026)، قبول حقولEngineCoreOutputالمضافة (#56533)، وvllm-rsعلىPATHفي صورة CUDA (#57606). - معايير الأداء: واجهة خلفية
openai-responsesلـvllm bench serve(#54628) وmodel_idفي ملفات JSON الخاصة بالكمون/الإنتاجية (#58112).
الأمان
- بكل طلب
mm_processor_kwargsوmedia_io_kwargsيُرفضان افتراضيًا؛ النشر الموثوق يفعّلها اختياريًا عبر--trust-request-mm-kwargs(#58830). - تجزئات كتل ذاكرة التخزين المؤقت للبادئات توسّع المفاتيح الإضافية وفق المصدر (#51899) وتتضمن مسار LoRA (#59335)؛ إطار إدخال التجزئة متعدد الوسائط (#54283) والتجزئة التزايدية للكتل تغطي كل خاصية متداخلة (#51694).
- حمولات متعددة الوسائط الجديدة تسبق ذاكرة استقبال قديمة (#57833)، وإصابات ذاكرة التخزين المؤقت للمشفّر بعدد تضمينات غير مطابق تُرفض (#57696).
min_tokensفوق القيمة الافتراضية الممتلئةmax_tokensتُرفض بدلًا من تعليق المحرك (#57731)؛ تعقيم الرسائل يرشّح عناوين الذاكرة بأحرف كبيرة (#58832)؛ رفض محولات LoRA المسمّاة باسم نموذج مخدوم (#59286).
الاعتماديات
- FlashInfer 0.7.0.post1 (#58069، #59323)، Transformers 5.17.0 (#56108) مع حد أعلى في requirements (#59614)، XGrammar 0.2.7 (#57272)،
oss-harmonyاستبدالopenai-harmony(#55128)، وترقية تثبيت نسخة DeepGEMM Fork (#57218)، وترقية FlashKDA (#58846)، وhumming-kernels 0.1.16 (#58054). - تستخدم صور CUDA 12 إصدار LMCache 0.4.4 وCuPy CUDA 12 (#57945)؛ وتُنشر صورة Docker Hub معنونة بشكل منفصل باسم zstd (
-x86_64-zstd) (#55608)؛ وصور Rubin CUDA 13.4 الليلية (#55953). - ROCm: AITER v0.1.23 (#58867)، وtorch 2.13، وTriton 3.8 (#50605، #58006)، وROCR المرمّع (#57328)، وتثبيات LMCache OpenTelemetry (#59056).
- XPU: PyTorch 2.14 (#56013). CPU: حزم wheels مبنية على Ubuntu 22.04 (#58515)، وTriton CPU جاهز مسبقًا (#58140).
التغييرات الجذرية والإيقافات
- لكل طلب
mm_processor_kwargsوmedia_io_kwargsالآن يُرجعان خطأً ما لم يبدأ الخادم مع--trust-request-mm-kwargs؛ أما على مستوى الخادم فإن--mm-processor-kwargs/--media-io-kwargsوغير المتصلLLMدون تغيير (#58830). tokenizer_mode="slow"تمت إزالته؛ حيث كان يتصرف بالفعل مثل"hf"تحت Transformers v5 (#58545).--enable-mamba-fine-grained-prefix-cacheأُعيدت تسميته إلى--enable-mamba-shared-prefix-checkpoint(#57382).- التكميم عبر الإنترنت من خلال
quantization="fp8"يُعاد توجيهه الآن إلى الاختصارfp8_per_tensorعبر الإنترنت (#53585)؛ وأُزيل التكميم الصامت الخاص بـ Quark عبر الإنترنت لـ MXFP4 لصالح واجهة برمجة التطبيقات للتكميم عبر الإنترنت (#51800). - تمت إزالة الواجهة الخلفية AllSpark INT8 W8A16 GEMM (#58001). وأُزيل خيار
return_assistant_tokens_maskمن/renderوحقل الاستجابةassistant_tokens_mask(#57520). VLLM_PLE_CPU_OFFLOADتمت إزالته؛ استخدم--engram-config(#57937).VLLM_XPU_ENABLE_XPU_GRAPHتمت إزالته وتصبح رسوم XPU البيانية مفعّلة افتراضيًا (#51600).- تمت إزالة الصيغة المفصولة بفواصل لـ
--collect-detailed-traces؛ استخدم صيغة القائمة (#55702). - الإعدادات الافتراضية الجديدة:
--enforce-eagerيعطّل أيضًا تسخين نوى JIT ما لم تُفعَّل خاصية تحمّل الأعطال (#58197، #58593)؛VLLM_BATCH_INVARIANT=1يستخدم رسوم CUDA البيانية القابلة للفصل دون torch.compile (#57586) ويعطّل التوازي التسلسلي وTP غير المتزامن (#56377)؛ وإعادة التشغيل المحدودة لـ DeepSeek-V4.1 SWA مفعّلة (#56227) باستثناء ROCm (#57906)؛ وتُشارك جداول مضيف Engram بين نسخ DP المشتركة في الموقع عندما يكون ذلك ممكنًا (#57651)؛ وتُعد FlashMLA mega attention الافتراضية لـ DeepSeek-V4.1 على SM100 (#56935)؛ وAITER w4a4 ASM GEMM معطّل افتراضيًا على ROCm (#57055). - الجمع بين Model Runner V1 وPP > 1 والجدولة غير المتزامنة والمخرجات المهيكلة يُرفض الآن عند بدء التشغيل (#56250)؛
json_objectيُرفض عند التحقق مع الواجهة الخلفية outlines (#57743). transformersلها الآن حد أعلى في المتطلبات (#59614).
المساهمون الجدد
- @0z5a قدم أول مساهمة له في https://github.com/vllm-project/vllm/pull/56441
- @200lz قدم أول مساهمة له في https://github.com/vllm-project/vllm/pull/55528
- @AARONKANG04 قدم أول مساهمة له في https://github.com/vllm-project/vllm/pull/48521
- @acsoto قدم أول مساهمة له في https://github.com/vllm-project/vllm/pull/57314
- @adenzhou1350 قدم أول مساهمة له في https://github.com/vllm-project/vllm/pull/56882
- @adtygan قدم أول مساهمة له في https://github.com/vllm-project/vllm/pull/56325
- @amasen02 قدم أول مساهمة له في https://github.com/vllm-project/vllm/pull/56576
- @amd-sriram قدم أول مساهمة له في https://github.com/vllm-project/vllm/pull/53792
- @andrewor14 قدم أول مساهمة له في https://github.com/vllm-project/vllm/pull/52956
- @Ankit-Jaiswal-AMD قدم أول مساهمة له في https://github.com/vllm-project/vllm/pull/56252
- @baljinderhothi-cohere قدم أول مساهمة له في https://github.com/vllm-project/vllm/pull/58792
- @BaoYunkai قدم أول مساهمة له في https://github.com/vllm-project/vllm/pull/57568
- @blipbyte قدم أول مساهمة له في https://github.com/vllm-project/vllm/pull/55612
- @BPbruce قدم أول مساهمة له في https://github.com/vllm-project/vllm/pull/46466
- @chuan932 قدم أول مساهمة له في https://github.com/vllm-project/vllm/pull/55330
- @coderfornow قدم أول مساهمة له في https://github.com/vllm-project/vllm/pull/54978
- @CZT0 قدم أول مساهمة له في https://github.com/vllm-project/vllm/pull/51694
- @devtyagi3909 قدم أول مساهمة له في https://github.com/vllm-project/vllm/pull/56635
- @dilberx قدم أول مساهمة له في https://github.com/vllm-project/vllm/pull/57076
- @divyvasal قدم أول مساهمة له في https://github.com/vllm-project/vllm/pull/49845
- @equiluxe قدم أول مساهمة له في https://github.com/vllm-project/vllm/pull/48115
- @errmakov قدم أول مساهمة له في https://github.com/vllm-project/vllm/pull/58583
- @farzad-elastix قدم أول مساهمة له في https://github.com/vllm-project/vllm/pull/56168
- @freyfwt قدم أول مساهمة له في https://github.com/vllm-project/vllm/pull/51367
- @garrett361 قدم أول مساهمة له في https://github.com/vllm-project/vllm/pull/57984
- @git-jxj قدم أول مساهمة له في https://github.com/vllm-project/vllm/pull/55702
- @gokay-ai قدم أول مساهمة له في https://github.com/vllm-project/vllm/pull/58292
- @gongwei-130 قدم أول مساهمة له في https://github.com/vllm-project/vllm/pull/55102
- @haosenwang1018 قدم أول مساهمة له في https://github.com/vllm-project/vllm/pull/58288
- @harshit-sarvam قدم أول مساهمة له في https://github.com/vllm-project/vllm/pull/56034
- @HieDean قدم أول مساهمة له في https://github.com/vllm-project/vllm/pull/57356
- @huthvincent قدم أول مساهمة له في https://github.com/vllm-project/vllm/pull/48419
- قدّم @i-m-aditya أول مساهمة لهم في https://github.com/vllm-project/vllm/pull/57447
- قدّم @jayzuccarelli أول مساهمة لهم في https://github.com/vllm-project/vllm/pull/58557
- قدّم @jiakangkangfuzhe أول مساهمة لهم في https://github.com/vllm-project/vllm/pull/55146
- قدّم @jiangLLM أول مساهمة لهم في https://github.com/vllm-project/vllm/pull/57487
- قدّم @jiaran-king أول مساهمة لهم في https://github.com/vllm-project/vllm/pull/56242
- قدّم @jz-yolo أول مساهمة لهم في https://github.com/vllm-project/vllm/pull/58884
- قدّم @kaijunli-infr أول مساهمة لهم في https://github.com/vllm-project/vllm/pull/52101
- قدّم @karya0 أول مساهمة لهم في https://github.com/vllm-project/vllm/pull/57453
- قدّم @KEYS-A15 أول مساهمة لهم في https://github.com/vllm-project/vllm/pull/57528
- قدّم @kwen2501 أول مساهمة لهم في https://github.com/vllm-project/vllm/pull/51520
- قدّم @laulopezreal أول مساهمة لهم في https://github.com/vllm-project/vllm/pull/57189
- قدّم @lijipeng787 أول مساهمة لهم في https://github.com/vllm-project/vllm/pull/58225
- قدّم @limitmhw أول مساهمة لهم في https://github.com/vllm-project/vllm/pull/48606
- قدّم @linnea-lin-00638949 أول مساهمة لهم في https://github.com/vllm-project/vllm/pull/47450
- قدّم @LinzeShi أول مساهمة لهم في https://github.com/vllm-project/vllm/pull/57347
- قدّم @mahird3 أول مساهمة لهم في https://github.com/vllm-project/vllm/pull/57708
- قدّم @melcheikh أول مساهمة لهم في https://github.com/vllm-project/vllm/pull/48956
- قدّم @MichaelLapshin أول مساهمة لهم في https://github.com/vllm-project/vllm/pull/57396
- قدّم @mjkvaak-amd أول مساهمة لهم في https://github.com/vllm-project/vllm/pull/48249
- قدّم @mkunredd أول مساهمة لهم في https://github.com/vllm-project/vllm/pull/58244
- قدّم @mmastrac أول مساهمة لهم في https://github.com/vllm-project/vllm/pull/57414
- قدّم @mustafayildirim أول مساهمة لهم في https://github.com/vllm-project/vllm/pull/57252
- قدّم @Navjot10 أول مساهمة لهم في https://github.com/vllm-project/vllm/pull/55390
- قدّم @olka-amd أول مساهمة لهم في https://github.com/vllm-project/vllm/pull/51065
- قدّم @PeganovAnton أول مساهمة لهم في https://github.com/vllm-project/vllm/pull/55128
- قدّم @Rakul-Chauhan أول مساهمة لهم في https://github.com/vllm-project/vllm/pull/54967
- قدّم @Ricardo-M-L أول مساهمة لهم في https://github.com/vllm-project/vllm/pull/52580
- قدّم @Ronnie-Rui أول مساهمة لهم في https://github.com/vllm-project/vllm/pull/54581
- قدّم @RyanMa29 أول مساهمة لهم في https://github.com/vllm-project/vllm/pull/57295
- قدّم @sammaji أول مساهمة لهم في https://github.com/vllm-project/vllm/pull/58626
- قدّم @sawsa307 أول مساهمة لهم في https://github.com/vllm-project/vllm/pull/56497
- قدّم @ScarWar أول مساهمة لهم في https://github.com/vllm-project/vllm/pull/49435
- قدم @sdougbrown أول مساهمة لهم في https://github.com/vllm-project/vllm/pull/49819
- قدم @semerandre أول مساهمة لهم في https://github.com/vllm-project/vllm/pull/55557
- قدم @sergiofigueras أول مساهمة لهم في https://github.com/vllm-project/vllm/pull/57948
- قدم @shallow10 أول مساهمة لهم في https://github.com/vllm-project/vllm/pull/58336
- قدم @SIDDARTHAREDDY8 أول مساهمة لهم في https://github.com/vllm-project/vllm/pull/57743
- قدم @simpleqt أول مساهمة لهم في https://github.com/vllm-project/vllm/pull/55936
- قدم @tangzzycc أول مساهمة لهم في https://github.com/vllm-project/vllm/pull/53283
- قدم @touch869 أول مساهمة لهم في https://github.com/vllm-project/vllm/pull/55844
- قدم @tripathiarpan20 أول مساهمة لهم في https://github.com/vllm-project/vllm/pull/57140
- قدم @twu3202 أول مساهمة لهم في https://github.com/vllm-project/vllm/pull/57769
- قدم @ubwzwd أول مساهمة لهم في https://github.com/vllm-project/vllm/pull/55931
- قدم @UNIDY2002 أول مساهمة لهم في https://github.com/vllm-project/vllm/pull/58370
- قدم @valarLip أول مساهمة لهم في https://github.com/vllm-project/vllm/pull/58659
- قدم @vcave أول مساهمة لهم في https://github.com/vllm-project/vllm/pull/51681
- قدم @voidxb أول مساهمة لهم في https://github.com/vllm-project/vllm/pull/49300
- قدم @vorapolsiloai أول مساهمة لهم في https://github.com/vllm-project/vllm/pull/50212
- قدم @vschandramourya أول مساهمة لهم في https://github.com/vllm-project/vllm/pull/58779
- قدم @weitliao أول مساهمة لهم في https://github.com/vllm-project/vllm/pull/54535
- قدم @wenjinhust أول مساهمة لهم في https://github.com/vllm-project/vllm/pull/51366
- قدم @Willian-Zhang أول مساهمة لهم في https://github.com/vllm-project/vllm/pull/58720
- قدم @wtdcode أول مساهمة لهم في https://github.com/vllm-project/vllm/pull/56268
- قدم @xinnywinne أول مساهمة لهم في https://github.com/vllm-project/vllm/pull/55084
- قدم @YannikHinteregger أول مساهمة لهم في https://github.com/vllm-project/vllm/pull/50047
- قدم @YashasviChaurasia أول مساهمة لهم في https://github.com/vllm-project/vllm/pull/58112
- قدم @Yatimai أول مساهمة لهم في https://github.com/vllm-project/vllm/pull/43462
- قدم @YCH188 أول مساهمة لهم في https://github.com/vllm-project/vllm/pull/57190
- قدم @yousafshah أول مساهمة لهم في https://github.com/vllm-project/vllm/pull/55957
- قدم @ys2025-AI أول مساهمة لهم في https://github.com/vllm-project/vllm/pull/56841
- قدم @yuchenwang3 أول مساهمة لهم في https://github.com/vllm-project/vllm/pull/54699
- قدم @zhecfy أول مساهمة لهم في https://github.com/vllm-project/vllm/pull/58316
- قدم @Zoe923 أول مساهمة لهم في https://github.com/vllm-project/vllm/pull/53864
- قدم @Zyann7 أول مساهمة لهم في https://github.com/vllm-project/vllm/pull/57784
المساهمون
الإشارة إلى المستخدمين التاليين: @AndreasKaratzas, @khluu, @mgoin, @njhill, @BugenZhao, @stefankoncarevic, @robertgshaw2-redhat, @taneem-ibrahim, @Thangnguyenvn98, @hmellor, @Juntian777, @WoosukKwon, @yewentao256, @gau-nernst, @mmastrac, @LucasWilkinson, @Fangzhou-Ai, @NickLucche, @aoshen02, @JaredforReal, @mawong-amd, @DarkLight1337, @zyongye, @sfeng33, @vllm-agent, @okorzh-amd, @ZJY0516, @shen-shanshan, @gty111, @Isotr0py, @djramic, @zixi-qi, @wzhao18, @alec-flowers, @aarushjain29, @Rohan138, @yma11, @mjkvaak-amd, @ivanium, @yisustc, @MatthewBonanni, @wangxiyuan, @reidliu41, @chaojun-zhang, @shaohuaxi, @gcanlin, @ganeshr10, @linitra24, @yzong-rh, @divakar-amd, @atalman, @ShuoleiWang, @simondanielsson, @rasmith, @chaunceyjiang, @micah-wil, @liusy58, @LioEinaudi, @louie-tsai, @LiuYinfeng01, @jeejeelee, @zhenwei-intel, @jperezdealgaba, @hlin99, @zxd1997066, @lucamotz, @lucifer1004, @eopXD, @ashraf-bhuiyan, @TheEpicDolphin, @JulienDarve, @mayuyuace, @danisereb, @bigPYJ1151, @Etelis, @JohnQinAMD, @jiangkuaixue123, @tianmu-li, @akii96, @vllmellm, @RyanMa29, @afriedri, @elvircrn, @mustafayildirim, @yuzhouo7, @wtdcode, @biswapanda, @adtygan, @hickeyma, @itayalroy, @jiangLLM, @Hotragn, @faaany, @xhx1022, @jinzhen-lin, @sheralskumar, @Wauplin, @matteso1, @wjabbour, @Sunt-ing, @arpera, @hclsys, @S1ro1, @HDCharles, @fxmarty-amd, @liuzijing2014, @UNIDY2002, @samuelkim7, @markmc, @errmakov, @zhejiangxiaomai, @KernelClint, @i-m-aditya, @ColinZ22, @ppalanga, @franciscojavierarceo, @maithilijoshi20, @mfylcek, @almersawi, @albertoperdomo2, @0z5a, @jacklin78911-collab, @lzhan011, @Alex-ai-future, @freyfwt, @ZhengGong-amd, @mindungil, @amasen02, @devtyagi3909, @wenjinhust, @jbyczkow, @AdaAibaby, @harshit-sarvam, @vineethsaivs, @tripathiarpan20, @sashko-zakharchuk, @semerandre, @rebklee, @git-jxj, @cjackal, @xinnywinne, @andrewor14, @kyleliang-nv, @thillai-c, @dongluw, @ChuanLi1101, @omerpaz95, @jiaran-king, @liuyao0322, @coderfornow, @drakosha, @laulopezreal, @melcheikh, @shantipriya-amd, @Rukhaiya2004، بالإضافة إلى: @yuchenwang3, @lxy-alexander, @tlrmchlsmth, @HieDean, @Zoe923, @YCH188, @amd-sriram, @andylolu2, @MicheleCampi, @sdougbrown, @vMaroon, @shimib, @andakai, @thegoldenflow, @Levius-Fubuki, @olka-amd, @limitmhw, @yuwenzho, @adenzhou1350, @Josephasafg, @kylesayrs, @jdebache, @kaijunli-infr, @afierka-intel, @frida-andersson, @bnellnm, @ys2025-AI, @waizuichougou, @touch869, @rjrock, @sawsa307, @pavelzak, @ScarWar, @fadara01, @Mi-Jiazhi, @dilberx, @mahird3, @Zyann7, @roikoren755, @YukioZzz, @Ronnie-Rui, @acsoto, @czhu-cohere, @twu3202, @oliverholworthy, @weitliao, @sergiofigueras, @tuukkjs, @Sip4818, @karen-sy, @garrett361, @GirasoleY, @Navjot10, @taking-lying-flat, @wangyicong52, @majunze2001, @gangula-karthik, @ubwzwd, @linnea-lin-00638949, @kushaldabbe, @Yatimai, @guanxingithub, @jiakangkangfuzhe, @MichaelLapshin, @jhu960213, @tpopp, @mganczarenko, @qiching, @tangzzycc, @lijipeng787, @nikhilkulkarni1755, @QwertyJack, @Ankit-Jaiswal-AMD, @vorapolsiloai, @Dao007forever, @BPbruce, @divyvasal, @simpleqt, @blipbyte, @jhaotingc, @karya0, @farzad-elastix, @grYe99, @talorabr, @jackLei0901, @Yejing-Lai, @Priyjain-amd, @KEYS-A15, @LinzeShi, @bohnstingl, @nightcityblade, @vcave, @AARONKANG04, @CZT0, @snadampal, @microslaw, @haosenwang1018, @netanel-haber, @khushali9, @sammaji, @SIDDARTHAREDDY8, @100milliongold, @gongwei-130, @fululi12, @mkunredd, @mrodden, @noooop, @valarLip, @shallow10, @200lz, @askliar, @chuan932, @Monishver11, @YashasviChaurasia, @gokay-ai, @jiacao-amd, @yousafshah, @positive666, @TQCB, @lk-chen, @Ricardo-M-L, @huthvincent, @baljinderhothi-cohere, @vschandramourya, @kwen2501, @xiao-llm, @zhecfy, @Willian-Zhang, @simon-veitner-redhat, @mevince, @voidxb, @hongxiayang, @YannikHinteregger, @V-3604, @Rakul-Chauhan, @frankwang28, @LCAIZJ, @PeganovAnton, @jz-yolo, @QHarshil, @R3hankhan123, @jayzuccarelli, @yannicks1, @BaoYunkai, @xaguilar-amd, @xiaohuguo2023, @wxsIcey, @harshaladhav-amd, @varun-sundar-rabindranath, @kliuae, @LostFox11