vLLM Releases

v0.31.0

# v0.31.0 ## أبرز الملامح يتضمن هذا الإصدار 717 عمليتا إيداع من 307 مساهمين (96 منهم جدد)! * **أداء DeepSeek-V4.1-Flash**: انتباه FlashMLA الضخم مع ذاكرة KV المؤقتة المضغوطة بصيغة NVFP4 من V4.1 أصبح الآن الافتراضي على…

v0.31.0

أبرز الملامح

يتضمن هذا الإصدار 717 عمليتا إيداع من 307 مساهمين (96 منهم جدد)!

  • أداء DeepSeek-V4.1-Flash: أصبح انتباه FlashMLA الضخم مع ذاكرة KV المؤقتة المضغوطة بصيغة NVFP4 من V4.1 هو الافتراضي الآن على SM100 (#56935)؛ أعداد DeepGEMM sparse MQA logits للفهرس (#56254) وMega-Gate الذي يدمج GEMM الخاصة بالبوابة مع اختيار الخبراء (#56266)؛ تدمج حدود فك الترميز الـTP all-reduce وإعداد مدخلات mHC (#57643) وإتمام MoE (#58586)؛ WO-A مدموجة للدفعات الصغيرة مع RoPE العكسي وترميز MXFP8 على SM100/SM103 (#58634)؛ الـMXFP8 wo_b بصيغة MXFP8 مع reduce-scatter متوازي التسلسل (#57428)؛ توزيع wkv في Engram عبر رتب TP (#58678) ومشاركة جداول Engram المضيفة عبر نسخ DP المتموضعة معًا افتراضيًا (#57651)؛ رسوم CUDA للمرمِّز لبرج الرؤية (#56625)؛ وإعادة تشغيل SWA المحدودة التي تُبقي KV ذات النافذة المنزلقة خارج التخزين المؤقت للبادئات (#56227).
  • إعادة التشغيل السريعة: واجهة الأوامر الجديدة vllm preload تُشغِّل عفريت ذاكرة الأوزان المؤقتة الذي يُبقي الأوزان ما بعد التكميم مقيمة في ذاكرة GPU عبر إعادة تشغيل المحرك (#56680)، والآن مع توازي البيانات (#57386)، ونماذج MTP المسودة (#57312)، ونقطة نهاية /health (#58552) وانتظار الجاهزية (#58370). لقطات تجريبية للمحرك المهيأ (vllm snapshot create/restore) تستخدم CRIU لاستعادة محرك TP1 مُهيأ بالكامل (#51360).
  • Model Runner V2 وفك الترميز التخميني: فك الترميز التخميني بنموذج المسودة (#43091) ومعالجات الأعداد المنطقية المخصصة (#56497) على Model Runner V2؛ المُسوِّد الجديد LiLiCorr (#57934)؛ الجدولة غير المتزامنة لـ DFlash (#58065) مع التقاط الحساب المسبق لسياق K/V في رسم CUDA للمسودة (#57632)؛ التحقق التكيفي DSpark لـ Gemma4 (#57263) وفك الترميز متغير الطول لـ Kimi-K3 (#52988)؛ هدف DCP مع مسودة DSpark غير DCP (#56723)؛ ويُحسب الآن ذاكرة MoE أثناء تنميط MRV2، متجنبًا نفاد الذاكرة على نشرات WideEP (#57270, #58411).
  • الخدمة على نطاق واسع: الواجهة الخلفية المتوازنة لـall2all في MoonEP لـEP عبر --all2all-backend moonep (#52101)، توازي سياق التعبئة المسبقة مع توازي البيانات (#57075)، تقليل reduce-scatter متعدد الذاكرة منخفض SM للـ SM100/SM103 (#55072)، وDeepEPv2 مع توازي التسلسل (#57210) وEPLB مع تداخل الخبراء المشتركين (#57236)، واجهة خلفية لنقل الأوزان M2N عبر NCCL واعية للتقسيم للتعلم المعزز (#51520)، واكتشاف ضغط الظهر لتفريغ KV (#50045).
  • ضوابط الجدولة: --max-num-active-seqs تتحكم في قبول RUNNING بشكل مستقل عن max_num_seqs (#56758), --long-prefill-token-threshold يتكيف الآن مع عدد التعبئات المسبقة المنتظرة بدلًا من تقسيم طلب منفرد (#57951, #58459)، وأُعيدت هيكلة قائمة الانتظار بحيث تُجدول الطلبات التي تحتفظ مسبقًا بكتل KV أولًا (#58947)، وأُصلح طريق مسدود بين موصل KV وMTP تحت ضغط KV (#57104).
  • تحصين HiSparse: صفوف تحقق MTP تُحل عبر نواة إقامة موحدة (#59235)، إصلاح انهيار قبول MTP تحت الرسوم الكاملة FULL (#59309)، لا صفحات GPU دون دعم مضيف (#59036)، إصلاح جمود حي للإيقاف المسبق في التعبئة المسبقة المقسمة (#59494)، تحجيم ذاكرة KV المؤقتة من المجموعات التي يخصصها HiSparse (#59450)، وإصلاحات نشر البادئة على المضيف وتبني البادئة على GPU (#59007, #59282).
  • الأمان: يُرفض كل من mm_processor_kwargs و media_io_kwargs لكل طلب ما لم يُضبط --trust-request-mm-kwargs (#58830)؛ تُوسم مفاتيح ذاكرة البادئة الإضافية بالمصدر بحيث لم يعد بإمكان اسم LoRA و cache_salt التصادم (#51899)، ومسار LoRA أصبح جزءًا من هاش الكتلة (#59335)؛ لم تعد مدخلات ذاكرة الاستقبال متعددة الوسائط القديمة قادرة على استبدال الحمولات الطازجة (#57833).
  • تغييرات جوهرية: وسائط kwargs متعددة الوسائط لكل طلب تم تقييدها (#58830)؛ tokenizer_mode="slow" تمت إزالته (#58545)؛ --enable-mamba-fine-grained-prefix-cache أُعيدت تسميته إلى --enable-mamba-shared-prefix-checkpoint (#57382)؛ التكميم عبر الإنترنت من خلال quantization="fp8" استُبدل بالاختصار fp8_per_tensor (#53585) وأُزيل التكميم الصامت عبر الإنترنت من Quark (#51800)؛ وأُزيل الواجهة الخلفية AllSpark INT8 W8A16 (#58001)؛ --enforce-eager أصبح يعطّل أيضًا التسخين المسبق لنواة JIT (#58197)؛ رسوم XPU مُمكّنة افتراضيًا مع VLLM_XPU_ENABLE_XPU_GRAPH تمت إزالته (#51600).

مخرجات الإصدار

حزم Python Wheels

المنصة التثبيت
PyPI (CUDA 13.0) pip install vllm
PyPI (CUDA 13.0, uv) uv pip install vllm --torch-backend=auto
ROCm pip install vllm --extra-index-url https://wheels.vllm.ai/rocm/0.31.0/rocm723
XPU uv pip install vllm --extra-index-url https://wheels.vllm.ai/0.31.0/xpu --extra-index-url https://download.pytorch.org/whl/xpu --index-strategy unsafe-best-match

صور Docker

المنصة صورة Docker
CUDA 13.0 (الافتراضي) docker pull vllm/vllm-openai:v0.31.0
CUDA 12.9 docker pull vllm/vllm-openai:v0.31.0-cu129
ROCm docker pull vllm/vllm-openai-rocm:v0.31.0
CPU docker pull vllm/vllm-openai-cpu:v0.31.0
XPU docker pull vllm/vllm-openai-xpu:v0.31.0

ملفات أخرى

ملفات الإصدار الجاهزة متوفرة في قسم Assets أسفل هذه الصفحة، بما في ذلك: - حزمة tarball للتوزيع المصدري - حزم Python الخاصة بـ CUDA 129.9 — ملاحظة: حزم CUDA 12.9 Python لمعماري x86_64 و arm64 - حزم CUDA 13.0 Python لمعماري x86_64 و arm64 - حزم CPU Python لمعماري x86_64 و arm64 و macOS - حزمة XPU Python لمعمارية x86_64

دعم النماذج

  • قدرات النماذج الجديدة: وضع التوليد المهيكل DiffusionGemma مع خيارات أحادية الرمز محدودة (#57250)، MiMo V2 MXFP4 MoE، موجه BF16 MoE ومسودات DFlash (#57784)، الحالات المخفية المساعدة في Cohere2MoE لمولدات المسودات EAGLE3/DFlash (#49819)، GLM-5.2-MXFP4 على مسار ROCm الخاص بـ DeepSeek-V3.2 (#51915)، نقاط التحقق AMD-Quark مختلطة الدقة DeepSeek-V4.1-Flash-MXFP4 (#57071) و GLM-5.3-Flash Quark MXFP4 (#56176)، و granite_thinking_parser مدمج لـ Granite 4.2 (#55957).
  • DeepSeek-V4.1-Flash: انتباه FlashMLA mega مع ذاكرة KV المؤقتة المضغوطة NVFP4 كافتراضي لـ SM100 (#56935)، لوغاريتمات DeepGEMM sparse MQA في المفهرس (#56254)، Mega-Gate (#56266)، دمج TP all-reduce + إعداد مدخلات mHC (#57643) مع دمج MoE finalize فيه (#58586)، WO-A مدمج للدفعات الصغيرة (#58634)، MXFP8 wo_b GEMM + reduce-scatter (#57428)، معاملات mHC متداخلة للدفعات الصغيرة في TP (#57603) مقتصرة على رسومات CUDA الكاملة FULL (#57874)، Engram wkv مقسم عبر TP (#58678)، عمليات بحث Engram متسلسلة مع جداول مضيف huge-page (#56926)، جداول Engram مشتركة افتراضيًا عبر نسخ DP (#57651، #57914، #59068)، دمج MegaMoE أصلي للخبراء المشتركين دون حشو (#56568، #57204)، تجهيز MegaMoE أسرع وجمع NVFP4 cache (#57604)، استعادة مسار RMSNorm + MXFP8 المدمج للاستعلام (#57679)، إدراج سياق DSpark للـ KV فقط (#56441)، رسومات CUDA لمرمز الرؤية (#56625، #58499)، إعادة تشغيل SWA محدودة (#56227)، استعادة SWA السببية للصور لمطابقة المرجع (#57152)، خرائط جهد الاستدلال المحدّثة (#58316)، وإصلاحات بدء التشغيل لكتل المرشحين ذات درجات NaN (#57454)، مؤشرات DeepSelect (#58215)، انتباه DSpark غير السببي على FlashInfer (#57432)، JIT في وقت التشغيل لمخازن المرشحين المؤقتة (#57667) والاستيراد دون Triton (#57654).
  • DeepSeek V4: FlashInfer sparse MLA مع RoPE عكسي مدمج + تكميم FP8 (#58621)، إسقاطات WKV للسياق DSpark مكدسة (#54674)، توزيع خبراء MoE مدمج محسوب من مجموعة EP (#57465)، إكمال FIM عبر suffix (#44229)، تحليل string= المفقودة في استدعاءات الأدوات (#56271)، إرفاق أدوات الطلب برسالة نظام قائمة (#51856)، الحفاظ على تباعد كتل الصور (#56882)، وفصل عرض DSpark عن التحقق من مراحل MTP (#54631).
  • GLM-5.3-Flash: خلفيات sparse اختيارية FlashAttention و FlashMLA على SM90 (#55385)، NoPE sparse MLA على خلفية FlashInfer SM120 (#55277)، top-k تعاوني للدفعات الصغيرة في فك الترميز (#57327)، مساحة عمل مفهرس فك الترميز محسوبة حسب الطول المجمّع (توفير 3 GiB، #57701)، عمليات بيانات وصفية أسرع بـ 1.6-4.8x (#58450)، تعيين خانة ذيل kpool مدمج (#57534)، kpool top-k عبر المرسل المشترك (#57546)، تقليل عبء تحضير sparse MLA (#57458)، لا مزامنة D2H في خطة SM90 sparse MLA تحت الجدولة غير المتزامنة (#58684)، FlashKDA يحافظ على الحالة المتكررة بدقة FP32 للـ prefills الطويلة (#58846)، وإصلاحات صحّية لـ kpool corruption مع فك الترميز التخميني (#58454)، عدم تطابق SM90 index_kpool mismatch (#58704)، خطوات ذيل kpool (#57477)، مطالبات من 500k token (#57317)، طبقات MLP الكثيفة تحت التوازي التسلسلي (#58061)، اختيار خلفية المفهرس top-k (#58594) وإطلاقات varlen paged MQA (#55270).
  • Qwen3.8-Flash-Next (Qwen4Exp): ذاكرة KV رئيسية FP8 على مسار QSA (#55557)، FP8 TP مع FlashInfer TRTLLM MoE (#55867)، ضبط SM90 QSA (#57273)، دمج HC down projection + SiLU (#58957)، تقليل عبء بيانات PLE الوصفية (#58114)، إصلاح تجزئة مساحة عمل مفهرس QSA (#57105)، تحرير ذاكرة KV المؤقتة أثناء التنميط (#58961)، إبقاء معرفات الجلب المسبق PLE المثبتة خارج مخزن CUDA graph (#58489)، وبحث تعيين الخبراء المفهرس موفرًا حوالي 25 ثانية من تحميل الأوزان على DGX Spark (#58720).
  • Kimi K3 و MiniMax-M3: مدمج رقع الرؤية Kimi-K3 كـ GEMM (#58527)، QK RoPE مدمج لـ KimiViT (حتى 29x، #58651)، تكميم الخبراء الموجهين (#57430)، إصلاحات محلل الاستدلال (#57098) وعدّ رموز الاستدلال (#58372)، تحديث مؤشرات KV لسياق DSpark بعد إعادة الربط (#58814)، الكتل الأولى عديمة الحالة لم تعد تُصنّف كـ decodes (#51483)، وتقديرات كتل Mamba التي لم تعد تعيق القبول عند إصابات البادئات الخارجية (#57050)؛ رسومات CUDA لمرمز MiniMax-M3 (#58673)، Conv3dLayer دمج الرقع (حوالي 62x، #58512)، triton_mrope في برج الرؤية (#58526)، وتوجيه MiniMax2 مدمج مع تحجيم غير وحدوي (#58880)، وإصلاحات المعالج (#58460، #59613).
  • DiffusionGemma: نواة إحصاءات أخذ العينات بتمريرة واحدة (#58226)، diffusion_constrained قراءات فوق logprob_token_ids (أسرع بنحو 25%، #58216)، صفوف لوغيت أقل للدفعات ذات التعبئة المسبقة فقط (#57416)، logprob_token_ids دعم (#57417)، وإصلاحات للـ logprobs المتزامنة (#57414)، وdtype الاحتياطي في وضع eager (#57462)، والمدخلات متعددة الوسائط (#57589)، ورؤوس LM المُكمَّمة (#48521) والتنفيذ على CPU (#58964).
  • متعدد الوسائط: Triton mm_input_norm kernel (‏#56798، #56711)، والحفاظ على البكسلات الخام عبر مسار ViT المجزأ بـ DP (‏#56872)، واحترام fps لفيديو Qwen2.5-VL في M-RoPE الزمني (‏#47736)، ومقاطع Whisper وQwen2-Audio الأطول من 30 ثانية (‏#57769، #56912)، وشبكة العناصر النائبة لـ Mistral3 (‏#53758)، والرقع غير المقسمة لـ Idefics3 (‏#48760)، ورموز Ovis2.5 (‏#52623)، وأوزان الخبراء لـ Aria (‏#57487)، وFP8 المدمج لـ MiMo-V2.5 qkv_proj التقسيم الشرائحي (sharding) (#57508)، Gemma4 AutoWeightsLoader (#55911) والمقاسات القياسية للـ buffer (#54213)، وGemma4 FP8 KV مع FA4 عند head dim بقيمة 512 (#53175)، وLaguna RoPE (#57189)، وتراجع دقة Mistral-Large-3 (#57563)، وEXIF التالفة (#56527, #57234)، وتسميات JinaVL (#57347)، وتوجيه Sarvam MLA مع logits للموجه FP32 (#56034)، ودرجات انتباه CohereASR المدمجة (#55190)، والالتفاف المجموعاتي المدمج DFlash2 (#55960).
  • LoRA: نماذج لغة Nemotron VL (#56231)، وModernBert (#57148)، وتضمينات VoyageQwen3 (#57708)، وتصنيف المتتاليات RoBERTa (#58884)، و modules_to_save رؤوس التصنيف التسلسلي (#53555) مع لكل مُحوِّل num_labels (#57766).

نواة المحرك

  • مشغّل النماذج V2: فك التشفير التخميني بنموذج المسودة (#43091)، ومعالجات logits مخصصة (#56497) تم التحقق منها عند القبول (#57728)، ومدخلات وهمية عشوائية (#58411)، ورموز وهمية موجهة إلى خبراء MoE أثناء التنميط (#57270)، ورسوم FULL decode لنهايات المطالبات ذات الرمز الواحد (#58400)، وخرائط token-to-request مشتركة (#57102) وإعادة استخدام بيانات Mamba/GDN الوصفية عبر مجموعات ذاكرة التخزين المؤقت KV (#58762)، ورسوم CUDA للمرمِّز فقط لـ ViT (#56922)، ومزيل الأوزان (#57834) ونموذج التجميع (#57737) تم إطلاقهما عند الإغلاق، وإصلاحات لـ MTP KV متعدد الطبقات في P/D (#55055)، والقبل السريع مع LoRA (#56456)، وكتابات جدول الكتل القديمة من خطوات المسودة الوهمية (#56734)، ونهايات المطالبات المبطنة في النماذج الهجينة (#58434)، وخانات المسودة التي لم تُقترح مطلقًا (#58784)، والملاءمة التلقائية max_model_len (#58149) و intermediate_tensors أثناء الالتقاط (#57745).
  • فك التشفير التخميني: مسوّدة LiLiCorr (#57934)، والجدولة غير المتزامنة لـ DFlash (#58065) وسياق K/V في رسم CUDA الخاص بالمسودة (#57632)، والتحقق التكيّفي DSpark لـ Gemma4 (#57263)، والتحقق التكيّفي متغير الطول لـ Kimi-K3 (#52988)، وإزالة المزامنة بين CPU وGPU للمفردات غير المتجانسة (#57396)، وتجنّب إعادة ترجمة Triton في مقدّر القبول (#57107)، وإصلاحات للمسودات EAGLE/الكثيفة مع EP (#56930)، ودفعات التنميح لـ DFlash/DSpark (#56448)، وذاكرة رأس MTP لـ GLM (#55442)، وتضمينات المطالب مع المسودات (#57356)، وفك الترميز السببي متعدد الرموز في TritonMLA (#51065).
  • المجدول: --max-num-active-seqs (#56758)، تكيّفي --long-prefill-token-threshold (#57951, #58459), skipped_waiting استُبدلت بقائمة انتظار تنتظر ومتحفظة بـ KV‏ (#58947)، والقبول الذري لـ n > 1 طلبات (#53936)، وموصل KV + حالة توقف تام في MTP (#57104)، وهاوية في معدل النقل عندما max_num_seqs ليس من مضاعفات الرقم 8 (#57355)، واستمرارات البث التي تحتفظ بـ logprobs وتحدّث الحد الأقصى للرموز (#57447، #57676)، وسباق بين طلب قابل للاستئناف والجدولة غير المتزامنة (#58259)، واستطلاع غير محجوب لقواعد المخرجات المهيكلة (#55931).
  • التخزين المؤقت للبادئات والنماذج الهجينة: مفاتيح إضافية موسومة بالمصدر (#51899) ومسارات LoRA مُلبَّدة (#59335), --enable-mamba-shared-prefix-checkpoint (#57382)، وإصابات ذيل المطالبة مع استعادة MTP (#58368)، ونقاط تفتيش نهاية المطالبة محفوظة ضمن الاحتفاظ المتناثر (#59146)، وحجز نقاط تفتيش في وضع align (#59175)، وقطع GDN الأولى عديمة الحالة (#51565)، ومجموعات مسودة MTP لذاكرة KV المؤقتة موسومة على مسار التجميع الهجين (#55390)، وبانٍ معمَّم لنقاط تفتيش prefill (#57783)، وحفظ حالات Mamba2 لتعبئة prefill على دفعات دون مزامنة GPU-CPU (#49371), skip_reading_prefix_cache محترمة لإصابات الموصل (#57269)، وتلبيد كتل متعدد الوسائط تزايدي (#51694)، وحجم كتلة KV تدعمه جميع خلفيات الانتباه (#49845) مع رسائل أخطاء أوضح (#58557), و CacheConfig.effective_attention_block_size لـ DCP (#56538).
  • الإقلاع والذاكرة: ترجمة إحماء Triton متوازية (#58582)، وتعطيل الإحماء عبر JIT في ظل --enforce-eager (#58197) ما لم تكن التسامح مع الأخطاء مفعّلاً (#58593)، وإحماء DeepGEMM يعيد استخدام مساحة عمل MoE (#57268)، وتجزئة المُخصِّص لم تعد تقلص ذاكرة KV المؤقتة أثناء التنميط (#58430)، ومخازن prefill المتناثرة محجوزة قبل تحديد حجم KV (#57575)، وإطلاق مشاهدات مساحة عمل FlashMLA القديمة (#56902)، ومساحة عمل DeepGEMM FP8 مُنقَصة إلى النصف (#53914)، ومساحات عمل Marlin/Humming مشتركة (#57421)، وتحويل أوزان FlashInfer BF16 MoE في المكان (#54699)، وخيوط إقلاع UniProc محدودة بحصة المعالج (#58946)، وخيوط وقت التشغيل تُضبط قبل التنميط (#55891).
  • الأنوية: الترشيح المُعايَن لـ top-k الدائم (#56346)، ومولّد عشوائي Murmur3 لأخذ عينات Gumbel (#51367)، وتكميم 8-بت لكل مجموعة رموز مقيّم بالسجلات (#55330)، وحساب abs-max لـ FP8 لكل موتر متجهي (#58194)، وموزِّع أنوية Triton لتجاوزات خاصة بالمنصات (#43048), GateLinear لجميع نماذج MoE (#58234)، وتخطي خانات الخبراء غير المحلية في TritonExperts (#58051)، وتأجيل إنهاء top-k في TRT-LLM-Gen على المسار المعياري (#58635)، وإعدادات matmul ثابتة تجاه الدفعات لـ SM120 (#57456)، ومخدش إزالة التكميم لـ prefill في FlashInfer محدود الحجم (#57918)، وإصلاحات لـ NaNs في softcap في Triton (#56579)، وتحويلات QuIP Hadamard (#43462)، وCUTLASS FP8 linear على A100 (#55884)، وأخذ عينات FlashInfer على وحدات معالجة رسومية غير مدعومة (#48956)، وحشو مقاييس FP8 كتلية لـ SM100 (#57377)، والتقاط prefill للرسوم المختلطة FULL (#58275)، ومطابقة أنماط العمليات المخصصة في Inductor (#58189)، واختلاف CuteDSL BF16 GDN prefill عن FLA على Qwen3.5 (#53864)، وSM100 fp8_ds_mla ذاكرة التخزين المؤقت (#49435)، ودفعات فك الترميز غير المنتظمة في مفهرس المصفوفات المتناثرة (#52500)، والأقنعة allowed_token_ids القديمة بعد إعادة ترتيب الدفعة (#48419، #43931)، و prompt_embeds الموترات المحتفظ بها بعد انتهاء الطلبات (#57988).
  • ثبات الدفعة (Batch invariance): رسوم CUDA قابلة للتعطل دون torch.compile افتراضيًا تحت VLLM_BATCH_INVARIANT (#57586)، وتوازي التسلسل وTP غير المتزامن معطّلان (#56377)، مع بقاء تجميعات NCCL 2.31 مفعّلة (#58179).
  • السكون والتعلم المعزز (Sleep and RL): release_kv_cache_memory() يحرر ذاكرة KV cache فقط (#44890)، --sleep-preserve-parameter-names يحتفظ بالأوزان المجمدة عبر سكون المستوى 2 (#57891)، ونقل أوزان NCCL M2N (#51520)، وتحديثات أوزان DP الكثيفة حسب فهرس DP (#56950)، وإبقاء إعداد الموزّع عند تبديل المقاطع القابلة للتوسيع (#57982)، ونشر حالات فشل إعادة تعيين الذاكرة المؤقتة أثناء السكون (#54581).
  • إعادة التشغيل السريع: vllm preload (#56680)، وDP (#57386)، ومسودات MTP (#57312)، وانتظار الجاهزية (#58370)، /health (#58552)، وأوزان ModelOpt MXFP8 المعالجة مسبقًا (#57316)، ولقطات المحرك المهيأ (#51360).
  • التسجيل والرصد: LoggingConfig عبر --logging-config و --log-level (#57205)، وإصلاحات تسجيل JSON (#57957، #58747)، وإصلاح قمع سجل بدء التشغيل (#51366)، وتوصيف torch موحّد واعٍ بالمنصة (#57460)، وعدم ظهور معدل إصابة بادئة 0.0% قبل أي استعلام (#54990)، وتنسيق مقاييس نقل KV (#57068)، وحساب حجم تنشيط MFU من نوع بيانات النموذج (#57070)، وفحوصات متغيرات البيئة القابلة للتجاوز حسب المنصة (#48599)، VLLM_TARGET_DEVICE=empty pip install vllm للواجهات الخلفية خارج الشجرة (#41074)، والإبلاغ عن إصدار vLLM الصحيح عند التثبيت من المصدر (#57295، #57744).

الخدمة على نطاق واسع

  • اتصالات MoE: واجهة MoonEP الخلفية (#52101)، وDeepEPv2 مع توازي التسلسل (#57210) وتداخل EPLB + الخبير المشترك (#57236)، وreduce-scatter متعدد الوسائط منخفض SM (#55072)، وإحصاءات حمل EPLB أثناء توسيع Elastic EP (#58473)، وتخطي الصفوف المبطنة لـ SP في التوجيه المجمّع بحيث لم يعد المرتبة 0 متأخرة في المعالجة التمهيدية (#56079)، ورفض التوجيه بالتجزئة على الواجهات الخلفية الأحادية غير المدعومة (#57867)، وتخطي بث الرموز المعيّنة تحت PP للطلبات المغادرة للمحرك (#58542)، وDBO مع توصيف DeepEP منخفض الزمن (#57502)، وموازن تحميل خارجي مع نسخ مكررة تتشارك العقد (#53743)، وعدم وجود RPC حاجز أثناء مصافحة المحرك (#57226) أو انتظارات غير محدودة لرموز المسودات (#58779).
  • توازي السياق: PCP مع DP وEP وMTP (#57075)، وهدف DCP مع مسودات DSpark/DFlash غير DCP (#56723)، وأطوال تسلسل DCP دون مزامنة CPU-GPU (#58169)، وسحبات NIXL DCP عبر مناطق MLA cache (#57389).
  • موصلات KV: دفع المعالجة التمهيدية بتوازي الأنابيب عبر NIXL لـ attention-HMA (#50494) وتخطيطات MLA المعبأة (#50499)، وفصل مقاييس فشل النقل عن انتهاء صلاحية KV (#55854)، وتحرير حالة الأقران الميتة دون انتظار TTL (#50047)، وحصاد العهود منتهية الصلاحية خلف رأس نابض بالنبضات (#58292)، واستعادة إتمام الدفع (#58188)، وتسجيل نشاط الجانب D (#52245)؛ وMooncake CUSTOM_MEM_POOL (#49300)، وحالات فشل التحميل على مستوى الطلب تحت HMA (#56855، #57174) وإعادة محاولة bootstrap (#58919)؛ وحالة Mamba/KDA الهجينة في MoRIIO بوضع READ (#51052) وتسابق توجيه متعدد فك الترميز (#51681)؛ وإصابات ذاكرة المعالجة التمهيدية في prompt_tokens_details (#54222)؛ وناشرو أحداث KV المرتبطون بالمنفذ 0 (#55844)؛ واستعادة GET لبيانات وصف KV cache للمستهلكين الخارجيين (#56925)؛ وأحداث KV للأجزاء الجزئية التي تحتفظ بكل ميزات الوسائط المتعددة (#58288)؛ والحفظ المكتمل في خطوات بدون تمرير أمامي (#57775)؛ وآمن الإجهاض ExampleHiddenStatesConnector (#56841)؛ وتعبئات FP8 في DecodeBench (#58472)؛ ومغلف طلب KvHints (#53423)؛ وموصل AuxOutput لمخرجات الخبراء الموجّهين (#45635، #58150، #58205).
  • تفريغ KV: لكل طلب max_load_tokens (#55885)، وكشف الضغط العكسي (#50045)، SimpleCPUOffloadConnector مقاييس Prometheus (#57251)، وتخطي مجموعات non-prefix-cacheable (#56810) وscratch (#57145)، وتخطيطات مكررة لـ MLA متعدد المجموعات (#57652)، وتسجيل المناطق التي تبلغ 512 GiB أو أكثر على شكل أجزاء (#51081)، وفحص ذاكرة cgroup قبل تخصيص SHM (#54014)، وإصلاحات لحداثة الذاكرة المؤقتة (#51787)، والنوافذ المنزلقة المحتفظ بها بواسطة MTP (#56709)، وصفوف MLA القياسية (#56799)، وبيانات وصف الأحداث (#57453) وذاكرة ROCm المثبتة (#57160).
  • HiSparse: نواة الإقامة الموحدة لصفوف MTP (#59235)، وقبول MTP تحت الرسوم الكاملة FULL (#59309)، وتخصيص مدعوم من المضيف (#59036)، والجمود في الاستباق (#59494)، وحجم KV cache (#59450)، ونشر البادئات من المضيف (#59007)، وتبنّي البادئات على GPU (#59282)، ومقاييس الإقامة (#58725).
  • توزيع المشفّر (EPD): وكيل EPD ديناميكي مع تسجيل مُدار عبر المشغّل (#54176)، وتجميع طلبات الصور لكل مُرمِّز (#57095)، وتخزين مؤقت عبر المُرمِّزات من خلال Mooncake (#56242)، ومدخلات صوتية للبيانات الوصفية فقط (#57887)، وتخطي شظايا نموذج اللغة لـ --mm-encoder-only (#58086)، ومقاييس موصل EC (#54960)، وإصلاحات خاصة بالمُرمِّز فقط (#58490، #58287، #57696).

العتاد & الأداء

  • NVIDIA: FlashInfer 0.7.0.post1 (#58069، #59323)، وترقية تثبيت DeepGEMM مع إصلاحات SM120 (#57218)، وصور ليلية لـ Rubin مع CUDA 13.4 (#55953)، وبناءات QuTLASS مع PyTorch 2.13 (#58173).
  • AMD ROCm: AITER v0.1.23 (#56885, #58867)، وtorch 2.13 وTriton 3.8 (#50605, #58006)، triton_kernels 3.8 MXFP4 MoE لـgpt-oss وDeepSeek-V4 (#55934)، وإصلاح انهيار مقطعي (segfault) في مضيف ROCR (#57328)؛ وتدفق مزدوج HCA لـDeepSeek-V4/V4.1 (#56853) وتداخل CSA2 واعٍ للطبقات (#57407)، وFP8 wo_a (#54894)، ودمج RoPE العكسي في تقليل فك الترميز المتناثر (#57435، #57451) والذي يُصدر الآن MXFP8 لمجموعة FP8 wo_a مجمّعة FP8 (#58456)، وMXFP8 GEMM بمقاييس 32x32 أصلية على gfx950 (#58510)، وإعادة استخدام بيانات top-k الرّثّة (ragged) الوصفية (#57434)، واختيار أسرع لكتل المرشحين (#58208)، وجداول Engram في ذاكرة المضيف (#57491) وجداول Qwen3.8-Flash-Next PLE منقولة إلى ذاكرة المضيف (#57497)، ومسار AITER ASM اختياري لفك الترميز مع DCP + فك الترميز التخميني (#56861)، get_top_tokens() على مُسوّد MTP في DeepSeek V4 (#57568)، وتحقّق تكيّفي DSpark (#52362)، واختياري VLLM_DSV4_LOGITS_FIX لـlogits المفهرس المتناثر على gfx950/gfx942 (#50455)، وتراجع عن #56433 و#51692 لأسباب دقة (#57132)، وأخطاء واضحة لـFSE مع DPA+ETP (#57919)؛ وkernels Kimi-K3 a4w4 FlyDSL (#53940) مع VLLM_ROCM_USE_AITER_MOE_SITUV2=a16w4|a8w4|a4w4 (#58201)، وفك ترميز تخميني KDA بتزامن منخفض (#58045)، وMoE كامن مجزّأ تحت EP (#54956) ونسخ إسقاط أقل (#50592)؛ ومسار ROCm Hy4 مع torch.compile (زمن فك ترميز أقل بـ13 مرة، #57526)؛ ودمج QK-norm لـAITER في MiniMax-M3 (#54535)، وإدخال K/V بدون نسخ (#56849) وإصلاحات MXFP8 (#53674, #58089)؛ وإصلاحات إقلاع GLM-5.3-Flash (#57192, #57252, #57425)؛ وAITER QuickReduce + RMSNorm (#48249)، وBF16 AsyncTP (#58098)، ودمج ثابت لمخرجات انتباه FP8 (#58099)، ودمج QK-norm/RoPE/KV-cache لـMRoPE (#50212)، وAITER GDN decode للتخطيطات المسطحة (#53623)، wvSplitK لـGEMMs بمخرج واحد (#53283)، و69 نسخة أقل في كل خطوة فك ترميز على مسار skinny GEMM (#58566)، وlookup GEMM مضبوط عبر AITER (#55001)، وبلاطة KV prefill أضيق لـTriton على RDNA3/RDNA4 (#58225)، ونسخ H2D كبيرة قابلة للترحيل على مراحل (#56343)، وإصلاحات لحشو MXFP4 MoE الذي يستنزف KV cache (#56359)، وAITER MLA FP8 prefill OOM (#57923)، وإزالة المقاييس لذاكرة تخزين غير مكمّاة (#56726) وAITER MoE fallbacks (#56590, #57866, #57426). VLLM_ROCM_USE_AITER_FP4_ASM_GEMM مُستعاد ومعطّل افتراضيًا (#57055)؛ وإعادة التشغيل المحدودة SWA معطّلة على ROCm (#57906).
  • Intel XPU: PyTorch 2.14 (#56013)، ورسوم XPU مفعّلة افتراضيًا (#51600)، وEPLB (#44987)، وint8 W8A8 MoE على Triton (#53162)، وثبات الدُفعات (#55881)، وتضمين دواري SYCL (#55721)، ودمج QK RMSNorm + RoPE + gate (منطقة فك الترميز أسرع بنسبة 55%، #56096)، ومُعيّن العينات Model Runner V2 (#57277) وتحكم PP microbatch (#55145)، --device-ids مُراعاةً (#56015)، وإصلاح تجاوز مؤشر الجهاز (#54514).
  • CPU: FP8 W8A8 خطي وMoE لـIntel Diamond Rapids (#49942)، وانتباه صفحات Arm أسرع بنسبة تصل إلى 25% (#56045)، وZen DA8W4 int4 للطبقات الكثيفة وMoE (#54024)، وzentorch SDPA لانتباه المُشفّر (#54508) وMLA prefill (#54967)، ومصاريد انتباه FP32 (#56252)، وW8A8 INT8 MoE على POWER (#55316)، وW4A16 Whisper (#58268)، وحزم wheels مبنية على Ubuntu 22.04 (glibc 2.34) مع AMX-FP8 (#58515)، وAVX10.2 مشروط بدعم المُجمّع (#58133)، وTriton CPU مُعدّ مسبقًا (#58140)، --device-memory-utilization alias (#56547)، وvLLM Recipes في صورة CPU (#58796, #57306)، وتثبيت protobuf لـs390x (#54978) وtorchcodec للفيديو (#58693)، وإصلاحات لـMinistral FP8 (#56985)، وأوزان موجّه FP32 (#56168)، وإخفاقات استيراد zentorch (#54923)، وmacOS multimodal SHM (#57142)، وتقارب CPU لكل رتبة محلية (#53636) وتخطيط حالة NIXL GDN (#53300).

الكمّنة (Quantization)

  • Humming: تحويلات Hadamard والكمّنة الفورية NVFP4/MXFP4/MXFP8 (#56685)، وwNaM غير متماثل عبر compressed-tensors (#46528)، وhumming-kernels 0.1.16 (#58054)، وHumming في وسيط MoE لـW4A8 (INT4xFP8) (#58427).
  • قدرات جديدة: تصديرات Quark W4A16 INT4/UINT4 أصلية (#48606)، وإزالة كمّنة MXFP4 وقت التحميل اختيارية (#50814)، وواجهات خلفية NVFP4 MoE صريحة لكل رمز (#57176)، وتخطيط N-first قياسي لـcompressed-tensors WNA16 MoE (#52798).
  • الإصلاحات: MXFP8 على الطبقات دون حدود mm_mxfp8 الأبعاد (#54223)، ومقاييس NVFP4 الفورية عند إعادة التحميل (#57954)، وبيانات وصفية خطية لرأس LM (#58444)، ومسار الكمّنة الكتلية المدمج SiLU-mul المتجاهل تحت SwiGLU clamp (#57984).

API و&الواجهة الأمامية

  • خيارات ونقاط نهاية جديدة: --tool-strict-level (#56268), response_format مع tool_choice=auto (#56086)، وإكمالات FIM لـDeepSeek-V4 (#44229)، release_kv_cache_memory() و POST /release_kv_cache_memory (#44890)، وتقييم prefill برموز ثابتة عبر prompt_logprob_token_ids (#54335)، ومقاييس فك الترميز التخميني لكل طلب في /inference/v1/generate (#43310)، ومقاييس لكل طلب (#55084) و cache_write_tokens (#57222) في Responses API، Anthropic thinking في /v1/messages (#58613)، البث التدفق للتفكير واستدعاءات الأدوات من نقطة النهاية derender (#50550) مع إزاحة إلغاء الترميز (#57528)، vllm chat المخرجات التدفقية للتفكير (#57045)، تسجيل تصحيح الأخطاء لنص الطلب مع --enable-log-requests (#58163)، والسطر التلخيصي فقط لسلاسل التوثيق الخاصة بالإعدادات في --help (#57357).
  • Structured output and parsers: قواعد Lark أصلية في الواجهة الخلفية xgrammar (#58321)، XGrammar 0.2.7 (#57272)، ترحيل Granite إلى محرك المحلل التدفقي (#49648)، وإصلاحات لحدود التفكير (#56635)، وخيارات xgrammar مع أحرف التحكم (#48115)، ومخطط JSON من نوع القائمة (#48416)، وفارغ structural_tag (#47450)، ومعالجة EOS في outlines (#58612، #57743)، وسجلات logprobs التدفقية الممنوعة من المحلل (#58583)، وأسماء أدوات Inkling بعد التفكير (#58792)، والطول finish_reason لاستدعاءات الأدوات التدفقية المبتورة (#46303).
  • توافق OpenAI وAnthropic وHarmony: أعداد رموز الاستدلال لـ Harmony وDeepSeek-V3 وStep3 (#58626) ولكل جولة أدوات في Responses (#58927)، Harmony max_output_tokens في حلقة الأدوات (#58551)، إكمالات الدردشة المجمّعة باستخدام الطلبات المعدّلة (#58929، #58958)، محلل جديد لكل اختيار (#58939)، إعادة عدّ الاستدلال المؤجّلة (#56067)، تنظيف MCP في Responses (#56988) وقيمة افتراضية لـ detail الصور (#57241)، اكتشاف النظام المضمّن في Anthropic (#58754) والتفكير المعطّل مع P/D (#58786)، رفض سلاسل الإيقاف في --tokens-only الخوادم (#57058)، رفض prompt_embeds بإرجاع 400 (#55451، #57006)، حدود المطالبات بعد التوسيع متعدد الوسائط (#57076)، --override-generation-config العقوبات (#50769)، مراجعات Hub (#56092، #57461)، logprobs الكاملة في استجابات token-in/token-out (#58488)، إلغاء التقييم التوليدي (#57729، #58788)، نبضات keepalive عبر gRPC (#55102)، و run-batch التفريغ الصوتي المميّز للمتحدثين (#57948).
  • التجميع (Pooling): حشو التضمين المقطّع (#56505) والتطبيع (#57498)، ترميز رموز إعادة الترتيب مع حدود المستندات (#57666)، والإبقاء على رؤوس عائلة BERT للحصول على logits الخام (#57664).
  • الواجهة الأمامية Rust: --hf-overrides (#56931), --sse-keep-alive-interval (#58306)، أدوار دردشة مخصصة (#58311)، محللات MiMo V2.5 (#57933)، ضوابط استدلال مقيسة (#56998)، قواعد إخراج مملوكة للمحلل (#55269، #57340)، أقنعة أخذ العينات عبر gRPC (#56777)، حجم DP محلي في بيانات gRPC الوصفية مع vllm-proto 0.3.0 (#57116، #57233)، مدرّج استباق لكل طلب (#57033)، مدرّجات خالية من الأقفال (#58574)، سياق رؤية Nemotron-H (#57634)، معالجات رؤية مملوكة للنموذج (#58109)، mm-processor معيار أداء (#51922، #58084، #58378)، التعرّف على وسائط serve غير المدعومة (#58330)، لم يعد NaN في logprobs يقتل عميل المحرك (#51026)، قبول حقول EngineCoreOutput المضافة (#56533)، و vllm-rs على PATH في صورة CUDA (#57606).
  • معايير الأداء: واجهة خلفية openai-responses لـ vllm bench serve (#54628) و model_id في ملفات JSON الخاصة بالكمون/الإنتاجية (#58112).

الأمان

  • بكل طلب mm_processor_kwargs و media_io_kwargs يُرفضان افتراضيًا؛ النشر الموثوق يفعّلها اختياريًا عبر --trust-request-mm-kwargs (#58830).
  • تجزئات كتل ذاكرة التخزين المؤقت للبادئات توسّع المفاتيح الإضافية وفق المصدر (#51899) وتتضمن مسار LoRA (#59335)؛ إطار إدخال التجزئة متعدد الوسائط (#54283) والتجزئة التزايدية للكتل تغطي كل خاصية متداخلة (#51694).
  • حمولات متعددة الوسائط الجديدة تسبق ذاكرة استقبال قديمة (#57833)، وإصابات ذاكرة التخزين المؤقت للمشفّر بعدد تضمينات غير مطابق تُرفض (#57696).
  • min_tokens فوق القيمة الافتراضية الممتلئة max_tokens تُرفض بدلًا من تعليق المحرك (#57731)؛ تعقيم الرسائل يرشّح عناوين الذاكرة بأحرف كبيرة (#58832)؛ رفض محولات LoRA المسمّاة باسم نموذج مخدوم (#59286).

الاعتماديات

  • FlashInfer 0.7.0.post1 (#58069، #59323)، Transformers 5.17.0 (#56108) مع حد أعلى في requirements (#59614)، XGrammar 0.2.7 (#57272)، oss-harmony استبدال openai-harmony (#55128)، وترقية تثبيت نسخة DeepGEMM Fork (#57218)، وترقية FlashKDA (#58846)، وhumming-kernels 0.1.16 (#58054).
  • تستخدم صور CUDA 12 إصدار LMCache 0.4.4 وCuPy CUDA 12 (#57945)؛ وتُنشر صورة Docker Hub معنونة بشكل منفصل باسم zstd (-x86_64-zstd) (#55608)؛ وصور Rubin CUDA 13.4 الليلية (#55953).
  • ROCm: AITER v0.1.23 (#58867)، وtorch 2.13، وTriton 3.8 (#50605، #58006)، وROCR المرمّع (#57328)، وتثبيات LMCache OpenTelemetry (#59056).
  • XPU: PyTorch 2.14 (#56013). CPU: حزم wheels مبنية على Ubuntu 22.04 (#58515)، وTriton CPU جاهز مسبقًا (#58140).

التغييرات الجذرية والإيقافات

  • لكل طلب mm_processor_kwargs و media_io_kwargs الآن يُرجعان خطأً ما لم يبدأ الخادم مع --trust-request-mm-kwargs؛ أما على مستوى الخادم فإن --mm-processor-kwargs / --media-io-kwargs وغير المتصل LLM دون تغيير (#58830).
  • tokenizer_mode="slow" تمت إزالته؛ حيث كان يتصرف بالفعل مثل "hf" تحت Transformers v5 (#58545).
  • --enable-mamba-fine-grained-prefix-cache أُعيدت تسميته إلى --enable-mamba-shared-prefix-checkpoint (#57382).
  • التكميم عبر الإنترنت من خلال quantization="fp8" يُعاد توجيهه الآن إلى الاختصار fp8_per_tensor عبر الإنترنت (#53585)؛ وأُزيل التكميم الصامت الخاص بـ Quark عبر الإنترنت لـ MXFP4 لصالح واجهة برمجة التطبيقات للتكميم عبر الإنترنت (#51800).
  • تمت إزالة الواجهة الخلفية AllSpark INT8 W8A16 GEMM (#58001). وأُزيل خيار return_assistant_tokens_mask من /render وحقل الاستجابة assistant_tokens_mask (#57520).
  • VLLM_PLE_CPU_OFFLOAD تمت إزالته؛ استخدم --engram-config (#57937). VLLM_XPU_ENABLE_XPU_GRAPH تمت إزالته وتصبح رسوم XPU البيانية مفعّلة افتراضيًا (#51600).
  • تمت إزالة الصيغة المفصولة بفواصل لـ --collect-detailed-traces ؛ استخدم صيغة القائمة (#55702).
  • الإعدادات الافتراضية الجديدة: --enforce-eager يعطّل أيضًا تسخين نوى JIT ما لم تُفعَّل خاصية تحمّل الأعطال (#58197، #58593)؛ VLLM_BATCH_INVARIANT=1 يستخدم رسوم CUDA البيانية القابلة للفصل دون torch.compile (#57586) ويعطّل التوازي التسلسلي وTP غير المتزامن (#56377)؛ وإعادة التشغيل المحدودة لـ DeepSeek-V4.1 SWA مفعّلة (#56227) باستثناء ROCm (#57906)؛ وتُشارك جداول مضيف Engram بين نسخ DP المشتركة في الموقع عندما يكون ذلك ممكنًا (#57651)؛ وتُعد FlashMLA mega attention الافتراضية لـ DeepSeek-V4.1 على SM100 (#56935)؛ وAITER w4a4 ASM GEMM معطّل افتراضيًا على ROCm (#57055).
  • الجمع بين Model Runner V1 وPP > 1 والجدولة غير المتزامنة والمخرجات المهيكلة يُرفض الآن عند بدء التشغيل (#56250)؛ json_object يُرفض عند التحقق مع الواجهة الخلفية outlines (#57743).
  • transformers لها الآن حد أعلى في المتطلبات (#59614).

المساهمون الجدد

  • @0z5a قدم أول مساهمة له في https://github.com/vllm-project/vllm/pull/56441
  • @200lz قدم أول مساهمة له في https://github.com/vllm-project/vllm/pull/55528
  • @AARONKANG04 قدم أول مساهمة له في https://github.com/vllm-project/vllm/pull/48521
  • @acsoto قدم أول مساهمة له في https://github.com/vllm-project/vllm/pull/57314
  • @adenzhou1350 قدم أول مساهمة له في https://github.com/vllm-project/vllm/pull/56882
  • @adtygan قدم أول مساهمة له في https://github.com/vllm-project/vllm/pull/56325
  • @amasen02 قدم أول مساهمة له في https://github.com/vllm-project/vllm/pull/56576
  • @amd-sriram قدم أول مساهمة له في https://github.com/vllm-project/vllm/pull/53792
  • @andrewor14 قدم أول مساهمة له في https://github.com/vllm-project/vllm/pull/52956
  • @Ankit-Jaiswal-AMD قدم أول مساهمة له في https://github.com/vllm-project/vllm/pull/56252
  • @baljinderhothi-cohere قدم أول مساهمة له في https://github.com/vllm-project/vllm/pull/58792
  • @BaoYunkai قدم أول مساهمة له في https://github.com/vllm-project/vllm/pull/57568
  • @blipbyte قدم أول مساهمة له في https://github.com/vllm-project/vllm/pull/55612
  • @BPbruce قدم أول مساهمة له في https://github.com/vllm-project/vllm/pull/46466
  • @chuan932 قدم أول مساهمة له في https://github.com/vllm-project/vllm/pull/55330
  • @coderfornow قدم أول مساهمة له في https://github.com/vllm-project/vllm/pull/54978
  • @CZT0 قدم أول مساهمة له في https://github.com/vllm-project/vllm/pull/51694
  • @devtyagi3909 قدم أول مساهمة له في https://github.com/vllm-project/vllm/pull/56635
  • @dilberx قدم أول مساهمة له في https://github.com/vllm-project/vllm/pull/57076
  • @divyvasal قدم أول مساهمة له في https://github.com/vllm-project/vllm/pull/49845
  • @equiluxe قدم أول مساهمة له في https://github.com/vllm-project/vllm/pull/48115
  • @errmakov قدم أول مساهمة له في https://github.com/vllm-project/vllm/pull/58583
  • @farzad-elastix قدم أول مساهمة له في https://github.com/vllm-project/vllm/pull/56168
  • @freyfwt قدم أول مساهمة له في https://github.com/vllm-project/vllm/pull/51367
  • @garrett361 قدم أول مساهمة له في https://github.com/vllm-project/vllm/pull/57984
  • @git-jxj قدم أول مساهمة له في https://github.com/vllm-project/vllm/pull/55702
  • @gokay-ai قدم أول مساهمة له في https://github.com/vllm-project/vllm/pull/58292
  • @gongwei-130 قدم أول مساهمة له في https://github.com/vllm-project/vllm/pull/55102
  • @haosenwang1018 قدم أول مساهمة له في https://github.com/vllm-project/vllm/pull/58288
  • @harshit-sarvam قدم أول مساهمة له في https://github.com/vllm-project/vllm/pull/56034
  • @HieDean قدم أول مساهمة له في https://github.com/vllm-project/vllm/pull/57356
  • @huthvincent قدم أول مساهمة له في https://github.com/vllm-project/vllm/pull/48419
  • قدّم @i-m-aditya أول مساهمة لهم في https://github.com/vllm-project/vllm/pull/57447
  • قدّم @jayzuccarelli أول مساهمة لهم في https://github.com/vllm-project/vllm/pull/58557
  • قدّم @jiakangkangfuzhe أول مساهمة لهم في https://github.com/vllm-project/vllm/pull/55146
  • قدّم @jiangLLM أول مساهمة لهم في https://github.com/vllm-project/vllm/pull/57487
  • قدّم @jiaran-king أول مساهمة لهم في https://github.com/vllm-project/vllm/pull/56242
  • قدّم @jz-yolo أول مساهمة لهم في https://github.com/vllm-project/vllm/pull/58884
  • قدّم @kaijunli-infr أول مساهمة لهم في https://github.com/vllm-project/vllm/pull/52101
  • قدّم @karya0 أول مساهمة لهم في https://github.com/vllm-project/vllm/pull/57453
  • قدّم @KEYS-A15 أول مساهمة لهم في https://github.com/vllm-project/vllm/pull/57528
  • قدّم @kwen2501 أول مساهمة لهم في https://github.com/vllm-project/vllm/pull/51520
  • قدّم @laulopezreal أول مساهمة لهم في https://github.com/vllm-project/vllm/pull/57189
  • قدّم @lijipeng787 أول مساهمة لهم في https://github.com/vllm-project/vllm/pull/58225
  • قدّم @limitmhw أول مساهمة لهم في https://github.com/vllm-project/vllm/pull/48606
  • قدّم @linnea-lin-00638949 أول مساهمة لهم في https://github.com/vllm-project/vllm/pull/47450
  • قدّم @LinzeShi أول مساهمة لهم في https://github.com/vllm-project/vllm/pull/57347
  • قدّم @mahird3 أول مساهمة لهم في https://github.com/vllm-project/vllm/pull/57708
  • قدّم @melcheikh أول مساهمة لهم في https://github.com/vllm-project/vllm/pull/48956
  • قدّم @MichaelLapshin أول مساهمة لهم في https://github.com/vllm-project/vllm/pull/57396
  • قدّم @mjkvaak-amd أول مساهمة لهم في https://github.com/vllm-project/vllm/pull/48249
  • قدّم @mkunredd أول مساهمة لهم في https://github.com/vllm-project/vllm/pull/58244
  • قدّم @mmastrac أول مساهمة لهم في https://github.com/vllm-project/vllm/pull/57414
  • قدّم @mustafayildirim أول مساهمة لهم في https://github.com/vllm-project/vllm/pull/57252
  • قدّم @Navjot10 أول مساهمة لهم في https://github.com/vllm-project/vllm/pull/55390
  • قدّم @olka-amd أول مساهمة لهم في https://github.com/vllm-project/vllm/pull/51065
  • قدّم @PeganovAnton أول مساهمة لهم في https://github.com/vllm-project/vllm/pull/55128
  • قدّم @Rakul-Chauhan أول مساهمة لهم في https://github.com/vllm-project/vllm/pull/54967
  • قدّم @Ricardo-M-L أول مساهمة لهم في https://github.com/vllm-project/vllm/pull/52580
  • قدّم @Ronnie-Rui أول مساهمة لهم في https://github.com/vllm-project/vllm/pull/54581
  • قدّم @RyanMa29 أول مساهمة لهم في https://github.com/vllm-project/vllm/pull/57295
  • قدّم @sammaji أول مساهمة لهم في https://github.com/vllm-project/vllm/pull/58626
  • قدّم @sawsa307 أول مساهمة لهم في https://github.com/vllm-project/vllm/pull/56497
  • قدّم @ScarWar أول مساهمة لهم في https://github.com/vllm-project/vllm/pull/49435
  • قدم @sdougbrown أول مساهمة لهم في https://github.com/vllm-project/vllm/pull/49819
  • قدم @semerandre أول مساهمة لهم في https://github.com/vllm-project/vllm/pull/55557
  • قدم @sergiofigueras أول مساهمة لهم في https://github.com/vllm-project/vllm/pull/57948
  • قدم @shallow10 أول مساهمة لهم في https://github.com/vllm-project/vllm/pull/58336
  • قدم @SIDDARTHAREDDY8 أول مساهمة لهم في https://github.com/vllm-project/vllm/pull/57743
  • قدم @simpleqt أول مساهمة لهم في https://github.com/vllm-project/vllm/pull/55936
  • قدم @tangzzycc أول مساهمة لهم في https://github.com/vllm-project/vllm/pull/53283
  • قدم @touch869 أول مساهمة لهم في https://github.com/vllm-project/vllm/pull/55844
  • قدم @tripathiarpan20 أول مساهمة لهم في https://github.com/vllm-project/vllm/pull/57140
  • قدم @twu3202 أول مساهمة لهم في https://github.com/vllm-project/vllm/pull/57769
  • قدم @ubwzwd أول مساهمة لهم في https://github.com/vllm-project/vllm/pull/55931
  • قدم @UNIDY2002 أول مساهمة لهم في https://github.com/vllm-project/vllm/pull/58370
  • قدم @valarLip أول مساهمة لهم في https://github.com/vllm-project/vllm/pull/58659
  • قدم @vcave أول مساهمة لهم في https://github.com/vllm-project/vllm/pull/51681
  • قدم @voidxb أول مساهمة لهم في https://github.com/vllm-project/vllm/pull/49300
  • قدم @vorapolsiloai أول مساهمة لهم في https://github.com/vllm-project/vllm/pull/50212
  • قدم @vschandramourya أول مساهمة لهم في https://github.com/vllm-project/vllm/pull/58779
  • قدم @weitliao أول مساهمة لهم في https://github.com/vllm-project/vllm/pull/54535
  • قدم @wenjinhust أول مساهمة لهم في https://github.com/vllm-project/vllm/pull/51366
  • قدم @Willian-Zhang أول مساهمة لهم في https://github.com/vllm-project/vllm/pull/58720
  • قدم @wtdcode أول مساهمة لهم في https://github.com/vllm-project/vllm/pull/56268
  • قدم @xinnywinne أول مساهمة لهم في https://github.com/vllm-project/vllm/pull/55084
  • قدم @YannikHinteregger أول مساهمة لهم في https://github.com/vllm-project/vllm/pull/50047
  • قدم @YashasviChaurasia أول مساهمة لهم في https://github.com/vllm-project/vllm/pull/58112
  • قدم @Yatimai أول مساهمة لهم في https://github.com/vllm-project/vllm/pull/43462
  • قدم @YCH188 أول مساهمة لهم في https://github.com/vllm-project/vllm/pull/57190
  • قدم @yousafshah أول مساهمة لهم في https://github.com/vllm-project/vllm/pull/55957
  • قدم @ys2025-AI أول مساهمة لهم في https://github.com/vllm-project/vllm/pull/56841
  • قدم @yuchenwang3 أول مساهمة لهم في https://github.com/vllm-project/vllm/pull/54699
  • قدم @zhecfy أول مساهمة لهم في https://github.com/vllm-project/vllm/pull/58316
  • قدم @Zoe923 أول مساهمة لهم في https://github.com/vllm-project/vllm/pull/53864
  • قدم @Zyann7 أول مساهمة لهم في https://github.com/vllm-project/vllm/pull/57784

المساهمون

الإشارة إلى المستخدمين التاليين: @AndreasKaratzas, @khluu, @mgoin, @njhill, @BugenZhao, @stefankoncarevic, @robertgshaw2-redhat, @taneem-ibrahim, @Thangnguyenvn98, @hmellor, @Juntian777, @WoosukKwon, @yewentao256, @gau-nernst, @mmastrac, @LucasWilkinson, @Fangzhou-Ai, @NickLucche, @aoshen02, @JaredforReal, @mawong-amd, @DarkLight1337, @zyongye, @sfeng33, @vllm-agent, @okorzh-amd, @ZJY0516, @shen-shanshan, @gty111, @Isotr0py, @djramic, @zixi-qi, @wzhao18, @alec-flowers, @aarushjain29, @Rohan138, @yma11, @mjkvaak-amd, @ivanium, @yisustc, @MatthewBonanni, @wangxiyuan, @reidliu41, @chaojun-zhang, @shaohuaxi, @gcanlin, @ganeshr10, @linitra24, @yzong-rh, @divakar-amd, @atalman, @ShuoleiWang, @simondanielsson, @rasmith, @chaunceyjiang, @micah-wil, @liusy58, @LioEinaudi, @louie-tsai, @LiuYinfeng01, @jeejeelee, @zhenwei-intel, @jperezdealgaba, @hlin99, @zxd1997066, @lucamotz, @lucifer1004, @eopXD, @ashraf-bhuiyan, @TheEpicDolphin, @JulienDarve, @mayuyuace, @danisereb, @bigPYJ1151, @Etelis, @JohnQinAMD, @jiangkuaixue123, @tianmu-li, @akii96, @vllmellm, @RyanMa29, @afriedri, @elvircrn, @mustafayildirim, @yuzhouo7, @wtdcode, @biswapanda, @adtygan, @hickeyma, @itayalroy, @jiangLLM, @Hotragn, @faaany, @xhx1022, @jinzhen-lin, @sheralskumar, @Wauplin, @matteso1, @wjabbour, @Sunt-ing, @arpera, @hclsys, @S1ro1, @HDCharles, @fxmarty-amd, @liuzijing2014, @UNIDY2002, @samuelkim7, @markmc, @errmakov, @zhejiangxiaomai, @KernelClint, @i-m-aditya, @ColinZ22, @ppalanga, @franciscojavierarceo, @maithilijoshi20, @mfylcek, @almersawi, @albertoperdomo2, @0z5a, @jacklin78911-collab, @lzhan011, @Alex-ai-future, @freyfwt, @ZhengGong-amd, @mindungil, @amasen02, @devtyagi3909, @wenjinhust, @jbyczkow, @AdaAibaby, @harshit-sarvam, @vineethsaivs, @tripathiarpan20, @sashko-zakharchuk, @semerandre, @rebklee, @git-jxj, @cjackal, @xinnywinne, @andrewor14, @kyleliang-nv, @thillai-c, @dongluw, @ChuanLi1101, @omerpaz95, @jiaran-king, @liuyao0322, @coderfornow, @drakosha, @laulopezreal, @melcheikh, @shantipriya-amd, @Rukhaiya2004، بالإضافة إلى: @yuchenwang3, @lxy-alexander, @tlrmchlsmth, @HieDean, @Zoe923, @YCH188, @amd-sriram, @andylolu2, @MicheleCampi, @sdougbrown, @vMaroon, @shimib, @andakai, @thegoldenflow, @Levius-Fubuki, @olka-amd, @limitmhw, @yuwenzho, @adenzhou1350, @Josephasafg, @kylesayrs, @jdebache, @kaijunli-infr, @afierka-intel, @frida-andersson, @bnellnm, @ys2025-AI, @waizuichougou, @touch869, @rjrock, @sawsa307, @pavelzak, @ScarWar, @fadara01, @Mi-Jiazhi, @dilberx, @mahird3, @Zyann7, @roikoren755, @YukioZzz, @Ronnie-Rui, @acsoto, @czhu-cohere, @twu3202, @oliverholworthy, @weitliao, @sergiofigueras, @tuukkjs, @Sip4818, @karen-sy, @garrett361, @GirasoleY, @Navjot10, @taking-lying-flat, @wangyicong52, @majunze2001, @gangula-karthik, @ubwzwd, @linnea-lin-00638949, @kushaldabbe, @Yatimai, @guanxingithub, @jiakangkangfuzhe, @MichaelLapshin, @jhu960213, @tpopp, @mganczarenko, @qiching, @tangzzycc, @lijipeng787, @nikhilkulkarni1755, @QwertyJack, @Ankit-Jaiswal-AMD, @vorapolsiloai, @Dao007forever, @BPbruce, @divyvasal, @simpleqt, @blipbyte, @jhaotingc, @karya0, @farzad-elastix, @grYe99, @talorabr, @jackLei0901, @Yejing-Lai, @Priyjain-amd, @KEYS-A15, @LinzeShi, @bohnstingl, @nightcityblade, @vcave, @AARONKANG04, @CZT0, @snadampal, @microslaw, @haosenwang1018, @netanel-haber, @khushali9, @sammaji, @SIDDARTHAREDDY8, @100milliongold, @gongwei-130, @fululi12, @mkunredd, @mrodden, @noooop, @valarLip, @shallow10, @200lz, @askliar, @chuan932, @Monishver11, @YashasviChaurasia, @gokay-ai, @jiacao-amd, @yousafshah, @positive666, @TQCB, @lk-chen, @Ricardo-M-L, @huthvincent, @baljinderhothi-cohere, @vschandramourya, @kwen2501, @xiao-llm, @zhecfy, @Willian-Zhang, @simon-veitner-redhat, @mevince, @voidxb, @hongxiayang, @YannikHinteregger, @V-3604, @Rakul-Chauhan, @frankwang28, @LCAIZJ, @PeganovAnton, @jz-yolo, @QHarshil, @R3hankhan123, @jayzuccarelli, @yannicks1, @BaoYunkai, @xaguilar-amd, @xiaohuguo2023, @wxsIcey, @harshaladhav-amd, @varun-sundar-rabindranath, @kliuae, @LostFox11

المصدر الأصلي

vLLM Releases

ملاحظات المحتوى

النشر الأصلي والحقوق تعود إلى المصدر.

ترجمة آلية · يُرجى الرجوع إلى الأصل