إصدار ما قبل النشر / بناء مستمر: هذا بناء تجريبي، وليس إصدارًا مستقرًا.
feat: add GLM5Next MTP, optimize (#29928) * llama : add GLM5-Next NextN (MTP) graph بناء رأس التنبؤ المتعدد للرموز GLM5-Next كـ graph_mtp: تمرّر كتلة NextN enorm(tok)+hnorm(h) عبر eh_proj، وتشغّل طبقة DSA عادية واحدة وlm_head المشترك، مع إعادة استخدام بناة الجذع من خلال باني وسم no_build. كما يتحمّل llama_memory_recurrent حذفًا جزئيًا seq_rm عندما لا يحتوي السياق على طبقات recurrent، وهو ما يحتاجه سياق مسودة MTP. Assisted-by: Claude * llama : glm5-next: skip dead compute in headless NextN forwards تمريرة NextN دون صفوف إخراج (لحاق MTP وprefill سياق المسودة) تستمر فقط من خلال كتابات ذاكرة التخزين المؤقت، لذا يحافظ الرسم بلا رأس على كتابات MLA latent وindexer key|gate وpooled-key ويسقط مسار الاستعلام، واختيار المفهرس، وجسم الانتباه، والشبكة FFN ورأس LM. تنخفض عملية اللحاق 4-token من 6.9 ms إلى 0.33 ms من kernels؛ تظل تجزئات الإخراج الجشعة وقبول المسودة دون تغيير. Assisted-by: Claude * llama : glm5-next: fix NextN extraction contracts and shared-tail rollback ثلاثة إصلاحات ناتجة عن المراجعة المعمارية. يتطلب تقليم الرسم بلا رأس الآن أيضًا ألا يكون هناك أي استخراج nextn غير مقنّع نشط، لأن هذا الوضع يقرأ صفوفًا مخفية بعدد n_tokens بغض النظر عن أعلام logits. ينشر الاستخراج المقنّع الصفوف المخفية المجمّعة بواسطة معرفات الإخراج، لذا فإن الدفعة التي ليست أعلام إخراجها بادئة تصدّر الصفوف الصحيحة. التراجع الجزئي للـ recurrent الذي تكون خليته الذيلية مشتركة مع تسلسل آخر يُرفض الآن بدلاً من تحريك ذيل ذلك التسلسل بصمت. Assisted-by: Claude * llama : glm5-next: tidy comments in the MTP changes Assisted-by: Claude * llama : glm5-next: crop the MTP graph to the output rows instead of pruning it استبدال تقليم NextN بلا رأس بنمط الاقتصاص الذي تستخدمه رسوم MTP الأخرى: تجميع إخراج الانتباه ومدخل الكتلة عند معرفات الإخراج قبل الشبكة FFN الموضعية والرأس المشترك. تمريرة NextN دون صفوف إخراج (لحاق MTP وprefill سياق المسودة) تشغّل بعد ذلك الشبكة FFN والرأس على صفر صفوف. تنخفض عملية اللحاق 4-token من 6.9 ms إلى 2.9 ms من kernels؛ تظل تجزئات الإخراج الجشعة دون تغيير. Assisted-by: Claude * glm5-next: use the nextn crop helpers in the MTP graph استبدال شرط الاقتصاص المحلي والاختيار المقنّع لـ t_h_nextn بـ crop_before_nextn وcrop_after_nextn، بحيث يضيّق رسم MTP صفوفه بنفس طريقة الرسم الرئيسي والنماذج الأخرى. وصف فرعي الخلية المشتركة والفلتر الفارغ في التراجع الجزئي للـ recurrent. * glm5-next: load MTP-only and trunk-only GGUF files جعل تنسورات الجذع اختيارية عندما يحتوي الملف على طبقة NextN فقط، وتنسورات NextN اختيارية عندما يحتوي الملف على الجذع فقط، بحيث يُحمَّل GGUF المُقسَّم MTP كنموذج مسودة. Co-authored-by: Georgi Gerganov --------- Co-authored-by: Pascal Co-authored-by: Georgi Gerganovالموقع الإلكتروني: - https://llama.app
شهادات التصديق: - https://github.com/ggml-org/llama.cpp/attestations/53581440
macOS/iOS: - macOS Apple Silicon (arm64) - macOS Apple Silicon (arm64، مع تفعيل KleidiAI) معطَّل - macOS Intel (x64) - إطار XCFramework لنظام iOS
لينكس: - أوبونتو x64 (CPU) - أوبونتو arm64 (CPU) - أوبونتو s390x (CPU) - أوبونتو x64 (Vulkan) - أوبونتو arm64 (Vulkan) - أوبونتو x64 (CUDA 12) - مكتبات CUDA 12.8 - أوبونتو x64 (CUDA 13) - مكتبات CUDA 13.4 - أوبونتو arm64 (CUDA 13) - مكتبات CUDA 13.4 - أوبونتو x64 (ROCm 10.0) - أوبونتو x64 (OpenVINO) - أوبونتو x64 (SYCL FP32) - أوبونتو x64 (SYCL FP16) - لينكس arm64 (سنابدراغون: CPU، Adreno GPU، Hexagon NPU) - دليل الإعداد
أندرويد: - أندرويد arm64 (CPU) - أندرويد arm64 (سنابدراغون: CPU، Adreno GPU، Hexagon NPU) - دليل الإعداد
ويندوز: - Windows x64 (CPU) - Windows arm64 (CPU) - Windows arm64 (OpenCL Adreno) - Windows x64 (CUDA 12) - ملفات CUDA 12.4 DLLs - Windows x64 (CUDA 13) - ملفات CUDA 13.4 DLLs - Windows arm64 (CUDA 13) - ملفات CUDA 13.4 DLLs - Windows x64 (Vulkan) - Windows arm64 (Vulkan) - Windows x64 (OpenVINO) - Windows x64 (SYCL) - Windows x64 (ROCm 10.0)
openEuler: - معطَّل - openEuler x86 (310p) - openEuler x86 (910b، ACL Graph) - openEuler aarch64 (310p) - openEuler aarch64 (910b، ACL Graph)
واجهة المستخدم: - واجهة المستخدم