llama.cpp Releases

[إصدار ما قبل الإطلاق / بناء مستمر] b11408

[إصدار ما قبل الإطلاق / بناء مستمر] ggml-cpu : إضافة نواة مصفوفة Q8_0 IME1 لمعالج SpacemiT X60 (#28479) * ggml-cpu : إضافة نواة مصفوفة Q8_0 IME1 لمعالج SpacemiT X60 على معالج SpacemiT X60، كان تسريع المصفوفات عبر IME…

إصدار ما قبل الإطلاق / بناء مستمر: هذا بناء تجريبي وليس إصداراً مستقراً.

ggml-cpu : إضافة نواة مصفوفة Q8_0 IME1 لمعالج SpacemiT X60 (#28479) * ggml-cpu : إضافة نواة مصفوفة Q8_0 IME1 لمعالج SpacemiT X60 على معالج SpacemiT X60، كان تسريع المصفوفات عبر IME يقتصر على Q4_0/Q4_1/Q4_K. لم يكن لدى Q8_0 أي نواة IME1، وبما أن بناء SpacemiT يضبط GGML_CPU_REPACK=OFF لم يكن هناك مسار repack مُجمَّع أيضاً، فلم يكن لدى Q8_0 أي مسار مُسرَّع على الإطلاق وكان يعمل أبطأ بنحو عشر مرات من Q4_0 في prefill على اللوحة نفسها. - إضافة make_block_q8_0x16 وإدخال repack الخاص بـ Q8_0: تداخل الأوزان في تخطيط 16 عموداً الذي تتوقعه سلسلة vmadot في IME1 - إضافة ime1::gemm_kernel_i8i8، وهي نواة IME1 من نوع int8 x int8 مع مسار A أحادي الصف ومسار من 4 صفوف؛ يحمّل مسار 4 صفوف كل لوحة B مرة واحدة ويعيد استخدامها عبر 4 صفوف من A - إضافة quantize_a_4row_i8 لترجيم التنشيطات من 4 صفوف - ربط كليهما في forward_mul_mat ومصنع repack الخاص بـ Q8_0 - التوثيق: اعتبار Q8_0 مدعوماً على X60 تم التحقق من الصحة مقابل مرجع صحيح مطابق كمياً لـ K = 32 حتى 4096، بخطأ نسبي أقصى يقارب 1e-6، ومن خلال التأكد من أن التوليد يبقى متماسكاً عبر عدة مطالبات. تم الاختبار على Milk-V Jupiter (SpacemiT X60)، Bianbu 2.1.1، gcc 14.2، مع Qwen2.5-0.5B-Instruct Q8_0. llama-bench -t 4 تحت taskset -c 0-3، 5 تكرارات على لوحة خاملة: pp128 يتحسن من 10.70 إلى 93.87 t/s. أما Q4_0 فيبقى دون تغيير عند 106.40 -> 107.51 t/s، كما هو متوقع بما أن هذا لا يمس ذلك المسار. * ggml-cpu : نقل تعريف q8_0_16x32 إلى قسم IME1 * ggml-cpu : محاذاة تعيينات نواة q8_0 IME1

الموقع الإلكتروني: - https://llama.app

إقرارات التحقق: - https://github.com/ggml-org/llama.cpp/attestations/52757256

macOS/iOS: - macOS Apple Silicon (arm64) - macOS Apple Silicon (arm64، مع تمكين KleidiAI) معطَّل - macOS Intel (x64) - iOS XCFramework

لينكس: - Ubuntu x64 (CPU) - Ubuntu arm64 (CPU) - Ubuntu s390x (CPU) - Ubuntu x64 (Vulkan) - Ubuntu arm64 (Vulkan) - Ubuntu x64 (CUDA 12) - مكتبات CUDA 12.8 - Ubuntu x64 (CUDA 13) - مكتبات CUDA 13.4 - Ubuntu arm64 (CUDA 13) - مكتبات CUDA 13.4 - Ubuntu x64 (ROCm 10.0) - Ubuntu x64 (OpenVINO) - Ubuntu x64 (SYCL FP32) - Ubuntu x64 (SYCL FP16) - Linux arm64 (Snapdragon: CPU، Adreno GPU، Hexagon NPU) - دليل الإعداد

أندرويد: - Android arm64 (CPU) - Android arm64 (Snapdragon: CPU، Adreno GPU، Hexagon NPU) - دليل الإعداد

ويندوز: - Windows x64 (CPU) - Windows arm64 (CPU) - Windows arm64 (OpenCL Adreno) - Windows x64 (CUDA 12) - ملفات CUDA 12.4 DLLs - Windows x64 (CUDA 13) - ملفات CUDA 13.4 DLLs - Windows arm64 (CUDA 13) - ملفات CUDA 13.4 DLLs - Windows x64 (Vulkan) - Windows arm64 (Vulkan) - Windows x64 (OpenVINO) - Windows x64 (SYCL) - Windows x64 (ROCm 10.0)

openEuler: - معطَّل - openEuler x86 (310p) - openEuler x86 (910b، ACL Graph) - openEuler aarch64 (310p) - openEuler aarch64 (910b، ACL Graph)

واجهة المستخدم: - واجهة المستخدم

المصدر الأصلي

llama.cpp Releases

ملاحظات المحتوى

النشر الأصلي والحقوق تعود إلى المصدر.

ترجمة آلية · يُرجى الرجوع إلى الأصل