llama.cpp Releases

[قبل الإصدار / بناء مستمر] b11463

[قبل الإصدار / بناء مستمر] sycl: تسريع عملية ملء الذاكرة في GLM MLA باستخدام MKL flash attention (#29171) * sycl: تسريع عملية ملء الذاكرة في GLM MLA باستخدام MKL flash attention GLM-4.7 Flash يستخدم شكل MLA يحتوي على 576…

الإصدار قبل الإطلاق / البناء المستمر: هذا إصدار تجريبي، وليس إصدارًا مستقرًا.

sycl: تسريع تعبئة pré-fill لـ GLM MLA باستخدام MKL flash attention (#29171) * sycl: تسريع تعبئة pré-fill لـ GLM MLA باستخدام MKL flash attention GLM-4.7 Flash يستخدم شكل MLA ذو رؤوس Q/K بعرض 576، ورأس V بعرض 512، وGQA 20، وF16 KV. يقوم منظم SYCL برفض هذا الشكل لأن البوابة العادية لمكدسة MKL flash-attention تتطلب مطابقة أطوال K/V، ويحدد أبعاد الرأس عند 512، بحيث يعود معالجة التحفيز إلى النواة TILE التي أبطأت بشكل كبير. تقبل فقط الشكل 576/576/512، GQA-20 F16 المؤكد من الناحية التحققية في دورة MKL الحالية. تظل جميع الأشكال K/V غير المتطابقة على مساراتها الانتقالية الحالية. تعامل مع سجل V الخاص بـ GLM كنظرة أضيق للمصفوفات K. اختر وصف F16 المصفوفي عندما يكون المسافة بين الصفوف مضمّمة، واستخدم الاسم المختصر لملفات ديسيكونتيزنة K/V فقط عندما تكون العرض المنطقي لها متطابقًا. يقتصر استثناء المسافة على نظرة V حقيقية تشارك مسافة الصف K. أضف الاختبار الداعم للطريق التشغيلي للتوجيه 576/512، GQA-20 بدقة. على جهاز Intel Arc Pro B70 بترقية e613ef2، pp8192 تحسن من 432.80 إلى 1292.29 توك/ثانية (2.99 ضربًا في، +198.6%). tg256 لا يتغير داخل الضوضاء عند 45.67 مقابل 45.65 توك/ثانية. الاختبار الدقيق للMLA يمر، ونتائج التصحيح يؤكدان توجيه MKL. * sycl: تخزين نتائج الانتباه الفلاشي لـ MKL في F16 احتفظ بناتج QK GEMM في F16 بدلاً من F32. الـ Softmax عبر الإنترنت لا يزال يحول كل درجة إلى نوع F32 للقيمة القصوى، والمعامل التربيعي، والمجموع، لذا فإن الحسابات لكل عنصر لا تتغير باستثناء تقريب الدرجات، وتم كتابة مصفوفة F32 فقط لتكون مستهلكة كاحتمالات نوع F16. مصفوفة درجة F32 هي أكبر متوسطات الانتباه العابرة في هذا المسار؛ فتخزينها كنوع F16 يقلل حجمها وحجم التدفق. هذا يعتمد على تحميلات Softmax المتجانسة من 1aa2954bd، التي تقرأ صفوف الدرجات معًا بشكل تعاوني، لذا فإن النوع الصغير من البيانات يُستفيد من ذلك. تم القياس باستخدام Intel Arc Pro B70، وفقًا للبيانات من الاجتماع السابق: -ngl 999 -b 4096 -ub 1024 -ctk f16 -ctv f16 -fa على: pp8192 1583.9 -> 1657.1 توك/ثانية (+4.6%) pp64000 610.0 -> 684.5 توك/ثانية (+12.2%) pp131072 ~354 -> 402.1 توك/ثانية (+13.5%) tg256 عند سياق 8k لا يتغير (32.64)، ولم تظهر مجموعة FLASH_ATTN_EXT أي عيوب جديدة. حالات لوجو ميديا ليميتد MLA تمر بشكل صحيح أمام CPU. قم بتعديل الرقم الأساسي ~354 إذا كنت ترغب في الإشارة إلى الأزواج المقاسة فقط (النقطة 131k التي تم إرسالها فقط جاءت من النسخة المحفوظة المتوافقة). يمكنك اختيار إضافة “Assisted-by” وفقًا لإرشادات المساهمة، حيث ساهم الذكاء الاصطناعي في التغيير. * إعادة تنفيذ “sycl: تخزين درجات الانتباه الفلاشية MKL في F16” هذا يعيد تنفيذ الاكتشاف 265f9748164dc88e02678425b75f520ccd528b32.

الموقع الإلكتروني: - https://llama.app

الشهادات: - https://github.com/ggml-org/llama.cpp/attestations/53529269

macOS/iOS: - macOS Apple Silicon (arm64) - macOS Apple Silicon (arm64، مع تفعيل KleidiAI) معطل - macOS Intel (x64) - iOS XCFramework

لينكس: - أوبونتو x64 (CPU) - أوبونتو arm64 (CPU) - أوبونتو s390x (CPU) - أوبونتو x64 (فولكان) - أوبونتو arm64 (فولكان) - أوبونتو x64 (CUDA 12) - مكتبات CUDA 12.8 - أوبونتو x64 (CUDA 13) - مكتبات CUDA 13.4 - أوبونتو arm64 (CUDA 13) - مكتبات CUDA 13.4 - أوبونتو x64 (ROCm 10.0) - أوبونتو x64 (أوبرفينو) - أوبونتو x64 (SYCL FP32) - أوبونتو x64 (SYCL FP16) - لينكس arm64 (سنابدراقون: وحدة المعالجة المركزية، جهاز الرسوميات Adreno، Hexagon NPU) - دليل الإعداد

Android: - Android arm64 (CPU) - Android arm64 (Snapdragon: CPU، Adreno GPU، Hexagon NPU) - دليل الإعداد

ويندوز: - ويندوز x64 (القوة الحاسوبية) - ويندوز arm64 (CPU) - ويندوز arm64 (OpenCL Adreno) - ويندوز x64 (CUDA 12) - CUDA 12.4 DLLs - ويندوز x64 (CUDA 13) - CUDA 13.4 DLLs - ويندوز arm64 (CUDA 13) - CUDA 13.4 DLLs - ويندوز x64 (فولكان) - ويندوز arm64 (فولكان) - ويندوز x64 (أوبنفينو) - ويندوز x64 (SYCL) - ويندوز x64 (ROCm 10.0)

openEuler: - مفقود - openEuler x86 (310p) - openEuler x86 (910b, ACL Graph) - openEuler aarch64 (310p) - openEuler aarch64 (910b, ACL Graph)

واجهة المستخدم: - واجهة المستخدم

المصدر الأصلي

llama.cpp Releases

ملاحظات المحتوى

النشر الأصلي والحقوق تعود إلى المصدر.

ترجمة آلية · يُرجى الرجوع إلى الأصل