llama.cpp Releases

[إصدار ما قبل النشر / بناء مستمر] b11405

[إصدار ما قبل النشر / بناء مستمر] cuda: تجزئة مفهرس lightning فوق المفاتيح والرموز لـ 4 رؤوس (#29901) * cuda: تجزئة مفهرس lightning فوق المفاتيح والرموز لـ 4 رؤوس مع وجود رؤوس قليلة جداً لبلاطة wmma، تقوم كتلة بتقييم 64…

إصدار ما قبل النشر / بناء مستمر: هذا بناء تجريبي، وليس إصداراً مستقراً.

cuda: تجزئة مفهرس lightning فوق المفاتيح والرموز لـ 4 رؤوس (#29901) * cuda: تجزئة مفهرس lightning فوق المفاتيح والرموز لـ 4 رؤوس مع وجود رؤوس قليلة جداً لبلاطة wmma، تقوم كتلة بتقييم 64 مفتاحاً مقابل 8 رموز: تُوضع المفاتيح مرة واحدة بدقة نصفية، والاستعلامات رأساً واحداً في كل مرة، وكل خيط يمتلك مفتاحاً واحداً لرمزين، بحيث لا يحتاج أي حاصل ضرب نقطي إلى اختزال عبر الخيوط. الدفعات الأصغر من بلاطة رموز تحتفظ بنواة المتجهات. يقيس test-backend-ops لـ 4 رؤوس. * cuda: ضرب بلاطة مفهرس lightning بالفاصلة العائمة معالجة مراجعة am17an: تتجاوز منتجات half2 الحد بمجرد أن يتجاوز q * k واحد نطاق f16. تبقى الاستعلامات بالفاصلة العائمة في الذاكرة المشتركة وكل half2 من المفاتيح يتوسع مرة واحدة لكل من الرمزين، بحيث يُحسب كل منتج ومجموع بالفاصلة العائمة. * cuda: توسيع كل مفتاح من مفهرس lightning مرة واحدة لجميع الرؤوس تُضع نواة البلاطة استعلامات وأوزان كل رأس في آن واحد، فيتوسع كل عنصر مفتاح من الدقة النصفية مرة واحدة ويغذي جميع الرؤوس، بحاجز واحد. تُنسخ مفاتيح F16 إلى البلاطة دون المرور بالفاصلة العائمة ذهاباً وإياباً. إبقاء المفاتيح بالفاصلة العائمة في الذاكرة المشتركة يقيس أبطأ، إذ تنخفض نسبة الإشغال. * cuda: منع بلاطة مفهرس lightning من إغراق السجلات على ROCm يقيم كل خيط من نواة البلاطة الآن مفتاحين لرمز واحد، فيشارك الـ warp رمزه وتكون قراءات الاستعلام بثّية: ستة قراءات مشتركة لكل زوج عناصر بدلاً من تسعة لنفس المنتجات. الحلقة الداخلية ملفوفة بفك 8، مما يُبقي gfx908 عند 63 VGPRs دون إغراق حيث احتاجت الحلقة الملفوفة بالكامل أكثر من ألف، وجعلت النواة أسرع بـ 36 مرة على R9700 وأسرع قليلاً على CUDA.

الموقع الإلكتروني: - https://llama.app

الشهادات: - https://github.com/ggml-org/llama.cpp/attestations/52734616

macOS/iOS: - macOS Apple Silicon (arm64) - macOS Apple Silicon (arm64، مع تمكين KleidiAI) معطّل - macOS Intel (x64) - iOS XCFramework

لينكس: - Ubuntu x64 (CPU) - Ubuntu arm64 (CPU) - Ubuntu s390x (CPU) - Ubuntu x64 (Vulkan) - Ubuntu arm64 (Vulkan) - Ubuntu x64 (CUDA 12) - مكتبات CUDA 12.8 - Ubuntu x64 (CUDA 13) - مكتبات CUDA 13.4 - Ubuntu arm64 (CUDA 13) - مكتبات CUDA 13.4 - Ubuntu x64 (ROCm 10.0) - Ubuntu x64 (OpenVINO) - Ubuntu x64 (SYCL FP32) - Ubuntu x64 (SYCL FP16) - Linux arm64 (Snapdragon: CPU, Adreno GPU, Hexagon NPU) - دليل الإعداد

أندرويد: - Android arm64 (CPU) - Android arm64 (Snapdragon: CPU, Adreno GPU, Hexagon NPU) - دليل الإعداد

ويندوز: - ويندوز x64 (CPU) - ويندوز arm64 (CPU) - ويندوز arm64 (OpenCL Adreno) - ويندوز x64 (CUDA 12) - ملفات DLL الخاصة بـ CUDA 12.4 - ويندوز x64 (CUDA 13) - ملفات DLL الخاصة بـ CUDA 13.4 - ويندوز arm64 (CUDA 13) - ملفات DLL الخاصة بـ CUDA 13.4 - ويندوز x64 (Vulkan) - ويندوز arm64 (Vulkan) - ويندوز x64 (OpenVINO) - ويندوز x64 (SYCL) - ويندوز x64 (ROCm 10.0)

openEuler: - DISABLED - openEuler على بنية x86 (310p) - openEuler على بنية x86 (910b، ACL Graph) - openEuler على بنية aarch64 (310p) - openEuler على بنية aarch64 (910b، ACL Graph)

واجهة المستخدم: - UI

المصدر الأصلي

llama.cpp Releases

ملاحظات المحتوى

النشر الأصلي والحقوق تعود إلى المصدر.

ترجمة آلية · يُرجى الرجوع إلى الأصل