llama.cpp Releases

[إصدار ما قبل الإطلاق / بناء مستمر] b11482

[إصدار ما قبل الإطلاق / بناء مستمر] cuda: نوى FWHT لعرض الكتل فوق 512 (#29100) يغطي FWHT الخاص بـ CUDA العروض من 64 إلى 512. يعالج صفًا واحدًا لكل warp ويحتفظ بقيم N/32 لكل lane، لذا فإن الكتل الأعرض تحتاج إلى مسجّلات…

إصدار ما قبل الإطلاق / بناء مستمر: هذا بناء تجريبي، وليس إصدارًا مستقرًا.

cuda: نوى FWHT لعرض الكتل فوق 512 (#29100) يغطي FWHT الخاص بـ CUDA العروض من 64 إلى 512. يعالج صفًا واحدًا لكل warp ويحتفظ بقيم N/32 لكل lane، لذا فإن الكتل الأعرض تحتاج إلى مسجّلات أكثر لكل lane مما تسمح به هذه البنية. تشغّل fwht_cuda_block صفًا واحدًا لكل كتلة خيوط مع 256 خيطًا، فيحتفظ كل خيط بقيم N/256. المراحل الأدنى من عرض الـ warp لا تزال تستخدم shuffle، وتلك التي تصل حتى عرض الكتلة تمر عبر الذاكرة المشتركة، والباقي يبقى في المسجّلات. نفس اصطلاح الفراشة والإشارة المستخدم في نواة الـ warp. العروض من 64 إلى 512 تحتفظ بنواة الـ warp. أما من 1024 حتى 8192 فتستخدم النواة الجديدة، لكل من المصادر F32 وF16. لا تتحقق ggml_cuda_op_mul_mat_use_fwht (الدالة المشتركة supports_op/dispatch المضافة في #29096) من العرض، لذا لم تكن بحاجة إلى أي تغيير هنا: أي عرض تسمح به ولا يمكن لـ ggml_cuda_op_fwht خدمته يسقط بالفعل بشكل صحيح إلى مسار cuBLAS. أُعيد أساسها على master الحالي مع التزام F16 الخاص بـ #29096 تحتها، لأنها تعتمد على نفس البنية التحتية لقوالب F16؛ طُبّق ذلك الالتزام بنجاح، ولم يكن هناك سوى تعارض واحد في test-backend-ops.cpp حيث التقت إضافات اختبار التزام آخر غير ذي صلة بالقرب من هذه الكتلة. test-backend-ops على جهاز A10 (lambdalabs): MUL_MAT 1297/1297، شاملة جميع حالات FWHT/Hadamard (18 حالة موجودة، و4 جديدة F32 واسعة، و4 جديدة F16 واسعة، و2 حالتين جديدتين متعددتين الصفوف، و1 حالة حدية كبيرة جدًا نُقلت إلى 16384).

الموقع الإلكتروني: - https://llama.app

شهادات التوثيق: - https://github.com/ggml-org/llama.cpp/attestations/53784056

macOS/iOS: - macOS Apple Silicon (arm64) - macOS Apple Silicon (arm64، مع تمكين KleidiAI) معطّل - macOS Intel (x64) - iOS XCFramework

لينكس: - أوبونتو x64 (معالج CPU) - أوبونتو arm64 (معالج CPU) - أوبونتو s390x (معالج CPU) - أوبونتو x64 (Vulkan) - أوبونتو arm64 (Vulkan) - أوبونتو x64 (CUDA 12) - مكتبات CUDA 12.8 - أوبونتو x64 (CUDA 13) - مكتبات CUDA 13.4 - أوبونتو arm64 (CUDA 13) - مكتبات CUDA 13.4 - أوبونتو x64 (ROCm 10.0) - أوبونتو x64 (OpenVINO) - أوبونتو x64 (SYCL FP32) - أوبونتو x64 (SYCL FP16) - لينكس arm64 (سنايدراغون: CPU، وحدة معالجة الرسومات Adreno، وحدة معالجة العصبية Hexagon NPU) - دليل الإعداد

أندرويد: - أندرويد arm64 (معالج CPU) - أندرويد arm64 (سنايدراغون: CPU، وحدة معالجة الرسومات Adreno، وحدة معالجة العصبية Hexagon NPU) - دليل الإعداد

ويندوز: - Windows x64 (CPU) - Windows arm64 (CPU) - Windows arm64 (OpenCL Adreno) - Windows x64 (CUDA 12) - CUDA 12.4 DLLs - Windows x64 (CUDA 13) - CUDA 13.4 DLLs - Windows arm64 (CUDA 13) - CUDA 13.4 DLLs - Windows x64 (Vulkan) - Windows arm64 (Vulkan) - Windows x64 (OpenVINO) - Windows x64 (SYCL) - Windows x64 (ROCm 10.0)

openEuler: - معطّل -‏ openEuler x86 (310p) -‏ openEuler x86 (910b، ACL Graph) -‏ openEuler aarch64 (310p) -‏ openEuler aarch64 (910b، ACL Graph)

واجهة المستخدم: - واجهة المستخدم

المصدر الأصلي

llama.cpp Releases

ملاحظات المحتوى

النشر الأصلي والحقوق تعود إلى المصدر.

ترجمة آلية · يُرجى الرجوع إلى الأصل