إصدار تجريبي / بناء مستمر: هذا بناء تجريبي، وليس إصداراً مستقراً.
vulkan: انتباه فلاش متناثر لـ K/V المكمّمة (#29639) * vulkan: انتباه فلاش متناثر لـ K/V المكمّمة بمساعدة: Claude * vulkan: ضغط فهرس FA متناثر بمسح واحد كان الضغط يشغّل مجموعة عمل واحدة لكل صف قناع ويمرّ على الصف في أجزاء من BLOCK_SIZE، مع مسح لمجموعة عمل لكل جزء. في فك الترميز هذا يعني مجموعة عمل واحدة تنفّذ KV/1024 تكراراً محدودة بالحواجز، لذا عند 128k خلية كانت تكلفته أعلى من الانتباه المتناثر الذي تغذّيه. قسّم الصف بدلاً من ذلك إلى مقاطع متجاورة: واحد لكل مجموعة فرعية مع عدّ اقتراع عبر تحميلات مترابطة، أو واحد لكل خيط دون مجموعات فرعية. مسح واحد على أعداد المقاطع يعطي بعد ذلك لكل مقطع إزاحة إخراجه. تظل قائمة الفهارس تصاعدية.الموقع: - https://llama.app
شهادات التحقق: - https://github.com/ggml-org/llama.cpp/attestations/52797762
أنظمة macOS/iOS: - إصدار macOS Apple Silicon (arm64) - إصدار macOS Apple Silicon (arm64 مع تفعيل KleidiAI) معطّل - إصدار macOS Intel (x64) - إطار XCFramework لنظام iOS
لينكس: - Ubuntu x64 (CPU) - Ubuntu arm64 (CPU) - Ubuntu s390x (CPU) - Ubuntu x64 (Vulkan) - Ubuntu arm64 (Vulkan) - Ubuntu x64 (CUDA 12) - مكتبات CUDA 12.8 - Ubuntu x64 (CUDA 13) - مكتبات CUDA 13.4 - Ubuntu arm64 (CUDA 13) - مكتبات CUDA 13.4 - Ubuntu x64 (ROCm 10.0) - Ubuntu x64 (OpenVINO) - Ubuntu x64 (SYCL FP32) - Ubuntu x64 (SYCL FP16) - لينكس arm64 (Snapdragon: CPU، Adreno GPU، Hexagon NPU) - دليل الإعداد
أندرويد: - Android arm64 (CPU) - Android arm64 (Snapdragon: CPU، Adreno GPU، Hexagon NPU) - دليل الإعداد
ويندوز: - Windows x64 (CPU) - Windows arm64 (CPU) - Windows arm64 (OpenCL Adreno) - Windows x64 (CUDA 12) - CUDA 12.4 DLLs - Windows x64 (CUDA 13) - CUDA 13.4 DLLs - Windows arm64 (CUDA 13) - CUDA 13.4 DLLs - Windows x64 (Vulkan) - Windows arm64 (Vulkan) - Windows x64 (OpenVINO) - Windows x64 (SYCL) - Windows x64 (ROCm 10.0)
openEuler: - DISABLED - openEuler x86 (310p) - openEuler x86 (910b، ACL Graph) - openEuler aarch64 (310p) - openEuler aarch64 (910b، ACL Graph)
واجهة المستخدم: - واجهة المستخدم