llama.cpp Releases

[قبل الإصدار / بناء مستمر] b11513

[قبل الإصدار / البناء المستمر] CUDA: تحسين اختيار الخوارزمية top-k (#28713) * CUDA: radix top-k لعدد الصفوف الكبير يحل محل DeviceTopKKernel الخاص بـ CUB باختيار radix على الشبكة فوق الصفوف، والذي يعتمد على…

الإصدار قبل الإطلاق / البناء المستمر: هذا إصدار تجريبي، وليس إصدارًا مستقرًا.

CUDA: تحسين اختيار خوارزمية top-k (#28713) * CUDA: استخدام radix top-k للعدد الكبير من الصفوف يحل محل CUB لخاصية DeviceTopKKernel التي تُستخدم لكل صف، طريقة اختيار radix على الشبكة فوق الصفوف، والتي يتم التحكم فيها بواسطة GGML_CUDA_TOPK_RADIX_MIN_ROWS. عند qwen4exp مع 34,816 كلمة، يقلص ذلك عدد تنفيذات top-k من 1,671,253 تنفيذ / 5,761.8 مللي ثانية إلى 2,329 / 941.8 مللي ثانية. * CUDA: اختر تنفيذ TOP_K حسب الشكل استبدل الحالة الخاصة nrows/ncols بالحد الفاصل على القرار من #28547 (كما تم تنفيذه في #29278): بيتونيك للصفوف القصيرة، اختيار البحث في الجذر للصفوف الطويلة، وDeviceTopK أو CUB argsort للصف واحد طويل. تظل العتبات قابلة للتغيير أثناء بناء البرنامج. تحسينان إضافيان على تلك الحدود: - يظل استخدام bitonic قيد التنفيذ للصفوف حتى الصف 1024 المضمَّتة، بينما تتناسب الصفوف مع موجة واحدة من الكتلات (nrows <= عدد SMs)؛ تكلفة اختيار Radix select ثابتة وتتمثل في حوالي عشرة إطلاقات، وتُقسَّم هذه التكلفة على صفوف أكثر. - مع توفر DeviceTopK، يمكن التعامل مع حتى صفتين. يقوم اختيار Radix select الآن بتعريف الصفوف على شكل كتل، بحيث تظل ذاكرة التخزين المخصصة محدودة، ويحافظ مسار bitonic على طريقة التقطيع الخاصة به. HIP و MUSA يحتفظان بعتباتهما السابقة. أضف حالات الأداء حول نقطة التقاطع بين البيتونيك والراديكس لاختبار عمليات الواجهة الخلفية. * CUDA: جعل التعليقات من الكبار k أقل تفصيلاً * CUDA: إزالة حد عرض TOP_K من دالة supports_op * CUDA: استخدام DeviceTopK للTOP_K ذو الصف الواحد إذا كان متاحًا * CUDA: تجنب تجاوز ncols في فحص bitonic لـ TOP_K * CUDA: مشاركة مساعد تقطيع الصف بين argsort و top-k * CUDA: تنفيذ حسابات TOP_K radix blocks_per_row باستخدام int64_t * CUDA: تغيير اسم GGML_CUDA_TOP_K_NROWS_THRESHOLD_DEVICETOPK إلى GGML_CUDA_TOP_K_NROWS_THRESHOLD * CUDA: مشاركة مساعد تصنيف واحد بين مسارات bitonic و CUB TOP_K * CUDA: تحديث تعليقات TOP_K TODO، عتبة التحديد، وتقسيم الكتل * الاختبارات: إضافة حالات TOP_K التي تمتد على عدة كتل من الصفوف * CUDA: استخدام int64_t col في حلقات TOP_K، تصحيح تعليق العتبة * CUDA: تقييد TOP_K ودعم ARGSORT على ne[0] <= INT_MAX --------- المؤلف المشترك: praneshgo <227579474+praneshgo@users.noreply.github.com> المؤلف المشترك: Pranesh Gonegandla

الموقع الإلكتروني: - https://llama.app

الشهادات: - https://github.com/ggml-org/llama.cpp/attestations/54066267

macOS/iOS: - macOS Apple Silicon (arm64) - macOS Apple Silicon (arm64، مع تشغيل KleidiAI) معطل - macOS Intel (x64) - iOS XCFramework

لينكس: - أوبونتو x64 (CPU) - أوبونتو arm64 (المعالج الذكي) - أوبونتو s390x (CPU) - أوبونتو x64 (فولكان) - أوبونتو arm64 (فولكان) - أوبونتو x64 (CUDA 12) - مكتبات CUDA 12.8 - أوبونتو x64 (CUDA 13) - مكتبات CUDA 13.4 - أوبونتو arm64 (CUDA 13) - مكتبات CUDA 13.4 - أوبونتو x64 (ROCm 10.0) - أوبونتو x64 (أوفنفينو) - أوبونتو x64 (SYCL FP32) - أوبونتو x64 (SYCL FP16) - لينكس arm64 (سنابدراغون: وحدة المعالجة المركزية، جهاز معالجة الرسومات Adreno، Hexagon NPU) - دليل الإعداد

Android: - Android arm64 (CPU) - Android arm64 (Snapdragon: CPU، Adreno GPU، Hexagon NPU) - دليل الإعداد

ويندوز: - ويندوز x64 (الرقائق المركزية) - ويندوز arm64 (CPU) - ويندوز arm64 (OpenCL Adreno) - ويندوز x64 (CUDA 12) - CUDA 12.4 DLLs - ويندوز x64 (CUDA 13) - CUDA 13.4 DLLs - ويندوز arm64 (CUDA 13) - CUDA 13.4 DLLs - ويندوز x64 (فولكان) - ويندوز arm64 (فولكان) - ويندوز x64 (أوبنفينو) - ويندوز x64 (SYCL) - ويندوز x64 (ROCm 10.0)

openEuler: - مفقود - openEuler x86 (310p) - openEuler x86 (910b, ACL Graph) - openEuler aarch64 (310p) - openEuler aarch64 (910b, ACL Graph)

UI: - UI

المصدر الأصلي

llama.cpp Releases

ملاحظات المحتوى

النشر الأصلي والحقوق تعود إلى المصدر.

ترجمة آلية · يُرجى الرجوع إلى الأصل