llama.cpp Releases

[Pre-Release / Continuous-Build] b11408

[Pre-Release / Continuous-Build] ggml-cpu : Q8_0-IME1-Matrixkernel für SpacemiT X60 hinzufügen (#28479) * ggml-cpu : Q8_0-IME1-Matrixkernel für SpacemiT X60 hinzufügen Auf dem SpacemiT X60 deckte die…

Pre-Release / Continuous-Build: dies ist ein experimenteller Build, keine stabile Veröffentlichung.

ggml-cpu : Q8_0-IME1-Matrixkernel für SpacemiT X60 hinzufügen (#28479) * ggml-cpu : Q8_0-IME1-Matrixkernel für SpacemiT X60 hinzufügen Auf dem SpacemiT X60 deckte die IME-Matrixbeschleunigung nur Q4_0/Q4_1/Q4_K ab. Für Q8_0 gab es keinen IME1-Kernel, und da der SpacemiT-Build GGML_CPU_REPACK=OFF setzt, war auch kein Repack-Pfad einkompiliert, sodass Q8_0 überhaupt keinen beschleunigten Pfad hatte und für Prefill auf demselben Board etwa zehnmal langsamer lief als Q4_0. - make_block_q8_0x16 und den Q8_0-Repack-Eintrag hinzufügen: Verschachtelung der Gewichte in das 16-Spalten-Layout, das die IME1-vmadot-Sequenz erwartet - ime1::gemm_kernel_i8i8 hinzufügen, einen int8 x int8-IME1-Kernel mit einem Einzeilen- und einem 4-Zeilen-Pfad für A; der 4-Zeilen-Pfad lädt jedes B-Panel einmal und verwendet es über 4 Zeilen von A wieder - quantize_a_4row_i8 für die 4-Zeilen-Aktivierungsquantisierung hinzufügen - beide in forward_mul_mat und die Repack-Factory für Q8_0 einbinden - Doku: Q8_0 als unterstützt auf X60 markieren Die Korrektheit wurde gegen eine quantisierungsgenaue Ganzzahl-Referenz für K = 32 bis 4096 überprüft, mit einem maximalen relativen Fehler von etwa 1e-6, sowie durch Prüfung, dass die Generierung über mehrere Prompts hinweg kohärent bleibt. Getestet auf Milk-V Jupiter (SpacemiT X60), Bianbu 2.1.1, gcc 14.2, mit Qwen2.5-0.5B-Instruct Q8_0. llama-bench -t 4 unter taskset -c 0-3, 5 Wiederholungen auf einem unbelasteten Board: pp128 steigt von 10.70 auf 93.87 t/s. Q4_0 bleibt unverändert bei 106.40 -> 107.51 t/s, wie erwartet, da dieser Pfad nicht berührt wird. * ggml-cpu : q8_0_16x32-Deklaration in den IME1-Abschnitt verschieben * ggml-cpu : q8_0-IME1-Kernel-Zuweisungen ausrichten

Website: - https://llama.app

Attestierungen: - https://github.com/ggml-org/llama.cpp/attestations/52757256

macOS/iOS: - macOS Apple Silicon (arm64) - macOS Apple Silicon (arm64, KleidiAI aktiviert) DEAKTIVIERT - macOS Intel (x64) - iOS XCFramework

Linux: - Ubuntu x64 (CPU) - Ubuntu arm64 (CPU) - Ubuntu s390x (CPU) - Ubuntu x64 (Vulkan) - Ubuntu arm64 (Vulkan) - Ubuntu x64 (CUDA 12) - CUDA-12.8-Bibliotheken - Ubuntu x64 (CUDA 13) - CUDA-13.4-Bibliotheken - Ubuntu arm64 (CUDA 13) - CUDA-13.4-Bibliotheken - Ubuntu x64 (ROCm 10.0) - Ubuntu x64 (OpenVINO) - Ubuntu x64 (SYCL FP32) - Ubuntu x64 (SYCL FP16) - Linux arm64 (Snapdragon: CPU, Adreno-GPU, Hexagon-NPU) - Einrichtungsanleitung

Android: - Android arm64 (CPU) - Android arm64 (Snapdragon: CPU, Adreno-GPU, Hexagon-NPU) - Einrichtungsanleitung

Windows: - Windows x64 (CPU) - Windows arm64 (CPU) - Windows arm64 (OpenCL Adreno) - Windows x64 (CUDA 12) - CUDA 12.4 DLLs - Windows x64 (CUDA 13) - CUDA 13.4 DLLs - Windows arm64 (CUDA 13) - CUDA 13.4 DLLs - Windows x64 (Vulkan) - Windows arm64 (Vulkan) - Windows x64 (OpenVINO) - Windows x64 (SYCL) - Windows x64 (ROCm 10.0)

openEuler: - DISABLED - openEuler x86 (310p) - openEuler x86 (910b, ACL Graph) - openEuler aarch64 (310p) - openEuler aarch64 (910b, ACL Graph)

Benutzeroberfläche: - UI

Originalquelle

llama.cpp Releases

Hinweise zum Inhalt

Originalveröffentlichung und Rechte liegen bei der Quelle.

Maschinelle Übersetzung · Original beachten