llama.cpp Releases

[Pré-version / build continu] b11408

[Pré-version / build continu] ggml-cpu : ajout d'un noyau matriciel Q8_0 IME1 pour SpacemiT X60 (#28479) * ggml-cpu : ajout d'un noyau matriciel Q8_0 IME1 pour SpacemiT X60 Sur le SpacemiT X60, l'accélération matricielle…

Pré-version / build continu : il s'agit d'un build expérimental, et non d'une version stable.

ggml-cpu : ajout d'un noyau matriciel Q8_0 IME1 pour SpacemiT X60 (#28479) * ggml-cpu : ajout d'un noyau matriciel Q8_0 IME1 pour SpacemiT X60 Sur le SpacemiT X60, l'accélération matricielle IME ne couvrait que Q4_0/Q4_1/Q4_K. Q8_0 n'avait pas de noyau IME1, et comme le build SpacemiT définit GGML_CPU_REPACK=OFF il n'y avait pas non plus de chemin de repack compilé, si bien que Q8_0 n'avait aucun chemin accéléré et s'exécutait environ dix fois plus lentement que Q4_0 pour le prefill sur la même carte. - ajout de make_block_q8_0x16 et de l'entrée de repack Q8_0 : entrelacer les poids dans la disposition à 16 colonnes qu'attend la séquence vmadot IME1 - ajout de ime1::gemm_kernel_i8i8, un noyau IME1 int8 x int8 avec un chemin A à une ligne et un chemin A à 4 lignes ; le chemin à 4 lignes charge chaque panneau B une seule fois et le réutilise sur 4 lignes de A - ajout de quantize_a_4row_i8 pour la quantization des activations sur 4 lignes - branchement des deux dans forward_mul_mat et la fabrique de repack pour Q8_0 - docs : marquer Q8_0 comme pris en charge sur X60 L'exactitude a été vérifiée par rapport à une référence entière quant-exacte pour K = 32 jusqu'à 4096, avec une erreur relative maximale d'environ 1e-6, et en vérifiant que la génération reste cohérente sur plusieurs prompts. Testé sur Milk-V Jupiter (SpacemiT X60), Bianbu 2.1.1, gcc 14.2, avec Qwen2.5-0.5B-Instruct Q8_0. llama-bench -t 4 sous taskset -c 0-3, 5 répétitions sur une carte au repos : pp128 passe de 10.70 à 93.87 t/s. Q4_0 reste inchangé à 106.40 -> 107.51 t/s, comme prévu puisque cela ne touche pas ce chemin. * ggml-cpu : déplacement de la déclaration q8_0_16x32 vers la section IME1 * ggml-cpu : alignement des affectations du noyau IME1 q8_0

Site Web : - https://llama.app

Attestations : - https://github.com/ggml-org/llama.cpp/attestations/52757256

macOS/iOS : - macOS Apple Silicon (arm64) - macOS Apple Silicon (arm64, KleidiAI activé) DÉSACTIVÉ - macOS Intel (x64) - XCFramework iOS

Linux : - Ubuntu x64 (CPU) - Ubuntu arm64 (CPU) - Ubuntu s390x (CPU) - Ubuntu x64 (Vulkan) - Ubuntu arm64 (Vulkan) - Ubuntu x64 (CUDA 12) - Bibliothèques CUDA 12.8 - Ubuntu x64 (CUDA 13) - Bibliothèques CUDA 13.4 - Ubuntu arm64 (CUDA 13) - Bibliothèques CUDA 13.4 - Ubuntu x64 (ROCm 10.0) - Ubuntu x64 (OpenVINO) - Ubuntu x64 (SYCL FP32) - Ubuntu x64 (SYCL FP16) - Linux arm64 (Snapdragon : CPU, GPU Adreno, NPU Hexagon) - guide d'installation

Android : - Android arm64 (CPU) - Android arm64 (Snapdragon : CPU, GPU Adreno, NPU Hexagon) - guide d'installation

Windows : - Windows x64 (CPU) - Windows arm64 (CPU) - Windows arm64 (OpenCL Adreno) - Windows x64 (CUDA 12) - DLLs CUDA 12.4 - Windows x64 (CUDA 13) - DLLs CUDA 13.4 - Windows arm64 (CUDA 13) - DLLs CUDA 13.4 - Windows x64 (Vulkan) - Windows arm64 (Vulkan) - Windows x64 (OpenVINO) - Windows x64 (SYCL) - Windows x64 (ROCm 10.0)

openEuler : - DÉSACTIVÉ - openEuler x86 (310p) - openEuler x86 (910b, ACL Graph) - openEuler aarch64 (310p) - openEuler aarch64 (910b, ACL Graph)

UI : - UI

Source originale

llama.cpp Releases

À propos du contenu

La publication originale et les droits appartiennent à la source.

Traduction automatique · Consultez l’original