llama.cpp Releases

[Pre-release / compilación continua] b11408

[Pre-release / compilación continua] ggml-cpu : añadir kernel de matriz Q8_0 IME1 para SpacemiT X60 (#28479) * ggml-cpu : añadir kernel de matriz Q8_0 IME1 para SpacemiT X60 En el SpacemiT X60, la aceleración de matrices…

Pre-release / compilación continua: esta es una compilación experimental, no una versión estable.

ggml-cpu : añadir kernel de matriz Q8_0 IME1 para SpacemiT X60 (#28479) * ggml-cpu : añadir kernel de matriz Q8_0 IME1 para SpacemiT X60 En el SpacemiT X60, la aceleración de matrices IME solo cubría Q4_0/Q4_1/Q4_K. Q8_0 no tenía kernel IME1, y dado que la compilación de SpacemiT establece GGML_CPU_REPACK=OFF tampoco había una ruta de repack compilada, así que Q8_0 no tenía ninguna ruta acelerada y se ejecutaba aproximadamente diez veces más lento que Q4_0 para prefill en la misma placa. - añadir make_block_q8_0x16 y la entrada de repack de Q8_0: intercalar los pesos en el diseño de 16 columnas que espera la secuencia vmadot de IME1 - añadir ime1::gemm_kernel_i8i8, un kernel IME1 int8 x int8 con una ruta de A de una sola fila y otra de 4 filas; la ruta de 4 filas carga cada panel B una vez y lo reutiliza en 4 filas de A - añadir quantize_a_4row_i8 para la cuantización de activaciones de 4 filas - conectar ambos en forward_mul_mat y la fábrica de repack para Q8_0 - docs: marcar Q8_0 como compatible en X60 La corrección se verificó contra una referencia entera cuant-exacta para K = 32 hasta 4096, con un error relativo máximo de aproximadamente 1e-6, y comprobando que la generación se mantiene coherente en varios prompts. Probado en Milk-V Jupiter (SpacemiT X60), Bianbu 2.1.1, gcc 14.2, con Qwen2.5-0.5B-Instruct Q8_0. llama-bench -t 4 bajo taskset -c 0-3, 5 repeticiones en una placa inactiva: pp128 pasa de 10.70 a 93.87 t/s. Q4_0 queda sin cambios en 106.40 -> 107.51 t/s, como se esperaba ya que esto no toca esa ruta. * ggml-cpu : mover la declaración q8_0_16x32 a la sección IME1 * ggml-cpu : alinear las asignaciones del kernel IME1 de q8_0

Sitio web: - https://llama.app

Atestaciones: - https://github.com/ggml-org/llama.cpp/attestations/52757256

macOS/iOS: - macOS Apple Silicon (arm64) - macOS Apple Silicon (arm64, KleidiAI habilitado) DISABLED - macOS Intel (x64) - XCFramework de iOS

Linux: - Ubuntu x64 (CPU) - Ubuntu arm64 (CPU) - Ubuntu s390x (CPU) - Ubuntu x64 (Vulkan) - Ubuntu arm64 (Vulkan) - Ubuntu x64 (CUDA 12) - Bibliotecas CUDA 12.8 - Ubuntu x64 (CUDA 13) - Bibliotecas CUDA 13.4 - Ubuntu arm64 (CUDA 13) - Bibliotecas CUDA 13.4 - Ubuntu x64 (ROCm 10.0) - Ubuntu x64 (OpenVINO) - Ubuntu x64 (SYCL FP32) - Ubuntu x64 (SYCL FP16) - Linux arm64 (Snapdragon: CPU, GPU Adreno, NPU Hexagon) - guía de configuración

Android: - Android arm64 (CPU) - Android arm64 (Snapdragon: CPU, GPU Adreno, NPU Hexagon) - guía de configuración

Windows: - Windows x64 (CPU) - Windows arm64 (CPU) - Windows arm64 (OpenCL Adreno) - Windows x64 (CUDA 12) - DLLs de CUDA 12.4 - Windows x64 (CUDA 13) - DLLs de CUDA 13.4 - Windows arm64 (CUDA 13) - DLLs de CUDA 13.4 - Windows x64 (Vulkan) - Windows arm64 (Vulkan) - Windows x64 (OpenVINO) - Windows x64 (SYCL) - Windows x64 (ROCm 10.0)

openEuler: - DESACTIVADO - openEuler x86 (310p) - openEuler x86 (910b, ACL Graph) - openEuler aarch64 (310p) - openEuler aarch64 (910b, ACL Graph)

UI: - UI

Fuente original

llama.cpp Releases

Notas sobre el contenido

La publicación original y los derechos pertenecen a la fuente.

Traducción automática · Consulte el original