llama.cpp Releases更新于

[预发布 / 持续集成构建] b11408

llama.cpp预发布为SpacemiT X60新增Q8_0 IME1矩阵内核,实测pp128从10.70提升到93.87 t/s。此为实验性构建,加速仅限该X60平台。

预发布 / 持续集成构建:这是一个实验性构建,不是稳定版本。

ggml-cpu :为 SpacemiT X60 添加 Q8_0 IME1 矩阵内核(#28479) * ggml-cpu :为 SpacemiT X60 添加 Q8_0 IME1 矩阵内核 在 SpacemiT X60 上,IME 矩阵加速此前仅覆盖 Q4_0/Q4_1/Q4_K。 Q8_0 没有 IME1 内核,而且由于 SpacemiT 构建设置了 GGML_CPU_REPACK=OFF,也没有编译进任何重打包路径,因此 Q8_0 完全没有加速路径,在同一块板卡上进行 prefill 时比 Q4_0 慢大约十倍。 - 添加 make_block_q8_0x16 和 Q8_0 重打包入口:将权重交织为 IME1 vmadot 序列所期望的 16 列布局 - 添加 ime1::gemm_kernel_i8i8,一个 int8 x int8 的 IME1 内核, 包含单行和 4 行的 A 路径;4 行路径每次加载一个 B 面板 并在 A 的 4 行间复用 - 为 4 行激活量化添加 quantize_a_4row_i8 - 将两者接入 Q8_0 的 forward_mul_mat 和重打包工厂 - 文档:将 Q8_0 标记为在 X60 上受支持 正确性对照了一个量化精确的整数参考实现进行验证, K = 32 到 4096,最大相对误差约为 1e-6,并 通过检查在若干提示词上的生成保持连贯来验证。 在 Milk-V Jupiter(SpacemiT X60)、Bianbu 2.1.1、gcc 14.2 上, 使用 Qwen2.5-0.5B-Instruct Q8_0 进行测试。在 taskset -c 0-3 下运行 llama-bench -t 4,在空闲板卡上重复 5 次:pp128 从 10.70 提升到 93.87 t/s。Q4_0 保持不变,为 106.40 -> 107.51 t/s,符合预期,因为本次改动 不涉及该路径。 * ggml-cpu :将 q8_0_16x32 声明移至 IME1 部分 * ggml-cpu :对齐 q8_0 IME1 内核赋值

网站: - https://llama.app

证明(Attestations): - https://github.com/ggml-org/llama.cpp/attestations/52757256

macOS/iOS: - macOS Apple Silicon (arm64) - macOS Apple Silicon (arm64, 启用 KleidiAI) 已禁用 - macOS Intel (x64) - iOS XCFramework

Linux: - Ubuntu x64(CPU) - Ubuntu arm64(CPU) - Ubuntu s390x(CPU) - Ubuntu x64(Vulkan) - Ubuntu arm64(Vulkan) - Ubuntu x64(CUDA 12) - CUDA 12.8 库 - Ubuntu x64(CUDA 13) - CUDA 13.4 库 - Ubuntu arm64(CUDA 13) - CUDA 13.4 库 - Ubuntu x64(ROCm 10.0) - Ubuntu x64(OpenVINO) - Ubuntu x64(SYCL FP32) - Ubuntu x64(SYCL FP16) - Linux arm64(Snapdragon:CPU、Adreno GPU、Hexagon NPU) - 设置指南

Android: - Android arm64(CPU) - Android arm64(Snapdragon:CPU、Adreno GPU、Hexagon NPU) - 设置指南

Windows: - Windows x64(CPU 版) - Windows arm64(CPU 版) - Windows arm64(OpenCL Adreno 版) - Windows x64(CUDA 12 版) - CUDA 12.4 DLL 文件 - Windows x64(CUDA 13 版) - CUDA 13.4 DLL 文件 - Windows arm64(CUDA 13 版) - CUDA 13.4 DLL 文件 - Windows x64(Vulkan 版) - Windows arm64(Vulkan 版) - Windows x64(OpenVINO 版) - Windows x64(SYCL 版) - Windows x64(ROCm 10.0 版)

openEuler: - DISABLED - openEuler x86 架构(310p) - openEuler x86 架构(910b,ACL Graph) - openEuler aarch64 架构(310p) - openEuler aarch64 架构(910b,ACL Graph)

界面: - 界面

原始出处

llama.cpp Releases

内容说明

原始发布及相关权利归来源方。

机器翻译 · 请以原文为准