llama.cpp Releases

[预发布 / 持续构建版本] b11476

[预发布 / 持续构建版本] metal : 针对其余 src0 类型的少量行 MMA 矩阵乘法 (#30065) 通用少量行 MMA 内核适用于任何具有 16 权重反量化器的类型,因此它现在也支持 BF16、Q1_0、Q2_0、MXFP4、Q2_K、Q3_K、TQ2_0 以及 IQ 类型。每种类型从它在 M3 Ultra 上超越当前内核的行数开始启用:TQ2_0 为 5 行,BF16 为 4 行,MXFP4、Q2_0、Q2_K 和…

预发布 / 持续构建版本:这是一个实验性构建版本,不是稳定版本。

metal : 针对其余 src0 类型的少量行 MMA 矩阵乘法 (#30065) 通用少量行 MMA 内核适用于任何具有 16 权重 反量化器的类型,因此它现在也支持 BF16、Q1_0、Q2_0、MXFP4、Q2_K、Q3_K、 TQ2_0 以及 IQ 类型。每种类型从它在 M3 Ultra 上超越 当前内核的行数开始启用:TQ2_0 为 5 行,BF16 为 4 行, MXFP4、Q2_0、Q2_K 和 IQ4_NL 为 3 行,其余类型为 2 行。 test-backend-ops perf -o MUL_MAT, m=4096, k=14336, M3 Ultra,本次更改 相对 master 的耗时(各自为两次交错运行的平均值):从 阈值到 8 行为 0.23 至 0.98,9 至 16 行为 0.24 至 0.33, 1 行和 512 行为 0.99 至 1.01。

网站: - https://llama.app

证明文件: - https://github.com/ggml-org/llama.cpp/attestations/53605242

macOS/iOS: - macOS Apple Silicon (arm64) - macOS Apple Silicon (arm64, 启用 KleidiAI) 已禁用 - macOS Intel (x64) - iOS XCFramework

Linux: - Ubuntu x64 (CPU) - Ubuntu arm64 (CPU) - Ubuntu s390x (CPU) - Ubuntu x64 (Vulkan) - Ubuntu arm64 (Vulkan) - Ubuntu x64 (CUDA 12) - CUDA 12.8 库 - Ubuntu x64 (CUDA 13) - CUDA 13.4 库 - Ubuntu arm64 (CUDA 13) - CUDA 13.4 库 - Ubuntu x64 (ROCm 10.0) - Ubuntu x64 (OpenVINO) - Ubuntu x64 (SYCL FP32) - Ubuntu x64 (SYCL FP16) - Linux arm64(Snapdragon:CPU、Adreno GPU、Hexagon NPU) - 设置指南

Android: - Android arm64 (CPU) - Android arm64(Snapdragon:CPU、Adreno GPU、Hexagon NPU) - 设置指南

Windows 系统: - Windows x64(CPU 版本) - Windows arm64(CPU 版本) - Windows arm64(OpenCL Adreno 版本) - Windows x64(CUDA 12 版本) - CUDA 12.4 动态链接库 - Windows x64(CUDA 13 版本) - CUDA 13.4 动态链接库 - Windows arm64(CUDA 13 版本) - CUDA 13.4 动态链接库 - Windows x64(Vulkan 版本) - Windows arm64(Vulkan 版本) - Windows x64(OpenVINO 版本) - Windows x64(SYCL 版本) - Windows x64(ROCm 10.0 版本)

openEuler: - DISABLED - openEuler x86 架构(310p) - openEuler x86 架构(910b,ACL Graph) - openEuler aarch64 架构(310p) - openEuler aarch64 架构(910b,ACL Graph)

UI: - UI

原始出处

llama.cpp Releases

内容说明

原始发布及相关权利归来源方。

机器翻译 · 请以原文为准