llama.cpp Releases更新于

[预发布 / 持续构建版本] b11505

llama.cpp预发布构建修复Vulkan后端TOP_K算子缺陷:+inf与NaN此前未被计数,曾致NVIDIA设备挂起、AMD返回错误索引。修复映射NaN、扩展搜索范围并新增test_top_k_inf回归测试,属实验性构建。

预发布 / 持续构建版本:这是实验性构建版本,不是稳定版本。

vulkan : 修复 +inf/NaN 输入以及负值时 k = 1 的 TOP_K(#30107) topk_nary_search.comp 中的桶搜索最初从范围 [0, 0xFF800000) 开始,该范围恰好止于 +inf 的有序 uint 映射之下, 因此 +inf 和 NaN 从未被计入。当一个工作组块中可计数的值少于 k 时, ballot 为空,着色器读取了未初始化的共享状态 (在 NVIDIA 上导致挂起/设备丢失,在 AMD 上索引错误),并且块中少量 +inf 在未被计数的情况下被选中,导致真正的最高值丢失。 现在在输入时将 NaN 映射为 -inf,从 [0, 0xFFFFFFFF) 开始以便每个值都被 计数,并对最高桶的结束值(2^32)进行钳制而不是回绕到 0。 k = 1 路径此前将浮点位作为有符号整数进行比较,这会导致 负值的排序颠倒;现改为直接比较浮点数。 在 test-backend-ops 中添加 test_top_k_inf:包含负值、少于 k 个 +inf 以及大量 -inf 的情况,k = 1、10、40。 Assisted-by: Claude Opus 5.5

网站: - https://llama.app

证明文件: - https://github.com/ggml-org/llama.cpp/attestations/53971594

macOS/iOS: - macOS Apple Silicon (arm64) - macOS Apple Silicon (arm64, 启用 KleidiAI) 已禁用 - macOS Intel (x64) - iOS XCFramework

Linux: - Ubuntu x64 (CPU) - Ubuntu arm64 (CPU) - Ubuntu s390x (CPU) - Ubuntu x64 (Vulkan) - Ubuntu arm64 (Vulkan) - Ubuntu x64 (CUDA 12) - CUDA 12.8 libraries - Ubuntu x64 (CUDA 13) - CUDA 13.4 libraries - Ubuntu arm64 (CUDA 13) - CUDA 13.4 libraries - Ubuntu x64 (ROCm 10.0) - Ubuntu x64 (OpenVINO) - Ubuntu x64 (SYCL FP32) - Ubuntu x64 (SYCL FP16) - Linux arm64(Snapdragon:CPU、Adreno GPU、Hexagon NPU) - 安装指南

Android: - Android arm64 (CPU) - Android arm64(Snapdragon:CPU、Adreno GPU、Hexagon NPU) - 安装指南

Windows: - Windows x64(CPU 版) - Windows arm64(CPU 版) - Windows arm64(OpenCL Adreno 版) - Windows x64(CUDA 12 版) - CUDA 12.4 DLL 文件 - Windows x64(CUDA 13 版) - CUDA 13.4 DLL 文件 - Windows arm64(CUDA 13 版) - CUDA 13.4 DLL 文件 - Windows x64(Vulkan 版) - Windows arm64(Vulkan 版) - Windows x64(OpenVINO 版) - Windows x64(SYCL 版) - Windows x64(ROCm 10.0 版)

openEuler: - DISABLED - openEuler x86 架构(310p) - openEuler x86 架构(910b,ACL Graph) - openEuler aarch64 架构(310p) - openEuler aarch64 架构(910b,ACL Graph)

UI: - UI

原始出处

llama.cpp Releases

内容说明

原始发布及相关权利归来源方。

机器翻译 · 请以原文为准