预发布版 / 持续构建:这是一个实验性构建,不是稳定版本。
vulkan: 针对量化 K/V 的稀疏 flash attention (#29639) * vulkan: 针对量化 K/V 的稀疏 flash attention Assisted-by: Claude * vulkan: 单次扫描的稀疏 FA 索引压缩 压缩操作之前每个掩码行运行一个 workgroup,并以 BLOCK_SIZE 为单位遍历该行,每块执行一次 workgroup 扫描。对于解码来说,这意味着一个 workgroup 进行 KV/1024 次受屏障限制的迭代,因此在 128k 个单元时, 其开销比它所服务的稀疏注意力还要高。 改为将行拆分为连续的段:有子组时每个子组一个段,使用 合并加载上的 ballot 计数;无子组时每个线程一个段。然后对段计数进行一次扫描, 即可得出每个段的输出偏移。索引列表保持升序。网站: - https://llama.app
证明: - https://github.com/ggml-org/llama.cpp/attestations/52797762
macOS/iOS: - macOS Apple Silicon(arm64) - macOS Apple Silicon(arm64,已启用 KleidiAI) 已禁用 - macOS Intel(x64) - iOS XCFramework
Linux: - Ubuntu x64(CPU 版) - Ubuntu arm64(CPU 版) - Ubuntu s390x(CPU 版) - Ubuntu x64(Vulkan 版) - Ubuntu arm64(Vulkan 版) - Ubuntu x64(CUDA 12 版) - CUDA 12.8 库 - Ubuntu x64(CUDA 13 版) - CUDA 13.4 库 - Ubuntu arm64(CUDA 13 版) - CUDA 13.4 库 - Ubuntu x64(ROCm 10.0 版) - Ubuntu x64(OpenVINO 版) - Ubuntu x64(SYCL FP32 版) - Ubuntu x64(SYCL FP16 版) - Linux arm64(Snapdragon:CPU、Adreno GPU、Hexagon NPU) - 设置指南
Android 平台: - Android arm64(CPU 版本) - Android arm64(Snapdragon 平台:CPU、Adreno GPU、Hexagon NPU) - 设置指南
Windows 版本: - Windows x64(CPU)版本 - Windows arm64(CPU)版本 - Windows arm64(OpenCL Adreno)版本 - Windows x64(CUDA 12)版本 - CUDA 12.4 DLL 文件 - Windows x64(CUDA 13)版本 - CUDA 13.4 DLL 文件 - Windows arm64(CUDA 13)版本 - CUDA 13.4 DLL 文件 - Windows x64(Vulkan)版本 - Windows arm64(Vulkan)版本 - Windows x64(OpenVINO)版本 - Windows x64(SYCL)版本 - Windows x64(ROCm 10.0)版本
openEuler: - DISABLED - openEuler x86 架构(310p) - openEuler x86 架构(910b,ACL Graph) - openEuler aarch64 架构(310p) - openEuler aarch64 架构(910b,ACL Graph)
UI: - UI