llama.cpp Releases更新于

[预发布版本 / 持续构建版本] b11474

[预发布版本 / 持续构建版本] feat: add GLM5Next MTP, optimize (#29928) * llama : 添加 GLM5-Next NextN (MTP) 图 将 GLM5-Next 的多 token 预测头构建为 graph_mtp:NextN 块通过 eh_proj 嵌入 enorm(tok)+hnorm(h),运行一个普通 DSA 层和共享的 lm_head,并通过 no_build…

预发布版本 / 持续构建版本:这是一个实验性构建版本,不是稳定发布版本。

feat: add GLM5Next MTP, optimize (#29928) * llama : 添加 GLM5-Next NextN (MTP) 图 将 GLM5-Next 的多 token 预测头构建为 graph_mtp:NextN 块通过 eh_proj 嵌入 enorm(tok)+hnorm(h),运行一个普通 DSA 层和共享的 lm_head,并通过 no_build 标签构造函数复用主干(trunk)的构建器。当上下文中没有循环层时, llama_memory_recurrent 也容忍部分 seq_rm,这正是 MTP 草稿上下文所需要的。 Assisted-by: Claude * llama : glm5-next: 在无头 NextN 前向中跳过无用计算 没有输出行的 NextN 前向(MTP 追赶和草稿上下文 prefill)仅通过其缓存写入而 持久化,因此无头图保留 MLA latent、indexer key|gate 和 pooled-key 写入, 并丢弃查询路径、indexer 选择、注意力主体、FFN 和 LM 头。4-token 追赶的 内核耗时从 6.9 ms 降至 0.33 ms;贪心输出哈希和草稿接受率保持不变。 Assisted-by: Claude * llama : glm5-next: 修复 NextN 提取契约和共享尾部回滚 来自架构评审的三项修复。无头图剪枝现在还要求没有未掩码的 nextn 提取处于 活动状态,因为该模式会无视 logits 标志读取 n_tokens 个隐藏行。掩码提取会 发布由输出 id 收集的隐藏行,因此输出标志不是前缀的批次也能导出正确的行。 尾部单元与其他序列共享的部分循环回滚现在会被拒绝,而不是静默移动该序列的 尾部。 Assisted-by: Claude * llama : glm5-next: 整理 MTP 改动中的注释 Assisted-by: Claude * llama : glm5-next: 将 MTP 图裁剪到输出行而不是进行剪枝 用其他 MTP 图使用的裁剪模式替换无头 NextN 剪枝:在按位置计算的 FFN 和共享 头之前,在输出 id 处收集注意力输出和块输入。没有输出行的 NextN 前向(MTP 追赶和草稿上下文 prefill)随后在零行上运行 FFN 和头。4-token 追赶的内核 耗时从 6.9 ms 降至 2.9 ms;贪心输出哈希保持不变。 Assisted-by: Claude * glm5-next: 在 MTP 图中使用 nextn 裁剪辅助函数 用 crop_before_nextn 和 crop_after_nextn 替换本地的裁剪条件和 t_h_nextn 的 掩码选择,使 MTP 图以与主图及其他模型相同的方式收窄其行。 描述循环部分回滚中的共享单元和空过滤分支。 * glm5-next: 加载仅含 MTP 和仅含主干的 GGUF 文件 当文件仅包含 NextN 层时,将主干张量设为可选;当文件仅包含主干时,将 NextN 张量设为可选,以便拆分的 MTP GGUF 能作为草稿模型加载。 Co-authored-by: Georgi Gerganov --------- Co-authored-by: Pascal Co-authored-by: Georgi Gerganov

网站: - https://llama.app

证明(Attestations): - https://github.com/ggml-org/llama.cpp/attestations/53581440

macOS/iOS: - macOS Apple Silicon (arm64) - macOS Apple Silicon (arm64, 启用 KleidiAI) 已禁用 - macOS Intel (x64) - iOS XCFramework

Linux: - Ubuntu x64(CPU) - Ubuntu arm64(CPU) - Ubuntu s390x(CPU) - Ubuntu x64(Vulkan) - Ubuntu arm64(Vulkan) - Ubuntu x64(CUDA 12) - CUDA 12.8 库 - Ubuntu x64(CUDA 13) - CUDA 13.4 库 - Ubuntu arm64(CUDA 13) - CUDA 13.4 库 - Ubuntu x64(ROCm 10.0) - Ubuntu x64(OpenVINO) - Ubuntu x64(SYCL FP32) - Ubuntu x64(SYCL FP16) - Linux arm64(Snapdragon:CPU、Adreno GPU、Hexagon NPU) - 安装指南

Android: - Android arm64(CPU) - Android arm64(Snapdragon:CPU、Adreno GPU、Hexagon NPU) - 安装指南

Windows 平台: - Windows x64(CPU 版本) - Windows arm64(CPU 版本) - Windows arm64(OpenCL Adreno 版本) - Windows x64(CUDA 12 版本) - CUDA 12.4 DLL 文件 - Windows x64(CUDA 13 版本) - CUDA 13.4 DLL 文件 - Windows arm64(CUDA 13 版本) - CUDA 13.4 DLL 文件 - Windows x64(Vulkan 版本) - Windows arm64(Vulkan 版本) - Windows x64(OpenVINO 版本) - Windows x64(SYCL 版本) - Windows x64(ROCm 10.0 版本)

openEuler: - 已禁用 - openEuler x86 平台(310p) - openEuler x86 平台(910b,ACL Graph) - openEuler aarch64 平台(310p) - openEuler aarch64 平台(910b,ACL Graph)

UI: - UI

原始出处

llama.cpp Releases

内容说明

原始发布及相关权利归来源方。

机器翻译 · 请以原文为准