llama.cpp Releases

[预发布 / 持续构建版本] b11454

[预发布 / 持续构建版本] model :添加 K2 Horizon dense 和 MoVA 支持 (#29535) * model: K2 Horizon gguf 转换代码 * model: 在 k2-horizon.cpp 中加载 hparams 和张量 * model: K2 Horizon 计算图 * model: K2 Horizon 计算图调整及注册分词器 * model: K2 Horizon 聊天模板并适配…

预发布 / 持续构建版本:这是一个实验性构建版本,不是稳定版本。

model :添加 K2 Horizon dense 和 MoVA 支持 (#29535) * model: K2 Horizon gguf 转换代码 * model: 在 k2-horizon.cpp 中加载 hparams 和张量 * model: K2 Horizon 计算图 * model: K2 Horizon 计算图调整及注册分词器 * model: K2 Horizon 聊天模板并适配 safetensors 命名 * unicode :添加 K2-Horizon 预分词器拆分器 K2-Horizon 正则表达式在 unicode_regex_split_custom 中没有对应的分支,因而落入通用的 std::regex 回退路径,而该回退存在两种失效方式。 在 MSVC 上 std::regex 拒绝 \p{...},因此在 Windows 上根本无法加载任何 K2-Horizon GGUF:llama-quantize、llama-imatrix 和 llama-perplexity 都会在产出任何 token 之前因 regex_error(error_escape) 而中止。 在回退路径能够编译的情况下它也是错误的。unicode_regex_split 在匹配之前把每个 码点折叠成一个表示其 Unicode 类别的单字节,而 U+200C/U+200D 属于 Control 类别, 该类别在 k_ucat_cpt 中没有条目,因此两者都变成 0xD0 回退字节。这样一来 K2 正则表达式中的字面 ‌ 和 ‍ 备选项永远无法匹配,每个 ZWNJ 或 ZWJ 都会终止一个字母串。 该拆分器基于现有的 llama3 拆分器,仅加宽了一条规则,即 K2 的正则表达式与 llama3 的唯一区别在于字母串还会附带附加符号、ZWNJ 和 ZWJ。 tests/test-unicode.cpp 为此新增了一个用例:更改前使用 [Amy] [ZWNJ khaham] 会失败,更改后字母串保持完整并通过测试。 * tests: 扩展 K2 Horizon unicode 拆分器覆盖范围 * unicode: 处理 K2 Horizon 大小写折叠和空输入 Assisted-by: Codex * jinja :在 selectattr 和 rejectattr 中支持序列索引 Assisted-by: Codex * model :添加 K2 Horizon dense 和 MoVA 支持 包含来自 ifm-ai/llama.cpp 的 K2 Horizon 实现,并带有转换器、张量并行以及模型保存/重新加载方面的修复。 Assisted-by: Codex * chat :支持 K2 Horizon 推理和工具调用 Assisted-by: Codex * conversion: 移除过时的 K2 Aurora 别名 Assisted-by: Codex * k2-horizon: 强制执行响应 模式并加载 YaRN beta 在推理之后约束最终 JSON,接受灵活的 JSON 工具封装, 强制执行 XML 方言,并处理重复或交替的思考标记。 加载 YaRN beta 元数据,而不是保留默认值。 添加 schema、流式传输、续写和模型重新加载方面的回归测试。验证 CUDA 和 CPU 构建以及 0.9B、4B 和 MoVA 的对话/工具往返。 Assisted-by: Codex * 重命名模板测试夹具 * 处理 cisc 的后续意见 * 清理解析器 / 回应 aldehir 的评论 * 清理 test-chat * 移除回退:模型主要使用 high 训练 * 修复 k2 attn_v_exp tn 拆分和 metal fusion 基线 * k2-horizon :在求和之前前向展开视图 * k2-horizon: 在 group norm 之前复制 embds 以修复 TP * 禁用张量并行 --------- Co-authored-by: Ryandito Diandaru Co-authored-by: WestWaters Co-authored-by: Natani L. Mayday <71436458+TaskPuppyNatani@users.noreply.github.com> Co-authored-by: West <100190545+WestWaters@users.noreply.github.com> Co-authored-by: aaryamonvikram Co-authored-by: aaryamonvikram <96529820+aaryamonvikram@users.noreply.github.com>

网站: - https://llama.app

证明(Attestations): - https://github.com/ggml-org/llama.cpp/attestations/53326308

macOS/iOS: - macOS Apple Silicon (arm64) - macOS Apple Silicon (arm64, 已启用 KleidiAI) 已禁用 - macOS Intel (x64) - iOS XCFramework

Linux: - Ubuntu x64 (CPU) - Ubuntu arm64 (CPU) - Ubuntu s390x (CPU) - Ubuntu x64 (Vulkan) - Ubuntu arm64 (Vulkan) - Ubuntu x64 (CUDA 12) - CUDA 12.8 库 - Ubuntu x64 (CUDA 13) - CUDA 13.4 库 - Ubuntu arm64 (CUDA 13) - CUDA 13.4 库 - Ubuntu x64 (ROCm 10.0) - Ubuntu x64 (OpenVINO) - Ubuntu x64 (SYCL FP32) - Ubuntu x64 (SYCL FP16) - Linux arm64(骁龙:CPU、Adreno GPU、Hexagon NPU) - 安装指南

Android: - Android arm64 (CPU) - Android arm64(骁龙:CPU、Adreno GPU、Hexagon NPU) - 安装指南

Windows: - Windows x64(CPU 版) - Windows arm64(CPU 版) - Windows arm64(OpenCL Adreno 版) - Windows x64(CUDA 12 版) - CUDA 12.4 DLL 文件 - Windows x64(CUDA 13 版) - CUDA 13.4 DLL 文件 - Windows arm64(CUDA 13 版) - CUDA 13.4 DLL 文件 - Windows x64(Vulkan 版) - Windows arm64(Vulkan 版) - Windows x64(OpenVINO 版) - Windows x64(SYCL 版) - Windows x64(ROCm 10.0 版)

openEuler: - 已禁用 - openEuler x86 架构(310p) - openEuler x86 架构(910b,ACL Graph) - openEuler aarch64 架构(310p) - openEuler aarch64 架构(910b,ACL Graph)

用户界面: - 用户界面

原始出处

llama.cpp Releases

内容说明

原始发布及相关权利归来源方。

机器翻译 · 请以原文为准