llama.cpp Releases更新日

[プレリリース / 継続的ビルド] b11408

[プレリリース / 継続的ビルド] ggml-cpu : SpacemiT X60 向けに Q8_0 IME1 マトリクスカーネルを追加 (#28479) * ggml-cpu : SpacemiT X60 向けに Q8_0 IME1 マトリクスカーネルを追加 SpacemiT X60 では、IME マトリクスアクセラレーションは Q4_0/Q4_1/Q4_K のみをカバーしていました。Q8_0 には IME1…

プレリリース / 継続的ビルド: これは実験的なビルドであり、安定版リリースではありません。

ggml-cpu : SpacemiT X60 向けに Q8_0 IME1 マトリクスカーネルを追加 (#28479) * ggml-cpu : SpacemiT X60 向けに Q8_0 IME1 マトリクスカーネルを追加 SpacemiT X60 では、IME マトリクスアクセラレーションは Q4_0/Q4_1/Q4_K のみをカバーしていました。 Q8_0 には IME1 カーネルが存在せず、SpacemiT ビルドでは GGML_CPU_REPACK=OFF が設定されているため repack パスもコンパイルされておらず、Q8_0 には アクセラレーションされたパスがまったくなく、同じボード上での prefill は Q4_0 の 約10倍遅く動作していました。 - make_block_q8_0x16 と Q8_0 の repack エントリを追加: 重みを IME1 の vmadot シーケンスが 想定する 16 列レイアウトにインターリーブします - ime1::gemm_kernel_i8i8 を追加: int8 x int8 の IME1 カーネルで、1 行パスと 4 行の A パスを持ちます。4 行パスは各 B パネルを一度だけロードし、 A の 4 行で再利用します - 4 行の活性化量子化のため quantize_a_4row_i8 を追加 - 両方を Q8_0 の forward_mul_mat と repack ファクトリに接続 - ドキュメント: Q8_0 を X60 でサポート済みとマーク 正確性については、K = 32 から 4096 まで量子化厳密な整数リファレンスと比較して 最大相対誤差約 1e-6 であることを確認し、複数のプロンプトにわたって 生成が一貫性を保つことも確認しました。 Milk-V Jupiter (SpacemiT X60)、Bianbu 2.1.1、gcc 14.2、 Qwen2.5-0.5B-Instruct Q8_0 でテストしました。taskset -c 0-3 下での llama-bench -t 4、 アイドル状態のボードで 5 回の繰り返し: pp128 は 10.70 から 93.87 t/s へ向上しました。 Q4_0 は 106.40 -> 107.51 t/s で変化なし、このパスには 触れていないため期待どおりです。 * ggml-cpu : q8_0_16x32 の宣言を IME1 セクションへ移動 * ggml-cpu : q8_0 IME1 カーネルの代入位置を整列

Website: - https://llama.app

Attestations: - https://github.com/ggml-org/llama.cpp/attestations/52757256

macOS/iOS 向け: - macOS Apple Silicon(arm64)版 - macOS Apple Silicon(arm64、KleidiAI 有効)版 DISABLED(無効) - macOS Intel(x64)版 - iOS 向け XCFramework

Linux: - Ubuntu x64(CPU) - Ubuntu arm64(CPU) - Ubuntu s390x(CPU) - Ubuntu x64(Vulkan) - Ubuntu arm64(Vulkan) - Ubuntu x64(CUDA 12) - CUDA 12.8 ライブラリ - Ubuntu x64(CUDA 13) - CUDA 13.4 ライブラリ - Ubuntu arm64(CUDA 13) - CUDA 13.4 ライブラリ - Ubuntu x64(ROCm 10.0) - Ubuntu x64(OpenVINO) - Ubuntu x64(SYCL FP32) - Ubuntu x64(SYCL FP16) - Linux arm64(Snapdragon: CPU、Adreno GPU、Hexagon NPU) - セットアップガイド

Android: - Android arm64(CPU) - Android arm64(Snapdragon: CPU、Adreno GPU、Hexagon NPU) - セットアップガイド

Windows: - Windows x64 (CPU) - Windows arm64 (CPU) - Windows arm64 (OpenCL Adreno) - Windows x64 (CUDA 12) - CUDA 12.4 の DLL - Windows x64 (CUDA 13) - CUDA 13.4 の DLL - Windows arm64 (CUDA 13) - CUDA 13.4 の DLL - Windows x64 (Vulkan) - Windows arm64 (Vulkan) - Windows x64 (OpenVINO) - Windows x64 (SYCL) - Windows x64 (ROCm 10.0)

openEuler: - DISABLED - openEuler x86(310p)向け - openEuler x86(910b、ACL Graph)向け - openEuler aarch64(310p)向け - openEuler aarch64(910b、ACL Graph)向け

UI: - UI

原文の出典

llama.cpp Releases

内容について

原文の公開と権利は出典元に帰属します。

機械翻訳 · 原文をご参照ください