llama.cpp Releases更新日

[Pre-release / 継続的ビルド] b11463

[Pre-release / 継続的ビルド] sycl: MKL flash attention による GLM MLA prefill の高速化 (#29171) * sycl: MKL flash attention による GLM MLA prefill の高速化 GLM-4.7 Flash は、576 幅の Q/K ヘッド、512 幅の V ヘッド、GQA 20、F16 KV という MLA シェイプを使用します。SYCL…

Pre-release / 継続的ビルド: これは実験的なビルドであり、安定版リリースではありません。

sycl: MKL flash attention による GLM MLA prefill の高速化 (#29171) * sycl: MKL flash attention による GLM MLA prefill の高速化 GLM-4.7 Flash は、576 幅の Q/K ヘッド、512 幅の V ヘッド、GQA 20、F16 KV という MLA シェイプを使用します。SYCL ディスパッチャーはこのシェイプを拒否します。 通常の MKL flash-attention ゲートは一致する K/V 幅を要求し、ヘッド次元を 512 に制限しているため、プロンプト処理は 大幅に遅い TILE カーネルにフォールバックします。 検証済みの 576/576/512、GQA-20 F16 シェイプのみを既存の MKL パイプラインに受け入れます。他の不一致な K/V シェイプはすべて現在の フォールバックパスに維持します。 GLM の V キャッシュを K 行のより狭いストライドビューとして扱います。行ストライドに パディングがある場合はストライド対応の F16 記述子を選択し、論理幅が一致する場合にのみ K/V 逆量子化バッファーをエイリアスします。ストライド例外は、K の行ストライドを 共有する実際の V ビューに限定します。 正確な 576/512、GQA-20 プロンプトパスのバックエンドテストを追加します。 master e613ef2 の Intel Arc Pro B70 では、pp8192 が 432.80 から 1292.29 tok/s に向上しました(2.99 倍、+198.6%)。tg256 はノイズ範囲内で 変わらず、45.67 に対して 45.65 tok/s です。正確な MLA テストは合格し、 デバッグ出力が MKL ディスパッチを確認しています。 * sycl: MKL flash attention のスコアを F16 で保存 QK GEMM の出力を F32 の代わりに F16 で保持します。オンライン softmax は 依然として各スコアを最大値・指数・総和の計算のために F32 に変換するため、 スコアの丸めを除き要素ごとの計算は変わらず、F32 の 行列は F16 の確率として消費されるためだけに書き込まれていました。 F32 のスコア行列はこのパス上で最大の flash-attention 中間データであり、 F16 で保存することでサイズとトラフィックが半分になります。これは、各スコア行を 協調的に読み取る 1aa2954bd の coalesced softmax ロードの上に構築されているため、 小さいデータ型が効果を発揮します。 前のコミットのディスパッチを使用して、Intel Arc Pro B70 で -ngl 999 -b 4096 -ub 1024 -ctk f16 -ctv f16 -fa on で測定: pp8192 1583.9 -> 1657.1 tok/s (+4.6%) pp64000 610.0 -> 684.5 tok/s (+12.2%) pp131072 ~354 -> 402.1 tok/s (+13.5%) 8k コンテキストでの tg256 は不変(32.64)で、FLASH_ATTN_EXT スイートには 新たな失敗はありません。正確な GLM MLA バックエンドケースは CPU に対して合格します。 測定ペアのみを引用したい場合は、~354 のベースライン数値を調整してください(131k のディスパッチのみのポイントは同等の保守ビルドからのものです)。貢献ガイドラインに従い、AI がこの変更に貢献しているため、必要に応じて Assisted-by: を追加してください。 * "sycl: MKL flash attention のスコアを F16 で保存" を取り消し この取り消しはコミット 265f9748164dc88e02678425b75f520ccd528b32 を元に戻します。

ウェブサイト: - https://llama.app

検証情報 (Attestations): - https://github.com/ggml-org/llama.cpp/attestations/53529269

macOS/iOS ビルド: - macOS Apple Silicon (arm64) ビルド - macOS Apple Silicon (arm64、KleidiAI 有効) ビルド DISABLED(無効) - macOS Intel (x64) ビルド - iOS 用 XCFramework

Linux: - Ubuntu x64 (CPU) - Ubuntu arm64 (CPU) - Ubuntu s390x (CPU) - Ubuntu x64 (Vulkan) - Ubuntu arm64 (Vulkan) - Ubuntu x64 (CUDA 12) - CUDA 12.8 ライブラリ - Ubuntu x64 (CUDA 13) - CUDA 13.4 ライブラリ - Ubuntu arm64 (CUDA 13) - CUDA 13.4 ライブラリ - Ubuntu x64 (ROCm 10.0) - Ubuntu x64 (OpenVINO) - Ubuntu x64 (SYCL FP32) - Ubuntu x64 (SYCL FP16) - Linux arm64 (Snapdragon: CPU、Adreno GPU、Hexagon NPU) - セットアップガイド

Android: - Android arm64 (CPU) - Android arm64 (Snapdragon: CPU、Adreno GPU、Hexagon NPU) - セットアップガイド

Windows: - Windows x64(CPU)向け - Windows arm64(CPU)向け - Windows arm64(OpenCL Adreno)向け - Windows x64(CUDA 12)向け - CUDA 12.4 用DLL - Windows x64(CUDA 13)向け - CUDA 13.4 用DLL - Windows arm64(CUDA 13)向け - CUDA 13.4 用DLL - Windows x64(Vulkan)向け - Windows arm64(Vulkan)向け - Windows x64(OpenVINO)向け - Windows x64(SYCL)向け - Windows x64(ROCm 10.0)向け

openEuler: - DISABLED - openEuler x86(310p) - openEuler x86(910b、ACLグラフ) - openEuler aarch64(310p) - openEuler aarch64(910b、ACLグラフ)

UI: - UI

原文の出典

llama.cpp Releases

内容について

原文の公開と権利は出典元に帰属します。

機械翻訳 · 原文をご参照ください