llama.cpp Releases更新日

[プレリリース / 継続的ビルド] b11405

[プレリリース / 継続的ビルド] cuda: 4ヘッド向けにlightning indexerをキーとトークン上でタイリング (#29901) * cuda: 4ヘッド向けにlightning indexerをキーとトークン上でタイリング…

プレリリース / 継続的ビルド: これは実験的なビルドであり、安定版リリースではありません。

cuda: 4ヘッド向けにlightning indexerをキーとトークン上でタイリング (#29901) * cuda: 4ヘッド向けにlightning indexerをキーとトークン上でタイリング wmmaタイルに対してヘッド数が少なすぎる場合、1ブロックが8 トークンに対して64キーをスコアリングします。キーはhalf精度で一度ステージングされ、クエリは1 ヘッドずつ処理され、各スレッドが2トークンについて1キーを担当するため、どのドット 積にもスレッド間リダクションは不要です。トークン タイルより小さいバッチはベクトルカーネルを維持します。test-backend-opsは4ヘッドを測定します。 * cuda: lightning indexerタイルをfloatで乗算 am17anからのレビューに対応: 単一の q * kがf16範囲を超えるとhalf2の積がオーバーフローします。クエリは共有メモリ内でfloatのまま保持され 、キーの各half2は両トークン用に一度だけ拡張されるため、すべての 積と和はfloatで計算されます。 * cuda: 各lightning indexerキーを全ヘッド用に一度だけ拡張 タイルカーネルは全ヘッドのクエリと重みを一度にステージングする ため、各キー要素はhalfから一度だけ拡張され、全ヘッドに供給され ます。単一のバリアで行われます。F16キーはfloatを経由せずにタイルへコピーされます。キーを共有メモリ内でfloatのまま保持すると測定が 遅くなり、オキュパンシーが低下します。 * cuda: ROCm上でlightning indexerタイルがレジスタをスピルしないようにする タイルカーネルの各スレッドは単一トークンについて2キーをスコアリングするようになり、 ワープがトークンを共有し、クエリの読み出しはブロードキャストになります。同じ積に対して要素ペアごとに9回の代わりに6回の 共有読み出しで済みます。 内側のループは8でアンロールされており、完全にアンロールした場合に1,000超が必要だったところで、gfx908をスピルなしの63 VGPRsに保ち、 R9700上でカーネルを36倍高速化し、CUDAでもわずかに高速化します。

ウェブサイト: - https://llama.app

アテステーション: - https://github.com/ggml-org/llama.cpp/attestations/52734616

macOS/iOS: - macOS Apple Silicon(arm64)版 - macOS Apple Silicon(arm64、KleidiAI有効) 無効(DISABLED) - macOS Intel(x64)版 - iOS 向け XCFramework

Linux: - Ubuntu x64(CPU) - Ubuntu arm64(CPU) - Ubuntu s390x(CPU) - Ubuntu x64(Vulkan) - Ubuntu arm64(Vulkan) - Ubuntu x64(CUDA 12) - CUDA 12.8 ライブラリ - Ubuntu x64(CUDA 13) - CUDA 13.4 ライブラリ - Ubuntu arm64(CUDA 13) - CUDA 13.4 ライブラリ - Ubuntu x64(ROCm 10.0) - Ubuntu x64(OpenVINO) - Ubuntu x64(SYCL FP32) - Ubuntu x64(SYCL FP16) - Linux arm64(Snapdragon: CPU、Adreno GPU、Hexagon NPU) - セットアップガイド

Android: - Android arm64(CPU) - Android arm64(Snapdragon: CPU、Adreno GPU、Hexagon NPU) - セットアップガイド

Windows版: - Windows x64(CPU)版 - Windows arm64(CPU)版 - Windows arm64(OpenCL Adreno)版 - Windows x64(CUDA 12)版 - CUDA 12.4 DLLファイル - Windows x64(CUDA 13)版 - CUDA 13.4 DLLファイル - Windows arm64(CUDA 13)版 - CUDA 13.4 DLLファイル - Windows x64(Vulkan)版 - Windows arm64(Vulkan)版 - Windows x64(OpenVINO)版 - Windows x64(SYCL)版 - Windows x64(ROCm 10.0)版

openEuler: - DISABLED - openEuler x86(310p) - openEuler x86(910b、ACLグラフ) - openEuler aarch64(310p) - openEuler aarch64(910b、ACLグラフ)

UI: - UI

原文の出典

llama.cpp Releases

内容について

原文の公開と権利は出典元に帰属します。

機械翻訳 · 原文をご参照ください