Pre-release / 継続的ビルド: これは実験的なビルドであり、安定版リリースではありません。
vulkan: 量子化K/V向けのスパースflash attention (#29639) * vulkan: 量子化K/V向けのスパースflash attention Assisted-by: Claude * vulkan: シングルスキャンによるスパースFAインデックス圧縮 これまでの圧縮処理は、マスク行ごとに1つのワークグループを実行し、行を BLOCK_SIZEチャンク単位で走査して、チャンクごとにワークグループスキャンを 行うものでした。デコードでは、1つのワークグループがKV/1024回のバリア 境界付き反復を行うことになるため、128kセルではその処理が、供給先の スパースattention自体よりも高いコストとなっていました。 代わりに、行を連続したセグメントに分割します: サブグループありの場合は coalescedロードに対するballotカウントでセグメントごとに1つ、サブグループ なしの場合はスレッドごとに1つとします。セグメント数に対する単一のスキャン により、各セグメントの出力オフセットが得られます。インデックスリストは 昇順のまま維持されます。Website: - https://llama.app
Attestations: - https://github.com/ggml-org/llama.cpp/attestations/52797762
macOS/iOS: - macOS Apple Silicon (arm64) - macOS Apple Silicon (arm64、KleidiAI有効化) ディスエーブルド(無効) - macOS Intel (x64) - iOS向けのXCFramework
Linux: - Ubuntu x64(CPU) - Ubuntu arm64(CPU) - Ubuntu s390x(CPU) - Ubuntu x64(Vulkan) - Ubuntu arm64(Vulkan) - Ubuntu x64(CUDA 12) - CUDA 12.8 ライブラリ - Ubuntu x64(CUDA 13) - CUDA 13.4 ライブラリ - Ubuntu arm64(CUDA 13) - CUDA 13.4 ライブラリ - Ubuntu x64(ROCm 10.0) - Ubuntu x64(OpenVINO) - Ubuntu x64(SYCL FP32) - Ubuntu x64(SYCL FP16) - Linux arm64(Snapdragon: CPU、Adreno GPU、Hexagon NPU) - セットアップガイド
Android: - Android arm64(CPU) - Android arm64(Snapdragon: CPU、Adreno GPU、Hexagon NPU) - セットアップガイド
Windows版: - Windows x64(CPU) - Windows arm64(CPU) - Windows arm64(OpenCL Adreno) - Windows x64(CUDA 12) - CUDA 12.4 DLLファイル - Windows x64(CUDA 13) - CUDA 13.4 DLLファイル - Windows arm64(CUDA 13) - CUDA 13.4 DLLファイル - Windows x64(Vulkan) - Windows arm64(Vulkan) - Windows x64(OpenVINO) - Windows x64(SYCL) - Windows x64(ROCm 10.0)
openEuler: - DISABLED - openEuler x86 (310p) 向け - openEuler x86 (910b、ACL Graph) 向け - openEuler aarch64 (310p) 向け - openEuler aarch64 (910b、ACL Graph) 向け
UI: - UI