llama.cpp Releases更新日

[プレリリース / 継続的ビルド] b11436

[プレリリース / 継続的ビルド] ggml-openvino: CIテストを修正、GPUのリグレッションを修正。(#30037) * ggml-openvino: 選択されていないグラフの分岐をスキップし、DUPをサポート Upstream #29622 が ggml_build_forward_select() を通じて、すべての入力埋め込みグラフに token/embd…

プレリリース / 継続的ビルド: これは実験的なビルドであり、安定版リリースではありません。

ggml-openvino: CIテストを修正、GPUのリグレッションを修正。(#30037) * ggml-openvino: 選択されていないグラフの分岐をスキップし、DUPをサポート Upstream #29622 が ggml_build_forward_select() を通じて、すべての入力 埋め込みグラフに token/embd 混合の分岐を追加しました。そのノードは 計算対象としてフラグが立てられていませんが、バックエンドはそれらを 翻訳してしまい、その分岐内の DUP はサポートされていなかったため、 スケジューラはグラフを分割し、固定のトークン数で埋め込みを分割境界を 越えて渡しました。その結果、最初のシングルトークンデコードが失敗しました (CPUおよびGPU上の test-thread-safety)。 OVモデルを計算ノードのみから構築するようにし、グラフが1つのバックエンドに 留まるよう、CONTと同様に同型の連続する DUP を翻訳します。 * ggml-openvino: inp_scale_rows のトークン次元を動的に #29622 は、トークンごとの埋め込みスケール(gemma3、gemma3n、 gemma4)を新しい [1, n_tokens] 入力に移動させました。これに動的な トークン次元を与え、静的(NPU)パスではチャンクごとにパディングします。 * ggml-openvino: 未バインドの Q4_1/Q4_K 重みを含む GPU MUL_MAT opテストをスキップ opテストは Q4_1/Q4_K の重みを f16 のゼロ点を持つ u4 として構築します。GPU プラグインは一部の行数において、この形式のコンパイルに「clFinish, error code: -5 CL_OUT_OF_RESOURCES」で失敗し、#29869 で追加された MUL_MAT のケース(例: m=1000, n=2, k=1024)において test-backend-ops が中断されます。モデルの重みは u4 のゼロ点を 使用しており、影響を受けません。 プラグインが修正されるまで、これらのケースをGPU上ではサポート対象外として 報告します。opテストは割り当て前にサポート状況を確認するため、このチェックは 未バインドの重みにのみ一致します。モデルのロードはダミーバッファで プローブを行い、重みをGPU上に保持します。 * ggml-openvino: FILL を出力型で作成する translate_fill は常に f32 の定数を構築していたため、f16 の FILL が f32 のデータを生成し、コピー帰りが f16 の出力バッファを オーバーランしていました。定数には出力型を使用します。 * ggml-openvino: 量子化型を伴う CONCAT を拒否する 量子化された入力は翻訳時に非量子化されるため、バックエンドは量子化型の CONCAT 出力を書き込むことができません。量子化型への CPY と同様に、 サポート対象外として報告します。 * ggml-openvino: build_rs の単一の再帰状態ギャザーを処理する #29856 により、build_rs は s_copy のリーフ上の単一の GET_ROWS ですべての 再帰状態をギャザーし、ubatch と追加の状態をそのビューとして扱うように なりました。ステートフルパスは以前の形式、すなわち s_copy のビューごとに 1つの GET_ROWS のみに一致していたため、Qwen3.5 は CPU および GPU での ステートフル実行に失敗しました(Concat 内の "is_axis_valid(axis, r)")。 シングルスロットキャッシュの場合、s_copy のリーフ上の GET_ROWS を アクティブ状態のギャザーとして扱い、そのビューを読み取る reshape の ランク4レイアウトを維持し、空の追加状態ビューのコピーをシングルスロットの 残り書き戻しにマッピングします。空のビューの動的次元について警告しないでください。 * openvino: GPUプラグインの欠陥を回避するため eltwise オペランドのランクを揃える * openvino: ランク3のステートフルグラフ上のMoE融合に一致させる * ggml-openvino: AlignEltwiseOperandRanks で RMS ノルムの出力を unsqueeze しない このパスは、オペランドのランクが異なる Add/Multiply/Subtract の 低ランク側のオペランドを unsqueeze します。gemma-3 では、アテンション後の 残差加算の低ランク側のオペランドがノルム出力であり、それを unsqueeze すると GPUプラグインがレイヤーを誤って計算します: gemma-3 はステートフル実行で GPU上の回答が空になります。 低ランク側のオペランドが RMS ノルムの出力である場合は、この書き換えを スキップしてください。 * docs : OpenVINO 検証済みモデルを更新 --------- Co-authored-by: Mustafa Cavus

ウェブサイト: - https://llama.app

Attestations(証明): - https://github.com/ggml-org/llama.cpp/attestations/53122299

macOS/iOS 向け: - macOS Apple Silicon (arm64) 版 - macOS Apple Silicon (arm64、KleidiAI 有効) 無効 - macOS Intel (x64) 版 - iOS 向け XCFramework

Linux: - Ubuntu x64 (CPU) - Ubuntu arm64 (CPU) - Ubuntu s390x (CPU) - Ubuntu x64 (Vulkan) - Ubuntu arm64 (Vulkan) - Ubuntu x64 (CUDA 12) - CUDA 12.8 ライブラリ - Ubuntu x64 (CUDA 13) - CUDA 13.4 ライブラリ - Ubuntu arm64 (CUDA 13) - CUDA 13.4 ライブラリ - Ubuntu x64 (ROCm 10.0) - Ubuntu x64 (OpenVINO) - Ubuntu x64 (SYCL FP32) - Ubuntu x64 (SYCL FP16) - Linux arm64 (Snapdragon: CPU、Adreno GPU、Hexagon NPU) - セットアップガイド

Android: - Android arm64 (CPU) - Android arm64 (Snapdragon: CPU、Adreno GPU、Hexagon NPU) - セットアップガイド

Windows向け: - Windows x64(CPU)向け - Windows arm64(CPU)向け - Windows arm64(OpenCL Adreno)向け - Windows x64(CUDA 12)向け - CUDA 12.4 DLL - Windows x64(CUDA 13)向け - CUDA 13.4 DLL - Windows arm64(CUDA 13)向け - CUDA 13.4 DLL - Windows x64(Vulkan)向け - Windows arm64(Vulkan)向け - Windows x64(OpenVINO)向け - Windows x64(SYCL)向け - Windows x64(ROCm 10.0)向け

openEuler: - DISABLED - openEuler x86 (310p) - openEuler x86 (910b、ACL Graph あり) - openEuler aarch64 (310p) - openEuler aarch64 (910b、ACL Graph あり)

UI: - UI

原文の出典

llama.cpp Releases

内容について

原文の公開と権利は出典元に帰属します。

機械翻訳 · 原文をご参照ください