プレリリース / 連続ビルド: これは実験的なビルドであり、安定版リリースではありません。
feat: GLM5Next MTP を追加、最適化 (#29928) * llama : GLM5-Next NextN (MTP) グラフを追加 GLM5-Next のマルチトークン予測ヘッドを graph_mtp として構築: NextN ブロックは enorm(tok)+hnorm(h) を eh_proj で埋め込み、1 つのプレーンな DSA レイヤーと 共有 lm_head を実行し、no_build タグ ctor を通じてトランクのビルダーを再利用します。 llama_memory_recurrent は、コンテキストが再帰レイヤーを含まない場合の部分的な seq_rm も許容するようになり、これは MTP ドラフトコンテキストが必要とするものです。 Assisted-by: Claude * llama : glm5-next: ヘッドレス NextN フォワードにおける無駄な計算をスキップ 出力行を持たない NextN フォワード(MTP キャッチアップとドラフトコンテキストの prefill)はキャッシュ書き込みを通じてのみ永続化されるため、ヘッドレスグラフは MLA latent、indexer key|gate、pooled-key の書き込みを保持し、クエリ パス、indexer 選択、アテンション本体、FFN、LM ヘッドを削除します。 4 トークンのキャッチアップは 6.9 ms から 0.33 ms のカーネルに短縮されます。貪欲出力の ハッシュとドラフト受容は変更されていません。 Assisted-by: Claude * llama : glm5-next: NextN 抽出契約と共有テールのロールバックを修正 アーキテクチャレビューからの 3 つの修正。ヘッドレスグラフのプルーニングは、 マスクされていない nextn 抽出が有効でないことも要求するようになりました。そのモードは logits フラグに関係なく n_tokens の隠れ行を読み取るためです。マスクされた抽出は 出力 id によって収集された隠れ行を公開するため、出力フラグが接頭辞でないバッチも 正しい行をエクスポートします。テールセルが別のシーケンスと共有されている部分的な 再帰ロールバックは、そのシーケンスのテールを黙って移動するのではなく、拒否されるようになりました。 Assisted-by: Claude * llama : glm5-next: MTP 変更のコメントを整理 Assisted-by: Claude * llama : glm5-next: MTP グラフをプルーニングの代わりに出力行にクロップ ヘッドレス NextN プルーニングを、他の MTP グラフが使用するクロップパターンに置き換え: 位置ごとの FFN と共有ヘッドの前に、 出力 id でアテンション出力とブロック入力を gather します。 出力行を持たない NextN フォワード(MTP キャッチアップとドラフトコンテキストの prefill)は、ゼロ行に対して FFN とヘッドを実行します。4 トークンの キャッチアップは 6.9 ms から 2.9 ms のカーネルに短縮されます。貪欲出力の ハッシュは変更されていません。 Assisted-by: Claude * glm5-next: MTP グラフで nextn クロップヘルパーを使用 ローカルのクロップ条件と t_h_nextn のマスクされた select を crop_before_nextn と crop_after_nextn に置き換え、MTP グラフが メイングラフや他のモデルと同じように行を絞り込むようにします。 再帰の部分的なロールバックにおける共有セルと空のフィルタ分岐について記述します。 * glm5-next: MTP のみおよびトランクのみの GGUF ファイルを読み込み ファイルが NextN レイヤーのみを含む場合はトランクのテンソルをオプションにし、 ファイルがトランクのみを含む場合は NextN のテンソルをオプションにすることで、 分割された MTP GGUF をドラフトモデルとして読み込めるようにします。 Co-authored-by: Georgi Gerganov --------- Co-authored-by: Pascal Co-authored-by: Georgi Gerganovウェブサイト: - https://llama.app
アテステーション: - https://github.com/ggml-org/llama.cpp/attestations/53581440
macOS/iOS 向け: - macOS Apple Silicon (arm64) 版 - macOS Apple Silicon (arm64、KleidiAI 有効) 版 無効化 - macOS Intel (x64) 版 - iOS XCFramework 向け
Linux: - Ubuntu x64(CPU) - Ubuntu arm64(CPU) - Ubuntu s390x(CPU) - Ubuntu x64(Vulkan) - Ubuntu arm64(Vulkan) - Ubuntu x64(CUDA 12) - CUDA 12.8 ライブラリ - Ubuntu x64(CUDA 13) - CUDA 13.4 ライブラリ - Ubuntu arm64(CUDA 13) - CUDA 13.4 ライブラリ - Ubuntu x64(ROCm 10.0) - Ubuntu x64(OpenVINO) - Ubuntu x64(SYCL FP32) - Ubuntu x64(SYCL FP16) - Linux arm64(Snapdragon: CPU、Adreno GPU、Hexagon NPU) - セットアップガイド
Android: - Android arm64(CPU) - Android arm64(Snapdragon: CPU、Adreno GPU、Hexagon NPU) - セットアップガイド
Windows(ウィンドウズ)版: - Windows x64(CPU)版 - Windows arm64(CPU)版 - Windows arm64(OpenCL Adreno)版 - Windows x64(CUDA 12)版 - CUDA 12.4 DLL(ダイナミックリンクライブラリ) - Windows x64(CUDA 13)版 - CUDA 13.4 DLL(ダイナミックリンクライブラリ) - Windows arm64(CUDA 13)版 - CUDA 13.4 DLL(ダイナミックリンクライブラリ) - Windows x64(Vulkan)版 - Windows arm64(Vulkan)版 - Windows x64(OpenVINO)版 - Windows x64(SYCL)版 - Windows x64(ROCm 10.0)版
openEuler: - DISABLED ・openEuler x86(310p) ・openEuler x86(910b、ACL Graph) ・openEuler aarch64(310p) ・openEuler aarch64(910b、ACL Graph)
UI: - UI