Pre-release / kontinuierlicher Build: Dies ist ein experimenteller Build, kein stabiler Release.
Vorteil: Hinzufügen von GLM5Next MTP, Optimierung (#29928) * Llama: Hinzufügen von GLM5-Next NextN (MTP) Graph Das GLM5-Next-Multi-Token-Prediktionsmodell wird als graph_mtp: das NextN-Blok erstellt. Es embedt enorm(tok)+hnorm(h) über eh_proj, führt eine einfache DSA-Schicht und die gemeinsame lm_head aus und nutzt die Bausteine des Trunks durch den no_build-Torquektor. Lama_memory_recurrent toleriert auch einen Teilseq_rm, wenn der Kontext keine rekurrenten Schichten enthält – was auch der MTP-Draft-Kontext benötigt. Assistiert von: Claude * llama : glm5-next: überspannen des toten Rechnens in der headless NextN-Forward Eine NextN-Forward ohne Ausgabeneinträge (die MTP-Catch-up und die draft-context-Prefill) bleibt nur durch die Cache-Writes erhalten, sodass das headless Graph den MLA latenten, indexer-key|gate und pooled-key-Writes behält und den Query-Pfad, die indexer-Selbstauswahl, den Attention-Body, den FFN und den LM-Head fallen lässt. Der 4-Token-Catch-up sinkt von 6,9 ms auf 0,33 ms in den Kernels; die gierigen Output-Hashes und die Akzeptanz des Entwurfs bleiben unverändert. Assisted-by: Claude * llama : glm5-next: beheben die NextN-Extraktionen und den Shared-Tail-Rollback Drei Fehlerbehebungen aus der architektonischen Überprüfung. Die headless-Graph-Purging erfordert nun auch, dass keine unmaskierten NextN-Extraktionen aktiv sind, da diese Modi die n_tokens versteckten Zeilen lesen, unabhängig von den Logits-Flaggen. Maskierte Extraktion veröffentlicht die versteckten Zeilen, die durch die Ausgabennamen erfasst wurden, sodass ein Batch, dessen Ausgabeflaggen kein Präfix sind, die richtigen Zeilen exportiert. Ein teilweiser wiederkehrender Rückroll, dessen letzte Zelle mit einer anderen Sequenz gemeinsam ist, wird jetzt abgelehnt, anstatt die letzte Zelle dieser Sequenz stillschweigend zu verschieben. Assisted-by: Claude * llama : glm5-next: Ordnen die Kommentare in den MTP-Änderungen Assisted-by: Claude * llama : glm5-next: Kürze das MTP-Graph auf die Ausgabeneinträge anstatt es zu prüfen Ersetzen Sie das headless NextN-Pruning durch das Kürzungsmuster, das die anderen MTP-Graphen verwenden: sammle die Ausgabe und den Block-Eingang bei den Ausgabendaten vor dem positionellen FFN und dem gemeinsamen Kopf. A NextN – mit keinen Ausgabereihen (das MTP-Catch-up und das Draft-Context-Prefill) – führt anschließend den FFN aus und übertrifft die Nullreihen. Das 4-Token-Catch-up sinkt von 6,9 ms auf 2,9 ms der Kernels; die gierigen Ausgabehashes bleiben unverändert. Assisted-by: Claude * glm5-next: Verwende die nächsten Crop-Helper im MTP-Graphen Ersetze die lokale Crop-Bedingung und die maskierte Auswahl von t_h_nextn durch crop_before_nextn und crop_after_nextn, sodass der MTP-Graphen seine Zeilen genauso wie der Hauptgraphen und die anderen Modelle verengt. Beschreibe die gemeinsame Zelle und die leeren Filterzweige des wiederkehrenden Teilrückzugs. * glm5-next: Laden von GGUF-Dateien, die nur MTP und nur Trunk enthalten Machen die Trunk-Tensors optional, wenn die Datei nur die NextN-Schicht enthält, und die NextN-Tensors optional, wenn die Datei nur den Trunk enthält, sodass das geteilte MTP-GGUF als Entwurfsmodell geladen wird. Mitwirkender: Georgi Gerganov --------- Mitwirkender: Pascal Mitwirkender: Georgi GerganovWebseite: - https://llama.app
Attestationen: - https://github.com/ggml-org/llama.cpp/attestations/53581440
macOS/iOS: - macOS Apple Silicon (arm64) - macOS Apple Silicon (arm64, KleidiAI aktiviert) DEACTIVIERT - macOS Intel (x64) - iOS XCFramework
Linux: - Ubuntu x64 (CPU) - Ubuntu arm64 (CPU) - Ubuntu s390x (CPU) - Ubuntu x64 (Vulkan) - Ubuntu arm64 (Vulkan) - Ubuntu x64 (CUDA 12) - CUDA 12.8 Bibliotheken - Ubuntu x64 (CUDA 13) - CUDA 13.4 Bibliotheken - Ubuntu arm64 (CUDA 13) - CUDA 13.4 Bibliotheken - Ubuntu x64 (ROCm 10.0) - Ubuntu x64 (OpenVINO) - Ubuntu x64 (SYCL FP32) - Ubuntu x64 (SYCL FP16) - Linux arm64 (Snapdragon: CPU, Adreno-GPU, Hexagon-NPU) - Setup-Guide
Android: - Android arm64 (CPU) - Android arm64 (Snapdragon: CPU, Adreno-GPU, Hexagon-NPU) - Setup-Anleitung
Windows: - Windows x64 (CPU) - Windows arm64 (CPU) - Windows arm64 (OpenCL Adreno) - Windows x64 (CUDA 12) - CUDA 12.4 DLLs - Windows x64 (CUDA 13) - CUDA 13.4 DLLs - Windows arm64 (CUDA 13) - CUDA 13.4 DLLs - Windows x64 (Vulkan) - Windows arm64 (Vulkan) - Windows x64 (OpenVINO) - Windows x64 (SYCL) - Windows x64 (ROCm 10.0)
openEuler: - DEACTIVIERT - openEuler x86 (310p) - openEuler x86 (910b, ACL Graph) - openEuler aarch64 (310p) - openEuler aarch64 (910b, ACL Graph)
UI: - UI