llama.cpp Releases

[Pré-lancement / construction continue] b11474

[Pré-révision / build continu] feat : ajouter GLM5Next MTP, optimisation (#29928) * llama : ajouter GLM5-Next NextN (MTP) graph. Construire la tête de prédiction multi-tokens GLM5-Next en tant que graph_mtp : le bloc…

Build pré-révision / build continu : il s’agit d’un build expérimental, pas d’une version stable.

feature : ajouter GLM5Next MTP, optimisation (#29928) * llama : ajouter GLM5-Next NextN (MTP) graph Construire la tête de prédiction multi-token GLM5-Next en utilisant le graph_mtp : le bloc NextN incorpore enorm(tok)+hnorm(h) via eh_proj, exécute une couche DSA simple et la lm_head partagée, réutilisant les constructeurs du tronc via le ctor no_build. llama_memory_recurrent tolère également une seq_rm partielle lorsque le contexte ne contient pas de couches récurrentes, ce qui est nécessaire pour le contexte du projet MTP. Assisté par : Claude * llama : glm5-next: ignorer le calcul mort dans les NextN headless Un forward NextN sans lignes de sortie (le MTP catch-up et le draft-context prefill) persiste uniquement grâce aux écritures de sa cache, ainsi le graphique headless conserve la MLA latent, l’indexer key|gate et les écritures poolée-key, et supprime le chemin de requête, la sélection de l’indexer, le corps d’attention, le FFN et la tête du LM. Le rattrapage de 4 tokens passe de 6,9 ms à 0,33 ms sur les noyaux ; les hachages de sortie avides et l’acceptation des drafts restent inchangés. Assistance : Claude * llama : glm5-next : corriger les contrats d’extraction NextN et le rollback de la queue partagée Trois corrections apportées suite à l’examen architectural. La suppression du graphe sans tête nécessite désormais que aucune extraction NextN non masquée ne soit en cours, car ce mode lit les lignes cachées n_tokens indépendamment des flags logits. Extraction masquée publie les lignes cachées recueillies par les IDs de sortie, de sorte qu’un lot dont les étiquettes de sortie ne sont pas un préfixe exporte les bonnes lignes. Un retour en arrière partiel et récurrent dont la cellule d’extrémité est partagée avec une autre séquence est maintenant rejeté plutôt que de déplacer silencieusement cette cellule d’extrémité de la séquence. Assisté par : Claude * llama : glm5-next : nettoyer les commentaires dans les modifications du MTP Assisté par : Claude * llama : glm5-next : couper le graphique MTP sur les lignes de sortie plutôt que de le supprimer Remplacer le prunage NextN sans tête par le motif de coupe utilisé par les autres graphiques MTP : rassembler l’attention de sortie et l’entrée de bloc aux IDs de sortie avant le FFN positionnel et la tête partagée. A NextN forward sans lignes de sortie (la MTP catch-up et le draft-context prefill) puis exécute le FFN et le head au-dessus de zéro ligne. Le 4-token catch-up passe de 6,9 ms à 2,9 ms de kernels ; les hachages de sortie gourmands restent inchangés. Assistance : Claude * glm5-next : utiliser les helpers de croissance nextn dans le graphique MTP Remplacer la condition de croissance locale et le sélection masqué de t_h_nextn par crop_before_nextn et crop_after_nextn, afin que le graphique MTP réduise ses lignes de la même manière que le graphique principal et les autres modèles. Décrire la cellule partagée et les branches de filtre vides de la régression partielle. * glm5-next : charger les fichiers GGUF ne contenant que des données MTP et que du tronck, Rendre les tensors de tronck optionnels lorsque le fichier ne contient que la couche NextN, et les tensors NextN optionnels lorsque le fichier ne contient que du tronck, de sorte que le fichier MTP divisé GGUF se charge comme un modèle préparatoire. Auteur co-auteur : Georgi Gerganov --------- Auteur co-auteur : Pascal Auteur co-auteur : Georgi Gerganov

Site web : - https://llama.app

Attestations : - https://github.com/ggml-org/llama.cpp/attestations/53581440

macOS/iOS : - macOS Apple Silicon (arm64) - macOS Apple Silicon (arm64, KleidiAI activé) DÉSACTIVÉ - macOS Intel (x64) - iOS XCFramework

Linux : - Ubuntu x64 (CPU) - Ubuntu arm64 (CPU) - Ubuntu s390x (CPU) - Ubuntu x64 (Vulkan) - Ubuntu arm64 (Vulkan) - Ubuntu x64 (CUDA 12) - Bibliothèques CUDA 12.8 - Ubuntu x64 (CUDA 13) - CUDA 13.4 bibliothèques - Ubuntu arm64 (CUDA 13) - CUDA 13.4 bibliothèques - Ubuntu x64 (ROCm 10.0) - Ubuntu x64 (OpenVINO) - Ubuntu x64 (SYCL FP32) - Ubuntu x64 (SYCL FP16) - Linux arm64 (Snapdragon : CPU, Adreno GPU, Hexagon NPU) - guide de configuration

Android : - Android arm64 (CPU) - Android arm64 (Snapdragon : CPU, Adreno GPU, Hexagon NPU) - guide de configuration

Windows : - Windows x64 (CPU) - Windows arm64 (CPU) - Windows arm64 (OpenCL Adreno) - Windows x64 (CUDA 12) - CUDA 12.4 DLLs - Windows x64 (CUDA 13) - CUDA 13.4 DLLs - Windows arm64 (CUDA 13) - CUDA 13.4 DLLs - Windows x64 (Vulkan) - Windows arm64 (Vulkan) - Windows x64 (OpenVINO) - Windows x64 (SYCL) - Windows x64 (ROCm 10.0)

openEuler : - DÉACTIFÉ - openEuler x86 (310p) - openEuler x86 (910b, ACL Graph) - openEuler aarch64 (310p) - openEuler aarch64 (910b, ACL Graph)

UI : - UI

Source originale

llama.cpp Releases

À propos du contenu

La publication originale et les droits appartiennent à la source.

Traduction automatique · Consultez l’original