Pré-release / build continu : il s'agit d'un build expérimental, pas d'une version stable.
model : ajout de la prise en charge de K2 Horizon dense et MoVA (#29535) * model : code de conversion gguf pour K2 Horizon * model : chargement des hparams et des tenseurs dans k2-horizon.cpp * model : graphe de calcul de K2 Horizon * model : ajustement du graphe de calcul de K2 Horizon et enregistrement des tokenizers * model : modèle de chat de K2 Horizon et adaptation aux noms safetensors * unicode : ajout du pré-tokenizer splitter de K2-Horizon La regex de K2-Horizon n'avait aucune branche dans unicode_regex_split_custom et tombait sur le repli général std::regex, qui échoue de deux manières. Sous MSVC, std::regex rejette \p{...}, donc aucun GGUF K2-Horizon ne se charge du tout sous Windows : llama-quantize, llama-imatrix et llama-perplexity s'interrompent tous avec regex_error(error_escape) avant qu'un token ne soit produit. Là où le repli compile, il reste incorrect. unicode_regex_split réduit chaque codepoint à un seul octet nommant sa catégorie Unicode avant la correspondance, et U+200C/U+200D sont de catégorie Control, qui n'a pas d'entrée dans k_ucat_cpt, donc les deux deviennent l'octet de repli 0xD0. Les alternatives littérales et dans la regex de K2 ne peuvent alors jamais correspondre et chaque ZWNJ ou ZWJ termine une séquence de lettres. Le splitter est celui existant de llama3 avec une seule règle élargie, car la regex de K2 diffère de celle de llama3 uniquement en ce qu'une séquence de lettres accepte aussi les marques, ZWNJ et ZWJ. tests/test-unicode.cpp gagne un cas pour cela : il échoue avant la modification avec [Amy] [ZWNJ khaham] et passe après avec la séquence intacte. * tests : élargissement de la couverture du splitter unicode de K2 Horizon * unicode : gestion du pliage de casse de K2 Horizon et des entrées vides Assisted-by: Codex * jinja : prise en charge des indices de séquence dans selectattr et rejectattr Assisted-by: Codex * model : ajout de la prise en charge de K2 Horizon dense et MoVA Inclut l'implémentation de K2 Horizon issue de ifm-ai/llama.cpp avec le convertisseur, les correctifs tensor-parallel et de sauvegarde/rechargement du modèle. Assisted-by: Codex * chat : prise en charge du raisonnement et des appels d'outils de K2 Horizon Assisted-by: Codex * conversion : suppression de l'alias obsolète K2 Aurora Assisted-by: Codex * k2-horizon : application des schémas de réponse et chargement des bêtas YaRN Contraindre le JSON final après le raisonnement, accepter des enveloppes d'outils JSON flexibles, appliquer les dialectes XML et gérer les marqueurs de réflexion répétés ou alternés. Charger les métadonnées bêta YaRN au lieu de conserver les valeurs par défaut. Ajout de régressions pour les schémas, le streaming, la continuation et le rechargement du modèle. Validation des builds CUDA et CPU ainsi que des aller-retours de conversation/outils pour 0.9B, 4B et MoVA. Assisted-by: Codex * renommage de la fixture de modèle * traitement des relances de cisc * déslopardification du parseur / prise en compte des commentaires d'aldehir * nettoyage de test-chat * suppression du repli : modèle entraîné principalement sur high de toute façon * correction du découpage tn de k2 attn_v_exp et de la base de fusion metal * k2-horizon : propagation des vues expand avant les sommes * k2-horizon : copie des embds avant le group norm pour corriger TP * désactivation du parallélisme de tenseurs --------- Co-authored-by: Ryandito Diandaru Co-authored-by: WestWaters Co-authored-by: Natani L. Mayday <71436458+TaskPuppyNatani@users.noreply.github.com> Co-authored-by: West <100190545+WestWaters@users.noreply.github.com> Co-authored-by: aaryamonvikram Co-authored-by: aaryamonvikram <96529820+aaryamonvikram@users.noreply.github.com>Site Web : - https://llama.app
Attestations : - https://github.com/ggml-org/llama.cpp/attestations/53326308
macOS/iOS : - macOS Apple Silicon (arm64) - macOS Apple Silicon (arm64, KleidiAI activé) DÉSACTIVÉ - macOS Intel (x64) - XCFramework iOS
Linux : - Ubuntu x64 (CPU) - Ubuntu arm64 (CPU) - Ubuntu s390x (CPU) - Ubuntu x64 (Vulkan) - Ubuntu arm64 (Vulkan) - Ubuntu x64 (CUDA 12) - Bibliothèques CUDA 12.8 - Ubuntu x64 (CUDA 13) - Bibliothèques CUDA 13.4 - Ubuntu arm64 (CUDA 13) - Bibliothèques CUDA 13.4 - Ubuntu x64 (ROCm 10.0) - Ubuntu x64 (OpenVINO) - Ubuntu x64 (SYCL FP32) - Ubuntu x64 (SYCL FP16) - Linux arm64 (Snapdragon : CPU, GPU Adreno, NPU Hexagon) - guide d'installation
Android : - Android arm64 (CPU) - Android arm64 (Snapdragon : CPU, GPU Adreno, NPU Hexagon) - guide d'installation
Windows : - Windows x64 (CPU) - Windows arm64 (CPU) - Windows arm64 (OpenCL Adreno) - Windows x64 (CUDA 12) - DLL CUDA 12.4 - Windows x64 (CUDA 13) - DLL CUDA 13.4 - Windows arm64 (CUDA 13) - DLL CUDA 13.4 - Windows x64 (Vulkan) - Windows arm64 (Vulkan) - Windows x64 (OpenVINO) - Windows x64 (SYCL) - Windows x64 (ROCm 10.0)
openEuler : - DÉSACTIVÉ - openEuler x86 (310p) - openEuler x86 (910b, ACL Graph) - openEuler aarch64 (310p) - openEuler aarch64 (910b, ACL Graph)
UI : - UI