Pré-version / build continu : il s'agit d'un build expérimental, pas d'une version stable.
llama : re-réserver le sched lorsque les indicateurs d'extraction nextn changent (#30020) L'init spéculative MTP active l'extraction NextN sur les contextes cible et draft après que les deux ont été créés et leurs planificateurs réservés. Avec une extraction non masquée, le graphe du tronc conserve chaque token jusqu'à la dernière couche au lieu de se limiter aux lignes de sortie, donc le premier décode se réalloue à la forme de ce batch et le batch suivant, plus large, déclenche GGML_SCHED_DEBUG_REALLOC. Invalider la réservation lorsque les indicateurs changent afin que le prochain calcul se re-réserve avec la nouvelle forme du graphe. Assisted-by: ClaudeSite Web : - https://llama.app
Attestations : - https://github.com/ggml-org/llama.cpp/attestations/53181663
macOS/iOS : - macOS Apple Silicon (arm64) - macOS Apple Silicon (arm64, KleidiAI activé) DÉSACTIVÉ - macOS Intel (x64) - iOS XCFramework
Linux : - Ubuntu x64 (CPU) - Ubuntu arm64 (CPU) - Ubuntu s390x (CPU) - Ubuntu x64 (Vulkan) - Ubuntu arm64 (Vulkan) - Ubuntu x64 (CUDA 12) - Bibliothèques CUDA 12.8 - Ubuntu x64 (CUDA 13) - Bibliothèques CUDA 13.4 - Ubuntu arm64 (CUDA 13) - Bibliothèques CUDA 13.4 - Ubuntu x64 (ROCm 10.0) - Ubuntu x64 (OpenVINO) - Ubuntu x64 (SYCL FP32) - Ubuntu x64 (SYCL FP16) - Linux arm64 (Snapdragon : CPU, GPU Adreno, NPU Hexagon) - guide d'installation
Android : - Android arm64 (CPU) - Android arm64 (Snapdragon : CPU, GPU Adreno, NPU Hexagon) - guide d'installation
Windows : - Windows x64 (CPU) - Windows arm64 (CPU) - Windows arm64 (OpenCL Adreno) - Windows x64 (CUDA 12) - DLL CUDA 12.4 - Windows x64 (CUDA 13) - DLL CUDA 13.4 - Windows arm64 (CUDA 13) - DLL CUDA 13.4 - Windows x64 (Vulkan) - Windows arm64 (Vulkan) - Windows x64 (OpenVINO) - Windows x64 (SYCL) - Windows x64 (ROCm 10.0)
openEuler : - DÉSACTIVÉ - openEuler x86 (310p) - openEuler x86 (910b, ACL Graph) - openEuler aarch64 (310p) - openEuler aarch64 (910b, ACL Graph)
UI : - UI