Pre-release / compilación continua: esta es una compilación experimental, no una versión estable.
llama : re-reservar el sched cuando cambian las flags de extracción nextn (#30020) La inicialización especulativa de MTP habilita la extracción NextN en los contextos target y draft después de que ambos fueron creados y sus schedulers reservados. Con la extracción sin máscara, el grafo troncal conserva cada token hasta la última capa en lugar de recortar las filas de salida, por lo que el primer decode reasigna a la forma de ese batch y el siguiente batch, más ancho, dispara GGML_SCHED_DEBUG_REALLOC. Invalidar la reserva cuando cambian las flags para que el próximo cómputo re-reserve con la nueva forma del grafo. Assisted-by: ClaudeSitio web: - https://llama.app
Attestations: - https://github.com/ggml-org/llama.cpp/attestations/53181663
macOS/iOS: - macOS Apple Silicon (arm64) - macOS Apple Silicon (arm64, KleidiAI habilitado) DISABLED - macOS Intel (x64) - iOS XCFramework
Linux: - Ubuntu x64 (CPU) - Ubuntu arm64 (CPU) - Ubuntu s390x (CPU) - Ubuntu x64 (Vulkan) - Ubuntu arm64 (Vulkan) - Ubuntu x64 (CUDA 12) - Bibliotecas CUDA 12.8 - Ubuntu x64 (CUDA 13) - Bibliotecas CUDA 13.4 - Ubuntu arm64 (CUDA 13) - Bibliotecas CUDA 13.4 - Ubuntu x64 (ROCm 10.0) - Ubuntu x64 (OpenVINO) - Ubuntu x64 (SYCL FP32) - Ubuntu x64 (SYCL FP16) - Linux arm64 (Snapdragon: CPU, GPU Adreno, NPU Hexagon) - guía de configuración
Android: - Android arm64 (CPU) - Android arm64 (Snapdragon: CPU, GPU Adreno, NPU Hexagon) - guía de configuración
Windows: - Windows x64 (CPU) - Windows arm64 (CPU) - Windows arm64 (OpenCL Adreno) - Windows x64 (CUDA 12) - DLLs de CUDA 12.4 - Windows x64 (CUDA 13) - DLLs de CUDA 13.4 - Windows arm64 (CUDA 13) - DLLs de CUDA 13.4 - Windows x64 (Vulkan) - Windows arm64 (Vulkan) - Windows x64 (OpenVINO) - Windows x64 (SYCL) - Windows x64 (ROCm 10.0)
openEuler: - DISABLED - openEuler x86 (310p) - openEuler x86 (910b, ACL Graph) - openEuler aarch64 (310p) - openEuler aarch64 (910b, ACL Graph)
UI: - UI