llama.cpp Releases

[Pre-lanzamiento / construcción continua] b11474

[Pre-lanzamiento / construcción continua] feat: agregar GLM5Next MTP, optimizar (#29928) * llama: agregar GLM5-Next NextN (MTP) graph. Construir la cabeza de predicción multi-token GLM5-Next como graph_mtp: el bloque…

Build pre-lanzamiento / build continuo: esta es una versión experimental, no una versión estable.

característica: agregar GLM5Next MTP, optimizar (#29928) * llama : agregar el grafo GLM5-Next NextN (MTP) Construir la cabeza de predicción de multi-token GLM5-Next como graph_mtp: el bloque NextN incrusta enorm(tok)+hnorm(h) a través de eh_proj, ejecuta una capa simple de DSA y la lm_head compartida, reutilizando los constructores del tronco a través del constructor no_build. llama_memory_recurrent también tolera una secuencia parcial seq_rm cuando el contexto no tiene capas recurrentes, que es lo que necesita el contexto del borrador de MTP. Asistente: Claude * llama : glm5-next: evitar el cálculo muerto en los NextN sin servidor Un Forward de NextN sin filas de salida (el MTP catch-up y el draft-context prefill) persiste solo a través de las escrituras de su caché, por lo que el grafo sin servidor mantiene la MLA latent, la clave|gate del indexer y las escrituras de pooled-key, y elimina el camino de consulta, la selección del indexer, el cuerpo de atención, el FFN y la cabeza del LM. El recupero de 4 tokens pasa de 6.9 ms a 0.33 ms en los kernels; los hashes de salida codiciosos y la aceptación del borrador permanecen sin cambios. Asistido por: Claude * llama : glm5-next: arreglar los contratos de extracción NextN y el rollback de cola compartida Tres correcciones desde la revisión arquitectónica. La eliminación del grafo sin cabeza ahora también requiere que no haya extracciones NextN desenmascaradas en funcionamiento, porque ese modo lee filas ocultas de n_tokens independientemente de las banderas logits. Extracción oculta publica las filas ocultas recopiladas por los IDs de salida, de modo que un lote cuyos indicadores de salida no son un prefijo exporta las filas correctas. Un rollback recurrente parcial cuyo celda final está compartida con otra secuencia ahora es rechazado en lugar de mover silenciosamente la celda final de esa secuencia. Asistido por: Claude * llama : glm5-next: organizar los comentarios en los cambios del MTP Asistido por: Claude * llama : glm5-next: cortar el grafo MTP hasta las filas de salida en lugar de eliminarlo Reemplazar el pruning NextN sin cabeza con el patrón de corte que usan los otros grafos MTP: reunir la atención en la salida y la entrada del bloque en los IDs de salida antes del FFN posicional y el cabezal compartido. Un NextN forward sin filas de salida (el MTP catch-up y el draft-context prefill) luego ejecuta el FFN y la cabecera sobre cero filas. El 4-token catch-up disminuye de 6.9 ms a 2.9 ms en los kernels; los hashes de salida gourméticos permanecen sin cambios. Asistido por: Claude * glm5-next: utilizar los ayudantes de corte nextn en el gráfico MTP Reemplaza la condición de corte local y la selección oculta de t_h_nextn por crop_before_nextn y crop_after_nextn, de modo que el gráfico MTP reduzca sus filas de la misma manera que el gráfico principal y los otros modelos. Describe la célula compartida y las ramas de filtro vacías del rollback parcial recurrente. * glm5-next: cargar archivos GGUF solo para MTP y solo para trunk Haga que los tensores trunk sean opcionales cuando el archivo contiene únicamente la capa NextN, y que los tensores NextN sean opcionales cuando el archivo contiene únicamente el trunk, de modo que el archivo GGUF dividido en MTP se carga como un modelo preliminar. Autor coautor: Georgi Gerganov --------- Autor coautor: Pascal Autor coautor: Georgi Gerganov

Web:} - https://llama.app

Atestaciones: - https://github.com/ggml-org/llama.cpp/attestations/53581440

macOS/iOS: - macOS Apple Silicon (arm64) - macOS Apple Silicon (arm64, KleidiAI activado) DESACTIVADO - macOS Intel (x64) - iOS XCFramework

Linux: - Ubuntu x64 (CPU) - Ubuntu arm64 (CPU) - Ubuntu s390x (CPU) - Ubuntu x64 (Vulkan) - Ubuntu arm64 (Vulkan) - Ubuntu x64 (CUDA 12) - Bibliotecas CUDA 12.8 - Ubuntu x64 (CUDA 13) - Bibliotecas CUDA 13.4 - Ubuntu arm64 (CUDA 13) - Bibliotecas CUDA 13.4 - Ubuntu x64 (ROCm 10.0) - Ubuntu x64 (OpenVINO) - Ubuntu x64 (SYCL FP32) - Ubuntu x64 (SYCL FP16) - Linux arm64 (Snapdragon: CPU, Adreno GPU, Hexagon NPU) - guía de configuración

Android: - Android arm64 (CPU) - Android arm64 (Snapdragon: CPU, Adreno GPU, Hexagon NPU) - guía de configuración

Windows: - Windows x64 (CPU) - Windows arm64 (CPU) - Windows arm64 (OpenCL Adreno) - Windows x64 (CUDA 12) - CUDA 12.4 DLLs - Windows x64 (CUDA 13) - CUDA 13.4 DLLs - Windows arm64 (CUDA 13) - CUDA 13.4 DLLs - Windows x64 (Vulkan) - Windows arm64 (Vulkan) - Windows x64 (OpenVINO) - Windows x64 (SYCL) - Windows x64 (ROCm 10.0)

openEuler: - DESACTIVADO - openEuler x86 (310p) - openEuler x86 (910b, ACL Graph) - openEuler aarch64 (310p) - openEuler aarch64 (910b, ACL Graph)

UI: - UI

Fuente original

llama.cpp Releases

Notas sobre el contenido

La publicación original y los derechos pertenecen a la fuente.

Traducción automática · Consulte el original