llama.cpp Releases

[Pre-release / compilación continua] b11509

[Pre-release / compilación continua] CUDA: corregir la guardia de versión de CCCL que se rompía en el cambio de versión mayor (#29453) * CUDA: corregir la guardia de versión de CCCL que se rompía en el cambio de versión…

Pre-release / compilación continua: esta es una compilación experimental, no una versión estable.

CUDA: corregir la guardia de versión de CCCL que se rompía en el cambio de versión mayor (#29453) * CUDA: corregir la guardia de versión de CCCL que se rompía en el cambio de versión mayor La guardia comparaba los componentes mayor y menor de forma independiente: CCCL_MAJOR_VERSION >= 3 && CCCL_MINOR_VERSION >= 1 El componente menor se restablece a 0 cada vez que se inicia una nueva serie mayor, por lo que en CCCL 4.x esto se evalúa como 4 >= 3 && 0 >= 1, es decir, falso. STRIDED_ITERATOR_AVAILABLE deja de definirse y argsort retrocede silenciosamente a la ruta init_offsets. Nada avisa y la compilación sigue teniendo éxito, así que la regresión es una pérdida silenciosa de rendimiento en lugar de un error de compilación. CCCL ya expone la versión como un único entero empaquetado en forma MMMmmmpp, que es lo que usa su propio encabezado de versión: CCCL_VERSION = MAJOR * 1000000 + MINOR * 1000 + PATCH de modo que 3.4.3 es 3004003 y ">= 3.1" es simplemente ">= 3001000". Una sola comparación, sin aritmética de componentes que pueda salir mal. Comprobado contra una referencia escrita a mano de "version >= 3.1" sobre 2.9.9, 3.0.0, 3.1.0, 3.1.99, 3.2.0, 3.4.3, 3.9.9, 3.99.99, 4.0.0, 4.2.7 y 5.0.0: sin divergencias. La guardia antigua discrepaba en 4.0.0 y 5.0.0. Verificado en RTX 4070 (sm_89), CUDA 13.4, CCCL 3.4.3: - cmake --build build --config Release: salida 0 - test-backend-ops test -o ARGSORT -b CUDA0: 98/98 aprobados, CUDA0 OK Tenga en cuenta que una prueba de regresión aprobada no prueba por sí sola que la guardia sigue tomándose, ya que la ruta alternativa también pasa. El preprocesamiento de la unidad de traducción real confirma que la rama del iterador strided es la que se compila: counting_iterator está presente, init_offsets no. Signed-off-by: Heitor * Actualizar ggml/src/ggml-cuda/argsort.cu * Aplicar sugerencia de @ORippler --------- Signed-off-by: Heitor Co-authored-by: Oliver Simons

Sitio web: - https://llama.app

Atestaciones: - https://github.com/ggml-org/llama.cpp/attestations/53997029

macOS/iOS: - macOS Apple Silicon (arm64) - macOS Apple Silicon (arm64, KleidiAI habilitado) DESACTIVADO - macOS Intel (x64) - XCFramework para iOS

Linux: - Ubuntu x64 (CPU) - Ubuntu arm64 (CPU) - Ubuntu s390x (CPU) - Ubuntu x64 (Vulkan) - Ubuntu arm64 (Vulkan) - Ubuntu x64 (CUDA 12) - Bibliotecas de CUDA 12.8 - Ubuntu x64 (CUDA 13) - Bibliotecas de CUDA 13.4 - Ubuntu arm64 (CUDA 13) - Bibliotecas de CUDA 13.4 - Ubuntu x64 (ROCm 10.0) - Ubuntu x64 (OpenVINO) - Ubuntu x64 (SYCL FP32) - Ubuntu x64 (SYCL FP16) - Linux arm64 (Snapdragon: CPU, GPU Adreno, NPU Hexagon) - guía de configuración

Android: - Android arm64 (CPU) - Android arm64 (Snapdragon: CPU, GPU Adreno, NPU Hexagon) - guía de configuración

Windows: - Windows x64 (CPU) - Windows arm64 (CPU) - Windows arm64 (OpenCL Adreno) - Windows x64 (CUDA 12) - DLLs de CUDA 12.4 - Windows x64 (CUDA 13) - DLLs de CUDA 13.4 - Windows arm64 (CUDA 13) - DLLs de CUDA 13.4 - Windows x64 (Vulkan) - Windows arm64 (Vulkan) - Windows x64 (OpenVINO) - Windows x64 (SYCL) - Windows x64 (ROCm 10.0)

openEuler: - DISABLED - openEuler x86 (310p) - openEuler x86 (910b, ACL Graph) - openEuler aarch64 (310p) - openEuler aarch64 (910b, ACL Graph)

UI: - UI

Fuente original

llama.cpp Releases

Notas sobre el contenido

La publicación original y los derechos pertenecen a la fuente.

Traducción automática · Consulte el original