Pre-release / compilación continua: esta es una compilación experimental, no una versión estable.
cuda: kernels FWHT para anchos de bloque superiores a 512 (#29100) La FWHT de CUDA cubre anchos de 64 a 512. Ejecuta una fila por warp y mantiene N/32 valores por lane, por lo que los bloques más anchos necesitan más registros por lane de los que ese diseño permite. fwht_cuda_block ejecuta una fila por bloque de hilos con 256 hilos, de modo que cada hilo mantiene N/256 valores. Las etapas por debajo del ancho del warp siguen haciendo shuffle, las que llegan hasta el ancho del bloque pasan por memoria compartida y el resto permanece en registros. La misma convención de mariposa y de signo que el kernel de warp. Los anchos de 64 a 512 mantienen el kernel de warp. De 1024 a 8192 usan el nuevo, tanto para fuentes F32 como F16. ggml_cuda_op_mul_mat_use_fwht (el predicado compartido supports_op/dispatch añadido en #29096) no comprueba el ancho, así que no necesitó cambios aquí: cualquier ancho que admita y que ggml_cuda_op_fwht no pueda servir ya cae correctamente en la ruta de cuBLAS. Rebasado sobre el master actual con el commit F16 de #29096 por debajo, ya que depende de la misma infraestructura de plantillas F16; ese commit se aplicó limpiamente, el único conflicto fue en test-backend-ops.cpp donde las adiciones de pruebas de un commit intermedio no relacionado cayeron cerca de este bloque. test-backend-ops en una A10 (lambdalabs): MUL_MAT 1297/1297, incluyendo todos los casos FWHT/Hadamard (18 existentes, 4 nuevos F32 anchos, 4 nuevos F16 anchos, 2 nuevos de muchas filas, 1 caso de límite demasiado grande movido a 16384).Sitio web: - https://llama.app
Atestaciones: - https://github.com/ggml-org/llama.cpp/attestations/53784056
macOS/iOS: - macOS Apple Silicon (arm64) - macOS Apple Silicon (arm64, KleidiAI habilitado) DISABLED - macOS Intel (x64) - iOS XCFramework
Linux: - Ubuntu x64 (CPU) - Ubuntu arm64 (CPU) - Ubuntu s390x (CPU) - Ubuntu x64 (Vulkan) - Ubuntu arm64 (Vulkan) - Ubuntu x64 (CUDA 12) - Bibliotecas CUDA 12.8 - Ubuntu x64 (CUDA 13) - Bibliotecas CUDA 13.4 - Ubuntu arm64 (CUDA 13) - Bibliotecas CUDA 13.4 - Ubuntu x64 (ROCm 10.0) - Ubuntu x64 (OpenVINO) - Ubuntu x64 (SYCL FP32) - Ubuntu x64 (SYCL FP16) - Linux arm64 (Snapdragon: CPU, GPU Adreno, NPU Hexagon) - guía de configuración
Android: - Android arm64 (CPU) - Android arm64 (Snapdragon: CPU, GPU Adreno, NPU Hexagon) - guía de configuración
Windows: - Windows x64 (CPU) - Windows arm64 (CPU) - Windows arm64 (OpenCL Adreno) - Windows x64 (CUDA 12) - DLLs de CUDA 12.4 - Windows x64 (CUDA 13) - DLLs de CUDA 13.4 - Windows arm64 (CUDA 13) - DLLs de CUDA 13.4 - Windows x64 (Vulkan) - Windows arm64 (Vulkan) - Windows x64 (OpenVINO) - Windows x64 (SYCL) - Windows x64 (ROCm 10.0)
openEuler: - DISABLED - openEuler x86 (310p) - openEuler x86 (910b, ACL Graph) - openEuler aarch64 (310p) - openEuler aarch64 (910b, ACL Graph)
UI: - UI