사전 출시 / 지속 빌드: 실험적 빌드이며 안정 릴리스가 아닙니다.
vulkan: 양자화된 K/V를 위한 sparse flash attention (#29639) * vulkan: 양자화된 K/V를 위한 sparse flash attention Assisted-by: Claude * vulkan: 단일 스캔 sparse FA 인덱스 압축 기존 압축은 마스크 행당 하나의 workgroup이 실행되고 행을 BLOCK_SIZE 청크 단위로 순회하며 청크마다 workgroup 스캔을 수행하는 방식이었습니다. 디코드의 경우 하나의 workgroup이 KV/1024번의 barrier-바운드 반복을 수행하는 것이므로, 128k 셀에서는 그것이 공급하는 sparse attention보다 더 많은 비용이 들었습니다. 대신 행을 연속된 세그먼트로 분할하십시오: coalesced 로드에 대한 ballot 카운팅과 함께 서브그룹당 하나씩, 또는 서브그룹 없이 스레드당 하나씩. 세그먼트 카운트에 대한 단일 스캔이면 각 세그먼트에 출력 오프셋을 제공합니다. 인덱스 목록은 오름차순으로 유지됩니다.Website: - https://llama.app
Attestations: - https://github.com/ggml-org/llama.cpp/attestations/52797762
macOS/iOS: - macOS Apple Silicon (arm64) - macOS Apple Silicon (arm64, KleidiAI 활성화) DISABLED - macOS Intel (x64) - iOS XCFramework
Linux: - Ubuntu x64 (CPU) - Ubuntu arm64 (CPU) - Ubuntu s390x (CPU) - Ubuntu x64 (Vulkan) - Ubuntu arm64 (Vulkan) - Ubuntu x64 (CUDA 12) - CUDA 12.8 라이브러리 - Ubuntu x64 (CUDA 13) - CUDA 13.4 라이브러리 - Ubuntu arm64 (CUDA 13) - CUDA 13.4 라이브러리 - Ubuntu x64 (ROCm 10.0) - Ubuntu x64 (OpenVINO) - Ubuntu x64 (SYCL FP32) - Ubuntu x64 (SYCL FP16) - Linux arm64 (Snapdragon: CPU, Adreno GPU, Hexagon NPU) - 설정 가이드
Android: - Android arm64 (CPU) - Android arm64 (Snapdragon: CPU, Adreno GPU, Hexagon NPU) - 설정 가이드
윈도우(Windows): - 윈도우(Windows) x64 (CPU) 버전 - 윈도우(Windows) arm64 (CPU) 버전 - 윈도우(Windows) arm64 (OpenCL Adreno) 버전 - 윈도우(Windows) x64 (CUDA 12) 버전 - CUDA 12.4 DLL 파일 - 윈도우(Windows) x64 (CUDA 13) 버전 - CUDA 13.4 DLL 파일 - 윈도우(Windows) arm64 (CUDA 13) 버전 - CUDA 13.4 DLL 파일 - 윈도우(Windows) x64 (Vulkan) 버전 - 윈도우(Windows) arm64 (Vulkan) 버전 - 윈도우(Windows) x64 (OpenVINO) 버전 - 윈도우(Windows) x64 (SYCL) 버전 - 윈도우(Windows) x64 (ROCm 10.0) 버전
openEuler: - 비활성화됨 - openEuler x86 (310p) 환경 - openEuler x86 (910b, ACL Graph) 환경 - openEuler aarch64 (310p) 환경 - openEuler aarch64 (910b, ACL Graph) 환경
UI: - UI