사전 출시 / 연속 빌드: 이것은 실험적인 빌드이며 안정 릴리스가 아닙니다.
cuda: 4개 헤드에 대해 키와 토큰 단위로 lightning indexer를 타일링 (#29901) * cuda: 4개 헤드에 대해 키와 토큰 단위로 lightning indexer를 타일링 wmma 타일에 비해 헤드 수가 너무 적으면, 하나의 블록이 64개 키를 8개 토큰에 대해 점수화합니다: 키는 half 정밀도로 한 번 스테이징되고, 쿼리는 한 번에 한 헤드씩 처리되며, 각 스레드가 두 토큰에 대해 하나의 키를 담당하므로 어떤 내적도 스레드 간 리덕션을 필요로 하지 않습니다. 토큰 타일보다 작은 배치는 벡터 커널을 유지합니다. test-backend-ops가 4개 헤드를 측정합니다. * cuda: lightning indexer 타일을 float로 곱하기 am17an의 리뷰 반영: 단일 q * k가 f16 범위를 초과하면 half2 곱이 오버플로됩니다. 쿼리는 공유 메모리에 float로 유지되고 각 키의 half2는 두 토큰에 대해 한 번 확장되므로, 모든 곱과 합이 float로 계산됩니다. * cuda: 각 lightning indexer 키를 모든 헤드에 대해 한 번씩 확장 타일 커널은 모든 헤드의 쿼리와 가중치를 한 번에 스테이징하므로, 각 키 요소는 half에서 한 번만 확장되어 단일 배리어로 모든 헤드에 공급됩니다. F16 키는 float 왕복 없이 타일로 복사됩니다. 키를 공유 메모리에 float로 유지하면 점유율이 떨어져 더 느리게 측정됩니다. * cuda: ROCm에서 lightning indexer 타일이 레지스터를 스필하지 않도록 방지 이제 타일 커널의 각 스레드는 단일 토큰에 대해 두 개의 키를 점수화하므로, 워프가 토큰을 공유하고 쿼리 읽기는 브로드캐스트됩니다: 동일한 곱에 대해 요소 쌍당 아홉 대신 여섯 번의 공유 읽기가 수행됩니다. 내부 루프는 8회 언롤되어, 완전히 언롤된 루프가 천 개 이상을 필요로 하던 곳에서 gfx908을 스필 없이 63 VGPRs로 유지하며, R9700에서 커널을 36배 빠르게 만들고 CUDA에서 약간 더 빠르게 만듭니다.웹사이트: - https://llama.app
증명(Attestations): - https://github.com/ggml-org/llama.cpp/attestations/52734616
macOS/iOS: - macOS Apple Silicon (arm64) - macOS Apple Silicon (arm64, KleidiAI 활성화) 비활성화됨 - macOS Intel (x64) - iOS XCFramework
Linux: - Ubuntu x64 (CPU) - Ubuntu arm64 (CPU) - Ubuntu s390x (CPU) - Ubuntu x64 (Vulkan) - Ubuntu arm64 (Vulkan) - Ubuntu x64 (CUDA 12) - CUDA 12.8 라이브러리 - Ubuntu x64 (CUDA 13) - CUDA 13.4 라이브러리 - Ubuntu arm64 (CUDA 13) - CUDA 13.4 라이브러리 - Ubuntu x64 (ROCm 10.0) - Ubuntu x64 (OpenVINO) - Ubuntu x64 (SYCL FP32) - Ubuntu x64 (SYCL FP16) - Linux arm64 (Snapdragon: CPU, Adreno GPU, Hexagon NPU) - 설정 가이드
Android: - Android arm64 (CPU) - Android arm64 (Snapdragon: CPU, Adreno GPU, Hexagon NPU) - 설정 가이드
윈도우(Windows): - Windows x64(CPU) 버전 - Windows arm64(CPU) 버전 - Windows arm64(OpenCL Adreno) 버전 - Windows x64(CUDA 12) 버전 - CUDA 12.4 DLL 파일들 - Windows x64(CUDA 13) 버전 - CUDA 13.4 DLL 파일들 - Windows arm64(CUDA 13) 버전 - CUDA 13.4 DLL 파일들 - Windows x64(Vulkan) 버전 - Windows arm64(Vulkan) 버전 - Windows x64(OpenVINO) 버전 - Windows x64(SYCL) 버전 - Windows x64(ROCm 10.0) 버전
openEuler: - 비활성화됨 - openEuler x86 (310p) 환경 - openEuler x86 (910b, ACL Graph) 환경 - openEuler aarch64 (310p) 환경 - openEuler aarch64 (910b, ACL Graph) 환경
UI: - UI