llama.cpp Releases수정일

[Pre-release / 연속 빌드] b11408

[Pre-release / 연속 빌드] ggml-cpu : SpacemiT X60용 Q8_0 IME1 매트릭스 커널 추가 (#28479) * ggml-cpu : SpacemiT X60용 Q8_0 IME1 매트릭스 커널 추가 SpacemiT X60에서는 IME 매트릭스 가속이 Q4_0/Q4_1/Q4_K만 지원했습니다. Q8_0에는 IME1 커널이 없었고, SpacemiT 빌드는…

Pre-release / 연속 빌드: 이것은 실험적인 빌드이며 안정 릴리스가 아닙니다.

ggml-cpu : SpacemiT X60용 Q8_0 IME1 행렬 커널 추가 (#28479) * ggml-cpu : SpacemiT X60용 Q8_0 IME1 행렬 커널 추가 SpacemiT X60에서는 IME 행렬 가속이 Q4_0/Q4_1/Q4_K만 지원했습니다. Q8_0에는 IME1 커널이 없었고, SpacemiT 빌드는 GGML_CPU_REPACK=OFF로 설정되어 있어 repack 경로도 컴파일되지 않았기 때문에 Q8_0은 가속 경로가 전혀 없어서 같은 보드에서 prefill 시 Q4_0보다 약 10배 느리게 동작했습니다. - make_block_q8_0x16과 Q8_0 repack 엔트리 추가: IME1 vmadot 시퀀스가 기대하는 16열 레이아웃으로 가중치를 인터리브 - ime1::gemm_kernel_i8i8 추가: 1행 및 4행 A 경로를 갖는 int8 x int8 IME1 커널; 4행 경로는 각 B 패널을 한 번 로드하여 A의 4행에 걸쳐 재사용 - 4행 활성화 양자화를 위한 quantize_a_4row_i8 추가 - Q8_0에 대해 forward_mul_mat과 repack 팩토리에 두 커널 연결 - 문서: X60에서 Q8_0 지원 표시 정확성은 K = 32부터 4096까지 양자화 정확한(exact) 정수 참조와 비교하여 최대 상대 오차 약 1e-6임을 확인했고, 여러 프롬프트에서 생성이 일관되게 유지되는지 확인함으로써 검증했습니다. Milk-V Jupiter (SpacemiT X60), Bianbu 2.1.1, gcc 14.2 환경에서 Qwen2.5-0.5B-Instruct Q8_0으로 테스트했습니다. taskset -c 0-3 하에서 llama-bench -t 4, 유휴 보드에서 5회 반복: pp128이 10.70에서 93.87 t/s로 향상되었습니다. Q4_0은 106.40 -> 107.51 t/s로 변경되지 않았는데, 이 변경이 해당 경로를 건드리지 않으므로 예상된 결과입니다. * ggml-cpu : q8_0_16x32 선언을 IME1 섹션으로 이동 * ggml-cpu : q8_0 IME1 커널 할당 정렬

웹사이트: - https://llama.app

증명(Attestations): - https://github.com/ggml-org/llama.cpp/attestations/52757256

macOS/iOS: - macOS Apple Silicon (arm64) - macOS Apple Silicon (arm64, KleidiAI 활성화) DISABLED - macOS Intel (x64) - iOS XCFramework

Linux: - Ubuntu x64 (CPU) - Ubuntu arm64 (CPU) - Ubuntu s390x (CPU) - Ubuntu x64 (Vulkan) - Ubuntu arm64 (Vulkan) - Ubuntu x64 (CUDA 12) - CUDA 12.8 라이브러리 - Ubuntu x64 (CUDA 13) - CUDA 13.4 라이브러리 - Ubuntu arm64 (CUDA 13) - CUDA 13.4 라이브러리 - Ubuntu x64 (ROCm 10.0) - Ubuntu x64 (OpenVINO) - Ubuntu x64 (SYCL FP32) - Ubuntu x64 (SYCL FP16) - Linux arm64 (Snapdragon: CPU, Adreno GPU, Hexagon NPU) - 설치 가이드

Android: - Android arm64 (CPU) - Android arm64 (Snapdragon: CPU, Adreno GPU, Hexagon NPU) - 설치 가이드

윈도우(Windows): - Windows x64(CPU)용 - Windows arm64(CPU)용 - Windows arm64(OpenCL Adreno)용 - Windows x64(CUDA 12)용 - CUDA 12.4 DLL 파일 - Windows x64(CUDA 13)용 - CUDA 13.4 DLL 파일 - Windows arm64(CUDA 13)용 - CUDA 13.4 DLL 파일 - Windows x64(Vulkan)용 - Windows arm64(Vulkan)용 - Windows x64(OpenVINO)용 - Windows x64(SYCL)용 - Windows x64(ROCm 10.0)용

openEuler: - DISABLED - openEuler x86(310p) 대상 - openEuler x86(910b, ACL Graph) 대상 - openEuler aarch64(310p) 대상 - openEuler aarch64(910b, ACL Graph) 대상

UI: - UI

원문 출처

llama.cpp Releases

내용 안내

원문 발행 및 권리는 출처에 있습니다.

기계 번역 · 원문을 참고하세요