llama.cpp Releases

[Pre-release / continuous build] b11440

[사전 릴리스 / 지속 빌드] llama : nextn extraction 플래그가 변경될 때 sched를 다시 예약 (#30020) speculative MTP init은 target과 draft 컨텍스트가 모두 생성되고 스케줄러가 예약된 후에 두 컨텍스트에서 NextN extraction을 활성화합니다. unmasked extraction의 경우 trunk 그래프가 output rows로…

사전 릴리스 / 지속 빌드: 이것은 실험적 빌드이며 안정 릴리스가 아닙니다.

llama : nextn extraction 플래그가 변경될 때 sched를 다시 예약 (#30020) speculative MTP init은 target과 draft 컨텍스트가 모두 생성되고 스케줄러가 예약된 후에 두 컨텍스트에서 NextN extraction을 활성화합니다. unmasked extraction의 경우 trunk 그래프가 output rows로 잘리지 않고 마지막 레이어까지 모든 토큰을 유지하므로, 첫 번째 decode가 해당 배치의 형태로 재할당되고 그다음 더 넓은 배치에서 GGML_SCHED_DEBUG_REALLOC이 발동됩니다. 플래그가 변경될 때 예약을 무효화하여 다음 compute가 새 그래프 형태로 다시 예약하도록 합니다. Assisted-by: Claude

웹사이트: - https://llama.app

Attestations: - https://github.com/ggml-org/llama.cpp/attestations/53181663

macOS/iOS: - macOS Apple Silicon (arm64) - macOS Apple Silicon (arm64, KleidiAI 활성화됨) 비활성화됨 - macOS Intel (x64) - iOS XCFramework

Linux: - Ubuntu x64 (CPU) - Ubuntu arm64 (CPU) - Ubuntu s390x (CPU) - Ubuntu x64 (Vulkan) - Ubuntu arm64 (Vulkan) - Ubuntu x64 (CUDA 12) - CUDA 12.8 라이브러리 - Ubuntu x64 (CUDA 13) - CUDA 13.4 라이브러리 - Ubuntu arm64 (CUDA 13) - CUDA 13.4 라이브러리 - Ubuntu x64 (ROCm 10.0) - Ubuntu x64 (OpenVINO) - Ubuntu x64 (SYCL FP32) - Ubuntu x64 (SYCL FP16) - Linux arm64 (Snapdragon: CPU, Adreno GPU, Hexagon NPU) - 설정 가이드

Android: - Android arm64 (CPU) - Android arm64 (Snapdragon: CPU, Adreno GPU, Hexagon NPU) - 설정 가이드

윈도우: - 윈도우 x64(CPU) - 윈도우 arm64(CPU) - 윈도우 arm64(OpenCL Adreno) - 윈도우 x64(CUDA 12) - CUDA 12.4 DLL - 윈도우 x64(CUDA 13) - CUDA 13.4 DLL - 윈도우 arm64(CUDA 13) - CUDA 13.4 DLL - 윈도우 x64(Vulkan) - 윈도우 arm64(Vulkan) - 윈도우 x64(OpenVINO) - 윈도우 x64(SYCL) - 윈도우 x64(ROCm 10.0)

openEuler: - 비활성화됨 - openEuler x86 플랫폼 (310p) - openEuler x86 플랫폼 (910b, ACL Graph) - openEuler aarch64 플랫폼 (310p) - openEuler aarch64 플랫폼 (910b, ACL Graph)

UI: - UI

원문 출처

llama.cpp Releases

내용 안내

원문 발행 및 권리는 출처에 있습니다.

기계 번역 · 원문을 참고하세요