llama.cpp Releases

[사전 릴리스 / 연속 빌드] b11436

[사전 릴리스 / 연속 빌드] ggml-openvino: CI 테스트 수정; GPU 회귀 수정. (#30037) * ggml-openvino: 선택되지 않은 그래프 브랜치 건너뛰기 및 DUP 지원 업스트림 #29622가 ggml_build_forward_select()를 통해 모든 입력 임베딩 그래프에 혼합 token/embd 브랜치를 추가합니다. 해당 노드들은 연산 대상으로 플래그되지…

사전 릴리스 / 연속 빌드: 이것은 실험적 빌드이며 안정 릴리스가 아닙니다.

ggml-openvino: CI 테스트 수정; GPU 회귀 수정. (#30037) * ggml-openvino: 선택되지 않은 그래프 브랜치 건너뛰기 및 DUP 지원 업스트림 #29622가 ggml_build_forward_select()를 통해 모든 입력 임베딩 그래프에 혼합 token/embd 브랜치를 추가합니다. 해당 노드들은 연산 대상으로 플래그되지 않지만, 백엔드가 어쨌든 이를 변환했고 그 브랜치의 DUP은 지원되지 않아 스케줄러가 그래프를 분할하고 고정된 토큰 수로 분할 지점을 넘어 임베딩을 전달했습니다. 그 결과 첫 단일 토큰 디코딩이 실패했습니다 (CPU 및 GPU의 test-thread-safety). 연산 노드만으로 OV 모델을 빌드하고, CONT와 같은 동일 유형 연속 DUP을 변환하여 그래프가 하나의 백엔드에 머물도록 합니다. * ggml-openvino: inp_scale_rows의 토큰 차원을 동적으로 변경 #29622는 또한 토큰별 임베딩 스케일(gemma3, gemma3n, gemma4)을 새로운 [1, n_tokens] 입력으로 이동시킵니다. 동적 토큰 차원을 부여하고 정적(NPU) 경로에서는 청크별로 패딩합니다. * ggml-openvino: 바인딩되지 않은 Q4_1/Q4_K 가중치를 사용하는 GPU MUL_MAT op 테스트 건너뛰기 Op 테스트는 f16 zero point를 갖는 u4로 Q4_1/Q4_K 가중치를 빌드합니다. GPU 플러그인은 일부 행 수에 대해 "clFinish, error code: -5 CL_OUT_OF_RESOURCES"와 함께 이 형식의 컴파일에 실패하며, 이로 인해 #29869에서 추가된 MUL_MAT 케이스(예: m=1000, n=2, k=1024)에서 test-backend-ops가 중단됩니다. 모델 가중치는 u4 zero point를 사용하므로 영향을 받지 않습니다. 플러그인이 수정될 때까지 이러한 케이스를 GPU에서 지원되지 않음으로 보고합니다. Op 테스트는 할당 전에 지원 여부를 확인하므로, 이 확인은 바인딩되지 않은 가중치에만 해당합니다. 모델 로딩은 더미 버퍼로 프로브하며 가중치를 GPU에 유지합니다. * ggml-openvino: FILL을 출력 타입으로 생성 translate_fill이 항상 f32 상수를 빌드했기 때문에, f16 FILL이 f32 데이터를 생성하고 그 되돌리기 복사가 f16 출력 버퍼를 넘쳐흘렀습니다. 상수에는 출력 타입을 사용합니다. * ggml-openvino: 양자화 타입의 CONCAT 거부 양자화 입력은 변환 시 역양자화되므로, 백엔드는 양자화된 CONCAT 출력을 쓸 수 없습니다. 양자화 타입으로의 CPY와 마찬가지로 지원되지 않음으로 보고합니다. * ggml-openvino: build_rs의 단일 순환 상태 gather 처리 #29856은 build_rs가 s_copy 리프에 대한 하나의 GET_ROWS로 모든 순환 상태를 gather하고 ubatch 및 추가 상태를 그것의 뷰로 취하도록 변경했습니다. 상태 저장 경로는 이전 형태인 s_copy의 뷰당 하나의 GET_ROWS만 일치했으므로, Qwen3.5가 CPU 및 GPU에서 상태 저장 실행에 실패했습니다(Concat의 "is_axis_valid(axis, r)"). 단일 슬롯 캐시의 경우, s_copy 리프에 대한 GET_ROWS를 활성 상태 gather로 취급하고, 그것의 뷰를 읽는 reshape들의 rank-4 레이아웃을 유지하며, 빈 추가 상태 뷰의 복사를 단일 슬롯 나머지 writeback에 매핑합니다. 빈 뷰의 동적 차원에 대해 경고하지 마십시오. * openvino: GPU 플러그인 결함을 우회하기 위해 eltwise 피연산자 랭크 정렬 * openvino: rank-3 상태 저장 그래프에서 MoE 융합 일치 * ggml-openvino: AlignEltwiseOperandRanks에서 RMS norm 출력을 unsqueeze하지 않기 이 패스는 피연산자 랭크가 다른 Add/Multiply/Subtract의 낮은 랭크 피연산자를 unsqueeze합니다. gemma-3에서 attention 이후 잔차 add의 낮은 랭크 피연산자는 norm 출력이며, 이를 unsqueeze하면 GPU 플러그인이 레이어를 잘못 계산합니다: gemma-3는 상태 저장 실행 시 GPU에서 빈 답변을 반환합니다. 낮은 랭크 피연산자가 RMS norm 출력일 경우 이 재작성을 건너뜁니다. * docs : OpenVINO 검증된 모델 업데이트 --------- Co-authored-by: Mustafa Cavus

웹사이트: - https://llama.app

증명(Attestations): - https://github.com/ggml-org/llama.cpp/attestations/53122299

macOS/iOS: - macOS Apple Silicon (arm64) - macOS Apple Silicon (arm64, KleidiAI 활성화) 비활성화됨 - macOS Intel (x64) - iOS XCFramework

리눅스: - Ubuntu x64 (CPU) - Ubuntu arm64 (CPU) - Ubuntu s390x (CPU) - Ubuntu x64 (Vulkan) - Ubuntu arm64 (Vulkan) - Ubuntu x64 (CUDA 12) - CUDA 12.8 라이브러리 - Ubuntu x64 (CUDA 13) - CUDA 13.4 라이브러리 - Ubuntu arm64 (CUDA 13) - CUDA 13.4 라이브러리 - Ubuntu x64 (ROCm 10.0) - Ubuntu x64 (OpenVINO) - Ubuntu x64 (SYCL FP32) - Ubuntu x64 (SYCL FP16) - Linux arm64 (Snapdragon: CPU, Adreno GPU, Hexagon NPU) - 설정 가이드

안드로이드: - Android arm64 (CPU) - Android arm64 (Snapdragon: CPU, Adreno GPU, Hexagon NPU) - 설정 가이드

윈도우(Windows): - 윈도우(Windows) x64 (CPU) - 윈도우(Windows) arm64 (CPU) - 윈도우(Windows) arm64 (OpenCL Adreno) - 윈도우(Windows) x64 (CUDA 12) - CUDA 12.4 DLLs - 윈도우(Windows) x64 (CUDA 13) - CUDA 13.4 DLLs - 윈도우(Windows) arm64 (CUDA 13) - CUDA 13.4 DLLs - 윈도우(Windows) x64 (Vulkan) - 윈도우(Windows) arm64 (Vulkan) - 윈도우(Windows) x64 (OpenVINO) - 윈도우(Windows) x64 (SYCL) - 윈도우(Windows) x64 (ROCm 10.0)

openEuler: - DISABLED - openEuler x86 (310p) 환경 - openEuler x86 (910b, ACL Graph) 환경 - openEuler aarch64 (310p) 환경 - openEuler aarch64 (910b, ACL Graph) 환경

UI: - UI

원문 출처

llama.cpp Releases

내용 안내

원문 발행 및 권리는 출처에 있습니다.

기계 번역 · 원문을 참고하세요