사전 출시 / 지속 빌드: 이것은 실험적 빌드이며 안정적인 릴리스가 아닙니다.
feat: GLM5Next MTP 추가, 최적화 (#29928) * llama : GLM5-Next NextN (MTP) 그래프 추가 GLM5-Next 멀티 토큰 예측 헤드를 graph_mtp로 구축합니다: NextN 블록은 enorm(tok)+hnorm(h)를 eh_proj를 통해 임베드하고, 하나의 일반 DSA 레이어와 공유 lm_head를 실행하며, no_build 태그 ctor를 통해 트렁크의 빌더들을 재사용합니다. llama_memory_recurrent는 또한 컨텍스트에 순환(recurrent) 레이어가 없을 때 부분 seq_rm을 허용하며, 이는 MTP 드래프트 컨텍스트에 필요한 사항입니다. Assisted-by: Claude * llama : glm5-next: 헤드리스 NextN 포워드에서 불필요한 연산 건너뛰기 출력 행이 없는 NextN 포워드(MTP 캐치업과 드래프트 컨텍스트 프리필)는 캐시 쓰기를 통해서만 상태를 유지하므로, 헤드리스 그래프는 MLA latent, indexer key|gate 및 pooled-key 쓰기를 유지하고 쿼리 경로, indexer 선택, 어텐션 본체, FFN 및 LM 헤드를 제거합니다. 4토큰 캐치업이 커널 기준 6.9 ms에서 0.33 ms로 감소하며, greedy 출력 해시와 드래프트 수용률은 변하지 않았습니다. Assisted-by: Claude * llama : glm5-next: NextN 추출 계약과 공유 테일 롤백 수정 아키텍처 리뷰에서 나온 세 가지 수정 사항입니다. 헤드리스 그래프 프루닝은 이제 마스킹되지 않은 nextn 추출이 활성 상태가 아님을 요구합니다. 그 이유는 해당 모드가 logits 플래그와 관계없이 n_tokens개의 히든 행을 읽기 때문입니다. 마스킹된 추출은 출력 id로 수집된 히든 행을 공개하므로, 출력 플래그가 접두사가 아닌 배치도 올바른 행을 내보냅니다. 테일 셀이 다른 시퀀스와 공유되는 부분 순환 롤백은 이제 해당 시퀀스의 테일을 조용히 이동시키는 대신 거부됩니다. Assisted-by: Claude * llama : glm5-next: MTP 변경 사항의 주석 정리 Assisted-by: Claude * llama : glm5-next: MTP 그래프를 프루닝하는 대신 출력 행에 맞춰 잘라내기(crop) 헤드리스 NextN 프루닝을 다른 MTP 그래프가 사용하는 crop 패턴으로 교체합니다: 위치별(position-wise) FFN과 공유 헤드 이전에 출력 id에서 어텐션 출력과 블록 입력을 gather합니다. 출력 행이 없는 NextN 포워드(MTP 캐치업과 드래프트 컨텍스트 프리필)는 이제 0개의 행에 대해 FFN과 헤드를 실행합니다. 4토큰 캐치업이 커널 기준 6.9 ms에서 2.9 ms로 감소하며, greedy 출력 해시는 변하지 않았습니다. Assisted-by: Claude * glm5-next: MTP 그래프에서 nextn crop 헬퍼 사용 로컬 crop 조건과 t_h_nextn의 마스킹된 select를 crop_before_nextn과 crop_after_nextn으로 교체하여, MTP 그래프가 메인 그래프 및 다른 모델들과 동일한 방식으로 행을 좁히도록 합니다. 순환(partial rollback) 부분 롤백의 공유 셀 및 빈 필터 분기에 대해 설명합니다. * glm5-next: MTP 전용 및 트렁크 전용 GGUF 파일 로드 파일이 NextN 레이어만 포함할 때 트렁크 텐서를 선택적으로 만들고, 파일이 트렁크만 포함할 때 NextN 텐서를 선택적으로 만들어, 분할된 MTP GGUF가 드래프트 모델로 로드되도록 합니다. Co-authored-by: Georgi Gerganov --------- Co-authored-by: Pascal Co-authored-by: Georgi Gerganov웹사이트: - https://llama.app
증명(Attestations): - https://github.com/ggml-org/llama.cpp/attestations/53581440
macOS/iOS: - macOS Apple Silicon (arm64) - macOS Apple Silicon (arm64, KleidiAI 활성화됨) DISABLED - macOS Intel (x64) - iOS XCFramework
Linux: - Ubuntu x64 (CPU) - Ubuntu arm64 (CPU) - Ubuntu s390x (CPU) - Ubuntu x64 (Vulkan) - Ubuntu arm64 (Vulkan) - Ubuntu x64 (CUDA 12) - CUDA 12.8 라이브러리 - Ubuntu x64 (CUDA 13) - CUDA 13.4 라이브러리 - Ubuntu arm64 (CUDA 13) - CUDA 13.4 라이브러리 - Ubuntu x64 (ROCm 10.0) - Ubuntu x64 (OpenVINO) - Ubuntu x64 (SYCL FP32) - Ubuntu x64 (SYCL FP16) - Linux arm64 (Snapdragon: CPU, Adreno GPU, Hexagon NPU) - 설정 가이드
Android: - Android arm64 (CPU) - Android arm64 (Snapdragon: CPU, Adreno GPU, Hexagon NPU) - 설정 가이드
윈도우: - 윈도우 x64(CPU) - 윈도우 arm64(CPU) - 윈도우 arm64(OpenCL Adreno) - 윈도우 x64(CUDA 12) - CUDA 12.4 DLL 파일 - 윈도우 x64(CUDA 13) - CUDA 13.4 DLL 파일 - 윈도우 arm64(CUDA 13) - CUDA 13.4 DLL 파일 - 윈도우 x64(Vulkan) - 윈도우 arm64(Vulkan) - 윈도우 x64(OpenVINO) - 윈도우 x64(SYCL) - 윈도우 x64(ROCm 10.0)
openEuler: - DISABLED - openEuler x86 (310p) 지원 - openEuler x86 (910b, ACL Graph) 지원 - openEuler aarch64 (310p) 지원 - openEuler aarch64 (910b, ACL Graph) 지원
UI: - UI