llama.cpp Releases

[Pré-version / build continu] b11435

[Pré-version / build continu] llama : correction d'une course de données du scatter k-pool sur les séquences partagées (#29994) * llama : re-mettre en pool chaque rep k-pool partagé une seule fois Avec des cellules…

Pré-version / build continu : il s'agit d'un build expérimental, pas d'une version stable.

llama : correction d'une course de données du scatter k-pool sur les séquences partagées (#29994) * llama : re-mettre en pool chaque rep k-pool partagé une seule fois Avec des cellules partagées, chaque pool est re-mis en pool, et comme les clés en pool sont toujours dispersées, les pools qu'un seq_cp partage entre séquences écrivaient la même ligne rep à partir de plusieurs entrées de scatter, une course de données sur le backend CPU. Marquer chaque rep une seule fois : les séquences partageantes lisent la même ligne via pool_cells. * llama : exiger un seq_cp de séquence entière dans la mémoire idx hybride L'état récurrent est toujours copié en entier quelle que soit la plage, et une cellule k-pool partagée par une copie partielle pourrait porter deux groupements de pool avec une seule ligne en pool. Chaque appelant copie des séquences entières, donc rejeter les plages partielles au lieu de les prendre en charge. * llama : supprimer le mode cache_safe du k-pool Avec un seq_cp de séquence entière, les séquences qui partagent des cellules partagent aussi leurs pools, donc la ligne en pool d'un rep partagé est valide pour toutes. Marquer chaque rep une seule fois dans chaque ubatch au lieu de tout re-mettre en pool tant que des cellules sont partagées, ce qui supprime le scan de partage et les contournements stale-all dans seq_rm, state_read et state_drop. seq_cp ne stales plus que la destination.

Site web : - https://llama.app

Attestations : - https://github.com/ggml-org/llama.cpp/attestations/53070668

macOS/iOS : - macOS Apple Silicon (arm64) - macOS Apple Silicon (arm64, KleidiAI activé) DÉSACTIVÉ - macOS Intel (x64) - iOS XCFramework

Linux : - Ubuntu x64 (CPU) - Ubuntu arm64 (CPU) - Ubuntu s390x (CPU) - Ubuntu x64 (Vulkan) - Ubuntu arm64 (Vulkan) - Ubuntu x64 (CUDA 12) - Bibliothèques CUDA 12.8 - Ubuntu x64 (CUDA 13) - Bibliothèques CUDA 13.4 - Ubuntu arm64 (CUDA 13) - Bibliothèques CUDA 13.4 - Ubuntu x64 (ROCm 10.0) - Ubuntu x64 (OpenVINO) - Ubuntu x64 (SYCL FP32) - Ubuntu x64 (SYCL FP16) - Linux arm64 (Snapdragon : CPU, GPU Adreno, NPU Hexagon) - guide d'installation

Android : - Android arm64 (CPU) - Android arm64 (Snapdragon : CPU, GPU Adreno, NPU Hexagon) - guide d'installation

Windows : - Windows x64 (CPU) - Windows arm64 (CPU) - Windows arm64 (OpenCL Adreno) - Windows x64 (CUDA 12) - DLLs CUDA 12.4 - Windows x64 (CUDA 13) - DLLs CUDA 13.4 - Windows arm64 (CUDA 13) - DLLs CUDA 13.4 - Windows x64 (Vulkan) - Windows arm64 (Vulkan) - Windows x64 (OpenVINO) - Windows x64 (SYCL) - Windows x64 (ROCm 10.0)

openEuler : - DÉSACTIVÉ - openEuler x86 (310p) - openEuler x86 (910b, ACL Graph) - openEuler aarch64 (310p) - openEuler aarch64 (910b, ACL Graph)

UI : - UI

Source originale

llama.cpp Releases

À propos du contenu

La publication originale et les droits appartiennent à la source.

Traduction automatique · Consultez l’original