IT Home Médias technologiques le 9 octobre : un post publié hier (8 octobre) par le site NeoWin indique que Microsoft collabore avec les communautés ouvertes llama.cpp et GGUF, Windows 11 Mise à niveau du système pour Windows ML.Support natif expérimental pour la prédiction de modèles dans les formats GGUF et ONNX, ainsi que l’introduction de l’API Windows ML Runtime.
Lors de l’événement October de Windows et Surface, Microsoft a présenté les dernières avancées de Windows ML. Windows ML est un cadre d’inférence d’IA locale destiné à Windows 11 par Microsoft. Les développeurs peuvent exécuter des modèles d’IA sur le dispositif, créer des applications de génération de texte et de reconnaissance vocale, et réduire la dépendance aux optimisations spécifiques du matériel.

Microsoft indique que, grâce à la coopération communautaire, les développeurs peuvent désormais importer des modèles GGUF depuis Hugging Face via l’intégration expérimentale de llama.cpp, et les exécuter directement localement. En matière de performance, Microsoft collabore également avec NVIDIA pour apporter des contributions de code à llama.cpp et aux optimisations de performance correspondantes.

Windows ML ajoute une voie de raisonnement native pour Windows expérimentale, permettant l’exécution des modèles ONNX et GGUF. La nommature officielle de cette voie est Windows ML Runtime API ; Microsoft affirme qu’elle offre un meilleur rendement, une intégration plus profonde du système et une capacité de contrôle plus fine.
IT Home note : Le GGUF est un format de fichier de modèle souvent utilisé pour l’exécution locale de modèles de langage grand. Les développeurs peuvent obtenir des modèles GGUF sur des plateformes telles que Hugging Face, et les charger et inférer à l’aide d’outils tels que llama.cpp sur un ordinateur personnel.
Et ONNX est un format de échange de réseaux neuronaux ouvert, utilisé pour migrer les modèles d’IA entre différents frameworks et équipements. ONNX Runtime est son environnement d’exécution courant, permettant le déploiement de l’inférence des modèles sur des appareils Windows.

Avec le soutien de la API Windows ML Runtime, Microsoft a également lancé les API Text Generation et Speech Recognition. Les développeurs peuvent utiliser ces deux interfaces pour créer des fonctionnalités de génération de texte et de reconnaissance vocale.

Microsoft indique que l’API ONNX Runtime est toujours complètement supportée ; les améliorations futures pour Windows seront prioritairement orientées vers l’API Windows ML Runtime. Les deux runtimes sont inclus dans la version actuelle, et les développeurs peuvent choisir le moment de la migration en fonction de leur familiarité avec chacun.
