IT之家 10月9日の報道によると、テクノロジーメディアのNeoWinは昨日(10月8日)にブログを投稿し、マイクロソフトがllama.cppおよびGGUFオープンソースコミュニティと協力して、Windows 11システム上でWindows MLをアップグレードしていると報じている。GGUFおよびONNX形式のモデルの推論に対する実験的なネイティブサポートが提供され、Windows ML Runtime APIも公開されている。
WindowsとSurfaceの10月イベントで、マイクロソフトはWindows MLの最新動向を発表した。Windows MLは、Windows 11向けのローカルAI推論フレームワークであり、開発者はデバイス上でAIモデルを実行し、テキスト生成や音声認識などのアプリケーションを構築することができ、特定のハードウェアへの最適化への依存を減らすことができる。

マイクロソフトは、コミュニティとの協力を通じて、開発者が llama.cppの実験的な統合機能を利用してHugging FaceからGGUFモデルをインポートし、ローカルで直接実行できるようになると発表しました。性能面では、マイクロソフトはNVIDIAと協力して、llama.cppおよび関連する性能最適化に関するコードを提供しています。

Windows MLには、新たな実験的なWindowsオリジナルの推論パスが追加され、ONNXとGGUFの両種のモデルを実行できます。このパスの正式名称はWindows ML Runtime APIであり、マイクロソフトによると、より高い性能、より深いシステム統合、そしてより細かい制御能力を持っていると言われています。
IT之家注:GGUFは、ローカルで大規模言語モデルを実行する際によく使われるモデルファイル形式です。開発者はHugging FaceなどのプラットフォームからGGUFモデルを入手し、llama.cppなどのツールを使用して個人コンピュータ上でモデルを読み込み、推論を行うことができます。
そして、ONNXはオープンなニューラルネットワーク交換フォーマットであり、異なるフレームワークやハードウェア間でAIモデルを移行するために使用されます。ONNX Runtimeはその一般的な実行環境であり、Windowsデバイス上でのモデルの推論・デプロイをサポートします。

Windows ML Runtime APIを利用できることにより、マイクロソフトはText Generation APIとSpeech Recognition APIも発表しました。開発者はこれら2つのインターフェースを使って、テキスト生成や音声認識機能を実装することができます。

マイクロソフトは、ONNX Runtime APIが依然として完全にサポートされていると述べています。今後、Windows向けの最適化はWindows ML Runtime APIに優先して行われる予定です。両方の実行環境は現在のバージョンに含まれており、開発者は習慣に合わせて移行のタイミングを選択できます。
