IT之家 10월 9일 소식에 따르면, 기술 미디어 NeoWin은 어제(10월 8일) 블로그 글을 게시하여 마이크로소프트가 llama.cpp 및 GGUF 오픈소스 커뮤니티와 협력하여 Windows 11 시스템에서 Windows ML을 업그레이드하고 있다고 보도했습니다. 실험적으로 GGUF 및 ONNX 형식 모델의 인출을 네이티브로 지원하며, Windows ML Runtime API를 출시합니다.
Windows와 Surface 10월 행사에서 마이크로소프트는 Windows ML의 최신 발전 상황을 공개했습니다. Windows ML은 마이크로소프트가 Windows 11을 위해 개발한 로컬 AI 추론 프레임워크로, 개발자는 기기 단에서 AI 모델을 실행하여 텍스트 생성, 음성 인식 등의 애플리케이션을 구축할 수 있으며, 특정 하드웨어에 대한 최적화에 대한 의존도를 줄일 수 있습니다.

마이크로소프트는 커뮤니티 협력을 통해, 개발자들이 llama.cpp의 실험적 통합 기능을 이용하여 Hugging Face의 GGUF 모델을 불러와서 로컬에서 직접 실행할 수 있다고 밝혔습니다. 성능 측면에서는 인텔과도 협력하여 llama.cpp 및 관련 성능 최적화에 관한 코드를 공헌하고 있습니다.

Windows ML은 새로운 실험적인 Windows 기본 추론 경로를 추가하여 ONNX와 GGUF 모델을 실행할 수 있습니다. 이 경로의 공식 명칭은 Windows ML Runtime API이며, 마이크로소프트는 이를 더 높은 성능, 더 깊은 시스템 통합 및 더 세분화된 제어 능력이라고 말합니다.
IT之家 주: GGUF는 로컬에서 대형 언어 모델을 실행하는 데 자주 사용되는 모델 파일 형식입니다. 개발자는 Hugging Face와 같은 플랫폼에서 GGUF 모델을 얻고, llama.cpp과 같은 도구를 사용하여 개인용 컴퓨터에서 모델을 로드하고 추론할 수 있습니다.
그리고 ONNX는 개방형 신경망 교환 형식으로, 다양한 프레임워크와 하드웨어 간에 AI 모델을 이동시키는 데 사용됩니다. ONNX Runtime은 이를 위한 일반적인 실행 환경이며, Windows 기기에서 모델의 추론 배포를 지원합니다.

Windows ML Runtime API를 지원하는 가운데, 마이크로소프트는 Text Generation API와 Speech Recognition API를 함께 출시했으며, 개발자는 이 두 가지 인터페이스를 사용하여 텍스트 생성 및 음성 인식 기능을 구축할 수 있다.

마이크로소프트는 ONNX Runtime API가 여전히 전체적으로 지원된다고 밝혔습니다. 향후 Windows에 대한 최적화는 Windows ML Runtime API에 우선적으로 적용될 예정입니다. 두 가지 런타임 기능은 현재 버전에도 포함되어 있으므로, 개발자는 익숙한 방식에 따라 마이그레이션 시기를 선택할 수 있습니다.
