IT之家 AI

GitHub Copilot, 순수 클라우드 AI 모델 벗어난다: Surface Laptop Ultra 로컬 추론 처리량 최대 초당 63 토큰

IT之家 10월 8일 소식, 태평양 표준시 10월 7일 오전 10시(베이징 시간 10월 8일 새벽 1시)에 미국 샌프란시스코에서 개최된 발표회에서 마이크로소프트는 GitHub Copilot이 이번 달 말까지 로컬 AI 모델 추론을 지원할 것이라고 발표했습니다. 개발자는 클라우드 모델과 디바이스 측 모델 간에 자동 또는 수동으로 전환할 수 있습니다. GitHub Copilot은 마이크로소프트가…

이미지 출처 · IT之家 AI
IT之家 네티즌 愚公骑马 님의 제보에 감사드립니다!

IT之家 10월 8일 소식, 태평양 표준시 10월 7일 오전 10시(베이징 시간 10월 8일 새벽 1시)에 미국 샌프란시스코에서 개최된 발표회에서 마이크로소프트는 GitHub Copilot이 이번 달 말까지 로컬 AI 모델 추론을 지원할 것이라고 발표했습니다.개발자는 클라우드 모델과 디바이스 측 모델 간에 자동 또는 수동으로 전환할 수 있습니다.

GitHub Copilot은 마이크로소프트가 출시한 AI 코딩 어시스턴트로, Visual Studio Code, CLI 등의 도구에 통합되어 코드 컨텍스트에 따라 완성, 설명 또는 리팩터링 제안을 생성할 수 있습니다.

GitHub Copilot은 현재 클라우드 호스팅 모델에 의존하며, 오케스트레이터가 성능, 비용 및 정확성에 따라 요청을 라우팅합니다. 마이크로소프트는 이번 달 말까지 이 메커니즘을 확장하여 Copilot이 클라우드 모델과 로컬 AI 모델을 자동으로 선택하고 백그라운드에서 추론 작업을 조율하도록 할 계획입니다.

마이크로소프트는 GitHub Copilot 사용자에게 자동 오케스트레이션 또는 디바이스 측 모델 강제 사용의 두 가지 모드를 제공합니다. 사용자는 GitHub Copilot CLI, Copilot 앱 및 Visual Studio Code에서 기본 설정을 지정할 수 있습니다.

로컬 모델 선택은 공급자, 모델 또는 엔드포인트 지정을 지원하며, 개발자는 Windows ML을 통해 MAI Code 1.1 Flash를 선택하거나 OpenAI 호환 로컬 엔드포인트에 연결하여 해당 엔드포인트가 노출하는 모델을 선택할 수 있습니다.

마이크로소프트는 총 파라미터 1370억, 활성 파라미터 68억의 'Mixture of Experts' 모델인 MAI Code 1.1 Flash를 출시했으며, 양화 및 추측 디코딩 기술을 활용해 응답 속도와 메모리 사용량을 최적화했습니다.

이 모델은 Surface Laptop Ultra에서의 실측 결과, 복잡한 작업에서의 피크 메모리 사용률, 토큰 활용률 및 처리 속도가 모두 크게 향상된 것으로 나타났습니다. 디코딩 처리량 테스트에서는 프롬프트 길이가 2K에서 256K 토큰일 때 처리량이 초당 40~63 토큰 사이를 기록했습니다. IT之家가 관련 이미지를 아래에 첨부합니다:

마이크로소프트 Surface Laptop Ultra 발표회 특집

원문 출처

IT之家 AI

내용 안내

원문 발행 및 권리는 출처에 있습니다.

기계 번역 · 원문을 참고하세요