AIbaseAktualisiert

Microsoft veröffentlicht das MAI Code1.1Flash-Modell; GitHub Copilot wird hybride Inferenz mit lokaler und Cloud-Verarbeitung unterstützen

Microsoft kündigte auf der Windows- und Surface-Veranstaltung am 7. Oktober 2026 an, noch vor Ende dieses Monats eine Unterstützung für lokale KI-Modelle für GitHub Copilot einzuführen; Entwickler können dann frei…

Microsoft kündigte auf der Windows- und Surface-Veranstaltung am 7. Oktober 2026 an, noch vor Ende dieses Monats eine Unterstützung für lokale KI-Modelle in GitHub Copilot einzuführen, die es Entwicklern ermöglicht, frei zwischen Cloud- und On-Device-Modellen zu wechseln oder eine automatische Vermittlung zu realisieren.

Um den Speicherengpass bei der On-Device-Inferenz und den Ressourcenverbrauch bei langen Kontexten zu lösen, hat Microsoft das effiziente hybride Mixture-of-Experts-Modell (MoE) MAI Code1.1Flash vorgestellt. Das Modell verfügt über insgesamt 137 Milliarden Parameter und 6,8 Milliarden aktivierte Parameter und kombiniert Quantisierungs- und Speculative-Decoding-Techniken, wodurch es den Speicherverbrauch deutlich senkt und zugleich die Antwortgeschwindigkeit der Geräte-codierung verbessert; erstmals kommt es im neuen Surface Laptop Ultra mit NVIDIA RTX Spark Hardware zum Einsatz.

In der konkreten Anwendung können Nutzer über die GitHub Copilot CLI, die Copilot-Anwendung und Visual Studio Code den Inferenzmodus selbst wählen: Sie können sich entweder auf die automatische Ressourcenkoordination im Copilot-Backend verlassen oder festlegen, dass lokale Modelle wie MAI Code1.1Flash über einen Windows-ML-Anbieter oder einen OpenAI-kompatiblen lokalen Endpunkt aufgerufen werden. In Sachen Sicherheit integriert das System das vom Windows-Team entwickelte Microsoft Execution Container (MXC), das die nativen Container-Isolationsmechanismen der jeweiligen Betriebssysteme nutzt, um die sichere Ausführung von Code zu gewährleisten.

Dieses Upgrade markiert, dass KI-Coding-Assistenten sich beschleunigt von einer reinen Cloud-Abhängigkeit zu einer hybriden Architektur aus „Cloud plus Endgerät“ entwickeln. Diese Maßnahme senkt nicht nur die Einstiegshürde für die Bereitstellung lokaler Modelle, sondern bietet auch für Entwicklungsszenarien mit hohen Datenschutzanforderungen und geringer Latenz eine effizientere Umsetzungslösung.

Originalquelle

AIbase

Hinweise zum Inhalt

Originalveröffentlichung und Rechte liegen bei der Quelle.

Maschinelle Übersetzung · Original beachten