Microsoft hat Microsoft-Decision-1 veröffentlicht, ein Entscheidungsmodell für Routing, Klassifizierung, Verifizierung und Agentsteuerung. Microsoft-Decision-1 ist ein Entscheidungsbewertungsmodell, das eine kalibrierte Wahrscheinlichkeit für jede feste Antwortoption zurückgibt anstatt generierten Textes. Es posttrainiert wurde von Alibaba’s Qwen3.5-9B und ist jetzt in Microsoft Foundry sowie OpenRouter verfügbar.
TL;DR
- Größe: Entwickelt auf Qwen3.5-9B; die genaue Anzahl der Parameter ist nicht bekannt. 32.768-Token-Kontextfenster.
- Verfügbar für: Nur eine hostete API (Microsoft Foundry, OpenRouter über Azure). Keine offenen Gewichte, keine quantisierten Varianten, Hardware wird nicht offengelegt.
- Leistung: Höchste durchschnittliche Genauigkeit im Vergleich von Microsofts 36-Testkriterien, mit einer Latenzzeit von 85 ms p50.
- Bestwert: 83,5 % durchschnittliche Genauigkeit bei 36 Benchmarks – vor Quyet-1.0-Large mit 81,9 %.
- Schlechteste: Kalibrierung auf 92.2, zweitbester hinter Quyet-1.0-Large bei 93.1. Nur Text, keine Erklärungen.
- Zusammenfassung:
- Bester Aspekt: schnelle, kostengünstige und kalibrierte Entscheidungen für 0,042 US-Dollar pro Million Eingabetoken mit kostenloser Ausgabe.
- Das Schlimmste: geschlossene Gewichte, und jeder Benchmark wird von dem Anbieter durchgeführt.
- Bester Aspekt: schnelle, kostengünstige und kalibrierte Entscheidungen für 0,042 US-Dollar pro Million Eingabetoken mit kostenloser Ausgabe.
Was ist ein Entscheidungsmodell?
Ein Entscheidungsmodell liest eine Eingabe und bewertet eine geschlossene Auswahl an Optionen. Es schreibt keine Textpassage. Microsoft betrachtet Entscheidungsmodelle als eine neue Kategorie der KI, die für Ausgaben entwickelt wurde, auf die das Softwareprogramm sofort reagieren kann.
Wie funktioniert Microsoft-Decision-1?
Microsoft posttrainiertes Qwen3.5-9B für einfache Entscheidungsbewertung. Anhand einer Situation, einer Frage und festgelegter Optionen gibt es in einem einzigen Aufruf die Wahrscheinlichkeit jeder Option an. Es ist geplant, zukünftige Versionen auf MAI- und OpenAI-Modelle zu basieren.
Die Foundry-Modellkarte listet die unterstützten Formate auf:
- Ja/Nein, Multiple-Choice-Fragen, Bewertung, Klassifizierung und Bewertungskriterien
- Bewertung der AI-Antworten und der vorgeschlagenen Agent-Aktionen
- Prüfung der Grundlage auf Basis der bereitgestellten Beweise
- explizite Ablehnungsmöglichkeiten wie „kann nicht sagen“
Die Trainierung verwendete öffentliche Datensätze im Rahmen von Microsofts Open Data-Prozess sowie synthetische Daten. Die Ausgabe ist in JSON formatiert. OpenRouter Notizen zeigen, dass die Gewichte kontinuierlich aktualisiert werden, während die API-Struktur unverändert bleibt.
Wie schnell und genau ist es?
Microsoft verglich 9 Systeme gegenüber 36 Benchmarken mit 147.137 Fragen. Die Benchmarks wurden während des Trainings blind aufbewahrt. Microsoft-Decision-1 lag im Durchschnitt bei einer Genauigkeit von 83,5%.
Seine p50-Latenz war 85 ms, mit p95 bei 125 ms. Das ist 4,5 Mal schneller als Quyet-1.0-Large und 35 Mal schneller als GPT-6 Sol, das 3,01 s benötigte.
Microsoft hat auch die Robustheit getestet. Es stört jede Anfrage auf 8 Arten, einschließlich Paraphrasing und Option-Umordnung. Das Modell änderte seine Entscheidung in durchschnittlich 1,3 % der Störungen. Die Änderungen waren null, wenn die Optionen paraphrasiert, umgekehrt oder umgeworfen wurden.
Was die Sicherheit angeht, führte Microsoft 5.250 Anfragen in 11 Benchmark-Tests durch. Diese umfassten schädliches Inhalt, Jailbreak-Fähigkeiten und Prompt-Injektionen. Microsoft berichtet über korrekte Ablehnungen mit hohem Nutzenanteil, ohne eine Punktzahl zu veröffentlichen.
Interne Ergebnisse, die Microsoft meldet
- Xbox Research: Sortiert über 10.000 Feedbackstellen – 14 Mal schneller und 200 Mal günstiger als GPT-6 Sol.
- Copilot Qualitätskontrolle: konkurrenzfähig gegenüber GPT5.6 Luna und 100 Mal schneller.
- Microsoft Discovery: 46 Mal konstanter als das LLM-Bewertungssystem, mit 3-fach höherer Geschwindigkeit.
Wie vergleicht es sich mit anderen Entscheidungsmodellen?
| Feature | Microsoft-Decision-1 | Quyet-1.0-Large | H2O-Lightning-4B | GPT-6 Luna Decisions |
|---|---|---|---|---|
| Entwickler | Microsoft | Chinh Nguyen | H2O.ai | OpenAI |
| Basismodell | Qwen3.5-9B | Gemma-4-31B-it (LoRA zusammengefasst) | Qwen3.5-4B | Nicht offenlegt |
| Parameter | Nicht offenlegt | 31.3B | 4B | Nicht offenlegt |
| Kontext / Eingabe | 32.768 Tokens | 8.000-Token-Prompt (6.000 Zustand) | 40.960 (VLLM-Dienst-Einstellung) | Nicht offenlegt |
| Lizenz | Eigene API | Apache-2.0 | Apache-2.0 | Eigene API |
| Modality | Text | Text | Text und Bilder | Text und Bilder |
| Hardware | Hosted (Azure) | 1x 80 GB GPU, bf16 | 32 GB GPU getestet; 9,1 GB Speicherkapazität | Hosted |
| Genauigkeit (Microsoft, 36 Benchmarks) | 83.5% | 81.9% | 77.2% | 79.4% |
| Kalibrierung (Microsoft) | 92.2 | 93.1 | 91.8 | 89.9 |
| Mittelwertliche Latenzzeit im Microsoft-Chart | 85 ms | 380 ms | 210 ms | 300 ms |
| Preis | $0,042/M Eingabe, Ausgabe kostenlos | Selbsthosten | Selbsthosten | $0,10/M Eingabe, Ausgabe kostenlos |
Die Zeilen für Genauigkeit, Kalibrierung und Latenz stammen aus Microsofts Diagramm. Die Latenzen der Konkurrenz werden mit dem JevBench v1.6.1 angepassten Median berechnet.
Ist die Latenzvergleiche vergleichbar?
Nicht vollständig. Microsoft hat sein eigenes Modell über Foundry gemessen. Die Wertungen der Konkurrenz verwenden die angepasste Medianwerte von JevBench, nicht die rohen Zeiten.
H2O.ai’s Modelkarte bestreitet dies. Sie besagt, dass die angepasste Zahl von JevBench das gemessene Zeitfenster verdoppelt und 0,15 Sekunden hinzufügt. H2O erklärt, dass die gemessene Medianwerte seines Modells 29 ms betragen, nicht 210 ms. Microsoft-Decision-1 ist auf der JevBench-Tabelle nicht zu finden. Auf der offiziellen Kombiwertung dieser Tabelle rangiert H2O-Lightning-4B auf Platz 1 mit 72,5.
Wie setzen die Entwickler es ein?
Entwickler können es von Microsoft Foundry als allgemein verfügbares ‘Direct from Azure’-Modell aufrufen. Auf OpenRouter läuft es über die Decisions-API, nicht über den Chat-Endpunkt. Die Chat-completion-SDKs funktionieren nicht.
Der Preis beträgt $0,042 pro Millionstoken der Eingabe, mit kostenlosen Ausgaben. Der Endpunkt für Entscheidungen von Luna von OpenAI kostet $0,10 pro Millionstoken der Eingabe.
Welche Einschränkungen gibt es?
Die Modellkarte ist ausdrücklich folgendermaßen:
- Nicht für Textgenerierung, offene Q&A, Chat, Übersetzung oder Zusammenfassung.
- Text-Only. Keine Bilder, Audio oder Video.
- Keine Erklärungen oder Begründungen im Ausgangstext.
- Nicht für allein automatisierte Entscheidungen in Bezug auf Krediten, Beschäftigung, Wohnen, Gesundheitsversorgung oder rechtliche Rechte.
- Anwendungen müssen Optionen, Schwellenwerte, Eskalationswege und menschliche Überwachung definieren.
Wichtigste Erkenntnisse
- Microsoft-Decision-1 erzielt feste Optionen mit kalibrierten Wahrscheinlichkeiten, nicht Text.
- Posttrainiert von Qwen3.5-9B, mit einem Kontextfenster von 32.768 Tokens.
- Löst die 36-Testvergleiche von Microsoft mit einer Genauigkeit von 83,5 % und 85 ms p50.
- Kosten: $0,042 pro Millionstoken der Eingabe; die Ausgabetoken sind kostenlos.
- Die Vergleiche der Latenzzeiten sind umstritten; die unabhängigen Ergebnisse von JevBench sind noch ausstehend.
Schauen Sie sich die offizielle Ankündigung, die Foundry-Modellkarte und die OpenRouter-Listung an. Der ganze Dank geht an den Forscher dieses Projekts. Folgen Sie uns auch gerne auf Twitter und vergessen Sie nicht, sich bei unserem 150k+ML SubReddit anzumelden und unseren Newsletter zu abonnieren. Warte! Sind Sie auf Telegram? Jetzt können Sie sich auch auf Telegram bei uns anmelden.
Die Beitrag Microsoft AI veröffentlicht Microsoft-Decision-1: Ein Qwen3.5-9B Entscheidungsbewertungsmodell erschien zunächst in MarkTechPost.