MarkTechPost

Microsoft AI publie Microsoft-Decision-1 : un modèle de notation de décision Qwen3.5-9B

Microsoft a publié Microsoft-Decision-1, un modèle de décision pour le routage, la classification, la vérification et le contrôle des agents. Microsoft-Decision-1 est un modèle de scoring de décisions qui renvoie une…

Microsoft a lancé Microsoft-Decision-1, un modèle de décision pour le routage, la classification, la vérification et le contrôle des agents. Microsoft-Decision-1 est un modèle de scoring de décisions qui renvoie une probabilité calibrée pour chaque option de réponse fixe, plutôt que du texte généré. Il a été post-trainé à partir de Alibaba’s Qwen3.5-9B et est maintenant disponible dans Microsoft Foundry et OpenRouter. .

TL;DR

  • Dimensions : Construite sur Qwen3.5-9B ; le nombre exact de paramètres n’est pas divulgué. Fenêtre de contexte de 32 768 tokens.
  • Fonctionne sur : Seulement une API hébergée (Microsoft Foundry, OpenRouter via Azure). Aucun poids ouvert, aucune variante quantifiée, le matériel n’est pas révélé.
  • Performance : La plus haute précision moyenne dans la comparaison de 36 benchmarks de Microsoft, avec une latence de 85 ms p50.
  • Meilleur : 83,5 % d’exactitude moyenne sur 36 tests, devant Quyet-1.0-Large à 81,9 %.
  • Le pire : Calibration de 92.2, deuxième derrière Quyet-1.0-Large à 93.1. Seulement du texte, sans explications.
  • En résumé :
    • Meilleure chose : décisions rapides, bon marché, calibrées à 0,042 $ par million de tokens d’entrée avec sortie gratuite.
      • Pire : les poids sont fermés, et chaque test de performance est géré par le fournisseur.

Qu'est-ce qu'un modèle de décision ?

Un modèle de décision lit une entrée et évalue un ensemble fermé d’options. Il ne produit pas de texte. Microsoft considère les modèles de décision comme une nouvelle catégorie d’IA, conçue pour que le logiciel puisse agir immédiatement sur les résultats.

Comment fonctionne Microsoft-Decision-1 ?

Microsoft Qwen3.5-9B post-trainé pour l’évaluation des décisions en une seule passée. Face à une situation, une question et des options fixes, il renvoie une probabilité pour chaque option en une seule appel. Il prévoit de baser les versions futures sur les modèles MAI et OpenAI.

La carte de modèle Foundry liste les formats pris en charge :

  • oui/non, questions de choix multiples, évaluation, classification et rubriques
  • évaluation des réponses de l’IA et des actions proposées par l’agent
  • Vérification de la fondation contre les preuves fournies
  • Options d’abstention explicite telles que « ne peut pas dire »

L’entraînement utilise des jeux de données publiques dans le cadre du processus Open Data de Microsoft, ainsi que des données synthétiques. Le résultat est en JSON. Notes sur OpenRouter indiquent que les poids sont mis à jour continuellement, tandis que la forme de l’API reste fixe.

Quelle est sa vitesse et son exactitude ?

Microsoft a comparé 9 systèmes 36 benchmarks avec 147 137 questions. Les benchmarks ont été conservés tels quels pendant l’entraînement. Microsoft-Decision-1 a dominé en termes d’exactitude moyenne à 83,5 %.

Sa latence p50 était de 85 ms, avec p95 à 125 ms. Cela est 4,5 fois plus rapide que Quyet-1.0-Large et 35 fois plus rapide que GPT-6 Sol, qui a pris 3,01 s.

Microsoft a également testé la robustesse du modèle. Chaque demande est perturbée de 8 manières, y compris par une paraphrase ou un changement de séquence des options. En moyenne, le modèle change de décision à 1,3 % des perturbations. Les changements de décision sont nuls lorsque les options sont paraphrased, inversées ou mélangées.

Sur le plan de la sécurité, Microsoft a réalisé 5 250 requêtes sur 11 tests. Ces tests comprenaient des contenus nuisibles, des tentatives de contournement et des injections de prompt. Microsoft indique des refus corrects avec une utilité importante conservée, sans publier de score.

Résultats internes rapportés par Microsoft

  • Xbox Research : trié plus de 10 000 éléments de retour, 14 fois plus rapide et 200 fois moins cher que GPT-6 Sol.
  • Qualité de Copilot : compétitive par rapport à GPT5.6 Luna, et 100 fois plus rapide.
  • Recherche Microsoft : 46 fois plus cohérent que le scoring des LLM, à une vitesse 3 fois supérieure.

Comment se compare-t-il aux autres modèles de décision ?

CaractéristiqueMicrosoft-Decision-1Quyet-1.0-LargeH2O-Lightning-4BGPT-6 Luna Decisions
DéveloppeurMicrosoftChinh NguyenH2O.aiOpenAI
Modèle de baseQwen3.5-9BGemma-4-31B-it (LoRA fusionné)Qwen3.5-4BNon divulgué
ParamètresNon divulgué31.3B4BNon divulgué
Contexte / entrée32 768 tokensPrompt de 8 000 tokens (état de 6 000)40,960 (paramètres du service vLLM)Non divulgué
LicenceAPI propriétaireApache-2.0Apache-2.0API propriétaire
ModalitéTextTextTexte et imagesTexte et images
HardwareHébergé (Azure)1 x GPU de 80 Go, bf1632 Go GPU testé ; 9,1 Go de poidsHébergé
Exactitude (Microsoft, 36 critères de performance)83.5%81.9%77.2%79.4%
Calibration (Microsoft)92.293.191.889.9
Latence médiane dans le graphique de Microsoft85 ms380 ms210 ms300 ms
Prix$0,042/M entrée, sortie gratuiteAutofournirAutofournir$0,10/M entrée, sortie gratuite

Les lignes d’exactitude, de calibration et de latence proviennent du graphique de Microsoft. Les latences des concurrents sont basées sur la médiane ajustée du JevBench v1.6.1.

La comparaison de la latence est-elle équivalente ?

Pas complètement. Microsoft a mesuré son propre modèle via Foundry. Les chiffres des concurrents utilisent la médiane ajustée de JevBench, et non les temps bruts.

La carte de modèle de H2O.ai conteste cela. Elle indique que le chiffre ajusté de JevBench double le temps mesuré et ajoute 0,15 s. H2O affirme que la médiane mesurée de son modèle est de 29 ms, et non 210 ms. Microsoft-Decision-1 n’apparaît pas sur la liste de JevBench. Sur la liste officielle de cette plateforme, H2O-Lightning-4B se classe numéro 1 avec 72,5.

Comment les développeurs le déploient-ils ?

Les développeurs peuvent l’appeler depuis Microsoft Foundry en tant que modèle généralement disponible ‘Direct from Azure’. Sur OpenRouter, il fonctionne via l’API Decisions, et non via l’endpoint de chat. Les SDK de complétions de chat ne fonctionneront pas.

Le prix est de 0,042 $ par million de tokens d’entrée, avec un output gratuit. L’endpoint de décisions Luna d’OpenAI facture 0,10 $ par million de tokens d’entrée.

Quelles sont les limites ?

La carte du modèle est claire :

  • Pas pour la génération de texte, questions-réponses ouvertes, chat, traduction ou résumé.
  • Text seulement. Aucune image, aucun audio ou vidéo.
  • Aucune explication ou justification dans la sortie.
  • Non destiné à des décisions automatisées uniques en matière de crédit, d’emploi, de logement, de santé ou de droits juridiques.
  • Les applications doivent définir des options, des seuils, des voies d’escalade et une supervision humaine.

Résumés clés

  • Microsoft-Decision-1 scores des options fixes avec des probabilités calibrées, pas du texte.
  • Post-trainé sur Qwen3.5-9B, avec une fenêtre de contexte de 32 768 tokens.
  • Les leaders de Microsoft atteignent une précision de 83,5 % et un temps de réponse de 85 ms p50 dans la comparaison de 36 benchmarks.
  • Coûts : 0,042 $ par million de tokens d’entrée ; les tokens de sortie sont gratuits.
  • Les comparaisons de latence sont controversées ; les résultats indépendants de JevBench sont en attente.


Veuillez consulter l’annonce officielle, la carte de modèle Foundry et la liste sur OpenRouter. Tout le crédit revient au chercheur de ce projet. Veuillez également nous suivre sur Twitter, et n’oubliez pas de rejoindre notre subreddit 150k+ML et de vous abonner à nos newsletters. Attendez ! êtes-vous sur Telegram ? Maintenant, vous pouvez également nous rejoindre sur Telegram.

La publication Microsoft AI publie Microsoft-Decision-1 : un modèle de scoring de décisions Qwen3.5-9B a été publiée en premier sur MarkTechPost.

Source originale

MarkTechPost

À propos du contenu

La publication originale et les droits appartiennent à la source.

Traduction automatique · Consultez l’original