MarkTechPost

Microsoft AI lanza Microsoft-Decision-1: un modelo de puntuación de decisiones basado en Qwen3.5-9B

Microsoft ha lanzado Microsoft-Decision-1, un modelo de decisión para enrutamiento, clasificación, verificación y control de agentes. Microsoft-Decision-1 es un modelo de puntuación de decisiones que devuelve una…

Microsoft ha lanzado Microsoft-Decision-1, un modelo de decisión para enrutamiento, clasificación, verificación y control de agentes. Microsoft-Decision-1 es un modelo de puntuación de decisiones que devuelve una probabilidad calibrada para cada opción de respuesta fija en lugar de texto generado. Está postentrenado a partir del Qwen3.5-9B de Alibaba y ya está disponible en Microsoft Foundry y OpenRouter. .

TL;DR

  • Tamaño: Construido sobre Qwen3.5-9B; número exacto de parámetros no revelado. Ventana de contexto de 32,768 tokens.
  • Se ejecuta en: Solo API alojada (Microsoft Foundry, OpenRouter vía Azure). Sin pesos abiertos, sin variantes cuantizadas, hardware no revelado.
  • Rendimiento: La mayor precisión promedio en la comparación de 36 benchmarks de Microsoft, con una latencia p50 de 85 ms.
  • Mejor: 83.5% de precisión promedio en 36 benchmarks, por delante de Quyet-1.0-Large con 81.9%.
  • Peor: Calibración de 92.2, por detrás de Quyet-1.0-Large con 93.1. Solo texto, sin explicaciones.
  • Conclusión:
    • Lo mejor: decisiones rápidas, baratas y calibradas a $0.042 por millón de tokens de entrada con salida gratuita.
      • Lo peor: pesos cerrados, y cada benchmark está gestionado por el proveedor.

¿Qué es un modelo de decisión?

Un modelo de decisión lee una entrada y puntúa un conjunto cerrado de opciones. No escribe prosa. Microsoft presenta los modelos de decisión como una nueva categoría de IA, diseñados para salidas sobre las que el software puede actuar de inmediato.

¿Cómo funciona Microsoft-Decision-1?

Microsoft postentrenó Qwen3.5-9B para puntuación de decisiones en una sola pasada. Dada una situación, una pregunta y opciones fijas, devuelve una probabilidad por opción en una sola llamada. Planea basar las versiones futuras en los modelos MAI y OpenAI.

La tarjeta de modelo de Foundry enumera los formatos admitidos:

  • preguntas de sí/no, de opción múltiple, de valoración, de clasificación y de rúbrica
  • calificación de las respuestas de IA y de las acciones propuestas por agentes
  • comprobaciones de fundamentación frente a evidencia suministrada
  • opciones explícitas de abstención como "no se puede saber"

El entrenamiento utilizó conjuntos de datos públicos bajo el proceso Open Data de Microsoft además de datos sintéticos. La salida es JSON. OpenRouter señala que los pesos se actualizan continuamente mientras la forma de la API permanece fija.

¿Qué tan rápido y preciso es?

Microsoft comparó 9 sistemas en 36 benchmarks con 147,137 preguntas. Los benchmarks se mantuvieron ocultos del entrenamiento. Microsoft-Decision-1 lideró en precisión promedio con 83.5%.

Su latencia p50 fue de 85 ms, con p95 de 125 ms. Eso es 4.5 veces más rápido que Quyet-1.0-Large y 35 veces más rápido que GPT-6 Sol, que tardó 3.01 s.

Microsoft también probó la robustez. Perturba cada solicitud de 8 maneras, incluyendo paráfrasis y barajado de opciones. El modelo cambió su decisión en 1.3% de las perturbaciones en promedio. Los cambios fueron cero cuando las opciones fueron parafraseadas, invertidas o barajadas.

En cuanto a la seguridad, Microsoft ejecutó 5,250 solicitudes en 11 benchmarks. Estos cubrieron contenido dañino, jailbreaks e inyección de prompts. Microsoft informa rechazos correctos con alta utilidad retenida, sin publicar una puntuación.

Los resultados internos que Microsoft reporta

  • Xbox Research: clasificó más de 10,000 elementos de retroalimentación, 14 veces más rápido y 200 veces más barato que GPT-6 Sol.
  • Control de calidad de Copilot: competitivo con GPT5.6 Luna y 100 veces más rápido.
  • Microsoft Discovery: 46 veces más consistente que la puntuación por LLM, a 3 veces la velocidad.

¿Cómo se compara con otros modelos de decisión?

CaracterísticaMicrosoft-Decision-1Quyet-1.0-LargeH2O-Lightning-4BGPT-6 Luna Decisions
DesarrolladorMicrosoftChinh NguyenH2O.aiOpenAI
Modelo baseQwen3.5-9BGemma-4-31B-it (LoRA fusionado)Qwen3.5-4BNo divulgado
ParámetrosNo divulgado31.3B4BNo divulgado
Contexto / entrada32,768 tokensPrompt de 8,000 tokens (6,000 de estado)40,960 (ajuste de vLLM serve)No divulgado
LicenciaAPI propietariaApache-2.0Apache-2.0API propietaria
ModalidadTextoTextoTexto e imágenesTexto e imágenes
HardwareAlojado (Azure)1x GPU de 80 GB, bf16GPU de 32 GB probada; pesos de 9.1 GBAlojado
Precisión (Microsoft, 36 benchmarks)83.5%81.9%77.2%79.4%
Calibración (Microsoft)92.293.191.889.9
Latencia mediana en el gráfico de Microsoft85 ms380 ms210 ms300 ms
Precio$0.042/M de entrada, salida gratisAutoalojadoAutoalojado$0.10/M de entrada, salida gratis

Las filas de precisión, calibración y latencia provienen del gráfico de Microsoft. Las latencias de la competencia allí usan la mediana ajustada de JevBench v1.6.1 .

¿Es la comparación de latencia de tú a tú?

No del todo. Microsoft midió su propio modelo a través de Foundry. Las cifras de la competencia usan la mediana ajustada de JevBench, no tiempos sin procesar.

La ficha del modelo de H2O.ai cuestiona esto. Indica que la cifra ajustada de JevBench duplica el tiempo medido y añade 0.15 s. H2O dice que la mediana medida de su modelo es 29 ms, no 210 ms. Microsoft-Decision-1 no aparece en el tablero de JevBench. En la compuesta oficial de ese tablero, H2O-Lightning-4B ocupa el puesto #1 con 72.5.

¿Cómo lo despliegan los desarrolladores?

Los desarrolladores pueden llamarlo desde Microsoft Foundry como un modelo 'Direct from Azure' de disponibilidad general. En OpenRouter, se ejecuta en la Decisions API, no en el endpoint de chat. Los SDK de chat completions no funcionarán.

El precio es $0.042 por millón de tokens de entrada, con salida gratuita. El endpoint de decisiones Luna de OpenAI cobra $0.10 por millón de tokens de entrada.

¿Cuáles son las limitaciones?

La ficha del modelo es explícita:

  • No para generación de texto, preguntas y respuestas abiertas, chat, traducción o resumen.
  • Solo texto. Sin imágenes, audio ni video.
  • No hay explicaciones ni justificaciones en la salida.
  • No para decisiones automatizadas únicas sobre crédito, empleo, vivienda, atención médica o derechos legales.
  • Las aplicaciones deben definir opciones, umbrales, rutas de escalamiento y supervisión humana.

Conclusiones clave

  • Microsoft-Decision-1 puntúa opciones fijas con probabilidades calibradas, no texto.
  • Entrenado posteriormente a partir de Qwen3.5-9B, con una ventana de contexto de 32,768 tokens.
  • Lidera la comparación de Microsoft de 36 benchmarks con un 83.5% de precisión y 85 ms p50.
  • Cuesta $0.042 por millón de tokens de entrada; los tokens de salida son gratuitos.
  • Las comparaciones de latencia están en disputa; los resultados independientes de JevBench están pendientes.


Echa un vistazo a la anuncio oficial, la ficha del modelo en Foundry y el listado en OpenRouter. Todo el mérito es del investigador de este proyecto. Además, no dudes en seguirnos en Twitter y no olvides unirte a nuestro SubReddit de ML con más de 150k y suscribirte a nuestro boletín. ¡Espera! ¿estás en telegram? ahora también puedes unirte a nosotros en telegram.

La entrada Microsoft AI Lanza Microsoft-Decision-1: Un Modelo de Puntuación de Decisiones Basado en Qwen3.5-9B apareció primero en MarkTechPost.

Fuente original

MarkTechPost

Notas sobre el contenido

La publicación original y los derechos pertenecen a la fuente.

Traducción automática · Consulte el original