MarkTechPost

Microsoft AI 发布 Microsoft-Decision-1:一个基于 Qwen3.5-9B 的决策评分模型

微软发布Microsoft-Decision-1,由Qwen3.5-9B后训练,对固定选项输出校准概率而非生成文本。厂商自测36项基准平均准确率83.5%、p50延迟85 ms;但模型闭源,基准均由厂商运行,延迟对比存争议。

Microsoft 发布了 Microsoft-Decision-1,一个用于路由、分类、验证和智能体控制的决策模型。Microsoft-Decision-1 是一个决策评分模型,它为每个固定答案选项返回一个经过校准的概率,而不是生成文本。它 由阿里巴巴的 Qwen3.5-9B 后训练而来 ,现已在 Microsoft Foundry 和 OpenRouter. .

TL;DR

  • 规模: 基于 Qwen3.5-9B 构建;确切参数数量未披露。32,768 token 上下文窗口。
  • 运行方式: 仅限托管 API(Microsoft Foundry,通过 Azure 的 OpenRouter)。无开放权重,无量化变体,硬件未披露。
  • 性能: 在 Microsoft 的 36 项基准比较中平均准确率最高,p50 延迟为 85 ms。
  • 最佳: 在 36 项基准上平均准确率为 83.5%,领先于 81.9% 的 Quyet-1.0-Large。
  • 最差: 校准得分为 92.2,仅次于 93.1 的 Quyet-1.0-Large。仅支持文本,无解释。
  • 结论:
    • 最好之处:以每百万输入 token 0.042 美元且输出免费的价格实现快速、廉价、经过校准的决策。
      • 最差之处:权重闭源,且所有基准均由厂商自行运行。

什么是决策模型?

决策模型读取输入并对一组封闭的选项进行评分。它不撰写散文。Microsoft 将决策模型定位为一个全新的 AI 类别,专为软件可以立即执行的输出而构建。

Microsoft-Decision-1 是如何工作的?

Microsoft 对 Qwen3.5-9B 进行了后训练,用于单次通过式决策评分. 在给定情境、问题和固定选项的情况下,它可以在一次调用中为每个选项返回一个概率。它计划将未来版本迁移到基于MAI和OpenAI模型的基础上。

该 Foundry 模型卡 列出支持的格式:

  • 是/否、多选题、评分、分类和量规类问题
  • AI 回复及所提议代理操作的评分
  • 针对所提供证据的接地性检查
  • 诸如“无法判断”之类的明确弃权选项

训练使用了在微软开放数据流程下提供的公开数据集以及合成数据。输出为JSON。 OpenRouter 说明 权重持续更新,而 API 形状保持不变。

它的速度和准确性如何?

微软对9个系统进行了比较 36项基准测试,共147,137个问题。基准测试在训练期间保持盲测。Microsoft-Decision-1以平均83.5%的准确率领先。

其 p50 延迟为 85 ms,p95 为 125 ms。这就是 比 Quyet-1.0-Large 快4.5倍,比 GPT-6 Sol 快35倍耗时 3.01 秒。

Microsoft 还测试了鲁棒性。它以 8 种方式扰动每个请求,包括改述和选项打乱。该模型 在平均 1.3% 的扰动中改变了其决策 。当选项被改述、反转或打乱时,翻转次数为零。

在安全方面,Microsoft 在 11 个基准上运行了 5,250 个请求。这些基准涵盖有害内容、越狱和提示注入。Microsoft 报告称其能正确拒绝请求并保持较高的实用性,但未公布分数。

Microsoft 报告的内部结果

  • Xbox Research: 整理了 10,000 多条反馈项,速度比 GPT-6 Sol 快 14 倍,成本低 200 倍。
  • Copilot 质量控制: 与 GPT5.6 Luna 相当,且快 100 倍。
  • Microsoft Discovery: 一致性比 LLM 评分高 46 倍,速度快 3 倍。

它与其他决策模型相比如何?

特性Microsoft-Decision-1Quyet-1.0-LargeH2O-Lightning-4BGPT-6 Luna Decisions
开发者微软Chinh NguyenH2O.aiOpenAI
基础模型Qwen3.5-9BGemma-4-31B-it(已合并 LoRA)Qwen3.5-4B未披露
参数量未披露31.3B4B未披露
上下文 / 输入32,768 tokens8,000-token 提示词(6,000 状态)40,960(vLLM serve 设置)未披露
许可证专有 APIApache-2.0Apache-2.0专有 API
模态文本文本文本与图像文本与图像
硬件托管(Azure)1x 80 GB GPU,bf16已测试 32 GB GPU;权重为 9.1 GB托管
准确率(Microsoft,36 项基准测试)83.5%81.9%77.2%79.4%
校准(Microsoft)92.293.191.889.9
Microsoft 图表中的中位延迟85 毫秒380 毫秒210 毫秒300 毫秒
价格输入 $0.042/百万,输出免费自托管自托管输入 $0.10/百万,输出免费

准确率、校准和延迟数据行来自 Microsoft 的图表。其中竞争对手的延迟采用 JevBench v1.6.1 的调整后中位数。

延迟对比是同类比较吗?

不完全是。Microsoft 通过 Foundry 测量了其自家的模型。竞争对手的数据采用的是 JevBench 的调整后中位数,而非原始计时。

H2O.ai 的模型卡 对此提出异议。该模型卡指出,JevBench 的调整后数值将实测时间翻倍并额外增加 0.15 秒。H2O 表示其模型的实测中位数为 29 毫秒,而不是 210 毫秒。Microsoft-Decision-1 并未出现在 JevBench 排行榜上。在该榜单的官方综合评分中, H2O-Lightning-4B 排名 #1,得分为 72.5.

开发者如何部署它?

开发人员可以从 Microsoft Foundry 以正式发布的“Direct from Azure”模型形式调用它。在 OpenRouter上,它运行于 Decisions API,而不是聊天端点。聊天补全 SDK 将无法使用。

定价为 每百万输入 token 0.042,输出免费。OpenAI 的 Luna decisions 端点 每百万输入 token 收费 0.10.

有哪些限制?

该 模型卡 明确说明:

  • 不用于文本生成、开放式问答、聊天、翻译或摘要。
  • 仅支持文本。不支持图像、音频或视频。
  • 输出中不得包含解释或理由。
  • 不得用于信贷、就业、住房、医疗或法律权利的单独自动化决策。
  • 应用必须定义选项、阈值、升级路径和人工监督。

关键要点

  • Microsoft-Decision-1 以校准的概率对固定选项进行评分,而非文本。
  • 由 Qwen3.5-9B 后训练而成,具有 32,768 token 的上下文窗口。
  • 在微软的 36 项基准对比中以 83.5% 的准确率和 85 ms p50 领先。
  • 每百万输入 token 成本为 $0.042;输出 token 免费。
  • 延迟对比存在争议;独立的 JevBench 结果尚待公布。


请查看 官方公告、 Foundry 模型卡 和 OpenRouter 页面。所有功劳归于该项目的研究者。此外,欢迎在 Twitter 上关注我们,并别忘了加入我们的 150k+ML SubReddit 以及订阅 我们的通讯。等等!你在用 telegram 吗? 现在你也可以在 telegram 上加入我们了。

本文 微软 AI 发布 Microsoft-Decision-1:一个基于 Qwen3.5-9B 的决策评分模型 首发于 MarkTechPost.

原始出处

MarkTechPost

内容说明

原始发布及相关权利归来源方。

机器翻译 · 请以原文为准