Microsoft 发布了 Microsoft-Decision-1,一个用于路由、分类、验证和智能体控制的决策模型。Microsoft-Decision-1 是一个决策评分模型,它为每个固定答案选项返回一个经过校准的概率,而不是生成文本。它 由阿里巴巴的 Qwen3.5-9B 后训练而来 ,现已在 Microsoft Foundry 和 OpenRouter. .
TL;DR
- 规模: 基于 Qwen3.5-9B 构建;确切参数数量未披露。32,768 token 上下文窗口。
- 运行方式: 仅限托管 API(Microsoft Foundry,通过 Azure 的 OpenRouter)。无开放权重,无量化变体,硬件未披露。
- 性能: 在 Microsoft 的 36 项基准比较中平均准确率最高,p50 延迟为 85 ms。
- 最佳: 在 36 项基准上平均准确率为 83.5%,领先于 81.9% 的 Quyet-1.0-Large。
- 最差: 校准得分为 92.2,仅次于 93.1 的 Quyet-1.0-Large。仅支持文本,无解释。
- 结论:
- 最好之处:以每百万输入 token 0.042 美元且输出免费的价格实现快速、廉价、经过校准的决策。
- 最差之处:权重闭源,且所有基准均由厂商自行运行。
- 最好之处:以每百万输入 token 0.042 美元且输出免费的价格实现快速、廉价、经过校准的决策。
什么是决策模型?
决策模型读取输入并对一组封闭的选项进行评分。它不撰写散文。Microsoft 将决策模型定位为一个全新的 AI 类别,专为软件可以立即执行的输出而构建。
Microsoft-Decision-1 是如何工作的?
Microsoft 对 Qwen3.5-9B 进行了后训练,用于单次通过式决策评分. 在给定情境、问题和固定选项的情况下,它可以在一次调用中为每个选项返回一个概率。它计划将未来版本迁移到基于MAI和OpenAI模型的基础上。
该 Foundry 模型卡 列出支持的格式:
- 是/否、多选题、评分、分类和量规类问题
- AI 回复及所提议代理操作的评分
- 针对所提供证据的接地性检查
- 诸如“无法判断”之类的明确弃权选项
训练使用了在微软开放数据流程下提供的公开数据集以及合成数据。输出为JSON。 OpenRouter 说明 权重持续更新,而 API 形状保持不变。
它的速度和准确性如何?
微软对9个系统进行了比较 36项基准测试,共147,137个问题。基准测试在训练期间保持盲测。Microsoft-Decision-1以平均83.5%的准确率领先。
其 p50 延迟为 85 ms,p95 为 125 ms。这就是 比 Quyet-1.0-Large 快4.5倍,比 GPT-6 Sol 快35倍耗时 3.01 秒。
Microsoft 还测试了鲁棒性。它以 8 种方式扰动每个请求,包括改述和选项打乱。该模型 在平均 1.3% 的扰动中改变了其决策 。当选项被改述、反转或打乱时,翻转次数为零。
在安全方面,Microsoft 在 11 个基准上运行了 5,250 个请求。这些基准涵盖有害内容、越狱和提示注入。Microsoft 报告称其能正确拒绝请求并保持较高的实用性,但未公布分数。
Microsoft 报告的内部结果
- Xbox Research: 整理了 10,000 多条反馈项,速度比 GPT-6 Sol 快 14 倍,成本低 200 倍。
- Copilot 质量控制: 与 GPT5.6 Luna 相当,且快 100 倍。
- Microsoft Discovery: 一致性比 LLM 评分高 46 倍,速度快 3 倍。
它与其他决策模型相比如何?
| 特性 | Microsoft-Decision-1 | Quyet-1.0-Large | H2O-Lightning-4B | GPT-6 Luna Decisions |
|---|---|---|---|---|
| 开发者 | 微软 | Chinh Nguyen | H2O.ai | OpenAI |
| 基础模型 | Qwen3.5-9B | Gemma-4-31B-it(已合并 LoRA) | Qwen3.5-4B | 未披露 |
| 参数量 | 未披露 | 31.3B | 4B | 未披露 |
| 上下文 / 输入 | 32,768 tokens | 8,000-token 提示词(6,000 状态) | 40,960(vLLM serve 设置) | 未披露 |
| 许可证 | 专有 API | Apache-2.0 | Apache-2.0 | 专有 API |
| 模态 | 文本 | 文本 | 文本与图像 | 文本与图像 |
| 硬件 | 托管(Azure) | 1x 80 GB GPU,bf16 | 已测试 32 GB GPU;权重为 9.1 GB | 托管 |
| 准确率(Microsoft,36 项基准测试) | 83.5% | 81.9% | 77.2% | 79.4% |
| 校准(Microsoft) | 92.2 | 93.1 | 91.8 | 89.9 |
| Microsoft 图表中的中位延迟 | 85 毫秒 | 380 毫秒 | 210 毫秒 | 300 毫秒 |
| 价格 | 输入 $0.042/百万,输出免费 | 自托管 | 自托管 | 输入 $0.10/百万,输出免费 |
准确率、校准和延迟数据行来自 Microsoft 的图表。其中竞争对手的延迟采用 JevBench v1.6.1 的调整后中位数。
延迟对比是同类比较吗?
不完全是。Microsoft 通过 Foundry 测量了其自家的模型。竞争对手的数据采用的是 JevBench 的调整后中位数,而非原始计时。
H2O.ai 的模型卡 对此提出异议。该模型卡指出,JevBench 的调整后数值将实测时间翻倍并额外增加 0.15 秒。H2O 表示其模型的实测中位数为 29 毫秒,而不是 210 毫秒。Microsoft-Decision-1 并未出现在 JevBench 排行榜上。在该榜单的官方综合评分中, H2O-Lightning-4B 排名 #1,得分为 72.5.
开发者如何部署它?
开发人员可以从 Microsoft Foundry 以正式发布的“Direct from Azure”模型形式调用它。在 OpenRouter上,它运行于 Decisions API,而不是聊天端点。聊天补全 SDK 将无法使用。
定价为 每百万输入 token 0.042,输出免费。OpenAI 的 Luna decisions 端点 每百万输入 token 收费 0.10.
有哪些限制?
该 模型卡 明确说明:
- 不用于文本生成、开放式问答、聊天、翻译或摘要。
- 仅支持文本。不支持图像、音频或视频。
- 输出中不得包含解释或理由。
- 不得用于信贷、就业、住房、医疗或法律权利的单独自动化决策。
- 应用必须定义选项、阈值、升级路径和人工监督。
关键要点
- Microsoft-Decision-1 以校准的概率对固定选项进行评分,而非文本。
- 由 Qwen3.5-9B 后训练而成,具有 32,768 token 的上下文窗口。
- 在微软的 36 项基准对比中以 83.5% 的准确率和 85 ms p50 领先。
- 每百万输入 token 成本为 $0.042;输出 token 免费。
- 延迟对比存在争议;独立的 JevBench 结果尚待公布。
请查看 官方公告、 Foundry 模型卡 和 OpenRouter 页面。所有功劳归于该项目的研究者。此外,欢迎在 Twitter 上关注我们,并别忘了加入我们的 150k+ML SubReddit 以及订阅 我们的通讯。等等!你在用 telegram 吗? 现在你也可以在 telegram 上加入我们了。
本文 微软 AI 发布 Microsoft-Decision-1:一个基于 Qwen3.5-9B 的决策评分模型 首发于 MarkTechPost.