Nace.AI 已经 开源了 Drex 1.5,这是一个面向智能体和后端工作流的 9B 决策模型。Drex 1.5 决策模型不生成文本。它读取一个状态和带类型的问题,然后为每个选项返回一个概率。Nace 报告其在公开榜单上得分为 58.08 Decision Index 0.3.1上得分为 58.08,是 10B 参数以下的最高分。权重已发布在 Hugging Face 上,托管版本已在 OpenRouter.
TL;DR
- 规模: 8.95B 参数(稠密),bf16 权重约 18 GB。上下文默认为 16,384 个 token,最高可达 131,072。
- 运行环境: bf16 下 1 块 CUDA GPU(在 24 GB A10G 上测试过)。Q8_0 GGUF(约 9.5 GB)可在 Apple 芯片和 CPU 上运行。
- 性能: 在公开的 Decision Index 0.3.1 上得分为 58.08,处于与 Jev 1.13.0(57.96)并列的评审委员会并列区间内。
- 最佳表现: 在 32K 到 128K token 的文档上准确率为 93.4%。
- 最差表现: 在 ACOS 方面情感分析上每项评审 F1 为 7.4%,而 Jev 为 29.5%。
- 结论:
- 最佳:在 1 块 GPU 上即可匹敌闭源模型的开源权重。
- 最差:在广泛知识和细粒度情感方面表现较弱。
什么是 Drex 1.5?
Drex 1.5 是 Nace.AI 推出的一个决策模型,可在 1 次前向传播中为一组固定选项打分。你发送一个 state (文本或 JSON)和命名的问题。它支持 3 种问题类型: choice, noul (是/否)和顺序型 score。由于不采样任何 token,因此 temperature 和 top_p 不适用。该模型只能以你提供的选项作答。
它提供 POST /v1/systemone API 服务。这与以下工具所使用的请求格式相同 TypeSafe 的 Jev,开启这一类别的闭源模型。Nace 表示,现有的 Jev 客户端只需修改几个环境变量即可继续工作。
Drex 1.5 是如何工作的?
其骨干是 MiMo-V2.6-Distill-Qwen-9B,一个从 Qwen 3.5 9B 蒸馏而来的 9B 模型。它有 32 个层并采用混合注意力机制:每个全注意力层对应 3 个线性注意力层。一个单独的指针头(head.pt)从骨干的隐藏状态为每个选项打分。
每个问题对状态运行 1 次前向传播再加上该问题。在 llama.cpp 中,状态只编码一次并在各问题之间共享。Nace 的 Drex 页面 称该模型在 index 基准的官方训练集上训练,仅在留出的测试集上进行评估。
Drex 1.5 在基准测试中的表现如何?
在公开的 Decision Index 0.3.1(37 项基准,经机会校正)上, 模型卡片 报告:
- Drex 1.5: 58.08
- Jev 1.13.0: 57.96
- Bespoke Nimble 9B v3: 57.19
- Cloudflare clef-flash: 56.15
Drex 1.5、Jev 和 Nimble 落在该榜单 0.9 分的平局区间内。Drex 在 37 项基准中有 20 项领先 Jev。Drex 的分数来自 Nace 使用官方工具包自己运行的测试。其领域得分在 Tools(75.0)最强,在 Knowledge and Reasoning(44.6)最弱。Nace 的发布图表使用较旧的 Decision Index 0.2.1,其中 Drex 得分为 58.28,Jev 为 57.91。
在 JevBench(231 个公开项目)上,Drex 得分 86.2%,Jev 为 87.0%。两者在高难度项目上均达到 73.9%。在跨越 8 个 OpenSpiel 游戏的对决中,Drex 对 Jev 取得 122 胜、47 平和 87 负(56.8%)。
长文档是其明显优势:
- 8K 到 32K tokens: 准确率 89.5%,中位数 0.65 秒
- 32K 到 128K tokens: 准确率 93.4%,中位数 2.0 秒
将同样的请求截断到 8K tokens 会使准确率降至 76.5% 和 78%。
开发者如何运行 Drex 1.5?
共有 4 种部署路径,全部提供相同的 API:
- Python(Kev 运行时):
inference.py以及serve.py(运行于 CUDA GPU 上)。 - llama.cpp: 一个 Nace fork ,使用 bf16 或 Q8_0 的 GGUF,可在 CUDA、Metal 或 CPU 上运行。
- Ollama: 一个 Nace fork ,它添加了
decision功能。 - 托管服务: OpenRouter 列出的价格为每 1M 输入 token 0.04 美元、输出 0 美元,由 DeepInfra 提供服务。Nace 也运营自己的 Console API.
Nace 在 AWS g5.2xlarge(A10G 24 GB)上测试了 bf16 和 Q8_0,得到了完全相同的答案。Q8_0 GGUF 在 Apple M5 Pro 上的 Metal 和 CPU 两种模式下也结果一致。
一个 Drex agent skill 可将该模型接入 Claude Code、Codex、Cursor、OpenCode、Hermes Agent、Gemini CLI 和 GitHub Copilot。Nace 的 发布文章 还为云用户提供了 25 美元的注册奖励。
Drex 1.5 与其他决策模型相比如何?
| 特性 | Drex 1.5 | Jev 1.13.0 | Bespoke Nimble 9B v3 |
|---|---|---|---|
| 开发者 | Nace.AI | TypeSafe AI | Bespoke Labs |
| 参数量 | 8.95B | 未披露 | 在 Qwen3.5-9B 上使用 LoRA |
| 权重 | 开放 | 闭源(仅限 API) | 开放(适配器) |
| 许可证 | Nace.AI Open RAIL-M | 专有 | CC BY-NC 4.0 |
| 上下文 | 默认 16,384,最高可达 131,072 | 每次请求 64K,32K 状态加最长问题 | 未披露 |
| Decision Index 0.3.1(公开) | 58.08 | 57.96 | 57.19 |
| Decision Index 0.2.1 | 58.28 | 57.91 | 56.88 |
| JevBench(231项) | 86.2% | 87.0% | 未披露 |
| 本地硬件 | 1块CUDA GPU(bf16)、Apple silicon或CPU(Q8_0) | 不适用 | Qwen3.5-9B基座加适配器 |
| API 价格(每 1M 输入 / 输出) | $0.04 / $0(OpenRouter) | $0.042 / $0 | 未披露 |
Decision Index 0.3.1的数据来自Drex 1.5模型卡,该模型卡引用了Jev和Nimble的公开排行榜。Nimble的0.2.1分数来自其自身的模型卡。
有哪些局限性?
Drex 1.5是一个决策层,而非通用模型。它无法生成文本、代码或解释。知识密集型测试是它的弱项:GPQA Diamond上为45.4%,而Jev为78.6%;MMLU-Pro上为58.7%,而后者为82.7%。
在索引基准的训练集上进行训练有助于它应对熟悉的决策类型。在新领域上的结果可能有所不同。通过Ollama和llama.cpp进行本地部署需要使用Nace的分支,而非主线版本。权重采用带使用限制的RAIL-M许可证,因此在商业使用前请查阅相关条款。
要点总结
- Drex 1.5是一个9B开源决策模型,可在1次推理中对选项评分。
- 它在Decision Index 0.3.1上得分58.08,与闭源的Jev 1.13.0持平。
- 长文档准确率在32K至128K token时达到93.4%。
- 它可以在1块GPU上运行,或在Mac上以9.5 GB的Q8_0 GGUF运行。
- 弱项:GPQA Diamond(45.4%)和ACOS情感分析(7.4%)。
欢迎查看 Hugging Face上的模型权重、 GitHub仓库 以及 Drex产品页面。所有功劳归于该项目的研究者。此外,欢迎在 Twitter 上关注我们,别忘了加入我们的 150k+ML SubReddit 并订阅 我们的新闻通讯等等!你在用 Telegram 吗? 现在你也可以在 Telegram 上加入我们了。
文章《 Nace AI 开源 Drex 1.5:一个为选项而非文本打分的 9B 决策模型 首发于 MarkTechPost.