Conway Research 推出的设备端助手 Underdog 已经 发布了 Saluki 27B 采用 Apache 2.0 许可证。黑马 Saluki 27B 是一个 2-bit 的 GGUF,源自 Qwen3.8-27B 能塞进 7.89 GB 的模型。完整 BF16 模型需要 54 GB。Underdog 针对压缩进行了调优,以保护工具调用能力——这项技能能把聊天模型变成智能体。对开发者而言,这意味着一个 27B 级别的智能体模型可以在 原版 llama.cpp.
内容速览
- 尺寸: 27B 稠密参数。GGUF 为 7.89 GB,而 BF16 为 54 GB。
- 运行于: 原版 llama.cpp 及基于它构建的应用,支持完整的 GPU 卸载。可选的 629 MB 或 928 MB 视觉扩展包。
- 性能: 在9个基准测试中平均保留96%的性能,对比完整的Qwen3.8-27B。
- 最佳: 并行工具调用,42(完整模型为35,保留率120%)。
- 最糟糕的是: AIME 2025,79.2 对 96.7(约82%的保持率)。
- 底线:
- 最好:在一个不到 8 GB 的文件中,工具调用性能胜过 54 GB 的原始版本。
- 最差:竞赛数学和多步推理下降了 12 到 18 分。
什么是 Underdog Saluki 27B?
Saluki 27B 是一个为本地代理构建的 Qwen3.8-27B 的 2 位混合精度 GGUF。 它叠加了 3 层工作:
- 基础是 Qwen3.8-27B,Qwen 团队的一个稠密 27B 模型。它有 64 层,将 Gated DeltaNet 线性注意力与门控注意力相结合,并支持 原生支持 262,144 个 token.
- 第二层是 ISTA-DASLab 的 Qwen3.8-27B-GSQ-RCO-GGUF. GSQ 为每个张量学习精确的低位标量网格。 RCO 在固定大小预算下为每个张量分配一种量化类型。ISTA最小的文件IQ2_XS为8.4 GB,即每个权重2.50比特。
- 第三层是Underdog自己的处理步骤。它将文件缩小到7.89 GB,并针对工具调用进行了优化。该文件被命名为
IQ2-mix并带有imatrix标签。Underdog尚未公布这一处理步骤的完整配方。
Saluki在基准测试中表现如何?
Underdog将其结果分为2组。
第一组在同一测试框架中运行了两个模型:
- Underdog Bench: 120个任务来自 BFCL v4的120个任务,在测试前已冻结。关闭思考模式,temperature为0。Saluki得分为88,完整模型为84,PrismML的Bonsai 2为70。
- 并行工具调用: 使用官方检查器进行100个BFCL v4并行任务。Saluki为42,完整模型为35。
- SWE-bench Verified: 50个问题。Saluki修复了30个,完整模型修复了33个。
第二组将Saluki与公开的全尺寸模型分数进行比较:
| 基准测试 | Saluki 27B | Qwen3.8-27B(公开) |
|---|---|---|
| IFEval (prompt-loose) | 93.5 | 91.5 |
| IFBench (prompt-loose) | 72.7 | 71.0 |
| MBPP+ | 78.0 | 83.9 |
| MuSR | 67.5 | 79.6 |
| AIME 2025(avg@4) | 79.2 | 96.7 |
| AIME 2026(avg@4) | 80.0 | 94.6 |
Saluki 与其他紧凑型 Qwen3.8-27B 构建相比表现如何?
| 特性 | Underdog Saluki 27B | Qwen3.8-27B(BF16) | ISTA GSQ-RCO IQ2_XS | PrismML Bonsai 2 27B(PTQ1_0) |
|---|---|---|---|---|
| 组织 | Underdog(Conway Research) | Qwen 团队 | ISTA-DASLab | PrismML |
| 参数量 | 27B | 27B | 27B | 27.36B |
| 文件大小 | 7.89 GB | 54 GB | 8.4 GB | 5.95 GB |
| 每权重比特数 | 未披露(2-bit 混合) | 16 | 2.50 | 1.75 |
| 上下文 | 未披露 | 262,144 原生 | 未披露 | 262K |
| 视觉 | 附加组件,629 或 928 MB | 原生 | 0.9 GB mmproj | 可选 0.63 GB |
| 运行时 | 原版 llama.cpp | Transformers、vLLM、SGLang | 原版 llama.cpp、Ollama、LM Studio | PrismML llama.cpp 分支 |
| Underdog Bench(共 120 项) | 88 | 84 | 未披露 | 70 |
| 厂商宣传数据 | 96% 平均保持率,9 项基准 | 基线 | 100.3% 零样本恢复 | FP16 的 98.2%,14 项基准 |
| 许可证 | Apache 2.0 | Apache 2.0 | Apache 2.0 | Apache 2.0 |
Bonsai 2 更小,并报告了 98.2% 的跨 14 项思考模式基准上报告了 98.2% 的保持率。它还取得了更强的数学成绩,包括 AIME25 上的 95.00。不过,它需要 PrismML 的 llama.cpp 分支,因为原版 llama.cpp 拒绝其打包格式。Saluki 可在原版 llama.cpp 上运行。各厂商使用自己的测试框架,因此跨厂商的分数不能直接比较。
要点
- Saluki 27B 将 Qwen3.8-27B 压缩到 7.89 GB,从 54 GB 降了下来。
- 它在工具调用上超过了完整模型:88 对 84。
- 并行工具调用从 35 升至 42。
- 数学和推理受到的影响最大,降至约 82 到 85%。
- 它以 Apache 2.0 许可在原版 llama.cpp 上运行。
请查看 Hugging Face 上的模型卡,以及 Underdog 发布页面 以及 在 X 上的公告。所有功劳归于该项目的研究者。另外,欢迎在 Twitter 上关注我们,别忘了加入我们的 150k+ML SubReddit 并订阅 我们的通讯。等等!你在用 Telegram 吗? 现在你也可以在 Telegram 上加入我们了。
这篇文章 认识 Underdog Saluki 27B:一个 2-bit 的 Qwen3.8-27B,在工具调用方面超越了原版 首发于 MarkTechPost.