MarkTechPost

认识一下逆袭者 Saluki 27B:一个 2-bit 量化的 Qwen3.8-27B,在工具调用上胜过原版

Conway Research的Underdog发布了2-bit量化的Saluki 27B,体积从54 GB降至7.89 GB,工具调用得分88超过原模型的84。但数学与推理下降,且未公布完整量化配方。

Conway Research 推出的设备端助手 Underdog 已经 发布了 Saluki 27B 采用 Apache 2.0 许可证。黑马 Saluki 27B 是一个 2-bit 的 GGUF,源自 Qwen3.8-27B 能塞进 7.89 GB 的模型。完整 BF16 模型需要 54 GB。Underdog 针对压缩进行了调优,以保护工具调用能力——这项技能能把聊天模型变成智能体。对开发者而言,这意味着一个 27B 级别的智能体模型可以在 原版 llama.cpp.

内容速览

  • 尺寸: 27B 稠密参数。GGUF 为 7.89 GB,而 BF16 为 54 GB。
  • 运行于: 原版 llama.cpp 及基于它构建的应用,支持完整的 GPU 卸载。可选的 629 MB 或 928 MB 视觉扩展包。
  • 性能: 在9个基准测试中平均保留96%的性能,对比完整的Qwen3.8-27B。
  • 最佳: 并行工具调用,42(完整模型为35,保留率120%)。
  • 最糟糕的是: AIME 2025,79.2 对 96.7(约82%的保持率)。
  • 底线:
    • 最好:在一个不到 8 GB 的文件中,工具调用性能胜过 54 GB 的原始版本。
    • 最差:竞赛数学和多步推理下降了 12 到 18 分。

什么是 Underdog Saluki 27B?

Saluki 27B 是一个为本地代理构建的 Qwen3.8-27B 的 2 位混合精度 GGUF。 它叠加了 3 层工作:

  • 基础是 Qwen3.8-27B,Qwen 团队的一个稠密 27B 模型。它有 64 层,将 Gated DeltaNet 线性注意力与门控注意力相结合,并支持 原生支持 262,144 个 token.
  • 第二层是 ISTA-DASLab 的 Qwen3.8-27B-GSQ-RCO-GGUF. GSQ 为每个张量学习精确的低位标量网格。 RCO 在固定大小预算下为每个张量分配一种量化类型。ISTA最小的文件IQ2_XS为8.4 GB,即每个权重2.50比特。
  • 第三层是Underdog自己的处理步骤。它将文件缩小到7.89 GB,并针对工具调用进行了优化。该文件被命名为 IQ2-mix 并带有imatrix标签。Underdog尚未公布这一处理步骤的完整配方。

Saluki在基准测试中表现如何?

Underdog将其结果分为2组。

第一组在同一测试框架中运行了两个模型:

  • Underdog Bench: 120个任务来自 BFCL v4的120个任务,在测试前已冻结。关闭思考模式,temperature为0。Saluki得分为88,完整模型为84,PrismML的Bonsai 2为70。
  • 并行工具调用: 使用官方检查器进行100个BFCL v4并行任务。Saluki为42,完整模型为35。
  • SWE-bench Verified: 50个问题。Saluki修复了30个,完整模型修复了33个。

第二组将Saluki与公开的全尺寸模型分数进行比较:

基准测试Saluki 27BQwen3.8-27B(公开)
IFEval (prompt-loose)93.591.5
IFBench (prompt-loose)72.771.0
MBPP+78.083.9
MuSR67.579.6
AIME 2025(avg@4)79.296.7
AIME 2026(avg@4)80.094.6

Saluki 与其他紧凑型 Qwen3.8-27B 构建相比表现如何?

特性Underdog Saluki 27BQwen3.8-27B(BF16)ISTA GSQ-RCO IQ2_XSPrismML Bonsai 2 27B(PTQ1_0)
组织Underdog(Conway Research)Qwen 团队ISTA-DASLabPrismML
参数量27B27B27B27.36B
文件大小7.89 GB54 GB8.4 GB5.95 GB
每权重比特数未披露(2-bit 混合)162.501.75
上下文未披露262,144 原生未披露262K
视觉附加组件,629 或 928 MB原生0.9 GB mmproj可选 0.63 GB
运行时原版 llama.cppTransformers、vLLM、SGLang原版 llama.cpp、Ollama、LM StudioPrismML llama.cpp 分支
Underdog Bench(共 120 项)8884未披露70
厂商宣传数据96% 平均保持率,9 项基准基线100.3% 零样本恢复FP16 的 98.2%,14 项基准
许可证Apache 2.0Apache 2.0Apache 2.0Apache 2.0

Bonsai 2 更小,并报告了 98.2% 的跨 14 项思考模式基准上报告了 98.2% 的保持率。它还取得了更强的数学成绩,包括 AIME25 上的 95.00。不过,它需要 PrismML 的 llama.cpp 分支,因为原版 llama.cpp 拒绝其打包格式。Saluki 可在原版 llama.cpp 上运行。各厂商使用自己的测试框架,因此跨厂商的分数不能直接比较。

要点

  • Saluki 27B 将 Qwen3.8-27B 压缩到 7.89 GB,从 54 GB 降了下来。
  • 它在工具调用上超过了完整模型:88 对 84。
  • 并行工具调用从 35 升至 42。
  • 数学和推理受到的影响最大,降至约 82 到 85%。
  • 它以 Apache 2.0 许可在原版 llama.cpp 上运行。


请查看 Hugging Face 上的模型卡,以及 Underdog 发布页面 以及 在 X 上的公告。所有功劳归于该项目的研究者。另外,欢迎在 Twitter 上关注我们,别忘了加入我们的 150k+ML SubReddit 并订阅 我们的通讯。等等!你在用 Telegram 吗? 现在你也可以在 Telegram 上加入我们了。

这篇文章 认识 Underdog Saluki 27B:一个 2-bit 的 Qwen3.8-27B,在工具调用方面超越了原版 首发于 MarkTechPost.

原始出处

MarkTechPost

内容说明

原始发布及相关权利归来源方。

机器翻译 · 请以原文为准