Conway ResearchのオンデバイスアシスタントであるUnderdogは、 Saluki 27Bを Apache 2.0の下で提供されています。Underdog Saluki 27Bは、次の2ビットGGUFです。 Qwen3.8-27B の2ビットGGUFで、7.89 GBに収まります。完全なBF16モデルには54 GBが必要です。Underdogは、チャットモデルをエージェントに変えるスキルであるツール呼び出しを保護するよう圧縮を調整しました。開発者にとって、これは27Bクラスのエージェントモデルが ストックのllama.cpp.
TL;DR
- サイズ: 27Bのデンスパラメータ。7.89 GBのGGUFに対し、BF16では54 GB。
- 動作環境: ストックのllama.cppおよびそれを基盤とするアプリで、フルGPUオフロードに対応。オプションで629 MBまたは928 MBのビジョンアドオンも利用可能。
- 性能: 完全なQwen3.8-27Bと比較して、9つのベンチマークで平均96%の維持率。
- 最良: 並列ツール呼び出し、42対35でフルモデルを上回る(120%の維持率)。
- 最悪: AIME 2025、79.2対96.7(約82%の維持率)。
- 結論:
- 最良: 8 GB未満のファイルで、ツール呼び出しにおいて54 GBのオリジナルを上回る。
- 最悪: 競技数学と多段階推論は12〜18ポイント低下する。
Underdog Saluki 27Bとは?
Saluki 27Bは、ローカルエージェント向けに構築されたQwen3.8-27Bの2ビット混合精度GGUFです。 3層の処理を重ねています:
- ベースは、Qwenチームによるデンスな27BモデルであるQwen3.8-27Bです。64層を持ち、Gated DeltaNet線形注意とゲート付き注意を組み合わせ、ネイティブで 262,144トークンに対応します.
- 第2層はISTA-DASLabの Qwen3.8-27B-GSQ-RCO-GGUF. GSQ は、テンソルごとに正確な低ビットのスカラーグリッドを学習します。 RCO 固定のサイズ予算の下で各テンソルに量子化タイプを割り当てます。ISTAの最小ファイルであるIQ2_XSは、2.50ビット/重みで8.4 GBです。
- 第3層はUnderdog自身のパスです。ファイルを7.89 GBまで縮小し、ツール呼び出しをターゲットとしました。ファイル名は
IQ2-mixまた、imatrixタグが付与されています。Underdogは、このパスの完全なレシピを公開していません。
Salukiはベンチマークでどのような性能を示しますか?
Underdogはその結果を2つのグループに分けています。
最初のグループは、両方のモデルを同じハーネスで実行しました。:
- ダークホース・ベンチ: 120件のタスク( BFCL v4、テスト前に凍結。Thinking off、temperature 0。Salukiは88、フルモデルは84、PrismMLのBonsai 2は70をスコアした。
- 並列ツール呼び出し: 100 BFCL v4の並列タスクを公式チェッカーで実行。Salukiは42、フルモデルは35。
- SWE-bench Verified: 50件中、Salukiは30件を修正、フルモデルは33件を修正。
2番目のグループは、Salukiを公開されているフルサイズのスコアと比較します:
| ベンチマーク | Saluki 27B | Qwen3.8-27B(公開版) |
|---|---|---|
| IFEval (prompt-loose) | 93.5 | 91.5 |
| IFBench(prompt-loose) | 72.7 | 71.0 |
| MBPP+ | 78.0 | 83.9 |
| MuSR | 67.5 | 79.6 |
| AIME 2025 (avg@4) | 79.2 | 96.7 |
| AIME 2026 (avg@4) | 80.0 | 94.6 |
Saluki は他のコンパクトな Qwen3.8-27B ビルドと比べてどうですか?
| 機能 | Underdog Saluki 27B | Qwen3.8-27B (BF16) | ISTA GSQ-RCO IQ2_XS | PrismML Bonsai 2 27B (PTQ1_0) |
|---|---|---|---|---|
| 組織 | Underdog (Conway Research) | Qwen チーム | ISTA-DASLab | PrismML |
| パラメータ数 | 27B | 27B | 27B | 27.36B |
| ファイルサイズ | 7.89 GB | 54 GB | 8.4 GB | 5.95 GB |
| 重みあたりビット数 | 非公開(2ビットのミックス) | 16 | 2.50 | 1.75 |
| コンテキスト | 非公開 | ネイティブで 262,144 | 非公開 | 262K |
| ビジョン | アドオン、629 または 928 MB | ネイティブ | 0.9 GB mmproj | オプションで 0.63 GB |
| ランタイム | ストックの llama.cpp | Transformers、vLLM、SGLang | ストックの llama.cpp、Ollama、LM Studio | PrismML llama.cpp フォーク |
| Underdog Bench(120問中) | 88 | 84 | 非公開 | 70 |
| ベンダーの目玉数値 | 96% 平均維持率、9ベンチマーク | ベースライン | 100.3% ゼロショット回復率 | FP16の98.2%、14ベンチマーク |
| ライセンス | Apache 2.0 | Apache 2.0 | Apache 2.0 | Apache 2.0 |
Bonsai 2 はより小さく、全体で 98.2% の保持率を報告しています 14の思考モードベンチマークで98.2%の維持率を報告しています。また、AIME25で95.00を記録するなど、数学においてより強い結果を出しています。ただし、ストックの llama.cpp はそのパッキング形式を拒否するため、PrismML の llama.cpp フォークが必要です。Saluki はストックの llama.cpp で動作します。各ベンダーは独自のハーネスを使用しているため、ベンダー間のスコアは直接比較できません。
重要なポイント
- Saluki 27B は Qwen3.8-27B を 54 GB から 7.89 GB に圧縮します。
- ツール呼び出しではフルモデルを上回ります:88 対 84。
- 並列ツール呼び出しは 35 から 42 に増加します。
- 数学と推論が最も大きな打撃を受け、約82〜85%まで低下します。
- Apache 2.0 の下でストックの llama.cpp で動作します。
ぜひご覧ください: Hugging Face のモデルカード、そして アンダードッグのローンチページ 「and the」 Xでの発表。このプロジェクトの研究者に全ての功績があります。また、ぜひ私たちをフォローしてください Twitter そして、私たちの 150k+ML SubReddit そして登録してください 弊社ニュースレター。待ってください!Telegram(テレグラム)を使っていますか? Telegramでもご参加いただけるようになりました。
この投稿 Underdog Saluki 27B に会おう:ツール呼び出しでオリジナルを上回る 2 ビットの Qwen3.8-27B 初出: MarkTechPost.