MarkTechPost

アンダードッグSaluki 27Bのご紹介: ツール呼び出しでオリジナルを上回る2ビット版Qwen3.8-27B

Underdog Saluki 27Bは、7.89 GBのQwen3.8-27Bの2ビットGGUFで、Apache 2.0で公開されています。ツール呼び出しでは54 GBのオリジナルを上回る一方、競技数学と推論では劣ります。本記事「Meet the Underdog Saluki 27B: A 2-bit Qwen3.8-27B That Beats the Original at Tool…

Conway ResearchのオンデバイスアシスタントであるUnderdogは、 Saluki 27Bを Apache 2.0の下で提供されています。Underdog Saluki 27Bは、次の2ビットGGUFです。 Qwen3.8-27B の2ビットGGUFで、7.89 GBに収まります。完全なBF16モデルには54 GBが必要です。Underdogは、チャットモデルをエージェントに変えるスキルであるツール呼び出しを保護するよう圧縮を調整しました。開発者にとって、これは27Bクラスのエージェントモデルが ストックのllama.cpp.

TL;DR

  • サイズ: 27Bのデンスパラメータ。7.89 GBのGGUFに対し、BF16では54 GB。
  • 動作環境: ストックのllama.cppおよびそれを基盤とするアプリで、フルGPUオフロードに対応。オプションで629 MBまたは928 MBのビジョンアドオンも利用可能。
  • 性能: 完全なQwen3.8-27Bと比較して、9つのベンチマークで平均96%の維持率。
  • 最良: 並列ツール呼び出し、42対35でフルモデルを上回る(120%の維持率)。
  • 最悪: AIME 2025、79.2対96.7(約82%の維持率)。
  • 結論:
    • 最良: 8 GB未満のファイルで、ツール呼び出しにおいて54 GBのオリジナルを上回る。
    • 最悪: 競技数学と多段階推論は12〜18ポイント低下する。

Underdog Saluki 27Bとは?

Saluki 27Bは、ローカルエージェント向けに構築されたQwen3.8-27Bの2ビット混合精度GGUFです。 3層の処理を重ねています:

  • ベースは、Qwenチームによるデンスな27BモデルであるQwen3.8-27Bです。64層を持ち、Gated DeltaNet線形注意とゲート付き注意を組み合わせ、ネイティブで 262,144トークンに対応します.
  • 第2層はISTA-DASLabの Qwen3.8-27B-GSQ-RCO-GGUF. GSQ は、テンソルごとに正確な低ビットのスカラーグリッドを学習します。 RCO 固定のサイズ予算の下で各テンソルに量子化タイプを割り当てます。ISTAの最小ファイルであるIQ2_XSは、2.50ビット/重みで8.4 GBです。
  • 第3層はUnderdog自身のパスです。ファイルを7.89 GBまで縮小し、ツール呼び出しをターゲットとしました。ファイル名は IQ2-mix また、imatrixタグが付与されています。Underdogは、このパスの完全なレシピを公開していません。

Salukiはベンチマークでどのような性能を示しますか?

Underdogはその結果を2つのグループに分けています。

最初のグループは、両方のモデルを同じハーネスで実行しました。:

  • ダークホース・ベンチ: 120件のタスク( BFCL v4、テスト前に凍結。Thinking off、temperature 0。Salukiは88、フルモデルは84、PrismMLのBonsai 2は70をスコアした。
  • 並列ツール呼び出し: 100 BFCL v4の並列タスクを公式チェッカーで実行。Salukiは42、フルモデルは35。
  • SWE-bench Verified: 50件中、Salukiは30件を修正、フルモデルは33件を修正。

2番目のグループは、Salukiを公開されているフルサイズのスコアと比較します:

ベンチマークSaluki 27BQwen3.8-27B(公開版)
IFEval (prompt-loose)93.591.5
IFBench(prompt-loose)72.771.0
MBPP+78.083.9
MuSR67.579.6
AIME 2025 (avg@4)79.296.7
AIME 2026 (avg@4)80.094.6

Saluki は他のコンパクトな Qwen3.8-27B ビルドと比べてどうですか?

機能Underdog Saluki 27BQwen3.8-27B (BF16)ISTA GSQ-RCO IQ2_XSPrismML Bonsai 2 27B (PTQ1_0)
組織Underdog (Conway Research)Qwen チームISTA-DASLabPrismML
パラメータ数27B27B27B27.36B
ファイルサイズ7.89 GB54 GB8.4 GB5.95 GB
重みあたりビット数非公開(2ビットのミックス)162.501.75
コンテキスト非公開ネイティブで 262,144非公開262K
ビジョンアドオン、629 または 928 MBネイティブ0.9 GB mmprojオプションで 0.63 GB
ランタイムストックの llama.cppTransformers、vLLM、SGLangストックの llama.cpp、Ollama、LM StudioPrismML llama.cpp フォーク
Underdog Bench(120問中)8884非公開70
ベンダーの目玉数値96% 平均維持率、9ベンチマークベースライン100.3% ゼロショット回復率FP16の98.2%、14ベンチマーク
ライセンスApache 2.0Apache 2.0Apache 2.0Apache 2.0

Bonsai 2 はより小さく、全体で 98.2% の保持率を報告しています 14の思考モードベンチマークで98.2%の維持率を報告しています。また、AIME25で95.00を記録するなど、数学においてより強い結果を出しています。ただし、ストックの llama.cpp はそのパッキング形式を拒否するため、PrismML の llama.cpp フォークが必要です。Saluki はストックの llama.cpp で動作します。各ベンダーは独自のハーネスを使用しているため、ベンダー間のスコアは直接比較できません。

重要なポイント

  • Saluki 27B は Qwen3.8-27B を 54 GB から 7.89 GB に圧縮します。
  • ツール呼び出しではフルモデルを上回ります:88 対 84。
  • 並列ツール呼び出しは 35 から 42 に増加します。
  • 数学と推論が最も大きな打撃を受け、約82〜85%まで低下します。
  • Apache 2.0 の下でストックの llama.cpp で動作します。


ぜひご覧ください: Hugging Face のモデルカード、そして アンダードッグのローンチページ 「and the」 Xでの発表。このプロジェクトの研究者に全ての功績があります。また、ぜひ私たちをフォローしてください Twitter そして、私たちの 150k+ML SubReddit そして登録してください 弊社ニュースレター。待ってください!Telegram(テレグラム)を使っていますか? Telegramでもご参加いただけるようになりました。

この投稿 Underdog Saluki 27B に会おう:ツール呼び出しでオリジナルを上回る 2 ビットの Qwen3.8-27B 初出: MarkTechPost.

原文の出典

MarkTechPost

内容について

原文の公開と権利は出典元に帰属します。

機械翻訳 · 原文をご参照ください