MarkTechPost

Meet the Underdog Saluki 27B: Ein 2-bit Qwen3.8-27B, das das Original beim Tool Calling schlägt

Underdog Saluki 27B ist ein 7,89 GB großer 2-bit-GGUF von Qwen3.8-27B unter Apache 2.0. Es schlägt das 54-GB-Original beim Tool Calling, gibt aber bei Competition-Mathematik und Reasoning Boden ab. Der Beitrag Meet the…

Underdog, der On-Device-Assistent von Conway Research, hat Saluki 27B veröffentlicht unter Apache 2.0. Underdog Saluki 27B ist ein 2-bit-GGUF von Qwen3.8-27B das in 7,89 GB passt. Das vollständige BF16-Modell benötigt 54 GB. Underdog hat die Komprimierung darauf abgestimmt, Tool Calling zu schützen – die Fähigkeit, die aus einem Chatmodell einen Agenten macht. Für Entwickler bedeutet das ein Agentenmodell der 27B-Klasse, das in Standard-llama.cpp.

TL;DR

  • Größe: 27B dense Parameter. 7,89 GB GGUF gegenüber 54 GB für BF16.
  • Läuft auf: Standard-llama.cpp und darauf aufbauenden Apps, mit vollständigem GPU-Offload. Optionales Vision-Add-on mit 629 MB oder 928 MB.
  • Leistung: 96 % durchschnittliche Beibehaltung über 9 Benchmarks gegenüber dem vollständigen Qwen3.8-27B.
  • Bestes Ergebnis: Parallele Tool Calls, 42 gegenüber 35 beim vollständigen Modell (120 % Retention).
  • Schlechtestes Ergebnis: AIME 2025, 79,2 gegenüber 96,7 (etwa 82 % Retention).
  • Fazit:
    • Bestes: Schlägt das 54-GB-Original beim Tool Calling in einer Datei unter 8 GB.
    • Schlechtestes: Competition-Mathematik und mehrstufiges Reasoning fallen um 12 bis 18 Punkte.

Was ist Underdog Saluki 27B?

Saluki 27B ist ein 2-bit-GGUF mit gemischter Präzision von Qwen3.8-27B, das für lokale Agenten entwickelt wurde. Es stapelt 3 Arbeitsebenen:

  • Die Basis ist Qwen3.8-27B, ein dichtes 27B-Modell vom Qwen-Team. Es hat 64 Schichten, kombiniert Gated DeltaNet linear Attention mit gated Attention und unterstützt nativ 262,144 Tokens.
  • Die zweite Ebene ist ISTA-DASLabs Qwen3.8-27B-GSQ-RCO-GGUF. GSQ lernt präzise Low-Bit-Skalargitter pro Tensor. RCO weist jedem Tensor einen Quantisierungstyp unter einem festen Größenbudget zu. ISTAs kleinste Datei, IQ2_XS, ist 8.4 GB groß bei 2.50 Bits pro Gewicht.
  • Die dritte Schicht ist Underdogs eigener Pass. Er verkleinerte die Datei auf 7.89 GB und zielte auf Tool Calling ab. Die Datei heißt IQ2-mix und trägt ein imatrix-Tag. Underdog hat das vollständige Rezept für diesen Durchlauf nicht veröffentlicht.

Wie schneidet Saluki bei Benchmarks ab?

Underdog teilt seine Ergebnisse in 2 Gruppen auf.

Die erste Gruppe führte beide Modelle im selben Harness aus:

  • Underdog Bench: 120 Aufgaben aus BFCL v4, vor dem Testen eingefroren. Thinking aus, Temperatur 0. Saluki erreicht 88, das volle Modell 84, und PrismMLs Bonsai 2 erreicht 70.
  • Parallele Tool-Aufrufe: 100 BFCL v4 Parallelaufgaben mit dem offiziellen Checker. Saluki 42, volles Modell 35.
  • SWE-bench Verified: 50 Issues. Saluki behebt 30, das volle Modell 33.

Die zweite Gruppe vergleicht Saluki mit öffentlichen Ergebnissen in voller Größe:

BenchmarkSaluki 27BQwen3.8-27B (öffentlich)
IFEval (prompt-loose)93.591.5
IFBench (prompt-loose)72.771.0
MBPP+78.083.9
MuSR67.579.6
AIME 2025 (avg@4)79.296.7
AIME 2026 (avg@4)80.094.6

Wie schneidet Saluki im Vergleich mit anderen kompakten Qwen3.8-27B-Builds ab?

MerkmalUnderdog Saluki 27BQwen3.8-27B (BF16)ISTA GSQ-RCO IQ2_XSPrismML Bonsai 2 27B (PTQ1_0)
OrganisationUnderdog (Conway Research)Qwen-TeamISTA-DASLabPrismML
Parameter27B27B27B27.36B
Dateigröße7,89 GB54 GB8,4 GB5,95 GB
Bits pro GewichtNicht angegeben (2-Bit-Mix)162.501.75
KontextNicht angegeben262,144 nativNicht angegeben262K
VisionAdd-on, 629 oder 928 MBNativ0.9 GB mmprojOptional 0.63 GB
LaufzeitStandard llama.cppTransformers, vLLM, SGLangStandard llama.cpp, Ollama, LM StudioPrismML llama.cpp Fork
Underdog Bench (von 120)8884Nicht offengelegt70
Hersteller-Schlagzeile96% durchschnittliche Retention, 9 BenchmarksBaseline100.3% Zero-Shot-Recovery98.2% von FP16, 14 Benchmarks
LizenzApache 2.0Apache 2.0Apache 2.0Apache 2.0

Bonsai 2 ist kleiner und berichtet eine Retention von 98.2% über 14 Thinking-Mode-Benchmarks. Es erreicht zudem stärkere Mathematik-Ergebnisse, darunter 95.00 bei AIME25. Es benötigt jedoch PrismMLs llama.cpp Fork, da Standard llama.cpp seine Packing-Formate ablehnt. Saluki läuft auf Standard llama.cpp. Jeder Hersteller verwendet sein eigenes Harness, daher sind f_vendor-übergreifende Ergebnisse nicht direkt vergleichbar.

Kernerkenntnisse

  • Saluki 27B passt Qwen3.8-27B in 7.89 GB, herunter von 54 GB.
  • Es schlägt das volle Modell beim Tool Calling: 88 gegenüber 84.
  • Parallele Tool-Aufrufe steigen von 35 auf 42.
  • Mathematik und Reasoning erleiden den größten Einbruch, auf etwa 82 bis 85%.
  • Es läuft in Standard llama.cpp unter Apache 2.0.


Schauen Sie sich die Model Card auf Hugging Face, die Underdog Launch-Seite und die Ankündigung auf X. Der gesamte Dank gebührt dem Forscher dieses Projekts. Folgen Sie uns gerne außerdem auf Twitter und vergessen Sie nicht, unserem 150k+ML SubReddit beizutreten und unseren Newsletterzu abonnieren. Moment! Sind Sie auf Telegram? jetzt können Sie uns auch auf Telegram beitreten.

Der Beitrag Der Außenseiter Saluki 27B im Porträt: Ein 2-bit Qwen3.8-27B, das das Original beim Tool Calling schlägt erschien zuerst auf MarkTechPost.

Originalquelle

MarkTechPost

Hinweise zum Inhalt

Originalveröffentlichung und Rechte liegen bei der Quelle.

Maschinelle Übersetzung · Original beachten