Underdog, der On-Device-Assistent von Conway Research, hat Saluki 27B veröffentlicht unter Apache 2.0. Underdog Saluki 27B ist ein 2-bit-GGUF von Qwen3.8-27B das in 7,89 GB passt. Das vollständige BF16-Modell benötigt 54 GB. Underdog hat die Komprimierung darauf abgestimmt, Tool Calling zu schützen – die Fähigkeit, die aus einem Chatmodell einen Agenten macht. Für Entwickler bedeutet das ein Agentenmodell der 27B-Klasse, das in Standard-llama.cpp.
TL;DR
- Größe: 27B dense Parameter. 7,89 GB GGUF gegenüber 54 GB für BF16.
- Läuft auf: Standard-llama.cpp und darauf aufbauenden Apps, mit vollständigem GPU-Offload. Optionales Vision-Add-on mit 629 MB oder 928 MB.
- Leistung: 96 % durchschnittliche Beibehaltung über 9 Benchmarks gegenüber dem vollständigen Qwen3.8-27B.
- Bestes Ergebnis: Parallele Tool Calls, 42 gegenüber 35 beim vollständigen Modell (120 % Retention).
- Schlechtestes Ergebnis: AIME 2025, 79,2 gegenüber 96,7 (etwa 82 % Retention).
- Fazit:
- Bestes: Schlägt das 54-GB-Original beim Tool Calling in einer Datei unter 8 GB.
- Schlechtestes: Competition-Mathematik und mehrstufiges Reasoning fallen um 12 bis 18 Punkte.
Was ist Underdog Saluki 27B?
Saluki 27B ist ein 2-bit-GGUF mit gemischter Präzision von Qwen3.8-27B, das für lokale Agenten entwickelt wurde. Es stapelt 3 Arbeitsebenen:
- Die Basis ist Qwen3.8-27B, ein dichtes 27B-Modell vom Qwen-Team. Es hat 64 Schichten, kombiniert Gated DeltaNet linear Attention mit gated Attention und unterstützt nativ 262,144 Tokens.
- Die zweite Ebene ist ISTA-DASLabs Qwen3.8-27B-GSQ-RCO-GGUF. GSQ lernt präzise Low-Bit-Skalargitter pro Tensor. RCO weist jedem Tensor einen Quantisierungstyp unter einem festen Größenbudget zu. ISTAs kleinste Datei, IQ2_XS, ist 8.4 GB groß bei 2.50 Bits pro Gewicht.
- Die dritte Schicht ist Underdogs eigener Pass. Er verkleinerte die Datei auf 7.89 GB und zielte auf Tool Calling ab. Die Datei heißt
IQ2-mixund trägt ein imatrix-Tag. Underdog hat das vollständige Rezept für diesen Durchlauf nicht veröffentlicht.
Wie schneidet Saluki bei Benchmarks ab?
Underdog teilt seine Ergebnisse in 2 Gruppen auf.
Die erste Gruppe führte beide Modelle im selben Harness aus:
- Underdog Bench: 120 Aufgaben aus BFCL v4, vor dem Testen eingefroren. Thinking aus, Temperatur 0. Saluki erreicht 88, das volle Modell 84, und PrismMLs Bonsai 2 erreicht 70.
- Parallele Tool-Aufrufe: 100 BFCL v4 Parallelaufgaben mit dem offiziellen Checker. Saluki 42, volles Modell 35.
- SWE-bench Verified: 50 Issues. Saluki behebt 30, das volle Modell 33.
Die zweite Gruppe vergleicht Saluki mit öffentlichen Ergebnissen in voller Größe:
| Benchmark | Saluki 27B | Qwen3.8-27B (öffentlich) |
|---|---|---|
| IFEval (prompt-loose) | 93.5 | 91.5 |
| IFBench (prompt-loose) | 72.7 | 71.0 |
| MBPP+ | 78.0 | 83.9 |
| MuSR | 67.5 | 79.6 |
| AIME 2025 (avg@4) | 79.2 | 96.7 |
| AIME 2026 (avg@4) | 80.0 | 94.6 |
Wie schneidet Saluki im Vergleich mit anderen kompakten Qwen3.8-27B-Builds ab?
| Merkmal | Underdog Saluki 27B | Qwen3.8-27B (BF16) | ISTA GSQ-RCO IQ2_XS | PrismML Bonsai 2 27B (PTQ1_0) |
|---|---|---|---|---|
| Organisation | Underdog (Conway Research) | Qwen-Team | ISTA-DASLab | PrismML |
| Parameter | 27B | 27B | 27B | 27.36B |
| Dateigröße | 7,89 GB | 54 GB | 8,4 GB | 5,95 GB |
| Bits pro Gewicht | Nicht angegeben (2-Bit-Mix) | 16 | 2.50 | 1.75 |
| Kontext | Nicht angegeben | 262,144 nativ | Nicht angegeben | 262K |
| Vision | Add-on, 629 oder 928 MB | Nativ | 0.9 GB mmproj | Optional 0.63 GB |
| Laufzeit | Standard llama.cpp | Transformers, vLLM, SGLang | Standard llama.cpp, Ollama, LM Studio | PrismML llama.cpp Fork |
| Underdog Bench (von 120) | 88 | 84 | Nicht offengelegt | 70 |
| Hersteller-Schlagzeile | 96% durchschnittliche Retention, 9 Benchmarks | Baseline | 100.3% Zero-Shot-Recovery | 98.2% von FP16, 14 Benchmarks |
| Lizenz | Apache 2.0 | Apache 2.0 | Apache 2.0 | Apache 2.0 |
Bonsai 2 ist kleiner und berichtet eine Retention von 98.2% über 14 Thinking-Mode-Benchmarks. Es erreicht zudem stärkere Mathematik-Ergebnisse, darunter 95.00 bei AIME25. Es benötigt jedoch PrismMLs llama.cpp Fork, da Standard llama.cpp seine Packing-Formate ablehnt. Saluki läuft auf Standard llama.cpp. Jeder Hersteller verwendet sein eigenes Harness, daher sind f_vendor-übergreifende Ergebnisse nicht direkt vergleichbar.
Kernerkenntnisse
- Saluki 27B passt Qwen3.8-27B in 7.89 GB, herunter von 54 GB.
- Es schlägt das volle Modell beim Tool Calling: 88 gegenüber 84.
- Parallele Tool-Aufrufe steigen von 35 auf 42.
- Mathematik und Reasoning erleiden den größten Einbruch, auf etwa 82 bis 85%.
- Es läuft in Standard llama.cpp unter Apache 2.0.
Schauen Sie sich die Model Card auf Hugging Face, die Underdog Launch-Seite und die Ankündigung auf X. Der gesamte Dank gebührt dem Forscher dieses Projekts. Folgen Sie uns gerne außerdem auf Twitter und vergessen Sie nicht, unserem 150k+ML SubReddit beizutreten und unseren Newsletterzu abonnieren. Moment! Sind Sie auf Telegram? jetzt können Sie uns auch auf Telegram beitreten.
Der Beitrag Der Außenseiter Saluki 27B im Porträt: Ein 2-bit Qwen3.8-27B, das das Original beim Tool Calling schlägt erschien zuerst auf MarkTechPost.