Underdog, l'assistant embarqué de Conway Research, a publié Saluki 27B sous Apache 2.0. Underdog Saluki 27B est un GGUF en 2 bits de Qwen3.8-27B qui tient dans 7,89 Go. Le modèle BF16 complet nécessite 54 Go. Underdog a ajusté la compression pour protéger l'appel d'outils, la compétence qui transforme un modèle de chat en agent. Pour les développeurs, cela signifie un modèle d'agent de classe 27B qui fonctionne dans le llama.cpp standard.
TL;DR
- Taille : 27B paramètres denses. GGUF de 7,89 Go contre 54 Go pour le BF16.
- Fonctionne sur : le llama.cpp standard et les applications construites dessus, avec déchargement GPU complet. Module vision optionnel de 629 Mo ou 928 Mo.
- Performances : 96 % de rétention moyenne sur 9 benchmarks par rapport au Qwen3.8-27B complet.
- Meilleur : appels d'outils parallèles, 42 contre 35 pour le modèle complet (rétention de 120 %).
- Pire : AIME 2025, 79,2 contre 96,7 (environ 82 % de rétention).
- En résumé :
- Meilleur : bat l'original de 54 Go en appel d'outils dans un fichier de moins de 8 Go.
- Pire : les mathématiques de compétition et le raisonnement multi-étapes chutent de 12 à 18 points.
Qu'est-ce qu'Underdog Saluki 27B ?
Saluki 27B est un GGUF en 2 bits à précision mixte de Qwen3.8-27B conçu pour les agents locaux. Il empile 3 couches de travail:
- La base est Qwen3.8-27B, un modèle dense 27B de l'équipe Qwen. Il compte 64 couches, combine l'attention linéaire Gated DeltaNet avec l'attention à porte, et prend en charge 262,144 tokens nativement.
- La deuxième couche est le Qwen3.8-27B-GSQ-RCO-GGUF. d'ISTA-DASLab. GSQ apprend des grilles scalaires bas-bit précises par tenseur. RCO attribue un type de quantification à chaque tenseur dans un budget de taille fixe. Le plus petit fichier d'ISTA, IQ2_XS, fait 8.4 Go à 2.50 bits par poids.
- La troisième couche est le propre passage d'Underdog. Il a réduit le fichier à 7.89 GB et ciblé l'appel d'outils. Le fichier s'appelle
IQ2-mixet comporte une balise imatrix. Underdog n'a pas publié la recette complète de cette passe.
Comment Saluki se comporte-t-il sur les benchmarks ?
Underdog divise ses résultats en 2 groupes.
Le premier groupe a exécuté les deux modèles dans le même harnais:
- Underdog Bench : 120 tâches issues de BFCL v4, figées avant les tests. Raisonnement désactivé, température 0. Saluki obtient 88, le modèle complet 84, et Bonsai 2 de PrismML obtient 70.
- Appels d'outils parallèles : 100 tâches parallèles BFCL v4 avec le vérificateur officiel. Saluki 42, modèle complet 35.
- SWE-bench Verified : 50 problèmes. Saluki en corrige 30, le modèle complet 33.
Le deuxième groupe compare Saluki avec les scores publics de modèles complets :
| Benchmark | Saluki 27B | Qwen3.8-27B (public) |
|---|---|---|
| IFEval (prompt-loose) | 93.5 | 91.5 |
| IFBench (prompt-loose) | 72.7 | 71.0 |
| MBPP+ | 78.0 | 83.9 |
| MuSR | 67.5 | 79.6 |
| AIME 2025 (avg@4) | 79.2 | 96.7 |
| AIME 2026 (avg@4) | 80.0 | 94.6 |
Comment Saluki se compare-t-il aux autres builds compacts de Qwen3.8-27B ?
| Caractéristique | Underdog Saluki 27B | Qwen3.8-27B (BF16) | ISTA GSQ-RCO IQ2_XS | PrismML Bonsai 2 27B (PTQ1_0) |
|---|---|---|---|---|
| Organisation | Underdog (Conway Research) | Équipe Qwen | ISTA-DASLab | PrismML |
| Paramètres | 27B | 27B | 27B | 27.36B |
| Taille du fichier | 7,89 Go | 54 Go | 8,4 Go | 5,95 Go |
| Bits par poids | Non divulgué (mix 2 bits) | 16 | 2.50 | 1.75 |
| Contexte | Non divulgué | 262,144 natif | Non divulgué | 262K |
| Vision | Module complémentaire, 629 ou 928 Mo | Natif | 0.9 GB mmproj | 0.63 GB optionnel |
| Runtime | llama.cpp standard | Transformers, vLLM, SGLang | llama.cpp standard, Ollama, LM Studio | fork llama.cpp de PrismML |
| Underdog Bench (sur 120) | 88 | 84 | Non divulgué | 70 |
| Chiffre mis en avant par le fournisseur | 96 % de rétention moyenne, 9 benchmarks | Référence | 100.3 % de récupération zero-shot | 98.2 % du FP16, 14 benchmarks |
| Licence | Apache 2.0 | Apache 2.0 | Apache 2.0 | Apache 2.0 |
Bonsai 2 est plus petit et affiche une rétention de 98.2 % sur 14 benchmarks en mode réflexion. Il obtient également de meilleurs résultats en mathématiques, avec notamment 95.00 sur AIME25. Cependant, il nécessite le fork llama.cpp de PrismML, car le llama.cpp standard rejette ses formats de packing. Saluki fonctionne sur le llama.cpp standard. Chaque fournisseur utilise son propre harnais de test, les scores inter-fournisseurs ne sont donc pas directement comparables.
Points clés
- Saluki 27B fait tenir Qwen3.8-27B dans 7.89 GB, contre 54 GB auparavant.
- Il surpasse le modèle complet en appel d'outils : 88 contre 84.
- Les appels d'outils parallèles passent à 42 contre 35.
- Les mathématiques et le raisonnement subissent la plus grosse baisse, retombant à environ 82 à 85 %.
- Il fonctionne dans le llama.cpp standard sous licence Apache 2.0.
Consultez la fiche du modèle sur Hugging Face, le Page de lancement d'Underdog et l' annonce sur X. Tout le mérite revient au chercheur de ce projet. N'hésitez pas également à nous suivre sur Twitter et n'oubliez pas de rejoindre notre SubReddit ML de plus de 150k et de vous abonner à notre Newsletter. Attendez ! êtes-vous sur telegram ? vous pouvez maintenant nous rejoindre sur telegram également.
L'article Découvrez le petit poucet Saluki 27B : un Qwen3.8-27B en 2 bits qui bat l'original en appel d'outils est apparu en premier sur MarkTechPost.