Underdog, el asistente en el dispositivo de Conway Research, ha publicado Saluki 27B bajo Apache 2.0. Underdog Saluki 27B es un GGUF de 2 bits de Qwen3.8-27B que cabe en 7.89 GB. El modelo BF16 completo necesita 54 GB. Underdog ajustó la compresión para proteger la llamada de herramientas, la habilidad que convierte un modelo de chat en un agente. Para los desarrolladores, eso significa un modelo agente de clase 27B que funciona en llama.cpp sin modificaciones.
TL;DR
- Tamaño: 27B de parámetros densos. 7.89 GB en GGUF frente a 54 GB para BF16.
- Funciona en: llama.cpp sin modificaciones y las aplicaciones construidas sobre él, con descarga completa a GPU. Complemento de visión opcional de 629 MB o 928 MB.
- Rendimiento: 96% de retención media en 9 benchmarks frente a la Qwen3.8-27B completa.
- Mejor: Llamadas de herramientas en paralelo, 42 frente a 35 del modelo completo (120% de retención).
- Peor: AIME 2025, 79.2 frente a 96.7 (alrededor de 82% de retención).
- En resumen:
- Mejor: supera a la original de 54 GB en llamada de herramientas en un archivo de menos de 8 GB.
- Peor: las matemáticas de competición y el razonamiento de varios pasos caen de 12 a 18 puntos.
¿Qué es Underdog Saluki 27B?
Saluki 27B es un GGUF de 2 bits y precisión mixta de Qwen3.8-27B construido para agentes locales. Apila 3 capas de trabajo:
- La base es Qwen3.8-27B, un modelo denso de 27B del equipo Qwen. Tiene 64 capas, combina atención lineal Gated DeltaNet con atención con compuerta y admite 262,144 tokens de forma nativa.
- La segunda capa es la de ISTA-DASLab, Qwen3.8-27B-GSQ-RCO-GGUF. GSQ aprende cuadrículas escalares de bajo bit precisas por tensor. RCO asigna un tipo de cuantización a cada tensor dentro de un presupuesto de tamaño fijo. El archivo más pequeño de ISTA, IQ2_XS, tiene 8.4 GB a 2.50 bits por peso.
- La tercera capa es el propio pase de Underdog. Redujo el archivo a 7.89 GB y se centró en el tool calling. El archivo se llama
IQ2-mixy lleva una etiqueta de imatrix. Underdog no ha publicado la receta completa para este pase.
¿Cómo rinde Saluki en los benchmarks?
Underdog divide sus resultados en 2 grupos.
El primer grupo ejecutó ambos modelos en el mismo entorno de prueba:
- Banquillo de los no favoritos: 120 tareas de BFCL v4, congelados antes de la prueba. Pensamiento desactivado, temperatura 0. Saluki obtiene 88, el modelo completo 84, y el Bonsai 2 de PrismML obtiene 70.
- Llamadas a herramientas en paralelo: 100 tareas paralelas BFCL v4 con el comprobador oficial. Saluki 42, modelo completo 35.
- SWE-bench Verified: 50 problemas. Saluki corrige 30, el modelo completo 33.
El segundo grupo compara a Saluki con puntuaciones públicas de tamaño completo:
| Benchmark | Saluki 27B | Qwen3.8-27B (público) |
|---|---|---|
| IFEval (prompt-loose) | 93.5 | 91.5 |
| IFBench (prompt-loose) | 72.7 | 71.0 |
| MBPP+ | 78.0 | 83.9 |
| MuSR | 67.5 | 79.6 |
| AIME 2025 (avg@4) | 79.2 | 96.7 |
| AIME 2026 (avg@4) | 80.0 | 94.6 |
¿Cómo se compara Saluki con otras compilaciones compactas de Qwen3.8-27B?
| Característica | Underdog Saluki 27B | Qwen3.8-27B (BF16) | ISTA GSQ-RCO IQ2_XS | PrismML Bonsai 2 27B (PTQ1_0) |
|---|---|---|---|---|
| Organización | Underdog (Conway Research) | Equipo de Qwen | ISTA-DASLab | PrismML |
| Parámetros | 27B | 27B | 27B | 27.36B |
| Tamaño del archivo | 7,89 GB | 54 GB | 8,4 GB | 5,95 GB |
| Bits por peso | No divulgado (mezcla de 2 bits) | 16 | 2.50 | 1.75 |
| Contexto | No divulgado | 262,144 nativo | No divulgado | 262K |
| Visión | Complemento, 629 o 928 MB | Nativo | 0.9 GB mmproj | 0.63 GB opcional |
| Runtime | llama.cpp estándar | Transformers, vLLM, SGLang | llama.cpp estándar, Ollama, LM Studio | Fork de llama.cpp de PrismML |
| Underdog Bench (de 120) | 88 | 84 | No revelado | 70 |
| Titular del proveedor | 96% de retención media, 9 benchmarks | Línea base | 100.3% de recuperación zero-shot | 98.2% de FP16, 14 benchmarks |
| Licencia | Apache 2.0 | Apache 2.0 | Apache 2.0 | Apache 2.0 |
Bonsai 2 es más pequeño y reporta 98.2% de retención en 14 benchmarks en modo thinking. También obtiene mejores resultados en matemáticas, incluido un 95.00 en AIME25. Sin embargo, necesita el fork de llama.cpp de PrismML, ya que el llama.cpp estándar rechaza sus formatos de packing. Saluki funciona en llama.cpp estándar. Cada proveedor usa su propio harness, por lo que las puntuaciones entre proveedores no son directamente comparables.
Conclusiones clave
- Saluki 27B comprime Qwen3.8-27B en 7.89 GB, frente a los 54 GB anteriores.
- Supera al modelo completo en tool calling: 88 frente a 84.
- Las llamadas a herramientas en paralelo suben a 42 desde 35.
- Las matemáticas y el razonamiento sufren el mayor impacto, cayendo a aproximadamente el 82 al 85%.
- Funciona en llama.cpp estándar bajo Apache 2.0.
Consulta la Model Card on Hugging Face, el Página de lanzamiento de Underdog y el anuncio en X. Todo el mérito es del investigador de este proyecto. Además, no dudes en seguirnos en Twitter y no olvides unirte a nuestro SubReddit de ML con más de 150k y suscribirte a nuestro boletín. ¡Espera! ¿estás en Telegram? ahora también puedes unirte a nosotros en Telegram.
La entrada Conoce a la oprimida Saluki 27B: una Qwen3.8-27B de 2 bits que supera al original en llamada de herramientas apareció primero en MarkTechPost.