MarkTechPost

Conoce a la Underdog Saluki 27B: una Qwen3.8-27B de 2 bits que supera a la original en llamada de herramientas

Underdog Saluki 27B es un GGUF de 7.89 GB y 2 bits de Qwen3.8-27B bajo Apache 2.0. Supera a la original de 54 GB en llamada de herramientas, pero cede terreno en matemáticas de competición y razonamiento. La entrada…

Underdog, el asistente en el dispositivo de Conway Research, ha publicado Saluki 27B bajo Apache 2.0. Underdog Saluki 27B es un GGUF de 2 bits de Qwen3.8-27B que cabe en 7.89 GB. El modelo BF16 completo necesita 54 GB. Underdog ajustó la compresión para proteger la llamada de herramientas, la habilidad que convierte un modelo de chat en un agente. Para los desarrolladores, eso significa un modelo agente de clase 27B que funciona en llama.cpp sin modificaciones.

TL;DR

  • Tamaño: 27B de parámetros densos. 7.89 GB en GGUF frente a 54 GB para BF16.
  • Funciona en: llama.cpp sin modificaciones y las aplicaciones construidas sobre él, con descarga completa a GPU. Complemento de visión opcional de 629 MB o 928 MB.
  • Rendimiento: 96% de retención media en 9 benchmarks frente a la Qwen3.8-27B completa.
  • Mejor: Llamadas de herramientas en paralelo, 42 frente a 35 del modelo completo (120% de retención).
  • Peor: AIME 2025, 79.2 frente a 96.7 (alrededor de 82% de retención).
  • En resumen:
    • Mejor: supera a la original de 54 GB en llamada de herramientas en un archivo de menos de 8 GB.
    • Peor: las matemáticas de competición y el razonamiento de varios pasos caen de 12 a 18 puntos.

¿Qué es Underdog Saluki 27B?

Saluki 27B es un GGUF de 2 bits y precisión mixta de Qwen3.8-27B construido para agentes locales. Apila 3 capas de trabajo:

  • La base es Qwen3.8-27B, un modelo denso de 27B del equipo Qwen. Tiene 64 capas, combina atención lineal Gated DeltaNet con atención con compuerta y admite 262,144 tokens de forma nativa.
  • La segunda capa es la de ISTA-DASLab, Qwen3.8-27B-GSQ-RCO-GGUF. GSQ aprende cuadrículas escalares de bajo bit precisas por tensor. RCO asigna un tipo de cuantización a cada tensor dentro de un presupuesto de tamaño fijo. El archivo más pequeño de ISTA, IQ2_XS, tiene 8.4 GB a 2.50 bits por peso.
  • La tercera capa es el propio pase de Underdog. Redujo el archivo a 7.89 GB y se centró en el tool calling. El archivo se llama IQ2-mix y lleva una etiqueta de imatrix. Underdog no ha publicado la receta completa para este pase.

¿Cómo rinde Saluki en los benchmarks?

Underdog divide sus resultados en 2 grupos.

El primer grupo ejecutó ambos modelos en el mismo entorno de prueba:

  • Banquillo de los no favoritos: 120 tareas de BFCL v4, congelados antes de la prueba. Pensamiento desactivado, temperatura 0. Saluki obtiene 88, el modelo completo 84, y el Bonsai 2 de PrismML obtiene 70.
  • Llamadas a herramientas en paralelo: 100 tareas paralelas BFCL v4 con el comprobador oficial. Saluki 42, modelo completo 35.
  • SWE-bench Verified: 50 problemas. Saluki corrige 30, el modelo completo 33.

El segundo grupo compara a Saluki con puntuaciones públicas de tamaño completo:

BenchmarkSaluki 27BQwen3.8-27B (público)
IFEval (prompt-loose)93.591.5
IFBench (prompt-loose)72.771.0
MBPP+78.083.9
MuSR67.579.6
AIME 2025 (avg@4)79.296.7
AIME 2026 (avg@4)80.094.6

¿Cómo se compara Saluki con otras compilaciones compactas de Qwen3.8-27B?

CaracterísticaUnderdog Saluki 27BQwen3.8-27B (BF16)ISTA GSQ-RCO IQ2_XSPrismML Bonsai 2 27B (PTQ1_0)
OrganizaciónUnderdog (Conway Research)Equipo de QwenISTA-DASLabPrismML
Parámetros27B27B27B27.36B
Tamaño del archivo7,89 GB54 GB8,4 GB5,95 GB
Bits por pesoNo divulgado (mezcla de 2 bits)162.501.75
ContextoNo divulgado262,144 nativoNo divulgado262K
VisiónComplemento, 629 o 928 MBNativo0.9 GB mmproj0.63 GB opcional
Runtimellama.cpp estándarTransformers, vLLM, SGLangllama.cpp estándar, Ollama, LM StudioFork de llama.cpp de PrismML
Underdog Bench (de 120)8884No revelado70
Titular del proveedor96% de retención media, 9 benchmarksLínea base100.3% de recuperación zero-shot98.2% de FP16, 14 benchmarks
LicenciaApache 2.0Apache 2.0Apache 2.0Apache 2.0

Bonsai 2 es más pequeño y reporta 98.2% de retención en 14 benchmarks en modo thinking. También obtiene mejores resultados en matemáticas, incluido un 95.00 en AIME25. Sin embargo, necesita el fork de llama.cpp de PrismML, ya que el llama.cpp estándar rechaza sus formatos de packing. Saluki funciona en llama.cpp estándar. Cada proveedor usa su propio harness, por lo que las puntuaciones entre proveedores no son directamente comparables.

Conclusiones clave

  • Saluki 27B comprime Qwen3.8-27B en 7.89 GB, frente a los 54 GB anteriores.
  • Supera al modelo completo en tool calling: 88 frente a 84.
  • Las llamadas a herramientas en paralelo suben a 42 desde 35.
  • Las matemáticas y el razonamiento sufren el mayor impacto, cayendo a aproximadamente el 82 al 85%.
  • Funciona en llama.cpp estándar bajo Apache 2.0.


Consulta la Model Card on Hugging Face, el Página de lanzamiento de Underdog y el anuncio en X. Todo el mérito es del investigador de este proyecto. Además, no dudes en seguirnos en Twitter y no olvides unirte a nuestro SubReddit de ML con más de 150k y suscribirte a nuestro boletín. ¡Espera! ¿estás en Telegram? ahora también puedes unirte a nosotros en Telegram.

La entrada Conoce a la oprimida Saluki 27B: una Qwen3.8-27B de 2 bits que supera al original en llamada de herramientas apareció primero en MarkTechPost.

Fuente original

MarkTechPost

Notas sobre el contenido

La publicación original y los derechos pertenecen a la fuente.

Traducción automática · Consulte el original