Conway Research의 온디바이스 어시스턴트인 Underdog은 Saluki 27B를 공개했습니다 Apache 2.0 라이선스 하에 공개되었습니다. Underdog Saluki 27B는 다음 모델의 2비트 GGUF입니다. Qwen3.8-27B의 2비트 GGUF로 7.89 GB 안에 들어갑니다. 전체 BF16 모델은 54 GB가 필요합니다. Underdog은 챗 모델을 에이전트로 만들어주는 기술인 도구 호출을 보호하도록 압축을 조정했습니다. 개발자 입장에서 이는 다음에서 실행되는 27B급 에이전트 모델을 의미합니다: 기본 llama.cpp.
TL;DR
- 크기: 27B 밀집 파라미터. 7.89 GB GGUF versus 16 BF16의 54 GB.
- 실행 환경: 기본 llama.cpp 및 이를 기반으로 한 앱, 완전한 GPU 오프로드 지원. 선택적으로 629 MB 또는 928 MB 비전 애드온.
- 성능: 전체 Qwen3.8-27B 대비 9개 벤치마크에서 평균 96% 성능 유지.
- 최고: 병렬 도구 호출에서 전체 모델의 35 대비 42 (120% 유지).
- 최악: AIME 2025에서 79.2 대비 96.7 (약 82% 유지).
- 요약:
- 최고: 8 GB 미만 파일에서 도구 호출에서 54 GB 원본을 능가.
- 최악: 경쟁 수학과 다단계 추론은 12~18포인트 하락.
Underdog Saluki 27B란 무엇인가?
Saluki 27B는 로컬 에이전트를 위해 만들어진 Qwen3.8-27B의 2비트 혼합 정밀도 GGUF입니다. 3개의 작업 계층을 쌓습니다:
- 기반은 Qwen 팀의 밀집 27B 모델인 Qwen3.8-27B입니다. 이 모델은 64개 레이어를 가지며, Gated DeltaNet 선형 어텐션과 게이티드 어텐션을 혼합하고, 262,144 토큰을 기본 지원합니다.
- 두 번째 계층은 ISTA-DASLab의 Qwen3.8-27B-GSQ-RCO-GGUF입니다. GSQ는 텐서별로 정확한 저비트 스칼라 그리드를 학습합니다. RCO 고정된 크기 예산 내에서 각 텐서에 양자화 유형을 할당합니다. ISTA의 가장 작은 파일인 IQ2_XS는 웨이트당 2.50비트로 8.4 GB입니다.
- 세 번째 계층은 Underdog 자체 패스입니다. 이 패스는 파일을 7.89 GB로 줄였으며 도구 호출(tool calling)을 목표로 했습니다. 파일 이름은 다음과 같습니다:
IQ2-mix그리고 imatrix 태그를 포함하고 있습니다. Underdog는 이 패스에 대한 전체 레시피를 공개하지 않았습니다.
Saluki는 벤치마크에서 어떤 성능을 보이나요?
Underdog는 결과를 2개의 그룹으로 나눕니다.
첫 번째 그룹은 두 모델을 동일한 하네스에서 실행했습니다.:
- 언더독 벤치: 다음으로부터의 120개 작업 BFCL v4테스트 전에 frozen(동결)되었습니다. Thinking off, temperature 0. Saluki는 88점, 풀 모델은 84점, PrismML의 Bonsai 2는 70점을 기록했습니다.
- 병렬 도구 호출: 공식 체커를 사용한 100개의 BFCL v4 병렬 태스크. Saluki 42, 풀 모델 35.
- SWE-bench Verified: 50개 이슈. Saluki는 30개를 수정하고, 풀 모델은 33개를 수정했습니다.
두 번째 그룹은 Saluki를 공개된 풀 사이즈 점수와 비교합니다:
| 벤치마크 | Saluki 27B | Qwen3.8-27B (공개) |
|---|---|---|
| IFEval (prompt-loose) | 93.5 | 91.5 |
| IFBench (prompt-loose) | 72.7 | 71.0 |
| MBPP+ | 78.0 | 83.9 |
| MuSR | 67.5 | 79.6 |
| AIME 2025 (avg@4) | 79.2 | 96.7 |
| AIME 2026 (avg@4) | 80.0 | 94.6 |
Saluki는 다른 Qwen3.8-27B 컴팩트 빌드들과 어떻게 비교됩니까?
| 특징 | Underdog Saluki 27B | Qwen3.8-27B (BF16) | ISTA GSQ-RCO IQ2_XS | PrismML Bonsai 2 27B (PTQ1_0) |
|---|---|---|---|---|
| 기관 | Underdog (Conway Research) | Qwen 팀 | ISTA-DASLab | PrismML |
| 파라미터 수 | 27B | 27B | 27B | 27.36B |
| 파일 크기 | 7.89 GB | 54 GB | 8.4 GB | 5.95 GB |
| 가중치당 비트 수 | 공개되지 않음 (2비트 혼합) | 16 | 2.50 | 1.75 |
| 컨텍스트 | 공개되지 않음 | 262,144 네이티브 | 공개되지 않음 | 262K |
| 비전 | 애드온, 629 또는 928 MB | 네이티브 | 0.9 GB mmproj | 선택 사항 0.63 GB |
| 런타임 | 스톡 llama.cpp | Transformers, vLLM, SGLang | 스톡 llama.cpp, Ollama, LM Studio | PrismML llama.cpp 포크 |
| Underdog Bench (120점 만점) | 88 | 84 | 공개되지 않음 | 70 |
| 벤더 헤드라인 | 평균 96% 유지율, 9개 벤치마크 | 베이스라인 | 제로샷 복원율 100.3% | FP16의 98.2%, 14개 벤치마크 |
| 라이선스 | Apache 2.0 | Apache 2.0 | Apache 2.0 | Apache 2.0 |
Bonsai 2는 더 작으며 98.2%의 유지율을 다음과 같이 보고합니다 14개 사고 모드 벤치마크에서 98.2% 유지율을 보고합니다. 또한 AIME25에서 95.00점을 기록하는 등 더 강한 수학 성능을 보여줍니다. 다만 스톡 llama.cpp는 its packing 포맷을 거부하므로 PrismML의 llama.cpp 포크가 필요합니다. Saluki는 스톡 llama.cpp에서 실행됩니다. 각 벤더는 자체 하네스를 사용하므로 벤더 간 점수는 직접 비교할 수 없습니다.
핵심 요약
- Saluki 27B는 Qwen3.8-27B를 54 GB에서 7.89 GB로 줄여 담습니다.
- 툴 호출에서 풀 모델을 능가합니다: 88 대 84.
- 병렬 툴 호출은 35에서 42로 증가합니다.
- 수학과 추론이 가장 큰 타격을 입어 약 82~85%로 하락합니다.
- Apache 2.0 라이선스로 스톡 llama.cpp에서 실행됩니다.
다음을 확인해 보세요: Hugging Face의 모델 카드, 그리고 언더독(Underdog) 런치 페이지 그리고 X의 발표. 이 프로젝트의 연구자에게 모든 공은 돌립니다. 또한 저희를 Twitter 에서 팔로우하시고 150k+ML SubReddit 에 가입하시며 our Newsletter을 구독하는 것도 잊지 마세요. 잠깐! 텔레그램을 사용하시나요? 이제 텔레그램에서도 저희와 함께하실 수 있습니다.
이 글 언더독 Saluki 27B를 소개합니다: 원본을 도구 호출에서 능가하는 2비트 Qwen3.8-27B 은 다음에서 처음 게시되었습니다 MarkTechPost.