MarkTechPost

언더독 Saluki 27B를 만나보세요: 도구 호출에서 원본을 능가하는 2비트 Qwen3.8-27B

언더독 Saluki 27B는 Apache 2.0 라이선스의 Qwen3.8-27B 2비트 GGUF로, 크기는 7.89 GB입니다. 도구 호출에서는 54 GB 원본을 능가하지만 경쟁 수학 및 추론에서는 성능이 떨어집니다. 이 글 '언더독 Saluki 27B를 만나보세요: 도구 호출에서 원본을 능가하는 2비트 Qwen3.8-27B'는 MarkTechPost 에서 처음 게시되었습니다.

Conway Research의 온디바이스 어시스턴트인 Underdog은 Saluki 27B를 공개했습니다 Apache 2.0 라이선스 하에 공개되었습니다. Underdog Saluki 27B는 다음 모델의 2비트 GGUF입니다. Qwen3.8-27B의 2비트 GGUF로 7.89 GB 안에 들어갑니다. 전체 BF16 모델은 54 GB가 필요합니다. Underdog은 챗 모델을 에이전트로 만들어주는 기술인 도구 호출을 보호하도록 압축을 조정했습니다. 개발자 입장에서 이는 다음에서 실행되는 27B급 에이전트 모델을 의미합니다: 기본 llama.cpp.

TL;DR

  • 크기: 27B 밀집 파라미터. 7.89 GB GGUF versus 16 BF16의 54 GB.
  • 실행 환경: 기본 llama.cpp 및 이를 기반으로 한 앱, 완전한 GPU 오프로드 지원. 선택적으로 629 MB 또는 928 MB 비전 애드온.
  • 성능: 전체 Qwen3.8-27B 대비 9개 벤치마크에서 평균 96% 성능 유지.
  • 최고: 병렬 도구 호출에서 전체 모델의 35 대비 42 (120% 유지).
  • 최악: AIME 2025에서 79.2 대비 96.7 (약 82% 유지).
  • 요약:
    • 최고: 8 GB 미만 파일에서 도구 호출에서 54 GB 원본을 능가.
    • 최악: 경쟁 수학과 다단계 추론은 12~18포인트 하락.

Underdog Saluki 27B란 무엇인가?

Saluki 27B는 로컬 에이전트를 위해 만들어진 Qwen3.8-27B의 2비트 혼합 정밀도 GGUF입니다. 3개의 작업 계층을 쌓습니다:

  • 기반은 Qwen 팀의 밀집 27B 모델인 Qwen3.8-27B입니다. 이 모델은 64개 레이어를 가지며, Gated DeltaNet 선형 어텐션과 게이티드 어텐션을 혼합하고, 262,144 토큰을 기본 지원합니다.
  • 두 번째 계층은 ISTA-DASLab의 Qwen3.8-27B-GSQ-RCO-GGUF입니다. GSQ는 텐서별로 정확한 저비트 스칼라 그리드를 학습합니다. RCO 고정된 크기 예산 내에서 각 텐서에 양자화 유형을 할당합니다. ISTA의 가장 작은 파일인 IQ2_XS는 웨이트당 2.50비트로 8.4 GB입니다.
  • 세 번째 계층은 Underdog 자체 패스입니다. 이 패스는 파일을 7.89 GB로 줄였으며 도구 호출(tool calling)을 목표로 했습니다. 파일 이름은 다음과 같습니다: IQ2-mix 그리고 imatrix 태그를 포함하고 있습니다. Underdog는 이 패스에 대한 전체 레시피를 공개하지 않았습니다.

Saluki는 벤치마크에서 어떤 성능을 보이나요?

Underdog는 결과를 2개의 그룹으로 나눕니다.

첫 번째 그룹은 두 모델을 동일한 하네스에서 실행했습니다.:

  • 언더독 벤치: 다음으로부터의 120개 작업 BFCL v4테스트 전에 frozen(동결)되었습니다. Thinking off, temperature 0. Saluki는 88점, 풀 모델은 84점, PrismML의 Bonsai 2는 70점을 기록했습니다.
  • 병렬 도구 호출: 공식 체커를 사용한 100개의 BFCL v4 병렬 태스크. Saluki 42, 풀 모델 35.
  • SWE-bench Verified: 50개 이슈. Saluki는 30개를 수정하고, 풀 모델은 33개를 수정했습니다.

두 번째 그룹은 Saluki를 공개된 풀 사이즈 점수와 비교합니다:

벤치마크Saluki 27BQwen3.8-27B (공개)
IFEval (prompt-loose)93.591.5
IFBench (prompt-loose)72.771.0
MBPP+78.083.9
MuSR67.579.6
AIME 2025 (avg@4)79.296.7
AIME 2026 (avg@4)80.094.6

Saluki는 다른 Qwen3.8-27B 컴팩트 빌드들과 어떻게 비교됩니까?

특징Underdog Saluki 27BQwen3.8-27B (BF16)ISTA GSQ-RCO IQ2_XSPrismML Bonsai 2 27B (PTQ1_0)
기관Underdog (Conway Research)Qwen 팀ISTA-DASLabPrismML
파라미터 수27B27B27B27.36B
파일 크기7.89 GB54 GB8.4 GB5.95 GB
가중치당 비트 수공개되지 않음 (2비트 혼합)162.501.75
컨텍스트공개되지 않음262,144 네이티브공개되지 않음262K
비전애드온, 629 또는 928 MB네이티브0.9 GB mmproj선택 사항 0.63 GB
런타임스톡 llama.cppTransformers, vLLM, SGLang스톡 llama.cpp, Ollama, LM StudioPrismML llama.cpp 포크
Underdog Bench (120점 만점)8884공개되지 않음70
벤더 헤드라인평균 96% 유지율, 9개 벤치마크베이스라인제로샷 복원율 100.3%FP16의 98.2%, 14개 벤치마크
라이선스Apache 2.0Apache 2.0Apache 2.0Apache 2.0

Bonsai 2는 더 작으며 98.2%의 유지율을 다음과 같이 보고합니다 14개 사고 모드 벤치마크에서 98.2% 유지율을 보고합니다. 또한 AIME25에서 95.00점을 기록하는 등 더 강한 수학 성능을 보여줍니다. 다만 스톡 llama.cpp는 its packing 포맷을 거부하므로 PrismML의 llama.cpp 포크가 필요합니다. Saluki는 스톡 llama.cpp에서 실행됩니다. 각 벤더는 자체 하네스를 사용하므로 벤더 간 점수는 직접 비교할 수 없습니다.

핵심 요약

  • Saluki 27B는 Qwen3.8-27B를 54 GB에서 7.89 GB로 줄여 담습니다.
  • 툴 호출에서 풀 모델을 능가합니다: 88 대 84.
  • 병렬 툴 호출은 35에서 42로 증가합니다.
  • 수학과 추론이 가장 큰 타격을 입어 약 82~85%로 하락합니다.
  • Apache 2.0 라이선스로 스톡 llama.cpp에서 실행됩니다.


다음을 확인해 보세요: Hugging Face의 모델 카드, 그리고 언더독(Underdog) 런치 페이지 그리고 X의 발표. 이 프로젝트의 연구자에게 모든 공은 돌립니다. 또한 저희를 Twitter 에서 팔로우하시고 150k+ML SubReddit 에 가입하시며 our Newsletter을 구독하는 것도 잊지 마세요. 잠깐! 텔레그램을 사용하시나요? 이제 텔레그램에서도 저희와 함께하실 수 있습니다.

이 글 언더독 Saluki 27B를 소개합니다: 원본을 도구 호출에서 능가하는 2비트 Qwen3.8-27B 은 다음에서 처음 게시되었습니다 MarkTechPost.

원문 출처

MarkTechPost

내용 안내

원문 발행 및 권리는 출처에 있습니다.

기계 번역 · 원문을 참고하세요