MarkTechPost

JetBrains, 코딩 에이전트용 12B MoE 오픈 모델 Mellum 2.1 출시

JetBrains가 Apache 2.0 라이선스, 2.5B 활성 파라미터를 가진 12B mixture-of-experts 사고 모델인 Mellum2.1을 출시했습니다. 실제 저장소에서의 RL을 통해 SWE-bench Verified 점수가 2.0에서 47.0으로 향상되었습니다. JetBrains Releases Mellum2.1: A 12B MoE Open Model for Coding…

JetBrains가 출시했습니다 Mellum2.1, 코딩 에이전트와 빠른 서브 에이전트를 위해 만들어진 오픈 모델입니다. Mellum2.1은 JetBrains의 12B mixture-of-experts 추론 모델로, 토큰당 2.5B 파라미터를 활성화합니다. Apache 2.0 라이선스로 다음에서 제공됩니다. Hugging Face. 아키텍처는 Mellum2에서 변경되지 않았습니다. 이번 업그레이드는 거의 전적으로 실제 소프트웨어 환경에서의 강화 학습(RL)에서 비롯되었습니다. 그 결과는 저장소를 탐색하고, 파일을 편집하고, 자신의 변경 사항을 검사하는 작고 자체 호스팅 가능한 모델입니다.

요약

  • 크기: 총 12B, 2.5B 활성 (64개 전문가, 8개 활성), 131,072토큰 컨텍스트
  • 실행 환경: vLLM 또는 SGLang을 통한 자체 GPU 실행(NVIDIA H200 1개에서 속도 테스트됨). GGUF 빌드는 llama.cpp, Ollama 및 LM Studio용으로 7.0 GB부터 시작합니다.
  • 성능: 나열된 17개 벤치마크 중 15개에서 Mellum2를 능가했으며, Qwen3.5-9B 상대로는 17개 중 5개에서 승리했습니다.
  • 최고: LiveCodeBench v6에서 82.0을 기록하며 Qwen3.5-9B(75.4)와 Gemma 4 E4B(69.4)를 앞섰습니다
  • 최악: Terminal-Bench 2.1에서 17.4로, Qwen3.5-9B(21.7)보다 낮은 수치
  • 핵심 요약 (최고): 단 2.5B의 활성 파라미터만으로 강력한 코딩 점수와 높은 처리량을 제공합니다.
  • 핵심 요약(최악의 경우): 어려운 에이전트형 소프트웨어 작업과 지식 분야에서는 여전히 Qwen3.5-9B에 뒤처집니다.

Mellum2.1이란 무엇인가?

Mellum2.1은 JetBrains이 Mellum2 Thinking을 2026년 6월에 오픈소스로 공개한 모델의 다음 버전입니다. 공개된 체크포인트는 Mellum2.1-12B-A2.5B-Thinking입니다. 이는 답변 전에 사고 과정(chain of thought)을 출력하는 추론 모델입니다. JetBrains은 에이전트 워커, 범용 추론 어시스턴트, 프라이빗 셀프호스팅 배포라는 3가지 용도를 목표로 합니다.

Mellum2.1 아키텍처는 어떻게 작동하나요?

이 모델은 28개 레이어와 64개 전문가(expert)로 구성되어 있습니다. 라우터는 토큰당 8개의 전문가를 활성화합니다. 어텐션은 32개 쿼리 헤드와 4개 KV 헤드를 갖는 grouped-query attention을 사용합니다. 4개 레이어 중 3개는 1,024토큰 슬라이딩 윈도우를 사용합니다. 컨텍스트 길이는 131,072토큰이고 어휘 크기는 98,304토큰입니다. 가중치는 bfloat16으로 제공됩니다.

Mellum2.1은 어떻게 학습되었나요?

새로운 작업의 거의 대부분이 포스트 트레이닝에 투입되었습니다. RL(강화학습)은 짧은 최종 단계에서 훈련의 주된 부분으로 옮겨졌습니다. JetBrains는 수학, 경쟁 프로그래밍, 과학, 도구 사용, 소프트웨어 엔지니어링 분야의 RL 과제를 추가했습니다. 또한 깨진 테스트, 검증 불가능한 답변, 너무 쉽거나 불가능한 과제를 걸러내기 위해 오픈 RL 데이터셋을 필터링했습니다. 소프트웨어 엔지니어링의 경우, 모델은 셸과 파일 편집 도구를 갖춘 실제 저장소에서 훈련하며 테스트가 통과하면 보상을 받습니다. 훈련 과정에서 수천 개의 환경에 걸쳐 수백만 개의 샌드박스를 구동했습니다.

Mellum2.1은 벤치마크에서 어떤 성능을 보이나요?

JetBrains는 Mellum2.1, Mellum2, Qwen3.5-9B 그리고 Gemma 4 E4B 를 thinking 모드에서 하나의 파이프라인으로 평가했습니다. 모든 점수는 JetBrains가 자체 보고한 것입니다.

가장 큰 향상은 에이전틱 코딩 분야입니다. SWE-bench Verified는 2.0에서 47.0으로 상승했습니다. SWE-bench Pro는 0.0에서 28.0으로 상승했습니다. Terminal-Bench 2.1은 0.6에서 17.4로 상승했습니다. 에이전틱 실행은 오픈소스 Pi v0.73.1 하네스를 114K토큰 컨텍스트로 사용했습니다.

Mellum2.1은 LiveCodeBench v6(82.0), HumanEval+(91.5), MBPP+(79.4), BFCL v4(62.3)에서 이 그룹을 선도합니다. Qwen3.5-9B는 여전히 SWE-bench Verified(50.0), SWE-bench Pro(38.0), AIME 25/26(86.7), GPQA Diamond(77.8)에서 선두입니다. 안전성도 향상되었습니다. HarmBench는 21.5에서 8.5로 낮아졌으며, 낮을수록 좋습니다.

파이프라인도 고려할 필요가 있습니다. Qwen 자체 카드는 LiveCodeBench v6에서 65.6, GPQA Diamond에서 81.7을 기록했다고 명시되어 있습니다. JetBrains는 동일한 모델에 대해 75.4와 77.8을 측정했습니다.

Mellum2.1은 얼마나 빠른가요?

포스트 트레이닝은 아키텍처를 변경하지 않았으므로 속도는 Mellum2와 동일합니다. 무거운 부하 상태의 H200 1대에서 JetBrains에 따르면 Mellum2.1은 Qwen3.5-9B보다 거의 2배의 토큰을 처리한다고 합니다. 단일 요청의 경우, multi-token prediction(MTP) 덕분에 약 1.6배 더 빠릅니다. vLLM speculative decoding을 위한 MTP 헤드는 곧 제공될 예정으로 목록에 올라 있습니다.

Mellum2.1을 로컬에서 어떻게 실행하나요?

전체 모델은 vLLM에서 --reasoning-parser qwen3와 함께 제공됩니다. 도구 호출은 --enable-auto-tool-choice --tool-call-parser hermes를 추가합니다. JetBrains는 temperature 0.6, top_p 0.95, top_k 20을 권장합니다.

JetBrains 릴리스 노트에는 GGUF 빌드가 진행 중이라고 언급되어 있습니다. GGUF 저장소 에는 이미 5개의 파일이 나열되어 있습니다:

  • BF16: 24.3 GB (참고용)
  • Q8_0: 12.9 GB, 96.1% top-token 일치
  • Q6_K: 10.9 GB, 93.9% top-token 일치
  • Q4_K_M: 8.1 GB, 88.0% top-token 일치 (권장)
  • MXFP4_MOE: 7.0 GB, 상위 토큰 일치율 85.6%

Mellum2.1 vs Qwen3.5-9B vs Gemma 4 E4B

특성Mellum2.1Mellum2 ThinkingQwen3.5-9BGemma 4 E4B
아키텍처MoE, 64개 전문가, 8개 활성MoE (2.1과 동일)하이브리드 Gated DeltaNet + 게이티드 어텐션레이어별 임베딩을 갖는 Dense
전체 파라미터12B12B9B (언어 모델)임베딩 포함 8B
활성 / 유효 파라미터2.5B 활성2.5B 활성9B (dense)4.5B 유효
컨텍스트131,072131,072262,144 네이티브, 최대 1,010,000128K
모달리티텍스트텍스트텍스트, 이미지, 비디오텍스트, 이미지, 오디오
라이선스Apache 2.0Apache 2.0Apache 2.0Apache 2.0
LiveCodeBench v6*82.069.475.469.4
SWE-bench Verified*47.02.050.023.0
Terminal-Bench 2.1*17.40.621.73.4
BFCL v4*62.349.658.552.5
GPQA Diamond*64.651.077.853.1
AIME 25/26*83.360.186.745.0

*벤치마크 행: JetBrains의 공유 파이프라인, thinking 모드 기준, 출처는 Mellum2.1 모델 카드입니다. Qwen3.5-9B와 Gemma 4 E4B에 대해서는 각 벤더의 자체 카드가 다른 수치를 보고합니다.

핵심 요약

  • Mellum2.1은 활성 파라미터 2.5B를 가진 12B MoE thinking 모델로, Apache 2.0 라이선스로 공개되었습니다.
  • 실제 저장소에서의 RL을 통해 SWE-bench Verified 점수가 2.0에서 47.0으로 향상되었습니다.
  • 테스트된 그룹 중 LiveCodeBench v6(82.0)와 BFCL v4(62.3)에서 선두를 차지했습니다.
  • Qwen3.5-9B는 여전히 SWE-bench Pro, GPQA Diamond, AIME에서 우세합니다.
  • 7.0 GB에서 8.1 GB의 GGUF 덕분에 로컬 코딩 서브 에이전트가 실용적으로 가능해졌습니다.


다음을 확인해 보세요: 모델 가중치, GGUF 빌드, 기술 블로그 그리고 Mellum2 기술 보고서. 이 프로젝트의 연구자에게 모든 공은 돌립니다. 또한 저희를 Twitter 에서 팔로우하고, 150k+ML SubReddit 에 참여하고 저희 뉴스레터를 구독하는 것도 잊지 마세요. 잠깐! 텔레그램을 사용하시나요? 이제 텔레그램에서도 저희와 함께하실 수 있습니다.

이 글은 JetBrains, 코딩 에이전트를 위한 12B MoE 오픈 모델 Mellum2.1 공개 글이 처음 게시된 곳은 MarkTechPost입니다..

원문 출처

MarkTechPost

내용 안내

원문 발행 및 권리는 출처에 있습니다.

기계 번역 · 원문을 참고하세요