Mistral AI 방금 출시를 발표했습니다 Mistral Large 4 (ML4), 내부 별명은 ' Le Chonk, 퍼블릭 프리뷰로 제공됩니다. ML4는 총 1.05조 개의 파라미터, 토큰당 490억 개의 활성 파라미터, 16억 개 파라미터의 비전 인코더, 그리고 100만 토큰의 컨텍스트 윈도우를 갖춘 세분화된 Mixture of Experts 모델입니다. 모델 문서에 따르면. Mistral의 유럽 내 자체 데이터센터에서 3,800개의 NVIDIA Grace Blackwell GPU로 처음부터 학습되었습니다.
요약: TL;DR
Mistral AI가 2026년 10월 6일 Mistral Large 4('Le Chonk')를 공개 프리뷰로 출시했습니다: 토큰당 49B가 활성화되는 1.05T 파라미터 세분화된 MoE 모델로, 네이티브 이미지 입력과 1M 컨텍스트 윈도우를 갖추고 있으며, Mistral의 자체 EU 데이터센터에서 3,800개의 NVIDIA Grace Blackwell GPU로 처음부터 학습되었습니다. API는 현재 1M 입력 토큰당 $1.36, 1M 출력 토큰당 $4.18의 가격으로 제공되고 있지만, 가중치는 10월 말에야 공개되므로 아직 셀프 호스팅은 불가능합니다. 가장 두드러진 성과는 사이버 보안 분야에서 나타나며, Mistral은 Cybench에서 93%, CyberGym-E2E에서 82%를 기록했다고 보고하면서, 여러 폐쇄형 프론티어 모델들이 해당 작업을 거부하기 때문에 거의 0점에 가까운 점수를 받는다고 언급했습니다.
아키텍처는 무엇인가요?
ML4는 이미지 입력을 기본으로 처리하는 하이브리드 인스트럭트-추론 MoE 모델입니다. 토큰당 약 4.7%의 가중치만 활성화되며, 이것이 1조(트릴리언)급 모델이 중간 가격대로 서비스될 수 있는 이유입니다. 전체 1.05T 가중치는 여전히 메모리에 상주해야 하므로, 활성화 수는 연산량을 결정할 뿐 하드웨어 비용 자체를 결정하지는 않습니다.
Mistral은 아직 전문가 수, top-k 라우팅, 레이어 구성을 공개하지 않았다. 이러한 정보는 가중치와 함께 공개될 예정이다. 학습 데이터는 EU의 모든 공용 언어를 포함해 160개 이상의 언어에 걸쳐 있었다.
인터랙티브 해설
성능은 어떤가요?
In 사이버 보안, Mistral은 93%를 보고했습니다 Cybench 그리고 CyberGym-E2E에서 82%를 기록하여, ML4를 Artificial Analysis Cyber Index 글로벌 톱 5에 올려놓았습니다. 더 흥미로운 주장은 구조적인 것입니다. Mistral에 따르면 여러 최첨단 폐쇄형 모델들이 아예 거부하기 때문에 CyberGym-E2E에서 거의 0점에 가까운 점수를 받는다고 합니다. 취약점이 실제임을 증명하기 위해 이를 재현하는 것은 표준적인 방어 작업이며, 공급자 수준의 거부가 이를 막고 있습니다.
In 에이전틱 코딩, Mistral은 DeepSWE v1.1에서 61.7%, SWE-Atlas-QnA에서 59.4%, Terminal-Bench 4.0에서 28.3%를 보고했으며, 이를 합산한 Artificial Analysis 코딩 에이전트 지수는 49.8%입니다. Mistral은 이 결과들이 해당 하네스가 공개되기 전에 비공개로 평가된 것이라 아직 독립적으로 재현할 수 없다고 밝혔습니다.
Surge AI와 함께 진행한 인간 블라인드 평가가 더 정직한 신호입니다. 전문 어노테이터들은 ML4 Preview를 5점 만점에 3.74점, 5개 모델 중 2위로 평가했으며, GLM-5.3(3.60)과 Kimi K3(3.59)보다는 앞서지만 Claude Opus 5 의 4.22점에는 뒤졌습니다.
에서 안전, ML4는 93.3%의 공격을 저지합니다. Lakera의 B3 벤치마크 그리고 최대 2.0 중 1.691점을 기록하며 KORABench.
가장 근접한 오픈 웨이트 경쟁 모델들과 비교하면 어떠한가요?
| 기능 | Mistral Large 4 | DeepSeek V4 Pro | Kimi K3 | GLM-5.3 |
|---|---|---|---|---|
| 총 파라미터 | 1.05T | 1.6T | 2.8T | 공식적으로 발표되지 않음 |
| 토큰당 활성 | 49B | 49B | ~104B | 공식적으로 발표되지 않음 |
| 컨텍스트 창 | 1M | 1M | 1M | 1M |
| 네이티브 이미지 입력 | 예 | 아니요 | 예 | 아니요 |
| 가중치 공개 여부 | 아직 미공개, 2026년 10월 말 공개 예정 | 예, Hugging Face에서 공개 | 예, 2026년 7월 27일부터 공개 | 예, Artificial Analysis 기준 |
| 라이선스 | 아직 발표되지 않음 | MIT | 수정된 MIT | GLM-5.3 라이선스 |
| 1M 입/출력당 API 가격 | $1.36 / $4.18 | 제공사에 따라 다름 | $3.00 / $15.00 | $1.40 / $4.40 |
| 출시됨 | 2026년 10월 6일 | 2026년 8월 (0813 빌드) | 2026년 7월 16일 | 2026년 8월 14일 |
오늘 이 모델로 무엇을 만들 수 있을까요?
프리뷰 API는 함수 호출, 구조화된 출력, 문서 QnA, 배칭, 그리고 Agents 및 Conversations 엔드포인트를 지원합니다. 캐시된 입력은 1M 토큰당 $0.14로 책정되어 있어, 1M 윈도우에서 긴 컨텍스트의 에이전트 루프 경제성을 실질적으로 바꿔놓았습니다.
핵심 요약
- 총 1.05T 파라미터, 토큰당 49B 활성화, 1M 컨텍스트, 1.6B 비전 인코더.
- Mistral의 자체 EU 데이터센터에서 3,800개의 Grace Blackwell GPU로 학습되었습니다.
- API 프리뷰가 현재 1M 입력 토큰당 $1.36, 1M 출력 토큰당 $4.18의 가격으로 제공 중입니다.
- 2026년 10월 말까지 가중치가 제공될 것이라고 약속했기 때문에, 아직 자체 호스팅은 불가능합니다.
- 가장 강력한 결과는 사이버보안 분야에서 나타났으며, 이 분야에서는 폐쇄형 모델들이 종종 해당 작업을 거부합니다.
다음을 확인해 보세요 Mistral Large 4 발표, Mistral Large 4 모델 문서 및 Artificial Analysis 모델 비교모든 크레딧은 이 프로젝트의 연구자에게 돌아갑니다. 또한 언제든지 저희를 Twitter 에서 팔로우하시고 저희의 150k+ML SubReddit 가입과 our Newsletter구독도 잊지 마세요. 잠깐! 텔레그램을 사용하고 계신가요? 이제 텔레그램에서도 저희와 함께하실 수 있습니다.
이 글 Mistral AI, Mistral Large 4(Le Chonk) 공개: 1.05T 파라미터 멀티모달 MoE 모델 은 다음에서 처음 게시되었습니다: MarkTechPost.