MarkTechPost수정일

Mistral AI, Mistral Large 4(Le Chonk) 출시: 1.05T 파라미터 멀티모달 MoE 모델

Mistral AI가 Le Chonk라는 별명의 Mistral Large 4를 공개 프리뷰로 출시했습니다. 이는 1.05조 파라미터 규모의 Mixture of Experts 모델로, 490억 개의 활성 파라미터, 네이티브 이미지 입력, 100만 토큰 컨텍스트 윈도우를 갖추고 있으며, Mistral의 자체 유럽 데이터센터에서 3,800개의 NVIDIA Grace Blackwell GPU로…

Mistral AI 방금 출시를 발표했습니다 Mistral Large 4 (ML4), 내부 별명은 ' Le Chonk, 퍼블릭 프리뷰로 제공됩니다. ML4는 총 1.05조 개의 파라미터, 토큰당 490억 개의 활성 파라미터, 16억 개 파라미터의 비전 인코더, 그리고 100만 토큰의 컨텍스트 윈도우를 갖춘 세분화된 Mixture of Experts 모델입니다. 모델 문서에 따르면. Mistral의 유럽 내 자체 데이터센터에서 3,800개의 NVIDIA Grace Blackwell GPU로 처음부터 학습되었습니다.

요약: TL;DR

Mistral AI가 2026년 10월 6일 Mistral Large 4('Le Chonk')를 공개 프리뷰로 출시했습니다: 토큰당 49B가 활성화되는 1.05T 파라미터 세분화된 MoE 모델로, 네이티브 이미지 입력과 1M 컨텍스트 윈도우를 갖추고 있으며, Mistral의 자체 EU 데이터센터에서 3,800개의 NVIDIA Grace Blackwell GPU로 처음부터 학습되었습니다. API는 현재 1M 입력 토큰당 $1.36, 1M 출력 토큰당 $4.18의 가격으로 제공되고 있지만, 가중치는 10월 말에야 공개되므로 아직 셀프 호스팅은 불가능합니다. 가장 두드러진 성과는 사이버 보안 분야에서 나타나며, Mistral은 Cybench에서 93%, CyberGym-E2E에서 82%를 기록했다고 보고하면서, 여러 폐쇄형 프론티어 모델들이 해당 작업을 거부하기 때문에 거의 0점에 가까운 점수를 받는다고 언급했습니다.

아키텍처는 무엇인가요?

ML4는 이미지 입력을 기본으로 처리하는 하이브리드 인스트럭트-추론 MoE 모델입니다. 토큰당 약 4.7%의 가중치만 활성화되며, 이것이 1조(트릴리언)급 모델이 중간 가격대로 서비스될 수 있는 이유입니다. 전체 1.05T 가중치는 여전히 메모리에 상주해야 하므로, 활성화 수는 연산량을 결정할 뿐 하드웨어 비용 자체를 결정하지는 않습니다.

Mistral은 아직 전문가 수, top-k 라우팅, 레이어 구성을 공개하지 않았다. 이러한 정보는 가중치와 함께 공개될 예정이다. 학습 데이터는 EU의 모든 공용 언어를 포함해 160개 이상의 언어에 걸쳐 있었다.

인터랙티브 해설

성능은 어떤가요?

In 사이버 보안, Mistral은 93%를 보고했습니다 Cybench 그리고 CyberGym-E2E에서 82%를 기록하여, ML4를 Artificial Analysis Cyber Index 글로벌 톱 5에 올려놓았습니다. 더 흥미로운 주장은 구조적인 것입니다. Mistral에 따르면 여러 최첨단 폐쇄형 모델들이 아예 거부하기 때문에 CyberGym-E2E에서 거의 0점에 가까운 점수를 받는다고 합니다. 취약점이 실제임을 증명하기 위해 이를 재현하는 것은 표준적인 방어 작업이며, 공급자 수준의 거부가 이를 막고 있습니다.

In 에이전틱 코딩, Mistral은 DeepSWE v1.1에서 61.7%, SWE-Atlas-QnA에서 59.4%, Terminal-Bench 4.0에서 28.3%를 보고했으며, 이를 합산한 Artificial Analysis 코딩 에이전트 지수는 49.8%입니다. Mistral은 이 결과들이 해당 하네스가 공개되기 전에 비공개로 평가된 것이라 아직 독립적으로 재현할 수 없다고 밝혔습니다.

Surge AI와 함께 진행한 인간 블라인드 평가가 더 정직한 신호입니다. 전문 어노테이터들은 ML4 Preview를 5점 만점에 3.74점, 5개 모델 중 2위로 평가했으며, GLM-5.3(3.60)과 Kimi K3(3.59)보다는 앞서지만 Claude Opus 5 의 4.22점에는 뒤졌습니다.

에서 안전, ML4는 93.3%의 공격을 저지합니다. Lakera의 B3 벤치마크 그리고 최대 2.0 중 1.691점을 기록하며 KORABench.

가장 근접한 오픈 웨이트 경쟁 모델들과 비교하면 어떠한가요?

기능Mistral Large 4DeepSeek V4 ProKimi K3GLM-5.3
총 파라미터1.05T1.6T2.8T공식적으로 발표되지 않음
토큰당 활성49B49B~104B공식적으로 발표되지 않음
컨텍스트 창1M1M1M1M
네이티브 이미지 입력예아니요예아니요
가중치 공개 여부아직 미공개, 2026년 10월 말 공개 예정예, Hugging Face에서 공개예, 2026년 7월 27일부터 공개예, Artificial Analysis 기준
라이선스아직 발표되지 않음MIT수정된 MITGLM-5.3 라이선스
1M 입/출력당 API 가격$1.36 / $4.18제공사에 따라 다름$3.00 / $15.00$1.40 / $4.40
출시됨2026년 10월 6일2026년 8월 (0813 빌드)2026년 7월 16일2026년 8월 14일

오늘 이 모델로 무엇을 만들 수 있을까요?

프리뷰 API는 함수 호출, 구조화된 출력, 문서 QnA, 배칭, 그리고 Agents 및 Conversations 엔드포인트를 지원합니다. 캐시된 입력은 1M 토큰당 $0.14로 책정되어 있어, 1M 윈도우에서 긴 컨텍스트의 에이전트 루프 경제성을 실질적으로 바꿔놓았습니다.

핵심 요약

  • 총 1.05T 파라미터, 토큰당 49B 활성화, 1M 컨텍스트, 1.6B 비전 인코더.
  • Mistral의 자체 EU 데이터센터에서 3,800개의 Grace Blackwell GPU로 학습되었습니다.
  • API 프리뷰가 현재 1M 입력 토큰당 $1.36, 1M 출력 토큰당 $4.18의 가격으로 제공 중입니다.
  • 2026년 10월 말까지 가중치가 제공될 것이라고 약속했기 때문에, 아직 자체 호스팅은 불가능합니다.
  • 가장 강력한 결과는 사이버보안 분야에서 나타났으며, 이 분야에서는 폐쇄형 모델들이 종종 해당 작업을 거부합니다.


다음을 확인해 보세요 Mistral Large 4 발표, Mistral Large 4 모델 문서 및 Artificial Analysis 모델 비교모든 크레딧은 이 프로젝트의 연구자에게 돌아갑니다. 또한 언제든지 저희를 Twitter 에서 팔로우하시고 저희의 150k+ML SubReddit 가입과 our Newsletter구독도 잊지 마세요. 잠깐! 텔레그램을 사용하고 계신가요? 이제 텔레그램에서도 저희와 함께하실 수 있습니다.

[Sponsored] 웹은 대부분의 에이전트가 갖고 있지 않은 유일한 API입니다. 데이터베이스, 캘린더, 저장소에는 API가 있습니다. 하지만 개방형 웹에는 대체로 없습니다. TinyFish MCP server 는 모든 MCP 클라이언트에 네 가지 도구를 제공합니다: TinySearch, TinyFetch(JavaScript를 포함한 전체 페이지를 마크다운으로 제공), 로그인과 폼 처리용 TinyBrowser, 다단계 작업용 TinyAgent입니다. Search와 Fetch는 무료입니다.

이 글 Mistral AI, Mistral Large 4(Le Chonk) 공개: 1.05T 파라미터 멀티모달 MoE 모델 은 다음에서 처음 게시되었습니다: MarkTechPost.

원문 출처

MarkTechPost

내용 안내

원문 발행 및 권리는 출처에 있습니다.

기계 번역 · 원문을 참고하세요