Mistral AI

Mistral Large 4를 소개합니다

레 총 오늘, 우리는 Mistral Large 4의 공개 미리보기를 출시합니다. 비공식적으로는 ML4, 매우 공식적으로는 le Chonk입니다. ML4는 오픈-weight 성능의 새로운 한계를 개척합니다. 오늘 Mistral Studio에서 미리보기 API를 시도할 수 있습니다. 가중치는 이달 말에 변경됩니다. 프론티어 성능 ML4는 1조 개의 파라미터를

이미지 출처 · Mistral AI

레 총

오늘, 우리는 Mistral Large 4의 공개 미리보기를 출시합니다. 비공식적으로는 ML4, 매우 공식적으로는 le Chonk입니다. ML4는 오픈-weight 성능의 새로운 한계를 개척합니다. 오늘 Mistral Studio에서 미리보기 API를 시도할 수 있습니다. 가중치는 이달 말에 변경됩니다.

프론티어 성능

ML4는 1조 개의 파라미터를 가진 본질적으로 다모달 모델로, 490억 개의 활성 파라미터를 가지고 있습니다. 이는 현재 우리가 보유한 가장 큰 규모의, 가장 강력한 모델입니다. 우리는 이 모델을 더욱 개선함에 따라 계속해서 빠르게 발전하고 있습니다.

이 모델은 코딩, 에이전트 기반 워크플로우, 다중 모드 이해 능력에서 뛰어난 성능을 보여줍니다. 이미 전 세계에서 가장 강력한 오픈소스 모델과 경쟁할 수 있는 성능을 달성했으며, 미국이나 유럽에서 개발된 어떤 오픈 무게 모델보다도 훨씬 뛰어납니다. 사이버 보안, 금융 및 법률을 포함한 중요한 기업 워크로드에서도, 이 모델은 오픈 모델 중 최첨단 수준에 해당합니다. 시각적 기반 설정과 같은 일부 분야에서는 더욱 나아가, 극초기 폐쇄 모델조차도 넘어서는 결과를 보입니다.

우리는 한 달 말까지 저울의 결과를 공개할 예정입니다. 그때까지는 사이버 보안 전문가들, 검증된 파트너들, 그리고 국가 당국과 함께 실제 환경에서 모델을 테스트하고 있습니다. 이들은 감시 기능을 줄이고 사이버 역량을 확대하여 동일한 모델에 접근할 수 있습니다.

데모

유럽에서 제작됨. AI 주권을 위해 만들어짐.

ML4는 유럽의 Mistral 자체 데이터 센터에 있는 3,800개의 NVIDIA Grace Blackwell GPU를 사용하여 처음부터 전체적으로 훈련되었습니다. 공개 프리뷰도 같은 인프라를 통해 제공됩니다. 이는 인프라, 연구, 제품 개발 분야에 대한 장기적인 투자에서 중요한 진전입니다. 최첨단 성능을 제공하며, 개방형 방식으로 설계되어 고객이 자신의 AI에 대한 통제권을 가질 수 있도록 합니다.

이는 사이버 보안 분야에서 특히 중요합니다. 공급자 수준의 거부로 인해 정당한 취약점 연구와 사고 대응이 차단될 수 있으며, 사고 중에 기능에 대한 접근 권한을 잃는 것 자체가 심각한 보안 위험이 될 수 있습니다. ML4는 최고급 사이버 성능과 개방형 웨이트, 자기 배포 기능을 결합하여 조직에 고급 보안 작업을 자체 정책에 따라 수행할 수 있는 능력과 자율성을 제공합니다.

이 모델은 전 세계 여러 지역에서 제공될 예정이며, 그중에는 Mistral이 다른 디지털 서비스 제공업체와는 독립적으로 유럽 법률에 따라 종합적으로 운영하는 유럽 지역도 포함됩니다. 흥미로운 사실은, ML4의 훈련 데이터 중 상당 부분이 다국어로 구성되어 있으며, 160개 이상의 언어를 포함하고 있고 유럽 연합의 모든 공식 언어도 포함된다는 것입니다.

우리는 세계 각국의 선도적인 기업들과 금융, 엔지니어링, 제조, 물류, 제약, 과학, 해운, 공공 부문 및 기타 중요 산업 분야에서 ML4를 교육하기 위해 긴밀히 협력해 왔습니다. 실제로 이 모델은 Mistral Forge를 통해 고객에게 제공하는 것과 동일한 훈련, 커스터마이징 및 RL 환경을 사용합니다.

오늘 바로 시도해 보세요

아직 더 많은 내용이 남아 있습니다. 가중치를 공개하는 작업을 진행하면서, 모델 아키텍처에 대한 자세한 정보, 추가적인 벤치마크 테스트, 그리고 트레이닝 후 방법론에 대해도 공유할 예정입니다.

이 모델은 새로운 세대의 전문화된 및 최적화된 Mistral 모델의 기반이 될 것입니다. 그동안, preview API를 시도해 보시고 소셜 미디어를 통해 우리와 피드백을 공유해 주시기 바랍니다.

능력에 대한 심층 분석

사이버 보안

ML4는 사이버 보안 분야에서 세계에서 가장 강력한 AI 모델 중 하나입니다. 실제 소프트웨어의 보안 결함을 찾고 수정하는 능력을 평가하는 독립적인 평가인 인공 분석 사이버 지수에서, ML4는 전 세계에서 상위 5개 모델 중 하나로 선정되었으며, 중국 외에서 개발된 개방형 모델 중에서도 압도적인 차이로 선두를 차지합니다. 이 지수의 테스트 중 하나에서는 모델이 오픈소스 소프트웨어의 실제 취약점을 재현하고 그를 패치하는 작업을 수행하는 경우, ML4는 82%의 점수를 얻어 모든 모델 중에서 가장 높은 점수를 기록했습니다. 또한 보안 경시대회에서 얻은 40개의 연습 문제로 구성된 Cybench의 93%의 문제를 해결합니다. 이는 오픈 무게 모델 중 가장 높은 점수 중 하나입니다.

그 최고 점수는 실질적인 이점을 나타냅니다. Claude Opus 5.5와 GPT-6 Astra를 포함한 여러 선도적인 폐쇄형 모델은 동일한 테스트에서 거의 0점을 받습니다. 왜냐하면 그 모델들은 작업을 수행하려고 하지 않기 때문입니다. 하지만 보안 소프트웨어는 종종 결함이 실제로 존재하는지를 증명하는 것부터 시작합니다. 바로 폐쇄형 모델의 보안 필터가 차단할 수 있는 유형의 작업입니다. 위협 행위자들이 이러한 모델을 해킹하여 공격적인 사이버 활동을 지원하는 경우가 점점 더 많아지고 있으므로 이는 더욱 중요하다. 방어자들은 같은 거부 사항에 구속되지 않으면서도 그러한 기능들을 구현할 수 있는 시스템이 필요하다. ML4는 이러한 작업을 수행할 수 있으며, 그 기능은 명시적으로 훈련된 것보다 더 넓다. 내부 테스트에서 악성코드 분석, 취약점 우선순위 결정, 탐지 규칙 작성에 유용함이 입증되었다. 보안 작업에 있어 주권적이고 감사 가능한 AI가 필요한 조직들의 경우, 사설 클라우드나 온프레미스 환경에서 운영될 수 있습니다.

ML4 대 필드: 다양한 복잡한 문제에 대해 효율적으로 추론하기

악성코드 역설계: 배포되지 않은 제품에 대한 조사 과제 해결

에이전트형 코딩

ML4는 소프트웨어 엔지니어링, 저장소 이해, 복잡한 터미널 워크플로우 분야에서 뛰어나며, DeepSWE v1.1에서 61.7%, SWE-Atlas-QnA에서 59.4%, Terminal-Bench 4에서 28.3%의 점수를 기록했습니다. 종합 Coding Agent Index 점수는 49.8%로, DeepSeek V4 Pro 0813과 Qwen3.8 Max보다 높습니다.

* DeepSWE, Terminal-Bench 4, 및 SWE Atlas QnA의 점수는 ArtificialAnalysis 코딩 인덱스에서 보고된 숫자를 사용합니다. Vibe Code Bench v1.1은 vals.ai에서 보고된 숫자를 사용합니다.

우리는 Surge AI를 이용하여 코딩 품질에 대한 인간 평가도 진행했습니다. 전문적인 해석자들이 모델 출력물을 1~5점으로 평가했으며, 모델의 정체는 숨겨졌습니다. ML4 Preview는 다섯 개의 모델 중 두 번째로 높은 점수(3.74점)를 받았으며, Kimi K3(3.59점), GLM-5.3(3.60점), GLM-5.2(3.40점)보다 높았고, Claude Opus 5(4.22점)보다는 낮았습니다.

에이전트 기반 워크플로우

ML4는 정보를 수집하고 도구를 사용하며 복잡한 워크플로우 내에서 완성된 결과물을 생산하는 일반용 에이전트를 실행합니다. AutomationBench에서는 Gmail, Google Sheets, Slack, Salesforce와 같은 앱을 포함한 657개의 비즈니스 워크플로우에서 59.9%의 점수를 기록했으며, 이는 Kimi K3, MiMo-V2.6-Pro, DeepSeek V4 Pro보다 높습니다.

지식 작업이 실제로 생성하는 전문적인 결과물들, 즉 스프레드시트, 슬라이드, PDF 파일에도 마찬가지로 강력합니다. 장기적인 지식 작업을 평가하는 AA-Briefcase에서는 1,393 Elo에 달하며, DeepSeek V4 Pro보다 앞서 있습니다.

멀티모달

ML4는 우리 모델이 이미지를 이해하는 능력에 있어 큰 변화를 가져옵니다. 이는 복잡한 문서, 차트, 자연 이미지들을 효과적으로 처리하며, 인식이 중요한 공학, 제조, 지질 관측과 같은 산업 분야에 시각 기술을 적용할 수 있게 합니다.

모델은 시각적 정보와 에이전트 기능을 더욱 결합할 수 있습니다: 기가픽셀 규모의 위성 이미지를 검사하여 시간이 중요한 재난 대응팀이 행동하도록 돕거나, 엔지니어링 도면을 분석하여 확대하고 검토하며 정확한 답을 찾기까지 합니다. 위의 데모에서 ML4는 복잡한 자연 장면을 구체화하고, 기술 도면의 기계 부품을 확인하며, PDF 파일에서 증거를 추출하고, 찾기 어려운 물체를 찾기 위해 대규모 지리공간 이미지를 스캔합니다.

시각적 기반과 관련해서는, 예를 들어 Dense 200에서 GPT-6-Astra를 42% 대 41%의 점수로 능가하여, ML4가 우리가 테스트한 모델 중 가장 우수한 모델 중 하나임을 알 수 있습니다.

과학과 수학

ML4는 인공지능 기반 방법과 수학, 물리학, 화학 분야의 연구원들의 전문성을 결합하여 구축된 강력한 과학적 역량을 갖추고 있습니다.

데이터 분석, 모델링, 물리적 현실 시뮬레이션과 같은 과학적 작업에 있어 에이전트형 코딩에서 매우 능숙하며, 이를 통해 연구자들은 설정 작업보다는 질문에 집중할 수 있습니다. 벤치마크 결과에서 ML4는 오픈-weight 모델 중 SciCode-Verified에서 최첨단 기술을 보유하고 있습니다. 실제로는 한 번의 실행으로 완전한 Hartree–Fock 시뮬레이션을 생성할 수 있으며, 이는 여러 고급 루틴으로 구성된 복잡하고 다단계의 화학 작업입니다.

ML4의 수학 능력도 더 뛰어나며, 형식적 추론과 응용수학 모두에서 그렇습니다. 인간 평가 결과에 따르면, GLM-5.3보다 더 정확하고 체계적으로 사고합니다. 또한, 첨단 이론물리학과 관련된 작업을 포함한 긴 시간의 특정 분야 응용수학 과제를 지속적으로 수행할 수 있습니다.

이러한 기능들을 함께 활용하면 ML4는 초기 질문부터 최종 결과까지의 전체 기술 작업 과정에서 강력한 연구 조수가 됩니다.

SciCode-Verified은 물리학, 수학, 재료과학, 생물학과 같은 분야에서 복잡한 과학 워크플로우를 코드로 구현하는 모델의 능력을 테스트합니다.

GLM5.3에 대한 ML4의 STEM 작업(수학 및 물리학) 내부 평가

지식 작업

ML4는 전문가들이 일상적으로 처리하는 실제 환경의 작업에 가장 유능한 모델입니다. 복잡한 스프레드시트와 문서를 생성, 편집 및 수정할 수 있으며, 법적 및 재무 기준에서도 뛰어난 성능을 보입니다.

특히, 우리는 법률 및 금융 관련 작업에 대한 대표적인 작업에서 ML4를 타사 평가자들(vals.ai)으로 평가했으며, 두 경우 모두 모델이 GPT-6-Astra보다 우수하다는 것을 확인했습니다. HarveyAI의 Legal Agent 벤치마크에서 ML4는 모든 오픈소스 모델을 능가합니다.

FinWorkBench은 실제 금융 및 회계 업무에서 스프레드시트를 생성/편집하는 과정에서 모델의 기능을 테스트합니다.

재무 분석은 정확성과 여러 출처의 정보를 통합하는 능력을 요구하며, 오늘날 많은 금융기관에서 이러한 과정은 시간이 많이 걸립니다. 이 데모에서는 ML4와 Mistral Medium 3.5가 동일한 다단계 기업 재무 과제에 직면하여, EDGAR 및 유사한 유럽 데이터베이스를 통해 제공되는 공개 회사 서류와 재무 보고서를 검색합니다. 애니메이션된 의미론 지도는 각 모델이 해결책을 찾아가는 과정을 보여주며, 그 과정에서 수집된 모든 문서를 강조합니다. 각 경로의 위치는 수집된 증거, 계산 결과, 그리고 아직 해결되지 않은 질문들을 반영합니다. 관찰자는 조사가 어떻게 진행되는지 확인할 수 있으며, 각 모델이 최종 답변에 도달하기 전에 따른 서로 다른 경로를 비교할 수 있습니다.

모델 안전성

ML4는 간접적인 프롬프트 주입에 대한 견고성 측면에서 우리의 벤치마크를 완전히 장악했으며, 이로 인해 OSS 모델의 최전선에 위치하게 되었습니다(GLM-5.2, GLM-5.3, Kimi-K2.6, Kimi-K3, DS-V4-Pro-0813과 비교하여). Lakera의 공개 데이터에서는 B3 AI 보안 벤치마크ML4는 93.3%의 공격을 저항합니다 – 경쟁자들 중에서는 더 높은 점수를 보이는 경우가 없습니다.

ML4는 우리 이전 모델들보다 더 책임감 있게 사용자와 상호작용합니다. 우리는 KORA Benchmark에서 우리의 결과를 보여줍니다. 여기서 ML4는 OSS 모델 중 가장 높은 측정 점수(1.691점)를 기록하며, 2점은 “우수한”으로 표시되는 최대값입니다.

특히 중요한 점은 사이버 보안과 관련된 악의적인 요청을 거부하려는 모델의 성향입니다. Cyber 벤치마크에서 우수한 성능을 보이지만, JailbreakBench, StrongREJECT, 및 AgentHarm에서 모델의 평균 거부율은 모든 OSS 모델보다 높습니다.

인간 평가

코딩, 컴퓨터 지원 설계(CAD), 금융, 수학, 물리학 분야의 전문 주석가들이 Mistral Large 4와 GLM-5.3을 비교한 내부 평가를 진행했습니다. CAD 및 STEM 분야에서는 ML4가 더 선호되었으며, 금융과 코딩 분야에서는 GLM-5.3과 비슷하거나 유사한 성능을 보였습니다.

대규모 강화 학습

기본 모델은 빠르게 개선되고 있으며, 우리의 후처리 과정도 그 속도를 유지해야 합니다. 어제의 모델을 위해 조정된 방법론은 오늘날의 최신 기술에 맞지 않으며, 한때 모델을 한계까지 몰아붙였던 실제 데이터 샘플도 더 이상 존재하지 않습니다. 우리는 강화학습(RL)을 사용하는데, 이는 모델이 발전함에 따라 적응하기 때문입니다. 우리는 모델의 자체 시도 결과를 기반으로 훈련하며, 모델이 더 강해질수록 과제의 난이도와 범위를 높일 수 있습니다.

우리의 RL 라이브러리는 새로운 환경을 쉽게 추가하고 대규모로 훈련할 수 있도록 설계되었습니다. 공유 가능한 조합 가능한 인터페이스를 통해 단일 훈련 실행에서 단순한 대화와 복잡한 과학적 문제 해결부터 안전 정렬, 사실성, 장기적인 도구 사용에 이르는 다양한 작업을 결합할 수 있습니다. 이러한 환경들은 코드 샌드박스, 웹 검색, 외부 API와 같은 기반 시설과 자원을 공유합니다. 동일한 구성 가능성은 검증에도 적용되며, 보상 모델, 단위 테스트, LLM 심사관, 정적 검사 등이 각 작업에 따라 필요에 따라 결합됩니다.

실행 중에 자동 확장 기능을 갖춘 액터 풀은 모델 훈련이 비동기적으로 진행되는 동안 수만 개의 롤아웃을 병렬로 생성합니다. 생성 및 훈련 파이프라인은 긴 경로를 위한 최적화가 이루어져, 여러 컴팩션에 걸쳐 수백만 토큰 규모의 롤아웃 예산을 지원하면서도 유휴 상태를 낮추는 기능을 갖습니다. 두 단계 모두에서 새롭게 개발된 방법과 최적화 기술은 오프-패러프리드 디트리를 최소화하고 장기적인 시간 범위 내에서 안정적인 RL을 가능하게 합니다.

현재의 규모(3k GPU)에서는 단일 훈련 실행이 하루에 약 330억 토큰을 생성하며, 이 중 160억 훈련 가능 완료 토큰이 필터링 및 마스킹 후에 남습니다. 우리는 훈련 진행 상황을 훈련 로그에서 직접 확인할 수 있습니다. 정책이 점점 더 복잡한 작업을 해결하는 법을 배우면서 여러 대표 환경에서 훈련 보상이 증가합니다. 아래에는 몇 가지 예시가 있습니다.

개선된 점들은 우리가 훈련하는 환경에만 국한되지 않으며, 후단 평가에도 적용됩니다. 마지막 모델은 차트에서 보여주는 것처럼, 훈련 후 단계(지도식 미세 조정 및 RL) 모두에서 이러한 개선된 점들을 가집니다.

다음에 무엇이 일어날까요?

이것은 시작에 불과합니다. ML4는 우리의 30억 유로 규모의 시리즈 D 투자로 지원되는 로드맵의 첫 번째 마일스톤입니다. 이는 유럽 기술 회사가 역대 가장 큰 자본금을 조달한 사례입니다. 그 자본은 이미 활용되고 있습니다: 우리는 유럽 내 데이터 센터에서 컴퓨팅 능력을 크게 확대하고 있으며, 앞으로 몇 달 안에 더 많은 서비스가 시작될 예정입니다.

더 많은 컴퓨팅 능력이란 더 많은 훈련을 의미합니다. 이 미리보기에 따른 강화 학습 과정은 아직 진행 중이며, 모델에는 포화 상태의 징후가 전혀 보이지 않습니다 — 앞으로 상당한 여유가 있습니다. 확장된 인프라를 통해 훈련을 더욱 확대할수록, 앞으로 몇 주 및 몇 달 내에 큰 긍정적인 향상이 이루어질 것으로 기대됩니다.

우리는 이달 말에 가중치를 공개할 예정이며, 아키텍처에 대한 자세한 정보와 추가적인 벤치마크 결과, 그리고 트레이닝 후 방법론도 함께 공개할 것입니다. ML4는 단지 기반일 뿐입니다. 이는 고객들이 가장 중요하게 여기는 산업 및 작업량을 위해 구축된 새로운 세대의 특화되고 최적화된 Mistral 모델의 기초가 될 것입니다.

이제부터의 진행 속도는 매우 빠를 것입니다. 계속 지켜보세요.

미스트랄 라지 4

새로운

오픈 웰드 하이브리드 인스트루먼트-리션싱 MoE는 다중 모드 입력을 활용하며, 지시, 추론, 에이전트 기능을 단일 모델에서 통합합니다. 이는 사이버 보안, 금융, 제조 분야에서 오픈 웰드 중 최신 기술이며, 160개 이상의 언어에 자연스럽게 대응할 수 있습니다.

멀티모달

추론

코딩

에이전트적

사이버 보안

입력 (/M 토큰)

$1.36

출력 (/M 토큰)

$4.18

더 읽기

원문 출처

Mistral AI

내용 안내

원문 발행 및 권리는 출처에 있습니다.

기계 번역 · 원문을 참고하세요