Mistral AI

Présentation de Mistral Large 4

Le Chonk Aujourd’hui, nous lançons une prévisualisation publique de Mistral Large 4. Informellement ML4, officiellement : le Chonk. ML4 pousse les frontières des performances de poids ouvert. Vous pou

Source de l’image · Mistral AI

Le Chonk

Aujourd’hui, nous lançons une prévisualisation publique de Mistral Large 4. Informellement ML4, officiellement : le Chonk. ML4 pousse les frontières des performances de poids ouvert. Vous pouvez tester l’API de prévisualisation aujourd’hui via Mistral Studio. Les poids seront mis à jour à la fin de ce mois.

Performance Frontier

ML4 est un modèle multimodal à 1 trillion de paramètres, avec 49 milliards de paramètres actifs. C’est notre plus grand et plus performant modèle jusqu’à présent, et il continue de se développer rapidement au fur et à mesure que nous l’affinons.

Le modèle démontre des performances exceptionnelles en matière de codage, de flux de travail agentique et de compréhension multimodale. Il atteint déjà des performances compétitives avec les modèles open-source les plus performants au niveau mondial, tout en surpassant de manière significative tout modèle open-weight développé aux États-Unis ou en Europe. Pour les charges de travail d'entreprise critiques, notamment en cybersécurité, en finance et en droit, il se classe parmi les modèles les plus avancés parmi ceux open-source. Dans certains domaines tels que la fondation visuelle, cela va encore plus loin, dépassant même les modèles fermés de frontière.

Nous publierons les poids à la fin du mois. Jusqu’à alors, nous testons le modèle dans des conditions réelles avec des leaders en cybersécurité, des partenaires vérifiés et les autorités étatiques, qui auront accès au même modèle avec une surveillance réduite et des capacités cyber accrues.

Demos

Fabriqué en Europe. Conçu pour la souveraineté de l’IA.

ML4 a été entraîné depuis le début sur 3 800 GPU NVIDIA Grace Blackwell dans les datacenters de Mistral en Europe. La preview publique est disponible sur cette même infrastructure. C’est un jalon important dans notre investissement à long terme en matière d’infrastructure, de recherche et de développement de produits : des performances de pointe dans des domaines critiques, fournies via des poids ouverts, conçues pour permettre aux clients de contrôler leur IA.

Cela est particulièrement important en cybersécurité, où des refus au niveau du fournisseur peuvent bloquer la recherche légitime de vulnérabilités et la réponse aux incidents, et où perdre l’accès à une capacité pendant un incident peut lui-même devenir un risque de sécurité critique. ML4 associe des performances cyber de premier plan avec des poids ouverts et un déploiement autonome, offrant ainsi aux organisations à la fois la capacité et l’autonomie de mettre en œuvre des travaux de sécurité avancés selon leurs propres politiques.

Le modèle sera disponible dans plusieurs régions du monde, y compris une déploiement en Europe où Mistral opère end-to-end, indépendamment d’autres fournisseurs de services numériques et conformément à la législation européenne. Bonne nouvelle : une part importante des données d’entraînement de ML4 est multilingue, couvrant plus de 160 langues, y compris toutes les langues officielles de l’Union européenne.

Nous avons travaillé en étroite collaboration avec des entreprises leader dans le monde dans les domaines des finances, de l’ingénierie, de la fabrication, de la logistique, des produits pharmaceutiques, de la science, du transport, du secteur public et d’autres industries à mission critique pour former ML4. En fait, le modèle utilise les mêmes entraînements, personnalisations et environnements de RL que nous offrons à nos clients via Mistral Forge.

Essaie-le aujourd’hui

Il y a encore du contenu à venir. Alors que nous travaillons pour publier les poids du modèle, nous partagerons des détails supplémentaires sur l’architecture du modèle, les tests de performance supplémentaires et notre méthodologie d’après-trainement.

Ce modèle servira également de base pour une nouvelle génération de modèles Mistral spécialisés et optimisés. En attendant, nous vous invitons à tester l’API de prévisualisation et à partager vos commentaires avec nous sur les réseaux sociaux.

capacités approfondies

Cybersécurité

ML4 est l’un des modèles d’IA les plus puissants au monde en matière de cybersécurité. Dans l’indice de l’analyse artificielle pour la cybersécurité, évaluation indépendante du niveau de performance des modèles d’IA dans la détection et la correction des failles de sécurité dans les logiciels réels, il figure parmi les cinq meilleurs modèles mondiaux et domine largement les modèles open-source développés en dehors de la Chine. Lors d’un des tests de cet indice, où le modèle doit reproduire une vulnérabilité réelle dans un logiciel open-source puis la corriger, ML4 obtient 82 %, le score le plus élevé parmi tous les modèles. Il résout également 93 % des défis dans Cybench, un ensemble de 40 exercices tirés de compétitions de sécurité, l’un des scores les plus élevés rapportés pour un modèle de poids ouvert.

Cet score maximal reflète un avantage pratique. Plusieurs modèles fermés de pointe, tels que le Claude Opus 5.5 et le GPT-6 Astra, obtiennent une note proche de zéro dans le même test, car ils refusent de réaliser la tâche. Cependant, la défense des logiciels commence souvent par prouver qu’un défaut existe réellement, c’est précisément le type de travail que les filtres de sécurité dans les modèles fermés peuvent bloquer. Cela est encore plus important car les acteurs de menaces cherchent de plus en plus à contourner ces mêmes modèles pour soutenir des activités cyber offensives : les défenseurs ont besoin de systèmes capables de rivaliser avec ces capacités sans être limités par les mêmes refus. ML4 peut effectuer ce travail, et ses capacités dépassent ce pour quoi il a été explicitement entraîné : lors de tests internes, il s’est avéré utile pour analyser le malware, prioriser les vulnérabilités et écrire des règles de détection. Pour les organisations qui ont besoin d’une IA souveraine et vérifiable pour les opérations de sécurité, elle pourra être exécutée sur un cloud privé ou sur site.

ML4 contre le champ : raisonner efficacement face à des défis complexes variés

Reversing engineering du malware : résolution d’une tâche d’enquête hors distribution

Codage agentique

ML4 excelle dans le génie logiciel, la compréhension des répositories et les workflows complexes en terminal, obtenant un score de 61,7 % sur DeepSWE v1.1, 59,4 % sur SWE-Atlas-QnA et 28,3 % sur Terminal-Bench 4. Son score combiné du Coding Agent Index de 49,8 % le place devant DeepSeek V4 Pro 0813 et Qwen3.8 Max.

* Les scores sur DeepSWE, Terminal-Bench 4 et SWE Atlas QnA utilisent les chiffres rapportés par l’indice de codage ArtificialAnalysis. Vibe Code Bench v1.1 utilise les chiffres rapportés par vals.ai.

Nous avons également mené une évaluation humaine aveugle avec Surge AI concernant la qualité de codage : des annotateurs professionnels ont noté les sorties du modèle sur une échelle de 1 à 5, les identités du modèle étant cachées. ML4 Preview a obtenu la deuxième place parmi les cinq modèles (3,74), devant Kimi K3 (3,59), GLM-5.3 (3,60) et GLM-5.2 (3,40), et seulement derrière Claude Opus 5 (4,22).

Workflows agentiques

ML4 exécute des agents polyvalents qui collectent des informations, utilisent des outils et produisent des résultats finaux dans des workflows complexes. Sur AutomationBench — 657 workflows de business via des applications telles que Gmail, Google Sheets, Slack et Salesforce — il obtient une note de 59,9 %, devant Kimi K3, MiMo-V2.6-Pro et DeepSeek V4 Pro.

Il est tout aussi efficace sur les livrables professionnels que le travail intellectuel produit réellement : feuilles de calcul, diapositives et PDF. Sur AA-Briefcase, qui évalue le travail intellectuel à long terme, il atteint 1 393 Elo, devant DeepSeek V4 Pro.

Multimodal

ML4 représente une véritable évolution dans la capacité de nos modèles à comprendre des images. Il raisonne de manière puissante à l’égard de documents complexes, de graphiques et d’images naturelles, et permet une vision accrue dans les industries où la perception est essentielle, telles que l’ingénierie, la fabrication et l’observation de la Terre.

Le modèle peut également combiner la base visuelle avec les capacités agentiques : de l’analyse d’images satellites en gigapixels – permettant aux équipes de réponse aux catastrophes d’agir en temps limité – à l’analyse de dessins techniques – zoom, inspection et vérification jusqu’à obtenir une réponse exacte. Dans nos démonstrations ci-dessus, ML4 permet de comprendre des scènes naturelles complexes, de vérifier les composants mécaniques dans les dessins techniques, de récupérer des éléments de preuves provenant de PDF, et de scanner des images géospatiales massives afin de localiser les objets les plus difficiles à trouver.

En termes de fondement visuel, nous avons constaté que ML4 était l’un des modèles les plus compétents que nous ayons testés, par exemple, il dépasse GPT-6-Astra sur Dense 200 (42 % contre 41 %).

Sciences et Mathématiques

ML4 offre de fortes capacités scientifiques, obtenues en combinant des méthodes guidées par l’IA avec l’expertise de nos chercheurs en mathématiques, en physique et en chimie.

Il est très compétent en codage agentique pour des tâches scientifiques telles que l’analyse de données, la modélisation et la simulation de la réalité physique, ce qui permet aux chercheurs de se concentrer sur les questions plutôt que sur les détails techniques. Dans les tests de performance, ML4 est à la pointe dans SciCode-Verified pour les modèles à poids ouvert. En pratique, il peut générer une simulation complète Hartree–Fock en une seule fois – une tâche chimique complexe et multiétapes composée d’une série de routines avancées.

Les mathématiques de ML4 sont également plus fortes, tant dans le raisonnement formel que dans les mathématiques appliquées. Dans nos évaluations humaines, il raisonne plus précisément et avec plus de structure que GLM-5.3, et il peut supporter des tâches longues en mathématiques appliquées spécifiques au domaine, y compris des travaux liés à la physique théorique frontier.

Ensemble, ces capacités font de ML4 un puissant assistant de recherche tout au long du processus technique complet – depuis la première question jusqu’au résultat final.

SciCode-Verified teste les capacités des modèles pour implémenter des flux de travail scientifiques complexes dans du code, dans des domaines tels que la physique, les mathématiques, les sciences des matériaux et la biologie.

Evaluation interne sur les tâches STEM (mathématiques et physique) de ML4 par rapport à GLM5.3

Connaissances Travail

ML4 est notre modèle le plus performant pour les tâches du monde réel que les professionnels effectuent quotidiennement. Il peut créer, modifier et corriger des feuilles de calcul et des documents complexes, présentant une performance exemplaire tant dans les critères juridiques que financiers.

Notamment, nous avons évalué ML4 auprès d’évaluateurs tiers (vals.ai) sur des tâches représentatives, tant en domaine juridique que financier, et nous avons constaté que le modèle dépasse GPT-6-Astra dans les deux cas. Sur le benchmark Legal Agent de HarveyAI, ML4 surpasse tous les modèles open-source.

FinWorkBench teste les capacités du modèle lors de la création et de l’édition de feuilles de calculs dans des cas d’usage réels de finance et de comptabilité.

L’analyse financière exige précision et la capacité de synthétiser des informations provenant de multiples sources, un processus qui reste long et épuisant dans de nombreuses institutions financières aujourd’hui. Dans cette démonstration, ML4 et Mistral Medium 3.5 sont chargés de relever le même défi de finance d’entreprise multiétapes : ils examinent les documents officiels des sociétés publiques et les rapports financiers, tels que ceux disponibles via EDGAR et les bases de données européennes correspondantes. Une carte sémantique animée trace le parcours de chaque modèle vers une solution, en mettant en évidence chaque document reçu au cours du processus. La position de chaque trajet reflète les preuves recueillies, les résultats des calculs et les questions restées sans réponse. Les spectateurs peuvent suivre comment les enquêtes se déroulent et comparer les différentes voies empruntées par chaque modèle avant d’obtenir sa réponse finale.

Modèle Sécurité

ML4 a saturé nos tests de robustesse aux injections de prompts indirectes, le plaçant à la frontière des modèles OSS (par rapport à GLM-5.2, GLM-5.3, Kimi-K2.6, Kimi-K3 et DS-V4-Pro-0813). Sur le B3 AI Security Benchmark publié par Lakera, ML4 résiste à 93.3 % des attaques – nous ne voyons aucun score plus élevé parmi les concurrents.

ML4 interagit également de manière plus responsable avec les utilisateurs que qualquer des modèles précédents. Nous mettons en avant nos résultats sur le KORA Benchmark, où ML4 obtient à nouveau la meilleure note mesurée parmi les modèles OSS (1,691, avec 2 étant le maximum indiqué comme “Exemplaire”).

Il est particulièrement important la propension du modèle à refuser les demandes malveillantes liées à la cybersécurité. Malgré ses performances élevées sur les benchmarks Cyber, le taux moyen de refus du modèle pour les prompts cyber provenant de JailbreakBench, StrongREJECT et AgentHarm est plus élevé que celui de tous les modèles OSS.

Évaluation humaine

Nous avons mené une évaluation interne dans laquelle des annotateurs experts dans les domaines du codage, du design assisté par ordinateur (CAD), des finances, des mathématiques et de la physique ont comparé Mistral Large 4 avec GLM-5.3. ML4 a été préféré dans le CAD et les domaines STEM, tandis que ses performances étaient à peu près équales ou proches de celles de GLM-5.3 dans les finances et le codage.

Apprentissage par renforcement à grande échelle

Les modèles de base se améliorent rapidement, et notre phase post-trainement doit suivre le rythme. Une méthode conçue pour le modèle d’hier ne suffit plus face aux défis actuels, car les données de vérification originales qui ont autrefois poussé un modèle à ses limites ne sont plus disponibles. Nous utilisons l’Apprentissage par Renforcement (RL) car il s’adapte en même temps que le modèle : nous nous entraînons sur les résultats des tentatives du modèle lui-même, et nous pouvons augmenter la difficulté ainsi que la complexité des tâches à mesure qu’il devient plus fort.

Nos bibliothèque de RL a été conçue pour faciliter l’ajout de nouveaux environnements et son entraînement à grande échelle. Une interface partagée et composable permet à une seule exécution d’entraînement de combiner des tâches allant du dialogue à une seule tour et de la résolution de problèmes scientifiques complexes jusqu’à l’alignement sur la sécurité, la vérité factuelle et l’utilisation d’outils à long terme. Ces environnements partagent des supports et des ressources tels que des sandboxes de code, une recherche en ligne et des API externes. La même capacité de composition s’étend également à la vérification, avec des modèles de récompense, des tests unitaires, des juges de LLM et des vérifications statiques combinés selon les besoins pour chaque tâche.

En temps de runtime, une flotte d’acteurs auto-scaleant génère des dizaines de milliers de déploiements en parallèle, tandis que l’entraînement du modèle se déroule de manière asynchrone. Le pipeline de génération et d’entraînement est optimisé pour des trajectoires longues, permettant des budgets de déploiement de millions de tokens sur plusieurs compactions tout en maintenant un faible état de désuétude. Des méthodes et optimisations novatrices à ces deux étapes minimisent le dérive hors politique et assurent une réponse stable du RL sur de longs horizons.

À notre taille actuelle (3 000 GPU), une seule exécution d’entraînement produit environ 33 milliards de tokens par jour, dont environ 16 milliards de tokens de complétion trainables après filtrage et masquage. Nous pouvons voir l’avancement de l’exécution directement dans les rapports de formation : les récompenses de formation augmentent dans plusieurs environnements représentatifs au fur et à mesure que la politique apprend à résoudre des tâches de plus en plus complexes. Voici quelques exemples.

Les améliorations ne sont pas spécifiques aux environnements sur lesquels nous entraînons ; elles se transmettent aux évaluations ultérieures, et le modèle final en doit à toutes les étapes post-entraînement (ajustement fini supervisé et RL), comme montré sur les graphiques.

Qu’est-ce qui va suivre

C’est seulement le début. ML4 représente le premier point de repère sur la feuille de route financée par notre série D de 3 milliards d’euros – la plus grande levée de fonds en capital-actions jamais réalisée par une entreprise technologique européenne. Ces fonds sont déjà utilisés : nous augmentons significativement notre capacité de calcul dans nos propres datacenters européens, et de nombreuses autres fonctionnalités seront lancées au cours des prochains mois.

Plus de calcul signifie plus de formation. L’exécution du apprentissage par renforcement qui se déroule derrière cette preview est encore en cours, et le modèle ne montre aucun signe de saturation – il y a encore beaucoup de marge. À mesure que nous augmentons l’échelle de la formation sur notre infrastructure étendue, nous attendons d’importants et rapides améliorations dans les semaines et les mois à venir.

Nous publierons les poids dès la fin du mois, ainsi que plus de détails sur l’architecture, les benchmarks supplémentaires et notre méthodologie post-traitement. Et ML4 n’est que la base : il servira de fondement pour une nouvelle génération de modèles Mistral spécialisés et optimisés, conçus pour les industries et les tâches qui intéressent le plus nos clients.

Le rythme de progression à partir de maintenant sera rapide. Restez à l’écoute.

Mistral Large 4

Nouveau

Hybride à poids ouvert combinant instruction et raisonnement par MoE avec entrée multimodale ; unité des instructions, du raisonnement et des capacités agentiques dans un seul modèle, à l’avant-garde pour les poids ouverts en cybersécurité, en finance et en fabrication, fluide nativement dans plus de 160 langues.

Multimodal

Réflexion

Codage

Agentique

Cybersécurité

Entrée (tokens /M)

$1.36

Output (/M tokens)

$4.18

Lire plus

Source originale

Mistral AI

À propos du contenu

La publication originale et les droits appartiennent à la source.

Traduction automatique · Consultez l’original