Mistral AI更新于

推出 Mistral Large 4

Mistral AI宣布推出Mistral Large 4公开预览,称其为“1 trillion-parameter natively multimodal model with 49 billion active parameters”,并称“We will release the weights by the end of the month”。文中还给出编码、智能体与多模态等基准分数,但架构、完整基准与后训练方法等细节尚未公布。

配图来源 · Mistral AI

Le Chonk

今天,我们推出一项 公开预览 Mistral Large 4 的。非正式地称为 ML4,非常正式地称为: le Chonk。ML4 推动了开放权重性能的前沿。你现在可以在以下平台试用预览版 API: Mistral Studio。权重在本月底下降。

前沿性能

ML4是一个拥有1万亿参数、490亿活跃参数的原生多模态模型。它是我们迄今为止最大、最强大的模型,并且随着我们不断完善它,它仍在快速进步。

该模型在编程、智能体工作流和多模态理解方面表现卓越。它已经达到了与全球最强开源模型相当的性能,同时显著超越美国或欧洲开发的任何开放权重模型。在网络安全、金融和法律等关键企业工作负载上,我们发现它在开放模型中处于最先进水平。在某些领域(如视觉定位)中,它更进一步,甚至超越了最前沿的闭源模型。

我们将在月底之前发布权重。在此之前,我们正在与网络安全领域的领军者、经过审核的合作伙伴以及国家机构一起,在真实环境中对模型进行红队测试,他们将以更少的内容审核和更强的网络能力访问同一模型。

演示

铸就于欧洲。为 AI 主权而生。

ML4 是在 Mistral 位于欧洲的自有数据中心内的 3,800 块 NVIDIA Grace Blackwell GPU 上从零训练的。公开预览也由同样的基础设施提供服务。这是我们在基础设施、研究和产品开发方面长期投资的一个重要里程碑:在关键垂直领域提供最先进的性能,通过开放权重交付,旨在让客户掌控自己的 AI。

这在网络安全领域尤为重要,因为提供商层面的拒绝可能阻碍合法的漏洞研究和事件响应,而在事件处理过程中失去对某项能力的访问本身也可能成为严重的安全风险。ML4 将顶尖的网络性能与开放权重和自主部署相结合,让组织既拥有能力,也拥有在自己的策略下运行高级安全工作的自主权。

该模型将在全球多个地区可用,其中包括一个由 Mistral 端到端运营、独立于其他数字服务提供商并受欧洲法律管辖的欧洲部署。有趣的是:ML4 的训练数据中有相当大一部分是多语言数据,涵盖超过 160 种语言,包括欧盟的每一种官方语言。

我们一直与全球金融、工程、制造、物流、制药、科学、航运、公共部门以及其他关键任务行业的领先企业紧密合作来训练 ML4。事实上,该模型使用的正是我们通过 Mistral Forge

立即试用

还有更多内容即将到来。在我们努力发布权重的过程中,我们将分享有关模型架构、更多基准测试以及我们后训练方法的更多细节。

该模型还将作为新一代专门化和优化的 Mistral 模型的基础。与此同时,我们邀请您 试用预览 API 并在社交媒体上与我们分享您的反馈。

能力深度解析

网络安全

ML4 是全球最强的网络安全 AI 模型之一。在 Artificial Analysis Cyber Index(一项评估 AI 模型在真实软件中发现并修复安全漏洞能力的独立评测)上,它位列全球前五名,并大幅领先于中国以外开发的开放权重模型。在该索引的一项测试中,模型需要复现开源软件中的一个真实漏洞然后加以修补,ML4 得分为 82%,是所有模型中最高的。它还解决了 Cybench 中 93% 的挑战,Cybench 是一套从安全竞赛中选取的 40 个练习,这是开放权重模型所报告的最高得分之一。

这一最高得分反映了一种实际优势。包括 Claude Opus 5.5 和 GPT-6 Astra 在内的多个领先闭源模型在同一测试中得分接近于零,因为它们拒绝执行该任务。然而,防御软件的工作往往始于证明一个漏洞是真实存在的,而这正是闭源模型中的安全过滤器可能阻止的那类工作。当威胁行为者越来越多地越狱这些同样的模型以支持进攻性网络活动时,这一点变得更加重要:防御者需要能够在不受同样拒绝约束的情况下匹配这些能力的系统。ML4 可以胜任这项工作,而且它的能力超出了其明确训练的范围:在内部测试中,它被证明可用于分析恶意软件、排定漏洞优先级以及编写检测规则。对于需要主权、可审计 AI 来进行安全运营的组织,它将能够在私有云或本地部署上运行。

ML4 对阵各路模型:在多样化复杂挑战上进行高效推理

恶意软件逆向工程:解决一个分布外调查任务

智能体化编码

ML4在软件工程、代码库理解和复杂终端工作流方面表现出色,在DeepSWE v1.1上得分61.7%,在SWE-Atlas-QnA上得分59.4%,在Terminal-Bench 4上得分28.3%。其49.8%的综合Coding Agent Index得分使其领先于DeepSeek V4 Pro 0813和Qwen3.8 Max。

* DeepSWE、Terminal-Bench 4 和 SWE Atlas QnA 的分数采用 ArtificialAnalysis 编程指数报告的数字。Vibe Code Bench v1.1 采用以下来源报告的数字: vals.ai. 

我们还与 Surge AI 合作进行了一项关于编程质量的盲测人工评估:专业标注者在 1–5 分制上对模型输出进行评分,且模型身份被隐藏。ML4 Preview 在五个模型中排名第二(3.74),领先于 Kimi K3(3.59)、GLM-5.3(3.60)和 GLM-5.2(3.40),仅次于 Claude Opus 5(4.22)。

智能体工作流

ML4 运行通用智能体,能够在复杂工作流中收集信息、使用工具并产出成品交付物。在 AutomationBench 上——涵盖 Gmail、Google Sheets、Slack 和 Salesforce 等应用的 657 个业务工作流——它得分为 59.9%,领先于 Kimi K3、MiMo-V2.6-Pro 和 DeepSeek V4 Pro。

在知识型工作实际产出的专业交付物方面——电子表格、幻灯片和 PDF——它同样表现出色。在评估长周期知识工作的 AA-Briefcase 上,它达到 1,393 Elo,领先于 DeepSeek V4 Pro。

多模态

ML4 是我们模型图像理解能力的重大飞跃。它能够在复杂文档、图表和自然图像之间进行强大的推理,并将视觉能力带入工程、制造和对地观测等感知至关重要的行业。

该模型还能进一步将视觉定位与智能体能力相结合:从检查十亿像素级卫星图像——帮助灾害响应团队在分秒必争时采取行动——到分析工程图纸——放大、检查并验证,直至答案完全准确。在上面的演示中,ML4 对密集自然场景进行定位,验证技术图纸中的机械零件,从 PDF 中检索证据,并在海量地理空间图像中扫描最难发现的物体。

尤其在视觉定位方面,我们发现 ML4 是我们测试过的能力最强的模型之一,例如在 Dense 200 上超越 GPT-6-Astra(42% 对 41%)。

科学与数学

ML4 具备强大的科学能力,这是通过将 AI 驱动的方法与我们研究人员在数学、物理和化学方面的专业知识相结合而构建的。

它在面向科学任务(如数据分析、建模和模拟物理现实)的智能体编程方面极为娴熟,使研究人员能够专注于问题本身而非繁琐的基础工作。在基准测试中,ML4 在开源权重模型中的 SciCode-Verified 上达到最先进水平。在实践中,它可以一次性生成完整的 Hartree–Fock 模拟——这是一项由一系列高级例程构成的复杂多步骤化学任务。

ML4 的数学能力也更强,在形式推理和应用数学方面均是如此。在我们的人工评估中,它的推理比 GLM-5.3 更精确、更具结构性,并且能够胜任长期的、领域特定的应用数学任务,包括与前沿理论物理相关的工作。

这些能力共同使 ML4 成为覆盖完整技术工作流的强大研究助手——从最初的问题到最终的结果。

SciCode-Verified 测试模型以代码形式实现复杂科学工作流的能力,领域涵盖物理、数学、材料科学和生物学等。 

ML4 对比 GLM5.3 在 STEM 任务(数学和物理)上的内部评估

知识型工作

ML4 是我们处理专业人士每天面对的真实任务时能力最强的模型。它可以创建、编辑和修复复杂的电子表格和文档,在法律和金融基准测试中均表现卓越。

值得注意的是,我们通过第三方评估者对 ML4 进行了评估(vals.ai)对 ML4 在法律和金融领域的代表性任务上进行了评估,发现该模型在两种情况下均超过 GPT-6-Astra。在 HarveyAI 的 Legal Agent 基准上,ML4 优于所有开源模型。

FinWorkBench 测试模型在真实金融和会计用例中创建/编辑电子表格的能力。

金融分析要求精确性以及从多个来源综合信息的能力,而这一过程在当今许多金融机构中仍然十分耗时。在本演示中,ML4 和 Mistral Medium 3.5 挑战同一个多步骤公司金融难题,搜索公开公司备案文件和财务报告,例如通过 EDGAR 和等效的欧洲数据库可获取的文件。一张动态语义地图追踪每个模型走向解决方案的历程,突出显示沿途检索到的每一份文档。每条轨迹的位置反映了已收集的证据、计算结果以及尚未解决的问题。观看者可以跟随调查的展开过程,并比较每个模型在得出最终答案之前所采取的不同路径。

模型安全

ML4 在抵御间接提示注入方面的鲁棒性基准测试中已达到饱和,使其处于 OSS 模型的前沿(与 GLM-5.2、GLM-5.3、Kimi-K2.6、Kimi-K3、DS-V4-Pro-0813 相比)。在 Lakera 的公开 B3 AI Security Benchmark上,ML4 抵御了 93.3% 的攻击——我们在竞争对手中未见到更高的分数。

ML4 与用户的互动也比我们以往任何模型都更负责任。我们重点介绍我们在 KORA Benchmark上的结果,ML4 再次以我们在 OSS 模型中测得的最高分位列其中(1.691,满分为 2,最高等级为“模范”). 

尤其值得关注的是模型拒绝涉及网络安全的恶意请求的倾向。尽管在 Cyber 基准测试中表现强劲,模型对来自 JailbreakBench, StrongREJECT和 AgentHarm 的网络提示的平均拒绝率高于所有开源(OSS)模型。

人类评估

我们进行了一项内部评估,来自编程、计算机辅助设计(CAD)、金融、数学和物理领域的专家标注员将 Mistral Large 4 与 GLM-5.3 进行了比较。ML4 在 CAD 和 STEM 领域更受青睐,在金融和编程领域表现与 GLM-5.3 持平或接近。

大规模强化学习

基础模型正在快速进步,我们的后训练必须跟上步伐。为昨天的模型调优的配方在今天的前沿模型上会留下未发挥的能力,因为曾经将模型推向极限的真值样本如今已不再如此。我们使用强化学习(RL),因为它能随模型一同适应:我们基于模型自身尝试的结果进行训练,并且随着模型变强,我们可以提高任务的难度和广度。

我们的强化学习库旨在让新环境易于添加并支持大规模训练。一个共享的、可组合的接口使单次训练运行能够结合多种任务,从单轮对话和复杂科学问题求解,到安全对齐、事实性和长时程工具使用。这些环境共享脚手架和资源,例如代码沙箱、网络搜索和外部 API。同样的可组合性也延伸到验证环节,可根据每个任务的需要将奖励模型、单元测试、LLM 评判器和静态检查组合使用。

在运行时,一个自动扩缩容的 actor 集群并行生成数以万计的 rollout,同时模型训练异步进行。生成和训练流水线针对长轨迹进行了优化,支持在多次压缩(compaction)中跨越百万级 token 的 rollout 预算,同时保持较低的数据陈旧度。贯穿这两个阶段的新方法和优化措施最大限度地减少了离策略漂移,并实现了长时程上的稳定强化学习。

在我们当前的规模(3k GPU)下,单次训练运行每天产生大约 330亿 token,其中经过过滤和掩码后约有 160亿可训练的补全 token 。我们可以直接在训练 rollout 中看到运行进展:随着策略学会解决日益复杂的任务,多个代表性环境中的训练奖励不断上升。以下是一些示例。

这些提升并不局限于我们训练所用环境;它们可以迁移到下游评估中,如各图表所示,最终模型将这些进步归功于两个后训练阶段(监督微调和强化学习)。

接下来的计划

这仅仅是个开始。ML4 是我们 30 亿欧元 D 轮融资所支持路线图上的第一个里程碑——这是欧洲科技公司有史以来规模最大的股权融资。这笔资金已经投入使用:我们正在自己的欧洲数据中心大幅扩大算力,未来几个月还将有更多资源上线。

更多算力意味着更多训练。本次预览背后的强化学习运行仍在进行中,模型没有表现出任何饱和迹象——前方还有巨大的提升空间。随着我们在扩建的基础设施上扩大训练规模,我们预计在未来数周和数月内会有大幅且快速的改进。

我们将在本月底发布权重,同时提供有关架构的更多细节、更多基准测试以及我们的后训练方法。ML4 仅仅是基础:它将作为新一代专用且优化的 Mistral 模型的基础,这些模型是为客户最关心的行业和工作负载而打造的。

从现在起,进展的速度将会很快。敬请期待。

Mistral Large 4

新

开源权重的指令与推理混合 MoE 模型,支持多模态输入;在单一模型中统一了指令、推理和智能体能力,在网络安全、金融和制造领域达到开源权重中的最先进水平,原生流畅支持 160 多种语言。

多模态

推理

编程

智能体

网络安全

输入(/百万 token)

$1.36

输出(/M tokens)

$4.18

阅读更多

原始出处

Mistral AI

内容说明

原始发布及相关权利归来源方。

机器翻译 · 请以原文为准