Mistral Large 4 是欧洲对拒绝执行安全类工作的美国模型推出的万亿参数回应
Jonathan Kemper
查看 Jonathan Kemper 的领英个人主页
2026年10月6日
由 THE DECODER 提示生成的 Nano Banana Pro
要点
- Mistral 已发布 Mistral Large 4 的预览版,这是一个在欧洲训练的、拥有一万亿参数的模型。模型权重预计于十月月底发布。
- 在 Artificial Analysis Intelligence Index 中,该模型跃升至 38 分,但仍远远落后于 Claude Opus 5.5 等领先的闭源模型。
- Mistral 的主要卖点在于 IT 安全:该模型能够复现并修复 Claude 和 GPT-6 等竞争对手因安全过滤机制而拒绝处理的软件漏洞。
Mistral 发布了其迄今最大的模型 Mistral Large 4。该模型拥有一万亿参数,并在公司位于欧洲的自有数据中心完成训练。在一项独立指数中,该模型实现了大幅跃升,但仍远逊于领先的闭源模型。Mistral 的主要卖点是它能够处理 Claude 和 GPT-6 拒绝涉及的安全任务。
Mistral 已发布 公开预览版 Mistral Large 4(ML4),昵称为 "le Chonk"。API 现已通过 Mistral Studio提供。模型权重预计于十月底随后发布。
据Mistral称,ML4是一个原生多模态模型,拥有一万亿参数,其中490亿为激活参数。 X上,该公司表示 ML4 是在综合基准测试中表现最佳的来自美国或欧洲的开放权重模型。它声称该模型在网络防御、制造和金融领域达到了最先进的性能,并表示即使在视觉定位(visual grounding)方面也超越了闭源前沿模型。
Mistral 的巨大飞跃,但 Claude 仍领先 20 分
独立的评估来自 Artificial Analysis 的 Intelligence Index,该指数汇总了十个不同领域的基准测试。ML4 在其中获得 38 分。这对 Mistral 来说是一个重大进步:其前身 Mistral Large 3 在该指数中仅获得 9 分,而最新的 Mistral Medium 3.5 得分为 14。凭借 38 分,ML4 还略胜 GLM-5.2 一筹,后者来自 Z.ai,Mistral 也在自己的平台上提供该模型。但与顶尖模型的差距仍然很大。 Claude Opus 5.5(Max) 以 58 分领先。广告

在权重发布之前,Mistral 正与安全公司、经过审核的合作伙伴以及政府机构一起对该模型进行红队测试。这些组织获得的是具有减弱的审核和扩展的网络攻击能力的相同版本。

Mistral 在网络安全方面的优势部分来自竞争对手拒绝该任务
Mistral 将其公告的大部分篇幅用于 IT 安全。据该公司称,在 Artificial Analysis Cyber Index 中,ML4 位列全球前五名模型之中。在中国以外开发的开放权重模型中,它以较大优势领先。
其中一项测试要求模型重现开源软件中的一个真实漏洞,然后对其进行修补。ML4 达到 82%,是所有模型中的最高分。不过原因很不寻常。据 Mistral 称,Claude Opus 5.5 和 GPT-6 Astra 得分接近于零,因为它们完全拒绝该任务。因此,该测试衡量的不仅是模型能力,也同样衡量提供商的政策。
Mistral 将这一点变成了卖点。该公司辩称,软件防御往往始于证明某个漏洞是真实存在的。封闭模型上的安全过滤器恰恰阻止了这类工作,而攻击者无论如何都会对这些模型进行越狱。Mistral 补充说,在事件处置过程中失去对某个提供商的访问权限本身也可能成为一种安全风险。ML4 还被设计为可在私有云或本地部署环境中运行。Ad
与此同时,Mistral 宣扬其高拒绝率。在来自 JailbreakBench、StrongREJECT 和 AgentHarm 的恶意网络提示上,ML4 的拒绝频率高于任何其他开放模型。至于该模型如何可靠地区分合法的漏洞研究与攻击准备,Mistral 并未解释。据该公司称,在 Lakera 的 B3 AI 安全基准测试中,ML4 拦截了 93.3% 的攻击。
ML4在编程方面位居第二,超过Deepseek和Qwen
在编程方面,ML4 在 Artificial Analysis Coding Agent Index 中得分为 49.8%,位居前列,超过了 Deepseek V4 Pro 以及 Qwen3.8 MaxMistral 还与 Surge AI 进行了一次盲测评估,由专业标注员在不了解代码出自哪个模型的情况下对代码质量进行评分。ML4 在五个模型中以 5 分满分获得 3.74 分排名第二,领先于 GLM-5.3 和 Kimi K3. Claude Opus 5 以4.22分领先。

在图像理解方面,Mistral 宣称有重大改进。ML4 应能分析文档、图表、十亿像素卫星图像和技术图纸,并自行放大和检查细节。不过,相比闭源模型的领先幅度很小。在 Dense 200 基准测试中,ML4 得分为 42%,而 GPT-6 Astra 为 41%。根据 Vals.ai 的一项评估,ML4 在法律和金融任务上也击败了 GPT-6 Astra。

作为商业模式选择的欧洲主权
Mistral表示,ML4是在其位于欧洲的自有数据中心内,使用3,800块Nvidia Grace Blackwell GPU从零开始训练的。该预览版运行在相同的基础设施上。除了在多个地区提供的服务之外,Mistral还计划推出一个完全由自己运营的欧洲版本,独立于其他服务提供商,并受欧洲法律管辖。训练数据涵盖超过160种语言,包括所有欧盟官方语言。
据Mistral介绍,训练是与金融、制造、物流、制药、航运和公共部门的企业合作进行的。该公司使用了它通过Mistral Forge向客户提供的同一套训练和强化学习环境。在强化学习后训练方面,Mistral使用了约3,000块GPU。单次训练运行每天大约生成330亿个token。
训练尚未完成
Mistral表示,预览版背后的强化学习运行仍在进行中,且没有出现平台期的迹象。该公司预计在未来几周内会有显著改进。算力扩建由 30亿欧元的D轮融资资助,这是欧洲科技公司有史以来规模最大的股权融资。

目前仍有许多不明确之处。根据 模型文档, ML4采用细粒度的专家混合架构,总参数量为1.05万亿,并配备16亿参数的视觉编码器。上下文窗口达一百万个token。Mistral计划在本月底随权重一同发布架构细节、许可证和后训练方法。
预览期间,Mistral对每百万输入token收费0.68美元,每百万输出token收费2.09美元。缓存输入价格为0.07美元。文档中还列出了双倍价格:输入1.36美元、输出4.18美元、缓存输入0.14美元。ML4还将作为新一代专用Mistral模型的基础。
几个月来,Mistral一直在欧洲建设自己的基础设施。今年3月,该公司获得了一笔 8.3亿美元贷款,用于在巴黎附近建设数据中心,计划到2027年底在欧洲实现200兆瓦的算力容量。该公司似乎正在将重心从消费者转向企业客户。今年5月,Mistral 将其聊天机器人Le Chat更名为Vibe,并将其重构为一款工作工具.
同月,Mistral首席执行官Arthur Mensch 向法国议会一个委员会警告称,欧洲面临在网络安全方面依赖美国模型的风险。Mensch表示,法国军方的代码库不应由Anthropic的Mythos进行扫描。他补充说,Mistral自己的模型可以发现与Mythos相关的同样的漏洞。
没有炒作的AI新闻 – 人工精选
订阅THE DECODER,享受无广告阅读、每周AI时事通讯、每年六期的独家“AI Radar”前沿报告、完整档案访问权限以及评论区访问权限。
来源: Mistral