Mistral 发布了 Mistral Large 4,在 Artificial Analysis 智能指数上得分 38;法国重新拥有了美中之外最智能的模型
@MistralAI 以 Research Public Preview 形式发布了 Mistral Large 4,并计划于 10 月底发布该 1T 参数(49B 激活)模型的权重。它在 Artificial Analysis 智能指数上取得 38 分,与 GPT-6 Luna(max,38)和 DeepSeek V4.1 Flash(max,39)相当。它还在 Artificial Analysis 网络安全指数上取得 50%,与 GLM-5.3-Flash 持平,并领先于 Kimi K3 和 DeepSeek V4.1 Flash(max)等模型。
Mistral Large 4 Preview 的关键基准测试结果:
➤ 美中之外最智能的模型:Mistral Large 4 Preview 在智能指数上得分 38,与 DeepSeek V4.1 Flash(max,39)和 GPT-6 Luna(max,38)相当。这使其成为美中之外最智能的模型,领先于韩国和阿拉伯联合酋长国等国家
➤ 网络防御能力与 GLM-5.3-Flash 持平:Mistral Large 4 Preview 在 Artificial Analysis 网络安全指数上得分 50,与 GLM-5.3-Flash(50)持平,落后于 MiMo-V2.6-Pro(56)。一旦其权重发布,它将在网络安全指数上位列开放权重模型前三。其最强成绩是在 CyberGym-E2E-AA 上,得分为 82%,领先于 MiMo-V2.6-Pro(79%)和 GPT-6 Luna(max,78%)
➤ 每任务成本是同等智能水平开放权重模型的 4 倍以上:Mistral Large 4 Preview 按标准定价(每 1M 输入/输出 token 为 1.36 美元/4.18 美元)计算,每个智能指数任务的成本为 1.13 美元,缓存输入 token 为每 1M 0.14 美元。前两周 Mistral Large 4 Preview 将以 50% 的发布折扣提供服务,使其每任务成本降至 0.57 美元。这仍高于 GLM-5.3-Flash(0.25 美元)和 DeepSeek V4.1 Flash(max,0.27 美元)
➤ 强大的文档和图像推理能力:Mistral Large 4 Preview 在 GDP.pdf 上得分 19%,与 MiMo-V2.6-Pro(19%)持平,落后于 Kimi K3(22%)。相比 Mistral Large 3 提升了 18 个百分点,部分得益于其 API 的改进,现在每次请求可接受 100 张图像,而此前的 Mistral 模型为 8 张
关键模型细节:
➤ 上下文窗口:512k token
➤ 多模态:文本和图像输入,文本输出
➤ 定价:每 1M 输入/输出 token 1.36 美元/4.18 美元(缓存输入 token 每 1M 0.14 美元),前两周享 50% 折扣(0.68 美元/2.09 美元)
➤ 可用性:在 Mistral 的 API 上以 Research Public Preview 形式提供,开放权重计划于 10 月底发布

