Ling 3.1 Flash 在智能水平上较其前代取得大幅提升,在 Artificial Analysis Intelligence Index 上得分为 41,尤其在智能体能力方面改进显著
@AntLingAGI 已发布 Ling 3.1 Flash,这是一款总参数量为 560B、激活参数量为 25B、上下文窗口为 1M token 的推理模型。它在 Artificial Analysis Intelligence Index v4.3 上得分为 41,高于 8 月发布的 Ling 3.0 Flash 的 20 分。Ling 3.1 Flash 预计将开放权重,蚂蚁集团即将发布权重。
主要结果:
➤ Ling 3.1 Flash 较其前代提升了智能体能力。凭借 GDPval-AA v2 Elo 1,622 分和 AA-Briefcase Elo 1,400 分,该模型可媲美 GLM-5.3-Flash、Gemini 3.8 Flash(high)和 DeepSeek V4.1 Flash(Max)等同类模型。Ling 3.1 Flash 在 AutomationBench-AA(62%)和 Terminal-Bench v4.0(33%)上也取得了显著进步。
➤ Ling 3.1 Flash 在 AA-Omniscience 上得分为 +2,较 Ling 3.0 Flash(-18)提升了 22 分。与前代相比,其准确率从 18% 提升到 29%,而幻觉率在相近的尝试率下(56% 到 58%)从 44% 降至 38%,表明提升主要来自知道更多,而非更多弃答。作为对比,DeepSeek V4.1 Flash(Max)的幻觉率为 97%。
➤ Ling 3.1 Flash 是一款比前代更大的模型,定价相应提高,但 token 效率更高。其总参数量为 560B、激活参数量为 25B,高于 Ling 3.0 Flash 的 124B 和 5.1B,定价为每 1M 输入/输出 token 0.30 美元/0.90 美元,高于之前的 0.075 美元/0.22 美元。运行 Intelligence Index 共使用 218M 输出 token,比 Ling 3.0 Flash(261M)少 16%。
➤ Ling 3.1 Flash 的单任务成本高于部分同类模型,但仍处于最具吸引力的象限。Ling 3.1 Flash 每任务成本为 0.99 美元,远高于 GLM-5.3-Flash(0.42 美元)和 DeepSeek V4.1 Flash(Max,0.32 美元),但低于 1.24 美元的 Gemini 3.8 Flash(High)。
其他模型细节:
➤ 规模:总参数量 560B,激活参数量 25B
➤ 上下文窗口:1M token
➤ 定价:每 1M 输入 token 0.30 美元、每 1M 输出 token 0.90 美元,缓存输入为每 1M 0.06 美元(80% 折扣)
➤ 可用性:可通过 Novita AI 访问,权重即将发布

