MarkTechPost更新于

Reflection AI 推出 Beam:一款拥有 501B 参数、23B 激活参数的开放权重 MoE 模型,面向编码与智能体工作负载

Reflection AI发布首个开放权重模型Beam,为501B稀疏MoE、每token激活23B参数,面向编程、推理与智能体任务。文章称其以3至4倍更少推理算力对标GLM 5.2,并给出SWE-bench Verified 80.9等自报成绩。Beam仍在最终红队测试,仅通过候补名单早期访问,Apache 2.0权重计划本月晚些时候发布。

Reflection AI 发布了其首个开放权重模型 Beam。Beam 是一款稀疏混合专家(MoE)模型,总参数量为 501B,每个 token 激活 23B 参数,专为编程、推理和智能体工作负载而构建。 据 Reflection AI 团队称,Beam 直接与 GLM 5.2 等更大的开放模型竞争,同时在推理基准上使用少 3 到 4 倍的推理计算量。

它现在可以部署吗? 目前还无法自行托管。Beam 正处于最后的红队测试阶段。早期访问通过 Reflection 平台的 候补名单进行.

什么是 Reflection Beam?

Beam 是由 Reflection AI 从零开始训练的通用智能体模型。它面向企业编程和智能体工作负载。Reflection 将 Beam 定位为推进西方开放权重前沿。研究团队对差距直言不讳:Kimi K3 在原始能力上仍然领先,因此 Beam 的卖点在于推理时的效率。

用户可以使用一个 推理力度参数。较低的设置偏向简短回答。较高的设置允许对困难任务进行更长的推理。团队可以根据任务难度和计算预算匹配力度。

Beam 的预训练方式

Beam 在来自网络、公开来源和专有授权数据集的 23.8 万亿 token 上进行了预训练。Reflection 团队表示,其数据筛选去除了约 95% 的原始互联网 token,同时保留了大约 1.8 万亿个传统过滤器会丢弃的高质量 token。

该架构将局部和全局注意力与细粒度路由专家交织在一起。负载平衡建立在 DeepSeek-V3 的无辅助损失平衡基础上,并增加了专家偏置更新的余弦衰减。在预训练结束时,最繁忙的专家仅达到平均负载的 1.04 倍。在全部 52 层中,通过基于深度的缩放、SandwichNorm、注意力门控和 FP32 残差累加,残差范数保持有界。

预训练在 6,144 块 NVIDIA GB300 NVL72 GPU 上于不到 4 周内完成。接近尾声时有效吞吐达到 92.3%,共进行了 9 次半自动回滚。中期训练将有效上下文扩展到 1M token。

高计算量强化学习

强化学习是 Beam 的核心扩展维度。此次训练使用了 10.5K 块 NVIDIA GB300 GPU,历时 4 周,生成了超过 100 million 个 rollout。最大 rollout 上下文为 256K token。训练和评分在近 1 million 个编程、智能体和 STEM 环境中消耗了约 1.3 billion 个沙箱。

Reflection 使用 完全异步策略梯度进行训练。每个 token 都标记有生成它的策略版本。新算法即使在一天的陈旧度、落后当前策略 107 个权重版本的情况下也能保持学习稳定。团队报告称,随着强化学习计算量的增加,没有出现平台期。

基础设施数字令人瞩目。系统平均维持 110K 个并发 rollout。新权重到达推理集群的中位时间约为 12 秒。71 起推理事故在不停止训练的情况下得到处理。

一个可控的长度惩罚教会 Beam 用更少的 token 解决任务。即使强化学习混合中没有浏览任务,浏览技能也得到了提升,这表明在智能体领域之间存在迁移。

安全与对齐

Reflection 从预训练检查点训练了一个单独的安全与对齐教师模型,并使用多教师在线策略蒸馏将其与强化学习教师模型合并。安全训练使用了 审慎对齐。安全评估结果将出现在技术报告中。

基准测试(Reflection 报告)

在 SWE-bench Verified 上,Beam 得分为 80.9,而 Nemotron 3 Ultra 为 70.7。在 Terminal Bench v2.1 上,Beam 得分为 80.1,接近得分 81.0 的 GLM 5.2。DeepSeek V4.1 Flash(90.6)和 Kimi K3(88.3)在该项上领先。这些数字来自 Reflection 的表格,其中对手的分数来源于 Artificial Analysis 和 DataCurve。

Beam 与最接近的开源权重竞争对手对比

功能Reflection BeamGLM-5.2Nemotron 3 UltraDeepSeek V4.1 FlashKimi K3
开发商Reflection AI(美国)Z.ai(中国)NVIDIA(美国)DeepSeek(中国)Moonshot AI(中国)
总参数量501B~753B550B552B backbone + 196B Engram2.8T
激活参数量23B~40B55B8B prefill / 16B decode104B
上下文1M(有效)1M最高 1M1M1M
输入文本文本文本文本 + 图像文本 + 图像
许可证Apache 2.0(计划中)MITOpenMDW-1.1MITKimi K3 License
权重2026年10月晚些时候可用可用可用可用
Terminal Bench v2.1*80.181.056.490.688.3
来源ReflectionHugging FaceNVIDIAHugging FaceHugging Face

*分数来自Reflection的Beam发布公告。规格于2026年10月5日核实。

Beam是这里总参数量最小的模型。其23B的激活参数量低于GLM-5.2、Nemotron 3 Ultra和Kimi K3。Apache 2.0和MIT是标准的宽松许可证。Kimi K3的自定义许可证对超大规模产品增加了署名要求。

要点

  • Beam是一个501B的MoE模型,激活参数量为23B,仅支持文本,有效上下文为1M。
  • 预训练使用了23.8T token,在6,144块NVIDIA GB300 GPU上耗时不到4周。
  • 强化学习在10.5K块GB300 GPU上进行了4周、超过100M次rollout。
  • Reflection报告其在SWE-bench Verified上得分为80.9,在Terminal Bench v2.1上得分为80.1。
  • Apache 2.0权重计划于本月晚些时候发布。

请查看 技术细节 和 抢先体验.

本文 Reflection AI推出Beam:一个具有23B激活参数、面向编程和智能体工作负载的501B开放权重MoE模型 首发于 MarkTechPost.

原始出处

MarkTechPost

内容说明

原始发布及相关权利归来源方。

机器翻译 · 请以原文为准