Reflection AI 发布了其首个开放权重模型 Beam。Beam 是一款稀疏混合专家(MoE)模型,总参数量为 501B,每个 token 激活 23B 参数,专为编程、推理和智能体工作负载而构建。 据 Reflection AI 团队称,Beam 直接与 GLM 5.2 等更大的开放模型竞争,同时在推理基准上使用少 3 到 4 倍的推理计算量。
它现在可以部署吗? 目前还无法自行托管。Beam 正处于最后的红队测试阶段。早期访问通过 Reflection 平台的 候补名单进行.
什么是 Reflection Beam?
Beam 是由 Reflection AI 从零开始训练的通用智能体模型。它面向企业编程和智能体工作负载。Reflection 将 Beam 定位为推进西方开放权重前沿。研究团队对差距直言不讳:Kimi K3 在原始能力上仍然领先,因此 Beam 的卖点在于推理时的效率。
用户可以使用一个 推理力度参数。较低的设置偏向简短回答。较高的设置允许对困难任务进行更长的推理。团队可以根据任务难度和计算预算匹配力度。
Beam 的预训练方式
Beam 在来自网络、公开来源和专有授权数据集的 23.8 万亿 token 上进行了预训练。Reflection 团队表示,其数据筛选去除了约 95% 的原始互联网 token,同时保留了大约 1.8 万亿个传统过滤器会丢弃的高质量 token。
该架构将局部和全局注意力与细粒度路由专家交织在一起。负载平衡建立在 DeepSeek-V3 的无辅助损失平衡基础上,并增加了专家偏置更新的余弦衰减。在预训练结束时,最繁忙的专家仅达到平均负载的 1.04 倍。在全部 52 层中,通过基于深度的缩放、SandwichNorm、注意力门控和 FP32 残差累加,残差范数保持有界。
预训练在 6,144 块 NVIDIA GB300 NVL72 GPU 上于不到 4 周内完成。接近尾声时有效吞吐达到 92.3%,共进行了 9 次半自动回滚。中期训练将有效上下文扩展到 1M token。
高计算量强化学习
强化学习是 Beam 的核心扩展维度。此次训练使用了 10.5K 块 NVIDIA GB300 GPU,历时 4 周,生成了超过 100 million 个 rollout。最大 rollout 上下文为 256K token。训练和评分在近 1 million 个编程、智能体和 STEM 环境中消耗了约 1.3 billion 个沙箱。
Reflection 使用 完全异步策略梯度进行训练。每个 token 都标记有生成它的策略版本。新算法即使在一天的陈旧度、落后当前策略 107 个权重版本的情况下也能保持学习稳定。团队报告称,随着强化学习计算量的增加,没有出现平台期。
基础设施数字令人瞩目。系统平均维持 110K 个并发 rollout。新权重到达推理集群的中位时间约为 12 秒。71 起推理事故在不停止训练的情况下得到处理。
一个可控的长度惩罚教会 Beam 用更少的 token 解决任务。即使强化学习混合中没有浏览任务,浏览技能也得到了提升,这表明在智能体领域之间存在迁移。
安全与对齐
Reflection 从预训练检查点训练了一个单独的安全与对齐教师模型,并使用多教师在线策略蒸馏将其与强化学习教师模型合并。安全训练使用了 审慎对齐。安全评估结果将出现在技术报告中。
基准测试(Reflection 报告)
在 SWE-bench Verified 上,Beam 得分为 80.9,而 Nemotron 3 Ultra 为 70.7。在 Terminal Bench v2.1 上,Beam 得分为 80.1,接近得分 81.0 的 GLM 5.2。DeepSeek V4.1 Flash(90.6)和 Kimi K3(88.3)在该项上领先。这些数字来自 Reflection 的表格,其中对手的分数来源于 Artificial Analysis 和 DataCurve。
Beam 与最接近的开源权重竞争对手对比
| 功能 | Reflection Beam | GLM-5.2 | Nemotron 3 Ultra | DeepSeek V4.1 Flash | Kimi K3 |
|---|---|---|---|---|---|
| 开发商 | Reflection AI(美国) | Z.ai(中国) | NVIDIA(美国) | DeepSeek(中国) | Moonshot AI(中国) |
| 总参数量 | 501B | ~753B | 550B | 552B backbone + 196B Engram | 2.8T |
| 激活参数量 | 23B | ~40B | 55B | 8B prefill / 16B decode | 104B |
| 上下文 | 1M(有效) | 1M | 最高 1M | 1M | 1M |
| 输入 | 文本 | 文本 | 文本 | 文本 + 图像 | 文本 + 图像 |
| 许可证 | Apache 2.0(计划中) | MIT | OpenMDW-1.1 | MIT | Kimi K3 License |
| 权重 | 2026年10月晚些时候 | 可用 | 可用 | 可用 | 可用 |
| Terminal Bench v2.1* | 80.1 | 81.0 | 56.4 | 90.6 | 88.3 |
| 来源 | Reflection | Hugging Face | NVIDIA | Hugging Face | Hugging Face |
*分数来自Reflection的Beam发布公告。规格于2026年10月5日核实。
Beam是这里总参数量最小的模型。其23B的激活参数量低于GLM-5.2、Nemotron 3 Ultra和Kimi K3。Apache 2.0和MIT是标准的宽松许可证。Kimi K3的自定义许可证对超大规模产品增加了署名要求。
要点
- Beam是一个501B的MoE模型,激活参数量为23B,仅支持文本,有效上下文为1M。
- 预训练使用了23.8T token,在6,144块NVIDIA GB300 GPU上耗时不到4周。
- 强化学习在10.5K块GB300 GPU上进行了4周、超过100M次rollout。
- Reflection报告其在SWE-bench Verified上得分为80.9,在Terminal Bench v2.1上得分为80.1。
- Apache 2.0权重计划于本月晚些时候发布。
本文 Reflection AI推出Beam:一个具有23B激活参数、面向编程和智能体工作负载的501B开放权重MoE模型 首发于 MarkTechPost.