The Decoder

Reflection的Beam成为在中国之外构建的最强开放权重模型

Reflection发布了其首个开放权重模型Beam。这个混合专家系统每个token仅激活其5010亿参数中的230亿,目标是在使用少三到四倍计算量的情况下在编码和推理方面与GLM 5.2匹敌。其对抗Deepseek和Qwen等中国开放权重对手的策略是以效率而非原始性能取胜。文章《Reflection的Beam成为在中国之外构建的最强开放权重模型》最初发表于The Decoder。

Jonathan Kemper
配图来源 · The Decoder

Reflection的Beam成为在中国之外构建的最强开放权重模型

Jonathan Kemper Jonathan Kemper 查看Jonathan Kemper的LinkedIn资料 2026年10月6日 Image description Reflection

要点

  • AI初创公司Reflection正在发布Beam,这是其首个面向编码和推理构建的开放权重模型,重点在于计算效率而非原始性能。
  • 据Reflection称,Beam每个token仅激活其5010亿参数中的230亿,并在关键基准测试中与GLM 5.2持平,同时使用的计算量少三到四倍。
  • 该模型使用10,500块Nvidia GPU经过四周的强化学习训练而成。它将以Apache 2.0许可证于"本月晚些时候"发布。

AI公司Reflection宣布推出Beam,这是其首个免费开放的模型。Beam不追求巅峰性能,而是力求以最小的计算量交付强劲成果,直接与Deepseek和Qwen的中国开放权重模型竞争。

Reflection为编码、逻辑推理和智能体任务构建了Beam。这个混合专家模型每个token激活其5010亿总参数中的230亿,使计算成本保持在相对较低的水平。

据Reflection称,在高难度推理任务上,Beam在匹敌 GLM 5.2 的同时使用的计算量少三到四倍。该公司瞄准的是那些将AI用于编码和自动化工作流、但需要控制运营成本的企业。

在编码和智能体基准测试中,Beam也接近规模大得多的 Qwen3.8-Max。该公司表示,像 Kimi K3 这样更强的开放模型在原始性能上仍然胜过它。Reflection表示,公司已经在训练一个后继模型,旨在弥合与表现最佳的开放模型之间剩余的差距。广告

Three scatter plots for DeepSWE v1.1, HLE, and Terminal Bench 2.1 show benchmark scores for Beam, GLM-5.2, Qwen 3.8, Inkling, Nemotron 3 Ultra, and Muse Glimmer plotted against estimated compute cost in PFLOP per attempt.
据Reflection称,在全部三项基准测试中,Beam在取得可比分数的同时,使用的计算量远少于GLM-5.2和Qwen 3.8。| 图片:Reflection
智能体编码基准测试 Beam Inkling Nemotron 3 Ultra GLM 5.2 GLM 5.3 Kimi K3 Qwen 3.8 Max DeepSeek V4.1 Flash
DeepSWE v1.1 44.4 NR NR 44.0 61.0 68.0 51.0 74.2
SWE Bench Pro v2-Hard 77.2 56.9 NR NR 84.3 88.2 NR NR
SWE Bench Pro v1 65.5 54.3 46.4 62.1 NR NR 67.7 NR
Terminal Bench v2.1 80.1 63.8 56.4 81.0 88.2 88.3 86.6 90.6
SWE Atlas 代码库问答 34.6 NR NR NR 61.0 68.0 NR NR
SWEBench 多语言 78.0 NR 67.7 NR NR NR NR NR
SWEBench Verified 80.9 77.6 70.7 NR NR NR NR NR

大规模强化学习运行提升了 Beam 的能力

Beam 的能力来自标准的大规模预训练与一个计算量特别高的强化学习阶段的结合。Reflection 表示,在强化学习阶段它运行了 10,500 块 Nvidia GB300 GPU,持续超过四周,并称这是所有开放实验室中规模最大的训练运行之一。性能在运行结束前持续提升,没有触及天花板。

Three line charts show Beam's scores on DeepSWE, HLE, and Terminal Bench 2.1 climbing steadily as the number of reinforcement learning rollouts increases to over 80 million.
Beam 的基准测试分数在强化学习过程中持续攀升,即使在超过 80 百万次 rollout 时也没有出现平台期的迹象。| 图片来源:Reflection

用户还可以控制 Beam 对问题进行推理的深入程度。一个可调参数让你可以选择模型是快速回答,还是在更难的任务上花更多时间思考,从而在计算成本与输出质量之间进行权衡。

Three scatter plots for DeepSWE v1.1, HLE, and Terminal Bench 2.1 show benchmark scores for Beam and competing models plotted against the average number of generated tokens.
以生成的 token 数量衡量,Beam 在相近性能水平上也比 GLM-5.2 和 Qwen 3.8 更加高效。| 图片来源:Reflection

Reflection 观察到了它所说的“涌现能力”。在运行一个混合了推理、软件工程和终端任务的强化学习训练时,该公司注意到 Beam 的网页浏览能力也在变强,尽管该训练组合中并不包含浏览任务。借助网络访问,该模型独立学会了查询其他语言模型并从外部服务拉取文档。

Reflection 分享了几个演示,包括一个实时更新的纽约地铁地图、一个小型 3D 游戏以及一个用于微调另一个 AI 模型的笔记本。Beam 是纯文本模型,但 Reflection 表示,只要其他媒体格式的内容以文本形式呈现,它就可以处理这些内容。

一个独立的模型负责安全与对齐

在安全与对齐方面,Reflection 训练了第二个模型并将其与 Beam 合并。这些准则涵盖了模型绝不能违反的硬性规则,以及事实准确性和承认不确定性等质量标准,还有直接、彻底且主动的回应风格。该公司计划在一份技术报告中公布其安全测试结果,并开源其开发的评估方法。

该公司表示,一份技术报告、开发者文档以及采用 Apache 2.0 开源许可证的模型权重将在“本月晚些时候”发布。Beam 仍在进行最终的安全测试,目前早期版本已向部分选定用户开放。

获20亿美元支持的前DeepMind研究人员

Reflection 由前 Google DeepMind 研究员 Misha Laskin 和 Ioannis Antonoglou 于 2024 年创立。Laskin 曾负责 Gemini 的奖励建模,Antonoglou 曾参与构建 AlphaGo。这家初创公司于 2025 年 3 月推出, 1.3亿美元的种子资金 以及通过自主编程构建超级智能的目标。其愿景是,语言模型能够像AlphaGo下围棋那样学会独立行动,即在计算机上使用强化学习。

2025年夏天,该公司发布了 阿西莫夫,一个用于分析大型代码库的智能体。随后反思提出了 以80亿美元估值融资20亿美元 于2025年10月,Nvidia是其投资者之一,此后该公司将自己定位为Deepseek和Qwen的西方对应者。该公司发布其模型权重,但将训练数据和流程保持专有。最近,Reflection签署了价值数十亿美元的计算协议,与 SpaceX 和 云服务商 Nebius.

AI新闻,不炒作 – 由人工精心挑选

订阅 THE DECODER,享受无广告阅读、每周 AI 新闻通讯、每年六期的独家 "AI Radar" 前沿报告、完整档案访问权限以及评论区的访问权限。

来源: 反思
原始出处

The Decoder

内容说明

原始发布及相关权利归来源方。

机器翻译 · 请以原文为准