The Decoder

ReflectionのBeam、中国製以外で最も高性能なオープンウェイトモデルに

Reflectionが初のオープンウェイトモデル「Beam」をリリースしました。このMixture-of-Expertsシステムは、5,010億のパラメータのうちトークンごとにわずか230億を活性化し、GLM…

Jonathan Kemper
画像の出典 · The Decoder

ReflectionのBeam、中国製以外で最も高性能なオープンウェイトモデルに

Jonathan Kemper Jonathan Kemper Jonathan KemperのLinkedInプロフィールを見る 2026年10月6日 Image description Reflection

要点

  • AIスタートアップのReflectionが、コーディングと推論のために構築された初のオープンウェイトモデル「Beam」をリリースします。生の性能よりも計算効率に焦点を置いています。
  • Reflectionによると、Beamは5,010億のパラメータのうちトークンごとにわずか230億を活性化し、3~4分の1の計算資源で主要なベンチマークにおいてGLM 5.2に匹敵する性能を発揮します。
  • このモデルは10,500基のNvidia GPUを用いて4週間にわたり強化学習で訓練されました。Apache 2.0ライセンスで「今月後半」にリリースされる予定です。

AI企業のReflectionが、初めて無料で利用可能なモデル「Beam」を発表しました。ピーク性能の追求ではなく、最小限の計算資源で強力な結果を提供することを目指すBeamは、DeepSeekやQwenの中国製オープンウェイトモデルと直接競合します。

Reflectionは、コーディング、論理的推論、エージェント的タスク向けにBeamを構築しました。このMixture-of-Expertsモデルは、5,010億の総パラメータのうちトークンごとに230億を活性化し、計算コストを比較的低く抑えています。

要求の厳しい推論タスクにおいて、Beamは GLM 5.2 と同等の性能を、Reflectionによれば3~4分の1の計算資源で発揮します。同社は、AIをコーディングや自動化されたワークフローに利用しつつ、運用コストを抑える必要がある企業を狙っています。

コーディングとエージェントのベンチマークにおいて、Beamははるかに大きな Qwen3.8-Maxにも肉薄します。ただし同社によると、 Kimi K3 のようなより強力なオープンモデルは、生の性能では依然としてBeamを上回っています。Reflectionは、上位のオープンモデルとの残りの差を埋めることを目指す後継モデルをすでに訓練中だと述べています。広告

Three scatter plots for DeepSWE v1.1, HLE, and Terminal Bench 2.1 show benchmark scores for Beam, GLM-5.2, Qwen 3.8, Inkling, Nemotron 3 Ultra, and Muse Glimmer plotted against estimated compute cost in PFLOP per attempt.
Reflectionによると、3つのベンチマークすべてにおいて、BeamはGLM-5.2やQwen 3.8よりもはるかに少ない計算資源で同等のスコアを達成しています。| 画像: Reflection
エージェント型コーディングベンチマーク Beam Inkling Nemotron 3 Ultra GLM 5.2 GLM 5.3 Kimi K3 Qwen 3.8 Max DeepSeek V4.1 Flash
DeepSWE v1.1 44.4 NR NR 44.0 61.0 68.0 51.0 74.2
SWE Bench Pro v2-Hard 77.2 56.9 NR NR 84.3 88.2 NR NR
SWE Bench Pro v1 65.5 54.3 46.4 62.1 NR NR 67.7 NR
Terminal Bench v2.1 80.1 63.8 56.4 81.0 88.2 88.3 86.6 90.6
SWE Atlas Codebase QnA 34.6 NR NR NR 61.0 68.0 NR NR
SWEBench Multilingual 78.0 NR 67.7 NR NR NR NR NR
SWEBench Verified 80.9 77.6 70.7 NR NR NR NR NR

大規模な強化学習ランがBeamの能力を支える

Beamの能力は、標準的な大規模事前学習と、特に計算量の多い強化学習フェーズの組み合わせから得られています。Reflection社によると、同社はこのRLフェーズでNvidia GB300 GPU 10,500基を4週間以上実行し、これはオープンなラボが行った中で最大級のトレーニングランの一つだとしています。パフォーマンスはランの終わりまで向上を続け、頭打ちにはなりませんでした。

Three line charts show Beam's scores on DeepSWE, HLE, and Terminal Bench 2.1 climbing steadily as the number of reinforcement learning rollouts increases to over 80 million.
強化学習を通じてBeamのベンチマークスコアは上昇し続け、8,000万回を超えるロールアウト時点でも頭打ちの兆候は見られませんでした。| 画像: Reflection

ユーザーは、Beamが問題をどの程度深く推論するかも制御できます。調整可能なパラメータにより、モデルに素早く回答させるか、難しいタスクにより多くの時間をかけて思考させるかを選択でき、計算コストと出力品質のトレードオフを調整できます。

Three scatter plots for DeepSWE v1.1, HLE, and Terminal Bench 2.1 show benchmark scores for Beam and competing models plotted against the average number of generated tokens.
生成トークン数で測ると、Beamは同等のパフォーマンスレベルにおいてGLM-5.2やQwen 3.8よりも効率的に動作します。| 画像: Reflection

Reflection社はトレーニング中に「創発的能力」と呼ぶ現象を観察しました。推論、ソフトウェアエンジニアリング、ターミナルタスクを混ぜたRLを実行中、同社はブラウジングタスクがそのトレーニングミックスに含まれていなかったにもかかわらず、Beamがウェブブラウジングを上達させていくことに気づきました。ウェブアクセスを許可されると、モデルは他の言語モデルへの問い合わせや外部サービスからのドキュメント取得を独自に学習しました。

Reflection社は複数のデモを公開しており、リアルタイム更新されるニューヨーク市の地下鉄路線図、小さな3Dゲーム、別のAIモデルをファインチューニングするためのノートブックなどが含まれています。Beamはテキスト専用ですが、Reflection社によれば、他のメディア形式のコンテンツもテキストとして表現されていれば処理できるといいます。Ad

安全性とアライメントは別のモデルが担当

安全性とアライメントのために、Reflectionは2つ目のモデルを訓練し、それをBeamに統合しました。ガイドラインは、モデルが決して破ってはならないハードルールから、事実の正確性や不確実性を認めることといった品質基準、さらに直接的で徹底的かつプロアクティブな応答スタイルに至るまで多岐にわたります。同社は安全性テストの結果を技術レポートとして公開し、開発した評価手法をオープンソース化する計画です。

同社によると、技術レポート、開発者向けドキュメント、そしてApache 2.0オープンライセンスのモデルウェイトは「今月後半」に公開される予定です。Beamは現在、最終的な安全性テストが進められており、現時点では一部のユーザーに早期版が提供されています。

元DeepMindの研究者、20億ドルの支援を受ける

Reflectionは2024年に、元Google DeepMindの研究者であるMisha Laskin氏とIoannis Antonoglou氏によって設立されました。Laskin氏はGeminiの報酬モデリングを統括し、Antonoglou氏はAlphaGoの開発に貢献しました。同スタートアップは2025年3月に創業し、 「130百万ドルのシード資金」 そして、自律的なコーディングによってスーパーインテリジェンスを構築するという目標。そのビジョンは、言語モデルがコンピュータ上での強化学習を用いて、AlphaGoが囲碁を指すのと同じように自律的に行動することを学べるというものでした。

2025年夏、同社はリリースした アシモフ、大規模なコードベースを分析するエージェントです。その後、Reflectionは 80億ドルの評価額で20億ドル 2025年10月にNvidiaを投資家に迎えて設立され、以来、DeepseekやQwenに対する西側の対抗馬としての位置づけを確立してきました。同社はモデルのウェイトを公開していますが、訓練データとパイプラインは非公開としています。最近では、Reflectionが数十億ドル規模のコンピュート取引を SpaceX そして クラウドプロバイダーのNebius.

誇張なしのAIニュース – 人間によるキュレーション

「THE DECODER」を購読すると、広告のない閲覧、週刊のAIニュースレター、年6回の限定「AI Radar」フロンティアレポート、全アーカイブへのアクセス、コメント欄へのアクセスが利用できます。

出典: 考察
原文の出典

The Decoder

内容について

原文の公開と権利は出典元に帰属します。

機械翻訳 · 原文をご参照ください