ReflectionのBeam、中国製以外で最も高性能なオープンウェイトモデルに
Jonathan Kemper
Jonathan KemperのLinkedInプロフィールを見る
2026年10月6日
Reflection
要点
- AIスタートアップのReflectionが、コーディングと推論のために構築された初のオープンウェイトモデル「Beam」をリリースします。生の性能よりも計算効率に焦点を置いています。
- Reflectionによると、Beamは5,010億のパラメータのうちトークンごとにわずか230億を活性化し、3~4分の1の計算資源で主要なベンチマークにおいてGLM 5.2に匹敵する性能を発揮します。
- このモデルは10,500基のNvidia GPUを用いて4週間にわたり強化学習で訓練されました。Apache 2.0ライセンスで「今月後半」にリリースされる予定です。
AI企業のReflectionが、初めて無料で利用可能なモデル「Beam」を発表しました。ピーク性能の追求ではなく、最小限の計算資源で強力な結果を提供することを目指すBeamは、DeepSeekやQwenの中国製オープンウェイトモデルと直接競合します。
Reflectionは、コーディング、論理的推論、エージェント的タスク向けにBeamを構築しました。このMixture-of-Expertsモデルは、5,010億の総パラメータのうちトークンごとに230億を活性化し、計算コストを比較的低く抑えています。
要求の厳しい推論タスクにおいて、Beamは GLM 5.2 と同等の性能を、Reflectionによれば3~4分の1の計算資源で発揮します。同社は、AIをコーディングや自動化されたワークフローに利用しつつ、運用コストを抑える必要がある企業を狙っています。
コーディングとエージェントのベンチマークにおいて、Beamははるかに大きな Qwen3.8-Maxにも肉薄します。ただし同社によると、 Kimi K3 のようなより強力なオープンモデルは、生の性能では依然としてBeamを上回っています。Reflectionは、上位のオープンモデルとの残りの差を埋めることを目指す後継モデルをすでに訓練中だと述べています。広告

| エージェント型コーディングベンチマーク | Beam | Inkling | Nemotron 3 Ultra | GLM 5.2 | GLM 5.3 | Kimi K3 | Qwen 3.8 Max | DeepSeek V4.1 Flash |
|---|---|---|---|---|---|---|---|---|
| DeepSWE v1.1 | 44.4 | NR | NR | 44.0 | 61.0 | 68.0 | 51.0 | 74.2 |
| SWE Bench Pro v2-Hard | 77.2 | 56.9 | NR | NR | 84.3 | 88.2 | NR | NR |
| SWE Bench Pro v1 | 65.5 | 54.3 | 46.4 | 62.1 | NR | NR | 67.7 | NR |
| Terminal Bench v2.1 | 80.1 | 63.8 | 56.4 | 81.0 | 88.2 | 88.3 | 86.6 | 90.6 |
| SWE Atlas Codebase QnA | 34.6 | NR | NR | NR | 61.0 | 68.0 | NR | NR |
| SWEBench Multilingual | 78.0 | NR | 67.7 | NR | NR | NR | NR | NR |
| SWEBench Verified | 80.9 | 77.6 | 70.7 | NR | NR | NR | NR | NR |
大規模な強化学習ランがBeamの能力を支える
Beamの能力は、標準的な大規模事前学習と、特に計算量の多い強化学習フェーズの組み合わせから得られています。Reflection社によると、同社はこのRLフェーズでNvidia GB300 GPU 10,500基を4週間以上実行し、これはオープンなラボが行った中で最大級のトレーニングランの一つだとしています。パフォーマンスはランの終わりまで向上を続け、頭打ちにはなりませんでした。

ユーザーは、Beamが問題をどの程度深く推論するかも制御できます。調整可能なパラメータにより、モデルに素早く回答させるか、難しいタスクにより多くの時間をかけて思考させるかを選択でき、計算コストと出力品質のトレードオフを調整できます。

Reflection社はトレーニング中に「創発的能力」と呼ぶ現象を観察しました。推論、ソフトウェアエンジニアリング、ターミナルタスクを混ぜたRLを実行中、同社はブラウジングタスクがそのトレーニングミックスに含まれていなかったにもかかわらず、Beamがウェブブラウジングを上達させていくことに気づきました。ウェブアクセスを許可されると、モデルは他の言語モデルへの問い合わせや外部サービスからのドキュメント取得を独自に学習しました。
Reflection社は複数のデモを公開しており、リアルタイム更新されるニューヨーク市の地下鉄路線図、小さな3Dゲーム、別のAIモデルをファインチューニングするためのノートブックなどが含まれています。Beamはテキスト専用ですが、Reflection社によれば、他のメディア形式のコンテンツもテキストとして表現されていれば処理できるといいます。Ad
安全性とアライメントは別のモデルが担当
安全性とアライメントのために、Reflectionは2つ目のモデルを訓練し、それをBeamに統合しました。ガイドラインは、モデルが決して破ってはならないハードルールから、事実の正確性や不確実性を認めることといった品質基準、さらに直接的で徹底的かつプロアクティブな応答スタイルに至るまで多岐にわたります。同社は安全性テストの結果を技術レポートとして公開し、開発した評価手法をオープンソース化する計画です。
同社によると、技術レポート、開発者向けドキュメント、そしてApache 2.0オープンライセンスのモデルウェイトは「今月後半」に公開される予定です。Beamは現在、最終的な安全性テストが進められており、現時点では一部のユーザーに早期版が提供されています。
元DeepMindの研究者、20億ドルの支援を受ける
Reflectionは2024年に、元Google DeepMindの研究者であるMisha Laskin氏とIoannis Antonoglou氏によって設立されました。Laskin氏はGeminiの報酬モデリングを統括し、Antonoglou氏はAlphaGoの開発に貢献しました。同スタートアップは2025年3月に創業し、 「130百万ドルのシード資金」 そして、自律的なコーディングによってスーパーインテリジェンスを構築するという目標。そのビジョンは、言語モデルがコンピュータ上での強化学習を用いて、AlphaGoが囲碁を指すのと同じように自律的に行動することを学べるというものでした。
2025年夏、同社はリリースした アシモフ、大規模なコードベースを分析するエージェントです。その後、Reflectionは 80億ドルの評価額で20億ドル 2025年10月にNvidiaを投資家に迎えて設立され、以来、DeepseekやQwenに対する西側の対抗馬としての位置づけを確立してきました。同社はモデルのウェイトを公開していますが、訓練データとパイプラインは非公開としています。最近では、Reflectionが数十億ドル規模のコンピュート取引を SpaceX そして クラウドプロバイダーのNebius.
誇張なしのAIニュース – 人間によるキュレーション
「THE DECODER」を購読すると、広告のない閲覧、週刊のAIニュースレター、年6回の限定「AI Radar」フロンティアレポート、全アーカイブへのアクセス、コメント欄へのアクセスが利用できます。
出典: 考察