Das Reflection’s Beam ist das leistungsstärkste offene Gewichtsmodell, das außerhalb Chinas entwickelt wurde
Jonathan Kemper
Sehen Sie das LinkedIn-Profil von Jonathan Kemper
Oct 6, 2026
ReflexionWichtige Punkte
- Die AI-Startup Reflection veröffentlicht Beam, ihr erstes offenes Gewicht-Modell, das für Programmieren und Denken entwickelt wurde, wobei der Schwerpunkt auf Rechenleistung und Effizienz liegt.
- Laut Reflection aktiviert Beam nur 23 Milliarden seiner 501 Milliarden Parameter pro Token und entspricht GLM 5.2 bei wichtigen Benchmarken, während es drei bis vier Mal weniger Rechenleistung verbraucht.
- Das Modell wurde über vier Wochen hinweg mit Reinforcement-Learning auf 10.500 Nvidia-GPUs trainiert. Es wird „später dieses Monat“ unter der Apache 2.0-Lizenz veröffentlicht werden.
Die AI-Firma Reflection hat Beam veröffentlicht, ihren ersten frei verfügbaren Modell. Anstatt nach maximaler Leistung zu streben, zielt Beam darauf ab, mit minimalem Rechenaufwand starke Ergebnisse zu liefern und somit direkt mit den chinesischen offenen-Modellen von Deepseek und Qwen konkurrieren zu können.
Reflection baut Beam für das Programmieren, logisches Denken und agentische Aufgaben. Das Mixture-of-Experts-Modell aktiviert 23 Milliarden seiner insgesamt 501 Milliarden Parameter pro Token, wodurch die Rechenkosten relativ niedrig bleiben.
Bei Fordernden Rechenaufgaben passt Beam GLM 5.2, indem er drei bis vier Mal weniger Rechenleistung verwendet, laut Reflection. Das Unternehmen zielt auf Unternehmen ab, die AI für Programmierung und automatisierte Workflows nutzen, aber ihre Betriebskosten kontrollieren müssen.
Bei der Kodierung und den Agent-Benchmarks kommt Beam auch dem viel größeren Qwen3.8-Max nahe. Stärkere offene Modelle wie Kimi K3 übertrumpfen ihn nach wie vor in der Rohleistung, so das Unternehmen. Reflection gibt an, dass es bereits ein Nachfolger trainiert, der darauf abzielt, den verbleibenden Unterschied zu den leistungsstärksten offenen Modellen zu schließen.

| Agentisches Kodieren-Benchmarks | Beam | Inkling | Nemotron 3 Ultra | GLM 5.2 | GLM 5.3 | Kimi K3 | Qwen 3.8 Max | DeepSeek V4.1 Flash |
|---|---|---|---|---|---|---|---|---|
| DeepSWE v1.1 | 44.4 | NR | NR | 44.0 | 61.0 | 68.0 | 51.0 | 74.2 |
| SWE Bench Pro v2-Hard | 77.2 | 56.9 | NR | NR | 84.3 | 88.2 | NR | NR |
| SWE Bench Pro v1 | 65.5 | 54.3 | 46.4 | 62.1 | NR | NR | 67.7 | NR |
| Terminal Bench v2.1 | 80.1 | 63.8 | 56.4 | 81.0 | 88.2 | 88.3 | 86.6 | 90.6 |
| SWE Atlas Codebase QnA | 34.6 | NR | NR | NR | 61.0 | 68.0 | NR | NR |
| SWEBench Multilingual | 78.0 | NR | 67.7 | NR | NR | NR | NR | NR |
| SWEBench Verifiziert | 80.9 | 77.6 | 70.7 | NR | NR | NR | NR | NR |
Massiv verstärktes Lernen, das die Fähigkeiten von Beam ermöglicht
Die Beam erhält seine Fähigkeiten aus einer Kombination von standardmäßigem großskaligen Vortraining und einer besonders kraftintensiven Reinforcement-Learning-Phase. Die Reflection berichtet, dass während dieser RL-Phase 10.500 Nvidia GB300-GPUs über vier Wochen lang verwendet wurden – dies gilt als eine der größten Trainingsrunde, die jemals in einem offenen Labor durchgeführt wurde. Die Leistung verbesserte sich bis zum Ende der Runde kontinuierlich, ohne einen Höhepunkt zu erreichen.

Benutzer können auch die Intensität bestimmen, mit der Beam ein Problem analysiert. Ein anpassbarer Parameter ermöglicht es Ihnen, zu wählen, ob das Modell schnell antwortet oder mehr Zeit benötigt, um schwierige Aufgaben zu überdenken – dabei wird die Rechenkosten gegenüber der Ausgabequalität ausgeglichen.

Die Reflexion beobachtete, was das Unternehmen als "emergenten Fähigkeiten" bezeichnet, während des Trainings. Während der Ausführung einer RL-Mischung aus Rechenschaft, Softwareentwicklung und Terminalaufgaben bemerkte das Unternehmen, dass Beam im Web-Browsing besser wurde, obwohl keine Browsing-Aufgaben Teil dieser Trainingsmischung waren. Mit dem Web-Zugang lernte das Modell unabhängig erneut, andere Sprachmodelle zu befragen und Dokumente von externen Diensten abzurufen.
Reflection teilte mehrere Demos mit, darunter eine live aktualisierende U-Bahn-Karte von New York City, ein kleines 3D-Spiel und ein Notizbuch zur Feinjustierung eines anderen KI-Modells. Beam ist nur textbasiert, aber Reflection sagt, dass es Inhalte aus anderen Medienformaten verarbeiten kann, solange sie als Text dargestellt sind.
Ein separater Modell verantwortet für Sicherheit und Ausrichtung
Für Sicherheit und Übereinstimmung trainierte Reflection ein zweites Modell und verband es mit Beam. Die Richtlinien umfassen von harte Regeln, die das Modell niemals verletzen darf, bis zu Qualitätsstandards wie faktische Genauigkeit und die Anerkennung von Unsicherheit, sowie einen direkten, gründlichen und proaktiven Reaktionsstil. Das Unternehmen plant, seine Sicherheitstestergebnisse in einem technischen Bericht zu veröffentlichen und die entwickelten Bewertungsmethoden frei zugänglich zu machen.
Ein technischer Bericht, Entwicklerdokumentation und Modellgewichte unter der offenen Apache 2.0-Lizenz sollen laut der Firma „später dieses Monat“ veröffentlicht werden. Beam durchläuft noch die endgültigen Sicherheitstests, und eine frühe Version ist vorerst für ausgewählte Benutzer verfügbar.
Ehemalige Deepmind-Forscher unterstützt von 2 Milliarden Dollar
Die Firma Reflection wurde im Jahr 2024 von den ehemaligen Google Deepmind-Forschern Misha Laskin und Ioannis Antonoglou gegründet. Laskin leitete das Reward-Modell für Gemini, und Antonoglou half bei der Entwicklung von AlphaGo. Das Startup lanzierte im März 2025 mit 130 Millionen Dollar an Seed-Finanzierung und hatte das Ziel, durch autonome Programmierung eine superintelligente Technologie zu entwickeln. Die Vision war, dass Sprachmodelllehre so unabhängig werden könnte wie AlphaGo beim Go-Spiel, indem man auf Computer-Reinforcement-Learning zurückgreift.
Im Sommer 2025 veröffentlichte das Unternehmen Asimov, einen Agenten zur Analyse großer Codebasen. Im Oktober 2025 erzielte Reflection eine 2 Milliarden Dollar bei einer Bewertung von 8 Milliarden Dollar, wobei Nvidia zu den Investoren gehörte. Seitdem positioniert sich das Unternehmen als westlicher Gegenpol zu Deepseek und Qwen. Das Unternehmen veröffentlicht seine Modellgewichte, behält jedoch die Trainingsdaten und -prozesse als Geschäftsgeheimnis. Kürzlich haben Reflection und SpaceX sowie der Cloud-Anbieter Nebius Milliarden-Dollar Computing-Verträge abgeschlossen.
AI-News ohne Hype – von Menschen zusammengestellt
Abonnieren Sie THE DECODER, um eine adsfreie Lektüre, einen wöchentlichen AI-Newsletter, unseren exklusiven „AI Radar“-Report sechsmal jährlich, Zugang zum vollständigen Archiv und Zugang zu unserer Kommentarsektion zu erhalten.
Quelle: Reflection