Le Reflection’s Beam est le modèle de poids ouvert le plus performant construit en dehors de la Chine
Jonathan Kemper
Voir le profil LinkedIn de Jonathan Kemper
6 octobre 2026
RéflexionPoints clés
- La start-up en IA Reflection lance Beam, son premier modèle de poids ouvert conçu pour le codage et la raisonnement, en mettant l’accent sur l’efficacité computationnelle plutôt que sur les performances brutes.
- Selon Reflection, Beam active seulement 23 milliards de ses 501 milliards de paramètres par token, et correspond à GLM 5.2 sur les principaux critères d’évaluation, tout en utilisant trois à quatre fois moins de puissance de calcul.
- Le modèle a été entraîné par apprentissage renforceur sur 10 500 GPU Nvidia en quatre semaines. Il sera livré « plus tard ce mois-ci » sous la licence Apache 2.0.
La société d’IA Reflection a annoncé Beam, son premier modèle disponible gratuitement. Au lieu de chercher à atteindre des performances maximales, Beam vise à offrir de bons résultats avec un nombre minimal de calculs, se mettant ainsi en compétition directe avec les modèles chinois open-weight de Deepseek et Qwen.
La Reflection a été conçue pour le codage, la raison logique et les tâches agentes. Le modèle de mélange d’experts active 23 milliards de ses 501 milliards de paramètres totaux par token, ce qui maintient les coûts de calcul relativement bas.
Dans les tâches de raisonnement exigeantes, Beam utilise GLM 5.2, avec trois à quatre fois moins de puissance de calcul, selon Reflection. L’entreprise cible les entreprises qui utilisent l’IA pour le codage et les processus automatisés, mais qui doivent maintenir leurs coûts d’exploitation sous contrôle.
Sur les benchmarks de codage et d’agents, Beam se rapproche également du plus grand Qwen3.8-Max. Des modèles ouverts plus puissants comme Kimi K3 surpassent encore Beam en termes de performance brute, selon l’entreprise. Reflection annonce qu’elle entraîne déjà un successeur visant à combler le fossé restant par rapport aux modèles ouverts les plus performants.

| Études de performance du codage agentique | Lignes de feu | Inkling | Nemotron 3 Ultra | GLM 5.2 | GLM 5.3 | Kimi K3 | Qwen 3.8 Max | DeepSeek V4.1 Flash |
|---|---|---|---|---|---|---|---|---|
| DeepSWE v1.1 | 44.4 | NR | NR | 44.0 | 61.0 | 68.0 | 51.0 | 74.2 |
| SWE Bench Pro v2-Hard | 77.2 | 56.9 | NR | NR | 84.3 | 88.2 | NR | NR |
| SWE Bench Pro v1 | 65.5 | 54.3 | 46.4 | 62.1 | NR | NR | 67.7 | NR |
| Terminal Bench v2.1 | 80.1 | 63.8 | 56.4 | 81.0 | 88.2 | 88.3 | 86.6 | 90.6 |
| SWE Atlas Codebase QnA | 34.6 | NR | NR | NR | 61.0 | 68.0 | NR | NR |
| SWEBench Multilingue | 78.0 | NR | 67.7 | NR | NR | NR | NR | NR |
| SWEBench Verified | 80.9 | 77.6 | 70.7 | NR | NR | NR | NR | NR |
Renforcement massive de l'apprentissage automatique alimentant les capacités de Beam
Le Beam tire ses capacités d’une combinaison de pré-entraînement à grande échelle et d’une phase d’apprentissage par renforcement particulièrement intensive en calcul. La Reflection indique avoir utilisé 10 500 GPU Nvidia GB300 pendant plus de quatre semaines durant cette phase d’apprentissage par renforcement, ce qui constitue l’une des plus grandes expériences d’entraînement jamais réalisées dans un laboratoire ouvert. Les performances se sont améliorées tout au long de la période d’entraînement, sans jamais atteindre un plafond.

Les utilisateurs peuvent également contrôler dans quelle mesure Beam analyse un problème. Un paramètre réglable permet de choisir si le modèle répond rapidement ou met plus de temps à réfléchir sur des tâches plus difficiles, en équilibrant le coût de calcul et la qualité du résultat.

La réflexion a observé ce qu’elle appelle "capacités émergentes" pendant l’entraînement. Lorsque la société exécute une combinaison de raisonnement par RL, d’ingénierie logicielle et de tâches terminal, elle a constaté que Beam devenait meilleur dans la navigation web, même si aucune tâche de navigation n’était incluse dans cette combinaison d’entraînement. Grâce à l’accès au web, le modèle a appris indépendamment à interroger d’autres modèles linguistiques et à récupérer des documents depuis des services externes.
Reflection a partagé plusieurs démos, y compris une carte du métro de New York en temps réel, un petit jeu 3D et un cahier pour affiner un autre modèle d’IA. Beam est uniquement texte, mais Reflection indique qu’il peut traiter des contenus provenant d’autres formats de médias, à condition qu’ils soient représentés en texte.
Un modèle distinct gère la sécurité et l’alignement
Pour sécurité et alignement, Reflection a entraîné un deuxième modèle et l’a fusionné avec Beam. Les directives couvrent des règles strictes que le modèle ne doit jamais enfreindre, ainsi que des normes de qualité telles que la précision factuelle et l’admission de l’incertitude, accompagnées d’un style de réponse direct, exhaustif et proactif. L’entreprise prévoit de publier les résultats de ses tests de sécurité dans un rapport technique et de rendre les méthodes d’évaluation qu’elle a développées open source.
Un rapport technique, une documentation pour développeurs et les poids des modèles, sous la licence open Apache 2.0, sont prévues pour être livrés « plus tard ce mois-ci », selon l’entreprise. Beam est encore en phase de tests de sécurité finales, et une version préliminaire est disponible pour les utilisateurs choisis pour l’instant.
Anciens chercheurs de Deepmind soutenus par 2 milliards de dollars
Reflection a été fondée en 2024 par Misha Laskin et Ioannis Antonoglou, anciens chercheurs de Google Deepmind. Laskin a dirigé le modèle de récompense pour Gemini, tandis qu’Antonoglou a contribué à la création d’AlphaGo. La startup a lancé en mars 2025 avec 130 millions de dollars de financement initial, et son objectif est de développer une superintelligence grâce à un codage autonome. La vision était que les modèles de langage pourraient apprendre à agir de manière indépendante, tout comme AlphaGo joue au Go, en utilisant l’apprentissage par renforcement sur ordinateurs.
En été 2025, l’entreprise a lancé Asimov, un agent conçu pour analyser de grands bases de code. Ensuite, en octobre 2025, Reflection a levé 2 milliards de dollars pour une valeur de 8 milliards de dollars, avec Nvidia parmi les investisseurs, et s’est depuis positionné comme une version occidentale de Deepseek et Qwen. L’entreprise publie ses poids de modèle mais garde les données d’entraînement et les pipelines propriétaires. Récemment, Reflection a signé des contrats de calcul à milliards de dollars avec SpaceX et le fournisseur de cloud Nebius.
Nouvelles en IA sans hype – sélectionnées par des humains
Abonnez-vous à THE DECODER pour une lecture sans publicités, un bulletin informatif sur l’IA hebdomadaire, notre rapport spécial « AI Radar » six fois par an, un accès complet aux archives, et un accès à notre section de commentaires.
Source : Reflection