The Decoder

Le rayon de réflexion devient le modèle ouvert de poids ouvert le plus performant construit en dehors de la Chine

Reflection a sorti Beam, son premier modèle de poids ouvert. Le système de mixte d’experts active seulement 23 milliards de ses 501 milliards de paramètres par token, et vise à rivaliser avec GLM 5.2 en matière de codage…

Jonathan Kemper
Source de l’image · The Decoder

Le Reflection’s Beam est le modèle de poids ouvert le plus performant construit en dehors de la Chine

Jonathan Kemper Jonathan Kemper Voir le profil LinkedIn de Jonathan Kemper 6 octobre 2026 Image description  Réflexion

Points clés

  • La start-up en IA Reflection lance Beam, son premier modèle de poids ouvert conçu pour le codage et la raisonnement, en mettant l’accent sur l’efficacité computationnelle plutôt que sur les performances brutes.
  • Selon Reflection, Beam active seulement 23 milliards de ses 501 milliards de paramètres par token, et correspond à GLM 5.2 sur les principaux critères d’évaluation, tout en utilisant trois à quatre fois moins de puissance de calcul.
  • Le modèle a été entraîné par apprentissage renforceur sur 10 500 GPU Nvidia en quatre semaines. Il sera livré « plus tard ce mois-ci » sous la licence Apache 2.0.

La société d’IA Reflection a annoncé Beam, son premier modèle disponible gratuitement. Au lieu de chercher à atteindre des performances maximales, Beam vise à offrir de bons résultats avec un nombre minimal de calculs, se mettant ainsi en compétition directe avec les modèles chinois open-weight de Deepseek et Qwen.

La Reflection a été conçue pour le codage, la raison logique et les tâches agentes. Le modèle de mélange d’experts active 23 milliards de ses 501 milliards de paramètres totaux par token, ce qui maintient les coûts de calcul relativement bas.

Dans les tâches de raisonnement exigeantes, Beam utilise GLM 5.2, avec trois à quatre fois moins de puissance de calcul, selon Reflection. L’entreprise cible les entreprises qui utilisent l’IA pour le codage et les processus automatisés, mais qui doivent maintenir leurs coûts d’exploitation sous contrôle.

Sur les benchmarks de codage et d’agents, Beam se rapproche également du plus grand Qwen3.8-Max. Des modèles ouverts plus puissants comme Kimi K3 surpassent encore Beam en termes de performance brute, selon l’entreprise. Reflection annonce qu’elle entraîne déjà un successeur visant à combler le fossé restant par rapport aux modèles ouverts les plus performants.

Three scatter plots for DeepSWE v1.1, HLE, and Terminal Bench 2.1 show benchmark scores for Beam, GLM-5.2, Qwen 3.8, Inkling, Nemotron 3 Ultra, and Muse Glimmer plotted against estimated compute cost in PFLOP per attempt.
Dans les trois benchmarks, Beam obtient des scores comparables tout en utilisant beaucoup moins de calcul que GLM-5.2 et Qwen 3.8, selon Reflection. | Image : Reflection
Études de performance du codage agentique Lignes de feu Inkling Nemotron 3 Ultra GLM 5.2 GLM 5.3 Kimi K3 Qwen 3.8 Max DeepSeek V4.1 Flash
DeepSWE v1.1 44.4 NR NR 44.0 61.0 68.0 51.0 74.2
SWE Bench Pro v2-Hard 77.2 56.9 NR NR 84.3 88.2 NR NR
SWE Bench Pro v1 65.5 54.3 46.4 62.1 NR NR 67.7 NR
Terminal Bench v2.1 80.1 63.8 56.4 81.0 88.2 88.3 86.6 90.6
SWE Atlas Codebase QnA 34.6 NR NR NR 61.0 68.0 NR NR
SWEBench Multilingue 78.0 NR 67.7 NR NR NR NR NR
SWEBench Verified 80.9 77.6 70.7 NR NR NR NR NR

Renforcement massive de l'apprentissage automatique alimentant les capacités de Beam

Le Beam tire ses capacités d’une combinaison de pré-entraînement à grande échelle et d’une phase d’apprentissage par renforcement particulièrement intensive en calcul. La Reflection indique avoir utilisé 10 500 GPU Nvidia GB300 pendant plus de quatre semaines durant cette phase d’apprentissage par renforcement, ce qui constitue l’une des plus grandes expériences d’entraînement jamais réalisées dans un laboratoire ouvert. Les performances se sont améliorées tout au long de la période d’entraînement, sans jamais atteindre un plafond.

Three line charts show Beam's scores on DeepSWE, HLE, and Terminal Bench 2.1 climbing steadily as the number of reinforcement learning rollouts increases to over 80 million.
Les scores de benchmark de Beam ont continué à augmenter dans le domaine du apprentissage par renforcement, sans signe de stagnation même avec plus de 80 millions de déploiements. | Image : Réflexion

Les utilisateurs peuvent également contrôler dans quelle mesure Beam analyse un problème. Un paramètre réglable permet de choisir si le modèle répond rapidement ou met plus de temps à réfléchir sur des tâches plus difficiles, en équilibrant le coût de calcul et la qualité du résultat.

Three scatter plots for DeepSWE v1.1, HLE, and Terminal Bench 2.1 show benchmark scores for Beam and competing models plotted against the average number of generated tokens.
Mesuré par le nombre de tokens générés, Beam fonctionne également plus efficacement que GLM-5.2 et Qwen 3.8 à des niveaux de performance similaires. | Image : Réflexion

La réflexion a observé ce qu’elle appelle "capacités émergentes" pendant l’entraînement. Lorsque la société exécute une combinaison de raisonnement par RL, d’ingénierie logicielle et de tâches terminal, elle a constaté que Beam devenait meilleur dans la navigation web, même si aucune tâche de navigation n’était incluse dans cette combinaison d’entraînement. Grâce à l’accès au web, le modèle a appris indépendamment à interroger d’autres modèles linguistiques et à récupérer des documents depuis des services externes.

Reflection a partagé plusieurs démos, y compris une carte du métro de New York en temps réel, un petit jeu 3D et un cahier pour affiner un autre modèle d’IA. Beam est uniquement texte, mais Reflection indique qu’il peut traiter des contenus provenant d’autres formats de médias, à condition qu’ils soient représentés en texte.

Un modèle distinct gère la sécurité et l’alignement

Pour sécurité et alignement, Reflection a entraîné un deuxième modèle et l’a fusionné avec Beam. Les directives couvrent des règles strictes que le modèle ne doit jamais enfreindre, ainsi que des normes de qualité telles que la précision factuelle et l’admission de l’incertitude, accompagnées d’un style de réponse direct, exhaustif et proactif. L’entreprise prévoit de publier les résultats de ses tests de sécurité dans un rapport technique et de rendre les méthodes d’évaluation qu’elle a développées open source.

Un rapport technique, une documentation pour développeurs et les poids des modèles, sous la licence open Apache 2.0, sont prévues pour être livrés « plus tard ce mois-ci », selon l’entreprise. Beam est encore en phase de tests de sécurité finales, et une version préliminaire est disponible pour les utilisateurs choisis pour l’instant.

Anciens chercheurs de Deepmind soutenus par 2 milliards de dollars

Reflection a été fondée en 2024 par Misha Laskin et Ioannis Antonoglou, anciens chercheurs de Google Deepmind. Laskin a dirigé le modèle de récompense pour Gemini, tandis qu’Antonoglou a contribué à la création d’AlphaGo. La startup a lancé en mars 2025 avec 130 millions de dollars de financement initial, et son objectif est de développer une superintelligence grâce à un codage autonome. La vision était que les modèles de langage pourraient apprendre à agir de manière indépendante, tout comme AlphaGo joue au Go, en utilisant l’apprentissage par renforcement sur ordinateurs.

En été 2025, l’entreprise a lancé Asimov, un agent conçu pour analyser de grands bases de code. Ensuite, en octobre 2025, Reflection a levé 2 milliards de dollars pour une valeur de 8 milliards de dollars, avec Nvidia parmi les investisseurs, et s’est depuis positionné comme une version occidentale de Deepseek et Qwen. L’entreprise publie ses poids de modèle mais garde les données d’entraînement et les pipelines propriétaires. Récemment, Reflection a signé des contrats de calcul à milliards de dollars avec SpaceX et le fournisseur de cloud Nebius.

Nouvelles en IA sans hype – sélectionnées par des humains

Abonnez-vous à THE DECODER pour une lecture sans publicités, un bulletin informatif sur l’IA hebdomadaire, notre rapport spécial « AI Radar » six fois par an, un accès complet aux archives, et un accès à notre section de commentaires.

Source : Reflection
Source originale

The Decoder

À propos du contenu

La publication originale et les droits appartiennent à la source.

Traduction automatique · Consultez l’original