MarkTechPost

Reflection AI introduit Beam : un modèle MoE ouvert 501B avec 23B de paramètres actifs pour les charges de travail de codage et d’agents

Reflection AI a introduit Beam, son premier modèle de poids ouvert. Il s’agit d’un modèle Mixture-of-Experts 501B sparse avec 23B paramètres actifs, conçu pour les tâches de codage et de travail agentique. Reflection…

Reflection AI a introduit Beam, son premier modèle de poids ouvert. Beam est un modèle Mixture-of-Experts (MoE) épargné, avec 501B de paramètres totaux et 23B d’éléments actifs par token, conçu pour les tâches de codage, de raisonnement et d’agents. Selon l’équipe de Reflection AI, Beam concurrence directement avec des modèles ouverts plus grands comme GLM 5.2, tout en nécessitant 3 à 4 fois moins de calcul d’inférence sur les benchmarks de raisonnement.

Est-ce que cela peut être déployé aujourd’hui ? Pas pour un hébergement autonome pour l’instant. Beam est en phase finale de red-teaming. Un accès précoce est disponible via une liste d’attente sur la plateforme Reflection.

Qu'est-ce que le faisceau de réflexion ?

Beam est un modèle d’agent général entraîné depuis zéro par Reflection AI. Il vise les tâches de codage d’entreprise et les charges de travail agentiques. Reflection considère Beam comme une contribution en faveur de la frontière ouverte occidentale. L’équipe de recherche est honnête sur les écarts existants. Kimi K3 reste en tête en termes de capacité brute, donc le point fort de Beam réside dans l’efficacité au moment de l’inférence.

Les utilisateurs reçoivent un paramètre de l’effort de raisonnement. Les paramètres plus bas favorisent des réponses courtes. Les paramètres plus élevés permettent des raisonnements plus longs pour les tâches difficiles. Les équipes peuvent adapter l’effort aux difficultés des tâches et calculer le budget.

Comment Beam a été pré-entraîné

Le réseau a été pré-entraîné sur 23,8 trillion tokens provenant du web, de sources publiques et de jeux de données licenciés. L’équipe Reflection indique que sa sélection a éliminé environ 95 % des tokens bruts de l’internet. Elle a également conservé environ 1,8 trillion tokens de haute qualité qui auraient été perdus par les filtres conventionnels.

L’architecture mélange l’attention locale et globale avec des experts de routage détaillés. Le équilibrage de charge s’appuie sur l’équilibrage sans perte d’loss assistée issue de DeepSeek-V3, en ajoutant une décroissance cosinusnelle des mises à jour de biais expert. L’expert le plus actif n’a atteint que 1,04 fois la charge moyenne à la fin du pré-entraînement. Sur les 52 couches, les normes résiduelles restent limitées grâce à la scalabilité basée sur la profondeur, SandwichNorm, le gating d’attention et l’accumulation des résidus en FP32.

Pré-entraînement terminé en moins de 4 semaines sur 6 144 GPU NVIDIA GB300 NVL72. La performance globale a atteint 92,3 % vers la fin, avec 9 rétrogradations semi-automatiques. Pendant le entraînement intermédiaire, le contexte efficace a été étendu à 1 M de tokens.

Apprentissage renforcé à haute puissance de calcul

RL est l’axe de scaling central de Beam. L’expérience a utilisé 10,5K GPU NVIDIA GB300 pendant 4 semaines et a généré plus de 100 millions de rollouts. Le contexte maximal de rollout était de 256K tokens. La formation et la notation ont consommé environ 1,3 milliard de sandboxes dans près de 1 million d’environnements de codage, d’agents et de STEM.

La réflexion a été entraînée avec gradiens de politique entièrement asynchrone. Chaque token est étiqueté avec la version de la politique qui l’a généré. Les nouveaux algorithmes continuent d’apprendre de manière stable, même après une journée de stagnation, 107 versions de poids en arrière de la politique actuelle. L’équipe ne constate aucune plateforme lorsque le calcul par RL augmente.

Les chiffres de l’infrastructure sont notables. Le système a supporté en moyenne 110 000 déploiements simultanés. Les nouveaux poids ont atteint la flotte d’inference en moyenne en environ 12 secondes. 71 incidents d’inference ont été gérés sans interrompre l’entraînement.

Une pénalité de longueur contrôlable a appris à Beam de résoudre des tâches avec moins de tokens. Les compétences de navigation ont également progressé sans avoir à naviguer dans des tâches en mode RL, ce qui suggère une transférabilité entre différents domaines agents.

Sécurité et Alignement

Le reflexion a entraîné un maître de sécurité et d’alignement distinct depuis le point de contrôle pré-entraîné. Ce maître a été fusionné avec le maître RL par l’utilisation de la distillation multi-maître sur-politique. L’entraînement en sécurité a utilisé l’alignement délibéré. Les résultats de l’évaluation de la sécurité apparaîtront dans le rapport technique.

Barrières de performance ( rapport de réflexion )

Sur SWE-bench Verified, Beam obtient 80,9 contre 70,7 pour Nemotron 3 Ultra. Sur Terminal Bench v2,1, Beam obtient 80,1, proche de 81,0 pour GLM 5,2. DeepSeek V4,1 Flash (90,6) et Kimi K3 (88,3) sont en tête. Ces chiffres proviennent du tableau de Reflection, qui repose sur des scores concurrents obtenus par Artificial Analysis et DataCurve.

Beam contre les concurrents les plus proches en poids ouvert

CaractéristiqueRayon de réflexionGLM-5.2Nemotron 3 UltraDeepSeek V4.1 FlashKimi K3
DéveloppeurReflection AI (US)Z.ai (Chine)NVIDIA (US)DeepSeek (Chine)Moonshot AI (Chine)
Paramètres totaux501B~753B550B552B backbone + 196B Engram2.8T
Paramètres actifs23B~40B55B8B préchargement / 16B décodage104B
Contexte1M (efficace)1MJusqu'à 1M1M1M
EntréeTextTextTextTexte + imageTexte + image
LicenceApache 2.0 (planifié)MITOpenMDW-1.1MITKimi K3 License
PoidsPlus tard en octobre 2026DisponibleDisponibleDisponibleDisponible
Terminal Bench v2.1*80.181.056.490.688.3
SourceReflectionHugging FaceNVIDIAHugging FaceHugging Face

*Les scores publiés dans l’annonce de Reflection’s Beam. Les spécifications ont été vérifiées le 5 octobre 2026.

Le Beam est le modèle le plus petit ici en termes de paramètres totaux. Son nombre d’actifs de 23B se situe en dessous de GLM-5.2, Nemotron 3 Ultra et Kimi K3. Apache 2.0 et MIT sont des licences permissives standard. La licence personnalisée de Kimi K3 impose des exigences d’attribution pour les produits très importants.

Résultats clés

  • Beam est un MoE de type 501B avec 23B paramètres actifs, uniquement en texte et doté de 1M de contexte effectif.
  • Le pré-trainement a utilisé 23,8 T de tokens sur 6 144 GPU NVIDIA GB300 en moins de 4 semaines.
  • RL a exécuté plus de 100 Mégateures de déploiements sur 10,5 K Goblet 300 GPU en 4 semaines.
  • Rapports de réflexion : 80,9 sur SWE-bench vérifié et 80,1 sur Terminal Bench v2,1.
  • Les poids de Apache 2.0 sont prévus pour la fin du mois.

Veuillez consulter les détails techniques et accès anticipé.

Le post Reflection AI Introduces Beam : Un modèle MoE 501B de poids ouvert avec 23B de paramètres actifs pour les tâches de codage et d’agentique a été publié en premier sur MarkTechPost.

Source originale

MarkTechPost

À propos du contenu

La publication originale et les droits appartiennent à la source.

Traduction automatique · Consultez l’original