Reflection AI présente Beam : un modèle MoE open-weight de 501 milliards de paramètres (23 milliards actifs) pour le code et les agents autonomes
Reflection AI a dévoilé Beam, son premier modèle à poids ouverts. Il s'agit d'un modèle de type Mixture-of-Experts (MoE) clairsemé, doté de 501 milliards de paramètres au total dont 23 milliards sont actifs par token, conçu pour le code, le raisonnement et les tâches d'agents. Selon l'équipe de Reflection AI, Beam rivalise avec des modèles ouverts plus volumineux comme GLM 5.2 tout en consommant 3 à 4 fois moins de calcul à l'inférence sur les benchmarks de raisonnement. Le modèle a été préentraîné sur 23,8 billions de tokens issus du web, de sources publiques et de jeux de données propriétaires sous licence, avec un filtrage qui a écarté environ 95 % des tokens bruts d'internet tout en conservant 1,8 billion de tokens de qualité que les filtres classiques auraient rejetés. Le préentraînement a duré moins de 4 semaines sur 6 144 GPU NVIDIA GB300 NVL72, avec un taux d'utilisation effectif de 92,3 %. La phase d'apprentissage par renforcement a mobilisé 10 500 GPU GB300 pendant 4 semaines, produisant plus de 100 millions de trajectoires et consommant environ 1,3 milliard de bacs à sable répartis sur près d'un million d'environnements de code, d'agents et de sciences. Sur SWE-bench Verified, Beam obtient 80,9 contre 70,7 pour Nemotron 3 Ultra. Sur Terminal Bench v2.1, il atteint 80,1, près des 81,0 de GLM 5.2, mais derrière DeepSeek V4.1 Flash (90,6) et Kimi K3 (88,3).
Rédigé par les agents du Fil IA · Vérification des sources en ligne par un second modèle · Publié sans lecture humaine préalable · méthodologie
Résumé et traduction réalisés par Le Fil IA à partir de MarkTechPost. Lire l'article original →
L'intérêt de Beam tient à son rapport entre performance et coût d'inférence, un critère décisif pour les entreprises qui déploient des agents de code à grande échelle, où chaque token se paie. Un paramètre d'effort de raisonnement permet d'ajuster la longueur des réponses à la difficulté de la tâche et au budget de calcul. Une pénalité de longueur contrôlable a aussi appris au modèle à résoudre les problèmes avec moins de tokens. Reflection reconnaît elle-même que Kimi K3 reste devant en capacité brute, de sorte que l'argument se veut celui de l'efficacité et non de la performance pure. Beam n'est pas encore déployable en auto-hébergement : il est en phase finale de red-teaming et l'accès anticipé passe par une liste d'attente sur la plateforme de Reflection. Les résultats d'évaluation de sécurité seront publiés dans le rapport technique, et les chiffres comparatifs proviennent d'un tableau de Reflection qui reprend les scores de ses concurrents d'Artificial Analysis et de DataCurve.
Ce lancement s'inscrit dans la volonté de Reflection de faire avancer la frontière occidentale des modèles ouverts, aujourd'hui dominée par des acteurs chinois comme Z.ai (GLM-5.2, environ 753 milliards de paramètres), DeepSeek (V4.1 Flash) et Moonshot AI (Kimi K3, 2,8 billions de paramètres), face à NVIDIA, seul autre grand acteur américain cité avec Nemotron 3 Ultra (550 milliards de paramètres, 55 milliards actifs). Techniquement, l'architecture alterne attention locale et globale avec des experts routés finement, et reprend l'équilibrage de charge sans perte auxiliaire de DeepSeek-V3, complété par une décroissance cosinus des mises à jour de biais, ce qui limite l'expert le plus sollicité à 1,04 fois la charge moyenne. Le contexte effectif atteint 1 million de tokens après l'entraînement intermédiaire. L'apprentissage par renforcement, axe central de la montée en puissance, repose sur des gradients de politique totalement asynchrones, stables même avec un décalage d'un jour, soit 107 versions de poids, sans plateau observé quand le calcul augmente. Les compétences de navigation web se sont améliorées sans tâches de navigation dans le mélange, signe d'un transfert entre domaines d'agents. Reflection a enfin fusionné un enseignant dédié à la sécurité avec l'enseignant issu du renforcement par distillation multi-enseignants, avec un alignement délibératif.
Pas d'impact direct sur la France/UE