Reflection ouvre Beam et met le coût d’exploitation en avant

Reflection AI a présenté Beam le 5 octobre : le premier modèle à poids ouverts d’un laboratoire fondé en 2024 par deux anciens chercheurs de Google DeepMind, Misha Laskin et Ioannis Antonoglou. Les poids ne sont pas encore disponibles. Reflection indique qu’ils seront publiés sous licence Apache 2.0 plus tard en octobre, avec un rapport technique, une fiche de modèle et des outils pour l’exécuter, l’évaluer et l’affiner, une fois le red teaming et les évaluations terminés. D’ici là, l’accès se fait sur liste d’attente.

Beam est un transformeur creux à mélange d’experts, uniquement textuel : 501 milliards de paramètres au total, 23 milliards actifs pour chaque jeton. Reflection affirme avoir préentraîné le modèle sur 23 800 milliards de jetons de données web et sous licence en moins de quatre semaines sur 6 144 puces Nvidia GB300 NVL72, puis mené une phase d’apprentissage par renforcement de plus de 100 millions de rollouts sur 10 500 de ces mêmes puces pendant quatre semaines de plus. La fenêtre de contexte était de 256 000 jetons pendant le renforcement et a été portée à un million lors de l’entraînement intermédiaire.

Une puce de processeur sur une carte de circuit imprimé, vue de près
Le préentraînement a pris moins de quatre semaines sur 6 144 puces Nvidia GB300 NVL72, selon Reflection. Illustration. Jeremy Waterhouse · pexels · Pexels License

La thèse : égaler GLM 5.2 avec une fraction du calcul

L’argument de Reflection n’est pas que Beam est le modèle ouvert le plus puissant. C’est que Beam atteint des scores « comparables à GLM-5.2 en utilisant trois à quatre fois moins de calcul d’inférence » : un argument de coût, pas de capacité. GLM 5.2, de Zhipu AI, compte environ 250 milliards de paramètres de plus que Beam.

Tous les chiffres publiés à ce jour sont ceux de Reflection et aucun n’a été reproduit de façon indépendante. Dans le tableau de l’entreprise, Beam obtient 80,1 sur Terminal-Bench v2.1 contre 81,0 pour GLM 5.2, 86,6 pour Qwen 3.8-Max d’Alibaba et 88,3 pour Kimi K3 de Moonshot AI. Sur GPQA Diamond, il obtient 90,5 contre 91,2 pour GLM 5.2, 92,6 pour Qwen 3.8-Max et 93,5 pour Kimi K3. Sur AIME 2026, il atteint 97,8 contre 99,2 pour GLM 5.2. Sur la moitié difficile de SWE-Bench Pro v2, il obtient 77,2, loin derrière Kimi K3 à 84,3 et Qwen 3.8-Max à 88,2.

Lu tel quel, le tableau place Beam environ un point sous GLM 5.2 partout, et nettement sous les deux modèles chinois plus grands. C’est proche de ce que Reflection dit qu’il montre : l’entreprise qualifie Beam de « compétitif » face à GLM 5.2 et affirme qu’il « approche » Qwen 3.8-Max en programmation et en travail d’agents.

Un immeuble de bureaux à façade de verre dans une rue, sous un ciel bleu
Reflection a levé environ 4,7 milliards de dollars et signé plus de 7 milliards d'accords de calcul courant jusqu'en 2029. Illustration. Brett Sayles · pexels · Pexels License

Ce que cela a coûté

Reflection a levé environ 4,7 milliards de dollars, auprès notamment de Nvidia, Sequoia Capital et Lightspeed Venture Partners, pour une valorisation avant financement de 25 milliards, rapporte TechCrunch. Elle a signé plus de 7 milliards de dollars d’accords de calcul avec SpaceX et Nebius pour accéder à des puces Nvidia GB300 jusqu’en 2029.

Le cadrage de l’entreprise est géopolitique : les laboratoires chinois tiennent la frontière des poids ouverts, et un laboratoire occidental devrait en tenir une part. Au vu de ce que Reflection a publié, Beam ne reprend pas cette frontière. Ce qu’il offre, c’est un modèle téléchargeable, modifiable et hébergeable soi-même sous licence permissive, avec une facture d’inférence que son concepteur chiffre entre un tiers et un quart de celle du modèle ouvert comparable le plus proche.

Ce qu’il faudra surveiller plus tard ce mois-ci, ce sont les poids et le rapport technique. Des exécutions indépendantes de Terminal-Bench et de SWE-Bench Pro diront si la promesse d’efficacité tient hors du harnais de Reflection.