Une carte héro générée intitulée « Reflection Beam : 501B de paramètres, 23B actifs », avec en sous-titre « MoE sparse / 23,8T de jetons de pré-entraînement / contexte API de 256K jetons / poids promis ce mois-ci / chaque chiffre rapporté par le fournisseur ». Trois icônes plates au trait se trouvent sous le texte : un schéma de couches empilées avec la plupart des couches estompées et une seule mise en évidence, un rack de neuf blocs serveurs, et un contour de document avec un petit cadenas. Le logo OrcaRouter est incrusté dans le coin inférieur droit.
Guides & Insights

Reflection Beam, expliqué : 501B paramètres, 23B actifs, et des poids pas encore disponibles

Auteur

Alistair Wren

Date de publication

Derniers modèles · 20Voir tous les modèles →
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Le 5 octobre 2026, Reflection a annoncé Reflection Beam, un modèle de langage à mélange d'experts clairsemé comptant 501 milliards de paramètres au total, dont 23 milliards sont activés par token, et a mis en service le jour même, devant celui-ci, un point de terminaison bêta compatible avec OpenAI. Cela représente 4,6 % du modèle éveillé à tout instant — un ratio agressif, même selon les normes du domaine actuel des modèles à poids ouverts — et c'est le chiffre sur lequel repose tout le lancement. Reflection indique que les poids complets, un rapport technique et une fiche de modèle seront publiés plus tard ce mois-ci sous licence Apache 2.0. À ce jour, ils ne sont pas là, aucun prix n'a été publié nulle part sur les propres plateformes de Reflection, et Artificial Analysis n'a aucune ligne pour le modèle. Ainsi, le résumé honnête de ce lancement est le suivant : une affirmation très précise sur l'efficacité, formulée par le laboratoire qui a entraîné le modèle, tous les chiffres à l'appui étant fournis par ce laboratoire.

Les propres tableaux comparatifs de Reflection placent Reflection Beam face à Inkling, Nemotron 3 Ultra, GLM 5.2, GLM 5.3, Kimi K3, Qwen3.8 Max et DeepSeek V4.1 Flash, ce qui donne une image fidèle du niveau qu'il vise : des modèles ouverts et semi-ouverts solides, mais pas à la frontière, dont plusieurs ne représentent qu'une fraction de la taille de Beam. Beam ne surpasse pas ce peloton sur les capacités brutes, et nous vous montrerons exactement où il perd. Ce qu'il prétend faire, c'est se hisser près du sommet de ce peloton tout en dépensant environ trois à quatre fois moins de calcul d'inférence que GLM 5.2 pour des scores de raisonnement comparables. C'est là toute la thèse de l'article.

Ce qui existe réellement aujourd'hui

Tout dans cette section provient de la documentation officielle de Reflection, consultée le 6 octobre 2026. L’API est en ligne en version bêta, derrière une liste d’attente ; les poids ne sont pas encore disponibles.

• ID du modèle — Beam-501B-A23B, créé le 5 octobre 2026.

• Interface — une surface compatible OpenAI à l'adresse api.reflection.ai/openai/v1, exposant Chat Completions et la liste Models, et rien d'autre. Pas de Completions, pas d'embeddings, pas de batches.

• Contexte — 256 000 tokens, avec une note de bas de page attachée au chiffre lui-même : « La fenêtre de contexte peut changer pendant la bêta. » La sortie maximale est de 128 000 tokens.

• Raisonnement — un paramètre reasoning_effort avec cinq valeurs : low, medium, high, xhigh et max. La valeur par défaut est medium, et le modèle raisonne toujours, quel que soit le réglage — il n’y a pas de désactivation possible.

• Modalité — texte en entrée, texte en sortie. Aucune entrée d'image ou d'audio au lancement, ce qui constitue une véritable différence par rapport à Inkling, le modèle privilégiant d'abord la multimodalité que Thinking Machines, la société de Mira Murati, a lancé en juillet.

• Date limite des connaissances — 30 juin 2026.

Prix — non. L'article de blog de Reflection, sa documentation et son modèle l'omettent tous, et la console de la plateforme se trouve derrière un mur d'inscription.

Cette dernière ligne compte plus qu’il n’y paraît. Tous les autres modèles de l’ensemble de comparaison de Beam ont un prix catalogue public que l’on peut saisir dès aujourd’hui dans un tableur. Beam, lui, n’en a pas, ce qui signifie que tout argument sur son coût à l’heure actuelle est un argument sur la puissance de calcul, et non sur des dollars.

A single-column infographic titled 'Reflection Beam - the scoreboard' with six rows reading 'Total / active parameters: 501B / 23B', 'Pre-training: 23.8T tokens on 6,144 GB300', 'API context: 256,000 tokens (beta footnote)', 'Reasoning effort: five levels, default medium', 'Price: not published anywhere' and 'Independent scores: none - no Artificial Analysis row'. A footer reads 'Vendor-reported; no independent reproduction. Weight release promised for later this month.' The OrcaRouter logo is composited in the bottom-right corner.

Le ratio de 501 à 23 est l’argument.

La parcimonie n’est pas nouvelle ; la question est de savoir jusqu’où un laboratoire est prêt à la pousser. GLM 5.2 fonctionne avec environ 40 milliards de paramètres actifs sur un total annoncé de l’ordre de 744 milliards — soit environ 5,4 %. Reflection Beam se situe à 4,6 % sur 501 milliards. Sur le papier, il s’agit d’un pas supplémentaire modeste, et Reflection se montre prudent quant à ce qu’il revendique à son sujet.

Le chiffre d'efficacité dans l'article de lancement provient d'un graphique construit à partir des données d'Artificial Analysis et de DataCurve, qui trace le score de raisonnement en fonction des FLOPs d'inférence estimés, où les FLOPs sont approximés comme le double du nombre de paramètres actifs multiplié par le nombre moyen de jetons générés. Cette formule exclut délibérément le préremplissage du prompt, le coût de l'attention et la surcharge liée au service. C'est un modèle approximatif, pas une mesure, et Reflection ne le présente pas comme tel — mais c'est aussi le seul soutien quantitatif à l'affirmation « 3 à 4× moins cher au même score », et il a été rédigé par le fournisseur. Considérez-le comme une hypothèse que les poids, lorsqu'ils seront disponibles, permettront à quelqu'un d'autre de tester.

Ce que l’architecture apporte en pratique, c’est un profil de service. Vingt-trois milliards de paramètres actifs, c’est un modèle que vous pouvez exécuter sur un nombre relativement faible de GPU avec une latence interactive, et c’est un produit différent d’un modèle dense de 501 milliards de paramètres, même si le nombre de paramètres sur la carte est identique. C’est la raison pour laquelle Reflection peut parler d’un raisonnement proche de la frontière sans parler d’un déploiement à l’échelle d’un centre de données.

Moins de quatre semaines pour pré-entraîner, et la divulgation est inhabituellement précise

Le compte rendu de l’entraînement est la partie de la publication qui se lit comme véritablement informative, car Reflection a publié des chiffres que la plupart des laboratoires gardent en interne.

• Pré-entraînement — 23,8 billions de tokens sur 6 144 puces GB300 dans des racks NVL72, terminé en moins de quatre semaines avec un goodput annoncé de 92,3 %, et neuf retours à des points de contrôle en cours de route.

• Apprentissage par renforcement — 10 500 puces GB300 pendant quatre semaines, plus de 100 millions de rollouts, une longueur de contexte de rollout maximale de 256 000 tokens, environ 1,3 milliard de sandboxes et environ un million d’environnements distincts, avec en moyenne 110 000 rollouts exécutés simultanément.

• Entraînement intermédiaire — étend le contexte effectif du modèle à 1 million de tokens.

• Stabilité — des gradients de politique asynchrones qui restent stables avec une obsolescence à l'échelle de la journée, plus une pénalité de longueur contrôlable afin de pouvoir ajuster la longueur du raisonnement sans réentraînement.

Lisez conjointement les lignes sur le pré-entraînement et celles sur le RL, et la forme de l’affirmation apparaît. L’histoire de l’efficacité ne porte pas seulement sur les paramètres actifs à l’inférence ; elle porte aussi sur la vitesse à laquelle le modèle a été entraîné et sur la part de calcul qui est allée au RL lié à l’environnement plutôt qu’à davantage de tokens. Un million d’environnements et 1,3 milliard de sandboxes, c’est une affirmation sur l’utilisation d’outils et sur l’infrastructure d’entraînement agentique, et cela s’aligne sur les benchmarks que Reflection a choisi de mettre en avant.

Un chiffre mérite d'être signalé. Le blog dit que l'entraînement intermédiaire étend le contexte effectif à 1 million de tokens ; la documentation de l'API indique une limite de service de 256 000 tokens, assortie d'une note de bas de page bêta. Il s'agit d'une capacité côté entraînement et d'une limite côté service, non d'une contradiction — mais l'écart est exactement le genre de chose qui devient un titre « contexte de 1 M » si personne ne lit le second document, et quiconque écrira sur Beam la semaine prochaine devrait lire le second document.

A screenshot of the Artificial Analysis language-model leaderboard, showing the ranked Intelligence Index table with per-model scores. No Reflection Beam row is present - the model is absent from the board, which is the point of the capture.

Benchmarks : là où Reflection Beam gagne, et là où il ne gagne pas

Tous les chiffres ci-dessous sont déclarés par le fournisseur, issus des tableaux de l’article de lancement de Reflection, et rien de tout cela n’a été reproduit de manière indépendante. Les colonnes de comparaison reprennent les mêmes chiffres que Reflection a publiés pour les autres modèles ; lorsqu’une cellule affiche « NR » dans l’original, le modèle n’a pas été exécuté. Il n’y a pas de ligne Artificial Analysis pour Beam, donc rien ici n’est passé par un harnais tiers.

Codage agentique

• Terminal-Bench v2.1 — Beam 80,1 vs GLM 5.2 81,0, GLM 5.3 88,2, Kimi K3 88,3, Qwen3.8 Max 86,6, DeepSeek V4.1 Flash 90,6, Inkling 63,2, Nemotron 3 Ultra 56,6.

• SWE-Bench Pro v1 — Beam 65,5 contre Qwen3.8 Max 67,7, GLM 5.2 62,1, Inkling 54,3, Nemotron 3 Ultra 46,4.

• SWE-Bench Pro v2-Hard — Beam 77,2 contre Kimi K3 88,2, GLM 5,3 84,3, Inkling 56,9.

• SWE-Bench Verified — Beam 80.9 contre Inkling 77.6, Nemotron 3 Ultra 70.7.

• SWE-Bench Multilingual — Beam 78,0 contre Nemotron 3 Ultra 67,7.

• DeepSWE v1.1 — Beam 44,4 contre DeepSeek V4.1 Flash 74,2, Kimi K3 68,0, GLM 5.3 61,0, Qwen3.8 Max 51,0, GLM 5.2 44,0.

• SWE Atlas Codebase QnA — Beam 34,6 vs Kimi K3 68,0, GLM 5.3 61,0.

C’est sur cette dernière ligne qu’il faut s’attarder. Le question-réponse sur des dépôts à long horizon est le cas où un modèle doit garder toute une base de code en tête au fil d’une longue interaction, et un 34,6 contre 68,0 n’est pas une différence d’arrondi. DeepSWE raconte une histoire similaire : 44,4 place Beam au même niveau que GLM 5.2 et loin derrière DeepSeek V4.1 Flash.

Raisonnement

• AIME 2026 — Beam 97,8 contre GLM 5.2 99,2, Inkling 97,1.

• HLE, sans outils — Beam 36,2 contre Kimi K3 46,9, Qwen3.8 Max 43,6, GLM 5.3 42,3, GLM 5.2 40,5, DeepSeek V4.1 Flash 39,1, Inkling 29,7, Nemotron 3 Ultra 26,7.

• GPQA Diamond — Beam 90,5 vs Kimi K3 93,5, Qwen3.8 Max 92,6, GLM 5.3 91,7, GLM 5.2 91,2, DeepSeek V4.1 Flash 90,9, Inkling 87,2, Nemotron 3 Ultra 87.

• SciCode — Beam 49,7 contre GLM 5.3 59,0, Kimi K3 58,7, Qwen3.8 Max 52,1, DeepSeek V4.1 Flash 52,0, Inkling 46,1, Nemotron 3 Ultra 44,6.

• CriPT AA — Beam 16.3 contre Kimi K3 23.4, GLM 5.2 20.9, Qwen3.8 Max 20.0, GLM 5.3 19.1, DeepSeek V4.1 Flash 14.3, Inkling 5.4, Nemotron 3 Ultra 3.1.

Le profil de raisonnement de Beam se situe au milieu du peloton, et le schéma est cohérent : confortablement devant les deux modèles de la génération précédente figurant dans la liste de Reflection, mais derrière le modèle actuel. Un score de 90,5 à GPQA Diamond est solide, mais quatre autres modèles le surpassent.

• MCP Atlas — Beam 78,7 contre Qwen3.8 Max 84,5, GLM 5.3 84,2, Kimi K3 82,3, GLM 5.2 77,8, Inkling 76,0, Nemotron 3 Ultra 63,1.

• AutomationBench, partition publique — Beam 37,0 vs DeepSeek V4.1 Flash 54,8, GLM 5.3 48,2, Kimi K3 46,7, Qwen3.8 Max 39,8, GLM 5.2 26,2.

• tau3 banking — Beam 38,0 contre Qwen3.8 Max 55,2, GLM 5.2 37,1, Kimi K3 37,1, Inkling 25,0, Nemotron 3 Ultra 22,6.

• BrowseComp avec gestion du contexte — Beam 77,4 contre Kimi K3 91,2, Inkling 77,1, Nemotron 3 Ultra 44,4.

• DeepSearchQA avec gestion du contexte — Beam 80,1 vs Kimi K3 95,0.

Reflection a aussi présenté deux démonstrations de capacités dans le billet : un taux de résolution de 95,5 % sur le puzzle « Land or Water », une grille de 180 par 90 avec 16 200 points qui exige de maintenir un état de plateau volumineux — un chiffre qui se situe entre les 92,5 et 97,8 % que Reflection attribue à Opus 5 et Fable 5 sur la même tâche — et un fine-tuning Text2SQL du plus petit Gemma-4 qui a porté la précision sur données mises de côté à 66,5 %. Les démonstrations sont sélectionnées ; elles montrent que le modèle sait faire une chose, pas à quelle fréquence.

Ce que vous pouvez en faire aujourd’hui, et ce sur quoi vous ne devez pas compter

Aujourd'hui, une seule chose est généralement possible : demander un accès bêta et appeler Beam-501B-A23B via le point de terminaison propre à Reflection avec un client au format OpenAI. Il n'y a pas de prix publié, il n'y a donc aucun moyen de modéliser le coût d'une charge de travail sur celui-ci. Il n'y a pas de poids, donc pas d'auto-hébergement, pas de quantification, pas de fine-tuning et pas de reproductibilité par des tiers. Il n'y a pas de ligne de benchmark indépendante, donc l'ensemble du tableau de performances ci-dessus repose sur les tableaux d'un seul laboratoire.

Reflection Beam ne figure pas parmi nos routes. Nous n'allons pas laisser entendre le contraire, et nous n'allons pas vous orienter vers un revendeur qui pourrait l'avoir. Ce que nous pouvons vous dire, c'est ce que coûte l'ensemble de comparaison, car nous routons quatre de ces modèles et les chiffres ci-dessous sont lus en direct sur notre propre catalogue ce matin : GLM 5.2 à 1,40 $ en entrée et 4,40 $ en sortie par million de tokens, GLM 5.3 à 1,26 $ et 3,96 $, Qwen3.8 Max à 2,00 $ et 6,00 $, et DeepSeek V4.1 Flash à 0,15 $ et 0,60 $. C'est un écart bien réel — DeepSeek V4.1 Flash est près de dix fois moins cher en entrée que GLM 5.2 — et c'est la raison pour laquelle un modèle bêta sans prix est difficile à intégrer dans une décision. OrcaRouter fait fonctionner une seule clé compatible OpenAI sur ceux-ci et plus de 200 autres modèles avec le prix catalogue du fournisseur répercuté tel quel et rien d'ajouté, ce qui signifie qu'un changement de prix d'un fournisseur est effectif de notre côté le jour même, plutôt qu'au moment où un revendeur actualise ses données. Et comme le basculement automatique fait partie intégrante du routage plutôt que d'être quelque chose que vous devez construire, un modèle nouveau et non éprouvé est le genre de chose que vous pouvez placer sur une part du trafic plutôt que sur votre chemin critique — ce qui est la seule façon responsable d'utiliser quelque chose dont personne n'a encore reproduit les benchmarks.

A screenshot of the OrcaRouter model page for z-ai/glm-5.2, showing the model name, the pass-through list price of $1.40 per million input tokens and $4.40 per million output tokens, the 1,000,000-token context window and the release date 2026-06-16.

Ce à quoi il faut faire attention avant de prendre au sérieux l’allégation d’efficacité

Trois choses trancheront la question, et deux d’entre elles sont promises d’ici la fin du mois.

Le premier point, ce sont les poids. Une licence Apache 2.0 et un rapport technique permettraient à quiconque disposant de quelques nœuds de mesurer ce qui compte vraiment — les tokens par seconde par GPU à un seuil de qualité donné, et si 23 milliards de paramètres actifs délivrent réellement le score par FLOP que le graphique laisse entendre. D’ici là, l’argument d’efficacité relève de l’arithmétique sur un coin de nappe.

Le second est un prix. Un modèle sans prix catalogue n’a pas sa place dans une comparaison de coûts, et si Beam se situe au-dessus du segment GLM et DeepSeek, l’argument de la puissance de calcul cesse d’avoir de l’importance pour quiconque dispose d’un budget. S’il se situe en dessous, la situation change rapidement.

Le troisième est un tiers qui exécute la suite. Tous les chiffres ci-dessus proviennent du même document, et un tableau rapporté par un fournisseur qui place son propre modèle derrière sur sept des seize lignes est bon signe quant à l’honnêteté du labo — mais cela reste un seul labo, un seul harnais, un seul ensemble de prompts.

Si vous avez besoin aujourd’hui d’un codeur agentique performant et que vous voulez savoir ce qu’il coûte, la réponse n’est pas encore Reflection Beam. Elle le sera peut-être dans trois semaines. Le modèle sur lequel une affirmation d’efficacité vaut la peine de parier est celui dont vous pouvez télécharger les poids et dont vous pouvez compter vous-même les FLOPs — et à ce test, Reflection nous a donné une date, pas un modèle.

Comparés dans cet article4

Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement