
Reflection Beam livre une API en bêta, et les poids se font encore attendre deux semaines
- openaiNOUVEAUOpenAI: GPT-6.1 Sol2026-09-2952Intelligence
- anthropicNOUVEAUAnthropic: Claude Sonnet 5.52026-09-2856Intelligence
- typesafeNOUVEAUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 par million de tokens · 150 tok/s
- OpenAINOUVEAUOpenAI: GPT-6 Luna2026-09-2238Intelligence
- OpenAINOUVEAUOpenAI: GPT-6 Sol2026-09-2248Intelligence
- AnthropicNOUVEAUAnthropic: Claude Opus 5.52026-09-2258Intelligence
- xAIGrok 4.72026-09-2146Intelligence
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 par million de tokens · 127 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens · 1202 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 par million de tokens · 53 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens · 222 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens · 229 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
Le premier modèle de Reflection s'appelle Reflection Beam, et ce qui est intéressant à son sujet ce matin, ce n'est pas qu'il existe — c'est que seule la moitié de lui existe. L'entreprise a annoncé Beam le 5 octobre 2026 comme un modèle sparse mixture-of-experts (mélange d'experts clairsemé) totalisant 501 milliards de paramètres, dont 23 milliards actifs par token, et a mis en ligne le jour même un point de terminaison bêta compatible OpenAI. Les poids sont promis pour la fin du mois sous licence Apache 2.0, accompagnés d'un rapport technique, d'une fiche de modèle et de la pile de service. En attendant leur publication, les seules personnes en mesure d'exécuter Beam-501B-A23B sont celles à qui Reflection remet une clé d'accès à la liste d'attente, et chaque chiffre de performance en circulation provient des propres tableaux d'un seul laboratoire.
C'est un drôle d'endroit pour qu'un lancement s'arrête, et il vaut la peine de préciser de quelle moitié nous disposons. Reflection a livré un aperçu auquel on peut s'inscrire et un ensemble de tableaux de benchmarks que personne n'a reproduits. Reflection n'a pas livré ce à quoi « open-weight » fait référence dans le titre.
Qu’est-ce qui est réellement en direct ce matin ?
Tout ce qui figure dans cette section provient du billet de blog et de la documentation propres à Reflection, consultés le 6 octobre 2026.
• ID du modèle — Beam-501B-A23B, créé le 5 octobre 2026, servi à api.reflection.ai/openai/v1 avec Chat Completions et une liste de modèles, et rien d'autre.
• Forme — 501 milliards de paramètres au total, 23 milliards actifs par token, soit un taux d’activation d’environ 4,6 %. Pour donner un ordre de grandeur, GLM 5.2 se situe près de 5,4 %.
• Contexte — 256 000 tokens sur l’API, avec une note de bas de page accolée au chiffre lui-même avertissant que la fenêtre peut changer pendant la bêta. La sortie maximale est de 128 000 tokens.
• Raisonnement — un paramètre reasoning_effort avec cinq réglages : low, medium, high, xhigh et max. La valeur medium est celle par défaut, et le modèle raisonne toujours. Il n’existe aucun interrupteur d’arrêt ni mode sans raisonnement.
• Modalité — texte en entrée, texte en sortie. Aucune entrée image, audio ou vidéo au lancement.
• Prix — non publié. L'article de blog n'en donne pas, la documentation n'en donne pas non plus, et la console de la plateforme se trouve derrière un mur d'inscription.
• Accès — une liste d'attente. Il n'existe pas de voie en libre-service et il n'y a pas de poids, donc pas de téléchargement, pas de quantification et pas d'affinage.
La ligne de prix est celle qui change votre façon de lire tout le reste. Quatre des sept modèles auxquels Beam est comparé dans les propres tableaux de Reflection ont des prix catalogue publics que vous pouvez mettre dans un tableur dès aujourd’hui. Beam n’en a pas, donc toute affirmation sur son coût à l’instant présent est une affirmation sur la puissance de calcul, pas sur les dollars.

Le nombre dont dépend le lancement
Le pitch de Reflection, c’est l’efficacité d’inférence, et il est inhabituellement précis sur ce que cela signifie : sur des benchmarks de raisonnement avancé, Beam obtient des scores comparables à GLM 5.2 tout en utilisant 3 à 4 fois moins de calcul d’inférence. Les gains sont décrits comme encore plus importants face aux modèles de la famille des 2 000 milliards de paramètres, où se situe Qwen 3.8-Max.
Le graphique qui sous-tend cette affirmation mérite d'être lu attentivement, car c'est la preuve déterminante de tout le billet. Il trace le score de raisonnement en fonction des FLOPs d'inférence estimés pour DeepSWE, Humanity's Last Exam et Terminal-Bench 2.1, et il estime les FLOPs comme étant environ le double du nombre de paramètres actifs multiplié par le nombre moyen de tokens générés par tentative. Cette formule exclut délibérément le préremplissage du prompt, les opérations d'attention dépendant du contexte et la surcharge de service — Reflection le précise dans la légende. Il s'agit d'une comparaison cohérente entre modèles plutôt que d'une mesure de la facture de qui que ce soit, et c'est aussi le seul soutien quantitatif à l'affirmation d'efficacité, rédigé par le laboratoire qui a conçu le modèle. Traitez-le comme une hypothèse que les poids permettront à d'autres de tester.
Ce que l’architecture apporte bel et bien, en pratique, c’est un profil de service. Vingt-trois milliards de paramètres actifs, c’est un modèle que l’on peut raisonnablement exécuter sur un nombre relativement faible de GPU avec une latence interactive, ce qui en fait un produit différent d’un modèle dense de 501 milliards de paramètres, même si le chiffre sur la fiche est identique. C’est pourquoi Reflection peut parler de raisonnement proche de la frontière sans parler d’un déploiement à l’échelle d’un centre de données — et pourquoi la publication à venir des poids est l’événement qui compte davantage que la clé bêta.
Où Beam se retrouve dans les propres tables de Reflection
Tous les chiffres ci-dessous sont déclarés par le fournisseur, issus des tableaux de l’article de lancement de Reflection, et aucun n’a été reproduit de manière indépendante. Lorsque Reflection n’a publié aucun chiffre pour un modèle, la cellule indique NR dans l’original. Les colonnes de comparaison sont celles de Reflection, ni les nôtres ni celles d’un tiers.
Travail de codage et sur le terminal
• Terminal-Bench v2.1 — Reflection Beam 80.1 face à GLM 5.2 81.0, GLM 5.3 88.2, Kimi K3 88.3, Qwen 3.8-Max 86.6 et DeepSeek V4.1 Flash 90.6. Beam se situe en dessous de chacun d’eux.
• SWE-Bench Verified — Reflection Beam 80,9 contre Inkling 77,6 et Nemotron 3 Ultra 70,7. C’est là que Beam semble le plus performant, mais notez que seuls les deux modèles les plus faibles de la liste y ont été exécutés.
• SWE-Bench Pro v1 — Reflection Beam 65,5 contre Qwen 3.8-Max 67,7, GLM 5.2 62,1, Inkling 54,3, Nemotron 3 Ultra 46,4.
• SWE-Bench Pro v2-Hard — Reflection Beam 77,2 face à Kimi K3 88,2, GLM 5.3 84,3, Inkling 56,9. Un écart de dix points par rapport au sommet du classement.
• DeepSWE v1.1 — Reflection Beam 44,4 face à DeepSeek V4.1 Flash 74,2, Kimi K3 68,0, GLM 5.3 61,0, Qwen 3.8-Max 51,0, GLM 5.2 44,0. Beam se situe au niveau de la génération précédente et trente points derrière le leader.
• SWE Atlas Codebase QnA — Reflection Beam 34,6 face à Kimi K3 68,0 et GLM 5,3 61,0. Garder un grand dépôt en tête au fil d’une longue interaction est l’élément le plus difficile de cette liste, et le 34,6 de Beam n’est pas une différence d’arrondi.
Raisonnement et science
• AIME 2026 — Reflection Beam 97,8 contre GLM 5.2 99,2 et Inkling 97,1.
• HLE sans outils — Reflection Beam 36.2 contre Kimi K3 46.9, Qwen 3.8-Max 43.6, GLM 5.3 42.3, GLM 5.2 40.5, DeepSeek V4.1 Flash 39.1, Inkling 29.7, Nemotron 3 Ultra 26.7. En milieu de peloton, et devant seulement les deux modèles de la génération précédente.
• GPQA Diamond — Reflection Beam 90,5 face à Kimi K3 93,5, Qwen 3.8-Max 92,6, GLM 5.3 91,7, GLM 5.2 91,2, DeepSeek V4.1 Flash 90,9.
• SciCode — Reflection Beam 49,7 face à GLM 5.3 59,0, Kimi K3 58,7, Qwen 3.8-Max 52,1, DeepSeek V4.1 Flash 52,0.
• CriPT AA — Reflection Beam 16.3 face à Kimi K3 23.4, GLM 5.2 20.9, Qwen 3.8-Max 20.0, GLM 5.3 19.1, DeepSeek V4.1 Flash 14.3, Inkling 5.4, Nemotron 3 Ultra 3.1.
Outils, recherche et contexte long
• MCP Atlas — Reflection Beam 78,7 contre Qwen 3.8-Max 84,5, GLM 5.3 84,2, Kimi K3 82,3, GLM 5.2 77,8.
• AutomationBench, partition publique — Reflection Beam 37,0 contre DeepSeek V4.1 Flash 54,8, GLM 5.3 48,2, Kimi K3 46,7, Qwen 3.8-Max 39,8, GLM 5.2 26,2.
• tau3 banking — Reflection Beam 38,0 contre Qwen 3.8-Max 55,2, GLM 5.2 37,1, Kimi K3 37,1.
• BrowseComp avec gestion du contexte — Reflection Beam 77,4 face à Kimi K3 91,2, Inkling 77,1, Nemotron 3 Ultra 44,4.
• DeepSearchQA avec gestion du contexte — Reflection Beam 80,1 face à Kimi K3 95,0.
• AA-LCR — Reflection Beam 79,3 contre Kimi K3 88,7, DeepSeek V4.1 Flash 84,0, Qwen 3.8-Max 80,3, GLM 5.3 79,7, Nemotron 3 Ultra 79,3, GLM 5.2 78,3, Inkling 77,3. Le rappel en contexte long est la seule ligne de capacités générales où Beam est véritablement compétitif plutôt que dans la moyenne.
Lisez les quatre tableaux ensemble et un schéma cohérent apparaît : Beam bat les deux modèles de génération précédente de la liste de Reflection et perd face au modèle actuel, sur presque toutes les lignes, avec des écarts allant de faibles à rédhibitoires. Qu'un fournisseur publie des tableaux qui placent son propre modèle en retrait sur autant de lignes est bon signe quant à l'honnêteté du laboratoire. Ce n'est pas un signe que le modèle est à la pointe.

La seule voix indépendante jusqu’ici, et ce qu’elle ne dit pas
La seule évaluation par un tiers rendue publique est celle d’Artificial Analysis, qui a déclaré le 5 octobre que Reflection lui avait donné accès et qu’elle évaluait Beam de manière indépendante, ajoutant que les premiers indicateurs suggèrent que Beam sera l’un des modèles ouverts les plus économes en tokens qu’elle ait vus pour son niveau d’intelligence.
C’est une déclaration significative de la part de l’organisation dont l’indice est celui que la plupart des acheteurs lisent réellement, et c’est aussi une déclaration sans aucun chiffre. Ce matin, il n’y a aucune ligne Beam dans le classement d’Artificial Analysis — les pages des modèles renvoient 404 et la charge utile du classement ne comporte aucune entrée Beam — donc l’allégation d’efficacité des tokens n’est, pour l’instant, qu’une promesse, de la part d’un tiers, de publier quelque chose. Rien dans l’indice n’a encore été recalculé sur Beam.
La divulgation sur l'entraînement, qui est la partie la plus solide de la publication
La section d’ingénierie de l’article de Reflection contient des chiffres que la plupart des laboratoires gardent en interne, et ils méritent d’être consignés, car ils constituent la partie de la publication qui sera encore intéressante dans un mois.
• Pré-entraînement — 23,8 billions de tokens sélectionnés sur 6 144 puces NVIDIA GB300 dans des racks NVL72, terminé de bout en bout en moins de quatre semaines, avec un goodput déclaré de 92,3 %, et neuf rembobinages semi-automatiques en cours de route attribués à des pics de norme de gradient ou à une suspicion de corruption silencieuse des données.
• Apprentissage par renforcement — 10 500 puces GB300 pendant quatre semaines, plus de 100 millions de rollouts, un contexte de rollout maximal de 256 000 tokens, environ 1,3 milliard de sandboxes et environ un million d’environnements distincts collectés pour des tâches de codage, agentiques et STEM.
Serving — les nouveaux poids ont atteint la flotte d’inférence en une médiane d’environ 12 secondes, la distribution hiérarchique réduisant le trafic entre racks de 75 % et rendant l’adoption à l’échelle de la flotte 2,2× plus rapide que lorsque chaque réplique récupère les poids elle-même.
• Stabilité — des gradients de politique entièrement asynchrones qui restent numériquement stables lorsqu'ils apprennent à partir d'interactions vieilles d'un jour, ainsi qu'une pénalité de longueur contrôlable permettant d'arbitrer entre la longueur du raisonnement et le score sans réentraînement.
• Données — environ 95 % des tokens internet bruts éliminés par analyse syntaxique, déduplication et curation, avec l'affirmation que les filtres conventionnels auraient manqué environ 1,8 billion de tokens que Reflection a conservés, y compris 87 % de ses tokens web-code curatés.
Deux lignes méritent d’être signalées. Le billet affirme que l’entraînement intermédiaire étend le contexte effectif de Beam à 1 million de jetons, tandis que la documentation de l’API indique une limite de service de 256 000 jetons, avec une note de bas de page bêta. Il s’agit d’une capacité côté entraînement et d’une limite côté service, non d’une contradiction, mais c’est précisément cet écart qui devient un gros titre « contexte 1 M » si personne ne lit le second document. Et le chiffre RL de plus de 100 millions de rollouts est présenté comme l’une des plus grandes campagnes de ce type menées par un laboratoire ouvert, ce qui est une affirmation sur l’échelle, non sur ce que cette échelle a permis d’obtenir — la courbe score en fonction des rollouts est celle du fournisseur et s’arrête là où le fournisseur a arrêté de la tracer.

Ce que vous pouvez faire avec Reflection Beam aujourd’hui
Une chose : inscrivez-vous sur la liste d’attente et, si vous obtenez une clé, appelez Beam-501B-A23B via le point de terminaison propre à Reflection avec un client au format OpenAI. Aucun prix n’est publié, il est donc impossible de modéliser le coût d’une charge de travail pour ce modèle. Il n’y a pas de poids, donc pas d’auto-hébergement, pas de quantification et pas de reproduction par des tiers. Il n’y a pas de ligne de benchmark indépendante, donc tout l’aperçu des performances ci-dessus repose sur les tableaux d’un seul laboratoire.
Reflection Beam ne fait pas partie de nos routes, et nous n'allons pas laisser entendre le contraire. Ce que nous pouvons vous donner, c'est le prix du segment qu'il tente d'intégrer, relevé en direct dans notre propre catalogue ce matin : GLM 5.2 à 1,40 $ en entrée et 4,40 $ en sortie par million de tokens, GLM 5.3 à 1,26 $ et 3,96 $, Qwen 3.8-Max à 2,00 $ et 6,00 $, et DeepSeek V4.1 Flash à 0,15 $ et 0,60 $. Cela représente un écart de plus de neuf fois entre le moins cher et le plus cher sur la seule entrée — et c'est pourquoi un modèle bêta sans prix catalogue est vraiment difficile à intégrer dans une décision, aussi bon soit son graphique d'efficacité.
OrcaRouter fait fonctionner une seule clé compatible OpenAI sur ces quatre modèles et plus de 200 autres, en répercutant le prix catalogue du fournisseur sans rien ajouter, de sorte qu'un changement de prix d'un fournisseur est effectif de notre côté le jour même, plutôt qu'au moment où un revendeur actualise un tableau. Le basculement automatique fait partie du routage, plutôt que d'être quelque chose que vous construisez autour de chaque fournisseur, ce qui signifie qu'un modèle non éprouvé — sans reproductibilité, sans score indépendant et sans prix — est exactement le genre de chose que vous placez sur une part de trafic plutôt que sur votre chemin critique.
Quand l'affirmation devient testable
Trois choses règlent cela, et Reflection en a placé deux dans le mois.
Le premier élément, ce sont les poids. Apache 2.0 plus un rapport technique permet à quiconque dispose de quelques nœuds de mesurer ce qui compte — jetons par seconde par GPU à un niveau de qualité fixé, et si 23 milliards de paramètres actifs délivrent réellement le score par FLOP que le graphique laisse entendre. D’ici là, l’argument d’efficacité relève de l’arithmétique sur un coin de serviette, et tous ceux qui le répètent ne font que répéter la légende de Reflection.
Le second est un prix. Un modèle sans prix catalogue n’a pas sa place dans une comparaison de coûts. Si Beam se situe au-dessus du segment GLM et DeepSeek, l’argument du calcul cesse de compter pour quiconque a un budget ; s’il se situe en dessous, la donne change rapidement.
Le troisième est l’indice. Artificial Analysis a déclaré qu’il évaluait Beam et n’a publié aucun chiffre. Lorsque cette ligne apparaîtra, ce sera le premier chiffre de cette histoire que Reflection n’a pas calculé.
Si vous avez besoin aujourd'hui d'un agent de codage performant et que vous voulez savoir combien il coûte, la réponse n'est pas encore Reflection Beam. Elle le sera peut-être dans trois semaines. Le modèle sur lequel il vaut la peine de parier une affirmation d'efficacité est celui dont vous pouvez télécharger les poids et dont vous pouvez compter vous-même les FLOPs — et à cette aune, Reflection nous a donné une date et une liste d'attente, pas un modèle.
Comparés dans cet article4
Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement
