
Reflection Beam vs Claude Opus 5.5 : l'un que vous pouvez appeler dès aujourd'hui, l'autre pour lequel il faut attendre
- openaiNOUVEAUOpenAI: GPT-6.1 Sol2026-09-2952Intelligence
- anthropicNOUVEAUAnthropic: Claude Sonnet 5.52026-09-2856Intelligence
- typesafeNOUVEAUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 par million de tokens · 150 tok/s
- OpenAINOUVEAUOpenAI: GPT-6 Luna2026-09-2238Intelligence
- OpenAINOUVEAUOpenAI: GPT-6 Sol2026-09-2248Intelligence
- AnthropicNOUVEAUAnthropic: Claude Opus 5.52026-09-2258Intelligence
- xAIGrok 4.72026-09-2146Intelligence
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 par million de tokens · 127 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens · 1202 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 par million de tokens · 53 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens · 202 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens · 229 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
Reflection Beam et Claude Opus 5.5 ne sont pas vraiment rivaux pour l'instant, et la raison est administrative plutôt que technique. Beam, le premier modèle de Reflection, a été annoncé le 5 octobre 2026 et est un modèle de mélange d'experts clairsemé de 501 milliards de paramètres activant 23 milliards de paramètres par token — mais il n'est accessible que via une liste d'attente, ses poids sont promis pour plus tard ce mois-ci sous Apache 2.0, et aucun prix n'a été publié nulle part. Opus 5.5 est sorti le 22 septembre 2026 comme modèle phare d'Anthropic : une fenêtre d'un million de tokens, des entrées texte, image et fichier, et un prix catalogue de 4,00 $ par million de tokens en entrée et de 20,00 $ par million en sortie. Donc la version honnête de cette comparaison, c'est que l'un de ces modèles, vous pouvez le mettre en production cet après-midi avec un coût connu, et l'autre, non — et tout le reste ici n'est qu'une projection sur ce qui se passera quand les poids arriveront.
La réponse courte
Si la question est de savoir sur quel modèle s'appuyer cette semaine, c'est Opus 5.5, sans grande contestation : il est généralement disponible, noté de façon indépendante, multimodal, avec un prix public, et servi via une API que vous pouvez appeler en cinq minutes. Le dossier de Beam ne repose pas sur le fait de battre Opus 5.5 — rien dans les propres documents de Reflection ne le prétend. Il repose sur une proposition bien plus étroite : qu'à un score de raisonnement donné, Beam consomme environ un quart du calcul d'inférence. Si cela se vérifie quand quelqu'un d'extérieur à Reflection le mesure, Beam devient intéressant pour les gros volumes de travail où la réponse doit être bonne, mais pas la meilleure. Sinon, Beam est un modèle ouvert de milieu de tableau avec une liste d'attente.
Ce qui suit sépare, dans cette confrontation, les éléments qui relèvent aujourd'hui de faits établis de ceux qui relèvent de paris.
Ce qu'est chaque modèle, précisément
Opus 5.5 est le successeur fermé et hébergé de Claude Opus 5, positionné par Anthropic pour les modifications en plusieurs étapes sur de vastes bases de code, la revue de code et les longues sessions autonomes. Il accepte le texte, les images et les fichiers, renvoie du texte, offre une fenêtre de contexte de 1 000 000 de tokens avec jusqu'à 128 000 tokens de sortie, et expose une réflexion étendue avec un effort de raisonnement configurable. Il ne s'agit pas de poids ouverts, et ses connaissances sont bornées par la date limite d'entraînement d'Anthropic plutôt que par quoi que ce soit que vous contrôlez.
Reflection Beam est la construction opposée. Il compte 501 milliards de paramètres au total, dont 23 milliards actifs — soit environ 4,6 % du modèle éveillé par token, un ratio agressif même face aux quelque 5,4 % de GLM 5.2 — conçu pour être peu coûteux à servir plutôt que peu coûteux à entraîner. Il est uniquement textuel. Son contexte API est de 256 000 tokens, avec une note de bas de page avertissant que ce chiffre pourrait évoluer pendant la bêta, et sa sortie maximale est de 128 000 tokens. Le point de terminaison est compatible OpenAI à l'adresse api.reflection.ai/openai/v1 et expose Chat Completions ainsi qu'une liste Models, et rien d'autre. Son paramètre reasoning_effort accepte cinq valeurs, vaut medium par défaut, et ne peut pas être désactivé.
• Prix — Claude Opus 5.5 : 4,00 $ en entrée et 20,00 $ en sortie par million de tokens, avec les lectures de cache à 0,20 $ et les écritures de cache à 5,00 $, contre Reflection Beam : non publié dans l'article de blog, la documentation ou la liste des modèles.
• Disponibilité — Opus 5.5 est en disponibilité générale aujourd’hui ; Beam fait l’objet d’une liste d’attente pour une bêta, les poids, le rapport technique et la fiche modèle étant promis plus tard ce mois-ci.
• Modalité — Opus 5.5 accepte le texte, les images et les fichiers ; Beam accepte uniquement le texte.
• Contexte — 1 000 000 de tokens contre 256 000, le chiffre de Beam étant assorti d’une réserve liée à la version bêta.
• Poids ouverts — non pour Opus 5.5, promis sous Apache 2.0 pour Beam, pas encore livré.
• Score indépendant — Opus 5.5 en propose un ; Beam non.

Le prix est la partie qui ne se compare pas
Les tarifs de 4,00 $ et de 20,00 $ d'Opus 5.5 correspondent au tarif catalogue du fournisseur, et dans notre catalogue ils sont répercutés tels quels, sans rien ajouter. Les lectures de cache à 0,20 $ et les écritures de cache à 5,00 $ ont une importance capitale pour la charge de travail à laquelle Opus 5.5 est destiné — une longue session agentique qui relit tour après tour la même base de code de 200 000 tokens paie le tarif de cache sur la quasi-totalité de celle-ci, et non le tarif d'entrée. C'est un levier bien réel et souvent sous-estimé, et il vaut la peine de le modéliser avant de conclure qu'un modèle de pointe dépasse le budget.
Beam n'a pas de chiffre comparable. Il n'y a pas de prix catalogue auquel se comparer, pas de palier de cache à modéliser, et aucun tarif publié pour la bêta. Reflection n'a pas dit si Beam serait vendu au token, facturé au siège ou offert avec les poids. Quiconque cite aujourd'hui un coût par million pour Beam ne fait que l'inventer.
La conséquence pratique : la comparaison des prix n’est pas « Opus 5.5 est cher et Beam est moins cher ». Elle est « l’un des deux a un prix, et l’autre a une date ». Pour une équipe qui doit décider aujourd’hui, cette asymétrie tranche davantage que ne le font les benchmarks.
Benchmarks : les deux chiffres qui se chevauchent, et pourquoi ils ne sont toujours pas comparables
Les tableaux de lancement de Reflection n'incluent pas Opus 5.5, ni aucun modèle fermé de pointe. Son ensemble de comparaison est entièrement ouvert ou semi-ouvert : Inkling, Nemotron 3 Ultra, GLM 5.2, GLM 5.3, Kimi K3, Qwen 3.8-Max et DeepSeek V4.1 Flash. Tout tableau comparant Beam à Opus doit donc être assemblé à la main, et l'assembler honnêtement signifie nommer les différences de harness plutôt que de les lisser.
Il existe exactement deux benchmarks pour lesquels les deux modèles disposent d’une valeur publiée, et aucun des deux appariements n’est contrôlé.
• Humanity's Last Exam — Reflection rapporte Beam à 36,2 sans outils ; Artificial Analysis enregistre Opus 5.5 à 61,4. Deux harnais différents, deux configurations différentes — le chiffre d'Opus 5.5 n'est pas étiqueté « sans outils » — et un écart de vingt-cinq points qui en dit moins sur les modèles que sur le dispositif.
• SciCode — Reflection rapporte Beam à 49,7 ; Artificial Analysis enregistre 66,9 pour Opus 5.5. Même benchmark, même problème : l’un des chiffres provient de l’exécution du fournisseur lui-même, l’autre d’un harnais tiers.
Tout le reste ne se recoupe pas du tout. Le tableau de Beam repose sur Terminal-Bench v2.1, tandis que l'indice Artificial Analysis actuel utilise Terminal-Bench 4.0 — une version différente de la même suite, c'est pourquoi les 80,1 de Beam et les 59,6 d'Opus 5.5 sur ce tableau ne constituent pas une comparaison et ne devraient jamais être imprimés côte à côte. Sur l'indice lui-même, Artificial Analysis place Opus 5.5 à 57,6 dans la configuration Max / Default Fallback, classé quatrième des 147 modèles de cette exécution. Beam n'a pas de ligne dans l'indice : les pages du modèle renvoient 404 et le classement ne comporte aucune entrée Beam ce matin.
La seule déclaration réellement indépendante et officielle au sujet de Beam est celle d’Artificial Analysis, le 5 octobre, selon laquelle Reflection lui avait donné accès et qu’elle évaluait le modèle de manière indépendante — et que les premiers indicateurs suggèrent que Beam sera l’un des modèles ouverts les plus économes en tokens qu’elle ait vus pour son niveau d’intelligence. C’est une phrase forte venant de la bonne source, et c’est encore une phrase sans chiffre. C’est le chiffre qui décidera de cette confrontation.

Là où l’argument d’efficacité mord réellement
L'argument de Reflection n'est pas que Beam est plus intelligent qu'un modèle de frontière. C'est que Beam obtient des résultats comparables à ceux de GLM 5.2 tout en utilisant 3 à 4 fois moins de calcul d'inférence, et que l'écart se creuse face aux modèles de la famille à 2 000 milliards de paramètres, dans laquelle se situe Qwen 3.8-Max. Le graphique qui le sous-tend estime les FLOPs générés comme deux fois le nombre de paramètres actifs multiplié par le nombre moyen de tokens générés par tentative, et sa propre légende admet que cela exclut le préremplissage du prompt, l'attention et les surcoûts de service.
Prenez cela au pied de la lettre, et la cible intéressante n’est pas du tout Opus 5.5 — c’est le milieu du marché. Opus 5.5 se mesure sur la capacité par tâche et l’emporte sur les tâches qui exigent du jugement : les refactorisations en plusieurs étapes, la revue de code, les travaux où une mauvaise réponse coûte plus cher que les tokens. Un modèle qui est éveillé à 4,6 pour cent par token se mesure sur le coût par tâche et gagne là où le volume domine et où la barre de qualité est « suffisamment bon et vérifié en aval ». Ce sont des produits différents, et une comparaison qui oppose Beam à Opus 5.5 sur un seul tableau de scores mesure la mauvaise chose.
Il y a un effet de second ordre qui mérite d’être nommé. Si l’argument d’efficacité de Beam tient, son terrain naturel est le type de charge de travail où, autrement, vous dépenseriez les tokens d’un modèle de pointe sur une tâche pour laquelle il est surqualifié. C’est une décision de routage, pas un choix de modèle, et c’est la raison pour laquelle la question du prix compte davantage que celle du benchmark ici : on ne peut pas router en fonction du coût vers un modèle sans coût.
En les exécutant côte à côte, lorsque Beam est appelable
Opus 5.5 est dès aujourd'hui dans notre catalogue à 4,00 $ et 20,00 $ par million de tokens, au prix catalogue répercuté sans rien ajouter, et il côtoie plus de 200 autres modèles derrière une seule clé compatible OpenAI sur api.orcarouter.ai/v1. Si vous vouliez faire un test A/B d'une charge de travail entre un modèle de pointe et un modèle ouvert bon marché, voilà à quoi ressemble la configuration : deux identifiants de modèle, une seule clé, pas de second contrat et aucune modification du code — et le basculement automatique dans le routage fait qu'un fournisseur qui passe une mauvaise après-midi n'emporte pas votre pipeline avec lui.
Beam ne peut pas encore en faire partie, et nous n’allons pas prétendre le contraire. Reflection Beam ne figure pas parmi nos routes, et nous ne vous orienterons vers personne susceptible de le revendre. Lorsque les poids seront publiés sous Apache 2.0, vous pourrez l’héberger vous-même et router vers votre propre endpoint ; d’ici là, le seul chemin possible est la liste d’attente de Reflection.
Pour une charge de travail où un modèle de pointe est réellement indispensable, la comparaison à faire n'est pas avec Beam. Elle se fait avec tout le reste du catalogue : GLM 5.3 à 1,26 $ et 3,96 $, Qwen 3.8-Max à 2,00 $ et 6,00 $, et DeepSeek V4.1 Flash à 0,15 $ et 0,60 $, tous relevés en direct ce matin. C'est le segment dans lequel Beam atterrira s'il pratique des tarifs compétitifs, et c'est un voisinage bien plus difficile que ne le laisse entendre le graphique de lancement.

Qu'est-ce qui changerait ce verdict
Trois choses, par ordre de l'importance qu'elles auraient.
Une ligne Artificial Analysis pour Beam. Pas l’annonce de son arrivée — la ligne. Si l’indice atterrit près du 57,6 d’Opus 5.5 tandis que l’affirmation d’efficacité des tokens survit au contact d’un harnais tiers, le milieu du marché devient vraiment inconfortable et Beam devient la valeur par défaut pour beaucoup de travaux à fort volume. S’il atterrit plus près du groupe des modèles à poids ouverts, dans le bas des quarante, Beam est un modèle bon marché solide, et rien de plus.
Un prix. Un modèle sans tarif catalogue ne peut pas gagner un débat sur les coûts, car il n’y a rien à comparer. Si Beam se place en dessous de la gamme GLM 5.3, l’argument de l’efficacité devient très vite un argument de budget. S’il se place au-dessus des 0,15 $ et 0,60 $ de DeepSeek V4.1 Flash sans avantage sur le plan des capacités, il aura du mal à décrocher les volumes de travail pour lesquels il a été conçu.
Les poids. Tant qu'ils n'existent pas, « open-weight » est une affirmation à propos d'une licence qui n'a pas été accordée, et personne ne peut vérifier l'arithmétique FLOPs-per-score sur un modèle qu'il est réellement possible d'exécuter. C'est la vérification que Reflection a invitée et n'a pas encore rendue possible.
Tant qu’au moins l’un de ceux-ci n’est pas disponible, le choix pratique ne se discute même pas. Opus 5.5 est le modèle sur lequel on peut raisonner, évaluer les coûts et livrer. Beam est le modèle que l’on garde à l’œil.
Comparés dans cet article3
Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement
