
Reflection Beam vs Kimi K3 : le même nom de benchmark, deux harnais différents
- openaiNOUVEAUOpenAI: GPT-6.1 Sol2026-09-2952Intelligence
- anthropicNOUVEAUAnthropic: Claude Sonnet 5.52026-09-2856Intelligence
- typesafeNOUVEAUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 par million de tokens · 150 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligence
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligence
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligence
- xAIGrok 4.72026-09-2146Intelligence
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 par million de tokens · 98 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens · 1202 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 par million de tokens · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens · 248 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
Reflection Beam obtient un score de 80,1 sur Terminal-Bench 2.1. Kimi K3 obtient 88,3. Mettez ces deux chiffres côte à côte, comme la plupart des articles de cette semaine l'ont fait, et vous concluez que Beam est à environ huit points du meilleur modèle ouvert du domaine. Mais ces deux nombres ne proviennent pas de la même source. Le 80,1 de Beam est déclaré par le fournisseur, tiré du tableau dans le propre billet de lancement de Reflection. Le 88,3 de Kimi K3 est également déclaré par le fournisseur, cette fois à partir du propre tableau de Moonshot — et le tableau d'un fournisseur n'affiche le score de son concurrent que lorsqu'il a été exécuté sur le propre harnais du fournisseur, avec son propre ensemble de prompts, à son propre réglage d'effort. Un tiers, Artificial Analysis, a depuis exécuté Kimi K3 sur un benchmark du même nom et publié 85,0. Cela représente un écart de 4,9 points, et non de 8,2 — et la direction de la correction est tout à fait prévisible, car le nombre qui s'érode est toujours celui qui provient du laboratoire qui a quelque chose à prouver.
Voilà tout le problème que pose la comparaison promise par le titre de cet article, et c'est la raison pour laquelle ce texte consacre sa première moitié à la provenance plutôt qu'aux scores. Reflection Beam est un modèle sparse mixture-of-experts à 501 milliards de paramètres, avec 23 milliards de paramètres actifs par token, annoncé le 5 octobre 2026 par Reflection AI avec un endpoint bêta compatible OpenAI en ligne le jour même. Kimi K3 est le modèle ouvert phare de Moonshot AI, répertorié dans notre propre catalogue avec une date de sortie au 15 juillet 2026 et évalué de manière indépendante par Artificial Analysis. L'un est un produit commercialisé, avec une grille tarifaire et une évaluation réalisée par un harnais tiers ; l'autre est une bêta sur liste d'attente dont les poids, le rapport technique et le prix n'existent pas encore. Les comparer n'est pas un exercice symétrique, et prétendre le contraire produirait une page qui semble précise et qui est fausse.
La version de 30 secondes
• Beam est plus rapide par FLOP sur le papier, non tarifé en pratique et non reproduit. Kimi K3 est évalué par un tiers, facturé à 3,00 $ en entrée et 15,00 $ en sortie par million de tokens, et généralement disponible.
• Sur le seul benchmark sur lequel les deux ont été exécutés — Terminal-Bench 2.1 — l’écart honnête est d’environ cinq points, pas huit, dès lors que les chiffres de chaque camp proviennent d’un harnais neutre.
• Les vrais avantages de Beam sont structurels, non numériques : un profil de service à 23B de paramètres actifs et une licence Apache 2.0 promise. Ni l'un ni l'autre n'est utilisable aujourd'hui.
• Si vous avez besoin d’un modèle cette semaine, ce n’est pas un pile ou face. C’est un modèle déjà disponible et une liste d’attente.
Ce que Reflection a réellement publié, et contre qui
L'article de lancement de Reflection établit un tableau de scores face à sept autres modèles : Inkling, Nemotron 3 Ultra, GLM 5.2, GLM 5.3, Kimi K3, Qwen 3.8 Max et DeepSeek V4.1 Flash. Chaque chiffre du tableau est rapporté par le fournisseur, aucun n'a été reproduit de façon indépendante, et il n'existe pas de page Artificial Analysis pour Reflection Beam — la page du modèle renvoie une erreur 404 sur leur site au 6 octobre 2026. Plusieurs cellules de l'original sont marquées NR parce que le modèle n'a pas été exécuté.
Voici l’intégralité de la section Beam contre K3 de ce tableau, une ligne par dimension :
• Terminal-Bench 2.1 — Beam 80,1 contre Kimi K3 88,3
• SWE-Bench Pro v2-Hard — Beam 77,2 vs Kimi K3 88,2
• DeepSWE v1.1 — Beam 44,4 contre Kimi K3 68,0
• SWE Atlas Q&R sur la base de code — Beam 34,6 vs Kimi K3 68,0
• HLE, sans outils — Beam 36.2 vs Kimi K3 46.9
• GPQA Diamond — Beam 90,5 vs Kimi K3 93,5
• SciCode — Beam 49,7 vs Kimi K3 58,7
• MCP Atlas — Beam 78,7 contre Kimi K3 82,3
• BrowseComp avec gestion du contexte — Beam 77,4 vs Kimi K3 91,2
• DeepSearchQA avec gestion du contexte — Beam 80,1 vs Kimi K3 95,0
Lisez cette liste honnêtement, et la physionomie du lancement se dessine. Reflection ne revendique nulle part une victoire sur K3. Il prétend se situer près du sommet d’un palier tout en dépensant trois à quatre fois moins de calcul d’inférence que GLM 5.2 pour des scores de raisonnement comparables — et la seule ligne où les deux modèles sont proches, Terminal-Bench 2.1, est celle où la comparaison est la moins fiable.
Pourquoi le harnais compte plus que le score
Un nom de benchmark est une étiquette, pas une spécification. Terminal-Bench 2.1 désigne un ensemble particulier de tâches exécutées dans le cadre d’un échafaudage d’agent particulier, avec une politique de nouvelle tentative particulière, un budget de tokens particulier et un réglage d’effort de raisonnement particulier. Deux laboratoires peuvent tous deux rapporter honnêtement un chiffre « Terminal-Bench 2.1 » et produire des nombres non comparables, car l’échafaudage et le réglage d’effort sont là où réside l’essentiel de la variance. Artificial Analysis existe en tant qu’organisation précisément pour cette raison : elle exécute un seul harnais, dans une seule configuration, sur de nombreux modèles, afin que ses chiffres puissent être soustraits les uns des autres.
Ainsi, le 80,1 que Reflection affiche pour Beam est un chiffre de fournisseur issu d’un banc d’essai de fournisseur, et le 88,3 qu’elle affiche pour K3 est aussi un chiffre de fournisseur — le fournisseur étant Reflection, qui mesure son propre concurrent. Ce second chiffre est le nombre le moins fiable de la ligne : un laboratoire qui fait tourner les poids d’un rival sur sa propre infrastructure n’a aucun intérêt à les faire tourner dans la meilleure configuration du rival, et aucune obligation de divulguer celle qu’il a choisie. Il n’y a rien de malhonnête là-dedans ; c’est simplement un chiffre dont la provenance ne justifie pas le poids que la couverture lui a accordé.
L'exécution d'Artificial Analysis elle-même place Kimi K3 à 85,02 sur Terminal-Bench 2.1, aux côtés d'un 12,6 sur Terminal-Bench v4.0 — un test différent et plus difficile —, d'un AA Coding Index de 76,2 (9e rang des modèles du tableau), d'un Intelligence Index de 43,6, d'un GPQA Diamond de 93,5, d'un HLE de 46,9, d'un SciCode de 59,5, d'un tau-banking de 45,98 et d'un Long-Context Recall de 88,7. Ces valeurs sont lues sur la fiche catalogue de K3 dans notre propre système, avec pour source artificialanalysis.ai, l'instantané d'évaluation étant daté du 15 juillet 2026. Beam n'a qu'un seul chiffre dans l'univers de cette liste, et il provient de Reflection. Cette absence devrait être temporaire plutôt que permanente : Artificial Analysis a déclaré que Reflection lui avait donné accès et qu'il évaluait le modèle, et sa propre formulation initiale — selon laquelle Beam « sera l'un des modèles ouverts les plus économes en tokens que nous ayons vus pour son niveau d'intelligence » — constitue le signal, de la part d'une organisation de benchmark, d'une attente, et non la publication d'un résultat. Jusqu'à ce que ce score soit publié, les chiffres de cet article ne sont pas soustractibles, et nous n'allons pas prétendre le contraire.

Ce que chacun coûte, et ce que chacun est.
La comparaison des coûts n’est pas serrée, et ce n’est même pas vraiment une comparaison, car l’un de ses côtés est vide.
• Prix — Kimi K3 : 3,00 $ en entrée / 15,00 $ en sortie par million de tokens, avec des lectures de cache à 0,30 $, contre Reflection Beam : aucun prix publié nulle part sur le blog, la documentation ou la fiche du modèle de Reflection, la console de la plateforme se trouvant derrière un mur d'inscription.
• Contexte — 1 048 576 tokens sur Kimi K3 contre 256 000 sur la bêta de Beam, avec une note de bas de page dans la documentation de Beam elle-même indiquant « la fenêtre de contexte peut changer pendant la bêta. »
• Modalité — Kimi K3 accepte le texte et les images ; Reflection Beam fonctionne en entrée texte / sortie texte, sans voie pour l'image ou l'audio au lancement.
• Disponibilité — Kimi K3 est en disponibilité générale aujourd'hui ; Reflection Beam est une bêta sur liste d'attente dont les poids sont promis pour plus tard en octobre sous Apache 2.0.
• Scores indépendants — K3 dispose d'une ligne complète dans Artificial Analysis ; Beam n'en a aucune.
• Profil de service — Kimi K3 est un grand modèle frontière quasi dense, à 46,8 tokens de sortie par seconde selon notre propre mesure sur notre playground au cours de la semaine écoulée ; les 23 B de paramètres actifs de Beam constituent un véritable argument architectural en faveur d'une latence plus faible et d'un coût par token plus bas, mais aucun endpoint ouvert au public ne permet de le mesurer.
L'affirmation d'efficacité mérite une phrase supplémentaire de prudence, car c'est le titre principal du lancement et elle fait plus de travail qu'elle ne peut en supporter. Le « 3 à 4 fois moins de calcul d'inférence » de Reflection provient d'un graphique qui approxime les FLOPs comme le double du nombre de paramètres actifs multiplié par le nombre moyen de tokens générés. Cette formule exclut délibérément le préremplissage du prompt, le coût de l'attention et les frais de service — les parties de la facture qui dominent le travail agentique à long contexte. C'est une estimation approximative d'un ratio de calcul, pas une mesure, pas un chiffre en dollars, et elle a été construite par le fournisseur. Considérez-la comme une hypothèse que les poids permettront à quelqu'un d'autre de tester.
Où se situe OrcaRouter dans tout cela
Kimi K3 est l'une de nos routes. Il est affiché à 3,00 $ en entrée et 15,00 $ en sortie par million de tokens, avec les lectures de cache à 0,30 $, soit le tarif du fournisseur Moonshot répercuté sans rien ajouter — donc si Moonshot modifie sa grille tarifaire, le chiffre sur notre page change le jour même, plutôt qu'au moment où un revendeur actualise ses données. Il est appelable depuis une seule clé compatible OpenAI, aux côtés de plus de 200 autres modèles, ce qui compte ici pour une raison précise : la réponse honnête à « Beam ou K3 ? » est qu'une équipe qui se couvre ne devrait pas choisir. Parce que le basculement automatique fait partie du routage plutôt que d'être quelque chose que l'on construit, un modèle comme Beam — bêta, sans tarif, non évalué par un tiers — est exactement ce que l'on place sur une part du trafic plutôt que sur son chemin critique. Vous acheminez le travail vers K3 par défaut, envoyez une part à Beam lorsque votre invitation de liste d'attente arrive, et laissez le routage revenir à K3 en cas d'erreur. C'est une décision que l'on peut prendre au sujet d'un modèle non éprouvé. Parier un chemin de production sur un seul ne l'est pas.

Qu'est-ce qui changerait ce verdict
Trois choses, par ordre décroissant d'importance.
Un prix. Si Beam se positionne sous le palier K3, l’argument d’efficacité deviendrait concret plutôt que théorique. Deuxièmement, les poids. Apache 2.0 plus un rapport technique permettrait à quiconque disposant de quelques nœuds de mesurer les tokens par seconde par GPU à un seuil de qualité fixe — le test qui permet réellement de trancher une affirmation en matière de calcul. Troisièmement, une exécution de harnais par un tiers. Reflection a donné à Artificial Analysis un accès, et un score en est attendu ; tant que ce chiffre n’est pas publié, chaque donnée Beam-versus-K3 en circulation remonte à un document rédigé par l’un des deux fournisseurs.
Deux questions qui méritent une réponse directe
Reflection Beam est-il meilleur que Kimi K3 ?
Au vu des preuves disponibles aujourd’hui, non — et personne n’a publié de preuves qu’il l’est. Le propre tableau de Reflection place K3 en tête sur les dix lignes communes ci-dessus, plusieurs d’entre elles avec des écarts (SWE Atlas 34,6 vs 68,0, DeepSearchQA 80,1 vs 95,0) qui ne sont pas serrés. L’argument de Beam est le coût par unité de capacité, et cet argument reste un graphique dessiné par le fournisseur tant que les poids et un prix n’existent pas.
Dois-je attendre les poids de Beam avant de construire sur K3 ?
Uniquement si l’auto-hébergement est une exigence plutôt qu’une préférence, car c’est le seul axe sur lequel les deux ne sont pas interchangeables — K3 n’est disponible que via API, tandis que Beam promet des poids Apache 2.0. Si vous passez par une API, K3 est disponible, dispose de scores et d’un tarif, et Beam est sur liste d’attente. Aucune version de cette décision ne justifie de retarder un projet.

Reflection nous a donné une date et un graphique, et une date n’est pas un modèle. La seule chose que ce lancement établit vraiment, c’est qu’un modèle de 501B activant 23B de paramètres peut être entraîné à se situer à quelques points de la frontière ouverte — ce qui, si les poids arrivent et que les chiffres tiennent, constitue un résultat significatif en matière d’efficacité. Ce n’est pas encore une raison de déplacer le travail hors d’un modèle qu’un tiers a réellement mesuré.
