
Reflection Beam vs Gemini 3.1 Pro Preview : l'un lit la vidéo, l'autre lit le texte
- openaiNOUVEAUOpenAI: GPT-6.1 Sol2026-09-2952Intelligence
- anthropicNOUVEAUAnthropic: Claude Sonnet 5.52026-09-2856Intelligence
- typesafeNOUVEAUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 par million de tokens · 150 tok/s
- OpenAINOUVEAUOpenAI: GPT-6 Luna2026-09-2238Intelligence
- OpenAINOUVEAUOpenAI: GPT-6 Sol2026-09-2248Intelligence
- AnthropicNOUVEAUAnthropic: Claude Opus 5.52026-09-2258Intelligence
- xAIGrok 4.72026-09-2146Intelligence
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 par million de tokens · 127 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens · 1202 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 par million de tokens · 53 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens · 202 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens · 229 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
Commençons par l'asymétrie qu'aucun tableau de benchmark de cette comparaison ne mentionne. Reflection Beam, annoncé le 5 octobre 2026, est un modèle sparse mixture-of-experts de 501 milliards de paramètres, dont 23 milliards de paramètres actifs par token, et il prend du texte en entrée et renvoie du texte en sortie. Rien d'autre. Gemini 3.1 Pro Preview, le modèle multimodal de pointe du fournisseur depuis le 19 février 2026, accepte le texte, les images, la vidéo, l'audio et les fichiers, et c'est le seul modèle de cette comparaison où la question « peut-il voir la chose sur laquelle je veux poser une question » appelle une réponse différente pour chaque camp. Tout le reste — les ratios de parcimonie, les fenêtres de contexte, les niveaux de prix — relève de l'argumentation. Celle-là est une spécification.
Cela signifie aussi qu'il s'agit de la paire la moins symétrique de l'ensemble, et de la plus utile, car elle révèle à quoi sert réellement une comparaison de modèles. Si votre charge de travail est du texte, Beam et Gemini 3.1 Pro sont deux options sur un spectre qui va du bon marché et non mesuré au coûteux et minutieusement évalué. Si votre charge de travail contient une trame vidéo, il n'y a pas de comparaison à faire.
Ce qu'est chaque modèle
Gemini 3.1 Pro Preview est le modèle phare de Google dans la catégorie « preview » : 1 048 576 tokens de contexte, une sortie maximale de 65 536 tokens, cinq modalités d'entrée, et une fenêtre d'un million de tokens atteinte par paliers tarifaires plutôt qu'à un tarif unique. Google le positionne pour l'ingénierie logicielle renforcée, de meilleures capacités agentiques et une utilisation plus efficace des tokens sur des flux de travail complexes. Ses poids ne sont pas ouverts. Son nom porte encore la mention « Preview », que Google conserve pour ce modèle depuis février.
Reflection Beam est le premier modèle de Reflection et le début d'une série à poids ouverts. Cinq cent un milliards de paramètres au total, 23 milliards actifs — soit environ 4,6 % du modèle éveillé par token. Vingt-trois virgule huit billions de tokens de pré-entraînement sur 6 144 puces GB300 en moins de quatre semaines, puis une campagne d'apprentissage par renforcement sur 10 500 puces GB300 pendant quatre semaines, avec plus de 100 millions de rollouts sur environ un million d'environnements. Son API est compatible OpenAI à l'adresse api.reflection.ai/openai/v1, avec Chat Completions et une liste Models, son contexte est de 256 000 tokens avec une note de bas de page bêta, son paramètre reasoning_effort comporte cinq niveaux et aucun interrupteur d'arrêt, et ses poids sont promis pour plus tard ce mois-ci sous licence Apache 2.0.
• Modalité — Gemini 3.1 Pro Preview prend en charge le texte, les images, la vidéo, l'audio et les fichiers ; Reflection Beam ne prend que le texte.
Contexte et sortie — 1 048 576 tokens en entrée et 65 536 en sortie pour Gemini, contre 256 000 en entrée et 128 000 en sortie pour Beam.
• Prix — Gemini 3.1 Pro Preview à 2,00 $ en entrée et 12,00 $ en sortie par million de jetons jusqu’à 200 000 jetons, passant à 4,00 $ et 18,00 $ au-delà, avec des lectures du cache à 0,20 $ ; Reflection Beam n’a pas de prix publié.
• Surface d’outillage — appel natif d’outils, sorties structurées et ancrage sur la recherche côté Google ; appel d’outils et sorties structurées côté Beam, avec un endpoint limité à Chat Completions.
• Poids — propriétaires pour Gemini ; Apache 2.0 promis pour Beam, pas encore publié.
• Score indépendant — Gemini 3.1 Pro Preview dispose d'un indice Artificial Analysis ; Beam n'a aucune ligne au tableau.
L’écart de modalité est tout l’argument.
Il vaut la peine d’être concret plutôt que de se contenter d’évoquer vaguement le « multimodal », car les conséquences pratiques sont précises.
Une charge de travail qui ingère un enregistrement d'écran, une photo de produit, un contrat scanné ou un fichier audio de centre d'appels ne peut pas être servie par Beam, à aucun prix, avec aucun prompt, sur aucun forfait. Il n'existe aucun contournement au niveau de l'API : la documentation de Beam décrit une seule modalité d'entrée et une seule modalité de sortie, et aucun chemin pour l'image ou l'audio n'y est répertorié. Gemini 3.1 Pro Preview prend en charge les cinq, ce qui signifie qu'il est le seul modèle ici à pouvoir être intégré dans un flux de travail où l'entrée n'est pas déjà du texte.
Le cas inverse mérite aussi d’être énoncé, car c’est celui sur lequel les gens se trompent. Si votre entrée est du texte et le restera, les cinq modalités de Gemini ne vous apportent rien, et vous payez le prix d’un modèle multimodal pour exécuter une charge de travail textuelle. Ce n’est pas un argument en faveur de Beam — c’est un argument pour dire que la question des modalités devrait être tranchée avant celle du benchmark, car elle élimine des options à moindre coût et de manière plus fiable que ne le fait n’importe quelle comparaison de scores.
Deux aperçus, deux significations différentes
Les deux noms de modèle comportent une mise en garde, et ces mises en garde ne se ressemblent pas, ce qui est la chose la plus intéressante dans ce duo.
Le « Preview » de Gemini 3.1 Pro est une convention de nommage sur un modèle généralement accessible depuis février, avec un score indépendant, une grille tarifaire publiée incluant un palier de contexte long documenté, et une surface d’outils complète. En pratique, « preview » signifie ici que Google se réserve le droit de le remplacer, et non qu’il est difficile d’y accéder ou qu’il n’est pas évalué.
La bêta de Beam est un véritable verrou. L'accès se fait par liste d'attente, l'ID du modèle a été créé le 5 octobre 2026, il n'existe aucune grille tarifaire, aucun score tiers, et les artefacts qui permettraient à quiconque de vérifier l'affirmation centrale — les poids, le rapport technique, la fiche modèle — sont promis plutôt que livrés. Le chiffre de contexte comporte une note de bas de page avertissant qu'il peut changer pendant la bêta, ce qui est une précaution dont aucun modèle en disponibilité générale n'a besoin.
La conséquence est asymétrique d’une manière qui compte pour les achats. Une équipe qui adopte Gemini 3.1 Pro Preview accepte un risque de renouvellement du modèle. Une équipe qui adopte Beam aujourd’hui accepte un prix inconnu, une évaluation indépendante inconnue et l’incapacité d’exécuter elle-même le modèle. Ce sont des catégories de risque différentes, et le prix est celle qui tranche le plus souvent.

Benchmarks, et le problème de citation
Les tableaux de lancement de Reflection n’incluent pas Gemini 3.1 Pro Preview ni aucun modèle Google. Son ensemble de comparaison est uniquement composé de modèles ouverts et semi-ouverts : Inkling, Nemotron 3 Ultra, GLM 5.2, GLM 5.3, Kimi K3, Qwen 3.8-Max et DeepSeek V4.1 Flash. Les deux modèles n’ont donc jamais été évalués l’un contre l’autre dans un tableau publié, et les chiffres ci-dessous proviennent de harnais différents de part et d’autre.
• Artificial Analysis Intelligence Index — Gemini 3.1 Pro Preview enregistre 29,7 et se classe 58e sur 147 lors de son exécution. Beam n’a aucune ligne dans l’indice.
• GPQA Diamond — Gemini 3.1 Pro Preview à 94,1 selon Artificial Analysis, contre 90,5 rapporté par le fournisseur de Beam.
• SciCode — 58,7 pour Gemini contre les 49,7 rapportés par le fournisseur de Beam.
• Humanity's Last Exam — 47,0 pour Gemini contre 36,2 rapporté par le fournisseur de Beam, ce score étant explicitement sans outils.
• Terminal-Bench v2.1 — 73,8 pour Gemini selon Artificial Analysis, contre le 80,1 annoncé par Beam. C’est la meilleure ligne de Beam dans cette confrontation, et c’est une moisson face à un modèle présent sur le marché depuis février.
• Rappel de contexte long — 82,0 pour {{1}}contre{{/1}} les 79,0 déclarés par le fournisseur {{2}}Bar{{/2}} sur AA-LCR.
• tau-squared Bench — 95,6 pour Gemini contre les 78,7 de Beam sur MCP Atlas et 38,0 sur tau3 banking. Des évaluations connexes de l'usage agentique d'outils, pas la même, et la différence d'appellation compte.
Il y a un problème d’honnêteté distinct du côté Gemini de ce tableau qui mérite sa propre phrase. Des scores d’index indépendants pour Gemini 3.1 Pro Preview ont été cités à 30, 46, 47,7 et 57 selon différentes sources, et Artificial Analysis propose différentes révisions de l’index sur différentes pages de modèles au même moment. Le chiffre de 29,7 ci-dessus est celui de la page que nous avons lue le 6 octobre 2026, et c’est le seul que nous citerons — mais tout article qui place un seul chiffre d’index Gemini à côté d’un concurrent sans préciser de quel instantané il provient présente un nombre flottant comme un nombre fixe. La même prudence s’applique en sens inverse à Beam, où il n’y a pas d’instantané du tout.
Le prix, et le palier auquel personne ne se prépare
Gemini 3.1 Pro Preview est à 2,00 $ en entrée et 12,00 $ en sortie par million de tokens jusqu'à 200 000 tokens, et à 4,00 $ et 18,00 $ au-delà. Les lectures de cache sont à 0,20 $ par million et les écritures de cache à 0,375 $. La limite de palier est l'élément à prendre en compte dans la planification : le principal argument de vente du modèle est une fenêtre de 1 048 576 tokens, et dès qu'une requête dépasse 200 000 tokens, le tarif d'entrée double et le tarif de sortie augmente de moitié. Une charge de travail conçue autour de la fenêtre d'un million de tokens est donc facturée au deuxième palier pour la majeure partie de son trafic, et non au premier.
Beam n'a pas de grille tarifaire, donc il n'y a aucun palier à modéliser et rien à comparer. Cette absence n'est pas neutre : elle signifie que l'affirmation la moins coûteuse qui soit défendable est que le coût de Beam est inconnu, et le seul appui quantitatif pour son positionnement en matière d'efficacité est le propre graphique de Reflection, qui estime les FLOPs générés comme le double du nombre de paramètres actifs multiplié par le nombre moyen de tokens générés par tentative sur DeepSWE, HLE et Terminal-Bench 2.1 — une légende qui concède que le préremplissage du prompt, l'attention et le surcoût de service sont exclus. Sur les charges de travail où un contexte d'un million de tokens importe, le préremplissage n'est pas un arrondi, et c'est précisément le terme que la formule omet.

Utilisation d’outils, recherche et là où les deux conceptions diffèrent
Les points forts annoncés de Gemini 3.1 Pro Preview sont l'ingénierie logicielle, la fiabilité agentique et l'efficacité en tokens, et sa surface d'outils publiée inclut l'appel de fonctions, les sorties structurées et l'ancrage par recherche. C'est ce dernier élément qu'il faut retenir pour quiconque compare des piles agentiques : la recherche ancrée est une capacité first-party du côté de Google, et elle change ce qu'un agent utilisant des outils peut faire sans qu'un service de récupération externe soit raccordé.
L'histoire des outils de Beam est plus intéressante qu'une ligne de spécification ne le suggère et plus difficile à évaluer. Reflection rapporte MCP Atlas à 78,7, AutomationBench public à 37,0, tau3 banking à 38,0, BrowseComp avec gestion du contexte à 77,4 et DeepSearchQA avec gestion du contexte à 80,1 — et note que, pendant l'apprentissage par renforcement, le modèle a appris de manière organique à interroger d'autres modèles de langage et à appeler des API OCR lorsqu'on lui donnait accès au web, bien que les tâches de navigation aient été absentes du mélange d'entraînement. Si cette généralisation tient, il s'agit d'un signal réel concernant le transfert agentique. Il s'agit aussi, à ce stade, d'une observation de fournisseur issue d'une exécution d'entraînement, sans vérification indépendante.
Sur les lignes d’utilisation d’outils où les deux camps affichent des chiffres, le tableau est contrasté plutôt qu’à sens unique. Le tableau des fournisseurs de Beam le place devant GLM 5.2 sur MCP Atlas et à égalité avec GLM 5.2 et Kimi K3 sur tau3 banking, tandis que le chiffre de 95,6 de Gemini sur tau-squared Bench est le nombre agentique le plus élevé publié par l’un ou l’autre camp. Des suites différentes, des harnais différents, et aucune évaluation commune — c’est le problème récurrent dans cette comparaison.
Choisir, et comment se couvrir
La règle de décision qui découle de ce qui précède est assez simple à énoncer en une ligne : si une entrée quelconque n’est pas du texte, Beam n’est pas une option et la comparaison s’arrête. Si toutes les entrées sont du texte, la question devient de savoir si l’allégation d’efficacité non attribuée de Beam vaut un prix inconnu et l’absence de score indépendant, face à un modèle qui coûte 2,00 $ et 12,00 $ avec un barème documenté et une surface d’outils complète.
Gemini 3.1 Pro Preview est disponible dans notre catalogue, avec le tarif catalogue du fournisseur répercuté tel quel, sans rien ajouter, derrière une seule clé compatible OpenAI sur api.orcarouter.ai/v1, aux côtés de plus de 200 autres modèles — et la même clé donne accès aux modèles avec lesquels Beam est en concurrence sur le prix, de GLM 5.3 à 1,26 $ et 3,96 $ à DeepSeek V4.1 Flash à 0,15 $ et 0,60 $, relevés en direct ce matin. Comme la frontière de palier à 200 000 tokens est un problème de routage plutôt qu'un problème de modèle, le DSL de routage vous permet de l'exprimer directement : gardez les requêtes courtes sur le palier économique et épinglez les vraiment longues là où la fenêtre est la raison pour laquelle vous avez choisi le modèle, en un seul appel plutôt que dans le code de l'application.
Reflection Beam ne fait pas partie de nos routes, et nous ne vous orienterons vers personne qui prétende l’avoir. Si les poids Apache 2.0 arrivent ce mois-ci comme promis, l’auto-hébergement devient une troisième option pour le travail en texte uniquement, et l’affirmation d’efficacité devient testable sur votre propre matériel.

Qu’est-ce qui changerait la réponse ?
L'argumentaire de Beam contre Gemini repose sur les deux mêmes éléments que toutes les comparaisons de Beam, et cette confrontation en ajoute un troisième.
Un prix. Sans celui-ci, l'argument d'efficacité ne peut pas être converti en décision budgétaire, et le modèle est en concurrence sur un diagramme plutôt que sur une grille tarifaire.
Une note indépendante. Artificial Analysis a déclaré le 5 octobre que Reflection lui avait donné accès et qu’il évaluait Beam, décrivant des indicateurs précoces suggérant que Beam sera l’un des modèles ouverts les plus économes en tokens qu’il ait vus pour son niveau d’intelligence. C’est la bonne source qui dit ce qu’il faut, et il n’y a toujours pas de ligne Beam au tableau — les pages du modèle renvoient une 404 et le classement ne comporte aucune entrée Beam ce matin.
Et ce qui ne change pas : Beam est uniquement textuel. Aucune publication de poids, aucune baisse de prix et aucune coupe d'indice ne modifie cela, ce qui signifie que pour toute une catégorie de charges de travail, cette comparaison ne deviendra jamais vraiment une comparaison. Si votre pipeline contient une vidéo, la réponse était Gemini 3.1 Pro Preview avant même le chargement du premier benchmark.
Comparés dans cet article1
Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement
