
Union Alpha vs Gemini 3.8 Flash : l’un a un score, l’autre une affirmation
- OrcaNOUVEAUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 par million de tokens
- orcaNOUVEAUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens
- deepseekNOUVEAUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- openaiNOUVEAUOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligence69Code
- grokSpaceXAI: Grok 4.62026-08-1244Intelligence77Code
- metaMeta: Muse Spark 1.22026-08-0540Intelligence72Code
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligence76Code
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligence69Code
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 par million de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Union Alpha et Gemini 3.8 Flash sont le même argument de vente présenté à deux niveaux de preuve complètement différents. L'opérateur d'Union Alpha le décrit comme offrant « des performances de niveau frontière sur un large éventail de tâches générales » et n'a publié aucun benchmark, aucun nombre de paramètres, aucune licence et aucun nom. Gemini 3.8 Flash est livré avec un tableau d'évaluation daté, un indice d'intelligence Artificial Analysis, des chiffres de coût par tâche provenant de testeurs indépendants et un barème tarifaire documenté qui s'étend jusqu'en 2027. Si vous choisissez entre eux pour autre chose que le prix, vous choisissez entre un chiffre que vous pouvez vérifier et une phrase que vous ne pouvez pas.
Côte à côte, avant la dispute
• Fenêtre de contexte — Union Alpha 262 144 jetons contre Gemini 3.8 Flash 1 048 576 jetons.
• Sortie maximale — 131,072 tokens contre 65,536 tokens. Union Alpha l'emporte sur ce point, et c'est le seul axe structurel où c'est le cas.
• Entrées — texte et image sur les deux, mais Gemini 3.8 Flash accepte en plus la vidéo, l'audio et les fichiers.
• Tarification — Union Alpha à 0 $ pendant sa préversion, contre Gemini 3.8 Flash à 0,75 $/M en entrée, 3,75 $/M en sortie, 0,075 $/M en entrée mise en cache, pour doubler à 1,50 $/7,50 $ le 1er janvier 2027.
• Contrôles de raisonnement — aucun exposé sur Union Alpha, contrairement aux niveaux de réflexion sur Gemini 3.8 Flash qui influent directement à la fois sur la qualité et sur le coût.
• Évaluation publiée — aucune de la part de l'opérateur d'Union Alpha par rapport à un tableau complet daté sur Gemini 3.8 Flash.
• Provenance — opérateur anonyme, aucun poids par rapport à la sortie datée et à la lignée documentée de Gemini 3.8 Flash.

Ce que disent réellement les chiffres de Gemini 3.8 Flash
Gemini 3.8 Flash a été lancé le 2 septembre 2026 — troisième sortie Flash de Google en six semaines environ, ce qui en dit long sur la part de l’histoire de ce modèle qui relève du rythme plutôt que d’une percée. Le tableau d’évaluation publié crédite conjointement artificialanalysis.ai et deepmind.google, il faut donc le lire comme un mélange de chiffres indépendants et de chiffres du fournisseur plutôt que comme un audit tiers neutre.
• AA Coding — 76,3, ce qui est un score de codage véritablement solide.
• AA Intelligence — 41,2. Notez qu'Artificial Analysis rapporte séparément 59 sur l'Intelligence Index à effort de raisonnement élevé, de sorte que le chiffre varie beaucoup selon le réglage d'effort ; précisez le réglage, sinon le chiffre n'a aucun sens.
• GPQA Diamond — 95,3, de loin le chiffre le plus élevé de cette comparaison.
• HLE-Verified — 54,9, avec le simple Humanity's Last Exam à 47,8.
• Terminal-Bench 2.1 — 89,4 dans le propre tableau de Google, légèrement devant les 89,1 de Claude Opus 5.
• Rappel en contexte long — 81,3 ; SciCode 56,6 ; tau_banking 44,9.
• Débit observé — 323 tokens de sortie par seconde sur une fenêtre récente de sept jours, avec un taux d'erreur de 0,63 %, un temps médian jusqu'au premier token de 3,46 seconde et un trafic mesuré de 498,5 M de tokens.
Les faiblesses sont tout aussi documentées que les points forts. Sur Terminal-Bench 4.0, il obtient 19,1 contre 51,8 pour Claude Opus 5. Sur OSWorld 2.0, il atteint 59,0 % contre 75,4 %. Sur GDPVal-AA v2, il est à la traîne avec 1545 Elo contre 1824. Gemini 3.8 Flash excelle sur une gamme précise de tâches et s'effondre dans les évaluations d'agents généraux les plus difficiles — exactement le genre de profil qu'un tableau publié permet de voir.
La tournure tarifaire qui prend les gens au dépourvu
Google a laissé le prix par token inchangé par rapport à Gemini 3.7 Flash. La facture a quand même augmenté.
Le modèle travaille plus dur : davantage d’étapes de raisonnement, davantage d’appels d’outils itératifs. Des tests indépendants menés par Artificial Analysis ont mesuré environ 30 % de jetons de sortie en plus par tâche et un coût par tâche supérieur d’environ 40 % à celui de 3.7 Flash. En raisonnement élevé, cela se situe autour de 0,58 $ par tâche ; le niveau moyen se situe près de 0,41 $ et le niveau faible près de 0,24 $.
C'est l'élément le plus utile de la comparaison pour quiconque établit un budget, et cela vaut bien au-delà de ces deux modèles : le prix unitaire et le coût par tâche sont des chiffres différents, et un seul d'entre eux figure sur une page de tarification. Google a maintenu 3.7 Flash disponible comme option moins chère, ce qui constitue une reconnaissance tacite de ce changement.
Ce que Union Alpha propose à la place
Union Alpha a fait son apparition dans des catalogues tiers le 16 septembre 2026 et fonctionne sur l'offre gratuite d'OrcaRouter. Il est anonyme — aucun laboratoire, aucun poids, aucune licence, aucune date de coupure des connaissances — et gratuit pendant une fenêtre annoncée d'environ une semaine, avec limitation de débit, sans qu'aucun prix après l'aperçu n'ait été annoncé.
Son point de terminaison est vérifiable même là où sa provenance ne l'est pas : contexte de 262 144 jetons, sortie maximale de 131 072 jetons, entrée texte et image avec sortie texte uniquement, appel d'outils et sortie JSON, temperature, top_p, max_tokens, et aucun contrôle de raisonnement d'aucune sorte. Le choix d'outil ne prend effectivement en charge que "auto".
Il y a exactement une mesure indépendante. SMF Clearinghouse a exécuté 157 tests Official A avec le raisonnement désactivé et a obtenu un score de 136/157 — 86,6 %, zéro erreur, dixième sur vingt-six. Le raisonnement était parfait à 30/30, les outils à 2/2, la programmation à 26/30, les mathématiques à 24/30. La rédaction est arrivée à 2/5.
Ce n’est pas un mauvais résultat. Il n’est simplement pas comparable. Official A est une vaste suite généraliste de 157 tests ; AA Coding et GPQA Diamond sont des instruments différents qui mesurent des choses différentes à des niveaux de difficulté différents. Mettre 136/157 à côté de 95,3 sur GPQA Diamond et déclarer un vainqueur serait exactement le genre de blanchiment qui rend les chiffres des fournisseurs inutiles.


La comparaison des coûts que personne ne peut réellement terminer
Voici l’exemple résolu, et il est délibérément incomplet.
Prenez une tâche que vous exécutez mille fois par mois. Sur Gemini 3.8 Flash en raisonnement élevé, le chiffre publié d’environ 0,58 $ par tâche porte cela à environ 580 $ par mois. C’est un chiffre réel et défendable, construit à partir d’une consommation de tokens mesurée.
Sur Union Alpha, ces mêmes mille tâches coûtent 0 $ aujourd'hui. Ce qu'elles coûteront dans trois semaines est inconnu, car aucun prix après la préversion n'existe. Ce qu'elles coûtent en fiabilité est également inconnu, car le modèle est limité en débit, fonctionne sur un seul point de terminaison sans fournisseur de secours, et répond avec HTTP 429 une fois que vous dépassez un plafond que personne n'a publié.
Donc, la réponse honnête est qu’Union Alpha remporte la seule comparaison de coûts disponible et perd la capacité de la prévoir. Pour un comparatif ponctuel, cela convient. Pour une ligne budgétaire, ce n’est pas un chiffre — c’est un espoir avec une URL.
Où chacun a sa place
Gemini 3.8 Flash a sa place partout où vous avez besoin d'un plancher mesuré : le travail documentaire à contexte long avec entrée vidéo ou audio, les tâches de codage où le score AA Coding de 76,3 est l'instrument pertinent, et toute charge de travail assortie d'un budget, car vous pouvez calculer le coût avant de vous engager et vous savez qu'il double le 1er janvier 2027.
Union Alpha a sa place dans le créneau exploratoire — essayer un modèle 256K doté de capacités de vision, dont le plafond de sortie est le double de celui de Gemini, sur des tâches où un point de terminaison disparu ne vous coûte rien.
La raison de les exécuter derrière un seul point de terminaison plutôt que deux intégrations est que cette comparaison va changer de forme à plusieurs reprises. Un DSL de routage vous permet de composer les deux en un seul appel — Gemini 3.8 Flash comme chemin mesuré, Union Alpha comme branche expérimentale — au lieu de coder en dur une décision que vous voudrez reconsidérer lorsque la fenêtre gratuite se fermera ou lorsque les tarifs d'introduction de Google expireront. Aucune de ces dates n'est éloignée, et toutes deux feront bouger le calcul.
Qu'est-ce qui réglerait ça ?
Une entrée datée pour Union Alpha dans un classement qui comporte aussi Gemini 3.8 Flash. C’est là toute la pièce manquante. Jusque-là, la position défendable n’est pas « Union Alpha est aussi bon que Gemini 3.8 Flash » — c’est « Union Alpha est gratuit pendant une semaine et personne ne l’a mesuré par rapport à quoi que ce soit que Google publie. » Ce sont deux phrases très différentes, et une seule d’entre elles est actuellement vraie.
La moitié mesurée de la paire est documentée ici : page du modèle Gemini 3.8 Flashaffiche les tarifs de 0,75 $/3,75 $, la remise de 90 % sur les entrées mises en cache et le plafond de sortie de 65 536 tokens qui détermine le travail sur les longs rapports.
Comparés dans cet article1
Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement
