
Union Alpha vs Qwen3.8 Flash : un point, c’est toute l’histoire
- OrcaNOUVEAUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 par million de tokens
- orcaNOUVEAUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens
- deepseekNOUVEAUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- openaiNOUVEAUOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligence69Code
- grokSpaceXAI: Grok 4.62026-08-1244Intelligence77Code
- metaMeta: Muse Spark 1.22026-08-0540Intelligence72Code
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligence76Code
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligence69Code
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 par million de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Union Alpha et Qwen3.8 Flash ne sont séparés que d’un point sur le seul test qui a mesuré les deux. Sur la suite SMF Clearinghouse Official A — 157 tests, raisonnement désactivé — Union Alpha a obtenu 136 et une exécution locale de Qwen3.8-Flash-Next a obtenu 137. C’est le résultat en face-à-face le plus serré qu’ait obtenu l’un ou l’autre modèle, et c’est aussi le chiffre le plus trompeur de cette comparaison, car les deux entrées n’ont pas été exécutées dans les mêmes conditions et une seule d’entre elles correspond à un modèle que vous pouvez réellement louer dès maintenant.
Ce que l'écart d'un point vous dit et ne vous dit pas
Commencez par ce que cela établit. Union Alpha n’est pas un bluff au sens trivial — une vaste suite de 157 tests avec zéro erreur, un raisonnement parfait (30/30) et une utilisation parfaite des outils (2/2) n’est pas ce que produit un point de terminaison creux. Son résultat en codage de 26/30 et en mathématiques de 24/30 le situent sur un terrain crédible, et son score d’écriture de 2/5 le place très loin du travail de prose à usage général.
Maintenant, les mises en garde, qui sont structurantes.
L'entrée Qwen3.8 Flash était une exécution locale de Qwen3.8-Flash-Next — le checkpoint à poids ouverts — et non l'API hébergée Qwen3.8 Flash. Le service local implique votre propre quantification, votre propre pile d'inférence, votre propre analyseur d'appels d'outils. Rien de tout cela n'est garanti de correspondre à ce que renvoie le point de terminaison hébergé, et les personnes qui ont mené le test ont signalé la comparaison comme non définitive pour exactement cette raison.
Une suite ne fait pas un profil. Official A est large mais superficiel par catégorie : la catégorie tools, c’est 2 tests. Une catégorie d’outils à deux tests qui obtient 2/2 est un bon signe, pas une preuve de fiabilité agentique, et Union Alpha est explicitement positionné comme un modèle agentique et de codage. L’instrument mesure quelque chose d’adjacent à l’affirmation.
Et ce point unique se trouve lui-même dans le bruit d'une suite de 157 tests. Considérez 136 et 137 comme « ils sont dans la même bande », et non comme un classement.
Côte à côte
• Fenêtre de contexte — Union Alpha 262 144 jetons contre Qwen3.8 Flash 1 000 000 jetons servis (262 144 natifs, étendus via YaRN).
• Sortie max — Union Alpha 131 072 tokens contre Qwen3.8 Flash 131 000 tokens. Quasiment identique.
• Entrées — texte et image sur Union Alpha vs texte, image et vidéo sur Qwen3.8 Flash.
• Tarification — 0 $ pendant la préversion d’Union Alpha, contre Qwen3.8 Flash à 0,150 $/M en entrée, 0,470 $/M en sortie, 0,018 $/M en lecture en cache et 0,230 $/M en écriture en cache.
• Contrôles du raisonnement — aucun sur Union Alpha, contre un mode de réflexion sur Qwen3.8 Flash activé par défaut et désactivable.
• Temps jusqu'au premier token — Union Alpha 10,00 s p50 contre Qwen3.8 Flash 6,62 s p50, tous deux mesurés sur notre endpoint sur la même fenêtre de sept jours. La vitesse de décodage brute est plus proche que ne le suggère la réputation : 170 tokens par seconde contre 103.
• Provenance — opérateur anonyme, aucun poids, contrairement à Alibaba/Qwen, avec les poids Qwen3.8-Flash-Next publiés en open source sur Hugging Face et ModelScope.

Qwen3.8 Flash : un pari sur l’efficacité avec 6B de paramètres actifs
Qwen3.8 Flash a été lancé le 26 août 2026 en tant que version de production gérée du checkpoint open-weight Qwen3.8-Flash-Next, qu'Alibaba a publié simultanément. Il s'agit d'un modèle mixture-of-experts de 125 milliards de paramètres activant environ 6 milliards de paramètres par token, plus 51 milliards de paramètres d'embedding N-gram, construit sur une attention hybride qui combine Gated DeltaNet avec un indexeur d'attention parcimonieuse.
La présentation du fournisseur porte sur l’économie de l’entraînement : Alibaba indique que le coût d’exécution représente environ un neuvième de celui de Qwen3.7-Plus, avec des préremplissages annoncés jusqu’à 7,6 fois plus rapides et des décodages jusqu’à 4,9 fois plus rapides sur des charges de travail de 1 M de jetons avec un taux de succès du cache élevé. Il s’agit de chiffres du fournisseur, qui n’ont pas été reproduits de manière indépendante.
Son tableau de benchmarks est lui aussi déclaré par le fournisseur et non reproduit : SWE-bench Pro 62,5, DeepSWE v1.1 58,7, SWE-bench Multilingual 81,0, NL2Repo 48,1, CoWorkBench 73,9, JobBench 55,7, RealWorldQA 88,5, LVBench 76,6, AndroidWorld 84,5. Le chiffre qu’il vaut la peine de citer en réponse au marketing est Humanity's Last Exam, à 35,9, qui se situe en dessous des 40,0 de Claude Opus 4.6 dans la même comparaison.
Sur notre propre page de modèle, la section des benchmarks publics affiche encore « en attente » — aucun tiers ne l'a encore évalué. Ce que nous avons, en revanche, c'est notre propre trafic : un temps médian jusqu'au premier token de 6,62 secondes, un débit de sortie de 103 tokens par seconde et un taux d'erreur de 4,5 %. Ce taux d'erreur est suffisamment élevé pour mériter une surveillance, et c'est le genre de chiffre qui n'apparaît que lorsque l'on mesure un point de terminaison en direct plutôt qu'un article de lancement.

Union Alpha : le modèle sans propriétaire
Union Alpha est apparu dans des catalogues tiers le 16 septembre 2026 et est servi sur l'offre gratuite d'OrcaRouter. Il n'a pas de laboratoire nommé, pas de poids, pas de licence, pas de nombre de paramètres et pas de note d'architecture. Son champ fournisseur indique « Stealth ».
Son point de terminaison, du moins, est lisible : contexte de 262 144 jetons, sortie maximale de 131 072 jetons, entrée texte et image avec sortie texte uniquement, appel d’outils, sortie JSON, temperature, top_p et max_tokens, et aucun contrôle de raisonnement du tout. Le choix d’outil ne respecte effectivement que « auto ». Sa fenêtre gratuite a été décrite comme ayant une durée d’environ une semaine, avec des limites de débit, et aucune tarification après l’aperçu n’a été annoncée.
L'affirmation énoncée — « des performances de niveau frontière sur un large éventail de tâches à usage général » — est rapportée par l'opérateur et non auditée. Le résultat 136/157 Official A est la seule mesure indépendante qui existe.

La vitesse est le point où ils cessent de se ressembler
Les chiffres de débit mis en avant ne les distinguent pas comme on pourrait s'y attendre, et la raison mérite d'être comprise.
D'après notre propre télémétrie de routage sur les sept derniers jours, Qwen3.8 Flash génère un flux de 103 jetons de sortie par seconde, avec un temps jusqu'au premier jeton (p50) de 6,62 secondes et un taux d'erreur de 4,5 %. Union Alpha, mesuré de la même manière, génère un flux de 170 jetons par seconde. En vitesse de décodage brute, le modèle anonyme est le plus rapide des deux.
Ce qu'il ne fait pas, c'est démarrer. Les p50 et p95 du temps jusqu'au premier token d'Union Alpha sont tous deux figés à 10,00 secondes, ce qui signifie qu'au moins la moitié de toutes les requêtes attendent dix secondes ou plus avant que le premier token n'apparaisse, et son taux d'erreur sur la même fenêtre est de 7,7 % — environ 1,7 fois celui de Qwen. L'exécution Official A de 157 tests sur laquelle s'appuient les sections précédentes a pris 4,6 heures de temps réel, avec une latence médiane de 91,9 secondes et une moyenne de 104,8 secondes par test, et quatre tests ont atteint le délai d'expiration de 300 secondes du harnais de test. Des testeurs indépendants qui l'ont exécuté le jour du lancement ont signalé un débit bien inférieur à celui qu'affiche notre point de terminaison, ce à quoi on peut s'attendre de la part d'un service qui absorbe encore une énorme charge du premier jour.
La différence pratique n’est donc pas la vitesse de décodage. C’est le délai avant le premier token et la fiabilité. Union Alpha n’est utilisable pour rien d’interactif — pas d’autocomplétion, pas d’assistance intégrée, pas de boucle d’agent serrée — car dix secondes de silence sont indiscernables d’un blocage. Il convient aux travaux asynchrones : tâches par lots nocturnes, longs passages de documents, exécutions d’évaluation hors ligne où rien n’attend le premier token et où un taux d’échec de 7,7 % est absorbé par une nouvelle tentative.
Qwen3.8 Flash à 103 jetons par seconde avec un délai médian jusqu’au premier jeton de 6,62 secondes n’est pas rapide non plus. Le constat honnête est que les deux sont lents, et qu’un seul d’entre eux échoue sur environ une requête sur treize.
L’argument de l’efficacité, et qui a le droit de le formuler
Alibaba avance un argument de coût d'entraînement : un neuvième du coût d'entraînement de Qwen3.7-Plus, six milliards de paramètres actifs par token, donc peu cher à servir. C'est une affirmation à propos d'un modèle dont les poids existent et dont la lignée est documentée.
L’argument d’efficacité d’Union Alpha est implicite plutôt que formulé : un modèle anonyme de 256K qu’il est gratuit d’appeler. Gratuit n’est pas synonyme de bon marché. Quelqu’un paie pour ces GPU, la preview a une fin annoncée, et l’aveu de l’opérateur lui-même qu’il optimisait pour la vitesse suggère que l’économie du service n’est pas encore stabilisée. Un modèle gratuit pendant une semaine puis impossible à tarifer a un argument d’efficacité qui expire avec la fenêtre.
Tenter l'inconnu sans parier dessus
La raison pour laquelle cette confrontation précise mérite d’être gardée en tête, c’est qu’elle constitue le test le moins cher possible d’un modèle non éprouvé. Qwen3.8 Flash est la valeur connue : fournisseur nommé, poids ouverts, benchmarks publiés (même s’ils sont teintés par le fournisseur), un prix réel par token de 0,150 $/0,470 $. Union Alpha est l’inconnue, facturée à zéro, dont toute la prétention à la compétitivité repose sur un seul résultat de 157 tests.
Plutôt que de choisir, placez l’inconnu derrière une règle de basculement. OrcaRouter répercute le prix catalogue des fournisseurs à 0 % de marge et prend en charge le basculement automatique entre fournisseurs, de sorte qu’un point de terminaison Union Alpha limité en débit ou disparu bascule vers un modèle qui répond encore au lieu de se manifester comme une tâche échouée à 3 h du matin. Les deux modèles reposent sur la même clé, donc l’expérience coûte un changement de configuration plutôt qu’une seconde intégration — et aucun des deux n’a à être une décision que vous devez défendre, car vous pouvez inverser le routage lorsque la fenêtre gratuite se ferme.
Verdict
Qwen3.8 Flash est le modèle sur lequel bâtir. Six milliards de paramètres actifs, des poids frères open source, une fenêtre de 1 M de tokens, l'entrée vidéo, un débit fonctionnel de 103 tokens par seconde et un prix publié que vous pouvez anticiper. Ses benchmarks sont rapportés par le fournisseur et son taux d'erreur mérite d'être surveillé, mais il appartient à quelqu'un, et ce quelqu'un livre.
Union Alpha est le modèle à mesurer. L'écart d'un point sur Official A est vraiment intéressant — cela suggère que, quelle que soit cette chose, ce n'est pas un jouet — et à 0 $ avec un plafond de sortie de 131K et une entrée visuelle, cela vaut une semaine de votre attention. Mais un écart d'un point sur une suite, produit par un opérateur anonyme avec un taux d'erreur de 7,7 %, est une raison d'enquêter plutôt qu'une raison de changer.
Ce qu'il faut surveiller est la même chose qui a toujours tranché cette question : un nom. Ox Alpha, l'entrée précédente de cette série, a été dévoilé six jours après être apparu sous le nom de GLM-5.3-Flash de Zhipu. Si Union Alpha en obtient un, la comparaison ne porte plus sur un point, mais sur un prix.
La quantité connue est tarifée et documentée : Page du modèle Qwen3.8 Flash affiche les tarifs de 0,150 $/0,470 $, le contexte servi de 1 M de tokens et le plafond de sortie de 131 K, les benchmarks publics étant encore en attente.
