
Union Alpha vs Qwen3.8 Flash: Eén punt vertelt het hele verhaal
- OrcaNIEUWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 mln tokens
- orcaNIEUWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens
- deepseekNIEUWDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- openaiNIEUWOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligentie69Coderen
- grokSpaceXAI: Grok 4.62026-08-1244Intelligentie77Coderen
- metaMeta: Muse Spark 1.22026-08-0540Intelligentie72Coderen
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligentie76Coderen
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligentie69Coderen
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 mln tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Union Alpha en Qwen3.8 Flash liggen één punt uit elkaar op de enige test die beide heeft gemeten. Op de SMF Clearinghouse Official A suite — 157 tests, redeneren uitgeschakeld — scoorde Union Alpha 136 en een lokale run van Qwen3.8-Flash-Next scoorde 137. Dat is het nauwste onderlinge resultaat dat een van beide modellen heeft, en het is ook het meest misleidende getal in deze vergelijking, omdat de twee inzendingen niet onder dezelfde omstandigheden draaiden en slechts één ervan een model is dat je op dit moment daadwerkelijk kunt huren.
Wat een verschil van één punt je wel en niet vertelt
Begin met wat het vaststelt. Union Alpha is geen bluf in de triviale zin — een brede testsuite van 157 tests met nul fouten, perfect redeneervermogen (30/30) en perfect toolgebruik (2/2) is niet iets wat een leeg endpoint voortbrengt. De coderingsscore van 26/30 en wiskundescore van 24/30 plaatsen het in geloofwaardig gebied, en de schrijfscore van 2/5 plaatst het nergens in de buurt van algemeen prozawerk.
Nu de kanttekeningen, die essentieel zijn.
De Qwen3.8 Flash-inzending betrof een lokale run van Qwen3.8-Flash-Next — de open-weight checkpoint — niet de gehoste Qwen3.8 Flash API. Lokaal serveren betekent je eigen kwantisatie, je eigen inferentiestack, je eigen tool-call-parser. Niets daarvan komt gegarandeerd overeen met wat het gehoste endpoint retourneert, en de mensen die de test uitvoerden, bestempelden de vergelijking om precies die reden als niet-definitief.
Eén suite is geen profiel. Official A is breed maar ondiep per categorie: tools telt 2 tests. Een toolcategorie met twee tests die 2/2 scoort is een goed teken, geen bewijs voor agentische betrouwbaarheid, en Union Alpha wordt expliciet gepositioneerd als een agentisch en codingmodel. Het instrument meet iets wat grenst aan de claim.
En dat ene punt zelf bevindt zich in de ruis van een testsuite van 157 tests. Behandel 136 en 137 als "deze zitten in dezelfde band", niet als een rangorde.
naast elkaar
• Contextvenster — Union Alpha 262.144 tokens vs Qwen3.8 Flash 1.000.000 tokens aangeboden (262.144 native, uitgebreid via YaRN).
• Maximale uitvoer — Union Alpha 131.072 tokens vs Qwen3.8 Flash 131.000 tokens. Effectief gelijk.
• Invoer — tekst en afbeelding op Union Alpha versus tekst, afbeelding en video op Qwen3.8 Flash.
Prijzen — $0 tijdens de preview van Union Alpha versus Qwen3.8 Flash tegen $0,150/M input, $0,470/M output, $0,018/M voor cache-lezen, $0,230/M voor cache-schrijven.
• Redeneerinstellingen — geen op Union Alpha versus een denkmodus op Qwen3.8 Flash die standaard aan staat en kan worden uitgeschakeld.
• Tijd tot eerste token — Union Alpha 10,00 s p50 tegenover Qwen3.8 Flash 6,62 s p50, beide gemeten op ons endpoint over hetzelfde venster van zeven dagen. De ruwe decodesnelheid ligt dichter bij elkaar dan de reputatie doet vermoeden: 170 tokens per seconde tegenover 103.
• Herkomst — anonieme operator, geen gewichten, in tegenstelling tot Alibaba/Qwen, met Qwen3.8-Flash-Next-gewichten open-source gepubliceerd op Hugging Face en ModelScope.

Qwen3.8 Flash: een 6B-actieve inzet op efficiëntie
Qwen3.8 Flash werd op 26 augustus 2026 gelanceerd als de beheerde productieversie van het open-weight Qwen3.8-Flash-Next-checkpoint, dat Alibaba tegelijkertijd uitbracht. Het is een mixture-of-experts-model met 125 miljard parameters dat per token ongeveer 6 miljard parameters activeert, plus 51 miljard N-gram-embeddingparameters, gebouwd op hybride attention die Gated DeltaNet combineert met een sparse-attention-indexer.
De framing van de leverancier draait om trainingseconomie: Alibaba meldt dat de kosten van een run ongeveer een negende zijn van die van Qwen3.7-Plus, met naar verluidt prefill tot 7,6× sneller en decode tot 4,9× sneller bij workloads van 1M tokens met veel cachehits. Dat zijn leverancierscijfers en ze zijn niet onafhankelijk gereproduceerd.
De benchmarktabel ervan is ook door de leverancier gerapporteerd en niet gereproduceerd: SWE-bench Pro 62,5, DeepSWE v1.1 58,7, SWE-bench Multilingual 81,0, NL2Repo 48,1, CoWorkBench 73,9, JobBench 55,7, RealWorldQA 88,5, LVBench 76,6, AndroidWorld 84,5. Het cijfer dat het waard is om de marketingafdeling voor te houden, is Humanity's Last Exam met 35,9, dat in dezelfde vergelijking onder de 40,0 van Claude Opus 4.6 ligt.
Op onze eigen modelpagina staat in de sectie met openbare benchmarks nog steeds 'in afwachting' — geen enkele derde partij heeft het nog beoordeeld. Wat we wel hebben, is ons eigen verkeer: een mediane tijd tot de eerste token van 6,62 seconden, een uitvoersnelheid van 103 tokens per seconde en een foutpercentage van 4,5%. Dat foutpercentage is hoog genoeg om in de gaten te houden, en het is het soort cijfer dat alleen opduikt wanneer je een live-endpoint meet in plaats van een lanceringspost.

Union Alpha: het model zonder eigenaar
Union Alpha verscheen op 16 september 2026 in catalogi van derden en wordt aangeboden op het gratis niveau van OrcaRouter. Het heeft geen genoemd lab, geen gewichten, geen licentie, geen parameteraantal en geen architectuurnotitie. Het providerveld luidt "Stealth".
Het endpoint is tenminste leesbaar: een context van 262.144 tokens, een maximale uitvoer van 131.072 tokens, tekst- en afbeeldingsinvoer met alleen tekstuitvoer, het aanroepen van tools, JSON-uitvoer, temperatuur, top_p en max_tokens, en helemaal geen redeneerinstellingen. Toolkeuze accepteert in de praktijk alleen "auto". Het gratis venster is beschreven als ongeveer een week, met een limiet op het aantal aanvragen, en er is geen prijsstelling na de preview aangekondigd.
De beweerde claim — "frontier-level performance across a broad range of general-purpose tasks" — is door de operator gerapporteerd en niet geauditeerd. Het 136/157 Official A-resultaat is de enige onafhankelijke meting die bestaat.

Snelheid is het punt waarop ze niet meer op elkaar lijken
De opvallende doorvoercijfers scheiden ze niet op de manier die je zou verwachten, en de reden is het waard om te begrijpen.
Op basis van onze eigen routeringstelemetrie over de afgelopen zeven dagen streamt Qwen3.8 Flash met 103 outputtokens per seconde, met een p50-tijd-tot-eerste-token van 6,62 seconden en een foutpercentage van 4,5%. Union Alpha, op dezelfde manier gemeten, streamt met 170 tokens per seconde. Qua ruwe decodesnelheid is het anonieme model het snelste van de twee.
Wat het niet doet, is starten. De p50 en p95 time-to-first-token van Union Alpha staan beide vast op 10,00 seconden, wat betekent dat minstens de helft van alle verzoeken tien seconden of langer wacht voordat de eerste token verschijnt, en het foutpercentage over hetzelfde venster is 7,7% — ongeveer 1,7 keer dat van Qwen. De Official A-run van 157 tests waarop de eerdere secties leunen, duurde 4,6 uur kloktijd, met een mediane latentie van 91,9 seconden en een gemiddelde van 104,8 seconden per test, en vier tests bereikten de time-out van 300 seconden van het testharnas. Onafhankelijke testers die het op de dag van de lancering uitvoerden, meldden een veel lagere doorvoer dan ons endpoint laat zien, wat je zou verwachten van een service die nog een enorme eerste-dagbelasting verwerkt.
Het praktische verschil is dus niet de decodeersnelheid. Het is de tijd tot het eerste token en de betrouwbaarheid. Union Alpha is niet bruikbaar voor iets interactiefs — geen automatische aanvulling, geen inline-assistentie, geen strakke agent-lus — want tien seconden stilte is niet te onderscheiden van een vastloper. Het past bij asynchroon werk: nachtelijke batchtaken, lange documentverwerkingen, offline evaluatieruns waarbij niets op het eerste token wacht en een faalpercentage van 7,7% wordt opgevangen door een nieuwe poging.
Qwen3.8 Flash met 103 tokens per seconde en een mediane time-to-first-token van 6,62 seconden is ook niet snel. De eerlijke formulering is dat beide traag zijn, en dat slechts één van de twee bij ongeveer één op de dertien verzoeken faalt.
Het efficiëntieargument, en wie het mag aanvoeren
Alibaba voert een argument over trainingskosten aan: een negende van de kosten van Qwen3.7-Plus om te trainen, zes miljard actieve parameters per token, dus goedkoop om te serveren. Dat is een bewering over een model waarvan de gewichten bestaan en waarvan de afstamming gedocumenteerd is.
Union Alpha's efficiëntieverhaal wordt gesuggereerd in plaats van expliciet genoemd — een anoniem model van 256K dat gratis aan te roepen is. Gratis is niet hetzelfde als goedkoop. Iemand betaalt voor die GPU's, de preview heeft een aangekondigd einde, en de eigen toegeving van de operator dat ze aan het optimaliseren waren voor snelheid suggereert dat de serveereconomie nog niet is uitgekristalliseerd. Een model dat een week gratis is en daarna niet te prijzen valt, heeft een efficiëntieargument dat met dat venster vervalt.
Het onbekende uitproberen zonder erop in te zetten
De reden waarom juist deze confrontatie het waard is om in je hoofd te houden, is dat het de goedkoopst mogelijke test van een onbewezen model is. Qwen3.8 Flash is de bekende factor: een genoemde leverancier, open gewichten, gepubliceerde (zij het door de leverancier gekleurde) benchmarks, een echte prijs per token van $0.150/$0.470. Union Alpha is de onbekende, geprijsd op nul, wiens volledige concurrentieclaim op één resultaat van 157 tests berust.
In plaats van te kiezen, zet je het onbekende achter een failoverregel. OrcaRouter geeft de listprijs van de provider door tegen 0% opslag en ondersteunt automatische failover tussen providers, zodat een rate-limited of verdwenen Union Alpha-endpoint terugvalt op een model dat nog steeds antwoordt, in plaats van om 3 uur 's nachts als een mislukte taak op te duiken. Beide modellen zitten op dezelfde sleutel, dus het experiment kost een configuratiewijziging in plaats van een tweede integratie — en geen van beide hoeft een beslissing te zijn die je moet verdedigen, want je kunt de routering omzetten wanneer het gratis venster sluit.
Vonnis
Qwen3.8 Flash is het model om op voort te bouwen. Zes miljard actieve parameters, open-source gewichten van een zustermodel, een contextvenster van 1M tokens, video-invoer, een werkende 103 tokens per seconde, en een gepubliceerde prijs die je kunt voorspellen. De benchmarks zijn door de leverancier gerapporteerd en het foutenpercentage is het waard om te monitoren, maar het is eigendom van iemand, en die iemand shipt.
Union Alpha is het model om te meten. Het gat van één punt op Official A is oprecht interessant — het suggereert dat wat dit ding ook is, het geen speelgoed is — en voor $0 met een uitvoerplafond van 131K en visuele input is het een week van je aandacht waard. Maar een gat van één punt op één suite, geproduceerd door een anonieme operator met een foutpercentage van 7,7%, is een reden om te onderzoeken in plaats van een reden om over te stappen.
Wat je in de gaten moet houden, is hetzelfde dat dit altijd al heeft beslecht: een naam. Ox Alpha, de vorige deelnemer in deze serie, werd zes dagen na zijn verschijning als Zhipu's GLM-5.3-Flash onthuld. Als Union Alpha er een krijgt, gaat de vergelijking niet langer over een punt maar over een prijs.
Het bekende is geprijsd en gedocumenteerd: Qwen3.8 Flash-modelpagina toont de tarieven van $0,150/$0,470, de geserveerde context van 1M tokens en het uitvoerplafond van 131K, terwijl publieke benchmarks nog moeten volgen.
