
Union Alpha vs Qwen3.8 Flash: En poäng är hela historien
- OrcaNYOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M tokens
- orcaNYOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M tokens
- deepseekNYDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- openaiNYOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligens76Kodning
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligens69Kodning
- grokSpaceXAI: Grok 4.62026-08-1244Intelligens77Kodning
- metaMeta: Muse Spark 1.22026-08-0540Intelligens72Kodning
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligens76Kodning
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligens69Kodning
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Union Alpha och Qwen3.8 Flash ligger en poäng ifrån varandra på det enda test som har mätt båda. På SMF Clearinghouse Official A-suite – 157 tester, resonemang avstängt – fick Union Alpha 136 och en lokal körning av Qwen3.8-Flash-Next fick 137. Det är det jämnaste direktmötet någon av modellerna har, och det är också den mest missvisande siffran i den här jämförelsen, eftersom de två posterna inte kördes under samma förutsättningar och bara en av dem är en modell som du faktiskt kan hyra just nu.
Vad en enpoängsskillnad säger och inte säger dig
Börja med vad det fastställer. Union Alpha är inte en bluff i trivial bemärkelse – en omfattande testsvit med 157 tester, noll fel, perfekt resonemang (30/30) och perfekt verktygsanvändning (2/2) är inte något som en ihålig slutpunkt producerar. Dess kodningsresultat på 26/30 och matte på 24/30 placerar det på trovärdig mark, och dess skrivbetyg på 2/5 placerar det inte i närheten av allmän prosaskrivning.
Nu till förbehållen, som är bärande.
Posten Qwen3.8 Flash var en lokal körning av Qwen3.8-Flash-Next — checkpointen med öppna vikter — inte det värdbaserade Qwen3.8 Flash-API:et. Lokal servering innebär din egen kvantisering, din egen inferensstack, din egen verktygsanropsparsare. Inget av det är garanterat att matcha vad den värdbaserade slutpunkten returnerar, och de som körde testet flaggade jämförelsen som icke-definitiv av just den anledningen.
En svit är inte en profil. Officiell A är bred men grund per kategori: verktyg är 2 tester. En verktygskategori med två tester som får 2/2 är ett gott tecken, inte bevis på agentisk tillförlitlighet, och Union Alpha är uttryckligen positionerad som en agentisk och kodande modell. Instrumentet mäter något angränsande till påståendet.
Och själva den enda punkten ligger i bruset från en testsvit med 157 tester. Behandla 136 och 137 som "dessa ligger i samma intervall", inte som en rangordning.
Sida vid sida
• Kontextfönster — Union Alpha 262 144 token vs Qwen3.8 Flash 1 000 000 serverade token (262 144 inbyggda, utökade via YaRN).
• Max utdata — Union Alpha 131 072 tokens vs Qwen3.8 Flash 131 000 tokens. I praktiken likvärdigt.
• Indata – text och bild på Union Alpha jämfört med text, bild och video på Qwen3.8 Flash.
• Prissättning — $0 under Union Alphas förhandsversion jämfört med Qwen3.8 Flash till $0,150/M indata, $0,470/M utdata, $0,018/M cachad läsning, $0,230/M cacheskrivning.
• Resonemangskontroller — inga på Union Alpha jämfört med ett tankeläge på Qwen3.8 Flash som är aktiverat som standard och kan inaktiveras.
• Tid till första token – Union Alpha 10,00 s p50 mot Qwen3.8 Flash 6,62 s p50, båda uppmätta på vår endpoint under samma sjudagarsperiod. Rå avkodningshastighet är närmare än vad ryktet antyder: 170 tokens per sekund mot 103.
• Ursprung — anonym operatör, inga vikter vs Alibaba/Qwen, där Qwen3.8-Flash-Next-vikterna har gjorts öppet tillgängliga på Hugging Face och ModelScope.

Qwen3.8 Flash: en satsning på 6B aktiva parametrar för effektivitet
Qwen3.8 Flash lanserades den 26 augusti 2026 som den produktionsklara, hanterade versionen av checkpointen Qwen3.8-Flash-Next med öppna vikter, som Alibaba släppte samtidigt. Det är en mixture-of-experts-modell med 125B parametrar som aktiverar ungefär 6B parametrar per token, plus 51B N-gram-inbäddningsparametrar, byggd på hybrid uppmärksamhet som kombinerar Gated DeltaNet med en indexerare för gles uppmärksamhet.
Leverantörens inramning handlar om träningsekonomi: Alibaba rapporterar att körningskostnaden är ungefär en niondel av Qwen3.7-Plus, med påstådd prefill upp till 7,6× snabbare och decode upp till 4,9× snabbare vid arbetsbelastningar på 1M tokens med höga cacheträffar. Dessa är leverantörssiffror och har inte reproducerats oberoende.
Dess benchmarktabell är också leverantörsrapporterad och oreproducerad: SWE-bench Pro 62,5, DeepSWE v1.1 58,7, SWE-bench Multilingual 81,0, NL2Repo 48,1, CoWorkBench 73,9, JobBench 55,7, RealWorldQA 88,5, LVBench 76,6, AndroidWorld 84,5. Siffran som är värd att citera tillbaka mot marknadsföringen är Humanity's Last Exam på 35,9, vilket ligger under Claude Opus 4.6:s 40,0 i samma jämförelse.
På vår egen modellsida står det fortfarande "pending" i avsnittet för offentliga benchmarks — ingen tredje part har betygsatt den ännu. Det vi däremot har är vår egen trafik: en median på 6,62 sekunder till första token, en utdatahastighet på 103 token per sekund och en felfrekvens på 4,5 %. Den felfrekvensen är tillräckligt hög för att vara värd att bevaka, och det är en sådan siffra som bara dyker upp när man mäter en aktiv endpoint i stället för ett lanseringsinlägg.

Union Alpha: modellen utan ägare
Union Alpha dök upp i tredjepartskataloger den 16 september 2026 och tillhandahålls på OrcaRouters kostnadsfria nivå. Det har inget namngivet labb, inga vikter, ingen licens, inget parameterantal och ingen arkitekturanteckning. Dess leverantörsfält lyder "Stealth".
Dess endpoint är åtminstone läsbar: kontext på 262 144 token, maximal utdata på 131 072 token, text- och bildinmatning med enbart textutdata, verktygsanrop, JSON-utdata, temperature, top_p och max_tokens, och inga kontroller för resonemang över huvud taget. Verktygsvalet stöder i praktiken endast "auto". Dess kostnadsfria tidsfönster har beskrivits som ungefär en vecka, med hastighetsbegränsning, och ingen prissättning efter förhandsvisningen har tillkännagivits.
Det angivna påståendet – "prestanda på frontier-nivå över ett brett spektrum av allmänna uppgifter" – är operatörsrapporterat och oreviderat. Resultatet 136/157 på Official A är den enda oberoende mätning som finns.

Hastigheten är där de slutar likna varandra
De genomströmningssiffror som lyfts fram i rubrikerna skiljer dem inte åt på det sätt man skulle förvänta sig, och anledningen är värd att förstå.
Enligt vår egen routningstelemetri under de senaste sju dagarna strömmar Qwen3.8 Flash med 103 utdata-tokens per sekund, med en p50-tid till första token på 6,62 sekunder och en felfrekvens på 4,5 %. Union Alpha, mätt på samma sätt, strömmar med 170 tokens per sekund. I rå avkodningshastighet är den anonyma modellen den snabbare av de två.
Det den inte gör är att starta. Union Alphas p50- och p95-tid till första token ligger båda fastlåsta på 10,00 sekunder, vilket innebär att minst hälften av alla förfrågningar väntar tio sekunder eller mer innan den första tokenen visas, och dess felfrekvens under samma fönster är 7,7 % — ungefär 1,7 gånger Qwens. Den 157-testiga Official A-körningen som de tidigare avsnitten lutar sig mot tog 4,6 timmars väggklockstid, med en medianlatens på 91,9 sekunder och ett medelvärde på 104,8 sekunder per test, och fyra tester nådde testramverkets 300-sekunders timeout. Oberoende testare som körde den på lanseringsdagen rapporterade mycket lägre genomströmning än vår endpoint visar, vilket är vad man kan förvänta sig av en tjänst som fortfarande absorberar en enorm första-dagens belastning.
Så den praktiska skillnaden är inte avkodningshastighet. Det är tid till första token och tillförlitlighet. Union Alpha är inte användbart för något interaktivt – ingen autokomplettering, ingen inline-hjälp, ingen snäv agentloop – eftersom tio sekunders tystnad inte går att skilja från en hängning. Det passar asynkront arbete: batchjobb över natten, långa dokumentgenomgångar, offline-utvärderingskörningar där inget väntar på den första token och en felfrekvens på 7,7 % absorberas av ett nytt försök.
Qwen3.8 Flash med 103 tokens per sekund och en median-tid till första token på 6,62 sekunder är inte heller snabbt. Den ärliga formuleringen är att båda är långsamma, och bara en av dem misslyckas med ungefär en förfrågan av tretton.
Effektivitetsargumentet, och vem som får framföra det
Alibaba lägger fram ett argument om träningskostnad: en niondel av kostnaden för att träna Qwen3.7-Plus, sex miljarder aktiva parametrar per token, vilket gör den billig att betjäna. Det är ett påstående om en modell vars vikter existerar och vars härkomst är dokumenterad.
Union Alphas effektivitetsberättelse är underförstådd snarare än uttalad – en anonym 256K-modell som är gratis att anropa. Gratis är inte samma sak som billig. Någon betalar för de där GPU:erna, förhandsvisningen har ett angivet slut, och operatörens eget medgivande att de optimerade för hastighet tyder på att ekonomin för att serva modellen ännu inte är fastställd. En modell som är gratis i en vecka och inte går att prissätta efteråt har ett effektivitetsargument som upphör med fönstret.
Att prova det okända utan att satsa på det
Anledningen till att just den här matchningen är värd att hålla i huvudet är att den är det billigaste möjliga testet av en obeprövad modell. Qwen3.8 Flash är den kända kvantiteten: namngiven leverantör, öppna vikter, publicerade (om än leverantörsvinklade) riktmärken, ett verkligt pris per token på $0.150/$0.470. Union Alpha är det okända, prissatt till noll, vars hela konkurrenskraftiga anspråk vilar på ett enda resultat från 157 tester.
I stället för att välja, placera det okända bakom en failover-regel. OrcaRouter för vidare leverantörens listpris med 0 % påslag och stöder automatisk failover mellan leverantörer, så en rate-limitad eller försvunnen Union Alpha-slutpunkt faller vidare till en modell som fortfarande svarar i stället för att visas som ett misslyckat jobb klockan 03.00. Båda modellerna ligger på samma nyckel, så experimentet kostar en konfigurationsändring i stället för en andra integration – och ingen av dem behöver vara ett beslut du måste försvara, eftersom du kan växla routningen när det kostnadsfria fönstret stängs.
Dom
Qwen3.8 Flash är modellen att bygga på. Sex miljarder aktiva parametrar, öppna vikter för systermodeller, ett fönster på 1M tokens, videoinmatning, en fungerande takt på 103 tokens per sekund och ett publicerat pris du kan förutse. Dess benchmarks är leverantörsrapporterade och dess felfrekvens är värd att bevaka, men den tillhör någon och den någon levererar.
Union Alpha är modellen att mäta. Gapet på en poäng på Official A är verkligen intressant – det antyder att vad det här än är, så är det ingen leksak – och vid $0 med ett tak på 131K utdata och visionsinmatning är det värt en veckas uppmärksamhet. Men ett gap på en poäng i en enda svit, framställt av en anonym operatör med en felfrekvens på 7,7 %, är ett skäl att undersöka snarare än ett skäl att byta.
Det man bör hålla ögonen på är samma sak som alltid har avgjort detta: ett namn. Ox Alpha, det tidigare inslaget i den här serien, avslöjades sex dagar efter att ha dykt upp som Zhipus GLM-5.3-Flash. Om Union Alpha får ett sådant, slutar jämförelsen handla om en poäng och börjar handla om ett pris.
Den kända kvantiteten är prissatt och dokumenterad: Qwen3.8 Flash-modelsidanvisar priserna $0.150/$0.470, den serverade kontexten på 1M tokens och utdatataket på 131K, medan offentliga benchmarks ännu återstår.
