
Union Alpha vs Qwen3.8 Flash: un punto è tutta la storia
- OrcaNUOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M di token
- orcaNUOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token
- deepseekNUOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- openaiNUOVOOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenza69Codice
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0540Intelligenza72Codice
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligenza76Codice
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligenza69Codice
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M di token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Union Alpha e Qwen3.8 Flash distano un punto l'uno dall'altro sull'unico test che li ha misurati entrambi. Sulla suite SMF Clearinghouse Official A — 157 test, reasoning disattivato — Union Alpha ha ottenuto 136 e un'esecuzione locale di Qwen3.8-Flash-Next ha ottenuto 137. Questo è il risultato testa a testa più ravvicinato che l'uno o l'altro dei due modelli abbia, ed è anche il numero più fuorviante di questo confronto, perché le due voci non sono state eseguite nelle stesse condizioni e solo una di esse è un modello che puoi effettivamente noleggiare in questo momento.
Cosa ti dice e cosa non ti dice il divario di un punto
Parti da ciò che stabilisce. Union Alpha non è un bluff nel senso banale — un'ampia suite di 157 test con zero errori, ragionamento perfetto (30/30) e uso perfetto degli strumenti (2/2) non è qualcosa che un endpoint vuoto produce. Il suo risultato di 26/30 nella programmazione e di 24/30 in matematica lo collocano in un territorio credibile, e il suo punteggio di 2/5 nella scrittura non lo colloca neanche lontanamente vicino al lavoro di prosa di uso generale.
Ora le avvertenze, che sono portanti.
La voce Qwen3.8 Flash era un'esecuzione locale di Qwen3.8-Flash-Next — il checkpoint open-weight — non l'API ospitata Qwen3.8 Flash. Il serving locale significa la tua quantizzazione, il tuo stack di inferenza, il tuo parser per le chiamate agli strumenti. Nulla di tutto ciò è garantito corrisponda a quanto restituisce l'endpoint ospitato, e le persone che hanno eseguito il test hanno segnalato il confronto come non definitivo proprio per questo motivo.
Una suite non è un profilo. Official A è ampio ma superficiale per categoria: tools conta 2 test. Una categoria di strumenti con due test che ottiene 2/2 è un buon segno, non una prova di affidabilità agentica, e Union Alpha è esplicitamente posizionato come modello agentico e di coding. Lo strumento sta misurando qualcosa di adiacente all'affermazione.
E il singolo punto stesso è dentro il rumore di una suite di 157 test. Considera 136 e 137 come "questi sono nella stessa fascia", non come una classifica.
Fianco a fianco
• Finestra di contesto — Union Alpha 262.144 token vs Qwen3.8 Flash 1.000.000 token serviti (262.144 nativi, estesi tramite YaRN).
• Output massimo — Union Alpha 131.072 token vs Qwen3.8 Flash 131.000 token. Di fatto alla pari.
• Input — testo e immagine su Union Alpha vs testo, immagine e video su Qwen3.8 Flash.
• Prezzi — $0 durante l'anteprima di Union Alpha rispetto a Qwen3.8 Flash a $0,150/M per input, $0,470/M per output, $0,018/M per lettura da cache, $0,230/M per scrittura in cache.
• Controlli di ragionamento — nessuno su Union Alpha rispetto a una modalità di pensiero su Qwen3.8 Flash che è attiva per impostazione predefinita e può essere disattivata.
• Tempo al primo token — Union Alpha 10,00 s p50 contro Qwen3.8 Flash 6,62 s p50, entrambi misurati sul nostro endpoint nella stessa finestra di sette giorni. La velocità di decodifica grezza è più simile di quanto la reputazione suggerisca: 170 token al secondo contro 103.
• Provenienza — operatore anonimo, nessun peso rispetto ad Alibaba/Qwen, con i pesi di Qwen3.8-Flash-Next resi open source su Hugging Face e ModelScope.

Qwen3.8 Flash: una scommessa sull'efficienza da 6B di parametri attivi
Qwen3.8 Flash è stato lanciato il 26 agosto 2026 come versione di produzione gestita del checkpoint open-weight Qwen3.8-Flash-Next, che Alibaba ha rilasciato contemporaneamente. È un modello mixture-of-experts da 125 miliardi di parametri che attiva circa 6 miliardi di parametri per token, più 51 miliardi di parametri di embedding N-gram, basato su un'attenzione ibrida che combina Gated DeltaNet con un indicizzatore ad attenzione sparsa.
L'inquadramento del fornitore riguarda l'economia dell'addestramento: Alibaba riporta un costo di esecuzione pari a circa un nono di Qwen3.7-Plus, con prefill dichiarata fino a 7,6× più veloce e decode fino a 4,9× più veloce su carichi di lavoro da 1M di token con un'elevata percentuale di hit in cache. Si tratta di dati del fornitore e non sono stati riprodotti in modo indipendente.
La sua tabella di benchmark è anch'essa dichiarata dal fornitore e non riprodotta: SWE-bench Pro 62,5, DeepSWE v1.1 58,7, SWE-bench Multilingual 81,0, NL2Repo 48,1, CoWorkBench 73,9, JobBench 55,7, RealWorldQA 88,5, LVBench 76,6, AndroidWorld 84,5. Il numero che vale la pena citare in risposta al marketing è Humanity's Last Exam a 35,9, che nello stesso confronto si colloca sotto il 40,0 di Claude Opus 4.6.
Sulla nostra pagina del modello, la sezione dei benchmark pubblici riporta ancora "in attesa" — nessuna terza parte gli ha ancora assegnato un punteggio. Quello che abbiamo, invece, è il nostro traffico: un tempo mediano al primo token di 6,62 secondi, una velocità di output di 103 token al secondo e un tasso di errore del 4,5%. Quel tasso di errore è abbastanza alto da meritare attenzione, ed è il tipo di cifra che si vede solo quando si misura un endpoint live invece di un post di lancio.

Union Alpha: il modello senza proprietario
Union Alpha è apparso su cataloghi di terze parti il 16 settembre 2026 e viene erogato su il piano gratuito di OrcaRouter. Non ha un laboratorio nominato, né pesi, né licenza, né numero di parametri, né note sull'architettura. Il suo campo provider riporta "Stealth".
Il suo endpoint, almeno, è leggibile: contesto di 262.144 token, output massimo di 131.072 token, input di testo e immagini con output solo testuale, chiamata di strumenti, output JSON, temperatura, top_p e max_tokens, e nessun controllo di ragionamento. La scelta dello strumento di fatto accetta solo "auto". La sua finestra gratuita è stata descritta come di circa una settimana, con limiti di velocità, e nessun prezzo post-anteprima annunciato.
L'affermazione dichiarata — "prestazioni di livello frontier su un'ampia gamma di compiti di uso generale" — è riportata dall'operatore e non verificata. Il risultato 136/157 Official A è l'unica misurazione indipendente esistente.

La velocità è il punto in cui smettono di assomigliarsi
I numeri di throughput principali non li separano nel modo che ci si aspetterebbe, e vale la pena capirne il motivo.
Sulla nostra telemetria di routing degli ultimi sette giorni, Qwen3.8 Flash eroga in streaming 103 token di output al secondo, con un tempo al primo token p50 di 6,62 secondi e un tasso di errore del 4,5%. Union Alpha, misurato allo stesso modo, eroga in streaming 170 token al secondo. In termini di velocità di decodifica pura, il modello anonimo è il più veloce dei due.
Ciò che non fa è partire. I valori p50 e p95 del tempo al primo token di Union Alpha sono entrambi fissati a 10,00 secondi, il che significa che almeno metà di tutte le richieste attende dieci secondi o più prima che compaia il primo token, e il suo tasso di errore nello stesso intervallo è del 7,7% — circa 1,7 volte quello di Qwen. L'esecuzione Official A da 157 test su cui si basano le sezioni precedenti ha richiesto 4,6 ore di tempo reale, con una latenza mediana di 91,9 secondi e una media di 104,8 secondi per test, e quattro test hanno raggiunto il timeout di 300 secondi dell'harness. Tester indipendenti che l'hanno eseguito il giorno del lancio hanno riportato un throughput molto inferiore rispetto a quello mostrato dal nostro endpoint, il che è quanto ci si aspetterebbe da un servizio che sta ancora assorbendo un enorme carico del primo giorno.
Quindi la differenza pratica non è la velocità di decodifica. È il tempo al primo token e l'affidabilità. Union Alpha non è utilizzabile per nulla di interattivo — nessun autocompletamento, nessuna assistenza inline, nessun loop stretto dell'agente — perché dieci secondi di silenzio sono indistinguibili da un blocco. Si adatta al lavoro asincrono: processi batch notturni, lunghe elaborazioni di documenti, esecuzioni di valutazione offline in cui nulla è in attesa del primo token e un tasso di errore del 7,7% viene assorbito da un nuovo tentativo.
Qwen3.8 Flash a 103 token al secondo con un tempo mediano di 6,62 secondi per il primo token non è veloce nemmeno lui. La formulazione onesta è che entrambi sono lenti, e solo uno dei due fallisce circa una richiesta su tredici.
L'argomento dell'efficienza, e chi ha il diritto di avanzarlo
Alibaba porta un argomento sui costi di addestramento: un nono del costo di Qwen3.7-Plus per addestrarlo, sei miliardi di parametri attivi per token, quindi economico da servire. Questa è un'affermazione su un modello i cui pesi esistono e la cui discendenza è documentata.
La storia di efficienza di Union Alpha è implicita piuttosto che dichiarata — un modello anonimo da 256K che è gratuito da chiamare. Gratuito non è la stessa cosa di economico. Qualcuno sta pagando per quelle GPU, l'anteprima ha una scadenza dichiarata, e l'ammissione stessa dell'operatore di aver ottimizzato per la velocità suggerisce che l'economia del servizio non è ancora definita. Un modello gratuito per una settimana e non prezzabile dopo ha un argomento di efficienza che scade con la finestra.
Provare l'ignoto senza scommetterci
Il motivo per cui vale la pena tenere a mente questo specifico confronto è che si tratta del test più economico possibile di un modello non ancora dimostrato. Qwen3.8 Flash è la certezza: fornitore identificato, pesi aperti, benchmark pubblicati (per quanto di parte), un prezzo reale per token di $0.150/$0.470. Union Alpha è l'incognita, prezzata a zero, la cui intera pretesa competitiva si basa su un unico risultato di 157 test.
Anziché scegliere, metti l'ignoto dietro una regola di failover. OrcaRouter trasmette il prezzo di listino del provider con markup 0% e supporta il failover automatico tra provider, così un endpoint Union Alpha limitato per frequenza o scomparso ricade su un modello che risponde ancora, invece di manifestarsi come un job fallito alle 3 del mattino. Entrambi i modelli stanno sulla stessa chiave, quindi l'esperimento costa un cambio di configurazione anziché una seconda integrazione — e nessuno dei due deve essere una decisione che devi difendere, perché puoi cambiare il routing quando la finestra gratuita si chiude.
Verdetto
Qwen3.8 Flash è il modello su cui costruire. Sei miliardi di parametri attivi, pesi gemelli open source, una finestra da 1M di token, input video, 103 token al secondo reali e un prezzo pubblicato che puoi prevedere. I suoi benchmark sono dichiarati dal fornitore e il suo tasso di errore merita di essere monitorato, ma appartiene a qualcuno e quel qualcuno sta spedendo.
Union Alpha è il modello da misurare. Il divario di un punto su Official A è davvero interessante — suggerisce che, qualunque cosa sia questa cosa, non è un giocattolo — e a $0, con un tetto di output di 131K e input visivo, vale una settimana della tua attenzione. Ma un divario di un punto su una sola suite, prodotto da un operatore anonimo con un tasso di errore del 7,7%, è una ragione per indagare piuttosto che una ragione per cambiare.
La cosa da tenere d'occhio è la stessa che ha sempre risolto la questione: un nome. Ox Alpha, la precedente voce di questa serie, è stato rivelato sei giorni dopo essere apparso come GLM-5.3-Flash di Zhipu. Se Union Alpha ne ottiene uno, il confronto smette di vertere su un punto e inizia a vertere su un prezzo.
La quantità nota è prezzata e documentata: pagina del modello Qwen3.8 Flashmostra le tariffe di $0.150/$0.470, il contesto servito di 1M token e il tetto di output di 131K, con i benchmark pubblici ancora in attesa.
