
Union Alpha vs Gemini 3.8 Flash: uno ha un punteggio, l'altro ha una dichiarazione
- OrcaNUOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M di token
- orcaNUOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token
- deepseekNUOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- openaiNUOVOOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenza69Codice
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0540Intelligenza72Codice
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligenza76Codice
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligenza69Codice
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M di token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Union Alpha e Gemini 3.8 Flash sono la stessa proposta presentata a due livelli di prova completamente diversi. L'operatore di Union Alpha lo descrive come dotato di "prestazioni di livello frontier su un'ampia gamma di compiti generici" e non ha pubblicato alcun benchmark, alcun numero di parametri, alcuna licenza e alcun nome. Gemini 3.8 Flash è stato rilasciato con una tabella di valutazione datata, un Artificial Analysis Intelligence Index, cifre di costo per attività provenienti da tester indipendenti e un listino prezzi documentato che si estende fino al 2027. Se scegli tra i due in base a qualcosa di diverso dal prezzo, stai scegliendo tra un numero che puoi verificare e una frase che non puoi.
Fianco a fianco, prima della discussione
• Finestra di contesto — Union Alpha 262.144 token vs Gemini 3.8 Flash 1.048.576 token.
• Output massimo — 131.072 token vs 65.536 token. Union Alpha vince su questo punto, ed è l'unico asse strutturale in cui ci riesce.
• Input — testo e immagini su entrambi, ma Gemini 3.8 Flash accetta inoltre video, audio e file.
• Prezzi — Union Alpha $0 durante l'anteprima rispetto a Gemini 3.8 Flash $0,75/M input, $3,75/M output, $0,075/M input in cache, che raddoppiano a $1,50/$7,50 il 1° gennaio 2027.
• Controlli di ragionamento — nessuno esposto su Union Alpha rispetto ai livelli di pensiero su Gemini 3.8 Flash che influiscono direttamente sia sulla qualità sia sui costi.
• Valutazione pubblicata — nessuna da parte dell'operatore di Union Alpha rispetto a una tabella completa e datata su Gemini 3.8 Flash.
• Provenienza — operatore anonimo, nessun peso rispetto al rilascio datato e al lignaggio documentato di Gemini 3.8 Flash.

Cosa dicono davvero i numeri di Gemini 3.8 Flash
Gemini 3.8 Flash è stato lanciato il 2 settembre 2026 — il terzo rilascio Flash di Google in circa sei settimane, il che ti fa capire quanto la storia di questo modello sia più una questione di cadenza che di vera svolta. La tabella di valutazione pubblicata cita tra le fonti artificialanalysis.ai e deepmind.google, quindi va letta come un misto di dati indipendenti e di dati del fornitore, più che come un audit terzo e imparziale.
• AA Coding — 76.3, che è un punteggio di coding davvero solido.
• AA Intelligence — 41.2. Si noti che Artificial Analysis riporta separatamente 59 sull'Intelligence Index con uno sforzo di ragionamento elevato, perciò il numero varia molto in base all'impostazione dello sforzo; indicare l'impostazione, altrimenti il numero è privo di significato.
• GPQA Diamond — 95.3, il valore singolo più alto in questo confronto, di gran lunga.
• HLE-Verified — 54,9, con il semplice Humanity's Last Exam a 47,8.
• Terminal-Bench 2.1 — 89,4 nella tabella di Google stessa, di poco davanti all'89,1 di Claude Opus 5.
• Richiamo su contesto lungo — 81,3; SciCode 56,6; tau_banking 44,9.
• Throughput osservato — 323 token di output al secondo in una recente finestra di sette giorni, con un tasso di errore dello 0,63%, un tempo mediano al primo token di 3,46 secondi e 498,5M token di traffico misurato.
I punti deboli sono documentati quanto i punti di forza. Su Terminal-Bench 4.0 ottiene 19,1 contro il 51,8 di Claude Opus 5. Su OSWorld 2.0 totalizza il 59,0% contro il 75,4%. Su GDPVal-AA v2 resta indietro a 1545 Elo contro 1824. Gemini 3.8 Flash è eccellente in una specifica fascia di lavoro e cade a picco sulle valutazioni general-agent più difficili — che è esattamente il tipo di profilo che una tabella pubblicata ti permette di vedere.
Il colpo di scena sui prezzi che coglie tutti alla sprovvista
Google ha lasciato invariato il prezzo per token rispetto a Gemini 3.7 Flash. Il conto è comunque aumentato.
Il modello lavora di più: più passaggi di ragionamento, più chiamate iterative agli strumenti. Test indipendenti condotti da Artificial Analysis hanno misurato circa il 30% in più di token di output per attività e un costo per attività superiore di circa il 40% rispetto a 3.7 Flash. Con il ragionamento elevato, si arriva a circa 0,58 $ per attività; la modalità media si attesta intorno a 0,41 $ e quella bassa a circa 0,24 $.
Questa è la cosa più utile in assoluto della comparazione per chiunque debba fare un budget, e vale ben oltre questi due modelli: prezzo unitario e costo per attività sono numeri diversi, e solo uno dei due compare su una pagina dei prezzi. Google ha mantenuto 3.7 Flash disponibile come opzione più economica, il che è un riconoscimento implicito di questo cambiamento.
Cosa offre invece Union Alpha
Union Alpha è apparso su cataloghi di terze parti il 16 settembre 2026 e funziona sul piano gratuito di OrcaRouter. È anonimo — nessun laboratorio, nessun peso, nessuna licenza, nessuna data limite delle conoscenze — e gratuito per una finestra dichiarata di circa una settimana, con limiti di frequenza, senza alcun prezzo annunciato dopo l'anteprima.
Il suo endpoint è verificabile anche laddove la sua provenienza non lo è: contesto di 262.144 token, output massimo di 131.072 token, input di testo e immagini con output solo testo, tool calling e output JSON, temperature, top_p, max_tokens, e nessun controllo di reasoning di alcun tipo. La scelta del tool supporta di fatto solo "auto".
Esiste esattamente una misurazione indipendente. SMF Clearinghouse ha eseguito 157 test Official A con il ragionamento disattivato e ha ottenuto 136/157 — 86,6%, zero errori, decimo su ventisei. Il ragionamento è stato perfetto: 30/30, strumenti 2/2, programmazione 26/30, matematica 24/30. La scrittura si è fermata a 2/5.
Non è un brutto risultato. Semplicemente non è un risultato comparabile. Official A è una vasta suite generale di 157 test; AA Coding e GPQA Diamond sono strumenti diversi che misurano cose diverse a livelli di difficoltà diversi. Mettere 136/157 accanto a 95,3 su GPQA Diamond e dichiarare un vincitore sarebbe esattamente il tipo di lavaggio che rende inutili i numeri dei fornitori.


Il confronto dei costi che nessuno riesce davvero a completare
Ecco l'esempio svolto, ed è volutamente incompleto.
Prendi un'attività che esegui mille volte al mese. Su Gemini 3.8 Flash con ragionamento elevato, la cifra pubblicata per attività di circa $0,58 porta a circa $580 al mese. È un numero reale e difendibile, basato sul consumo misurato di token.
Su Union Alpha, quelle stesse mille attività oggi costano 0 $. Quanto costeranno tra tre settimane è ignoto, perché non esiste alcun prezzo successivo all’anteprima. È ignoto anche quanto costino in termini di affidabilità, perché il modello è soggetto a limiti di frequenza, viene eseguito su un singolo endpoint senza provider di fallback e risponde con HTTP 429 una volta superato un limite che nessuno ha pubblicato.
Quindi la risposta onesta è che Union Alpha vince l'unico confronto di costi disponibile e perde la capacità di prevederlo. Per un confronto comparativo una tantum, va bene. Per una voce di bilancio, non è un numero — è una speranza con un URL.
Dove ognuno appartiene
Gemini 3.8 Flash è la scelta giusta ovunque serva un livello di base misurato: lavoro su documenti a contesto lungo con input video o audio, attività di programmazione in cui il punteggio AA Coding di 76,3 è lo strumento pertinente, e qualsiasi carico di lavoro con un budget associato, perché puoi calcolare il costo prima di impegnarti e sai che raddoppia il 1° gennaio 2027.
Union Alpha va nello slot esplorativo — provare un modello da 256K con capacità di visione, il cui tetto di output è il doppio di quello di Gemini, su lavori in cui un endpoint svanito non ti costa nulla.
Il motivo per eseguirli dietro un unico endpoint anziché tramite due integrazioni è che questa comparazione cambierà forma più volte. Un DSL di routing ti consente di comporre i due in un'unica chiamata — Gemini 3.8 Flash come percorso misurato, Union Alpha come ramo sperimentale — invece di codificare in modo rigido una decisione che vorrai rivedere quando la finestra gratuita si chiuderà o quando il prezzo introduttivo di Google scadrà. Nessuna di queste due date è lontana, ed entrambe sposteranno i calcoli.
Cosa lo risolverebbe
Una voce datata per Union Alpha su una classifica che riporta anche Gemini 3.8 Flash. È questo l'intero pezzo mancante. Fino ad allora, la posizione difendibile non è "Union Alpha è valido quanto Gemini 3.8 Flash" — è "Union Alpha è gratuito per una settimana e nessuno l'ha misurato rispetto a nulla di ciò che Google pubblica". Sono frasi molto diverse, e solo una di esse al momento è vera.
La metà misurata della coppia è documentata qui: pagina del modello Gemini 3.8 Flashriporta le tariffe di $0,75/$3,75, lo sconto del 90% sull'input in cache e il limite di output di 65.536 token che determina il lavoro sui report lunghi.
Confrontati in questo articolo1
Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno
