
Gemini 3.5 Flash-Lite vs Qwen 3.8: Cavallo da lavoro economico vs ammiraglia da 2.4T
- qwenNUOVOQwen: Qwen3.8 Max2026-08-03$2.00 / $6.00 per 1M di token · 56 tok/s
- deepseekNUOVODeepSeek: DeepSeek V4 Flash 07312026-07-3150Intelligenza69Codice
- qwenNUOVOQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M di token · 200 tok/s
- orcaNUOVOOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicNUOVOAnthropic: Claude Opus 52026-07-2461Intelligenza78Codice
- googleGoogle: Gemini 3.6 Flash2026-07-2150Intelligenza69Codice
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligenza49Codice
- metaMeta: Muse Spark 1.12026-07-1651Intelligenza71Codice
- kimiMoonshotAI: Kimi K32026-07-1557Intelligenza76Codice
- openaiOpenAI: GPT-5.6 Luna2026-07-0951Intelligenza71Codice
- openaiOpenAI: GPT-5.6 Terra2026-07-0955Intelligenza77Codice
- openaiOpenAI: GPT-5.6 Sol2026-07-0959Intelligenza77Codice
- grokxAI: Grok 4.52026-07-0854Intelligenza72Codice
- tencentTencent: Hy32026-07-0641Intelligenza59Codice
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232Intelligenza42Codice
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226Intelligenza39Codice
- anthropicAnthropic: Claude Sonnet 52026-06-3053Intelligenza72Codice
- klingKling: Kling 3.0 Turbo2026-06-1757Intelligenza52Codice57Matematica
- z-aiZ.ai: GLM 5.22026-06-1651Intelligenza69Codice60Matematica
- kimiMoonshotAI: Kimi K2.7 Code2026-06-1242Intelligenza61Codice61Matematica
Quando questo confronto è stato scritto per la prima volta, era sbilanciato in modo insolito: Gemini 3.5 Flash-Lite era un prodotto reale e acquistabile e Qwen 3.8 era un'anteprima riservata senza prezzo, senza benchmark e senza pesi. C'era ben poco da confrontare.
Non è più così. Qwen3.8-Max è diventato generalmente disponibile il 3 agosto 2026 con un tariffario pubblicato di $2 / $6 per milione di token, un endpoint compatibile con OpenAI e DashScope e una tabella di benchmark completa. È self-service, con costi preventivabili e attivo — anche su OrcaRouter. Quindi questo articolo è stato riscritto da zero, perché il confronto onesto oggi non è "modello disponibile contro vapore". È un vero confronto di livello: il cavallo di battaglia più economico e ad alta produttività di Google contro l'ammiraglia più grande di Alibaba.
Una nota per gli sviluppatori — questi due si trovano alle estremità opposte della curva dei costi, quindi la domanda giusta è a quale fascia appartiene il tuo carico di lavoro. OrcaRouter mette a disposizione oltre 200 modelli tramite un unico endpoint compatibile con OpenAI, così puoi testare entrambi sullo stesso compito senza dover configurare due SDK.
Verdetto TL;DR. Questi modelli non sono realmente in competizione — sono risposte a domande diverse. Flash-Lite è un modello di efficienza: Artificial Analysis Index 36, $0.30 / $2.50 per 1M, circa 490 token/sec, generalmente disponibile. È progettato per gestire ogni richiesta a costo trascurabile. Qwen3.8-Max è un modello di punta: ~2,4T parametri, un contesto da 1M di token a tariffa fissa, input nativo di immagini e video, e punteggi di livello frontier auto-dichiarati (GPQA Diamond 92.6, Terminal-Bench 2.1 86.6) — a $2 / $6, che è 6,7× la tariffa di input di Flash-Lite. Flash-Lite è la scelta predefinita giusta per classificazione, routing ed estrazione ad alto volume. Qwen3.8-Max è ciò a cui si passa quando un compito richiede davvero ragionamento di frontiera, un milione di token di contesto o input non testuale. L'unica avvertenza che non è cambiata: Qwen non ha ancora nessun punteggio benchmark indipendente.
Punti chiave
• Qwen 3.8 è ora generalmente disponibile — a partire dal 3 agosto 2026 ha prezzi pubblicati, accesso self-service e una tabella di benchmark. La precedente impostazione di un’anteprima ad accesso limitato e non preventivabile è obsoleta.
• Flash-Lite è drasticamente più economico: $0.30 / $2.50 per 1M rispetto a quelli di Qwen: $2 / $6 — circa 6.7× in input e 2.4× in output.
• Flash-Lite è molto più veloce: circa 490 token/sec, progettato per lavori ad alta produttività. Qwen3.8-Max mostra un p50 time-to-first-token di 1,64 s nella telemetria di OrcaRouter su 7 giorni, ma è un modello grande e approfondito.
• Flash-Lite ha l'unico punteggio certificato: Artificial Analysis Index 36. Qwen3.8-Max rimane senza punteggio da ogni valutatore indipendente, anche se Alibaba ora pubblica i propri numeri.
• Qwen vince nettamente sul piano delle capacità: un contesto da 1M token con tariffa fissa senza sovrapprezzo per prompt lunghi, oltre a input di testo/immagini/video e OmniDocBench 1.5 92.1 per il parsing di documenti. Flash-Lite è un piccolo modello efficiente.
• Pesi aperti: I Qwen sono promessi entro la settimana (ancora nessuna licenza), più un Qwen3.8-27B che secondo quanto riportato gira in ~17GB di VRAM. Flash-Lite è chiuso definitivamente.
Nota sull'accuratezza: tutte le cifre relative alla qualità di Qwen3.8-Max sono riportate da Alibaba e non verificate da terze parti. Le cifre di Gemini 3.5 Flash-Lite provengono da Artificial Analysis. I prezzi di Qwen si basano sulla scheda tariffaria GA di Alibaba Model Studio e sostituiscono l'accesso in era di anteprima descritto nelle versioni precedenti di questo articolo.
Specifiche e prezzo, fianco a fianco
• Produttore / stato — Flash-Lite: Google; generalmente disponibile; Qwen3.8-Max: Alibaba; GA (3 agosto 2026)
• Positioning — Flash-Lite: livello economico ad alta produttività; Qwen3.8-Max: ambizione di punta / all'avanguardia
• AA Intelligence Index — Flash-Lite: 36 (Artificial Analysis); Qwen3.8-Max: Non ancora valutato
• Punteggi dichiarati dal fornitore — Flash-Lite: posizione misurata da terzi; Qwen3.8-Max: GPQA Diamond 92.6, Terminal-Bench 2.1 86.6, OSWorld-Verified 86.1, FrontierSWE 73.5 (tutti dichiarati da Alibaba)
• Prezzo (per 1M, in / out) — Flash-Lite: $0.30 / $2.50; Qwen3.8-Max: $2.00 / $6.00, fisso su contesto 1M; input in cache $0.25
• Velocità — Flash-Lite: ~490 tok/sec (Artificial Analysis); Qwen3.8-Max: p50 TTFT 1.64s (telemetria a 7 giorni di OrcaRouter)
• Contesto — Flash-Lite: contesto di livello efficienza; Qwen3.8-Max: 1M token (983.616 con thinking; output massimo 131.072)
• Modalità — Flash-Lite: modello di efficienza incentrato sul testo; Qwen3.8-Max: testo, immagine, video in ingresso → testo in uscita
• Pesi — Flash-Lite: chiuso, solo API; Qwen3.8-Max: promesso entro la settimana, nessuna licenza ancora
• Accesso oggi — Flash-Lite: API standard, self-service; Qwen3.8-Max: API standard, self-service (Model Studio, DashScope, OrcaRouter)
Disposto in questo modo, il risultato è completamente diverso da quello di prima. La colonna di Qwen non è più vuota — è piena, e in diverse righe è la voce più forte. Ciò che sostituisce la vecchia impostazione "quantità nota contro promessa" è un semplice divario di livello: Flash-Lite costa circa 6,7× in meno sull'input ed è circa 13× più veloce in termini di throughput, mentre Qwen offre un contesto multimodale da un milione di token e un ragionamento dichiarato di livello frontiera. Sono entrambi prodotti legittimi; servono solo scopi diversi.
L'unica riga in cui il vecchio avvertimento vale ancora è quella dei benchmark. L'Index 36 di Flash-Lite è stato misurato da Artificial Analysis su una classifica pubblica. Ogni punteggio Qwen — GPQA Diamond 92.6, Terminal-Bench 86.6 e il resto — è stato prodotto da Alibaba con il proprio harness. Questo è un vero miglioramento rispetto al non pubblicare nulla, ma non è una verifica di terze parti, e i laboratori pubblicano i benchmark in cui vincono.

Index 36 vs un flagship senza punteggio: leggendo questo onestamente
È allettante contrapporre l'Index 36 di Flash-Lite al GPQA Diamond 92.6 di Qwen e dichiarare una disfatta. Sarebbe un errore di categoria doppio.
Innanzitutto, l'Artificial Analysis Intelligence Index è una misura composita basata su molti compiti; GPQA Diamond è un singolo test di scienze di livello graduate. Non sono sulla stessa scala e non possono essere sottratti l'uno dall'altro.
In secondo luogo, e cosa più importante, Flash-Lite non è mai stato progettato per ottenere punteggi elevati. Un indice di 36 è ciò che ci si aspetta da un modello efficiente. L'obiettivo ingegneristico di Google era un modello abbastanza economico e veloce da poter essere messo davanti a ogni richiesta in arrivo — smistamento dei ticket, classificazione, estrazione, sintesi su larga scala — dove un modello di frontiera sarebbe economicamente assurdo. Giudicarlo in base al tetto di ragionamento, a confronto con un modello di punta da 2,4T, non coglie il suo scopo.
Ciò che possiamo dire è più ristretto e più utile. Qwen3.8-Max è molto probabilmente il modello sostanzialmente più capace — i suoi numeri auto-dichiarati sono di gran lunga superiori a quelli che produrrebbe un modello Index-36, e il balzo FrontierSWE da 40,7 a 73,5 suggerisce un reale progresso. Ma "molto probabilmente" rimane un'inferenza, perché nessun valutatore indipendente lo ha valutato. Per contesto, il predecessore Qwen3.7-Max ha ottenuto 46 nell'AA Index — superiore al 36 di Flash-Lite, ma nemmeno vicino alla frontiera — quindi il salto generazionale implicito di Alibaba è ampio e non verificato.
La conseguenza pratica: se il tuo compito è uno che Flash-Lite completa già correttamente, il tetto più alto di Qwen non vale nulla per te e pagheresti 6.7× per averlo. Il tetto conta solo quando Flash-Lite sta effettivamente fallendo.
Costo in pratica: il divario tra i livelli in numeri
Prendi un lavoro di classificazione ad alto volume: 2.000 token di input, 200 token di output, eseguito 500.000 volte al giorno — una forma realistica di triage del supporto o routing dei contenuti.
• Flash-Lite: per chiamata, 0.002M × $0.30 = $0.0006, più 0.0002M × $2.50 = $0.0005. ≈ $0.0011 per chiamata → ~$550 al giorno.
• Qwen3.8-Max:per chiamata, 0.002M × $2 = $0.004, più 0.0002M × $6 = $0.0012. ≈ $0.0052 per chiamata → ~$2,600/giorno.
• Mensile: Flash-Lite ≈ $16,500; Qwen ≈ $78,000 — una differenza di $61,500 per lo stesso volume di attività.
A quella scala, la scelta del livello è la singola voce di costo più grande del sistema, ed è molto difficile giustificare un modello di punta per un lavoro che un modello efficiente gestisce. Questo è esattamente lo scenario per cui Flash-Lite esiste.
Ora invertilo. Prendi un'attività con documenti lunghi: 600.000 token di contesto, 5.000 token di output, 200 volte al giorno.
• Qwen3.8-Max: 0.6M × $2 = $1.20, più 0.005M × $6 = $0.03. ≈ $1.23 per chiamata, senza sovrapprezzo per prompt lunghi — e circa $0.18 se il contesto è nella cache a $0.25/1M.
• Flash-Litenon può essere prezzato affatto per questa configurazione, perché un contesto di 600.000 token in una singola chiamata non è ciò che un modello di fascia efficiente è progettato per contenere.
Quindi la risposta si capovolge completamente con la forma del carico di lavoro, ed è questa la vera lezione. Flash-Lite vince con un margine enorme nel lavoro ad alto volume e contesto breve. Qwen vince in qualsiasi ambito richieda un milione di token o input non testuali, dove Flash-Lite non è un'opzione più economica, ma semplicemente non è un'opzione.

Scenari: quale livello si adatta
Triage e instradamento del supporto su larga scala.Flash-Lite, chiaramente. L'indice 36 è sufficiente per la classificazione e, a circa $0,0011 per chiamata, puoi eseguirlo su ogni ticket. Inoltra solo la minoranza ambigua a un modello più grande.
Analisi integrale di contratti o documenti depositati.Qwen3.8-Max. Il contesto flat-rate da 1M consente di elaborare un documento di 400 pagine in un'unica chiamata, senza sovrapprezzi né chunking, e il suo punteggio auto-dichiarato di 92.1 su OmniDocBench 1.5 è pensato esattamente per questo tipo di lavoro.
Screenshot, grafico o pipeline video. Qwen3.8-Max, per impostazione predefinita, accetta immagini e video in input e riporta OSWorld-Verified 86.1 nel guidare una GUI reale. Flash-Lite non è un candidato per input non testuali.
Coding agentico. Qwen3.8-Max sui numeri dichiarati (Terminal-Bench 2.1 86.6, FrontierSWE 73.5), con l'avvertenza che nessuno è verificato in modo indipendente e il suo punteggio auto-riportato più debole è IFBench 82.8 sul seguire le istruzioni — un rischio reale per le pipeline che analizzano l'output di ogni passaggio.
Un'architettura a due livelli. Spesso la risposta corretta è entrambi: Flash-Lite come primo passaggio economico su ogni richiesta, Qwen3.8-Max come percorso di escalation per la piccola frazione che necessita di un milione di token, un'immagine o un vero ragionamento. Questo schema conserva gran parte del vantaggio economico di Flash-Lite, mantenendo comunque disponibile un'opzione all'avanguardia.
Self-hosting e apertura
Flash-Lite è chiuso e solo API, permanentemente — non esiste un percorso di self-hosting.
I pesi di Qwen3.8-Max sono promessi entro questa settimana, ma il modello di punta non è un obiettivo realistico: circa 1,2 TB a 4 bit contro circa 141 GB per H200 significa otto o più acceleratori di fascia alta, e Alibaba non ha ancora rivelato il numero di parametri attivi, quindi il throughput che quell'esborso comprerebbe non è modellabile. Inoltre non c'è ancora un testo di licenza, il che significa che l'usabilità commerciale è formalmente indeterminata.
Annunciato contestualmente, Qwen3.8-27B è la release che conta davvero per i piani on-premise. Passando anch'esso a pesi aperti e girando, secondo quanto riportato, in circa 17GB di VRAM, è una vera opzione self-hosting — e, soprattutto, un concorrente molto più vicino alla nicchia di efficienza di Flash-Lite rispetto al flagship da 2.4T.
Domande frequenti
Posso usare Qwen 3.8 oggi?
Sì. Qwen3.8-Max ha raggiunto la disponibilità generale il 3 agosto 2026 con prezzi pubblicati di $2 / $6 per 1 milione di token e un endpoint compatibile con OpenAI e DashScope. È self-service tramite Alibaba Model Studio, DashScope e OrcaRouter. Le versioni precedenti di questo articolo descrivevano un'anteprima ad accesso limitato; ciò è obsoleto.
Qual è più economico?
Gemini 3.5 Flash-Lite, di gran lunga: $0,30 / $2,50 per 1M contro i $2 / $6 di Qwen3.8-Max — circa 6,7× più economico in input e 2,4× in output. Nel lavoro ad alto volume con contesto breve, questa differenza domina ogni altra considerazione.
Qual è meglio?
Sono livelli diversi. Flash-Lite ha l'unico punteggio certificato (AA Index 36), ma è stato costruito per un throughput economico, non per il ragionamento. Qwen3.8-Max è con ogni probabilità di gran lunga più capace — i suoi punteggi auto-dichiarati GPQA Diamond 92.6 e Terminal-Bench 2.1 86.6 sono a livello di frontiera — ma non dispone di benchmark indipendenti, quindi resta un'inferenza piuttosto che un risultato misurato.
Qual è più veloce?
Flash-Lite, sostanzialmente. Artificial Analysis misura circa 490 token/sec, che è lo scopo del suo design di fascia efficiente. Qwen3.8-Max mostra un tempo p50 fino al primo token di 1,64 secondi nella telemetria di 7 giorni di OrcaRouter, ma è un modello grande e completo, e i recensori del periodo di anteprima lo hanno trovato lento su build agentiche lunghe.
Qwen 3.8 ha ora i pesi aperti?
Non ancora. Alibaba afferma che i pesi del modello di punta arriveranno entro la settimana, ma non c'è ancora alcuna licenza, scheda del modello o repository. Anche dopo il rilascio, un modello da 2.4T richiede otto o più GPU di classe H200. Il Qwen3.8-27B, annunciato contemporaneamente e che secondo quanto riferito richiede circa 17GB di VRAM, è l'opzione pratica per il self-hosting.
Dovrei usare entrambi?
Spesso sì. Una configurazione a due livelli — Flash-Lite come primo passaggio economico su ogni richiesta, Qwen3.8-Max come corsia di escalation per contesti lunghi, attività multimodali o genuinamente difficili — mantiene gran parte del vantaggio di costo di Flash-Lite, offrendo al contempo un'opzione all'avanguardia dove vale il suo prezzo.
Quale dovrei scegliere per la produzione oggi?
Flash-Lite per lavoro ad alto volume, con contesto breve e solo testo, dove Index 36 è sufficiente — è economico, veloce, verificato e collaudato. Qwen3.8-Max quando il carico di lavoro richiede un contesto da un milione di token, input di immagini o video, o ragionamenti in cui Flash-Lite fallisce in modo dimostrabile. Entrambi sono ora effettivamente implementabili, cosa che non era vera quando questo confronto è stato scritto per la prima volta.
Il risultato finale
Gemini 3.5 Flash-Lite vs Qwen 3.8 era un confronto tra un prodotto e un annuncio. Non lo è più. Dal 3 agosto 2026, Qwen3.8-Max è generalmente disponibile, ha un prezzo, è self-service e documentato — quindi l'inquadramento onesto è una decisione di livello piuttosto che una di prontezza.
Flash-Lite rimane la scelta predefinita corretta per il lavoro per cui è stato creato: a $0,30 / $2,50 e ~490 token/sec, gira su ogni richiesta per un errore di arrotondamento, e il suo Index 36 certificato è del tutto adeguato per classificazione, instradamento ed estrazione. Qwen3.8-Max è il livello di escalation — un contesto flat-rate da un milione di token, input nativo di immagini e video, e un ragionamento di frontiera dichiarato — a un costo di input circa 6,7 volte superiore. La sua unica debolezza irrisolta è la stessa di prima: nessun valutatore indipendente l'ha valutato, quindi il suo caso di qualità si basa sulla tabella di Alibaba stessa. Attendi il primo punteggio Intelligence Index indipendente e i pesi Qwen3.8-27B, che competeranno molto più direttamente con la nicchia di Flash-Lite. Nel frattempo, scegli in base alla forma del carico di lavoro — e considera di eseguire entrambi.

Confrontati in questo articolo1
Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno
