Gemini 3.5 Flash-Lite vs Qwen 3.8: Cavallo da lavoro economico vs ammiraglia da 2.4T
Guides & Insights

Gemini 3.5 Flash-Lite vs Qwen 3.8: Cavallo da lavoro economico vs ammiraglia da 2.4T

Autore

Jim Song

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Quando questo confronto è stato scritto per la prima volta, era sbilanciato in modo insolito: Gemini 3.5 Flash-Lite era un prodotto reale e acquistabile e Qwen 3.8 era un'anteprima riservata senza prezzo, senza benchmark e senza pesi. C'era ben poco da confrontare.

Non è più così. Qwen3.8-Max è diventato generalmente disponibile il 3 agosto 2026 con un tariffario pubblicato di $2 / $6 per milione di token, un endpoint compatibile con OpenAI e DashScope e una tabella di benchmark completa. È self-service, con costi preventivabili e attivo — anche su OrcaRouter. Quindi questo articolo è stato riscritto da zero, perché il confronto onesto oggi non è "modello disponibile contro vapore". È un vero confronto di livello: il cavallo di battaglia più economico e ad alta produttività di Google contro l'ammiraglia più grande di Alibaba.

Una nota per gli sviluppatori — questi due si trovano alle estremità opposte della curva dei costi, quindi la domanda giusta è a quale fascia appartiene il tuo carico di lavoro. OrcaRouter mette a disposizione oltre 200 modelli tramite un unico endpoint compatibile con OpenAI, così puoi testare entrambi sullo stesso compito senza dover configurare due SDK.

Verdetto TL;DR. Questi modelli non sono realmente in competizione — sono risposte a domande diverse. Flash-Lite è un modello di efficienza: Artificial Analysis Index 36, $0.30 / $2.50 per 1M, circa 490 token/sec, generalmente disponibile. È progettato per gestire ogni richiesta a costo trascurabile. Qwen3.8-Max è un modello di punta: ~2,4T parametri, un contesto da 1M di token a tariffa fissa, input nativo di immagini e video, e punteggi di livello frontier auto-dichiarati (GPQA Diamond 92.6, Terminal-Bench 2.1 86.6) — a $2 / $6, che è 6,7× la tariffa di input di Flash-Lite. Flash-Lite è la scelta predefinita giusta per classificazione, routing ed estrazione ad alto volume. Qwen3.8-Max è ciò a cui si passa quando un compito richiede davvero ragionamento di frontiera, un milione di token di contesto o input non testuale. L'unica avvertenza che non è cambiata: Qwen non ha ancora nessun punteggio benchmark indipendente.

Punti chiave

Qwen 3.8 è ora generalmente disponibile — a partire dal 3 agosto 2026 ha prezzi pubblicati, accesso self-service e una tabella di benchmark. La precedente impostazione di un’anteprima ad accesso limitato e non preventivabile è obsoleta.

Flash-Lite è drasticamente più economico: $0.30 / $2.50 per 1M rispetto a quelli di Qwen: $2 / $6 — circa 6.7× in input e 2.4× in output.

Flash-Lite è molto più veloce: circa 490 token/sec, progettato per lavori ad alta produttività. Qwen3.8-Max mostra un p50 time-to-first-token di 1,64 s nella telemetria di OrcaRouter su 7 giorni, ma è un modello grande e approfondito.

Flash-Lite ha l'unico punteggio certificato: Artificial Analysis Index 36. Qwen3.8-Max rimane senza punteggio da ogni valutatore indipendente, anche se Alibaba ora pubblica i propri numeri.

Qwen vince nettamente sul piano delle capacità: un contesto da 1M token con tariffa fissa senza sovrapprezzo per prompt lunghi, oltre a input di testo/immagini/video e OmniDocBench 1.5 92.1 per il parsing di documenti. Flash-Lite è un piccolo modello efficiente.

Pesi aperti: I Qwen sono promessi entro la settimana (ancora nessuna licenza), più un Qwen3.8-27B che secondo quanto riportato gira in ~17GB di VRAM. Flash-Lite è chiuso definitivamente.

Nota sull'accuratezza: tutte le cifre relative alla qualità di Qwen3.8-Max sono riportate da Alibaba e non verificate da terze parti. Le cifre di Gemini 3.5 Flash-Lite provengono da Artificial Analysis. I prezzi di Qwen si basano sulla scheda tariffaria GA di Alibaba Model Studio e sostituiscono l'accesso in era di anteprima descritto nelle versioni precedenti di questo articolo.

Specifiche e prezzo, fianco a fianco

• Produttore / stato — Flash-Lite: Google; generalmente disponibile; Qwen3.8-Max: Alibaba; GA (3 agosto 2026)

• Positioning — Flash-Lite: livello economico ad alta produttività; Qwen3.8-Max: ambizione di punta / all'avanguardia

• AA Intelligence Index — Flash-Lite: 36 (Artificial Analysis); Qwen3.8-Max: Non ancora valutato

• Punteggi dichiarati dal fornitore — Flash-Lite: posizione misurata da terzi; Qwen3.8-Max: GPQA Diamond 92.6, Terminal-Bench 2.1 86.6, OSWorld-Verified 86.1, FrontierSWE 73.5 (tutti dichiarati da Alibaba)

• Prezzo (per 1M, in / out) — Flash-Lite: $0.30 / $2.50; Qwen3.8-Max: $2.00 / $6.00, fisso su contesto 1M; input in cache $0.25

• Velocità — Flash-Lite: ~490 tok/sec (Artificial Analysis); Qwen3.8-Max: p50 TTFT 1.64s (telemetria a 7 giorni di OrcaRouter)

• Contesto — Flash-Lite: contesto di livello efficienza; Qwen3.8-Max: 1M token (983.616 con thinking; output massimo 131.072)

• Modalità — Flash-Lite: modello di efficienza incentrato sul testo; Qwen3.8-Max: testo, immagine, video in ingresso → testo in uscita

• Pesi — Flash-Lite: chiuso, solo API; Qwen3.8-Max: promesso entro la settimana, nessuna licenza ancora

• Accesso oggi — Flash-Lite: API standard, self-service; Qwen3.8-Max: API standard, self-service (Model Studio, DashScope, OrcaRouter)

Disposto in questo modo, il risultato è completamente diverso da quello di prima. La colonna di Qwen non è più vuota — è piena, e in diverse righe è la voce più forte. Ciò che sostituisce la vecchia impostazione "quantità nota contro promessa" è un semplice divario di livello: Flash-Lite costa circa 6,7× in meno sull'input ed è circa 13× più veloce in termini di throughput, mentre Qwen offre un contesto multimodale da un milione di token e un ragionamento dichiarato di livello frontiera. Sono entrambi prodotti legittimi; servono solo scopi diversi.

L'unica riga in cui il vecchio avvertimento vale ancora è quella dei benchmark. L'Index 36 di Flash-Lite è stato misurato da Artificial Analysis su una classifica pubblica. Ogni punteggio Qwen — GPQA Diamond 92.6, Terminal-Bench 86.6 e il resto — è stato prodotto da Alibaba con il proprio harness. Questo è un vero miglioramento rispetto al non pubblicare nulla, ma non è una verifica di terze parti, e i laboratori pubblicano i benchmark in cui vincono.

Index 36 vs un flagship senza punteggio: leggendo questo onestamente

È allettante contrapporre l'Index 36 di Flash-Lite al GPQA Diamond 92.6 di Qwen e dichiarare una disfatta. Sarebbe un errore di categoria doppio.

Innanzitutto, l'Artificial Analysis Intelligence Index è una misura composita basata su molti compiti; GPQA Diamond è un singolo test di scienze di livello graduate. Non sono sulla stessa scala e non possono essere sottratti l'uno dall'altro.

In secondo luogo, e cosa più importante, Flash-Lite non è mai stato progettato per ottenere punteggi elevati. Un indice di 36 è ciò che ci si aspetta da un modello efficiente. L'obiettivo ingegneristico di Google era un modello abbastanza economico e veloce da poter essere messo davanti a ogni richiesta in arrivo — smistamento dei ticket, classificazione, estrazione, sintesi su larga scala — dove un modello di frontiera sarebbe economicamente assurdo. Giudicarlo in base al tetto di ragionamento, a confronto con un modello di punta da 2,4T, non coglie il suo scopo.

Ciò che possiamo dire è più ristretto e più utile. Qwen3.8-Max è molto probabilmente il modello sostanzialmente più capace — i suoi numeri auto-dichiarati sono di gran lunga superiori a quelli che produrrebbe un modello Index-36, e il balzo FrontierSWE da 40,7 a 73,5 suggerisce un reale progresso. Ma "molto probabilmente" rimane un'inferenza, perché nessun valutatore indipendente lo ha valutato. Per contesto, il predecessore Qwen3.7-Max ha ottenuto 46 nell'AA Index — superiore al 36 di Flash-Lite, ma nemmeno vicino alla frontiera — quindi il salto generazionale implicito di Alibaba è ampio e non verificato.

La conseguenza pratica: se il tuo compito è uno che Flash-Lite completa già correttamente, il tetto più alto di Qwen non vale nulla per te e pagheresti 6.7× per averlo. Il tetto conta solo quando Flash-Lite sta effettivamente fallendo.

Costo in pratica: il divario tra i livelli in numeri

Prendi un lavoro di classificazione ad alto volume: 2.000 token di input, 200 token di output, eseguito 500.000 volte al giorno — una forma realistica di triage del supporto o routing dei contenuti.

Flash-Lite: per chiamata, 0.002M × $0.30 = $0.0006, più 0.0002M × $2.50 = $0.0005. ≈ $0.0011 per chiamata → ~$550 al giorno.

Qwen3.8-Max:per chiamata, 0.002M × $2 = $0.004, più 0.0002M × $6 = $0.0012. ≈ $0.0052 per chiamata → ~$2,600/giorno.

• Mensile: Flash-Lite ≈ $16,500; Qwen ≈ $78,000 — una differenza di $61,500 per lo stesso volume di attività.

A quella scala, la scelta del livello è la singola voce di costo più grande del sistema, ed è molto difficile giustificare un modello di punta per un lavoro che un modello efficiente gestisce. Questo è esattamente lo scenario per cui Flash-Lite esiste.

Ora invertilo. Prendi un'attività con documenti lunghi: 600.000 token di contesto, 5.000 token di output, 200 volte al giorno.

Qwen3.8-Max: 0.6M × $2 = $1.20, più 0.005M × $6 = $0.03. ≈ $1.23 per chiamata, senza sovrapprezzo per prompt lunghi — e circa $0.18 se il contesto è nella cache a $0.25/1M.

Flash-Litenon può essere prezzato affatto per questa configurazione, perché un contesto di 600.000 token in una singola chiamata non è ciò che un modello di fascia efficiente è progettato per contenere.

Quindi la risposta si capovolge completamente con la forma del carico di lavoro, ed è questa la vera lezione. Flash-Lite vince con un margine enorme nel lavoro ad alto volume e contesto breve. Qwen vince in qualsiasi ambito richieda un milione di token o input non testuali, dove Flash-Lite non è un'opzione più economica, ma semplicemente non è un'opzione.

Scenari: quale livello si adatta

Triage e instradamento del supporto su larga scala.Flash-Lite, chiaramente. L'indice 36 è sufficiente per la classificazione e, a circa $0,0011 per chiamata, puoi eseguirlo su ogni ticket. Inoltra solo la minoranza ambigua a un modello più grande.

Analisi integrale di contratti o documenti depositati.Qwen3.8-Max. Il contesto flat-rate da 1M consente di elaborare un documento di 400 pagine in un'unica chiamata, senza sovrapprezzi né chunking, e il suo punteggio auto-dichiarato di 92.1 su OmniDocBench 1.5 è pensato esattamente per questo tipo di lavoro.

Screenshot, grafico o pipeline video. Qwen3.8-Max, per impostazione predefinita, accetta immagini e video in input e riporta OSWorld-Verified 86.1 nel guidare una GUI reale. Flash-Lite non è un candidato per input non testuali.

Coding agentico. Qwen3.8-Max sui numeri dichiarati (Terminal-Bench 2.1 86.6, FrontierSWE 73.5), con l'avvertenza che nessuno è verificato in modo indipendente e il suo punteggio auto-riportato più debole è IFBench 82.8 sul seguire le istruzioni — un rischio reale per le pipeline che analizzano l'output di ogni passaggio.

Un'architettura a due livelli. Spesso la risposta corretta è entrambi: Flash-Lite come primo passaggio economico su ogni richiesta, Qwen3.8-Max come percorso di escalation per la piccola frazione che necessita di un milione di token, un'immagine o un vero ragionamento. Questo schema conserva gran parte del vantaggio economico di Flash-Lite, mantenendo comunque disponibile un'opzione all'avanguardia.

Self-hosting e apertura

Flash-Lite è chiuso e solo API, permanentemente — non esiste un percorso di self-hosting.

I pesi di Qwen3.8-Max sono promessi entro questa settimana, ma il modello di punta non è un obiettivo realistico: circa 1,2 TB a 4 bit contro circa 141 GB per H200 significa otto o più acceleratori di fascia alta, e Alibaba non ha ancora rivelato il numero di parametri attivi, quindi il throughput che quell'esborso comprerebbe non è modellabile. Inoltre non c'è ancora un testo di licenza, il che significa che l'usabilità commerciale è formalmente indeterminata.

Annunciato contestualmente, Qwen3.8-27B è la release che conta davvero per i piani on-premise. Passando anch'esso a pesi aperti e girando, secondo quanto riportato, in circa 17GB di VRAM, è una vera opzione self-hosting — e, soprattutto, un concorrente molto più vicino alla nicchia di efficienza di Flash-Lite rispetto al flagship da 2.4T.

Domande frequenti

Posso usare Qwen 3.8 oggi?

Sì. Qwen3.8-Max ha raggiunto la disponibilità generale il 3 agosto 2026 con prezzi pubblicati di $2 / $6 per 1 milione di token e un endpoint compatibile con OpenAI e DashScope. È self-service tramite Alibaba Model Studio, DashScope e OrcaRouter. Le versioni precedenti di questo articolo descrivevano un'anteprima ad accesso limitato; ciò è obsoleto.

Qual è più economico?

Gemini 3.5 Flash-Lite, di gran lunga: $0,30 / $2,50 per 1M contro i $2 / $6 di Qwen3.8-Max — circa 6,7× più economico in input e 2,4× in output. Nel lavoro ad alto volume con contesto breve, questa differenza domina ogni altra considerazione.

Qual è meglio?

Sono livelli diversi. Flash-Lite ha l'unico punteggio certificato (AA Index 36), ma è stato costruito per un throughput economico, non per il ragionamento. Qwen3.8-Max è con ogni probabilità di gran lunga più capace — i suoi punteggi auto-dichiarati GPQA Diamond 92.6 e Terminal-Bench 2.1 86.6 sono a livello di frontiera — ma non dispone di benchmark indipendenti, quindi resta un'inferenza piuttosto che un risultato misurato.

Qual è più veloce?

Flash-Lite, sostanzialmente. Artificial Analysis misura circa 490 token/sec, che è lo scopo del suo design di fascia efficiente. Qwen3.8-Max mostra un tempo p50 fino al primo token di 1,64 secondi nella telemetria di 7 giorni di OrcaRouter, ma è un modello grande e completo, e i recensori del periodo di anteprima lo hanno trovato lento su build agentiche lunghe.

Qwen 3.8 ha ora i pesi aperti?

Non ancora. Alibaba afferma che i pesi del modello di punta arriveranno entro la settimana, ma non c'è ancora alcuna licenza, scheda del modello o repository. Anche dopo il rilascio, un modello da 2.4T richiede otto o più GPU di classe H200. Il Qwen3.8-27B, annunciato contemporaneamente e che secondo quanto riferito richiede circa 17GB di VRAM, è l'opzione pratica per il self-hosting.

Dovrei usare entrambi?

Spesso sì. Una configurazione a due livelli — Flash-Lite come primo passaggio economico su ogni richiesta, Qwen3.8-Max come corsia di escalation per contesti lunghi, attività multimodali o genuinamente difficili — mantiene gran parte del vantaggio di costo di Flash-Lite, offrendo al contempo un'opzione all'avanguardia dove vale il suo prezzo.

Quale dovrei scegliere per la produzione oggi?

Flash-Lite per lavoro ad alto volume, con contesto breve e solo testo, dove Index 36 è sufficiente — è economico, veloce, verificato e collaudato. Qwen3.8-Max quando il carico di lavoro richiede un contesto da un milione di token, input di immagini o video, o ragionamenti in cui Flash-Lite fallisce in modo dimostrabile. Entrambi sono ora effettivamente implementabili, cosa che non era vera quando questo confronto è stato scritto per la prima volta.

Il risultato finale

Gemini 3.5 Flash-Lite vs Qwen 3.8 era un confronto tra un prodotto e un annuncio. Non lo è più. Dal 3 agosto 2026, Qwen3.8-Max è generalmente disponibile, ha un prezzo, è self-service e documentato — quindi l'inquadramento onesto è una decisione di livello piuttosto che una di prontezza.

Flash-Lite rimane la scelta predefinita corretta per il lavoro per cui è stato creato: a $0,30 / $2,50 e ~490 token/sec, gira su ogni richiesta per un errore di arrotondamento, e il suo Index 36 certificato è del tutto adeguato per classificazione, instradamento ed estrazione. Qwen3.8-Max è il livello di escalation — un contesto flat-rate da un milione di token, input nativo di immagini e video, e un ragionamento di frontiera dichiarato — a un costo di input circa 6,7 volte superiore. La sua unica debolezza irrisolta è la stessa di prima: nessun valutatore indipendente l'ha valutato, quindi il suo caso di qualità si basa sulla tabella di Alibaba stessa. Attendi il primo punteggio Intelligence Index indipendente e i pesi Qwen3.8-27B, che competeranno molto più direttamente con la nicchia di Flash-Lite. Nel frattempo, scegli in base alla forma del carico di lavoro — e considera di eseguire entrambi.

Confrontati in questo articolo1

Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno

© 2026 OrcaRouter

Per i provider

Gestisci una piattaforma di inferenza? Porta i tuoi modelli su OrcaRouter.

Contattaci

Unisciti alla community

DiscordEmailXGitHubYouTube