Card titolo hero per 'Ling 3.0 Tiny vs Gemini 3.5 Flash-Lite' con il sottotitolo 'Gratis non è economico — il leader di mercato rimane la scelta sicura' e due card informative: Ling 3.0 Tiny (Indice AA 23, molto verboso, gratuito fino al 14 agosto) e Gemini 3.5 Flash-Lite (Indice AA 36, ~490 tok/s, $0,30 / $2,50). Logo OrcaRouter composito in basso a destra.
Guides & Insights

Ling 3.0 Tiny vs Gemini 3.5 Flash-Lite: gratis non significa economico, e il leader di mercato rimane la scelta sicura.

Autore

Jim Song

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

«Gratis» è la parola più costosa del vocabolario del mercato dei modelli, perché di solito significa che qualcuno sta per farti pagare qualcosa di diverso dal prezzo di listino. È questa la trappola nascosta nel confronto tra Ling 3.0 Tiny, il nuovo modello di ragionamento MoE da 7,9 miliardi di parametri di Ant Group InclusionAI, e Gemini 3.5 Flash-Lite, l'attuale livello Gemini più economico e veloce di Go​ogle. Ling 3.0 Tiny è gratuito da chiamare adesso e costa $0,06 / $0,18 per milione di token dopo la promozione del 14 agosto — ma Artificial Analysis ha misurato che brucia 210 milioni di token di output solo per valutare la sua classe di 56 modelli, contro una mediana di 63 milioni, e lo ha segnalato come «molto verboso». Gemini 3.5 Flash-Lite costa cinque volte tanto per token, a $0,30 / $2,50, eppure vanta un Intelligence Index indipendente di 36 — 13 punti sopra Ling 3.0 Tiny — e una velocità di output di circa 490 token al secondo. Il cartellino più economico, il più veloce a parlare e il punteggio più basso sono tutti lo stesso modello. Questa è tutta la storia di questo confronto, e tutta la ragione per pensarci due volte prima di optare automaticamente per il nuovo arrivato solo in base al prezzo.

Entrambi i modelli appartengono alla fascia economica, ma si trovano in fasi diverse del loro ciclo di vita. Gemini 3.5 Flash-Lite è l'incumbent maturo: rilasciato il 21 luglio 2026, misurato continuamente da una terza parte e ampiamente adottato come livello predefinito per attività agentiche ad alto volume e sensibili alla latenza. Ling 3.0 Tiny ha una settimana di vita, ha un prezzo pensato per acquisire utenti ed è stato valutato una sola volta. Questo articolo distingue ciò che ciascun modello è realmente, ciò che dicono i numeri indipendenti e perché il prezzo "gratuito" è il numero meno utile nel confronto.

Ling 3.0 Tiny, la novità con un misuratore

Ling 3.0 Tiny launched on August 6, 2026 on commercial APIs with a quiet-listing pattern rather than a launch event. It is a mixture-of-experts model with 7.9B total parameters and roughly 1.3B active per token, a 256K-token context window (listed as 262K on the commercial listings and Artificial Analysis), up to 32K output tokens, native function calling, and prompt caching. Two modes switch per request: "Thinking," on by default, which spends output tokens on extended reasoning, and "Instant," which answers directly. It is text-in, text-out — no image, audio, or video input.

The pricing structure deserves precision, because "free" is doing a lot of work. It is listed as inclusionai/ling-3.0-tiny:free at $0 per million tokens on both sides; a second gateway runs it free until 8:00am PT on August 14, 2026, then applies its listed rate of $0.06 per million input and $0.18 per million output tokens, with cached input at $0.01. Artificial Analysis, which sampled the free tier, shows the $0.00 / $0.00 price on its live page. So the model is genuinely free right now, and genuinely metered a week from now.

Screenshot of the Artificial Analysis page for Ling 3.0 Tiny, showing an Intelligence Index of 23, price $0.00 / $0.00 on the free tier, a 210M-token verbosity read versus a 63M median, and output speed listed as N/A. REUSED from the what-is-ling-3-0-tiny explainer (audited).

Gemini 3.5 Flash-Lite, l'attuale detentore

Gemini 3.5 Flash-Lite è la risposta di Go​ogle alla stessa domanda, collocato un gradino più in basso nella linea Gemini 3.5. È nativamente multimodale in ingresso — testo, immagini, video, audio e file — con output testuale, finestra di contesto da 1 milione di token, fino a 64K token di output e sforzo di ragionamento configurabile (minimo, basso, più alto), così una pipeline può regolare la profondità, e il costo, per ogni richiesta. Il suo punteggio indipendente è un vero salto generazionale: Artificial Analysis Intelligence Index 36, classificato al 12° posto su 151 modelli monitorati, in crescita rispetto a 25 per Gemini 3.1 Flash-Lite. Quanto alla velocità, è il modello più veloce della serie 3.5 — Go​ogle ha dichiarato 350 token di output al secondo al lancio, mentre la pagina live di AA ha misurato circa 490 token al secondo, posizionandolo al 2° posto tra i modelli monitorati. I suoi numeri agentici dichiarati dal fornitore — 74,0% su OSWorld-Verified, 54% su Terminal-Bench 2.1, 72,2% su un test di recupero multi-ago da 128K — sono di Go​ogle e hanno valore indicativo, non di verità assoluta, e una questione aperta (computer-use indicato come integrato nel blog di Go​ogle ma non supportato nella documentazione API) merita di essere verificata prima di farvi affidamento.

È anche, per token, non economico per la sua fascia. Il nome "Lite" descrive la posizione del modello nella gamma, non un prezzo in calo: Gemini 2.5 Flash-Lite costava $0,10 / $0,40, 3.1 Flash-Lite costava $0,25 / $1,50 e 3.5 Flash-Lite costa $0,30 / $2,50 per milione di token, con input in cache a $0,03. Il vantaggio in efficienza deriva dalla velocità e dall'economia dei token, e le misurazioni di Artificial Analysis mostrano che il costo reale per attività è approssimativamente raddoppiato di generazione in generazione, mentre il tempo per attività si è dimezzato.

Il tabellone indipendente, letto nel contesto

Mettere i due modelli sullo stesso indice rende il divario evidente: Gemini 3.5 Flash-Lite a 36, Ling 3.0 Tiny a 23. Ma questo confronto da titolo è solo metà del quadro, perché i due modelli non vengono valutati sullo stesso campo. AA piazza Ling 3.0 Tiny al 6° posto su 56 nella sua classe di modelli tiny, contro una mediana di classe di 8 — ben al di sopra della media per un modello della sua taglia. Gemini 3.5 Flash-Lite si colloca al 12° posto su 151 nel più ampio insieme monitorato. Uno è un modello tiny eccezionale; l'altro è un solido modello economico nel pool aperto. Entrambe le affermazioni sono vere e significano cose diverse. Ling 3.0 Tiny offre un miglior rapporto qualità-prezzo per la sua classe di dimensioni rispetto a quello che Gemini 3.5 Flash-Lite offre per la sua fascia — e Gemini 3.5 Flash-Lite resta comunque il modello più capace con un ampio margine sulla stessa scala indipendente.

Comparison scoreboard for Ling 3.0 Tiny vs Gemini 3.5 Flash-Lite. Left column Ling 3.0 Tiny: AA 23, $0.06 / $0.18 after promo, 210M output tokens, text-only, 256K context, speed N/A (Vercel 264 tok/s). Right column Gemini 3.5 Flash-Lite: AA 36, $0.30 / $2.50, 43M output tokens, text + image + video + audio, 1M context, ~490 tok/s (AA). Footer: 'Both models per Artificial Analysis.' OrcaRouter logo composited bottom-right.

Le dimensioni, una per riga:

• Punteggio indipendente — Ling 3.0 Tiny AA Index 23 (#6/56, mediana di classe 8) vs Gemini 3.5 Flash-Lite AA Index 36 (#12/151).

• Prezzo — Ling 3.0 Tiny $0,06 / $0,18 per 1M dopo una promo gratuita rispetto a Gemini 3.5 Flash-Lite $0,30 / $2,50 per 1M (input in cache $0,03).

• Verbosità — Ling 3.0 Tiny 210M token di output nell'esecuzione dell'indice vs Gemini 3.5 Flash-Lite, misurato ma non verboso secondo quel flag.

• Modalità — Ling 3.0 Tiny solo testo vs Gemini 3.5 Flash-Lite testo, immagine, video, audio e input di file.

• Contesto — 256K su Ling 3.0 Tiny vs 1M su Gemini 3.5 Flash-Lite, con un output massimo di 64K su entrambi.

• Velocità — Ling 3.0 Tiny ~90–264 token/s sugli endpoint che hanno pubblicato un valore, contro i ~490 token/s di Gemini 3.5 Flash-Lite nella misurazione live di AA.

La riga della velocità è quella che molto probabilmente si sposterà. La velocità di output di Ling 3.0 Tiny è realmente irrisolta: Artificial Analysis la indica come N/A, mentre Vercel pubblicizza 264 token/secondo. I ~490 token/secondo di Gemini 3.5 Flash-Lite sono una misurazione AA live effettuata ben dopo che la volatilità del suo lancio si è stabilizzata. Per un livello sensibile alla latenza, questa è la differenza tra una quantità nota e una questione aperta.

L'economia della verbosità: perché gratis non è economico

Ecco l'aritmetica che di solito decide questo confronto. Esegui lo stesso compito ad alto ragionamento — diciamo 4.000 token di input, 2.000 token di output — su entrambi i modelli dopo la fine della promo di Ling 3.0 Tiny. Ling 3.0 Tiny addebita (4.000 × $0.06 + 2.000 × $0.18) / 1.000.000, circa $0.0006. Gemini 3.5 Flash-Lite addebita (4.000 × $0.30 + 2.000 × $2.50) / 1.000.000, circa $0.0062. A parità di conteggio token, Ling 3.0 Tiny è 10 volte più economico. Poi aggiungi la verbosità: un modello di ragionamento che emette token di pensiero come output non produce conteggi token identici. Se il rapporto di verbosità 210M-vs-63M di Ling 3.0 Tiny vale per il tuo carico di lavoro, il costo effettivo per attività circa triplica sul lato output, e il vantaggio di 10x si riduce a circa 3–4x. Comunque più economico — ma non più gratuito, e non nella stessa lega di quanto faccia sembrare il numero 210M.

Il quadro onesto è che i due modelli non sono sostituti alla stessa qualità. Il 23 di Ling 3.0 Tiny è un punteggio eccezionale per un modello con 1,3B di parametri attivi; il 36 di Gemini 3.5 Flash-Lite è un'altra lega di capacità, più visione, più contesto da 1M, più velocità consolidata. Paghi per quel divario — cinque volte il prezzo per token, e di più per attività una volta considerate le differenze di velocità — ma è un divario di capacità reale, non di marketing. Se il tuo carico di lavoro può accontentarsi della qualità del modello più economico, Ling 3.0 Tiny è il miglior rapporto qualità-prezzo. Se il tuo carico di lavoro richiede la capacità, nessun vantaggio di prezzo può colmare il divario.

Dove un router dimostra il proprio valore

Questa è esattamente la tipologia di carico di lavoro in cui un livello di routing batte l'impegno verso un singolo modello, e i dettagli di hosting contano per come lo costruisci. Gemini 3.5 Flash-Lite è ora disponibile su OrcaRouter al prezzo di listino del provider — $0,30 in ingresso / $2,50 in uscita per 1M, passato direttamente con ricarico 0%, quindi il prezzo sul listino di Google è identico al nostro, e qualsiasi futura riduzione di prezzo si applica lo stesso giorno. Si trova dietro lo stesso endpoint compatibile con OpenAI utilizzato da oltre 200 altri modelli, con failover automatico tra provider per quando un provider di base degrada a metà esecuzione, e il DSL di routing può inviare un prompt a più modelli e conservare la risposta migliore.

Ling 3.0 Tiny non è su OrcaRouter; è servito dai suoi endpoint dedicati, oggi gratuiti. Questa combinazione in realtà rafforza la tesi del routing, non la indebolisce. Sfrutta la finestra gratuita per testare Ling 3.0 Tiny sul tuo traffico prima che diventi a pagamento. Poi costruisci il percorso di produzione sul livello hosted — Gemini 3.5 Flash-Lite per le chiamate che richiedono visione, contesto lungo o un profilo di velocità stabile, con il livello di routing libero di passare a un modello più costoso per la minoranza dei casi difficili. Un livello gratuito è un ottimo esperimento e una dipendenza fragile; il livello hosted è ciò su cui puoi costruire un prodotto. Su OrcaRouter puoi eseguire entrambi nello stesso grafo — Ling 3.0 Tiny tramite endpoint diretto, Gemini 3.5 Flash-Lite tramite chiave — e lasciare che il router decida per ogni richiesta.

Screenshot of the OrcaRouter model page for Gemini 3.5 Flash-Lite (google/gemini-3.5-flash-lite) showing $0.30 input / $2.50 output per 1M tokens, a 1M-token context, up to 64K max output, multimodal text + image + video + file + audio input, and a p50 time-to-first-token of 819ms over the last 7 days. Fresh Edge-headless capture, audited.

Verdetto

Se stai scegliendo tra questi due e non li instradi insieme, la decisione è facile a dirsi e difficile da accettare. Ling 3.0 Tiny è il miglior affare e il modello più debole: un livello di reasoning solo testuale, vecchio di una settimana, con un punteggio eccellente per la sua dimensione, un prezzo aggressivo e un quadro di velocità e verbosità ancora irrisolto; merita una valutazione immediata in prova gratuita, ed è bene sapere che sarà misurato il 14 agosto. Gemini 3.5 Flash-Lite è il default di produzione più sicuro: ha ottenuto in modo indipendente un punteggio superiore di 13 punti, è multimodale, ha un contesto da 1M, è cinque volte più veloce secondo una misurazione consolidata, ed è prezzato di conseguenza. Gratis non vuol dire economico quando il modello parla tre volte tanto per pensare, con un tetto di capacità inferiore — e l'incumbent è la scommessa sicura per un motivo.

Confrontati in questo articolo2

Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno

© 2026 OrcaRouter

Per i provider

Gestisci una piattaforma di inferenza? Porta i tuoi modelli su OrcaRouter.

Contattaci

Unisciti alla community

DiscordEmailXGitHubYouTube