Scheda hero editoriale generata intitolata "Ling-3.1-flash vs Gemini 3.8 Flash" con il sottotitolo "Una prova gratuita da 256K contro un'API di produzione da 1M token". Due righe di confronto recitano "Ling-3.1-flash: prova gratuita di due settimane, contesto di 262.144 token, nessun peso pubblicato" e "Gemini 3.8 Flash: 0,75 $ / 3,75 $ per 1M token, contesto di 1.048.576 token, input multimodale", sopra un footer che recita "Le cifre di Ling sono dichiarate dal fornitore; le cifre di Gemini secondo OrcaRouter e Artificial Analysis."
Guides & Insights

Ling-3.1-flash vs Gemini 3.8 Flash: un modello di prova da 256K contro uno live da 1M token

Autore

Rowan Sterling

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli →
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Metti Ling-3.1-flash e Gemini 3.8 Flash fianco a fianco e la discrepanza non riguarda l'intelligenza — riguarda lo stato. Ling-3.1-flash, il modello mixture-of-experts da ~560 miliardi di parametri di Ant Group annunciato dal 29 al 30 settembre 2026, è una prova gratuita di due settimane con un contesto servito di 256K, un limite di output di 32.768 token, input solo testuale e nessun peso, licenza o prezzo pubblicati. Gemini 3.8 Flash, il modello di ragionamento di fascia Flash di Google rilasciato il 2 settembre 2026, è un'API di disponibilità generale con una finestra completa di 1.048.576 token, output di 65.536 token, input multimodale e un listino prezzi pubblico. Sulla carta è un confronto tra due modelli; in pratica è un confronto tra un modello su cui puoi costruire oggi e uno che puoi solo testare questo mese.

Non è una ragione per scartare Ling-3.1-flash. Un MoE gratuito da 560B con una propensione agentica vale due settimane del tempo di valutazione di chiunque. Ma cambia lo scopo di un confronto diretto: non "su quale dovrei standardizzare", ma "il modello di prova è abbastanza buono da farmi adottare una posizione cautelativa sulla risposta tra quindici giorni". Sono domande diverse, e hanno risposte diverse su ogni asse qui sotto.

Le tre cose che decidono l'esito prima che lo faccia qualsiasi benchmark

La maggior parte dei confronti inizia con i punteggi. Questo dovrebbe iniziare con la disponibilità, perché il divario, in questo caso, non è una questione di grado.

• Prezzi — Ling-3.1-flash è gratuito per tutta la durata della sua prova e non ha alcun listino prezzi pubblicato per il periodo successivo alla prova. Gemini 3.8 Flash ha un prezzo di listino di $0,75 per milione di token di input e $3,75 per milione di output durante il suo periodo promozionale, per poi passare a $1,50 / $7,50 il 1º gennaio 2027. Prezzi di listino dichiarati dal fornitore; entrambi sono soggetti a modifiche.

• Contesto — Ling-3.1-flash eroga 262.144 token nella versione di prova, con 1.000.000 indicati come obiettivo finale. Gemini 3.8 Flash eroga oggi tutti i 1.048.576 token. Se il tuo carico di lavoro dipende dalla finestra da un milione di token, solo uno di questi due ce l'ha ora.

• Pesi — Ling-3.1-flash non ne ha pubblicati: nessun repository, nessuna licenza, nessun checkpoint, solo l'intenzione dichiarata di renderlo open source dopo la prova. Gemini 3.8 Flash è chiuso e lo sarà sempre, ma è un'API gestita che puoi chiamare senza ambiguità oggi.

Letti insieme, quei tre convergono su un unico punto: i vantaggi di punta del modello Ling sono o promozionali (gratuito) o prospettici (contesto 1M, pesi aperti), mentre i vantaggi del modello Gemini sono contrattuali. Questa asimmetria pervade tutto ciò che segue.

Dove il modello Ling vince davvero

Due posti, ed entrambi sono reali.

Il primo è il costo durante la valutazione. Una prova gratuita di due settimane su un modello di queste dimensioni non è un espediente di marketing da liquidare con un gesto: è il modo più economico per scoprire se un mixture-of-experts da 560B gestisce i tuoi prompt. Gemini 3.8 Flash, qualunque sia il suo prezzo, non è gratis, e una valutazione seria su qualche migliaio di chiamate costa denaro vero.

La seconda è la traiettoria di apertura. Ling-3.1-flash è il successore di un modello che ha effettivamente rilasciato pesi con licenza MIT, e Ant ha dichiarato pubblicamente di voler rendere open source anche questo. Se ciò si concretizza con una licenza permissiva, ottieni qualcosa che Gemini 3.8 Flash non potrà mai offrire: la possibilità di ospitare autonomamente, mettere a punto o distillare un modello base da 560B. Il problema è quello che conta di più: stai scommettendo su una promessa, e la promessa della generazione precedente è stata mantenuta con due settimane di ritardo, non come garanzia.

Laddove Gemini 3.8 Flash non è vicino a perdere

Tolti di mezzo il processo e la questione dell'apertura, il confronto operativo pende nettamente a favore di Google.

• Input — Gemini 3.8 Flash accetta testo, immagini, video, file e audio. Ling-3.1-flash accetta testo e restituisce testo. Per i flussi di lavoro con documenti, screenshot o video non è una preferenza, è un limite di capacità.

• Limite di output — 65.536 token contro 32.768. Rilevante nel momento in cui si generano report, file di codice o output strutturato lungo in un'unica passata.

• Velocità effettiva — test indipendenti collocano la velocità mediana di output di Gemini 3.8 Flash vicino a 249 token al secondo, con la telemetria di sette giorni di OrcaRouter stesso che misura 552 token al secondo a un p50 di 4,95 secondi per il primo token. L'hosting di prova di Ling-3.1-flash è stato segnalato a circa 63 token al secondo. Il modello Gemini è in una classe di velocità diversa.

• Profondità di riferimento — Gemini 3.8 Flash può contare su un insieme di misurazioni indipendenti; i numeri di Ling-3.1-flash sono tutti di prima parte, su un endpoint nuovissimo, e nessuna terza parte li ha ancora rieseguiti.

Agenti multimodali — qualsiasi cosa che debba leggere uno screenshot, un PDF o una chiamata registrata è un compito di Gemini per costruzione, non per qualità.

Headless capture of the OrcaRouter model page for Gemini 3.8 Flash, model ID google/gemini-3.8-flash. It is marked FEATURED and credited to Google with a 2026-09-02 date, carries Vision, Audio, Tools, JSON and Reasoning capability chips, and describes the model as Google's most intelligent Flash model with significant gains over 3.7 Flash on software engineering, agentic tasks and multi-step reasoning. A stat strip reads input $0.75 and output $3.75 per 1M tokens, p50 time to first token 4.95 s, p95 10.00 s and 149.9M tokens of traffic over seven days; the pricing table lists $0.750 input, $3.75 output and $0.075 cache read per 1M tokens.

Benchmark, e perché i due set non sono davvero confrontabili

Il caso riferito dal fornitore per Ling-3.1-flash è un aggregato di 81,0 su cinque benchmark per agenti, con il 40,4% su Terminal-Bench 4.0, il 55,9% su SWE-Atlas e il 65,35% su HealthBench Professional; il resoconto di Ant stesso aggiunge 1.673 Elo su GDPVal-AA v2.1 e 75,16 su FrontierSWE. Ognuno di questi è una misurazione di Ant stessa. Non è stato pubblicato alcun harness e, cosa ancora più importante, non ci sono pesi che permettano a chiunque di rieseguire la suite.

Il quadro di Gemini 3.8 Flash è diverso per natura. Nell'attuale build dell'Intelligence Index di Artificial Analysis (v4.3.2), ottiene 40,9 con sforzo di ragionamento alto, 39,8 con medio e 33,5 con basso — e vale la pena segnalare che l'indice è stato rivisto di recente, quindi i dati pubblicati su questo modello all'inizio dell'autunno erano calcolati su una build diversa e non sono direttamente confrontabili con questi. Le stesse dichiarazioni di Google per il modello includono 54,9 su HLE-Verified e solidi risultati su Terminal-Bench 2.1 nella fascia alta degli 80. Numeri indipendenti e del fornitore, affiancati, entrambi legittimi, nessuno dei due intercambiabile.

C'è un solo confronto incrociato pulito che vale la pena fare, perché entrambi appartengono alla stessa famiglia di benchmark. Su Terminal-Bench 4.0, il dato del fornitore di Ling-3.1-flash è 40,4%. Claude Sonnet 5.5 — un modello di fascia media, non un flagship — ottiene 70,6% su quella stessa versione. Quella singola riga è l'argomento più forte contro l'interpretazione della scheda di Ant come "adiacente alla frontiera": il modello è competitivo sulle metriche agentiche che Ant ha scelto di evidenziare ed è chiaramente indietro sulla metrica di coding per terminale dove esiste un numero esterno.

Generated two-column scoreboard titled "Ling-3.1-flash vs Gemini 3.8 Flash - the scoreboard". The Ling-3.1-flash column reads Context 262,144, Output 32,768, Input text only, Price free trial, Weights none, Speed ~63 tok/s. The Gemini 3.8 Flash column reads Context 1,048,576, Output 65,536, Input text, image, audio, Price $0.75 / $3.75, Weights closed, Speed 552 tok/s. A footer reads "Ling figures vendor-reported; Gemini figures per OrcaRouter and Artificial Analysis."

La forma pratica della scelta

Se devi costruire qualcosa nelle prossime due settimane, la risposta non è affatto incerta e non è una critica a Ling-3.1-flash. Gemini 3.8 Flash è l'unico dei due che ti offre un endpoint stabile, un prezzo pubblicato, una finestra completa da un milione di token, input multimodale e una licenza che puoi leggere. È un modello Flash-tier di produzione.

Ling-3.1-flash è un obiettivo di valutazione. Il suo valore in questo momento sta nel fatto che la valutazione è gratuita e il modello è interessante: un MoE da 560B con solo ~25B attivi per token è una scommessa sulla sparsità, e Ant lo ha posizionato esattamente per i carichi di lavoro di agenti, ricerca e automazione d'ufficio per cui competono i modelli di fascia Flash. Eseguire i tuoi prompt su di esso durante la finestra di prova vale la pena proprio perché nessuno al di fuori di Ant lo ha ancora fatto — saresti tra i primi ad avere un'opinione non proveniente dal fornitore.

L'albero decisionale che ha senso questo mese: instrada la produzione verso Gemini 3.8 Flash, usa la prova gratuita per eseguire Ling-3.1-flash sui tuoi prompt più difficili e tieni la questione dei pesi aperti come il vero bivio. Se i pesi arrivano permissivi e un prezzo si avvicina alla fascia Flash, Ling-3.1-flash diventa una vera seconda opzione — una che puoi ospitare autonomamente, cosa che Gemini non sarà mai. Se arrivano con delle condizioni, la prova finisce e finisce anche il confronto.

Far funzionare entrambi con una sola chiave, ed essere chiari su ciò che manca

Gemini 3.8 Flash è oggi nel catalogo OrcaRouter con l'ID modello google/gemini-3.8-flash, al prezzo di listino di Google stesso senza alcun ricarico — così quando a gennaio la tariffa promozionale tornerà ai valori precedenti, il prezzo che paghi qui la segue automaticamente, senza bisogno di un nuovo contratto. DeepSeek-V4.1-Flash, l'altro modello economico di fascia Flash che vale la pena misurare nello stesso esperimento, si trova sullo stesso catalogo al prezzo di listino del suo fornitore, quindi un test a tre vie tra il modello in prova e le opzioni consolidate di fascia Flash si esegue dietro un'unica chiave API con failover automatico tra di essi.

Ling-3.1-flash non è nel nostro catalogo, e una ricerca nel nostro API pubblico dei modelli restituisce not-found per esso e per la generazione precedente — quindi la formulazione onesta è che la prova si svolge dove si svolge, tramite la superficie del fornitore stesso e piattaforme di inferenza di terze parti, e non affermiamo di ospitarlo. Questa è la parte di questo confronto che potrebbe cambiare più rapidamente: un modello in prova gratuita con un prezzo non annunciato è esattamente il tipo di cosa che approda su un livello di routing nel momento in cui Ant e i suoi host pubblicano un listino prezzi, e il pass-through a markup zero significa che il giorno in cui ciò accade, il prezzo qui è il prezzo là.

Quindi il verdetto è più ristretto di quanto suggerisca il numero di parametri. Ling-3.1-flash è il modello più ambizioso e il risultato di ricerca più interessante; Gemini 3.8 Flash è quello con cui puoi andare in produzione. Finché non esisteranno una licenza e un prezzo, è tutta qui la differenza — e non è una differenza che una riga di benchmark potrà risolvere.

Headless capture of the Artificial Analysis page for Gemini 3.8 Flash (High), marked "Released September 2026". Summary tiles read Intelligence 41 (rank 50 of 224), Speed 248.5 output tokens per second (rank 4 of 224), Cost $1.24 per Intelligence Index task at $0.75 input and $3.75 output per 1M tokens with a 90% cache discount (rank 62 of 224), and Verbosity 170M output tokens (rank 96 of 224). The comparison summary states the model is notably fast but very verbose, takes text, image, speech and video input, outputs text, and has a 1M-token context window, and the page names the current Artificial Analysis Intelligence Index build as v4.3.2.

Confrontati in questo articolo1

Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno