
Ling-3.1-flash vs Gemini 3.8 Flash: un modello di prova da 256K contro uno live da 1M token
- openaiNUOVOOpenAI: GPT-6.1 Sol2026-09-2952Intelligenza
- anthropicNUOVOAnthropic: Claude Sonnet 5.52026-09-2856Intelligenza
- typesafeNUOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M di token · 219 tok/s
- OpenAINUOVOOpenAI: GPT-6 Luna2026-09-2238Intelligenza
- OpenAINUOVOOpenAI: GPT-6 Sol2026-09-2248Intelligenza
- AnthropicNUOVOAnthropic: Claude Opus 5.52026-09-2258Intelligenza
- xAINUOVOGrok 4.72026-09-2146Intelligenza
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1M di token · 117 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token · 1064 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M di token · 41 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token · 213 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
Metti Ling-3.1-flash e Gemini 3.8 Flash fianco a fianco e la discrepanza non riguarda l'intelligenza — riguarda lo stato. Ling-3.1-flash, il modello mixture-of-experts da ~560 miliardi di parametri di Ant Group annunciato dal 29 al 30 settembre 2026, è una prova gratuita di due settimane con un contesto servito di 256K, un limite di output di 32.768 token, input solo testuale e nessun peso, licenza o prezzo pubblicati. Gemini 3.8 Flash, il modello di ragionamento di fascia Flash di Google rilasciato il 2 settembre 2026, è un'API di disponibilità generale con una finestra completa di 1.048.576 token, output di 65.536 token, input multimodale e un listino prezzi pubblico. Sulla carta è un confronto tra due modelli; in pratica è un confronto tra un modello su cui puoi costruire oggi e uno che puoi solo testare questo mese.
Non è una ragione per scartare Ling-3.1-flash. Un MoE gratuito da 560B con una propensione agentica vale due settimane del tempo di valutazione di chiunque. Ma cambia lo scopo di un confronto diretto: non "su quale dovrei standardizzare", ma "il modello di prova è abbastanza buono da farmi adottare una posizione cautelativa sulla risposta tra quindici giorni". Sono domande diverse, e hanno risposte diverse su ogni asse qui sotto.
Le tre cose che decidono l'esito prima che lo faccia qualsiasi benchmark
La maggior parte dei confronti inizia con i punteggi. Questo dovrebbe iniziare con la disponibilità, perché il divario, in questo caso, non è una questione di grado.
• Prezzi — Ling-3.1-flash è gratuito per tutta la durata della sua prova e non ha alcun listino prezzi pubblicato per il periodo successivo alla prova. Gemini 3.8 Flash ha un prezzo di listino di $0,75 per milione di token di input e $3,75 per milione di output durante il suo periodo promozionale, per poi passare a $1,50 / $7,50 il 1º gennaio 2027. Prezzi di listino dichiarati dal fornitore; entrambi sono soggetti a modifiche.
• Contesto — Ling-3.1-flash eroga 262.144 token nella versione di prova, con 1.000.000 indicati come obiettivo finale. Gemini 3.8 Flash eroga oggi tutti i 1.048.576 token. Se il tuo carico di lavoro dipende dalla finestra da un milione di token, solo uno di questi due ce l'ha ora.
• Pesi — Ling-3.1-flash non ne ha pubblicati: nessun repository, nessuna licenza, nessun checkpoint, solo l'intenzione dichiarata di renderlo open source dopo la prova. Gemini 3.8 Flash è chiuso e lo sarà sempre, ma è un'API gestita che puoi chiamare senza ambiguità oggi.
Letti insieme, quei tre convergono su un unico punto: i vantaggi di punta del modello Ling sono o promozionali (gratuito) o prospettici (contesto 1M, pesi aperti), mentre i vantaggi del modello Gemini sono contrattuali. Questa asimmetria pervade tutto ciò che segue.
Dove il modello Ling vince davvero
Due posti, ed entrambi sono reali.
Il primo è il costo durante la valutazione. Una prova gratuita di due settimane su un modello di queste dimensioni non è un espediente di marketing da liquidare con un gesto: è il modo più economico per scoprire se un mixture-of-experts da 560B gestisce i tuoi prompt. Gemini 3.8 Flash, qualunque sia il suo prezzo, non è gratis, e una valutazione seria su qualche migliaio di chiamate costa denaro vero.
La seconda è la traiettoria di apertura. Ling-3.1-flash è il successore di un modello che ha effettivamente rilasciato pesi con licenza MIT, e Ant ha dichiarato pubblicamente di voler rendere open source anche questo. Se ciò si concretizza con una licenza permissiva, ottieni qualcosa che Gemini 3.8 Flash non potrà mai offrire: la possibilità di ospitare autonomamente, mettere a punto o distillare un modello base da 560B. Il problema è quello che conta di più: stai scommettendo su una promessa, e la promessa della generazione precedente è stata mantenuta con due settimane di ritardo, non come garanzia.
Laddove Gemini 3.8 Flash non è vicino a perdere
Tolti di mezzo il processo e la questione dell'apertura, il confronto operativo pende nettamente a favore di Google.
• Input — Gemini 3.8 Flash accetta testo, immagini, video, file e audio. Ling-3.1-flash accetta testo e restituisce testo. Per i flussi di lavoro con documenti, screenshot o video non è una preferenza, è un limite di capacità.
• Limite di output — 65.536 token contro 32.768. Rilevante nel momento in cui si generano report, file di codice o output strutturato lungo in un'unica passata.
• Velocità effettiva — test indipendenti collocano la velocità mediana di output di Gemini 3.8 Flash vicino a 249 token al secondo, con la telemetria di sette giorni di OrcaRouter stesso che misura 552 token al secondo a un p50 di 4,95 secondi per il primo token. L'hosting di prova di Ling-3.1-flash è stato segnalato a circa 63 token al secondo. Il modello Gemini è in una classe di velocità diversa.
• Profondità di riferimento — Gemini 3.8 Flash può contare su un insieme di misurazioni indipendenti; i numeri di Ling-3.1-flash sono tutti di prima parte, su un endpoint nuovissimo, e nessuna terza parte li ha ancora rieseguiti.
Agenti multimodali — qualsiasi cosa che debba leggere uno screenshot, un PDF o una chiamata registrata è un compito di Gemini per costruzione, non per qualità.

Benchmark, e perché i due set non sono davvero confrontabili
Il caso riferito dal fornitore per Ling-3.1-flash è un aggregato di 81,0 su cinque benchmark per agenti, con il 40,4% su Terminal-Bench 4.0, il 55,9% su SWE-Atlas e il 65,35% su HealthBench Professional; il resoconto di Ant stesso aggiunge 1.673 Elo su GDPVal-AA v2.1 e 75,16 su FrontierSWE. Ognuno di questi è una misurazione di Ant stessa. Non è stato pubblicato alcun harness e, cosa ancora più importante, non ci sono pesi che permettano a chiunque di rieseguire la suite.
Il quadro di Gemini 3.8 Flash è diverso per natura. Nell'attuale build dell'Intelligence Index di Artificial Analysis (v4.3.2), ottiene 40,9 con sforzo di ragionamento alto, 39,8 con medio e 33,5 con basso — e vale la pena segnalare che l'indice è stato rivisto di recente, quindi i dati pubblicati su questo modello all'inizio dell'autunno erano calcolati su una build diversa e non sono direttamente confrontabili con questi. Le stesse dichiarazioni di Google per il modello includono 54,9 su HLE-Verified e solidi risultati su Terminal-Bench 2.1 nella fascia alta degli 80. Numeri indipendenti e del fornitore, affiancati, entrambi legittimi, nessuno dei due intercambiabile.
C'è un solo confronto incrociato pulito che vale la pena fare, perché entrambi appartengono alla stessa famiglia di benchmark. Su Terminal-Bench 4.0, il dato del fornitore di Ling-3.1-flash è 40,4%. Claude Sonnet 5.5 — un modello di fascia media, non un flagship — ottiene 70,6% su quella stessa versione. Quella singola riga è l'argomento più forte contro l'interpretazione della scheda di Ant come "adiacente alla frontiera": il modello è competitivo sulle metriche agentiche che Ant ha scelto di evidenziare ed è chiaramente indietro sulla metrica di coding per terminale dove esiste un numero esterno.

La forma pratica della scelta
Se devi costruire qualcosa nelle prossime due settimane, la risposta non è affatto incerta e non è una critica a Ling-3.1-flash. Gemini 3.8 Flash è l'unico dei due che ti offre un endpoint stabile, un prezzo pubblicato, una finestra completa da un milione di token, input multimodale e una licenza che puoi leggere. È un modello Flash-tier di produzione.
Ling-3.1-flash è un obiettivo di valutazione. Il suo valore in questo momento sta nel fatto che la valutazione è gratuita e il modello è interessante: un MoE da 560B con solo ~25B attivi per token è una scommessa sulla sparsità, e Ant lo ha posizionato esattamente per i carichi di lavoro di agenti, ricerca e automazione d'ufficio per cui competono i modelli di fascia Flash. Eseguire i tuoi prompt su di esso durante la finestra di prova vale la pena proprio perché nessuno al di fuori di Ant lo ha ancora fatto — saresti tra i primi ad avere un'opinione non proveniente dal fornitore.
L'albero decisionale che ha senso questo mese: instrada la produzione verso Gemini 3.8 Flash, usa la prova gratuita per eseguire Ling-3.1-flash sui tuoi prompt più difficili e tieni la questione dei pesi aperti come il vero bivio. Se i pesi arrivano permissivi e un prezzo si avvicina alla fascia Flash, Ling-3.1-flash diventa una vera seconda opzione — una che puoi ospitare autonomamente, cosa che Gemini non sarà mai. Se arrivano con delle condizioni, la prova finisce e finisce anche il confronto.
Far funzionare entrambi con una sola chiave, ed essere chiari su ciò che manca
Gemini 3.8 Flash è oggi nel catalogo OrcaRouter con l'ID modello google/gemini-3.8-flash, al prezzo di listino di Google stesso senza alcun ricarico — così quando a gennaio la tariffa promozionale tornerà ai valori precedenti, il prezzo che paghi qui la segue automaticamente, senza bisogno di un nuovo contratto. DeepSeek-V4.1-Flash, l'altro modello economico di fascia Flash che vale la pena misurare nello stesso esperimento, si trova sullo stesso catalogo al prezzo di listino del suo fornitore, quindi un test a tre vie tra il modello in prova e le opzioni consolidate di fascia Flash si esegue dietro un'unica chiave API con failover automatico tra di essi.
Ling-3.1-flash non è nel nostro catalogo, e una ricerca nel nostro API pubblico dei modelli restituisce not-found per esso e per la generazione precedente — quindi la formulazione onesta è che la prova si svolge dove si svolge, tramite la superficie del fornitore stesso e piattaforme di inferenza di terze parti, e non affermiamo di ospitarlo. Questa è la parte di questo confronto che potrebbe cambiare più rapidamente: un modello in prova gratuita con un prezzo non annunciato è esattamente il tipo di cosa che approda su un livello di routing nel momento in cui Ant e i suoi host pubblicano un listino prezzi, e il pass-through a markup zero significa che il giorno in cui ciò accade, il prezzo qui è il prezzo là.
Quindi il verdetto è più ristretto di quanto suggerisca il numero di parametri. Ling-3.1-flash è il modello più ambizioso e il risultato di ricerca più interessante; Gemini 3.8 Flash è quello con cui puoi andare in produzione. Finché non esisteranno una licenza e un prezzo, è tutta qui la differenza — e non è una differenza che una riga di benchmark potrà risolvere.

Confrontati in questo articolo1
Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno
