Card hero editoriale generata intitolata "Ling-3.1-flash vs Ling-3.0-flash" con il sottotitolo "Uno è scaricabile oggi. L'altro è una frase in un post stampa." Due colonne di confronto: "Ling-3.1-flash (annunciato)" elenca "~560B totali / ~25B attivi", "contesto fino a 1M di token" e "nessun peso, nessuna licenza"; "Ling-3.0-flash (rilasciato)" elenca "124B totali / 5,1B attivi", "contesto servito di 262.144 token" e "pesi MIT su Hugging Face".
Guides & Insights

Ling-3.1-flash vs Ling-3.0-flash: cosa cambia davvero con una finestra di 1M token e 4,5 volte i parametri

Autore

Gideon Frost

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli →
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

La famiglia Ling di Ant Group ha un nuovo livello fast, e questa volta è vecchio di una sola frase. Ling-3.1-flash è stato annunciato il 30 settembre 2026 — circa 560 miliardi di parametri totali, circa 25 miliardi attivi per token, una finestra di contesto dichiarata fino a 1 milione di token e una frase di rito allegata: "Prevediamo di rendere il modello open source presto". Il modello che sostituisce al vertice della linea fast, Ling-3.0-flash, è un animale diverso sotto ogni aspetto: 124 miliardi di parametri totali, 5,1 miliardi attivi per token, un contesto servito di 262.144 token, pesi con licenza MIT su Hugging Face dal 7 agosto e un Artificial Analysis Intelligence Index indipendente di 20. Uno di questi modelli lo puoi scaricare oggi. Dell'altro puoi solo leggerne. Confrontarli è davvero utile, ma solo se il confronto parte da lì.

L'aritmetica dei titoli è semplice e leggermente fuorviante. Ling-3.1-flash ha circa 4,5× il numero totale di parametri di Ling-3.0-flash e circa 4,9× il numero di parametri attivi — 25B contro 5,1B per token. Una lettura superficiale dice "modello molto più grande, quindi modello molto più intelligente". La lettura più attenta è che Ant ha grosso modo preservato il rapporto di sparsità mentre scalava il corpo, e ciò che questo ti offre è capacità, non necessariamente profondità di ragionamento per token: un modello che instrada 25B dei suoi 560B attraverso ogni token svolge più lavoro per token di uno che ne instrada 5,1B, ma paga anche circa cinque volte il calcolo per token per farlo. Dove approda questo compromesso dipende interamente dal fatto che l'architettura di Ant gestisca efficientemente i parametri extra — e questa è una domanda a cui l'annuncio non risponde.

I due modelli, fianco a fianco

Metti i fatti pubblicati uno accanto all'altro e le generazioni si separano nettamente. Ogni riga qui sotto indica ciò che Ant o un valutatore indipendente ha effettivamente pubblicato; dove manca un numero, manca perché nessuno lo ha pubblicato.

• Parametri totali — Ling-3.1-flash: ~560B (fornitore). Ling-3.0-flash: 124B (scheda del modello).

• Parametri attivi per token — Ling-3.1-flash: ~25B (fornitore). Ling-3.0-flash: 5,1B (scheda del modello).

• Finestra di contesto — Ling-3.1-flash: fino a 1M token (fornitore). Ling-3.0-flash: 256K nativa, servita a 262,144 (scheda del modello e ricette di inferenza).

• Pesi e licenza — Ling-3.1-flash: non pubblicato; nessun repository, nessuna licenza (verificato il 30 settembre e di nuovo il 1° ottobre 2026). Ling-3.0-flash: MIT, su Hugging Face come inclusionAI/Ling-3.0-flash e su ModelScope dal 7 agosto 2026.

• Formati dei pesi — Ling-3.1-flash: nessuno disponibile. Ling-3.0-flash: BF16 (~255GB) e FP8 (~128GB) dal laboratorio, più quantizzazioni della community.

• Provenienza del benchmark — Ling-3.1-flash: interamente dichiarato dal fornitore, nessun harness pubblico, nessun peso da rieseguire. Ling-3.0-flash: valutato in modo indipendente da Artificial Analysis con un Intelligence Index di 20, con velocità di output misurata e volume di generazione di token pubblicati a corredo.

• Disponibilità — Ling-3.1-flash: solo il prodotto Ling Studio di Ant. Ling-3.0-flash: self-hostabile, oltre che richiamabile tramite l'API per sviluppatori di Ant.

Headless capture of the Artificial Analysis model page for Ling 3.0 Flash. The page shows the model's stat strip with text input and text output, a 262k-token context window, 5.1B active parameters, and a written summary stating that Ling 3.0 Flash scores 20 on the Artificial Analysis Intelligence Index against a median of 8, generated 260M tokens during evaluation, is priced at $0.07 per 1M input tokens and $0.22 per 1M output tokens, and runs at 325 tokens per second.

{{1}}A cosa serve probabilmente {{2}}la capacità extra{{/2}}{{/1}}

La descrizione in una riga di Ling-3.1-flash fornita da Ant è la cosa più informativa del rilascio. L'app Ling Studio lo presenta per «agenti general-purpose, ricerca, lavoro d'ufficio di routine e sviluppo software/codice» — un'inquadratura da lavoro d'ufficio e agentica, non da benchmark di ragionamento. Ciò è coerente con il modo in cui la famiglia è organizzata: Ling è la linea general-purpose per testo e strumenti, Ring è la linea di ragionamento e Ming si occupa del multimodale. Ling-3.0-flash occupava lo stesso slot una generazione prima, ed era esplicitamente il livello veloce ed economico, non il flagship.

Leggi l'aumento di scala in questa luce e ha senso. I carichi di lavoro agentici e con chiamata agli strumenti sono lunghi, ripetitivi e affamati di contesto: un singolo ciclo di agente può bruciare decine di migliaia di token di output accumulato degli strumenti prima di intraprendere un'azione, quindi una finestra da 1M di token è un requisito funzionale, non un fronzolo da scheda tecnica. Scalare il numero totale di parametri mantenendo una grande frazione attiva è il modo in cui si aggiungono conoscenza del mondo e profondità nel seguire le istruzioni a un modello che deve comunque essere abbastanza veloce da stare dentro un ciclo. Ant qui non sta costruendo un'ammiraglia più lenta e più intelligente; sta costruendo una fascia veloce più grande.

L'obiezione contraria è il costo, ed è la stessa aritmetica che arriva dalla direzione opposta. La capacità extra non è gratuita al momento dell'inferenza — si paga su ogni token, e Ant non ha pubblicato alcun prezzo per Ling-3.1-flash: nessun listino tariffe API, nessuno sconto sulla cache, nulla di paragonabile ai $0.075/$0.22 per milione di token elencati dalla generazione precedente. Questo è il numero mancante che deciderebbe questo confronto, e manca.

Benchmark, e chi li ha eseguiti

Ling-3.1-flash arriva con tre punteggi che sembrano forti se presi isolatamente: 1.673 Elo su GDPVal-AA v2.1, 75,16 su FrontierSWE e 65,35 su HealthBench Professional. Tutti e tre sono di Ant, tratti dall'annuncio, e nessuno è stato riprodotto da un laboratorio esterno. La conseguenza pratica è che possono essere confrontati con i numeri di altri fornitori, ma non con quelli indipendenti — e l'Intelligence Index da 20 punti di Artificial Analysis per Ling-3.0-flash è un numero indipendente su una scala diversa, quindi mettere i due fianco a fianco equivarrebbe a confrontare una misurazione con un'affermazione. Al momento della scrittura non esiste una pagina di Ling-3.1-flash su Artificial Analysis.

Una nota a piè di pagina nel grafico di Ant merita di essere segnalata di per sé. La scheda afferma che il risultato di HealthBench Professional è stato valutato nell'«ambiente AQ» e che le capacità sanitarie di Ling-3.1-flash possono attualmente essere sperimentate solo in AQ. Nessuna documentazione pubblica spiega che cos'è AQ. Un punteggio di punta che reca un qualificatore di ambiente senza nome non è qualcosa che un team esterno possa riprodurre, nemmeno quando i pesi esisteranno.

Quale usare davvero questa settimana

La questione generazionale si risolve diversamente a seconda di ciò che ti serve oggi, e per quasi tutti la risposta in questo momento non è il modello più recente.

Se questa settimana devi eseguire qualcosa, Ling-3.0-flash è l'unico dei due a esistere in una forma utilizzabile: pesi MIT che puoi ospitare autonomamente, FP8 se vuoi ridurre l'ingombro, prezzi dell'API first-party pubblicati e un punteggio indipendente che ti dice cosa stai ottenendo. È un modello davvero valido nella sua fascia — la valutazione indipendente lo ha collocato sulla frontiera di Pareto degli open-weights per intelligenza rispetto ai parametri totali, e ha valutato molto positivamente la sua velocità, con l'avvertenza che è insolitamente prolisso e ha generato circa 260M token nel corso della valutazione, contro una mediana vicina ai 100M.

Se stai pianificando per i prossimi sei mesi, Ling-3.1-flash è la direzione di marcia e non ancora un componente. Gli aspetti specifici da tenere d'occhio prima che diventi tale: se i pesi saranno effettivamente aperti e con quale licenza, se la finestra servita è davvero 1M o un'estensione di un contesto nativo più breve, quanto costa per milione di token e se un laboratorio indipendente riproduce il 75.16 su FrontierSWE. Se uno qualsiasi di questi si concretizzasse, sarebbe un motivo per rifare il confronto. Nessuno si è concretizzato.

Ant Group's own Ling-3.1-flash benchmark card, published 30 September 2026. Bar-chart panels cover GDPval-AA v2.1 (1,673 Elo for Ling-3.1-flash), tau-Banking, SkillsBench, Automationbench, Terminal-Bench 4.0, CyberGym, FrontierSWE (75.16), SWE Atlas Codebase QnA, Finance Agent v2, HealthBench Professional (65.35), DRACO and MultiChallenge, with GPT-5.6 Sol, Claude Opus 5, Kimi K3, GLM 5.3, GLM 5.3 Flash and DeepSeek-V4.1-Flash as the comparison set. A footnote states HealthBench Professional was evaluated in the AQ environment.

Dove si colloca all'interno di uno stack di routing

Nessuno dei due modelli Ling è oggi nel nostro catalogo — Ling-3.0-flash, Ling-3.0-flash-VL e Ling-3.1-flash restituiscono tutti not-found contro l'API dei modelli OrcaRouter, quindi la risposta onesta a "posso chiamarlo tramite voi" è no, per ora. Ciò per cui un livello di routing è davvero utile in una settimana come questa è l'altra metà del problema: i modelli con cui metteresti a confronto un candidato. Claude Opus 5, GPT-5.6 Sol e DeepSeek-V4.1-Flash sono tutte route attive al prezzo di listino del provider, senza alcun markup, e un router che li tiene dietro un'unica chiave con failover automatico è il modo per mantenere un'infrastruttura di valutazione puntata su un bersaglio mobile senza dover mantenere quattro integrazioni. Quando arriveranno i pesi di Ling-3.1-flash e la licenza sarà leggibile, sarà anche questa la forma della decisione: aggiungere un endpoint, non ricostruire lo stack.

Il riepilogo generazionale è breve. Ling-3.0-flash è un modello rilasciato, valutato in modo indipendente e con licenza permissiva che oggi si può ospitare autonomamente. Ling-3.1-flash è una promessa più grande, con un contesto più lungo e più costosa da eseguire, che Ant non ha ancora consegnato in alcuna forma utilizzabile da uno sviluppatore. Considerare il secondo un aggiornamento del primo è l'errore che questo rilascio induce a commettere, e i numeri non lo supportano ancora.

Generated two-lane information card. Top lane headed "Independently measured" holds "Ling-3.0-flash — AA Intelligence Index 20 (v4.3)" and "Ling-3.0-flash — 325 tokens/sec, 260M tokens generated". Bottom lane headed "Vendor-reported only" holds "Ling-3.1-flash — 1,673 Elo GDPval-AA v2.1", "Ling-3.1-flash — 75.16 FrontierSWE" and "Ling-3.1-flash — 65.35 HealthBench Professional (AQ environment, undefined)".