Ling-3.0-flash: Cosa sappiamo realmente sul nuovo Fast-Tier MoE di Ant Group (E cosa non sappiamo)
Guides & Insights

Ling-3.0-flash: Cosa sappiamo realmente sul nuovo Fast-Tier MoE di Ant Group (E cosa non sappiamo)

Autore

Jim Song

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Il laboratorio InclusionAI di Ant Group ha rilasciato Ling-3.0-flash intorno al 23 luglio 2026, il che significa che è vecchio di pochi giorni al momento di questo brief. È un modello linguistico mixture-of-experts (MoE) con 124B parametri totali e circa 5,1B attivi per token (rapporto di sparsità di circa 24:1), progettato per la generazione di testo e il tool-calling. È posizionato come il livello veloce ed economico della famiglia Ling; il posto di punta spetta ancora al molto più grande Ling-2.6-1T (1T totale / 63B attivi). L'accesso oggi è solo tramite API — attraverso il portale developer di Ant, tramite OpenRouter come inclusionai/ling-3.0-flash e tramite ZenMux.

Questa è l'intera immagine confermata, e vale la pena essere chiari sul motivo per cui questo resoconto è più cauto di una tipica recensione di un modello. Non ci sono pesi su Hugging Face, nessun repository GitHub per Ling-V3 e nessuna chiara dichiarazione di licenza — un vero cambiamento rispetto a Ling 2.0 e Ling 2.6, entrambi rilasciati con pesi aperti sotto licenza MIT. Inoltre, non esistono dati di benchmark indipendenti di alcun tipo: Artificial Analysis, il valutatore terzo più comunemente citato per questa classe di modelli, non ha ancora una pagina dedicata. Ogni dato sulle prestazioni e sulla velocità attualmente in circolazione proviene direttamente da Ant Group.

In breve. Ling-3.0-flash è un modello MoE da 124B/5.1B attivi di InclusionAI di Ant Group, rilasciato negli ultimi giorni, solo API senza pesi su Hugging Face e con licenza non confermata. Le affermazioni del fornitore — picco di 1000 token/s, tempo al primo token inferiore a 100 ms — non hanno ancora una verifica indipendente, e non esiste un punteggio Artificial Analysis per questo specifico modello. La generazione precedente Ling-2.6-flash ha ottenuto un punteggio Artificial Analysis Intelligence Index di soli 14 (Ling-2.6-1T ha ottenuto 26), che è un contesto utile ma non sostituisce la reale capacità di Ling-3.0-flash. Il prezzo (¥0.40 in input / ¥1.20 in output per 1 milione di token, attualmente gratuito durante la settimana di lancio con 500k token gratuiti al giorno) è esplicitamente promozionale e probabilmente cambierà. Considera tutto questo come un'anteprima, non un verdetto.

Punti chiave

È il livello veloce/economico, non il modello di punta. Ling-2.6-1T rimane il modello più grande di InclusionAI; Ling-3.0-flash è un fratello più piccolo, più economico, più veloce, pensato per un uso ad alto volume.

Non esiste ancora alcun benchmark indipendente. Artificial Analysis non ha una pagina per Ling-3.0-flash. Gli unici numeri pubblici sono quelli di Ant Group, e la documentazione di Ant attualmente non mostra alcuna tabella di benchmark per questo modello.

Le affermazioni sulla velocità sono solo del fornitore. Il picco di 1000 token/sec e il tempo per il primo token inferiore a 100 ms provengono da Ant Group, senza alcun test di throughput di terze parti per confermare nessuno dei due valori.

Nessun peso aperto, licenza non confermata. Non esiste un repository Hugging Face né un progetto GitHub Ling-V3. Le precedenti generazioni di Ling erano sotto licenza MIT; non è noto se la 3.0-flash seguirà la stessa strada.

Il prezzo è una promozione della settimana di lancio. ¥0.40/¥1.20 per 1 milione di token sulla piattaforma di Ant non viene attualmente applicato, con 500k token gratuiti al giorno e un annuncio gratuito su OpenRouter — non è detto che queste condizioni rimangano in vigore una volta terminata la promozione.

È un pezzo di una famiglia di tre modelli. InclusionAI divide la sua gamma in Ling (MoE per scopi generali, questo modello), Ring (incentrato sul ragionamento) e Ming (multimodale).

Una nota su come leggere questo sommario: Ogni specifica, benchmark e prezzo qui sotto è etichettato per fonte. Dove Ant Group è l'unica fonte, lo diciamo chiaramente ed esprimiamo cautela di conseguenza. Dove i modelli Ling delle generazioni precedenti hanno punteggi indipendenti, li citiamo per contesto — non come sostituto dei dati su Ling-3.0-flash stesso, che ancora non esiste. Probabilmente sarà necessario un aggiornamento una volta che i test indipendenti raggiungeranno questo punto.

Ciò che effettivamente sappiamo

Architetturalmente, Ling-3.0-flash è un modello MoE sparso: 124B parametri in totale, con circa 5.1B attivi su ogni token, il che lo rende economico e veloce da eseguire rispetto alla sua dimensione totale. La finestra di contesto è di 256K token secondo la documentazione di Ant, con un'affermazione del fornitore che è estendibile a 1M; la lista di OpenRouter mostra 262.144 token, che corrisponde al valore di 256K. La lunghezza massima dell'output non è stata divulgata in nessun luogo che abbiamo trovato. Il modello supporta la generazione di testo standard e la chiamata di strumenti, ma non è stata menzionata alcuna capacità multimodale di input o output — tale capacità risiede nella linea separata Ming.

Per quanto riguarda la disponibilità, l'immagine è solo API e coerente tra le tre vie che abbiamo trovato: la piattaforma sviluppatori di Ant Group, OpenRouter (elencato come inclusionai/ling-3.0-flash) e ZenMux. Nessuna di queste espone pesi scaricabili. Non esiste una pagina organizzativa su GitHub per un progetto "Ling-V3", e la documentazione di Ant non indica una licenza per questo modello specifico — una lacuna significativa, dato che Ling 2.0 e Ling 2.6 sono stati entrambi rilasciati come pesi aperti sotto licenza MIT. Fino a quando InclusionAI non chiarirà questo, non dare per scontato che Ling-3.0-flash finirà per essere aperto, e non dare per scontato che non lo sarà.

Le lacune: cosa non è verificato

Il divario più grande sono i benchmark. Al momento in cui scriviamo, Artificial Analysis — il valutatore indipendente più citato per questa esatta classe di modelli — non ha una pagina per Ling-3.0-flash; il pattern URL che normalmente la ospiterebbe restituisce un 404. Ciò significa che al momento non esiste alcun punteggio di ragionamento, coding o matematica di terze parti per questo modello, da Artificial Analysis o da qualsiasi altro valutatore indipendente che siamo riusciti a trovare. La documentazione stessa di Ant aggrava la situazione: non pubblica affatto una tabella di benchmark per 3.0-flash, né del vendor né di altro tipo, il che è insolito per un rilascio di modello e vale la pena segnalarlo di per sé.

Per un contesto approssimativo, i modelli Ling della generazione precedente hanno punteggi indipendenti. Ling-2.6-flash ha registrato un Artificial Analysis Intelligence Index di 14, e il più grande Ling-2.6-1T ha ottenuto 26 — entrambi ben dietro i principali modelli open-weight monitorati da Artificial Analysis all'epoca. I dati del fornitore stesso di Ant per Ling-2.6-flash dichiaravano il 61,2% su SWE-bench Verified e il 73,85% su AIME2026. Nessuno di questi numeri dovrebbe essere attribuito direttamente a Ling-3.0-flash; una nuova generazione con una nuova architettura può muoversi in entrambe le direzioni, e finché un valutatore indipendente non lo esegue effettivamente, qualsiasi affermazione sulle capacità per 3.0-flash è un'ipotesi travestita da fatto.

Affermazioni di velocità del fornitore: veloci sulla carta, non verificate nella pratica.

La presentazione delle prestazioni di Ant Group per Ling-3.0-flash non punta sulla qualità del ragionamento, ma sulla velocità pura. Il venditore dichiara un throughput massimo di 1000 token al secondo e un tempo per il primo token (TTFT) inferiore a 100 millisecondi, entrambi valori che sarebbero davvero rapidi se confermati. Ma "se confermati" fa un bel lavoro in questa frase: questi numeri provengono esclusivamente dai materiali di Ant Group, misurati in condizioni che Ant controlla e non ha completamente divulgato (hardware, dimensione del batch, lunghezza del prompt e carico influenzano sostanzialmente i valori di throughput). Nessun laboratorio indipendente ha pubblicato una nuova misurazione. Finché qualcuno esterno ad Ant non esegue un test comparabile, tratta i 1000 tok/s e il TTFT sub-100ms come dati di marketing da verificare con il tuo carico di lavoro, non come fatti accertati.

Prezzi, e perché è un bersaglio mobile

Sulla piattaforma di Ant Group, i prezzi di listino per Ling-3.0-flash sono ¥0,40 per 1 milione di token in input e ¥1,20 per 1 milione di token in output — economici per progettazione, coerenti con il posizionamento come fascia veloce/economica. Ma questo prezzo di listino non è in realtà ciò che qualcuno sta pagando in questo momento: Ant sta eseguendo una promozione di lancio gratuita di una settimana e, separatamente, offre 500.000 token gratuiti al giorno sulla sua piattaforma. La scheda di OpenRouter mostra una variante ling-3.0-flash:free a $0/$0. Niente di tutto ciò deve essere scambiato per un prezzo stabile. Le promozioni di lancio scadono, le fasce gratuite vengono limitate, e gli stessi valori ¥0,40/¥1,20 potrebbero cambiare una volta che arriveranno dati di utilizzo reali. Se stai pianificando una spesa di produzione basata su questo modello, budgetizza in base al prezzo di listino, non a quello promozionale, e ricontrolla prima di impegnarti.

La famiglia Ling / Ring / Ming

Ling-3.0-flash non esiste in isolamento — InclusionAI organizza i suoi rilasci in tre famiglie con nome, ciascuna destinata a un compito diverso. Ling è la linea MoE per uso generale, che copre la generazione di testo quotidiana e il tool-calling; Ling-3.0-flash si trova all'estremità veloce/economica di essa, con Ling-2.6-1T ancora il flagship più grande. Ring è la linea focalizzata sul ragionamento di InclusionAI, costruita per compiti che si basano su chain-of-thought multi-step piuttosto che sul throughput grezzo. Ming è la linea multimodale, che gestisce immagini e altre modalità non testuali che Ling stesso non tocca. Se il tuo compito necessita di un ragionamento più pesante o input multimodale, il modello InclusionAI giusto probabilmente non è Ling-3.0-flash — è costruito per volume e velocità nella corsia testo e strumenti, non per estendersi nel territorio delle altre due famiglie.

A chi è rivolto: tre scenari

1. Pipeline di testo o chiamate di strumenti ad alto volume e sensibili alla latenza — come pilota, non come impegno

Se il tuo carico di lavoro è dominato dalla generazione di testo sensibile al throughput o dalla chiamata di strumenti — chat, agenti leggeri, chiamate API ad alta frequenza — il posizionamento di Ling-3.0-flash (numero ridotto di parametri attivi, TTFT dichiarato inferiore a 100 ms, prezzi di lancio quasi gratuiti) lo rende meritevole di un test pilota. Il problema è che "meritevole di un test pilota" è diverso da "meritevole di trasferire il traffico di produzione". Con zero dati di benchmark indipendenti, sei tu il benchmark in questo momento: esegui il tuo set di valutazione attraverso di esso prima di fidarti per qualsiasi cosa rivolta ai clienti, e non costruire modelli di costo basati sugli attuali prezzi promozionali.

2. Team che necessitano di contesto lungo con un budget limitato

Una finestra di contesto di 256K (con l'affermazione del fornitore di estendibilità fino a 1M) a un prezzo di listino veramente basso è una combinazione interessante per casi d'uso che richiedono molto recupero di informazioni o elaborazione di documenti, a condizione che l'effettiva qualità di ragionamento del modello si mantenga su quella lunghezza di contesto — cosa che, ancora una volta, nessuna fonte indipendente ha testato. Questo è un candidato ragionevole da includere nella rosa di opzioni insieme a consolidate opzioni di lungo contesto a basso costo, ma dovrebbe essere valutato fianco a fianco con esse, piuttosto che adottato solo sulla base della scheda tecnica di Ant.

3. Osservatori che monitorano il panorama MoE della Cina e la roadmap di InclusionAI.

Per i team che monitorano il panorama competitivo dei laboratori cinesi di modelli open e semi-open piuttosto che implementare un singolo modello in produzione, Ling-3.0-flash è un utile punto di riferimento: segnala che InclusionAI sta iterando rapidamente sul suo livello veloce, potenzialmente facendo un passo indietro rispetto ai pesi aperti (almeno per ora), e continuando a puntare su una struttura a tre famiglie (Ling/Ring/Ming) piuttosto che su un unico modello generale. Vale la pena aggiungerlo ai segnalibri e riconsiderarlo una volta che arriveranno chiarezza sui benchmark e sulla licenza.

Quando non usarlo

Evita Ling-3.0-flash per qualsiasi cosa in cui devi citare un'affermazione verificata di capacità — non esiste un benchmark indipendente a cui fare riferimento, quindi qualsiasi affermazione sulla sua capacità di ragionamento, programmazione o matematica è attualmente non falsificabile. Evitalo se hai bisogno di pesi aperti per self-hosting, fine-tuning o motivi di conformità; non ce ne sono disponibili, e la licenza per questo specifico modello non è nemmeno stata dichiarata, figuriamoci confermata come permissiva. Evitalo per attività multimodali — è compito della linea Ming, non di Ling. E fai attenzione a costruire un modello di costo basato sui prezzi attuali: la settimana di lancio gratuita, i 500k token giornalieri gratuiti e il livello gratuito di OpenRouter sono tutti promozionali, e il prezzo di listino di ¥0.40/¥1.20 a cui probabilmente tornerà non è stato ancora testato rispetto ai modelli di utilizzo reali.

Domande frequenti

Ling-3.0-flash ha pesi aperti?

Non al momento. Non c'è un repository Hugging Face e nessun progetto GitHub Ling-V3 al momento della scrittura. Le precedenti generazioni Ling (2.0 e 2.6) sono state rilasciate sotto licenza MIT come pesi aperti, ma nulla conferma che Ling-3.0-flash seguirà quel modello — o che non lo farà.

Come si comporta Ling-3.0-flash nei benchmark?

Non esiste ancora un benchmark indipendente per questo modello — Artificial Analysis non ha una pagina per questo modello. La documentazione stessa di Ant Group non pubblica una tabella di benchmark per esso. Per un contesto storico approssimativo, la generazione precedente Ling-2.6-flash ha ottenuto un Artificial Analysis Intelligence Index di 14, e Ling-2.6-1T ha ottenuto 26, ma nessuno dei due numeri dovrebbe essere considerato valido per questa nuova generazione.

Quanto è veloce davvero?

Ant Group afferma un picco di throughput di 1000 token al secondo e un time-to-first-token inferiore a 100 ms. Entrambi sono dati forniti solo dal produttore, senza alcuna ri-misurazione indipendente pubblicata finora. Trattateli come affermazioni da verificare sul vostro carico di lavoro, non come prestazioni confermate.

Quanto costa Ling-3.0-flash?

Il prezzo di listino sulla piattaforma di Ant è di ¥0,40 per 1 milione di token in input e ¥1,20 per 1 milione di token in output, ma attualmente è gratuito durante una promozione della settimana di lancio, con anche 500k token gratuiti/giorno disponibili. Anche OpenRouter elenca una variante gratuita. Aspettatevi che questi termini promozionali cambino.

Quanto è grande la finestra di contesto?

256K token secondo la documentazione di Ant, con un'affermazione del fornitore che è estendibile a 1M. L'elenco di OpenRouter mostra 262.144 token, coerenti con la cifra di 256K. La lunghezza massima dell'output non è divulgata.

Qual è la differenza tra Ling, Ring e Ming?

Ling è la linea MoE general-purpose di InclusionAI per testo e chiamata di strumenti, e Ling-3.0-flash si trova all'estremità veloce/economica. Ring è la linea focalizzata sul ragionamento. Ming gestisce i compiti multimodali. Sono famiglie di modelli separate, costruite per lavori diversi, non livelli dello stesso modello.

Ling-3.0-flash è uguale a Ling-2.6-1T?

No. Ling-2.6-1T è il modello di punta più grande di InclusionAI (1T totale / 63B parametri attivi) e rimane un modello separato e più grande. Ling-3.0-flash (124B totale / ~5.1B attivi) è la release più recente, più piccola e più veloce.

Dovrei usare Ling-3.0-flash in produzione oggi?

Solo dopo aver eseguito la propria valutazione. Senza un benchmark indipendente, una licenza non confermata e un prezzo attualmente promozionale, è ragionevole fare un pilot, ma prematuro affidargli carichi di lavoro critici per la produzione o sensibili alla conformità senza i propri test e un piano per quando i termini promozionali termineranno.

Il risultato finale

Ling-3.0-flash è un rilascio genuinamente nuovo che vale la pena seguire: un modello MoE da 124B/5.1B-attivi mirato direttamente a lavori di testo e chiamate di strumenti veloci, economici e ad alto volume, proveniente da un laboratorio che ha già lanciato modelli credibili. Ma al momento è una scheda tecnica e un insieme di dichiarazioni del fornitore, non un prodotto verificato: nessun benchmark indipendente, nessun peso aperto, nessuna licenza confermata e prezzi esplicitamente promozionali. Non è un motivo per scartarlo, ma per testarlo con cautela, verificare direttamente le dichiarazioni che contano per te e tornare su questo breve commento una volta che Artificial Analysis o un altro valutatore indipendente pubblichi numeri reali.

© 2026 OrcaRouter

Per i provider

Gestisci una piattaforma di inferenza? Porta i tuoi modelli su OrcaRouter.

Contattaci

Unisciti alla community

DiscordEmailXGitHubYouTube