Ling-3.0-flash: cosa sappiamo ora del MoE fast-tier a pesi aperti di Ant Group
Guides & Insights

Ling-3.0-flash: cosa sappiamo ora del MoE fast-tier a pesi aperti di Ant Group

Autore

Rowan Sterling

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Il laboratorio InclusionAI di Ant Group ha rilasciato ufficialmente Ling-3.0-flash — annunciato il 24 luglio 2026 e reso open-source con licenza MIT il 7 agosto — e il quadro è cambiato molto rispetto all'anteprima che avevamo pubblicato qui a luglio. È un modello nativo a ragionamento ibrido di tipo mixture-of-experts con 124B di parametri totali e solo 5.1B attivi per token, pensato come livello veloce ed economico della famiglia Ling. I due numeri che hanno cambiato tutto: Artificial Analysis ora lo valuta 38 sull'Intelligence Index (in aumento di 24 punti rispetto alla precedente generazione del livello veloce, Ling-2.6-flash) e lo colloca sulla frontiera di Pareto dei pesi aperti per intelligenza rispetto ai parametri totali. I pesi sono disponibili su Hugging Face e ModelScope.

Quando abbiamo parlato per la prima volta di questo modello il 24 luglio, il riepilogo onesto era: solo API, nessun peso, nessuna dichiarazione di licenza, nessun benchmark indipendente. Tutte e quattro queste affermazioni sono ormai superate. Ant ha reso open-source i pesi con licenza MIT il 7 agosto, e Artificial Analysis ha da allora pubblicato una valutazione indipendente completa. Questo aggiornamento rivede di conseguenza il briefing originale — le etichette “non verificato” che dominavano il post di luglio ora si applicano a un insieme molto più ristretto di affermazioni, principalmente i dati sulla velocità massima di Ant, piuttosto che al modello nel suo insieme.

In breve. Ling-3.0-flash è il MoE open-weight di fascia veloce di Ant Group: 124B totali / 5.1B attivi, con licenza MIT, contesto nativo di 256K (262K nel servizio). Artificial Analysis le attribuisce un Intelligence Index di 38 — in aumento di 24 punti rispetto alla precedente generazione Ling-2.6-flash e sulla frontiera di Pareto degli open-weight per intelligenza rispetto ai parametri totali — con un output misurato di circa 368 token/sec. I pesi sono su Hugging Face e ModelScope con licenza MIT. Ancora solo dichiarazioni del fornitore: la dichiarazione del picco di throughput di 1.100+ token/sec, il dato del time-to-first-token inferiore a 100ms e la tabella dei benchmark della model card. Il prezzo dell'API di prima parte è di $0,075 in ingresso / $0,22 in uscita per 1 milione di token (80% di sconto sui cache hit); il livello gratuito di lancio è terminato il 3 agosto.

Punti chiave

• È il livello veloce/economico, non il modello di punta. Il modello di punta da 1T di parametri della generazione precedente rimane il modello più grande di InclusionAI; Ling-3.0-flash è il fratello più piccolo e veloce, progettato per grandi volumi di testo e chiamate di strumenti.

• I pesi sono ora aperti con licenza MIT.I pesi sono stati pubblicati su Hugging Face (inclusionAI/Ling-3.0-flash) e ModelScope il 7 agosto sotto licenza MIT — un’inversione rispetto al quadro “solo API” di luglio.

• Ha finalmente un punteggio indipendente. Artificial Analysis misura un Intelligence Index di 38, in aumento di 24 rispetto a Ling-2.6-flash, e colloca il modello sulla frontiera di Pareto open-weights per intelligenza vs parametri totali.

• La velocità è ora in parte misurata.AA registra circa 368 token/sec in output e un tempo al primo token di ~1,98s; il picco di 1.100+ token/sec di Ant resta ancora solo un'affermazione del fornitore.

• I prezzi sono fissati e il lancio gratuito è terminato. L'API di prima parte riporta $0.075 in ingresso / $0.22 in uscita per 1 milione di token, con uno sconto dell'80% per i cache hit; il livello gratuito di lancio è terminato il 3 agosto.

• È uno dei tre modelli della famiglia. InclusionAI divide la sua gamma in Ling (MoE di uso generale per testo e strumenti, questo modello), Ring (ragionamento) e Ming (multimodale).

Una nota su come leggere questo aggiornamento: questa è una revisione dell'anteprima del 24 luglio, scritta dopo che i pesi sono stati resi pubblici e sono comparsi i primi punteggi indipendenti. Ogni specifica, benchmark e prezzo di seguito è etichettato per fonte. Dove Ant Group è l'unica fonte — le affermazioni sulla velocità di picco e la tabella dei benchmark della scheda del modello — lo diciamo chiaramente. Dove Artificial Analysis ha misurato qualcosa in modo indipendente, lo citiamo.

Ciò che effettivamente sappiamo

L'architettura è ora completamente documentata nella model card. Ling-3.0-flash utilizza uno stack di attenzione ibrida-lineare nativa — Attenzione Delta Kimi (KDA) e layer Gated MLA alternati in un rapporto 5:1 (35 KDA + 7 MLA), con gating diagonale a grana fine KDA — sopra una MoE sparsa 1/64 (512 esperti instradati, 8 attivati per token). È così che raggiunge 124B di parametri totali con solo 5.1B attivi. La finestra di contesto è di 256K nativamente, servita a 262.144 token nelle ricette di inferenza, e Ant sostiene che l'architettura scala fino a 1M. La lunghezza massima di output non è divulgata. Il modello è solo testo con supporto alla chiamata di strumenti; l'input multimodale risiede nella linea Ming separata.

Il laboratorio pubblica due formati di peso — BF16 (circa 255GB) e FP8 (circa 128GB) — e le varianti quantizzate dalla community sono già collegate dalla scheda del modello. Le ricette di deployment del laboratorio puntano su SGLang e vLLM.

Disponibilità: pesi aperti con licenza MIT

Il 7 agosto, il team InclusionAI di Ant Group ha reso open-source i pesi con licenza MIT su Hugging Face (inclusionAI/Ling-3.0-flash) e ModelScope. Si tratta di una licenza permissiva e utilizzabile commercialmente — la stessa con cui sono stati rilasciati Ling 2.0 e Ling 2.6 — e significa che puoi fare self-hosting, fare fine-tuning e distribuire Ling-3.0-flash da solo, invece di noleggiarlo tramite un'API. Il modello è inoltre chiamabile tramite l'API di sviluppo di Ant e diverse piattaforme di terze parti. Per un modello di fascia veloce a questo prezzo, la domanda più interessante è se fare self-hosting (FP8 gira in circa 128 GB) o restare su un'API.

Punteggi indipendenti: un AA Intelligence Index di 38

Il cambiamento più grande rispetto al post di luglio è che ora esistono numeri indipendenti. Artificial Analysis ha una pagina per Ling-3.0-flash e lo valuta 38 sull'Intelligence Index — 24 punti sopra la precedente generazione fast-tier, Ling-2.6-flash (14), e alla pari con MiMo-V2.5 e Qwen 3.6 27B pur attivando una frazione dei loro parametri. Artificial Analysis colloca inoltre il modello sulla frontiera di Pareto open-weights per l'intelligenza rispetto ai parametri totali: nessun modello open-weights con meno parametri totali ottiene un punteggio più alto. Il leader open-weights della fascia flash su AA, DeepSeek V4 Flash, ottiene comunque un punteggio più alto (Index 52 al massimo sforzo di ragionamento).

Anche i risultati relativi ad agenti e contesto lungo sono decisamente solidi. Sulla suite τ3-Bench Banking di AA, Ling-3.0-flash ottiene il 27%, seconda tra i modelli open-weights di fascia flash dietro a DeepSeek V4 Flash (39%). Su GDPval-AA v2 raggiunge un Elo di 1108, in aumento rispetto a 545 per Ling-2.6-flash. Ant ha addestrato il modello in oltre 10.000 ambienti interattivi (dato dichiarato dal fornitore) e lo propone come nodo di esecuzione per flussi di lavoro agentici — veloce, economico e usa-e-getta, lasciando il ragionamento pesante a un modello di punta più grande.

Un'avvertenza sulle fonti: la tabella dei benchmark sulla scheda del modello di Ant — SWE-Bench Pro 56.6, SWE-bench Multilingual 72.4, MathArena AIME 2026 93.2, HLE 22.7 — è riportata dal fornitore e non è stata ancora riprodotta in modo indipendente. Trattala come le affermazioni del laboratorio stesso, nella stessa categoria dei dati sulla velocità massima qui sotto.

Velocità: misurata, poi dichiarata

La storia della velocità ora è composta da due storie diverse. Indipendentemente, Artificial Analysis misura circa 368 token/sec in output e un tempo al primo token di ~1,98s sull'API first-party — davvero veloce per un MoE con 5,1B di parametri attivi, e sufficiente per collocare il modello ai vertici della sua categoria per la velocità. Separatamente, Ant Group dichiara una velocità media di output superiore a 1.100 token/sec su configurazioni GPU specifiche e un tempo al primo token inferiore a 100ms grazie a un layer di caching gerarchico a livello di cluster basato su SGLang HiCache e Mooncake. Il secondo gruppo di numeri proviene esclusivamente dal fornitore — misurato su hardware e configurazioni batch controllate da Ant, senza alcuna ripetizione indipendente pubblicata. Per la pianificazione, usa il dato di AA; considera gli 1.100+ token/sec come un tetto di marketing da verificare sul tuo carico di lavoro.

Prezzi: economici, e la promozione è finita.

Artificial Analysis elenca l'API di prima parte a $0,075 per 1 milione di token di input e $0,22 per 1 milione di output, con hit di cache a $0,015 (−80%) — tutti prezzi fissati dal fornitore. Il livello gratuito di lancio (500 mila token gratuiti al giorno, accesso API gratuito) è terminato il 3 agosto, e Ant ha applicato uno sconto temporaneo del 75% su Ling Studio fino al 31 agosto 2026, dopo il quale si applica il prezzo di listino. Anche a listino pieno, $0,075/$0,22 colloca Ling-3.0-flash saldamente nella fascia economica per un modello con un Index di 38.

A prezzi così bassi, il costo del cambio pesa più del prezzo per token. OrcaRouter esiste per rendere economico quel cambio: un'unica API per oltre 200 modelli, prezzi di listino dei provider applicati senza alcun ricarico (0% markup), e failover automatico tra provider — così quando un modello di nuova apertura come questo sembra buono sulla carta, puoi testarlo sul tuo carico di lavoro reale senza un secondo contratto, e passare a un modello diverso dietro la stessa chiave se non soddisfa le aspettative su un compito specifico.

La famiglia Ling / Ring / Ming

Ling-3.0-flash non esiste da solo: InclusionAI organizza i suoi rilasci in tre famiglie con nomi specifici, ciascuna pensata per un compito diverso. Ling è la linea MoE generalista per la generazione di testo quotidiana e il tool-calling, e Ling-3.0-flash si trova all'estremità veloce/economica, un gradino sotto il fiore all'occhiello da 1T parametri della generazione precedente. Ring è la linea incentrata sul ragionamento, costruita per il chain-of-thought a più passaggi. Ming è la linea multimodale. Se il tuo compito richiede ragionamenti più complessi o input di immagini, il modello InclusionAI giusto probabilmente non è Ling-3.0-flash: è costruito per volume e velocità nel campo di testo e strumenti.

A chi è rivolto: tre scenari

1. Pipeline di testo o di chiamata di strumenti ad alto volume e sensibili alla latenza

Questo è il terreno di casa del modello. Con un Index indipendente di 38, una licenza MIT e circa 368 tok/s misurati, la scommessa fast-tier è ora testabile, non più ipotetica — puoi eseguire il tuo set di valutazione su di esso, oppure scaricare i pesi e fare self-hosting. Ma non costruire attorno al tetto di 1.100+ tok/s dichiarato dal vendor finché non lo hai misurato sul tuo carico di lavoro.

2. Team che vogliono un contesto lungo con un budget limitato

Un contesto nativo di 256K (262K serviti) con un percorso dichiarato verso 1M, a $0.075/$0.22, è una combinazione interessante per lavori ad alto utilizzo di retrieval o di elaborazione di documenti. I numeri sul contesto lungo riportati nella scheda del modello sono dichiarati dal fornitore, quindi inseriscilo nella shortlist rispetto alle opzioni consolidate per il contesto lungo e verifica sul tuo corpus prima di impegnarti.

3. Osservatori che monitorano il panorama MoE cinese e la roadmap di InclusionAI

La questione di luglio — InclusionAI sarebbe rimasta aperta? — ora ha una risposta: sì, MIT, e in fretta. Ling-3.0-flash che approda sulla frontiera di Pareto AA con 5,1B attivi è un dato significativo per chiunque osservi come i laboratori cinesi stiano competendo sull'efficienza piuttosto che sul numero grezzo di parametri.

Cosa non è ancora verificato

Un breve elenco, ora che le grandi lacune sono state colmate. Le affermazioni del fornitore sulla velocità di picco (1.100+ tok/s, TTFT inferiore a 100 ms) non hanno una rimisurazione indipendente. La tabella dei benchmark nella scheda del modello è riportata dal fornitore. Le varianti FP4/INT4 e il percorso di distribuzione su singola DGX-Spark sono dichiarati dal fornitore. E sulla conoscenza, l'Omniscience Index di AA mostra che il miglioramento rispetto alla generazione precedente è derivato in gran parte dall'astensione — le allucinazioni sono scese (97% → 44%) mentre l'accuratezza è aumentata solo leggermente (16% → 18%) — quindi non scambiare il salto dell'Indice nei titoli per un balzo generalizzato nella conoscenza.

Quando non usarlo

Salta Ling-3.0-flash per il lavoro multimodale — quella è la linea Ming. Saltalo se ti serve un'ammiraglia di ragionamento pesante piuttosto che un esecutore veloce — quella è la corsia di Ring. Se hai intenzione di fare self-hosting, metti in conto l'hardware reale: BF16 è circa 255GB, FP8 circa 128GB. E se una affermazione è importante per te, verificala — i numeri di velocità di picco e contesto lungo sono di Ant finché un laboratorio indipendente non li riesegue.

Domande frequenti

Ling-3.0-flash ha pesi aperti?

Sì. I pesi sono stati resi open source il 7 agosto con licenza MIT, su Hugging Face (inclusionAI/Ling-3.0-flash) e ModelScope. Si tratta di una licenza permissiva e utilizzabile commercialmente — la stessa con cui sono stati distribuiti Ling 2.0 e Ling 2.6.

Come si comporta Ling-3.0-flash nei benchmark?

Artificial Analysis misura un Intelligence Index di 38, in aumento di 24 punti rispetto a Ling-2.6-flash, e colloca il modello sulla frontiera di Pareto open-weights per intelligenza rispetto ai parametri totali. La tabella dei benchmark sulla scheda del modello di Ant (ad esempio SWE-Bench Pro 56.6) è fornita dal venditore e non è stata riprodotta in modo indipendente.

Quanto è veloce davvero?

Artificial Analysis misura circa 368 token/sec in output con un tempo al primo token di ~1,98s sulla API di prima parte. Ant dichiara un throughput di picco di oltre 1.100 token/sec e un TTFT inferiore a 100 ms su specifiche configurazioni GPU — si tratta di dati forniti dal vendor senza alcuna misurazione indipendente.

Quanto costa Ling-3.0-flash?

AA elenca l'API di prima parte a $0,075 per 1 milione di token di input e $0,22 per 1 milione di output, con uno sconto dell'80% per i cache hit. Il livello gratuito di lancio è terminato il 3 agosto, e un periodo di sconto temporaneo del 75% su Ling Studio è valido fino al 31 agosto 2026.

Quanto è grande la finestra di contesto?

256K nativamente, servito a 262,144 token; Ant afferma che l'architettura scala a 1M. La lunghezza massima di output non è stata rivelata.

Qual è la differenza tra Ling, Ring e Ming?

Ling è la linea MoE generalista di InclusionAI per testo e chiamate di strumenti, e Ling-3.0-flash si colloca nella sua fascia veloce/economica. Ring è la linea focalizzata sul ragionamento. Ming gestisce i compiti multimodali. Sono famiglie separate per lavori diversi, non livelli di un unico modello.

Ling-3.0-flash è lo stesso del precedente flagship da 1T?

No. Ling-3.0-flash è la versione più recente e più piccola del livello veloce (124B totali / 5,1B attivi). L'ammiraglia da 1T parametri della generazione precedente rimane il modello più grande.

Dovrei usare Ling-3.0-flash in produzione oggi?

Più difendibile di quanto non fosse a luglio, ora che esiste un punteggio indipendente e una licenza MIT. Esegui prima il tuo set di valutazione, verifica le affermazioni sulla velocità del fornitore rispetto al tuo carico di lavoro e decidi tra API e self-hosting (FP8 gira in circa 128GB). I restanti numeri disponibili solo tramite fornitore sono abbastanza ristretti da poter pianificare di conseguenza.

Il risultato finale

Ling-3.0-flash è passato da “scheda tecnica e dichiarazioni del fornitore” a “peso aperto e valutato indipendentemente” in due settimane. Un AA Intelligence Index di 38 a 5,1B parametri attivi — sulla frontiera di Pareto degli open-weight, con licenza MIT, a $0,075/$0,22 — lo rende uno dei modelli open-weight più efficienti che puoi scegliere in questo momento, e uno che puoi davvero eseguire tu stesso. Le avvertenze sono più limitate di prima: i dati sulla velocità di picco e sulla scheda del modello sono ancora di Ant finché un laboratorio indipendente non li riproduce. Per testo ad alto volume e tool-calling a questo prezzo, si è guadagnato una valutazione reale.