
Ling-3.0-flash-VL: il modello di visione da 5,5B di parametri attivi di Ant raggiunge 25 sull'Intelligence Index
- deepseekNUOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- openaiNUOVOOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- googleNUOVOGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- qwenNUOVOQwen: Qwen3.8 Max (0902)2026-09-0240Intelligenza72Codice
- anthropicNUOVOAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 per 1M di token
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenza69Codice
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0540Intelligenza72Codice
- qwenQwen: Qwen3.8 Max2026-08-0340Intelligenza72Codice
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligenza69Codice
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M di token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Intelligenza78Codice
- googleGoogle: Gemini 3.6 Flash2026-07-2134Intelligenza69Codice
Ling-3.0-flash-VL ora ha un numero di benchmark che nessuno in Ant Group ha digitato, e questa è la notizia. Il primo modello nativamente multimodale del laboratorio inclusionAI di Ant ottiene un punteggio di 25 sull'Artificial Analysis Intelligence Index — un'esecuzione indipendente, sulla scala attuale v4.3, pubblicata insieme a una pagina del modello che ne elenca velocità, latenza e prezzo. Arriva tre settimane dopo che la scheda del modello del fornitore rivendicava 42 sullo stesso indice, e la cosa più utile che un lettore possa fare con quei due numeri è capire perché non sono una contraddizione: Ant ha misurato secondo il protocollo Intelligence Index v4.1.1, Artificial Analysis ha misurato secondo v4.3, e quelli sono righelli diversi costruiti da set di valutazione diversi. Il numero del fornitore non è tanto sopravvissuto al contatto con una terza parte, quanto è stato rimisurato su una scala che non esisteva quando è stato scritto.
Il modello alla base del punteggio è un mixture-of-experts sparso con 124B parametri totali e circa 5,5B attivi per token, rilasciato con licenza MIT con pesi BF16 e FP8, che accetta testo, immagini e video e restituisce testo. Quel dato sui parametri attivi è l'intero argomento a favore della cosa. Con 5,5B attivi, Ling-3.0-flash-VL si colloca su quella che è diventata la curva più interessante nei modelli aperti — la frontiera dell'intelligenza tracciata rispetto ai parametri attivati anziché alla dimensione totale — ed è lì perché svolge una discreta quantità di lavoro per unità di calcolo inferenziale, non perché sia enorme.
Questo pezzo copre ciò che è effettivamente uscito e quando, cosa dice l'esecuzione indipendente, perché l'affermazione sul Pareto regge meglio di molte altre, quanto costa il modello e dove puoi effettivamente chiamarlo. La versione breve, per chi vuole solo quella: Ling-3.0-flash-VL è reale, a pesi aperti, insolitamente economico da servire, misurabilmente sopra la media per la sua classe dimensionale, e notevolmente più verboso e più lento a essere rilasciato di quanto suggerisca il punteggio grezzo. Il suo 42 dichiarato dal fornitore non è mai stato riprodotto in modo indipendente e non è comparabile al 25 ora sulla classifica.
Cosa è stato effettivamente rilasciato, e la timeline che continua a essere appiattita
La copertura di questa release tende a fondere diversi eventi separati in un'unica data di lancio, e le date contano perché spiegano perché le prime descrizioni parlavano di un modello che nessuno al di fuori di Ant poteva valutare. Il repository Hugging Face inclusionAI/Ling-3.0-flash-VL è stato creato il 4 settembre 2026 — 64 shard di pesi BF16, una licenza MIT, uno stack di codice personalizzato per l'architettura bailing_moe_v3_vl e, per alcuni giorni, quasi nessuno lo scaricava. La quantizzazione FP8 è seguita l'8 settembre, circa 126 GB su 64 shard, con la torre visiva mantenuta a una precisione superiore rispetto ai pesi degli esperti. Artificial Analysis indica la release come 10 settembre 2026, che è la data a cui fa riferimento la sua stessa pagina, e la pagina del modello che riporta il punteggio è stata pubblicata all'incirca in quel periodo.
Quindi "rilasciato a settembre 2026" è accurato ma inutile. La sequenza pratica è stata: i pesi il 4, un secondo formato di precisione l'8 e una misurazione indipendente il 10. Il motivo per cui questo conta è che un modello con i pesi su disco ma senza endpoint ospitato e senza punteggio di terze parti, per la maggior parte dei team, non è ancora qualcosa che si possa valutare — è un download per cui devi predisporre l'infrastruttura. Ling-3.0-flash-VL ha superato quella soglia quando esistevano sia l'API sia il punteggio indipendente.
Il supporto per il serving è arrivato insieme ai pesi, non dopo. Ant ha pubblicato un cookbook per il deployment di SGLang e mantiene un fork di vLLM ottimizzato per Ling per l'architettura, che è la parte di un rilascio open che di solito resta indietro di settimane. Qui non è rimasta indietro.
Il numero sul tabellone, e quello sulla carta
Ecco il quadro indipendente di Artificial Analysis, che è l'unica misurazione di terze parti di questo modello attualmente esistente:
• Intelligence Index — 25 su v4.3, classificato #2 su 64 nella sua classe di dimensione, rispetto a una mediana di classe di 8br /> • Parametri totali — 124Bbr /> • Parametri attivi — 5,5B per tokenbr /> • Velocità di output — 142,9 token/secondo, #10 su 64, rispetto a una mediana tra pari di 105,1br /> • Tempo al primo token — 2,21 secondi, rispetto a una mediana tra pari di 2,29br /> • Finestra di contesto — 262K token misurati da Artificial Analysis, rispetto ai 256K che la model card stessa dichiarabr /> • Licenza — MIT, pesi aperti
Ed ecco il dato del fornitore accanto al quale viene così spesso stampato: 42 sul protocollo v4.1.1 dell'Artificial Analysis Intelligence Index, quattro punti sopra quello che il modello solo testo Ling-3.0-flash ha ottenuto sullo stesso protocollo. Quell'affermazione è nella scheda del modello, non ha alcuna traccia di valutazione pubblicata e non è il numero che Artificial Analysis riporta. Due cose sono vere allo stesso tempo: il 42 non è riprodotto e non è prova di alcuna disonestà, perché la v4.1.1 e la v4.3 non misurano la stessa cosa. Artificial Analysis ha riformulato il proprio indice a settembre 2026 e ha ricalcolato i punteggi dell'intera classifica; la v4.3 incorpora dieci valutazioni tra cui AA-Briefcase, GDPval-AA v2, AutomationBench-AA, Terminal-Bench v4.0 e Humanity's Last Exam. Qualsiasi articolo che citi ancora un 42 accanto a un 25 senza indicare la versione sta confrontando due test diversi e lo definisce un calo.

Il dettaglio che vale la pena segnalare al di là del punteggio principale è la verbosità. Artificial Analysis registra che Ling-3.0-flash-VL spende 160M token di output per completare l'Intelligence Index, classificandosi #8 su 64 rispetto a una mediana di 84M, e lo etichetta come "molto verboso". Per un modello il cui punto di forza è l'inferenza economica grazie a un piccolo numero di parametri attivi, ciò va direttamente contro il suo stesso punto di forza. Paghi per token, non per parametro. Un modello che attiva 5,5B ma emette quasi il doppio del numero mediano di token per rispondere alle stesse domande restituisce parte di quel vantaggio strutturale alla cassa — che è esattamente il tipo di interazione che una tabella di prezzi per token nasconde e una misurazione del costo per attività porta alla luce.
La tesi di Pareto, sottoposta a un po' di pressione
L'affermazione che Ling-3.0-flash-VL si trovi sulla frontiera di Pareto tra intelligenza e parametri attivi è, insolitamente, una che i dati indipendenti supportano anziché semplicemente consentire. La mediana della classe su questo indice è 8; Ling-3.0-flash-VL ottiene 25; e lo fa attivando 5,5 miliardi di parametri per token. Per i team il cui vincolo stringente è il throughput erogabile — un singolo acceleratore, un budget di richieste fisso, un deployment edge — quel rapporto è l'intera decisione, ed è una prestazione davvero solida.
Due avvertenze impediscono che si tratti di una vittoria netta. La prima è la discrepanza nel conteggio dei parametri: la scheda del modello indica circa 5,5B attivi, mentre il cookbook di SGLang descrive un modello con 5,1B attivi. Entrambi sono documenti di Ant, la differenza è piccola e cambia leggermente la forma della curva, non la direzione. La seconda è che "frontier" è un'affermazione relativa su un campo che si muove ogni settimana. Essere il migliore per intelligenza per parametro attivo a una data dimensione è una posizione che mantieni finché non viene rilasciato il modello successivo in quella fascia, e questa fascia è affollata.
La dimostrazione di punta del fornitore stesso — ovvero che Ling-3.0-flash-VL, che gareggia nella Image-to-WebDev Arena con lo pseudonimo "linthium", ha totalizzato 1.441 contro il GPT-5.4 di 1.440 — va letta come un richiamo d'attenzione, non come un risultato. Un margine di un punto rientra nel rumore di un Elo d'arena, è riportato dal fornitore e non è il tipo di divario che decide qualcosa. La dichiarazione di capacità che vi sta dietro è più interessante del numero: il modello è progettato per un ciclo di feedback visivo in cui genera codice front-end da un layout, esegue il rendering del proprio output, osserva il rendering e corregge — osserva, agisci, verifica, correggi, invece di produrre una didascalia una volta e fermarsi.

Quanto costa, il che è meno chiaro di quanto sembri
La pagina di Artificial Analysis elenca Ling-3.0-flash-VL a 0,00 $ per 1M di token in input e 0,00 $ per 1M di token in output, rispetto alle mediane dei concorrenti di 0,14 $ e 0,40 $. Non è un prezzo. È l'apparenza di un prezzo. Artificial Analysis assegna un prezzo all'endpoint che riesce a vedere, e l'endpoint che riesce a vedere è gratuito — il modello gira su Ling Studio di Ant in prova gratuita, e l'accesso promozionale gratuito è ciò che la scheda riflette. La documentazione multimodale di Ant non pubblica affatto un prezzo per token per il modello di visione, quindi non esiste un listino del fornitore con cui verificare lo zero. Per dare un'idea della scala, il fratello solo testo Ling-3.0-flash è stato listato intorno a 0,075 $ per 1M di input e 0,22 $ per 1M di output, e anche le varianti Ling specifiche per dominio di Ant sono state lanciate come API gratuite.
Considera lo zero come una finestra di test anziché una tariffa. I livelli gratuiti sui modelli appena rilasciati sono uno strumento di acquisizione clienti, e l'ipotesi di pianificazione onesta è che Ling-3.0-flash-VL alla fine avrà un prezzo più o meno vicino a quello del suo omologo testuale. C'è anche un'ambiguità aperta che l'arrivo di un endpoint a pagamento non risolverà: gli stessi esempi API di Ant usano l'identificatore del modello Ling-3.0-flash-VL-rc1, un marcatore di release candidate, e non è chiaro se il checkpoint servito sia identico byte per byte ai pesi aperti del 4 settembre. Se stai facendo benchmark dei tuoi prompt con l'API ospitata e ti aspetti che i risultati siano trasferibili a una build BF16 auto-ospitata, questa è un'ipotesi che dovresti verificare prima di costruirci sopra.
Il quadro dei costi si inverte a seconda da che parte si è. Per un team che dispone già di acceleratori, la build FP8 a circa 126 GB rientra in un nodo a otto vie di classe 80GB, e il conteggio dei parametri attivi di 5,5B significa che si paga il costo ammortizzato di quel nodo a fronte di un'impronta di calcolo per token molto ridotta — la versione più economica possibile di questo modello è quella che si serve da soli. Per un team senza acceleratori, la domanda è se un endpoint a pagamento arrivi prima che il livello gratuito chiuda.
Dove puoi effettivamente chiamarlo, inclusa la parte in cui diciamo no
Ling-3.0-flash-VL è raggiungibile tramite la piattaforma di Ant stessa — un endpoint compatibile con OpenAI su api.ant-ling.com/v1/chat/completions, e accanto ad esso uno compatibile con Anthropic — oltre all'accesso di prova gratuito su Ling Studio e a pesi aperti che puoi ospitare autonomamente. Anche alcuni gateway indipendenti hanno iniziato a inserirlo nei loro elenchi, e questo è davvero il modo più rapido per provarlo senza dover predisporre nulla.
La cosa che vale la pena dire chiaramente è che OrcaRouter oggi non instrada Ling-3.0-flash-VL. Non è presente nel nostro catalogo di modelli, quindi qualunque cosa tu legga qui sul chiamarlo tramite noi sarebbe pura fantasia, e preferiremmo che tu lo sapessi fin dall'inizio. Ciò che instradiamo è il modello di visione più direttamente comparabile ad esso: DeepSeek V4 Flash Vision Exp, la build multimodale sperimentale di DeepSeek, che è attiva nel nostro catalogo con una finestra di contesto da 1M di token e una tariffa pubblicata. Se la tua reale esigenza è un modello di visione capace dietro un unico endpoint compatibile con OpenAI — con una catena di fallback configurata in modo che, se un provider ha un intoppo, si ritenti prima che inizi la tua risposta, e i prezzi di listino dei provider passati senza alcun ricarico, così che una variazione di prezzo del fornitore ti raggiunga lo stesso giorno in cui viene applicata — questo è il modello da provare per primo finché Ling-3.0-flash-VL resta fuori catalogo.

Cosa guardare da qui
Tre cose decideranno se questo rilascio sembrerà significativo tra sei mesi. La prima è una seconda esecuzione indipendente: un punteggio da un solo valutatore è un punto dati, e la domanda interessante è se il posizionamento di Ling-3.0-flash-VL sulla curva intelligenza-parametri attivi sopravvive a un diverso sistema di valutazione. La seconda è il prezzo reale. Finché Ant non pubblica un listino prezzi per il modello di visione, ogni confronto di costi che lo coinvolge è una stima travestita da numero, e il piano gratuito sta facendo il lavoro che altrimenti farebbe un prezzo. La terza è il delta di qualità di FP8 — la torre di visione è stata deliberatamente mantenuta a una precisione superiore a quella dei pesi degli esperti in quella build, e se la versione quantizzata eguaglia BF16 su compiti visivi a grana fine è esattamente il tipo di domanda che emerge solo quando le persone la usano in produzione anziché sottoporla a benchmark.
Il verdetto disponibile oggi è più ristretto di quanto lasciasse intendere la copertura del lancio e più utile del solo punteggio. Ling-3.0-flash-VL è un vero modello di visione, con licenza MIT, auto-ospitabile, che attiva una piccola frazione dei suoi 124B parametri, ottiene 25 su un indice indipendente attuale contro una mediana di classe di 8, e cede parte di quel vantaggio a causa della verbosità. È un buon modello con una forma onesta. Il 42 sulla scheda è un numero proveniente da un righello che non esiste più.
Confrontati in questo articolo1
Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno
