
Ling-3.0-flash-VL: Ant lancia un modello multimodale sulla linea veloce Ling
- deepseekNUOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- openaiNUOVOOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- googleNUOVOGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- qwenNUOVOQwen: Qwen3.8 Max (0902)2026-09-0240Intelligenza72Codice
- anthropicNUOVOAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenza69Codice
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0540Intelligenza72Codice
- qwenQwen: Qwen3.8 Max2026-08-0340Intelligenza72Codice
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligenza69Codice
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M di token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Intelligenza78Codice
- googleGoogle: Gemini 3.6 Flash2026-07-2134Intelligenza69Codice
Il 4 settembre 2026, il laboratorio inclusionAI di Ant Group ha pubblicato su Hugging Face i pesi con licenza MIT per Ling-3.0-flash-VL e, lo stesso giorno, ha aggiornato la documentazione per sviluppatori della piattaforma Ant Ling per allinearla. Ling-3.0-flash-VL è il primo checkpoint in grado di gestire input visivi della famiglia Ling-3.0-flash: la stessa architettura backbone a miscela sparsa di esperti con circa 124 miliardi di parametri che ha reso il solo-testo Ling-3.0-flash uno dei modelli di ragionamento economici più discussi di fine estate, ora in grado di leggere immagini e brevi clip video oltre al testo. La quantizzazione FP8 è seguita l'8 settembre, la mattina in cui scriviamo. Così, in quattro giorni, il rilascio ha acquisito tre superfici su cui un lettore può agire: pesi aperti, un'API ufficiale sulla piattaforma Ling di Ant e un punteggio di 42 riportato dal fornitore sul protocollo Artificial Analysis Intelligence Index versione 4.1.1, quattro punti sopra i 38 misurati indipendentemente per il fratello solo-testo. Ciò che non ha ancora ricevuto è un annuncio formale: la scheda su Hugging Face e il tutorial per sviluppatori costituiscono l'intero lancio, motivo per cui questo articolo distingue ciò che il fornitore dichiara da ciò che un esterno può verificare.
Il rilascio è importante per ciò che fa alla mappa dei prodotti di Ant. Fino a metà 2026, il lavoro multimodale nel portafoglio di modelli di Ant si trovava nella linea separata Ming, mentre Ling-3.0-flash era posizionato — anche nell'explainer di questo blog per il modello testuale — come livello veloce, basato su testo e strumenti, per agenti, coding e deep research. Ling-3.0-flash-VL abbatte questo confine: porta le informazioni visive in un modello di ragionamento costruito su un numero insolitamente ridotto di parametri attivati e su lunghe esecuzioni agentiche, e consegna il risultato agli sviluppatori in tre modalità contemporaneamente. Ciò lo rende una scelta davvero diversa dalle precedenti varianti ottimizzate per dominio (Ling-3.0-flash-Fin, Ling-3.0-flash-Sante), che erano state distribuite come API gratuite senza pesi. Questo modello, invece, è aperto, gira sulla piattaforma a pagamento di Ant ed è così recente che nessuno al di fuori del fornitore ha ancora pubblicato un'esecuzione indipendente. Quest'ultimo fatto è il più importante dell'intero articolo.
Cosa è stato spedito, e quando
Ogni data riportata di seguito è verificabile nei repository e nella documentazione; nulla di tutto ciò si basa su un comunicato stampa inesistente.
• 4 settembre — il repository Hugging Face inclusionAI/Ling-3.0-flash-VL è stato creato alle 15:24 UTC con 64 shard bf16 dei pesi, uno stack completo di codice personalizzato per l'architettura bailing_moe_v3_vl, un template di chat con il ragionamento abilitato per impostazione predefinita e una licenza MIT. Al momento in cui scriviamo, il numero di download è di poche decine: è un rilascio che solo un osservatore di repository avrebbe notato fin dal primo giorno.
4 settembre — Il portale per sviluppatori di Ling-platform di Ant ha aggiunto il tutorial sulla comprensione multimodale che documenta il modello sull'API ufficiale (il timestamp "ultimo aggiornamento" della pagina riporta il 4 settembre 2026). I media cinesi per sviluppatori hanno riportato la funzionalità il giorno successivo, descrivendola come comprensione di immagini e video brevi per il question-answering visivo e l'analisi dei contenuti.
• Dal 5 settembre in poi — il supporto per il serving e il deployment è arrivato rapidamente: un cookbook di deployment SGLang per il modello, un fork personalizzato di vLLM mantenuto dall'organizzazione inclusionAI e un elenco di librerie di deployment bring-your-own-weights con un endpoint chat-completions già pronto. Questi sono runtime e infrastruttura, non annunci, ma ti dicono che il modello è stato costruito per essere servito, non solo pubblicato.
• 8 settembre — l'inclusione della quantizzazione FP8 inclusionAI/Ling-3.0-flash-VL-fp8 è arrivata (64 shard, ~126 GB), con la torre visiva volutamente lasciata a precisione più alta mentre i pesi MoE sono compressi in FP8 E4M3. Per l'hosting autonomo su GPU meno numerose o più piccole, questo è il checkpoint che la maggior parte delle persone scaricherà effettivamente.

La scheda qui sopra è ciò che questa release ha di più vicino a un post di lancio — descrizione del modello, architettura, link alle ricette SGLang e vLLM e nessun annuncio altrove che siamo riusciti a trovare. Vale la pena segnalare fin da subito una discrepanza: la scheda del modello dice «solo 5,5B di parametri attivati per token», mentre il cookbook SGLang scritto nello stesso periodo della release descrive un modello con «5,1B attivi». Trattandosi di un checkpoint nuovo di zecca, la differenza è probabilmente dovuta alla contabilizzazione della vision tower piuttosto che a due modelli diversi, ma è esattamente il tipo di dettaglio che dovrebbe essere etichettato come non ancora chiarito, piuttosto che sorvolato.
Un modello da 124B che attiva 5.5B — ora con gli occhi
Ling-3.0-flash-VL mantiene la ricetta ibrida sparse-MoE che ha definito il suo equivalente testuale. La scheda descrive un backbone a 42 strati che alterna layer Kimi-Delta-Attention e Gated-MLA in un rapporto 5:1 — lo stesso ritmo strutturale di Ling-3.0-flash — con un totale di circa 124,8 miliardi di parametri e solo una piccola frazione attivata per token. La novità è lo stack percettivo: un encoder visivo ViT che alimenta un proiettore MLP a due strati nel backbone linguistico, più VideoRoPE per codificare sia la posizione spaziale sia quella temporale, così che i fotogrammi video arrivino con un ordine su cui il modello può ragionare. L'input è testo, immagini e video; l'output è testo.
• Parametri — 124 miliardi in totale, ~5,5 miliardi attivati per token secondo la scheda del fornitore (vedi l'avvertenza sul conteggio qui sopra).
• Contesto — pubblicizzato come "fino a 1 milione di token"; le ricette di deployment oggi disponibili arrivano a 256K tramite lo YaRN rope scaling, che è la cifra pratica onesta su cui basare la pianificazione finché qualcuno non pubblica una run più lunga verificata.
• Thinking — il ragionamento è attivo per impostazione predefinita tramite il template di chat; sia gli esempi ufficiali dell'API sia le ricette di serving mostrano un'opzione per richiesta enable_thinking: false per le chiamate sensibili alla latenza.
• Licenza — MIT, per entrambi i formati di precisione, senza condizioni aggiuntive. È la stessa licenza pulita che ha reso notevole il rilascio open source di agosto del modello testuale, ed è esattamente il motivo per cui il self-hosting è un'opzione realistica e non una zona grigia.
L'intento progettuale conta tanto quanto la scheda tecnica. Ant posiziona Ling-3.0-flash-VL come un modello che "porta le informazioni visive nell'intero processo di comprensione, ragionamento, azione e verifica" — che è il linguaggio dei carichi di lavoro agentici, non della generazione di didascalie per immagini. Un modello che può guardare una registrazione dello schermo di 30 secondi, gestire una lunga sessione di chiamate di strumenti nel contesto e mantenere il suo costo di attivazione vicino a 5 miliardi di parametri è rivolto direttamente agli agenti per l'uso del computer e basati su brevi video. È un prodotto diverso dai modelli visione-linguaggio ottimizzati per il question-answering su singola immagine, ed è la cornice con cui ogni benchmark qui sotto dovrebbe essere letto.
Cosa accetta effettivamente l'API ufficiale
Il tutorial della piattaforma Ant Ling illustra Ling-3.0-flash-VL tramite due tipologie di API: un endpoint compatibile con OpenAI all'indirizzo api.ant-ling.com/v1/chat/completions e uno compatibile con Anthropic all'indirizzo api.ant-ling.com/anthropic/v1/messages. Vale la pena conoscere i vincoli prima di sviluppare su di essa:
• Immagini — JPEG e PNG, solo base64, fino a 40 immagini per richiesta, ciascuna immagine fino a 16.384 × 784 pixel e ogni stringa base64 fino a 32 MB. Il parametro compatibile con OpenAI, image_url.detail, viene ignorato; il motore decide la risoluzione internamente.
• Video — MP4, MOV o WMV, un clip per richiesta, massimo 30 secondi, campionato a 2 fotogrammi al secondo fissi fino a 32 fotogrammi, base64 fino a 32 MB. Il video funziona solo sull'endpoint compatibile con OpenAI; l'endpoint compatibile con Anthropic accetta testo e immagini ma non video.
• Identificatore del modello — gli esempi curl del tutorial chiamano il modello Ling-3.0-flash-VL-rc1 invece di Ling-3.0-flash-VL. Quel -rc1 è un suffisso indicatore di release candidate e una genuina questione aperta: la documentazione non dice quali pesi la piattaforma stia servendo o se il checkpoint dell’API corrisponda alla build con pesi aperti del 4 settembre. Se stai valutando l’API rispetto ai pesi aperti, questa è la prima cosa da testare, non un’ipotesi da dare per scontata.

La pagina sopra è dove risiedono i vincoli sugli input: formati di immagini e video, limiti per richiesta e le due forme di endpoint. È anche il punto in cui viene confermato che il modello è un'API commerciale realmente operativa, e non un semplice stub presente solo nella documentazione.
I numeri — e chi li ha riportati

L'unico numero in evidenza sulla scheda è 42 nel protocollo Artificial Analysis Intelligence Index versione 4.1.1, che Ant dichiara essere quattro punti avanti rispetto al punteggio di 38 del solo testuale Ling-3.0-flash. La distinzione in quella frase è cruciale. Il 38 è una misurazione di Artificial Analysis — eseguita in modo indipendente, pubblicata sulla loro classifica e citata con approvazione nella copertura mediatica del modello testuale. Il 42 è un'affermazione sulla scheda tecnica di Ant, fatta sotto un protocollo dell'indice AA ma non ancora elencata da Artificial Analysis, che al momento in cui scriviamo non aveva una pagina per Ling-3.0-flash-VL. Nessuno al di fuori di Ant ha ancora eseguito questo checkpoint. Trattate il 42 come un dato del fornitore proveniente dalla stessa famiglia che ha prodotto il genuino 38 del modello testuale — un motivo per approfondire, non un numero da citare come dato consolidato.
Tutto il resto della release è qualitativo o metodologico. La scheda descrive il modello attraverso un grafico di capacità "comprendere, ragionare, agire" e accenna a una valutazione agentica Terminal-Bench eseguita con un protocollo in stile AA, ma non pubblica risultati testuali numerici che possiamo riprodurre qui; il cookbook di deployment elenca celle di accuratezza (MMMU-Pro, GSM8K) legate a specifiche configurazioni di serving che vale la pena leggere, ma sono misurazioni legate all'infrastruttura, non valutazioni indipendenti. Il riassunto onesto è breve: un modello di ragionamento plausibile, economico da servire e con capacità visive, ma ancora senza una classifica pubblica indipendente.
Quanto costa, e cosa suggerisce la storia della famiglia.
Il tutorial multimodale di Ant non elenca un prezzo per token per Ling-3.0-flash-VL, quindi qualsiasi cifra qui riportata è un'inferenza, chiaramente etichettata come tale. L'àncora utile è la controparte testuale sulla stessa piattaforma: il prezzo di listino di prima parte di Ling-3.0-flash è di circa $0.075 per 1M di token di input e $0.22 per 1M di output, con letture in cache circa l'80% più economiche, e la console cinese lo prezza in renminbi (¥0.40 input / ¥1.20 output per 1M di token) dopo una promozione di lancio con il 75% di sconto terminata il 31 agosto. Un modello multimodale 124B-A5.5B è più costoso da servire rispetto a un modello di testo 124B-A5.1B — la torre di visione è densa e va eseguita per ogni token immagine — quindi un prezzo pari o di poco superiore a quella fascia è l'ipotesi a priori ragionevole. Anche i precedenti della famiglia giocano nell'altra direzione: le varianti di dominio Fin e Sante sono state lanciate come API gratuite, quindi Ant ha dimostrato che userà un prezzo pari a zero per stimolare l'adozione di una variante di Ling che vuole sul mercato. Se la VL seguirà la fascia dei modelli di testo a pagamento o il modello delle varianti gratuite, semplicemente non è ancora stato reso pubblico.
Per il percorso self-host i numeri sono concreti perché i file sono pubblici. La release bf16 è un download di circa 250 GB su 64 shard — un'impresa multi-GPU su qualsiasi cosa tranne i più grandi nodi singoli — mentre la release FP8 (~126 GB, vision tower mantenuta in bf16) si adatta comodamente a un nodo con 8 acceleratori di classe 80 GB ed è la versione che la maggior parte dei team eseguirà davvero. Le affermazioni sul throughput della guida al serving esistono, ma sono legate ai vendor; aspettatevi la solita avvertenza che i token/s reali dipendono dall'hardware e dal batch.
Dove si colloca un livello di routing — onestamente
Al lancio, nessuno dei principali gateway di modelli di terze parti che abbiamo controllato elenca Ling-3.0-flash-VL, e OrcaRouter — la piattaforma di routing a cui appartiene questo blog — non lo serve nemmeno. Niente in questo articolo dovrebbe essere letto come se lo facesse. Questo è, in tutta onestà, lo stato di un modello di quattro giorni, e vale la pena dirlo chiaramente perché le opzioni realmente a disposizione di un lettore oggi sono esattamente due: chiamare l'API ufficiale di Ant, oppure auto-ospitare i pesi MIT. L'aspetto routing è ciò che viene dopo. Una volta che un modello del genere raggiunge il serving di terze parti, l'economia di un router pass-through è il motivo per preferirlo nella valutazione: prezzo di listino del fornitore inoltrato con markup 0%, quindi un taglio di prezzo del venditore (o un esperimento a livello gratuito come i lanci di Fin e Sante) è attivo lo stesso giorno in cui viene annunciato, e il failover automatico consente di puntare un carico di lavoro reale su un modello open di pochi giorni senza scommettere il proprio stack sulla disponibilità di un singolo fornitore o sul comportamento di un singolo checkpoint. Per una famiglia di modelli che ha rivisto i propri prezzi una volta e si è frammentata in quattro varianti in sei settimane, non è un'ipotesi — è la differenza tra ritestare manualmente ogni volta che Ant si muove e ritestare una sola volta attraverso un'unica API.
Cosa guardare
Questa release è così recente che i segnali utili sono per lo più verifiche che chiunque può eseguire. Primo: se Artificial Analysis (o un altro laboratorio indipendente) elenca Ling-3.0-flash-VL e conferma o corregge il 42 — quel singolo dato separa "il miglior modello della famiglia" da "un altro numero da vendor". Secondo: se l'identificatore -rc1 sull'API ufficiale risolve ai pesi open del 4 settembre; in caso contrario, l'API e il percorso self-host sono modelli diversi e ogni confronto che leggi deve dire quale dei due ha usato. Terzo: i prezzi — una tariffa VL pubblicata sulla piattaforma Ling, e se segue la fascia a pagamento del modello di testo o il playbook dell'API gratuita di Fin/Sante. Quarto: se il checkpoint FP8 mantiene l'accuratezza dichiarata nella card in condizioni di serving reale — la vision tower mantenuta in bf16 è un buon segno, ma le affermazioni sulla vision quantizzata richiedono un run, non una config. E quinto: la questione della mappa di prodotto — con la vision ora nella linea veloce Ling, osserva se Ant mantiene Ming come brand multimodale separato o lascia che i due convergano.
Per uno sviluppatore, la risposta a breve termine è breve. Se vuoi costruirci sopra oggi, l'API ufficiale è il percorso a infrastruttura zero e i pesi FP8 sono il percorso self-host, ed entrambi sono realtà da questa settimana. Se vuoi costruire sul numero 42, aspetta che qualcuno al di fuori di Ant lo riproduca. Tutto ciò che c'è di genuinamente utile in Ling-3.0-flash-VL — pesi MIT, un'architettura plausibile, un design dal prezzo per attivazione aggressivo e un punteggio del fornitore da prendere sul serio — è in atto; tutto ciò che lo renderebbe un default sicuro è ancora in sospeso.
