Una hero card per il confronto 'Ling-3.0-flash-VL vs Ling 3.0 Flash' con il sottotitolo 'Un cervello da 124B, ora con gli occhi'. Sopra il titolo sono presenti due icone lineari piatte — un documento di testo a sinistra e un occhio su una cornice a destra — e sotto il sottotitolo due etichette separate da un sottile divisorio: 'STESSO BACKBONE HYBRID-LINEAR MOE' e 'UNO AGGIUNGE INPUT NATIVO DI IMMAGINI E VIDEO'. Non compaiono cifre né prezzi. Il logo OrcaRouter è posizionato nell'angolo in basso a destra.
Guides & Insights

Ling-3.0-flash-VL vs Ling 3.0 Flash: Lo stesso cervello da 124B, ora con gli occhi

Autore

Magnus Corvin

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Ling-3.0-flash-VL e Ling 3.0 Flash non sono rivali, e interpretare questo abbinamento come una sfida tra modelli ti porterebbe alla conclusione sbagliata. Ling-3.0-flash-VL è il checkpoint visione-linguaggio che il laboratorio inclusionAI di Ant Group ha rilasciato questa settimana — i pesi sono disponibili su Hugging Face con licenza MIT dal 4 settembre 2026 — ed è costruito direttamente su Ling 3.0 Flash, il modello di testo open-weight da 124 miliardi di parametri del laboratorio che ha ancorato il suo livello veloce da fine luglio. I due condividono lo stesso design MoE ibrido-lineare, la stessa economia di attivazione sparsa, la stessa ricetta di servizio con contesto di 256K e la stessa licenza MIT. Ciò che il checkpoint VL aggiunge è l'unica cosa che il modello di testo non ha mai avuto: input nativo di immagini e video, veicolato tramite un encoder ViT, un proiettore MLP a due strati e la codifica temporale VideoRoPE. Quindi il confronto si riduce a un'unica domanda pratica: se il tuo carico di lavoro non guarda mai un'immagine, il modello con gli occhi merita il passaggio?

Il motivo per cui la domanda merita di essere posta è che inclusionAI non presenta Ling-3.0-flash-VL come una linea di prodotto separata. La sua scheda modello lo definisce "il nostro nuovo modello multimodale nativo", basato su Ling-3.0-flash, di cui eredita le capacità linguistiche, di ragionamento e di contesto lungo, estendendole con una visione che partecipa all'intero ciclo di comprensione, ragionamento, azione e verifica — non una visione come semplice input aggiuntivo. Per una famiglia di modelli il cui precedente rilascio di punta era esplicitamente solo testo, questo è un vero cambiamento, e cambia il checkpoint su cui un team che lavora con testo e strumenti dovrebbe standardizzarsi.

Due checkpoint, un backbone

Ling 3.0 Flash, l'avversario in questo confronto, è il più maturo dei due. Annunciato a fine luglio 2026 e reso open-source con licenza MIT il 7 agosto, è un modello mixture-of-experts ibrido-lineare con 124B di parametri totali e circa 5,1B attivi per token — 35 layer KDA e 7 layer Gated MLA impilati con un rapporto di 5:1, 512 esperti instradati con 8 attivati, un contesto nativo di 256K servito a 262.144 token. È solo testo, con supporto per il tool-calling, pensiero abilitato per impostazione predefinita tramite il template di chat, e un profilo di costo insolitamente basso per le sue dimensioni. È anche la metà documentata della coppia: Artificial Analysis lo elenca nella sua classifica live, dove è al primo posto tra i 63 modelli della sua classe, e ha misurato un output di circa 313 token al secondo sull'API del fornitore.

Ling-3.0-flash-VL mantiene quell'architettura e aggiunge uno stack visivo in cima. La scheda descrive un encoder visivo ViT le cui caratteristiche vengono allineate allo spazio testuale tramite un proiettore MLP a due livelli, con VideoRoPE che codifica sia la posizione spaziale sia l'ordine temporale, così il modello può fare localizzazione di eventi e ragionamento su video lunghi. Il backbone è lo stesso ibrido 5:1 KDA-to-MLA, questa volta con 124B totali / 5.5B attivi per token, con un tronco di 42 livelli. Gli input sono testo, immagine e video; l'output è testo. Il contesto è pubblicizzato fino a 1M token, con la ricetta SGLang consigliata che serve 256K tramite scaling YaRN. Come il suo fratello testuale, viene fornito con il pensiero attivo per impostazione predefinita (disattivabile per richiesta con chat_template_kwargs) e funziona sia con SGLang sia con un fork custom inclusionAI di vLLM. La release BF16 pesa circa 250 GB su disco, distribuiti su 64 shard safetensor — la stessa classe da un quarto di terabyte dei pesi del modello testuale.

Quanto è aggiornato? Al momento in cui scriviamo, il repository VL ha un numero di download nell'ordine delle decine, la sua model card era ancora in fase di aggiornamento e Artificial Analysis non lo ha ancora elencato. Tutto ciò che segue e che non è esplicitamente attribuito ad Artificial Analysis è un resoconto diretto di inclusionAI.

A screenshot of the Hugging Face model card for inclusionAI/Ling-3.0-flash-VL, showing the header '@inclusionAI Ling-3.0-flash-VL', the 'Model card' and 'Files and versions' tabs, the introduction text 'We are introducing Ling-3.0-flash-VL, our next-generation native multimodal model' together with the 124B total / 5.5B activated / up to 1M context summary, and the right-hand sidebar noting License: mit, 42 downloads last month, Safetensors ~125B params, and 'This model isn't deployed — ask for provider support'.

Il tabellone

L'asimmetria qui non è di qualità — è di modalità. Sei dimensioni catturano la decisione:

Intelligenza (scheda fornitore, AA Index v4.1.1) — Ling-3.0-flash-VL: 42, dichiarato dal fornitore. Ling 3.0 Flash: 38, la cifra dell'indice precedente citata nella scheda.

AA live board di oggi (v4.3) — Ling-3.0-flash-VL: non ancora in classifica. Ling 3.0 Flash: stimato 25, classificato #1 su 63 nella sua categoria.

Ingressi — Ling-3.0-flash-VL: testo, immagine e video. Ling 3.0 Flash: solo testo.

Contesto — entrambi dichiarano fino a 1 milione di token; entrambi, oggi, sono di fatto serviti a 256K (262.144).

Prezzo — Ling-3.0-flash-VL: nessun prezzo di listino ancora; solo pesi aperti con licenza MIT. Ling 3.0 Flash: circa $0,07 per 1M di input e $0,22 per 1M di output sull'API di prima parte del fornitore.

Sceglilo per — Ling-3.0-flash-VL: documenti, screenshot, grafici, video e agenti che agiscono su GUI. Ling 3.0 Flash: tool-calling ad alto contenuto testuale e pipeline agentiche a lungo orizzonte.

A two-column scoreboard titled 'Ling-3.0-flash-VL vs Ling 3.0 Flash — the scoreboard'. Left column 'Ling-3.0-flash-VL': 'Intelligence (vendor card, AA Index v4.1.1): 42 — vendor-reported', 'AA live board today (v4.3): not listed yet', 'Inputs: text, image, video', 'Context: up to 1M; 256K recipe', 'Price: no list price — MIT open weights', 'Pick it for: documents, video, GUI agents'. Right column 'Ling 3.0 Flash': 'Intelligence (vendor card, AA Index v4.1.1): 38 — earlier AA figure', 'AA live board today (v4.3): 25 estimated, #1 of 63 in class', 'Inputs: text only', 'Context: 256K native; 1M claimed', 'Price: $0.07 / $0.22 per 1M (vendor API)', 'Pick it for: text-heavy agentic pipelines'. Footer reads 'VL figures vendor-reported; Flash figures per Artificial Analysis.' The OrcaRouter logo is composited in the bottom-right corner.

Il tabellone a cui il modello di testo non può accedere.

È qui che i due modelli divergono realmente, e la divergenza è strutturale più che competitiva: nei benchmark su immagini e video, il Ling 3.0 Flash solo testo non compare affatto, perché non può accettare l'input. Il grafico del Ling-3.0-flash-VL — la valutazione di inclusionAI, non replicata, condotta in parte internamente e in parte contro le API dei concorrenti con impostazioni di test ufficiali — riporta punteggi nelle tre categorie che la scheda mette in evidenza. Nella comprensione di immagini complesse mostra un MMMU-Pro di 79.0 e un MathVision di 84.87, con un 19.88 molto più basso su Humanity's Last Exam-Multimodal, il che riflette quanto quel set sia difficile per tutti. Nel lavoro su documenti e grafici è forte: OmniDocBench1.5 a 91.35 e CharXiv_RQ a 81.30. E nelle suite agentiche multimodali che rendono interessante questa release — ClawEval-MM a 59.9, WebVoyager a 90.83, Vision2Web a 57.69 — al modello multimodale viene chiesto di leggere un'interfaccia e agire su di essa, che è esattamente il compito da agente GUI che il modello testuale non può svolgere.

Leggeteli nel contesto ed emerge un quadro coerente: non è un modello ottimizzato per vincere quiz sulle immagini — è un modello ottimizzato per trasformare i pixel in azione: leggere il layout, seguire il grafico, operare sulla pagina. Nel grafico del fornitore è in testa nel confronto a tre (Qwen3.8-27B ad alto sforzo di ragionamento, Gemini 3.5 Flash-Lite e Kimi-K2.6) su OmniDocBench, WebVoyager e ClawEval-MM, mentre resta indietro su set difficili di conoscenza e ragionamento come MathVision e HLE-MM. Considerate ognuno di quei numeri come un'affermazione di inclusionAI finché un laboratorio neutrale non li confermi — ma la direzione dell'ottimizzazione è chiara e coerente.

L'unico numero per cui vale la pena discutere: 42 vs 38

L'affermazione che più probabilmente spingerà un team specializzato solo in testo a cambiare è quella principale: inclusionAI riporta che Ling-3.0-flash-VL ha ottenuto 42 sull'Artificial Analysis Intelligence Index (v4.1.1), quattro punti in più rispetto ai 38 che attribuisce a Ling 3.0 Flash sulla stessa versione dell'indice. Si noti cosa misura quell'indice: il punteggio composito della v4.1.1 attinge da suite testuali e agentiche — GDPval, Terminal-Bench, SciCode, GPQA Diamond, Humanity's Last Exam e simili, nessuna delle quali riguarda compiti su immagini. Quindi il fornitore sostiene che l'aggiunta dell'addestramento visivo al backbone condiviso abbia migliorato di quattro punti l'intelligenza lato testo del modello, non semplicemente che ora sappia descrivere immagini. È un'affermazione sorprendente e del tutto plausibile — l'instruction tuning multimodale spesso migliora le capacità testuali.

Due avvertenze sulle fonti mantengono quel numero nella giusta prospettiva. In primo luogo, il 38 è un dato di una generazione precedente dell'indice: Artificial Analysis ha da allora spostato la sua classifica live a una versione più recente dell'indice (v4.3), dove attualmente elenca Ling 3.0 Flash con un punteggio stimato di 25, pur continuando a collocarlo al primo posto tra i 63 modelli della sua categoria. La coppia 42-vs-38 del fornitore appartiene alla scala più vecchia, quindi non va letta come «quattro punti sopra il punteggio che AA attribuisce oggi al modello testuale». In secondo luogo, il 42 è il dato di inclusionAI stessa su un modello che Artificial Analysis non ha ancora elencato, e inclusionAI non ha pubblicato i risultati del checkpoint VL sulle singole suite testuali (SWE-Bench, Terminal-Bench) che la sua stessa tabella del modello testuale elenca separatamente. Quattro punti sono esattamente l'entità del miglioramento che vorresti riprodurre prima di migrare, sulla base di quel risultato, un flusso di lavoro puramente testuale.

A screenshot of the Artificial Analysis model page for Ling 3.0 Flash, showing the heading 'Ling 3.0 Flash — Intelligence, Performance & Price Analysis', 'Released August 2026', an estimated 25 on the Artificial Analysis Intelligence Index with a #1-of-63 rank in its class, pricing near $0.07 per 1M input and $0.22 per 1M output tokens, roughly 313 output tokens per second, and technical specs listing text-only input, a 262k context window, and 124B total / 5.1B active parameters.

Prezzo: uno ha un prezzo di listino, l'altro no.

Il confronto dei costi al momento contiene un solo prezzo. {{1}}Ling 3.0 Flash è oggi richiamabile sull'API di prima parte del fornitore a circa $0,07 per 1M di input e $0,22 per 1M di output — prezzi fissati dal fornitore, come confermato nella scheda di Artificial Analysis — con input in cache a costo inferiore, e gli sconti del periodo di lancio sono terminati.{{/1}} Ling-3.0-flash-VL non ha alcun prezzo API pubblicato da nessuna parte; non puoi ancora pagare a token per utilizzarlo. {{2}}Se lo vuoi entro questa settimana, devi fare self-hosting: pesi MIT di circa 250 GB in BF16, sulla stessa classe di hardware già richiesta dal modello di testo — 4 GPU da 141 GB (H20-3e o H200) oppure un nodo Blackwell a 4 GPU con tensor-parallel 4, o 8 GPU da 80 GB H100/H800 a TP8.{{/2}}

Ciò riformula l'economia per un team che lavora solo con il testo. Se acquisti token, il modello di testo a $0,07/$0,22 è economico e collaudato. Se stai già facendo self-hosting del modello di testo da 124B, il checkpoint VL non è una seconda infrastruttura da acquistare — sono altri ~250 GB di pesi sulla stessa classe di macchine, giustificati solo da workload che consumano realmente pixel. Il modello con gli occhi si ripaga solo quando gli occhi sono nel loop.

Chi dovrebbe scegliere cosa

Solo testo e volumi elevati — resta su Ling 3.0 Flash. Ottieni un modello collaudato, presente nella lista AA, un prezzo reale per token e un tool-calling maturo. Il guadagno di quattro punti nell’indice del modello VL non è stato replicato e il suo throughput lato testo non è stato misurato; non ci sono ancora prove che sia il modello testuale migliore, solo un’affermazione che lo sia.

La visione entra nel loop — documenti, screenshot, grafici, foto, fotogrammi video o un'interfaccia utente che il tuo agente deve leggere e su cui fare clic — Ling-3.0-flash-VL è la scelta ovvia, perché è lo stesso motore di ragionamento che già conosci con l'aggiunta dello stack di visione, piuttosto che un modello multimodale separato che devi rivalutare da zero.

Traffico misto, ancora da decidere — la mossa a basso rischio è mantenere entrambi raggiungibili e instradare in base alla richiesta, piuttosto che riprogettare l’architettura attorno a uno solo. Questa è la proprietà che un gateway di modelli esiste per offrirti: un’unica API su oltre 200 modelli, prezzi di listino dei fornitori trasferiti con ricarico allo 0% e failover automatico quando un provider degrada. Nessuno dei due checkpoint Ling è ancora dietro un endpoint OrcaRouter — il prezzo del modello di testo è quello del fornitore e il modello VL non ha alcun prezzo ospitato — ma quando il VL ne avrà uno, spostare un sottoinsieme di traffico su di esso e misurarne i risultati è un cambiamento di configurazione, non un progetto di integrazione.

Cosa manca ancora

• Un'esecuzione indipendente di Ling-3.0-flash-VL su un attuale Artificial Analysis Intelligence Index — il 42 è quanto dichiarato da inclusionAI su una versione precedente dell'indice.

• Il prezzo di qualsiasi API ospitata per il modello VL, che rappresenta il maggiore ostacolo all'adozione occasionale.

• Pubblicati split solo testo (SWE-Bench Pro, Terminal-Bench 2.1) per il checkpoint VL, così un team incentrato sul testo può verificare che lo stack di visione non gli sia costato nulla.

• Un valore di latenza end-to-end o di throughput per VL sotto carico di immagini — la velocità del modello di testo viene misurata; quella del modello di visione no.

Conferma neutrale del grafico del benchmark di visione, parti del quale sono state eseguite sull'harness proprietario di inclusionAI e almeno un benchmark interno è previsto per il rilascio successivo.

Il verdetto

Non è una gara sulla qualità dei modelli; è una decisione sulla modalità, a cui è allegata un’affermazione in quattro punti. Se i tuoi input sono testo, tieni Ling 3.0 Flash — è più economico, in lista AA e con prestazioni misurate, e il vantaggio del modello VL rispetto a esso è al momento una cifra del fornitore su una scala di indici più datata. Se il tuo carico di lavoro parte da uno schermo — una pagina di documento, uno screenshot, un grafico, un fotogramma video, una GUI che il tuo agente deve utilizzare — Ling-3.0-flash-VL è lo stesso cervello da 124B che già conosci, ora in grado di vedere, ed è un’opzione davvero nuova che una settimana fa non esisteva nel livello fast di Ling. Adottalo dove la visione è reale, valida il 42 prima di migrare qualsiasi cosa sulla base di questo e mantieni la scelta reversibile a livello di routing finché non arrivano un punteggio indipendente e un prezzo di listino.