
Ling-3.0-flash-VL vs DeepSeek V4 Flash Vision Exp: Due scommesse sulla visione aperta
- deepseekNUOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- openaiNUOVOOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- googleNUOVOGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- qwenNUOVOQwen: Qwen3.8 Max (0902)2026-09-0240Intelligenza72Codice
- anthropicNUOVOAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 per 1M di token
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenza69Codice
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0540Intelligenza72Codice
- qwenQwen: Qwen3.8 Max2026-08-0340Intelligenza72Codice
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligenza69Codice
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M di token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Intelligenza78Codice
- googleGoogle: Gemini 3.6 Flash2026-07-2134Intelligenza69Codice
Ling-3.0-flash-VL e DeepSeek V4 Flash Vision Exp sono i due modelli di visione open-weight in questa classe di peso che un team può realisticamente scaricare e servire oggi, e sono stati creati da persone che non concordano su a cosa serva la visione. Ling-3.0-flash-VL, del laboratorio inclusionAI di Ant Group, attiva circa 5,5B dei suoi 124B parametri per token e tratta la visione come qualcosa da applicare all'interno di un ciclo di feedback — generare, renderizzare, guardare, correggere — al minor costo di inferenza possibile. DeepSeek V4 Flash Vision Exp, la prima build multimodale di DeepSeek, abbina una finestra di contesto da 1M di token a 384K token di output massimo e tratta la visione come un input in più che un agente legge mentre cerca di portare a termine un lavoro lungo. Uno è ottimizzato per quanto poco gli costa pensare. L'altro è ottimizzato per quanto può contenere mentre lo fa.
Quella differenza, non un delta di benchmark, è ciò che dovrebbe guidare la scelta. I due modelli non hanno un protocollo di valutazione condiviso con cui confrontarsi, e solo uno di essi ha un punteggio indipendente. Quello che segue è la forma onesta del confronto: le scommesse architetturali, le specifiche che effettivamente divergono, la situazione dei benchmark incluso perché è carente, quanto costa ciascuno, e quale vince per quale lavoro — più la parte in cui diciamo chiaramente quale dei due è nel nostro catalogo.
Le due scommesse, formulate con precisione
Il lato Ling di questa faccenda è una scommessa sulla sparsità di attivazione come leva primaria sui costi. Ling-3.0-flash-VL è un mixture-of-experts sparso con 124B parametri totali — la model card ne indica circa 124,8B, e il cookbook di SGLang descrive 5,1B attivi laddove la card dice all'incirca 5,5B — ed esegue un trunk ibrido a 42 strati che alterna Kimi Delta Attention con blocchi MLA gated secondo un rapporto 5:1. Un vision encoder a risoluzione arbitraria e un proiettore MLP a due strati alimentano quel trunk, con VideoRoPE che gestisce la posizione spaziale e temporale in modo che i fotogrammi video arrivino in un ordine coerente. La conseguenza architetturale è un modello il cui costo di esecuzione per token è una piccola frazione di quello di un 124B denso, ed è esattamente il motivo per cui compare sulla frontiera intelligenza-versus-parametri-attivi.
Il fronte DeepSeek è una scommessa sul contesto e sulla resistenza agentica. DeepSeek V4 Flash Vision Exp riprende l'architettura testuale di DeepSeek-V4-Flash e vi aggiunge un encoder visivo e un aligner, poi prosegue l'addestramento — una fonte colloca il risultato attorno ai 305 miliardi di parametri, cosa che DeepSeek non ha confermato nel dettaglio. Dispone di una finestra di contesto di 1.048.576 token e di 384.000 token di output massimo, supporta l'output JSON, le tool call, la Responses API, l'Anthropic API e la continuazione da prefisso di conversazione, e DeepSeek è stata esplicita nel dire che non si tratta di un modello di visual question answering. È percezione per gli agenti: leggere screenshot web, interfacce software e grafici, per poi proseguire nelle tool call. Le immagini vengono convertite in token e fatturate come tali, con un limite di 384 token per immagine.
Leggi quei due paragrafi insieme e la forma della decisione emerge. Se il tuo carico di lavoro è "guarda questo, decidi qualcosa, agisci, guarda di nuovo", il numero di parametri attivi di Ling è ciò che rende il ciclo sostenibile e il suo design di feedback visivo è pensato esattamente per questo. Se il tuo carico di lavoro è "leggi questo documento di 400 pagine con figure e vai avanti", la finestra di contesto di DeepSeek è la funzionalità, e nulla dalla parte di Ling può competere con essa.
Perché il confronto tra benchmark è più esile di quanto sembri
Questa è la sezione che la maggior parte dei confronti salta, e saltarla produce una tabella di numeri che non significa nulla. Ecco qual è lo stato effettivo delle prove.
Ling-3.0-flash-VL ha una misurazione indipendente: 25 sull'Artificial Analysis Intelligence Index v4.3, classificato #2 su 64 nella sua classe di dimensioni rispetto a una mediana di classe di 8. La scheda del fornitore dichiara separatamente 42 sul protocollo Intelligence Index v4.1.1, che è una scala ritirata e non comparabile — considerare il 42 come non riprodotto.
DeepSeek V4 Flash Vision Exp non ha alcuna pagina su Artificial Analysis. Ogni numero pubblicato al riguardo è di DeepSeek stesso, dall'annuncio di rilascio, e diversi di essi sono esplicitamente relativi a Opus-4.8 anziché a un protocollo fisso. Non è una critica ai numeri; è un'affermazione su ciò che puoi farne. Non puoi mettere un modello valutato in modo indipendente e un modello valutato solo dal fornitore nella stessa colonna e dichiarare un vincitore, e qualsiasi pagina che lo faccia sta fabbricando un risultato.
Ciò che è legittimo è confrontare ciascun modello con il suo stesso record riportato, con la provenienza allegata:
• Ling-3.0-flash-VL, indipendente — Intelligence Index 25 su v4.3, #2 di 64 nella categoria, mediana di categoria 8, secondo Artificial Analysisbr /> • Ling-3.0-flash-VL, fornitore — 42 sul protocollo v4.1.1 ritirato, e 1.441 contro 1.440 di GPT-5.4 nell'Image-to-WebDev Arena come "linthium"; entrambi riportati dal fornitore e il margine nell'arena rientra nel rumore Elobr /> • DeepSeek V4 Flash Vision Exp, fornitore — Terminal Bench 2.1 83,9; DeepSWE 59,3 contro 58,0 di Opus-4.8; Agents' Last Exam 27,3 contro 25,7 di Opus-4.8; Toolathlon-Verified 75,9; Cybergym 75,3; Chartography 64,3; NL2Repo 57,7; DSBench-Hard 63,6; ZeroBench Pass@5 35,0; ApexBench Pass@1 36,5; AutomationBench 25,7br /> • DeepSeek V4 Flash Vision Exp, indipendente — nessuno pubblicato
Nota di cosa è composta per lo più la lista di DeepSeek: valutazioni agentiche e di ingegneria del software, non valutazioni di visione. La stessa impostazione di DeepSeek è che sui compiti puramente testuali il modello di visione eguaglia il DeepSeek-V4-Flash ufficiale senza regressioni, e che i miglioramenti sono sui benchmark per agenti multimodali — dove DeepSeek descrive il risultato come vicino a Opus-4.8 anziché superarlo, e ammette un divario di circa dieci punti nei compiti strutturati di data science e codice NL2Repo e DSBench-Hard. Si tratta di un insieme di affermazioni insolitamente prudente, e ti dice che il modello viene venduto come un aggiornamento della percezione per uno stack di agenti esistente anziché come un nuovo tetto.

Le specifiche che effettivamente divergono
Per la maggior parte, le due schede tecniche concordano: entrambe sono open-weight con licenza MIT, entrambe accettano in input testo e immagini e restituiscono testo, entrambe distribuiscono pesi BF16 con build quantizzate, entrambe hanno ricette di serving pubblicate ed entrambe gestiscono il video in qualche forma. Le divergenze sono concentrate in quattro punti.
• Parametri — Ling-3.0-flash-VL ha 124B totali con circa 5,5B attivi per token; DeepSeek V4 Flash Vision Exp è riportato intorno ai 305B, senza alcuna cifra pubblicata sui parametri attivibr /> • Finestra di contesto — Ling-3.0-flash-VL misura 262K token secondo Artificial Analysis, contro i 256K dichiarati nella sua stessa model card; DeepSeek V4 Flash Vision Exp arriva nativamente a 1.048.576 tokenbr /> • Output massimo — Ling-3.0-flash-VL è molto più ridotto, nell'ordine delle decine di migliaia di token; DeepSeek V4 Flash Vision Exp raggiunge 384.000br /> • Gestione delle immagini — Ling-3.0-flash-VL accetta fino a 40 immagini per richiesta, fino a 16.384 × 784 pixel ciascuna, solo in base64; DeepSeek V4 Flash Vision Exp accetta base64, URL esterni o un riferimento alla Files API, e limita il costo delle immagini a 384 token per immaginebr /> • Parametri attivi — Ling-3.0-flash-VL attiva circa 5,5B per token; DeepSeek V4 Flash Vision Exp non ha pubblicato alcuna cifra sui parametri attivi
La riga di gestione delle immagini è quella che viene sottovalutata. Un limite massimo rigido di 384 token per immagine significa che un grafico denso o uno screenshot a pagina intera viene compresso all'incirca allo stesso budget di una miniatura — economico e con perdita in un modo che conta per attività di lettura dettagliata. L'approccio di Ling va nella direzione opposta: un budget di pixel per immagine molto ampio, trasporto solo base64 e quindi un payload di richiesta molto più pesante. Quale sia migliore dipende interamente dal fatto che le tue immagini siano fotografie di documenti che devi leggere con precisione o screenshot di interfaccia utente che devi capire approssimativamente.
La seconda riga sottovalutata è l'output massimo. Il tetto di decine di migliaia di token di Ling-3.0-flash-VL va bene per un ciclo descrivi-poi-correggi ed è limitante per qualunque cosa voglia emettere un artefatto di grandi dimensioni — un file lungo generato, una riscrittura completa di un documento, un diff di migliaia di righe. L'output da 384K di DeepSeek esiste proprio perché il suo carico di lavoro previsto termina in un grande risultato di chiamata a strumento o in un artefatto generato. Se la tua pipeline si aspetta che il modello restituisca qualcosa di lungo, quella singola riga decide il confronto prima ancora di qualsiasi benchmark.
Prezzo, e la differenza tra gratuito e senza prezzo
DeepSeek V4 Flash Vision Exp ha un numero reale sul nostro catalogo: $0,24 per 1M token di input e $0,73 per 1M token di output, con una finestra di contesto di 1.048.576 token e un output massimo di 384.000 token, raggiungibile come deepseek/deepseek-v4-flash-vision-exp. Questa è una tariffa pubblicata, fatturata allo stesso modo del V4-Flash testuale, con immagini convertite in token fino a 384 per immagine. È una tariffa che puoi mettere in un foglio di calcolo.
Ling-3.0-flash-VL non ne ha uno. La pagina di Artificial Analysis lo indica a 0,00 $ per 1M di input e 0,00 $ per 1M di output rispetto alle mediane dei concorrenti di 0,14 $ e 0,40 $ — ma ciò riflette la prova gratuita in esecuzione su Ling Studio di Ant, non una tariffa. La documentazione multimodale di Ant non pubblica alcun prezzo per token per il modello visivo, quindi non c'è nulla con cui verificare lo zero. Il fratello solo testo Ling-3.0-flash è stato listato intorno a 0,075 $ per 1M di input e 0,22 $ per 1M di output, e le release Ling specifiche per dominio di Ant sono state lanciate come API gratuite, il che suggerisce una forma finale simile — ma un suggerimento non è un prezzo.
Metti quelli fianco a fianco onestamente e il confronto dei costi è: un modello ha una tariffa, l'altro ha una finestra promozionale e una stima plausibile. Chiunque affermi che Ling-3.0-flash-VL sia più economico di DeepSeek V4 Flash Vision Exp sta confrontando una prova gratuita con un prezzo di listino. L'affermazione difendibile è che Ling-3.0-flash-VL è molto probabilmente più economico per token una volta prezzato, perché 5,5B parametri attivi è un vantaggio strutturale che nessun cambiamento di tariffa cancella — con l'avvertenza che la verbosità di Ling-3.0-flash-VL ne erode una parte. Artificial Analysis registra che consuma 160M token di output sull'Intelligence Index, classificato #8 su 64 rispetto a una mediana di 84M ed etichettato "molto verboso". Paghi per token emesso, quindi un modello che dice quasi il doppio per raggiungere la stessa risposta restituisce parte di ciò che la sua attivazione sparsa fa guadagnare.
Quale, per cosa
L'albero decisionale onesto si ramifica in base al contesto e alla lunghezza dell'output prima di ramificarsi su qualunque altra cosa, perché queste sono le dimensioni in cui i due modelli non sono sostituti.
Scegli DeepSeek V4 Flash Vision Exp quando il tuo lavoro è lungo e termina con un artefatto: documenti di diverse centinaia di pagine con figure, basi di codice lette dall'inizio alla fine, cicli di agenti che devono produrre un risultato voluminoso, carichi di lavoro in cui vuoi passare un'immagine tramite URL o un riferimento all'API Files anziché base64, e pipeline in cui ti servono la Responses API, la continuazione del prefisso o una tariffa per token pubblicata sulla quale impostare il budget. È anche l'unico dei due ad avere un fornitore che dichiara la parità con il proprio modello testuale sulle attività testuali, il che conta se un solo modello ne sta sostituendo due nel tuo stack.
Scegli Ling-3.0-flash-VL quando il tuo vincolo principale è il costo per chiamata e il tuo ciclo è breve: automazione GUI, ispezione ripetuta di screenshot, generazione front-end con un ciclo di rendering e correzione, controlli a campione di documenti medici o finanziari in cui hai bisogno di un'elevata risoluzione per immagine e puoi accettare un output ridotto. Il conteggio di 5,5B parametri attivi è il motivo per sceglierlo, la licenza MIT è il motivo per cui è sicuro ospitarlo autonomamente, e il design del ciclo di feedback visivo è mirato esattamente al pattern osserva-agisci-verifica-correggi. Tieni presente che stai scegliendo un modello senza prezzo con un percorso di ingresso gratuito e nessun impegno su ciò che seguirà.
E se ciò di cui hai effettivamente bisogno è un solo modello che legga le immagini con competenza senza nessuno dei due estremi — nessun trucco di sparsità da 5,5B, nessuna finestra da un milione di token — allora nessuno di questi due è la risposta interessante, e i comuni modelli di visione di fascia media ti serviranno meglio e ti costeranno meno di entrambi gli specialisti.
Eseguirli, e dove ci inseriamo onestamente
DeepSeek V4 Flash Vision Exp è nel nostro catalogo. Puoi chiamarlo tramite l'endpoint compatibile con OpenAI di OrcaRouter con la stringa del modello deepseek/deepseek-v4-flash-vision-exp, sulla stessa chiave che usi per tutto il resto, alla tariffa pubblicata di $0.24/$0.73 senza alcun ricarico — il prezzo di listino del fornitore viene passato direttamente, quindi se DeepSeek riduce la tariffa ti raggiunge lo stesso giorno anziché al prossimo rinnovo contrattuale. Se stai inserendo un modello di visione in un percorso di produzione per la prima volta, questo è il più sicuro dei due con cui iniziare su un livello di routing, perché puoi configurare una catena di fallback in modo che un errore del fornitore venga ritentato su un'altra rotta prima che inizi la tua risposta. Nessuno vuole che la propria prima chiamata di visione in produzione sia quella che gli insegna cosa significa il guasto di un singolo fornitore.

Ling-3.0-flash-VL non è nel nostro catalogo, e non abbiamo intenzione di lasciar intendere il contrario. È raggiungibile tramite la piattaforma di Ant, che pubblica un endpoint compatibile con OpenAI e uno compatibile con Anthropic, tramite l'accesso di prova gratuito su Ling Studio, e tramite i pesi aperti su Hugging Face, che puoi servire autonomamente con la ricetta SGLang pubblicata o con il fork vLLM di Ant. Una cosa da verificare prima di investire in quella strada: gli esempi API di Ant usano l'identificatore Ling-3.0-flash-VL-rc1, un marcatore di release candidate, e se il checkpoint servito corrisponda ai pesi aperti non è stato stabilito pubblicamente. Se esegui benchmark sull'API ospitata aspettandoti che i numeri siano trasferibili a un deployment BF16 self-hosted, verifica prima questa ipotesi.

Il riassunto che regge all’esame più attento: non sono risposte rivali alla stessa domanda. DeepSeek V4 Flash Vision Exp è uno strato di percezione a contesto lungo per agenti, con un prezzo pubblicato e una scheda di benchmark dichiarata dal fornitore che si basa su valutazioni agentiche. Ling-3.0-flash-VL è un modello di visione economico da servire, con un autentico punteggio indipendente, un livello gratuito senza prezzo e una progettazione pensata per brevi cicli correttivi. Fai combaciare la forma del tuo carico di lavoro con la forma del modello, e il fatto che solo uno dei due abbia un punteggio indipendente in classifica dovrebbe orientare quanto peso dai al marketing dell’altro.
La stessa chiave dà accesso al resto del catalogo, e puoi sfogliare il catalogo completo dei modelli per vedere cos'altro si trova dietro un unico endpoint compatibile con OpenAI.
Confrontati in questo articolo2
Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno
