Una scheda di titolo che contrappone Ling-3.0-flash-VL, un modello visione-linguaggio da 124B di parametri con 5,5B attivi con licenza MIT, un Indice di Intelligenza indipendente di 25 e un percorso di serving NVIDIA CUDA, a InternLumina U2, un modello di diffusione multi-codebook da 16B di parametri con 1B attivi con licenza Apache-2.0 il cui unico checkpoint pubblicato è addestrato su Ascend, coprendo comprensione, generazione, editing e 3D.
Guides & Insights

Ling-3.0-flash-VL vs InternLumina U2: Entrambi rilasciati, silicio diverso

Autore

Alistair Wren

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Entrambi questi modelli ora sono reali, eseguibili e scaricabili, cosa che non era vera due settimane fa — e la differenza tra loro non ha quasi nulla a che fare con i benchmark. Ling-3.0-flash-VL, del laboratorio inclusionAI di Ant Group, ha pubblicato i pesi BF16 e FP8 su Hugging Face tra il 4 e l'8 settembre 2026, ha pubblicato insieme a essi le ricette di serving SGLang e vLLM, e ha ottenuto un punteggio indipendente di 25 sull'Artificial Analysis Intelligence Index v4.3. InternLumina U2, del team InternLM dello Shanghai AI Laboratory, ha distribuito prima il codice di inferenza e poi ha rilasciato i suoi pesi del modello addestrati su Ascend su Hugging Face il 10 settembre — sette shard safetensors in una sottocartella ascend/, portando il repository a un totale di sedici file.

Il tranello sta in ciò per cui quei due rilasci di pesi sono stati creati. Il percorso pubblicato di Ling-3.0-flash-VL è quello CUDA che tutti hanno già: un nodo a otto acceleratori esegue la build FP8, e gli stack di serving sono quelli che state già eseguendo. Il checkpoint pubblicato di InternLumina U2 è quello per Ascend, e il README è esplicito sul fatto che si scarica il checkpoint che corrisponde a come si intende eseguire l'inferenza — con il checkpoint addestrato su NVIDIA ancora indicato come prossimamente disponibile. Due modelli rilasciati nella stessa settimana, e solo uno dei due gira sull'hardware che la maggior parte dei team ha davanti.

Questo inquadra il confronto in modo utile. Non è più un articolo che mette a confronto released e vaporware, e chiunque descriva ancora InternLumina U2 come weights-pending si basa su un README vecchio di una settimana. È un articolo su due design visivi unificati molto diversi, arrivati su due ecosistemi siliconici diversi, e su quali parti di ciascun rilascio siano effettivamente complete.

Cosa contiene ora ciascuna release

Ling-3.0-flash-VL è un mixture-of-experts sparso da 124 miliardi di parametri che attiva circa 5,5 miliardi di parametri per token, su un tronco ibrido a 42 livelli che alterna Kimi Delta Attention con blocchi MLA con gating in rapporto 5:1. Un encoder visivo a risoluzione arbitraria e un proiettore MLP a due livelli alimentano quel tronco, con VideoRoPE che gestisce la posizione spaziale e temporale. Accetta testo, immagini e video e restituisce testo. Sia BF16 (64 shard) sia FP8 (circa 126 GB, con la torre visiva deliberatamente mantenuta a precisione superiore rispetto ai pesi degli esperti) sono pubblici con licenza MIT, e il rilascio è abbastanza completo che la comunità indipendente di benchmark gli ha assegnato un punteggio — 25 sull'Intelligence Index v4.3, classificato #2 su 64 nella sua classe dimensionale, contro una mediana di classe di 8. Ciò che non pubblica è un prezzo per token per il modello di visione, e i suoi esempi API riportano un -rc1 identificatore che lascia aperta la questione se il checkpoint servito corrisponda ai pesi aperti.

InternLumina U2 è un mixture-of-experts sparso da 16B parametri con circa 1B parametri attivi, basato su un backbone di modello linguistico diffusion MoE LLaDA-2.0, che copre sei famiglie di task in un unico modello: QA testuale, generazione testo-immagine, comprensione delle immagini, editing delle immagini, comprensione video e comprensione 3D. Il codice di inferenza per tutti questi è pubblico su main. Il checkpoint addestrato su Ascend è ora pubblico su Hugging Face. Ancora in sospeso, secondo la roadmap del repository stesso: il checkpoint addestrato su NVIDIA, il codice di addestramento (un repository separato) e il report tecnico. La roadmap spunta quattro caselle e ne lascia due aperte — codice di inferenza, pesi Ascend e stack di addestramento e inferenza Ascend completati; codice di addestramento e report tecnico no.

Un dettaglio pratico si trova tra quei due paragrafi. Eseguire i percorsi di visione di U2 richiede i pesi del tokenizer AToken in atoken_inference/checkpoints/atoken-sod.pt, e il driver rilasciato si aspetta una directory di checkpoint suddivisa con gli asset del modello tenuti insieme. Il codice è reale e si installa con Python 3.11, PyTorch 2.6.0 e, sul percorso CUDA, flash-attn 2.7.2. Il supporto Ascend vive su un ascend-npu-support ramo e richiede CANN più un corrispondente torch_npu build al posto della toolchain CUDA. Niente di tutto ciò è nascosto; tutto è documentato. È semplicemente una strada più lunga di pip install e una stringa di modello.

Due risposte alla domanda "che cos'è un token visivo"

Le architetture sono in disaccordo a un livello più profondo del numero di parametri, e il disaccordo è la cosa più interessante dell'affiancare queste due.

Ling-3.0-flash-VL mantiene il contratto standard. Un'immagine diventa una sequenza di token attraverso l'encoder visivo e il proiettore, quei token entrano in un tronco transformer, e tutto viene eseguito in modo autoregressivo. La novità non risiede in come la visione è rappresentata, ma in quanto economicamente viene eseguito il tronco — 5,5 miliardi di parametri attivi per token su 124 miliardi totali, che è l'intera ragione per cui il modello appare sulla frontiera intelligenza-versus-parametri-attivi. VideoRoPE conferisce alla posizione spaziale e temporale una codifica coerente, quindi il video non necessita di macchinari separati.

InternLumina U2 cambia la rappresentazione stessa. Utilizza il tokenizer AToken di Apple, in cui ogni posizione visiva è descritta da otto codebook complementari — texture locale, testo incorporato, geometria e dettagli ad alta frequenza come flussi separati anziché un unico vettore collassato. Ogni codebook mantiene il proprio embedding in ingresso, e gli otto embedding per posizione vengono concatenati e proiettati verso il basso in un singolo token del backbone. In uscita, la previsione è ciò che il team chiama autoregressiva per profondità di codebook e parallela nello spazio: il backbone di diffusione denoisa molte posizioni spaziali mascherate contemporaneamente, poi una testa autoregressiva multi-codebook predice in ordine gli otto codici per ciascuna posizione. Comprensione e generazione passano attraverso lo stesso meccanismo — che è la vera affermazione. L'argomento del team è che un singolo codebook limita la quantità di informazione che un token visivo può trasportare, mentre gli ibridi discreto-continui dividono comprensione e generazione su rappresentazioni e percorsi di decodifica diversi, e che passare completamente al discreto con più codebook è il modo per ottenere un modello genuinamente unificato anziché due stack messi insieme con i bulloni.

Entrambe sono posizioni coerenti, e comportano costi opposti. Le rappresentazioni multi-codebook possono conservare dettagli visivi più fini; moltiplicano anche il budget di token per immagine per il numero di codebook e rendono la decodifica considerevolmente più complessa, il che è presumibilmente parte del motivo per cui 16B-A1B è stata la scala scelta. La sparsità di Ling garantisce un'inferenza per token economica; significa anche una capacità attiva minore per passaggio in avanti, che è il compromesso che la mediana della classe di 8 sull'indice di intelligenza illustra silenziosamente — Ling-3.0-flash-VL la supera comodamente a 25, ma non compete con i modelli frontier densi sul ragionamento puro.

Le superfici delle attività si sovrappongono solo in parte.

Classificare entrambi sotto "modello multimodale" sopravvaluta la sovrapposizione. Sapere dove finisce evita molti confronti d'acquisto sbagliati.

• Input — Ling-3.0-flash-VL accetta testo, immagini e video, fino a 40 immagini per richiesta, e restituisce testo; InternLumina U2 accetta testo, immagini, video e asset 3D, e restituisce testo, immagini generate o immagini modificatebr /> • Generazione di immagini — Ling-3.0-flash-VL non è in grado di generare né modificare immagini; l'affermazione centrale di InternLumina U2 è che fa entrambe le cose, fino a 1024×1024, dagli stessi pesi che leggono le immaginibr /> • 3D — Ling-3.0-flash-VL non ha alcun percorso 3D; InternLumina U2 include una pipeline basata su Blender che renderizza asset GLB e GLTF in 64 viste appaiate di colore e profondità su cui il modello può ragionarebr /> • Video — Ling-3.0-flash-VL gestisce il video tramite la codifica temporale VideoRoPE; InternLumina U2 campiona 64 framebr /> • Contesto e output — Ling-3.0-flash-VL misura una finestra di contesto di 262K token rispetto ai 256K dichiarati nella sua model card, e un output massimo relativamente breve; InternLumina U2 non ha pubblicato nessuno dei due valoribr /> • Parametri attivi — Ling-3.0-flash-VL attiva circa 5,5B per token; InternLumina U2 ne attiva circa 1B, ovvero un quinto

Leggi quell'elenco e la conclusione è che questi due sono sostituti per esattamente un compito — leggere un'immagine e rispondere a domande al riguardo — e complementari quasi ovunque altrove. Se ti serve un modello che generi o modifichi un'immagine, Ling-3.0-flash-VL non è un candidato e nessun benchmark può cambiarlo. Se ti serve un unico modello che legga un grafico, generi una variante e ragioni su un asset 3D, InternLumina U2 è pensato per questo e Ling-3.0-flash-VL non lo affronta.

The GitHub repository page for InternLM/InternLumina-U2 showing the Apache-2.0 license, a commit titled Document weight downloads and mark Ascend checkpoint released from two days earlier, a file listing including infer_t2i_sft.py, infer_mmu_sft.py, infer_video_sft.py and infer_3d_sft.py, 52 stars, and the Releases panel reading No releases published.

Benchmark: un punteggio indipendente a fronte di una pagina di numeri dei fornitori

La qualità delle prove non è nemmeno lontanamente paragonabile, e vale la pena essere precisi sul perché invece di dichiarare un vincitore.

Il 25 di Ling-3.0-flash-VL sull'Intelligence Index v4.3 è un'esecuzione di terze parti su un protocollo pubblicato, con la mediana della classe a 8 per contesto, più un throughput misurato di 142,9 token di output al secondo rispetto a una mediana dei peer di 105,1 e un tempo al primo token di 2,21 secondi. La sua scheda del fornitore rivendica separatamente 42 sul v4.1.1 ritirato protocollo, che è una scala diversa e non può essere messa accanto al 25 come se il modello fosse peggiorato; l'indice è stato ridefinito a settembre 2026 e rivalutato su tutta la linea. Il fornitore riporta anche una vittoria per 1.441 contro 1.440 nell'Image-to-WebDev Arena su GPT-5.4 con l'handle "linthium" — un margine di un punto all'interno del rumore Elo, e riportato dal fornitore.

I numeri di InternLumina U2 sono quelli del laboratorio stesso, etichettati come preliminari e parziali, con le tabelle comparative complete e il rapporto tecnico ancora in sospeso. Ora si trovano in una tabella nel README del repository anziché in una classifica di benchmark, e non possono ancora essere verificati in modo indipendente perché nessuna terza parte ha pubblicato un'esecuzione. Esposti così come li presenta il laboratorio:

• Comprensione — ChartQA 86.52, CharXiv-DQ 83.65, HallusionBench 62.15, MMMU-Pro 36.13, MathVision 33.22, DynaMath 56.37br /> • Video — Video-MME 51.26, MVBench 59.74, MLVU 57.03br /> • Generazione e modifica — GenEval 0.81, DPG 87.10, TIIF Short 84.60, TIIF Long 85.95, ImgEdit 3.83br /> • Provenienza — ogni valore di InternLumina U2 è riportato dal fornitore e preliminare; ogni valore di Ling-3.0-flash-VL è riportato dal fornitore tranne l'Intelligence Index, che è secondo Artificial Analysis

Due di questi meritano una segnalazione. GenEval 0,81 è dietro allo 0,89 di un concorrente citato secondo la tabella dello stesso laboratorio — un raro caso di un fornitore che rende pubblica una sconfitta, e un motivo per fidarsi un po' di più del resto della scheda. E ImgEdit a 3,83 non ha significato senza la tabella di accompagnamento, che fa parte di ciò che conterrà il rapporto tecnico in sospeso. Considera la lista InternLumina U2 come risultati che il laboratorio intende difendere, non come risultati su cui puoi agire. Nota inoltre che i suoi punteggi di comprensione e il punteggio dell'indice di Ling-3.0-flash-VL non sono quantità comparabili: il primo è un insieme di numeri del fornitore specifici per attività, il secondo è un indice composito di terze parti.

A two-column comparison scoreboard for Ling-3.0-flash-VL and InternLumina U2 across six shared dimensions: Intelligence Index 25 on v4.3 versus none yet, active parameters 5.5B versus 1B, total parameters 124B versus 16B, license MIT versus Apache-2.0, published checkpoint NVIDIA CUDA versus Ascend only, and task surface understanding only versus plus generation, editing and 3D, with a footer noting the Ling figure is per Artificial Analysis and InternLumina U2 figures are vendor-reported preliminary.

Licenza, hardware e quanto costa davvero puntare su ciascuno

Ling-3.0-flash-VL è MIT in entrambi i formati di precisione, il che è praticamente quanto di più pulito si possa ottenere con pesi aperti: nessun vincolo aggiuntivo, nessuna restrizione sul campo d'uso, nessuna ambiguità sulla distribuzione commerciale. La build FP8 da circa 126 GB rientra in un nodo di otto acceleratori di classe 80 GB; BF16 è circa il doppio. Il supporto per il serving esiste già in SGLang e in un fork di vLLM mantenuto da Ant. Il rischio residuo è commerciale più che legale: Ant non pubblica alcuna tariffa per token per il modello di visione, l'accesso gratuito su Ling Studio è promozionale e non una tariffa, e Artificial Analysis lo elenca a 0,00 $ per 1M token in entrata e in uscita solo perché l'endpoint che riesce a vedere è quello gratuito.

InternLumina U2 è Apache-2.0 sul repository principale, con due eccezioni che vale la pena leggere: la VeOmni/ directory inclusa mantiene la sua licenza upstream Apache-2.0, e atoken_inference/ deriva da ml-atoken di Apple ed è ridistribuito secondo i termini originali di Apple. L'affermazione sull'infrastruttura è seria: punta sia a GPU NVIDIA sia a NPU Huawei Ascend, con allineamento numerico a livello di operatore tra i backend, e il team riferisce di aver addestrato end-to-end su un cluster Ascend da mille schede con un miglioramento dell'efficienza di addestramento pari a 1,85× grazie a operatori fusi, sharding HSDP ottimizzato e gradient checkpointing. Questa è vera ingegneria. Ed è anche ortogonale al fatto che il modello sia valido o meno: l'efficienza di addestramento su Ascend non dice nulla sulla qualità dell'output, e il checkpoint che esiste oggi è quello pensato per quello stack.

L'asimmetria pratica, quindi, non è una questione di aperto contro chiuso. Entrambe le release sono aperte, entrambe hanno una licenza permissiva ed entrambe possono essere scaricate oggi. È che una release presuppone l'hardware che probabilmente hai e l'altra presuppone l'hardware che probabilmente non hai. Se la tua flotta è NVIDIA, Ling-3.0-flash-VL è il lavoro di un pomeriggio e InternLumina U2 è un'attesa. Se la tua flotta è Ascend — cosa sempre più comune nel mercato cinese per cui questo modello è stato creato — quell'equazione si inverte completamente, e InternLumina U2 è quello con un percorso già pronto, mentre le ricette di Ling-3.0-flash-VL presuppongono CUDA.

Domande che le persone fanno davvero su questo abbinamento

I pesi di InternLumina U2 sono già scaricabili?

Sì, il checkpoint addestrato su Ascend è — sette shard safetensors pubblicati sotto ascend/ su Hugging Face, insieme ai file di configurazione, tokenizer e modellazione. Il checkpoint addestrato su NVIDIA è una sottocartella separata ed è ancora indicato come prossimamente disponibile, e il codice di addestramento e il rapporto tecnico restano ancora in sospeso.

È Ling-3.0-flash-VL strettamente migliore perché ha un punteggio indipendente?

No — è meglio supportato dalle prove ed è più facile da eseguire su hardware comune, il che è un'affermazione diversa. Ling-3.0-flash-VL non può generare né modificare immagini, non può elaborare asset 3D e non ha un prezzo pubblicato. Se il tuo compito è la generazione di immagini, la modifica di immagini o la comprensione 3D, InternLumina U2 lo affronta e Ling-3.0-flash-VL non lo affronta affatto, per quanti benchmark abbia il modello Ling.

Il 42 sulla scheda del modello di Ling-3.0-flash-VL contraddice il 25 di Artificial Analysis?

Non direttamente. Il 42 è stato misurato rispetto al protocollo Intelligence Index v4.1.1 e il 25 rispetto alla v4.3; l'indice è stato riformulato a settembre 2026 e rivalutato su tutta la linea, e le due versioni sono costruite a partire da set di valutazione diversi. Quel che si può dire è che il 42 non è mai stato riprodotto in modo indipendente, mentre il 25 è stato prodotto in modo indipendente.

Dove può essere chiamato l'uno o l'altro di questi

Né Ling-3.0-flash-VL né InternLumina U2 è presente nelnostro catalogo modelli, e affermare il contrario sarebbe un'asserzione che un lettore potrebbe verificare in dieci secondi. Ling-3.0-flash-VL è raggiungibile tramite la piattaforma di Ant stessa, che pubblica un endpoint compatibile con OpenAI e uno compatibile con Anthropic, tramite l'accesso di prova gratuito su Ling Studio, e tramite i pesi aperti se li servi tu stesso. InternLumina U2 è raggiungibile tramite il checkpoint di Hugging Face e il driver di inferenza del repository, sull'hardware a cui quel checkpoint è destinato.

Quello che instradiamo è il modello di visione rispetto al quale questo abbinamento viene più spesso valutato nella pratica: DeepSeek V4 Flash Vision Exp, disponibile nel catalogo con una finestra di contesto da 1M token e una tariffa pubblicata, sullo stesso endpoint compatibile con OpenAI del resto del catalogo. Quando un laboratorio rilascia pesi aperti, un livello di instradamento può di solito offrire il modello senza attendere che il servizio ospitato dal laboratorio stesso si stabilizzi — che è la differenza pratica tra un modello quotabile e un modello chiamabile. Questa differenza è concreta per Ling-3.0-flash-VL e, per il momento, accademica per InternLumina U2, la cui storia di rilascio è un percorso hardware piuttosto che una questione di hosting.

The Artificial Analysis model page for Ling-3.0-flash-VL showing an Intelligence Index of 25 on v4.3 with a class rank of #2 of 64 against a class median of 8, 124B total and 5.5B active parameters, a 262K-token context window, an MIT license and 142.9 output tokens per second.

Il verdetto è davvero spaccato, e si spacca su hardware e compito piuttosto che sulla qualità. Ling-3.0-flash-VL è la release completa: MIT, entrambi i formati di precisione, valutata da terzi, CUDA-first, e limitata alla comprensione. InternLumina U2 è il design più ambizioso e la release meno rifinita: il checkpoint di un solo stack hardware pubblicato, una superficie unificata di sei task che include generazione e 3D, e un report tecnico ancora dovuto. Se ti serve un modello di visione su hardware NVIDIA questa settimana, la scelta si fa da sé. Se il design multi-codebook di InternLumina U2 è ciò che ti interessa, la cosa da tenere d'occhio è il checkpoint NVIDIA — e la posizione onesta fino ad allora è che la sua tabella di benchmark, inclusa la riga che perde, descrive un modello la cui seconda metà non è ancora stata rilasciata.