
InternLumina-U2 vs Microsoft Mage-VL: Due laboratori silenziosi scommettono che i token visivi dovrebbero avere più peso
- AlibabaNUOVOQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token
- z-aiNUOVOZ.ai: GLM 5.3 Flash2026-08-2658Intelligenza72Codice
- DeepSeekNUOVODeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 per 1M di token
- z-aiZ.ai: GLM 5.32026-08-1860Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1552Intelligenza68Codice
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Intelligenza69Codice
- grokSpaceXAI: Grok 4.62026-08-1261Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0557Intelligenza72Codice
- qwenQwen: Qwen3.8 Max2026-08-0358Intelligenza72Codice
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligenza69Codice
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M di token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligenza78Codice
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligenza69Codice
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligenza49Codice
- metaMeta: Muse Spark 1.12026-07-1653Intelligenza71Codice
- kimiMoonshotAI: Kimi K32026-07-1560Intelligenza76Codice
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligenza71Codice
Microsoft Mage-VL e InternLumina-U2 sono stati entrambi distribuiti nel modo in cui i laboratori di ricerca distribuiscono quando non sono sicuri che il risultato sia già un prodotto: in silenzio. Microsoft ha pubblicato i pesi e il codice di Mage-VL su Hugging Face il 25 luglio 2026 senza alcun annuncio; l'organizzazione InternLM dello Shanghai AI Laboratory ha pubblicato il codice di inferenza di InternLumina-U2 su GitHub il 1° settembre 2026 senza alcun annuncio neanche in questo caso. A cinque settimane di distanza, due dei più grandi laboratori del mondo hanno rilasciato modelli che condividono una silenziosa convinzione — che il modo in cui trasformiamo la visione in token sia il collo di bottiglia — e poi li hanno lasciati lì perché la comunità se ne accorgesse. Uno di essi si può scaricare ed eseguire oggi, seppur in modo goffo. L'altro non si può eseguire affatto, perché i suoi pesi non esistono ancora. Questa è la mappa onesta dei due, e del perché "entrambi riportati dal fornitore, entrambi non comprovati" non è la stessa frase per entrambi.
Cinque settimane, due scommesse sull'efficienza della rappresentazione
Il filo conduttore è reale, non retorico. Mage-VL è un modello video nativo da codec: invece di decodificare uno stream in frame campionati uniformemente e di spingere una griglia densa di patch attraverso un vision transformer pre-addestrato sul web, segue la struttura dei codec video moderni, separando uno stream in frame ancora e nei dati di movimento compressi tra di essi, e assimilando direttamente quella rappresentazione compatta. Il ritorno dichiarato da Microsoft è una grande riduzione dei token visivi e un percorso di percezione in streaming significativamente più veloce — l'azienda lo inquadra come una sorta di soluzione al paradosso di Moravec per i modelli linguistici video, dove piccoli compiti di percezione in tempo reale costano tanta potenza di calcolo quanto un ragionamento offline complesso. Mage-VL è un osservatore: consuma video in modo efficiente e risponde a domande su ciò che vede, in tempo quasi reale.
InternLumina-U2 è una scommessa sullo stesso collo di bottiglia, ma dalla direzione opposta. Dove Mage-VL comprime il video seguendo il codec, InternLumina-U2 comprime ogni input visivo descrivendo ciascuna posizione con otto codici discreti complementari invece che con uno solo, usando un tokenizer che il laboratorio chiama AToken. La scommessa è che un singolo codebook limiti quanta informazione può trasportare un token visivo, quindi un vocabolario multi-codebook consente a un modello di diffusione con 16B parametri di fare comprensione e generazione attraverso la stessa interfaccia — leggere un grafico, rispondere a una domanda su un video, descrivere un asset 3D, generare un'immagine dal testo, modificarne una su istruzione — senza uno stack di generazione separato. Mage-VL vuole percepire i flussi a basso costo; InternLumina-U2 vuole percepire e disegnare con un unico insieme di pesi.
Il tabellone
I dati di entrambi i modelli sono dichiarati dal fornitore e non sono stati riprodotti in modo indipendente, quindi la tabella dei punteggi etichetta ogni riga con la propria provenienza.
• Shape — Mage-VL: un modello visione-linguaggio compatto e codec-native (circa 5 miliardi di parametri in BF16) costruito attorno a un backbone testuale Qwen, addestrato per la comprensione di immagini e video. InternLumina-U2: un MoE con 16 miliardi di parametri e 1 miliardo attivo (16B-A1B), un LLM a diffusione sparsa che copre comprensione, generazione e modifica.
• Rappresentazione visiva — Mage-VL: token nativi del codec che seguono la struttura del codec video (ancora più movimento); riportata una riduzione dei token visivi superiore al 75% su video in streaming. InternLumina-U2: token completamente discreti da otto codebook provenienti dal tokenizer AToken.
• Cosa fa — Mage-VL: guarda input di immagini e video, risponde in testo; progettato per la percezione in streaming. InternLumina-U2: afferma comprensione del testo, comprensione delle immagini, generazione testo-immagine, editing di immagini, comprensione video e comprensione 3D.
• Pesi — Mage-VL: pubblico su Hugging Face dal 25 luglio 2026 (microsoft/Mage-VL, Apache-2.0). InternLumina-U2: non pubblico — il repository Hugging Face è uno stub vuoto, pesi contrassegnati come "coming soon".
• Numeri principali — Mage-VL: Video-MME 64.0, NExT-QA 83.1, OVO-Bench 64.0, tutti riportati da Microsoft. InternLumina-U2: ChartQA 86.52, MathVision 33.22, VideoMME 51.26, GenEval 0.81, tutti riportati dal laboratorio, preliminari e parziali.
• Realtà del servizio — Mage-VL: scaricabile, ma non esiste un percorso standard vLLM o SGLang; il codice richiede trust_remote_code e nessun provider di inferenza lo distribuisce attualmente. InternLumina-U2: non può essere servito da nessuno — i pesi non sono disponibili pubblicamente, e anche il driver di inferenza rilasciato richiede file di checkpoint che non sono nel repository.

"Disponibile ma scomodo" non è lo stesso di "non disponibile".
Questa è la distinzione che conta di più se stai realmente cercando di costruire qualcosa. Mage-VL è reale nel modo che conta per primo: i pesi sono su Hugging Face, la scheda ha registrato un traffico di download molto intenso da fine luglio, e attorno ad essa è nato un piccolo ecosistema di quantizzazioni della community. "Reale" non significa "facile". La scheda del modello mostra un tag custom-code, l'encoder visivo non è il ViT congelato standard che gli stack di servizio esistenti presuppongono, e il repository stesso di Microsoft porta con sé la conseguenza pratica: eseguirlo significa trust_remote_code e nessuna implementazione provider chiavi in mano. Ma un team determinato con una GPU può caricarlo, puntarlo su uno stream video e verificare se la tesi codec-nativa regge per i propri dati. Questa è una differenza enorme rispetto a InternLumina-U2, dove la stessa frase finisce in modo diverso: un team determinato può leggere il codice di inferenza, e poi si ferma, perché non ci sono pesi da caricare.

La scheda Hugging Face di microsoft/Mage-VL, catturata il 27 agosto 2026 — la descrizione dello streaming nativo del codec, la licenza Apache-2.0, il tag arxiv e una sezione sui provider di inferenza che mostra che nessun provider distribuisce attualmente il modello.
L'asimmetria dei benchmark segue la stessa linea. I numeri di entrambi i modelli sono dichiarazioni dei vendor, senza ancora alcuna replica indipendente. Ma per Mage-VL queste dichiarazioni poggiano almeno su un artefatto scaricabile, il che significa che il divario tra dichiarazione e verifica è solo questione che qualcuno lo faccia girare. Per InternLumina-U2, invece, poggiano su una voce della roadmap — “le tabelle di confronto complete appariranno nel prossimo rapporto tecnico” — e non esiste alcun artefatto che possa verificarle. La stessa tabella parziale del laboratorio mostra addirittura il modello indietro rispetto ad almeno un rivale dichiarato superato (GenEval 0.81 contro 0.89 per LLaDA2.0-Uni), un utile promemoria per leggere alla lettera l'etichetta “preliminare, parziale”.
Dove potevano comporre invece di competere
Il modo più utile di leggere questi due è come pioli adiacenti di una scala, non come rivali per lo stesso lavoro. Un osservatore codec-native come Mage-VL è interessante proprio perché è abbastanza economico da funzionare in continuazione — la cosa che osserva ogni frame di uno stream e sale di livello solo quando appare qualcosa che merita l'attenzione di un modello più grande. Il modello più grande a cui fa salire il livello potrebbe, in linea di principio, essere un modello unificato del tipo che InternLumina-U2 dichiara di essere: il gate sempre attivo che decide cosa guardare, e il modello profondo che effettivamente legge il grafico, segue la scena 3D, o produce l'immagine modificata. Entrambi non sono dimostrati — Mage-VL non dimostrato ma eseguibile, InternLumina-U2 non dimostrato e non rilasciato — quindi l'inquadratura onesta è una composizione che potresti costruire una volta che ciascun lato è stato validato indipendentemente, non un testa a testa che puoi eseguire oggi.

Il repository GitHub InternLM/InternLumina-U2, catturato il 2 settembre 2026 — la pagina principale del repository che mostra la descrizione della diffusione multi-codebook, il badge della licenza Apache-2.0 e gli script di punto di ingresso per l'inferenza che costituiscono la versione pubblica, mentre i pesi restano esclusi dall'albero.
Cosa fa un livello di routing con checkpoint non comprovati
Nessuno di questi modelli è ospitato su OrcaRouter, e non lasceremo intendere il contrario: Mage-VL non ha un percorso di serving standard da nessuna parte, e InternLumina-U2 non ha pesi. Ciò per cui il DSL di routing è davvero utile in questa situazione è esprimere la composizione di cui sopra come un’unica chiamata invece che come collante ad hoc: un modello di percezione economico e sempre attivo che alimenta un modello più profondo, collegati in modo che il modello costoso venga eseguito solo quando quello economico segnala che qualcosa è cambiato. Quanto al problema dei checkpoint non collaudati — che è l’intero profilo di rischio di entrambi — il failover automatico è il meccanismo che consente a un team di provare un modello come Mage-VL su un percorso reale senza scommettere il percorso su di esso: la prima volta che il nuovo checkpoint si blocca, restituisce spazzatura o lancia un’eccezione, la chiamata ricade su un modello collaudato, e nessun ingegnere deve essere svegliato per azionare un interruttore. Un’unica API su oltre 200 modelli, prezzo di listino del provider applicato a ricarico zero, e la novità messa alla prova dietro una rete di sicurezza, non davanti alla produzione.
La conclusione
Se oggi volete testare la tesi del video nativo-codec, esiste solo Mage-VL — e "esiste" comporta avvertenze su codice personalizzato e serving fai-da-te. Se volete testare la tesi del modello unificato multi-codebook, non potete, perché InternLumina-U2 è ancora una specifica in attesa dei propri pesi; quello che potete fare è leggere la sua architettura ora, così da essere pronti nel momento in cui lo stub su Hugging Face verrà completato. Trattate il modello Microsoft come un artefatto goffo ma reale e il modello Shanghai AI Lab come una promessa ben documentata, e ricordate che in questo confronto "riportato dal fornitore e non riprodotto" vale per entrambi — significa solo qualcosa di diverso quando c'è un file che potete scaricare.
