
PixelUMM vs Microsoft Mage-VL: uno elimina il tokenizer visivo, l'altro lo riscrive
- openaiNUOVOOpenAI: GPT-6.1 Sol2026-09-2952Intelligenza
- anthropicNUOVOAnthropic: Claude Sonnet 5.52026-09-2856Intelligenza
- typesafeNUOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M di token · 223 tok/s
- OpenAINUOVOOpenAI: GPT-6 Luna2026-09-2238Intelligenza
- OpenAINUOVOOpenAI: GPT-6 Sol2026-09-2248Intelligenza
- AnthropicNUOVOAnthropic: Claude Opus 5.52026-09-2258Intelligenza
- xAINUOVOGrok 4.72026-09-2146Intelligenza
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1M di token · 124 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M di token · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token · 103 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token · 212 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
Entrambi PixelUMM e Microsoft Mage-VL sono stati creati da team convinti che il modo in cui la visione viene trasformata in token sia il collo di bottiglia sbagliato — e l'hanno risolto in direzioni opposte. Mage-VL, il modello di streaming codec-native di Microsoft, mantiene un tokenizer e lo rende molto più aggressivo: segue la struttura dei moderni codec video, conserva ogni anchor frame e solo quelle patch dei frame previsti in cui il codec spende bit, e riporta una riduzione dei token visivi di oltre il 75%, ottenendo un'accelerazione wall-clock fino a 3,5× rispetto al campionamento uniforme dei frame. PixelUMM, il modello unificato encoder-free di NVIDIA, rimuove completamente il tokenizer — ogni patch 16×16 di pixel grezzi raggiunge il backbone attraverso una singola proiezione lineare, senza alcun VAE e senza alcun vision transformer da nessuna parte. Uno comprime di più. L'altro si rifiuta del tutto di comprimere. E solo uno dei due può generare qualcosa.
Quell'ultima differenza è ciò che rende questo accostamento più interessante di una battaglia di specifiche. Mage-VL è un osservatore — un modello di percezione in streaming con un gate proattivo che decide quando parlare. PixelUMM è un lettore che disegna anche: gli stessi pesi rispondono a domande su un'immagine e generano nuovo video da un prompt testuale. Sono due risposte incompatibili a «che cosa dovrebbe essere un modello di visione unificato», e i numeri di ciascun laboratorio sono i suoi.
Dove avviene la compressione
La premessa di Mage-VL è un moderno paradosso di Moravec: i modelli visione-linguaggio sono forti nel difficile ragionamento offline ma lenti e avidi di calcolo nella semplice percezione in tempo reale. La sua soluzione è l'allineamento al codec. Invece di decodificare un flusso in fotogrammi campionati uniformemente e far passare una griglia densa attraverso un ViT congelato preaddestrato sul web, Mage-VL separa un flusso in fotogrammi anchor (I) e fotogrammi predetti (P), conserva tutte le patch degli anchor e mantiene solo le patch dei fotogrammi predetti che contengono movimento reale o nuovi dettagli. L'encoder, Mage-ViT, è addestrato da zero su una griglia di patch 16×16 con codifica posizionale rotativa 3D ed è esplicitamente agnostico rispetto al codec: la stessa interfaccia accetta vettori di movimento ed energia residua di H.264/AVC o HEVC, oppure la mappa dei rate appresa di un codec neurale, senza alcuna modifica architetturale né riaddestramento.
La premessa di PixelUMM è che il problema sia l'encoder stesso, non la sua efficienza. Il suo paper sostiene che modelli come BAGEL portino due interfacce visive — una ViT per le feature semantiche e una VAE per i latent di ricostruzione — il che raddoppia all'incirca il contesto visivo per immagine di condizionamento e costringe a ricostruire le pipeline di pretraining vision-language attorno a un secondo stream. PixelUMM le elimina entrambe: le immagini diventano patch spaziali 16×16, i video diventano tubelet spazio-temporali da 4 frame, e i pixel grezzi raggiungono un Transformer decoder-only attraverso proiezioni lineari a singolo strato. La comprensione è testo autoregressivo; la generazione è flow matching nello spazio dei pixel.
• Strategia di compressione — Mage-VL: temporale, derivata dal codec; mantieni gli anchor, rendi sparsi i frame predetti. PixelUMM: nessuna; mantieni ogni patch di pixel grezzi.
• Cosa viene addestrato da zero — Mage-VL: l'intero stack visivo, su circa 100M immagini e video non etichettati. PixelUMM: gli embedder e i decoder dei pixel, sopra un backbone linguistico Qwen3-8B.
• Backbone — Mage-VL: Qwen3-4B-Instruct-2507, l'unico componente preaddestrato, dietro un proiettore MLP a due livelli. PixelUMM: Qwen3-8B, circa 15,2 miliardi di parametri in totale.
• Comportamento in streaming — Mage-VL: un gate cognitivo valuta ogni finestra scorrevole e rimane silenzioso finché non si completa un evento meritevole di risposta, invocando il modello completo solo allora. PixelUMM: nessuna modalità streaming; le richieste sono chiamate di generazione o di comprensione.

Che cosa fa ciascuno, e che cosa non fa
Mage-VL è un singolo checkpoint che fornisce contemporaneamente comprensione di immagini e video e il gate proattivo per lo streaming — gli stessi pesi rispondono a domande offline e guidano commenti attivati da eventi. Include il processore codec, il pacchetto codec neurale e il gate. Una seconda release, microsoft/Mage-ViT, è il codificatore visivo autonomo proveniente dalla fase di pretraining da zero, offerto come front end plug-and-play per altri addestramenti multimodali. Ciò che Mage-VL non fa è generare. Legge.
PixelUMM copre text-to-image, text-to-video a 96 frame e 24 fps, e testo condizionato da immagini e video. Include quattro checkpoint — S8-F22-R05 come default che copre tutti e quattro i compiti, S8-F18-R01 ottimizzato per un text-to-video migliore a 480p e 720p ma incapace di comprensione video, e due stadi intermedi. Ciò che non fa è streaming, editing o 3D. Se hai bisogno di un modello che guarda un feed in diretta e parla quando succede qualcosa, PixelUMM è del tutto della forma sbagliata, e nessuna colonna di benchmark te lo dirà.
Il divario di adozione è il primo segnale onesto
Le due release non sono ugualmente mature, e i contatori dei download lo dicono più chiaramente di qualsiasi post di lancio.
• Mage-VL — pubblicato su Hugging Face il 25 luglio 2026 con licenza Apache-2.0, con un rapporto tecnico di accompagnamento e un identificativo arXiv. All'inizio di ottobre mostrava all'incirca 13.800 download e 414 like, e attorno ad esso era cresciuto un piccolo ecosistema di lavori della comunità.
• PixelUMM — pubblicato su Hugging Face il 1º ottobre 2026 con una licenza non commerciale per checkpoint. Al momento della stesura di questo testo, il suo numero di download era zero e il numero di like era tre. Ha pochi giorni di vita.
Non c'è ancora alcun annuncio da parte di nessuno dei due laboratori per la rispettiva release — Mage-VL è stato rilasciato a luglio senza uno e PixelUMM è stato rilasciato a ottobre senza uno. Questa simmetria è reale, ma sarebbe un errore leggerla come se i due fossero artefatti equivalenti. Mage-VL ha avuto dieci settimane di attenzione da parte della comunità; PixelUMM ha avuto giorni. Un modello che nessuno fuori dal laboratorio ha eseguito è una questione diversa da un modello che qualche migliaio di persone ha scaricato, e solo uno di questi due rientra nella seconda categoria.

Il tabellone dei punteggi, con provenienza
Ogni cifra è del laboratorio che lo sviluppa. Quelle di Mage-VL provengono dalla scheda e dal rapporto tecnico di Microsoft; quelle di PixelUMM dal suo preprint. Nessuno dei due è stato riprodotto in modo indipendente.
• Token visivi — Mage-VL: riduzione riportata di oltre il 75% rispetto al campionamento denso dei fotogrammi. PixelUMM: nessuna riduzione; l'argomento è che le patch grezze rimuovono una seconda codifica anziché ridurre la prima.
• Velocità effettiva — Mage-VL: fino a 3,5× più veloce del campionamento uniforme dei fotogrammi a parità di accuratezza, secondo quanto riportato da Microsoft. PixelUMM: nessuna dichiarazione comparativa sulla velocità nel paper.
• Qualità dell'encoder — Mage-VL: Mage-ViT riporta il 99,33% su CIFAR-10 e l'85,69% su ImageNet con un budget di 256 token, a partire da circa 100M di contenuti multimediali non etichettati. PixelUMM: nessun benchmark equivalente per l'encoder, poiché non esiste un encoder da valutare.
• Comprensione video — Mage-VL: miglioramenti riportati rispetto a Qwen3-VL-4B su ogni benchmark video e di temporal grounding da esso riportato, inclusi +22,5 su QVHighlight e +17,1 su ActivityNet. PixelUMM: MVBench 70,53, Video-MME 57,33 senza sottotitoli, LongVideoBench 59,61, LVBench 40,41.
• Comprensione delle immagini — Mage-VL: alla pari di Qwen3-VL-4B sulle immagini statiche, secondo quanto riportato da Microsoft. PixelUMM: MMMU 41,67, AI2D 80,12, DocVQA 90,42, ChartQA 82,96.
• Generazione — Mage-VL: nessuno. PixelUMM: GenEval complessivo 0,83 con un riscrittore di prompt, DPG-Bench 85,74, VBench Parte 1 qualità 84,10.
• Streaming — Mage-VL: gating proattivo degli eventi con i migliori TimVal, F1, ROC-AUC e PR-AUC riportati su SoccerNet streaming. PixelUMM: non supportato.
• Licenza — Mage-VL: Apache-2.0, codice e pesi. PixelUMM: codice Apache-2.0, NVIDIA One-Way Noncommercial License sul checkpoint.
Le due colonne non si sovrappongono abbastanza per stabilire una classifica. Mage-VL riporta un encoder efficiente che batte un concorrente di pari scala; PixelUMM riporta un modello da 15B che si colloca nella stessa fascia dei sistemi specialistici che lo circondano, e afferma apertamente nel proprio articolo che dati di addestramento differenti fanno sì che i risultati «non possano stabilire quale architettura sia superiore».
La divisione pratica
Scegli in base al compito, non al punteggio. Se stai costruendo una percezione video in tempo reale — un monitor che osserva uno stream e commenta quando succede qualcosa, con il costo in token come vincolo determinante — Mage-VL è l'unico dei due che lo fa, è Apache-2.0, e la sua scala di classe 4B significa che un singolo nodo può servirlo. Se ti serve un unico modello che legga immagini e video e li generi anche, PixelUMM è l'unico dei due che lo fa, ma è un artefatto di ricerca con licenza non commerciale, i suoi pesi sono 128 shard di checkpoint distribuiti dietro un indice nascosto, e il text-to-video esegue le guardrail di Cosmos per impostazione predefinita con un ambiente Python separato per il gate.
Per un team che ha bisogno di entrambe le capacità, l'argomento a favore del raggiungerle attraverso un unico livello di routing anziché due integrazioni dirette è semplice, anche se oggi nessuna delle due è ospitata: una sola chiave, i prezzi di listino dei provider passati con markup allo 0% e regole di failover che ti consentono di mettere un modello Apache-2.0 appena aperto davanti a una porzione di traffico mentre il modello collaudato regge il resto. OrcaRouter è costruito per questo tipo di problema — e per essere chiari, al momento non instradiamo né PixelUMM né Mage-VL, quindi questa è una descrizione del flusso di lavoro, non un elenco.
Cosa lo risolverebbe
Due eventi contano. Il primo è una riproduzione indipendente dei numeri dell'encoder di Mage-ViT o dei risultati video di Mage-VL da parte di qualcuno che non abbia interessi in gioco — dieci settimane di download non ne hanno ancora prodotto una. Il secondo è qualsiasi modifica alla licenza del checkpoint di PixelUMM, l'unico fatto che al momento separa un artefatto di ricerca da uno distribuibile. Finché nessuno dei due si concretizza, la cosa utile che si può dire di questa coppia è che Microsoft ha puntato a rendere più economica l'interfaccia visiva e NVIDIA ha puntato a rimuoverla, e nessuna delle due scommesse è stata valutata da qualcuno al di fuori del laboratorio che l'ha fatta.
