Una scheda del titolo generata nello stile aziendale OrcaRouter che recita “PixelUMM vs InternLumina-U2”, con quattro riquadri statistici: “41.67 / 57.33” (MMMU e Video-MME di PixelUMM), “0.81 / 51.26” (GenEval e Video-MME di InternLumina-U2), “Apache-2.0” (codice di InternLumina-U2 ed entrambi i checkpoint) e “1-way NC” (la licenza del checkpoint PixelUMM). Una riga a piè di pagina recita “Cifre riportate dal fornitore; nessuna riesecuzione indipendente di nessuno dei due modelli”. Il logo OrcaRouter è inserito in composizione nella striscia con padding in basso a destra.
Guides & Insights

PixelUMM vs InternLumina-U2: due beta senza encoder, e l'unica differenza che decide

Autore

Elias Hawthorne

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli →
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Due modelli, entrambi pubblici, entrambi progettati in modo insolito, e solo su uno dei due puoi costruire un prodotto. PixelUMM è il modello unificato senza encoder di NVIDIA — 15,2 miliardi di parametri su un backbone Qwen3-8B, che legge e scrive pixel grezzi tramite patch 16×16 e tubelet da 4 frame, senza alcun VAE e senza alcun encoder visivo in tutta la pipeline. InternLumina-U2 è il modello diffusion mixture-of-experts da 16B dello Shanghai AI Laboratory, che comprime ogni input visivo in otto codici discreti complementari tramite un tokenizer chiamato AToken. Entrambi hanno scommesso che l'interfaccia visiva sia il collo di bottiglia. La scommessa che conta di più è però quella nei file di licenza: InternLumina-U2 distribuisce pesi Apache-2.0, PixelUMM distribuisce un checkpoint con licenza non commerciale. Se stai scegliendo tra i due per qualsiasi uso commerciale, quella frase è l'intero confronto e il resto di questa pagina ne è il contesto.

Entrambe le serie di cifre riportate di seguito provengono direttamente dai laboratori stessi. Nessuno dei due modelli dispone di una valutazione indipendente, di un Elo di arena o di una riproduzione di terze parti. Nessuno dei due è servito da alcuna API ospitata. Ciò che differisce è cosa ti è consentito fare con l'artefatto una volta scaricato, e quanto sia effettivamente avanzata ciascuna release.

Dove si trova ciascuno in questo momento

Le tempistiche di rilascio si sono mosse a velocità diverse ed entrambe in silenzio.

• PixelUMM — Repository GitHub creato il 4 settembre 2026; preprint arXiv 2609.38597 datato 29 settembre 2026; repository del modello Hugging Face creato il 1° ottobre 2026 alle 21:40 UTC. Non è emerso alcun post sul blog, comunicato stampa o thread di lancio NVIDIA al riguardo.

• InternLumina-U2 — repository GitHub creato il 1º settembre 2026; stub Hugging Face registrato lo stesso giorno; pesi del checkpoint addestrati su Ascend aggiunti il 10 settembre 2026; pesi del checkpoint NVIDIA/CUDA aggiunti il 24 settembre 2026. Sette shard per stack, entrambi scaricabili oggi.

L'InternLumina-U2 che esisteva all'inizio di settembre — solo codice, pesi "in arrivo", un repository del modello vuoto — non è l'InternLumina-U2 che esiste ora. Chiunque ne abbia letto all'inizio del mese e abbia concluso che i pesi mancavano dovrebbe ricontrollare; sia i checkpoint per Huawei Ascend sia quelli per NVIDIA/CUDA sono online, sotto licenza Apache-2.0, con tokenizer, config, chat template e codice di modellazione remota accanto.

A headless-browser capture of the Hugging Face model card for the InternLumina-U2 repository, showing the model title, the Apache-2.0 licence tag, and the repository's download and like counters alongside the file listing for the checkpoint shards.

Due risposte alla stessa domanda

Entrambi i modelli partono dalla stessa lamentela: il fatto di portare con sé un encoder visivo per la comprensione e un VAE per la generazione significa rappresentare ogni immagine due volte, raddoppiando all'incirca il contesto visivo e costringendo una pipeline di addestramento a mantenere due interfacce.

La risposta di PixelUMM è eliminarli entrambi. I pixel grezzi entrano direttamente attraverso proiezioni lineari a singolo strato — una patch 16×16 per ogni posizione dell'immagine, un tubelet di 4 frame per ogni posizione video — e il backbone è un Transformer decoder-only il cui design Mixture-of-Transformers abbina attenzione condivisa a parametri specifici del task. Il testo viene predetto in modo autoregressivo; i pixel vengono predetti tramite flow matching. L'articolo dedica otto sezioni agli studi di progettazione — dimensione della patch, artefatti della patch, dinamiche nello spazio dei pixel rispetto a quelle nello spazio VAE, scaling computazionale — il che ti dice che la vera domanda del team era se il paradigma regga affatto.

La risposta di InternLumina-U2 è mantenere un'interfaccia discreta ma fare in modo che ogni token contenga molto di più. Il tokenizer AToken descrive ogni posizione visiva con otto codebook complementari che coprono texture, testo incorporato e geometria; gli otto embedding sono concatenati per posizione e proiettati in un unico token del backbone. La decodifica procede nella direzione opposta, con denoising spazialmente parallelo e una testa autoregressiva multi-codebook che predice gli otto codici in ordine. Il backbone è un LLM a diffusione sparsa della linea LLaDA-2.0, 16B totali con 1B attivi.

• Interfaccia visiva — PixelUMM: patch di pixel grezze e tubelet, nessun tokenizer. InternLumina-U2: token completamente discreti a otto codebook da AToken, nessun latente continuo.

• Backbone — PixelUMM: Qwen3-8B (15,2B totali), singolo decoder denso con esperti di comprensione e generazione. InternLumina-U2: modello linguistico di diffusione MoE sparso con 16B totali / 1B attivi.

• Metodo di generazione — PixelUMM: flow matching nello spazio dei pixel più testo autoregressivo. InternLumina-U2: denoising diffusion mascherato su codici discreti.

• Attività dichiarate — PixelUMM: da testo a immagine, da testo a video, da immagine a testo, da video a testo. InternLumina-U2: le stesse, più l'editing delle immagini e la comprensione 3D.

• Formato dei pesi — PixelUMM: 128 .distcp shard (~30 GB) dietro un indice .metadata nascosto. InternLumina-U2: sette .safetensors shard per stack hardware, layout standard Hugging Face.

A generated scoreboard card titled “PixelUMM vs InternLumina-U2 — the scoreboard”, with the two model names as column headings and six dimension rows spanning both columns: visual interface, backbone, generation method, video understanding, weight format and licence. PixelUMM's column shows raw pixel patches and tubelets, a Qwen3-8B backbone at 15.2B, pixel-space flow matching, Video-MME 57.33 with MVBench 70.53, 128 distributed-checkpoint shards, and a noncommercial checkpoint licence; InternLumina-U2's column shows eight-codebook discrete AToken tokens, a 16B-A1B sparse MoE diffusion backbone, masked diffusion denoising, Video-MME 51.26 with MVBench 59.74, seven safetensors shards per hardware stack, and Apache-2.0. A footer notes that the figures are vendor-reported with no independent rerun.

Il tabellone, con la sua provenienza allegata

Leggi ogni riga come un'affermazione del laboratorio stesso. Quelli di PixelUMM provengono dal suo preprint; quelli di InternLumina-U2 sono la descrizione che il laboratorio stesso ne dà come «preliminari, parziali», con le tabelle di confronto complete rinviate a un rapporto tecnico che non è ancora apparso.

• MMMU (ragionamento sulle immagini) — PixelUMM 41,67 (degli autori stessi). InternLumina-U2: non riportato.

• ChartQA — PixelUMM 82.96. InternLumina-U2 86.52.

• DocVQA — PixelUMM 90.42. InternLumina-U2: non riportato.

• Video-MME (senza sottotitoli) — PixelUMM 57.33. InternLumina-U2 51.26.

• MVBench — PixelUMM 70.53. InternLumina-U2 59.74.

• GenEval complessivo — PixelUMM 0,83 con un riscrittore di prompt LLM, 0,77 senza. InternLumina-U2 0,81.

• DPG-Bench complessivo — PixelUMM 85,74. InternLumina-U2 87,10.

• Generazione video — PixelUMM VBench Parte 1 qualità 84.10 / semantica 79.80, Parte 2 totale 83.24. InternLumina-U2: non riportato.

• Comprensione 3D — PixelUMM: nessuna attività di questo tipo. InternLumina-U2 riporta 3D MM-Vet 41,8.

Il confronto è impari perché i due laboratori pubblicano tabelle diverse, non perché uno stia vincendo. PixelUMM ha una sezione completa dedicata alla generazione video e nessuna sezione di editing o 3D; InternLumina-U2 dichiara sei famiglie di attività e riporta una tabella parziale che le copre. I numeri tra laboratori diversi sullo stesso nome di benchmark non sono la stessa misurazione — suddivisioni, prompt e campionamento differiscono — quindi considera le righe ChartQA e GenEval all'incirca allo stesso livello e fermati lì.

Il licensing è il punto in cui questo smette di essere un pareggio.

Questa è la parte che nessuna tabella di benchmark mostra. Il repository PixelUMM è Apache-2.0 e la scheda lo dichiara, in modo ben evidente. Il checkpoint è un artefatto separato sotto la NVIDIA One-Way Noncommercial License, limitato alla ricerca o alla valutazione non commerciale, e un file sorgente conserva inoltre un avviso CC BY-NC 4.0 ereditato da DiT. Uso per ricerca: nessun problema. Funzionalità interna di prodotto: una conversazione con il reparto legale, e probabilmente breve.

InternLumina-U2 è Apache-2.0 dall'inizio alla fine, codice ed entrambi i checkpoint, senza alcuna eccezione separata per usi non commerciali. Per un team che deve rilasciare, non è un piccolo vantaggio — è l'intera decisione. Entrambi i modelli hanno una maturità di livello ricerca. Solo uno dei due è senza restrizioni d'uso.

Quale provare davvero, e come

Se il tuo lavoro riguarda la comprensione video o vuoi un modello che generi video e immagini da un unico insieme di pesi, PixelUMM è l'artefatto più completo e il suo articolo è la lettura più utile — ma è un progetto di ricerca con licenza non commerciale, quindi appartiene a un banco di valutazione, non a una pipeline. Se il tuo lavoro riguarda l'ampiezza nella generazione di grafici, documenti e immagini, o hai bisogno di editing e 3D, InternLumina-U2 copre più terreno e non ha alcun limite di licenza; il suo costo è che il backbone di diffusione 16B-A1B e il tokenizer AToken implicano una vera ingegneria di serving, e i suoi numeri pubblicati sono esplicitamente parziali.

Nessuno dei due è su alcuna API ospitata al momento in cui scriviamo, e questo include OrcaRouter — non instradiamo nessuno dei due modelli. Quando ciò cambierà, l'argomento per raggiungerli tramite un livello di routing anziché tramite integrazione diretta è lo stesso che vale per qualsiasi modello appena aperto: una chiave per oltre 200 modelli, i prezzi di listino dei provider passati allo 0% di ricarico e il failover automatico, così che un modello che si rivela peggiore di quanto suggerisse la tabella del suo fornitore possa essere declassato cambiando una route invece di riscrivere un deployment. Fino ad allora, il consiglio onesto è quello noioso — scarica qualunque licenza permetta il tuo caso d'uso, esegui la tua valutazione sui tuoi dati e non pianificare in base ai numeri di nessuno dei due laboratori finché qualcuno al di fuori del laboratorio non li riproduce.

Cosa cambierebbe la risposta

Tre cose, in ordine di impatto. Una licenza commerciale sul checkpoint di PixelUMM renderebbe il confronto davvero serrato e lo farebbe passare da "leggi il paper" a "valuta i pesi". Un rapporto tecnico dello Shanghai AI Laboratory che includesse le tabelle di confronto complete trasformerebbe i numeri parziali di InternLumina-U2 in qualcosa di verificabile, e rivelerebbe anche quanta parte dell'ampiezza su sei task sia alla pari rispetto alla profondità dei token. E la prima riproduzione indipendente di uno dei due modelli — un rerun di GenEval o MVBench da parte di un team senza interessi nel risultato — è il momento in cui uno dei due smette di essere una tabella di un fornitore. Fino ad allora, uno è un'architettura insolita che puoi solo studiare, e l'altro è un'architettura insolita che puoi distribuire.