
PixelUMM vs InternLumina-U2: due beta senza encoder, e l'unica differenza che decide
- openaiNUOVOOpenAI: GPT-6.1 Sol2026-09-2952Intelligenza
- anthropicNUOVOAnthropic: Claude Sonnet 5.52026-09-2856Intelligenza
- typesafeNUOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M di token · 223 tok/s
- OpenAINUOVOOpenAI: GPT-6 Luna2026-09-2238Intelligenza
- OpenAINUOVOOpenAI: GPT-6 Sol2026-09-2248Intelligenza
- AnthropicNUOVOAnthropic: Claude Opus 5.52026-09-2258Intelligenza
- xAINUOVOGrok 4.72026-09-2146Intelligenza
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1M di token · 124 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M di token · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token · 103 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token · 212 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
Due modelli, entrambi pubblici, entrambi progettati in modo insolito, e solo su uno dei due puoi costruire un prodotto. PixelUMM è il modello unificato senza encoder di NVIDIA — 15,2 miliardi di parametri su un backbone Qwen3-8B, che legge e scrive pixel grezzi tramite patch 16×16 e tubelet da 4 frame, senza alcun VAE e senza alcun encoder visivo in tutta la pipeline. InternLumina-U2 è il modello diffusion mixture-of-experts da 16B dello Shanghai AI Laboratory, che comprime ogni input visivo in otto codici discreti complementari tramite un tokenizer chiamato AToken. Entrambi hanno scommesso che l'interfaccia visiva sia il collo di bottiglia. La scommessa che conta di più è però quella nei file di licenza: InternLumina-U2 distribuisce pesi Apache-2.0, PixelUMM distribuisce un checkpoint con licenza non commerciale. Se stai scegliendo tra i due per qualsiasi uso commerciale, quella frase è l'intero confronto e il resto di questa pagina ne è il contesto.
Entrambe le serie di cifre riportate di seguito provengono direttamente dai laboratori stessi. Nessuno dei due modelli dispone di una valutazione indipendente, di un Elo di arena o di una riproduzione di terze parti. Nessuno dei due è servito da alcuna API ospitata. Ciò che differisce è cosa ti è consentito fare con l'artefatto una volta scaricato, e quanto sia effettivamente avanzata ciascuna release.
Dove si trova ciascuno in questo momento
Le tempistiche di rilascio si sono mosse a velocità diverse ed entrambe in silenzio.
• PixelUMM — Repository GitHub creato il 4 settembre 2026; preprint arXiv 2609.38597 datato 29 settembre 2026; repository del modello Hugging Face creato il 1° ottobre 2026 alle 21:40 UTC. Non è emerso alcun post sul blog, comunicato stampa o thread di lancio NVIDIA al riguardo.
• InternLumina-U2 — repository GitHub creato il 1º settembre 2026; stub Hugging Face registrato lo stesso giorno; pesi del checkpoint addestrati su Ascend aggiunti il 10 settembre 2026; pesi del checkpoint NVIDIA/CUDA aggiunti il 24 settembre 2026. Sette shard per stack, entrambi scaricabili oggi.
L'InternLumina-U2 che esisteva all'inizio di settembre — solo codice, pesi "in arrivo", un repository del modello vuoto — non è l'InternLumina-U2 che esiste ora. Chiunque ne abbia letto all'inizio del mese e abbia concluso che i pesi mancavano dovrebbe ricontrollare; sia i checkpoint per Huawei Ascend sia quelli per NVIDIA/CUDA sono online, sotto licenza Apache-2.0, con tokenizer, config, chat template e codice di modellazione remota accanto.

Due risposte alla stessa domanda
Entrambi i modelli partono dalla stessa lamentela: il fatto di portare con sé un encoder visivo per la comprensione e un VAE per la generazione significa rappresentare ogni immagine due volte, raddoppiando all'incirca il contesto visivo e costringendo una pipeline di addestramento a mantenere due interfacce.
La risposta di PixelUMM è eliminarli entrambi. I pixel grezzi entrano direttamente attraverso proiezioni lineari a singolo strato — una patch 16×16 per ogni posizione dell'immagine, un tubelet di 4 frame per ogni posizione video — e il backbone è un Transformer decoder-only il cui design Mixture-of-Transformers abbina attenzione condivisa a parametri specifici del task. Il testo viene predetto in modo autoregressivo; i pixel vengono predetti tramite flow matching. L'articolo dedica otto sezioni agli studi di progettazione — dimensione della patch, artefatti della patch, dinamiche nello spazio dei pixel rispetto a quelle nello spazio VAE, scaling computazionale — il che ti dice che la vera domanda del team era se il paradigma regga affatto.
La risposta di InternLumina-U2 è mantenere un'interfaccia discreta ma fare in modo che ogni token contenga molto di più. Il tokenizer AToken descrive ogni posizione visiva con otto codebook complementari che coprono texture, testo incorporato e geometria; gli otto embedding sono concatenati per posizione e proiettati in un unico token del backbone. La decodifica procede nella direzione opposta, con denoising spazialmente parallelo e una testa autoregressiva multi-codebook che predice gli otto codici in ordine. Il backbone è un LLM a diffusione sparsa della linea LLaDA-2.0, 16B totali con 1B attivi.
• Interfaccia visiva — PixelUMM: patch di pixel grezze e tubelet, nessun tokenizer. InternLumina-U2: token completamente discreti a otto codebook da AToken, nessun latente continuo.
• Backbone — PixelUMM: Qwen3-8B (15,2B totali), singolo decoder denso con esperti di comprensione e generazione. InternLumina-U2: modello linguistico di diffusione MoE sparso con 16B totali / 1B attivi.
• Metodo di generazione — PixelUMM: flow matching nello spazio dei pixel più testo autoregressivo. InternLumina-U2: denoising diffusion mascherato su codici discreti.
• Attività dichiarate — PixelUMM: da testo a immagine, da testo a video, da immagine a testo, da video a testo. InternLumina-U2: le stesse, più l'editing delle immagini e la comprensione 3D.
• Formato dei pesi — PixelUMM: 128 .distcp shard (~30 GB) dietro un indice .metadata nascosto. InternLumina-U2: sette .safetensors shard per stack hardware, layout standard Hugging Face.

Il tabellone, con la sua provenienza allegata
Leggi ogni riga come un'affermazione del laboratorio stesso. Quelli di PixelUMM provengono dal suo preprint; quelli di InternLumina-U2 sono la descrizione che il laboratorio stesso ne dà come «preliminari, parziali», con le tabelle di confronto complete rinviate a un rapporto tecnico che non è ancora apparso.
• MMMU (ragionamento sulle immagini) — PixelUMM 41,67 (degli autori stessi). InternLumina-U2: non riportato.
• ChartQA — PixelUMM 82.96. InternLumina-U2 86.52.
• DocVQA — PixelUMM 90.42. InternLumina-U2: non riportato.
• Video-MME (senza sottotitoli) — PixelUMM 57.33. InternLumina-U2 51.26.
• MVBench — PixelUMM 70.53. InternLumina-U2 59.74.
• GenEval complessivo — PixelUMM 0,83 con un riscrittore di prompt LLM, 0,77 senza. InternLumina-U2 0,81.
• DPG-Bench complessivo — PixelUMM 85,74. InternLumina-U2 87,10.
• Generazione video — PixelUMM VBench Parte 1 qualità 84.10 / semantica 79.80, Parte 2 totale 83.24. InternLumina-U2: non riportato.
• Comprensione 3D — PixelUMM: nessuna attività di questo tipo. InternLumina-U2 riporta 3D MM-Vet 41,8.
Il confronto è impari perché i due laboratori pubblicano tabelle diverse, non perché uno stia vincendo. PixelUMM ha una sezione completa dedicata alla generazione video e nessuna sezione di editing o 3D; InternLumina-U2 dichiara sei famiglie di attività e riporta una tabella parziale che le copre. I numeri tra laboratori diversi sullo stesso nome di benchmark non sono la stessa misurazione — suddivisioni, prompt e campionamento differiscono — quindi considera le righe ChartQA e GenEval all'incirca allo stesso livello e fermati lì.
Il licensing è il punto in cui questo smette di essere un pareggio.
Questa è la parte che nessuna tabella di benchmark mostra. Il repository PixelUMM è Apache-2.0 e la scheda lo dichiara, in modo ben evidente. Il checkpoint è un artefatto separato sotto la NVIDIA One-Way Noncommercial License, limitato alla ricerca o alla valutazione non commerciale, e un file sorgente conserva inoltre un avviso CC BY-NC 4.0 ereditato da DiT. Uso per ricerca: nessun problema. Funzionalità interna di prodotto: una conversazione con il reparto legale, e probabilmente breve.
InternLumina-U2 è Apache-2.0 dall'inizio alla fine, codice ed entrambi i checkpoint, senza alcuna eccezione separata per usi non commerciali. Per un team che deve rilasciare, non è un piccolo vantaggio — è l'intera decisione. Entrambi i modelli hanno una maturità di livello ricerca. Solo uno dei due è senza restrizioni d'uso.
Quale provare davvero, e come
Se il tuo lavoro riguarda la comprensione video o vuoi un modello che generi video e immagini da un unico insieme di pesi, PixelUMM è l'artefatto più completo e il suo articolo è la lettura più utile — ma è un progetto di ricerca con licenza non commerciale, quindi appartiene a un banco di valutazione, non a una pipeline. Se il tuo lavoro riguarda l'ampiezza nella generazione di grafici, documenti e immagini, o hai bisogno di editing e 3D, InternLumina-U2 copre più terreno e non ha alcun limite di licenza; il suo costo è che il backbone di diffusione 16B-A1B e il tokenizer AToken implicano una vera ingegneria di serving, e i suoi numeri pubblicati sono esplicitamente parziali.
Nessuno dei due è su alcuna API ospitata al momento in cui scriviamo, e questo include OrcaRouter — non instradiamo nessuno dei due modelli. Quando ciò cambierà, l'argomento per raggiungerli tramite un livello di routing anziché tramite integrazione diretta è lo stesso che vale per qualsiasi modello appena aperto: una chiave per oltre 200 modelli, i prezzi di listino dei provider passati allo 0% di ricarico e il failover automatico, così che un modello che si rivela peggiore di quanto suggerisse la tabella del suo fornitore possa essere declassato cambiando una route invece di riscrivere un deployment. Fino ad allora, il consiglio onesto è quello noioso — scarica qualunque licenza permetta il tuo caso d'uso, esegui la tua valutazione sui tuoi dati e non pianificare in base ai numeri di nessuno dei due laboratori finché qualcuno al di fuori del laboratorio non li riproduce.
Cosa cambierebbe la risposta
Tre cose, in ordine di impatto. Una licenza commerciale sul checkpoint di PixelUMM renderebbe il confronto davvero serrato e lo farebbe passare da "leggi il paper" a "valuta i pesi". Un rapporto tecnico dello Shanghai AI Laboratory che includesse le tabelle di confronto complete trasformerebbe i numeri parziali di InternLumina-U2 in qualcosa di verificabile, e rivelerebbe anche quanta parte dell'ampiezza su sei task sia alla pari rispetto alla profondità dei token. E la prima riproduzione indipendente di uno dei due modelli — un rerun di GenEval o MVBench da parte di un team senza interessi nel risultato — è il momento in cui uno dei due smette di essere una tabella di un fornitore. Fino ad allora, uno è un'architettura insolita che puoi solo studiare, e l'altro è un'architettura insolita che puoi distribuire.
