
NVIDIA PixelUMM è stato rilasciato senza un annuncio — I pesi sono appena arrivati
- openaiNUOVOOpenAI: GPT-6.1 Sol2026-09-2952Intelligenza
- anthropicNUOVOAnthropic: Claude Sonnet 5.52026-09-2856Intelligenza
- typesafeNUOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M di token · 223 tok/s
- OpenAINUOVOOpenAI: GPT-6 Luna2026-09-2238Intelligenza
- OpenAINUOVOOpenAI: GPT-6 Sol2026-09-2248Intelligenza
- AnthropicNUOVOAnthropic: Claude Opus 5.52026-09-2258Intelligenza
- xAINUOVOGrok 4.72026-09-2146Intelligenza
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1M di token · 124 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M di token · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token · 103 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token · 212 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
Il modo più semplice per scoprire che NVIDIA ha creato un nuovo modello multimodale unificato è notare che nessuno te l'ha detto. nvidia/PixelUMM repository è apparso su Hugging Face alle 21:40 UTC del 1° ottobre 2026, con un checkpoint da 15,2 miliardi di parametri il cui intero stack addestrato poggia su un Qwen3-8B backbone — e non c'era nessun post sul blog, nessun comunicato stampa, nessuna slide di keynote e nessun thread di lancio ad accompagnarlo. Le ricerche del nome non trovano nulla sul blog stesso di NVIDIA. Ciò che esiste, invece, è un repository GitHub, una pagina di progetto il cui URL stesso dice ancora "preview", un preprint arXiv numerato 2609.38597 e un checkpoint suddiviso in 128 file con un indice nascosto senza il quale il loader si rifiuta di funzionare. PixelUMM è reale e scaricabile oggi. Se NVIDIA lo consideri rilasciato è una domanda a cui l'azienda non ha risposto.
Quel divario — tra un artefatto che esiste e un fornitore che non ha detto nulla — è tutta la storia qui, e vale la pena essere precisi su da quale lato di esso si collochi ciascun fatto. Tutto ciò che segue proviene dal repository, dalla model card e dal paper che gli autori stessi hanno pubblicato. Nulla proviene da un annuncio, perché non ce n'è stato alcuno.
Cosa è apparso, e quando
Il percorso dura circa quattro settimane, e ogni pezzo è atterrato in silenzio.
• 4 settembre 2026 — nv-tlabs/PixelUMM viene creato su GitHub sotto una licenza di repository Apache-2.0, descritto semplicemente come "Comprensione e generazione unificata di immagini e video senza encoder". Rimane con un unico commit iniziale fino alla fine di settembre.
• 28–29 settembre 2026 — arriva il commit iniziale del repository, e arXiv assegna il preprint arXiv:2609.38597, datato 29 settembre, che elenca autori di NVIDIA e dell'Università di Waterloo: Cong Wei, Xuanchi Ren, Bryan Chu, Weiming Ren, Huan Ling, Jiahui Huang, Laura Leal-Taixé, Sanja Fidler, Wenhu Chen, Zian Wang e Jay Zhangjie Wu.
• 1 ottobre 2026, 21:32 UTC — un commit finale al repository intitolato "docs: aggiungi la citazione dell'articolo PixelUMM".
• 1 ottobre 2026, 21:40 UTC — il repository del modello Hugging Face viene creato, otto minuti dopo, e si popola con gli shard del checkpoint.
La pagina del progetto è ospitata a un percorso che si legge letteralmente pixelumm-project-page-preview, e il paper non riporta alcuna indicazione sulla venue — niente CVPR, niente NeurIPS, niente "accepted to". Nel complesso, la sequenza dà l'impressione di un team di ricerca che mette online un artefatto di un paper e lascia che sia l'upload su HF a fare da annuncio. Questa è un'osservazione sulle prove, non un'affermazione sulle intenzioni: NVIDIA potrebbe benissimo avere un lancio pianificato per più avanti, e nulla qui lo esclude.

Cos'è realmente PixelUMM
La tesi progettuale è enunciata nella prima riga della scheda del modello: niente VAE, nessun encoder visivo. Dove un modello unificato convenzionale porta due interfacce visive — un vision transformer che produce feature semantiche per la comprensione e un autoencoder variazionale che produce latenti di ricostruzione per la generazione — PixelUMM non ne porta nessuna. Le immagini vengono tagliate in patch di 16×16 pixel; i video vengono tagliati in tubelet spazio-temporali di 4 frame; entrambi raggiungono il backbone attraverso nient'altro che proiezioni lineari a singolo strato. Entrano pixel grezzi; escono pixel grezzi.
• Architettura — Transformer decoder-only con embedding di patch a pixel grezzi e una testa di generazione iterativa dei pixel, descritto nel paper come una Mixture-of-Transformers che abbina attenzione condivisa a parametri specifici per l'attività.
• Backbone — Qwen3-8B, fissato alla revisione b968826d9c46dd6066d109eabc6255188de91218. Sono necessari solo i suoi file di configurazione e tokenizer; il checkpoint contiene i propri pesi linguistici appresi.
• Parametri — 15.199.672.064 (circa 15,2B), indicati come "8B MoT" nelle tabelle di benchmark dello stesso paper, dove la notazione della dimensione conta separatamente il backbone e l'esperto di generazione.
• Obiettivi — previsione testuale autoregressiva e flow matching nello spazio dei pixel addestrati congiuntamente, ed è ciò che consente a un unico insieme di pesi sia di rispondere a una domanda su un'immagine sia di disegnarne una nuova.
• Attività — text-to-image, text-to-video a 96 frame / 24 fps / 4 secondi, testo condizionato da immagine e testo condizionato da video.
La sezione empirica dell'articolo è insolita in un modo che merita di essere segnalato. Otto delle sue sezioni sono studi di scelte progettuali anziché posizionamenti in classifica — dimensione delle patch delle immagini, dimensione delle patch dei video, artefatti delle patch, dinamiche di addestramento nello spazio dei pixel rispetto allo spazio VAE, dimensione del modello, scaling del calcolo, condizionamento del contesto multimodale e interfacce di comprensione video. Questo è un articolo scritto da persone che cercano di rispondere se l'approccio funzioni, non uno che cerca di vincere una tabella.
I numeri sono degli autori stessi
Ogni cifra riportata di seguito è dichiarata dagli autori di PixelUMM nel loro preprint. Non esiste alcuna riproduzione indipendente, nessun Elo di arena e nessuna valutazione di terze parti, perché il modello ha al massimo sei settimane e precede qualsiasi harness esterno. Considerale come affermazioni con un link per il download, non come prestazioni verificate.
• Comprensione delle immagini — MMMU 41,67, MMStar 53,99, AI2D 80,12, DocVQA 90,42, ChartQA 82,96, OCRBench 78,00, BLINK 53,46, MMMU-Pro 27,63, secondo il protocollo ufficiale LMMS-Eval (64.750 generazioni su 21 attività).
• Comprensione video — MVBench 70,53, Video-MME 57,33 senza sottotitoli, LongVideoBench 59,61, LVBench 40,41.
• Generazione di immagini — GenEval complessivo 0,83 con un riscrittore di prompt LLM, 0,77 senza; DPG-Bench complessivo 85,74.
• Generazione video — Punteggio qualità VBench Parte 1 84,10, punteggio semantico 79,80; totale VBench Parte 2 83,24.
La lettura onesta è che questi sono numeri competitivi all'interno della loro classe, non numeri da leader di categoria, e il paper lo afferma esso stesso: osserva che, poiché i dati di addestramento differiscono tra i modelli, i risultati «non possono stabilire quale architettura sia superiore». Rispetto a Qwen3-VL-8B, il divario nella comprensione delle immagini è ampio su MMMU (41,67 contro 69,60) e su MMMU-Pro, dove gli autori non riportano alcun dato concorrente. Rispetto a Qwen-Image 20B, il divario su GenEval è da 0,83 a 0,87. Ciò che PixelUMM non è, stando ai suoi stessi numeri, è un modello allo stato dell'arte. Ciò che è, stando ai suoi stessi numeri, è un modello da 15B con un'architettura davvero insolita che si colloca nella stessa fascia dei sistemi specialistici che gli stanno intorno.
Il vantaggio più affilato è la licenza, non il benchmark.
Il repository è Apache-2.0 e la model card lo dichiara apertamente. Il checkpoint è un artefatto diverso con termini diversi, e questo è il dettaglio che più probabilmente coglie di sorpresa un team. I pesi sono distribuiti con la NVIDIA One-Way Noncommercial License, il cui utilizzo è limitato alla ricerca o alla valutazione non commerciale — una concessione sostanzialmente più restrittiva rispetto al codice che gli sta accanto. Un file sorgente nel repository, modeling/pixelumm/modeling_utils.py, conserva inoltre un avviso CC BY-NC 4.0 derivato da DiT.
Per un gruppo di ricerca, un team di valutazione o chiunque pubblichi un articolo, questa è una licenza perfettamente utilizzabile. Per un team di prodotto che prototipa una funzionalità interna, è la prima cosa da mettere davanti all'ufficio legale, e la risposta potrebbe essere no. Un modello che non puoi distribuire è un tipo diverso di asset rispetto a un modello che puoi distribuire, e nessuna parità di benchmark cambia questo.

Cosa serve per eseguirlo
Questo non è un download da fine settimana. La documentazione dell'ambiente richiede Linux x86-64, Python 3.12, un toolkit di sviluppo CUDA 13.0, una GPU NVIDIA e FlashAttention compilato dai sorgenti con quel toolkit — un'immagine CUDA di solo runtime non basta. Il checkpoint in sé non è un file model.safetensors: è composto da 128 shard .distcp per un totale di circa 30 GB più un indice .metadata nascosto, e il caricatore richiede che ogni shard referenziato e quell'indice siano presenti.
Due ulteriori dettagli determinano ciò che puoi effettivamente farci. Primo, text-to-video esegue i guardrail di Cosmos per impostazione predefinita, e questi richiedono accesso al repository ad accesso controllato nvidia/Cosmos-1.0-Guardrail più un secondo ambiente Python con una diversa versione major di Transformers — il solo login non sblocca i pesi. Secondo, l'esempio di addestramento dimostrativo in quattro passaggi, l'unica ricetta di addestramento pubblicata, è documentato come richiedente sette GPU con almeno 48 GiB ciascuna e circa 61 GB di disco libero per l'output. Il fine-tuning su una workstation non è il percorso previsto; l'inferenza su una singola scheda moderna lo è.
Il repository fornisce quattro checkpoint. S8-F22-R05 è quello predefinito e quello utilizzato per la valutazione dell'articolo, e copre tutti e quattro i task. S8-F18-R01 ha eseguito 10.000 passaggi aggiuntivi di fine-tuning a 480p e 720p e in genere offre risultati leggermente migliori di text-to-video, ma non è in grado di fare comprensione video. S8-F19-R03 e S8-F21-R02 sono stadi intermedi. Scegliere tra loro è una vera decisione, non un dettaglio.
Cosa non è confermato
Una lista breve, e conta più di quella lunga qui sopra.
• Nessun annuncio NVIDIA. Al momento della stesura, non è emerso alcun comunicato stampa né alcun post sul blog della stessa azienda per questo modello. Il rilascio silenzioso potrebbe essere intenzionale — gli artefatti di ricerca spesso vengono rilasciati in questo modo — oppure un lancio potrebbe semplicemente non essere ancora avvenuto.
• Nessuna valutazione indipendente.Ogni numero in questo articolo è degli autori stessi. Nulla è stato rieseguito al di fuori di NVIDIA e Waterloo.
• Nessuna route ospitata da nessuna parte. Oggi non puoi chiamare PixelUMM tramite un'API, e questo include OrcaRouter — non lo instradiamo, e non possiamo, perché un checkpoint con licenza non commerciale non è qualcosa che una piattaforma di serving commerciale possa offrire. Chi ti dice il contrario sta descrivendo una configurazione self-hosted.
Nessun futuro dichiarato. I termini non commerciali sono quelli così come forniti. Se si possa fare affidamento su di essi è ignoto e, data la storia di NVIDIA con i checkpoint di ricerca, non è qualcosa su cui pianificare.

Cosa tenere d'occhio in seguito
Tre eventi trasformerebbero PixelUMM da artefatto di ricerca in qualcosa che un pubblico più ampio può usare. Il primo è un cambiamento di licenza sul checkpoint: quel singolo file è l'intera barriera tra "interessante" e "utilizzabile in un prodotto". Il secondo è un lancio ufficiale NVIDIA, che arriverebbe con una cornice che il repository non può fornire: a cosa serve il modello, e se sia una direzione di prodotto o un paper. Il terzo è la prima riproduzione indipendente, molto probabilmente un rerun di GenEval o MVBench da parte di qualcuno con un cluster GPU a disposizione, ed è il momento in cui i numeri degli autori smettono di essere gli unici numeri.
Fino a quel momento, la posizione corretta è quella che le prove supportano. PixelUMM esiste, il codice e il paper sono pubblici e leggibili, i pesi si scaricano, e nessuna delle affermazioni sulle prestazioni è stata verificata da qualcuno al di fuori del team che le ha fatte. Non è una critica al lavoro — è l'aspetto che ha un rilascio di ricerca di sei settimane. È anche esattamente la situazione in cui un livello di routing si ripaga più avanti, se la licenza dovesse mai allentarsi: una sola chiave per i modelli di cui ti fidi già, prezzi di listino passati attraverso con markup 0%, e failover che ti consente di indirizzare una porzione di traffico verso qualcosa di non provato senza puntarci un percorso di produzione. Per ora, però, il riassunto onesto è più semplice. NVIDIA ha costruito qualcosa di insolito, l'ha pubblicato in modo completo e non l'ha detto a nessuno. Il repository è l'annuncio.
