Een gegenereerde titelkaart in de OrcaRouter-huisstijl met de tekst “NVIDIA PixelUMM”, met vier statistiektegels: “1 okt 2026” (Hugging Face-repository aangemaakt, nul downloads), “15,2B” (weergegeven als “8B MoT” in de tabellen van het artikel), “0” (aankondigingen van leveranciers) en “niet-commercieel” (checkpointlicentie; de code is Apache-2.0). Een voettekstregel luidt “Bronnen: Hugging Face-modelkaart · arXiv:2609.38597”. Het OrcaRouter-logo wordt gecompositeerd in de opgevulde strook rechtsonder.
Engineering & Research

NVIDIA PixelUMM uitgebracht zonder aankondiging — de gewichten zijn net gearriveerd

Auteur

Rowan Sterling

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen →
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

De eenvoudigste manier om erachter te komen dat NVIDIA een nieuw uniform multimodaal model heeft gebouwd, is te merken dat niemand het je heeft verteld. De nvidia/PixelUMM repository verscheen op Hugging Face om 21:40 UTC op 1 oktober 2026, met een checkpoint van 15,2 miljard parameters waarvan de volledige geleerde stack bovenop een Qwen3-8B backbone rust — en er was geen blogpost, geen persbericht, geen keynoteslide en geen lanceringsthread bij. Zoekopdrachten naar de naam leveren niets op op NVIDIA's eigen blog. Wat er in plaats daarvan is, is een GitHub-repository, een projectpagina waarvan de eigen URL nog steeds "preview" zegt, een arXiv-preprint met nummer 2609.38597, en een checkpoint verdeeld over 128 bestanden met een verborgen index zonder welke de loader weigert te draaien. PixelUMM is echt en vandaag downloadbaar. Of NVIDIA het als uitgebracht beschouwt, is een vraag die het bedrijf niet heeft beantwoord.

Die kloof — tussen een artefact dat bestaat en een leverancier die niets heeft gezegd — is hier het hele verhaal, en het is de moeite waard om precies te zijn over aan welke kant daarvan elk feit staat. Alles hieronder komt uit de repository, de model card en het paper dat de auteurs zelf hebben gepubliceerd. Niets komt uit een aankondiging, want die was er niet.

Wat verscheen, en wanneer

Het traject duurt ongeveer vier weken, en elk stuk landde rustig.

• 4 september 2026 — nv-tlabs/PixelUMM wordt op GitHub aangemaakt onder een Apache-2.0-repositorylicentie, simpelweg omschreven als "Encoder-Free Unified Image and Video Understanding and Generation". Het blijft tot eind september bij één enkele initiële commit.

• 28–29 september 2026 — de eerste commit van de repository verschijnt, en arXiv kent de preprint arXiv:2609.38597 toe, gedateerd 29 september, met auteurs van NVIDIA en de University of Waterloo: Cong Wei, Xuanchi Ren, Bryan Chu, Weiming Ren, Huan Ling, Jiahui Huang, Laura Leal-Taixé, Sanja Fidler, Wenhu Chen, Zian Wang en Jay Zhangjie Wu.

• 1 oktober 2026, 21:32 UTC — een laatste commit aan de repository met de titel "docs: add PixelUMM paper citation".

• 1 oktober 2026, 21:40 UTC — de Hugging Face-modelrepository wordt acht minuten later aangemaakt en wordt gevuld met de checkpoint-shards.

De projectpagina wordt gehost op een pad dat letterlijk pixelumm-project-page-preview luidt, en de paper bevat geen venue-regel — geen CVPR, geen NeurIPS, geen "accepted to". Alles bij elkaar genomen lijkt de reeks erop dat een onderzoeksteam een paper-artefact live zet en de HF-upload als aankondiging laat fungeren. Dat is een observatie over het bewijsmateriaal, geen claim over de intentie: het kan heel goed dat NVIDIA later een lancering gepland heeft, en niets hier sluit dat uit.

A headless-browser capture of the PixelUMM project page, hosted at a URL path that still reads pixelumm-project-page-preview, showing the model's title, its summary line about encoder-free unified image and video understanding and generation, and the project's task links.

Wat PixelUMM eigenlijk is

De ontwerpthese staat in de eerste regel van de modelkaart: geen VAE, geen vision-encoder. Terwijl een conventioneel unified model twee visuele interfaces heeft — een vision transformer die semantische kenmerken produceert voor begrip, en een variational autoencoder die reconstructie-latenten produceert voor generatie — heeft PixelUMM er geen. Afbeeldingen worden in patches van 16×16 pixels gesneden; video's worden in spatiotemporele tubelets van 4 frames gesneden; beide bereiken de backbone via niets meer dan lineaire projecties met één laag. Ruwe pixels gaan erin; ruwe pixels komen eruit.

• Architectuur — decoder-only Transformer met raw-pixel patch-embeddings en een iteratieve pixelgeneratie-head, in het artikel beschreven als een Mixture-of-Transformers die gedeelde aandacht combineert met taakspecifieke parameters.

• Backbone — Qwen3-8B, vastgezet op revisie b968826d9c46dd6066d109eabc6255188de91218. Alleen de configuratie- en tokenizerbestanden zijn nodig; het checkpoint bevat zijn eigen aangeleerde taalgewichten.

• Parameters — 15.199.672.064 (ongeveer 15,2B), weergegeven als "8B MoT" in de eigen benchmarktabellen van het artikel, waar de grootteaanduiding de backbone en de generatie-expert afzonderlijk meetelt.

• Doelstellingen — autoregressieve tekstvoorspelling en flow matching in pixelruimte die gezamenlijk worden getraind, wat ervoor zorgt dat één set gewichten zowel een vraag over een afbeelding kan beantwoorden als een nieuwe kan tekenen.

• Taken — tekst-naar-afbeelding, tekst-naar-video met 96 frames / 24 fps / 4 seconden, op afbeeldingen geconditioneerde tekst en op video geconditioneerde tekst.

Het empirische gedeelte van het paper is op een manier ongewoon die het vermelden waard is. Acht van de secties zijn studies naar ontwerpkeuzes in plaats van leaderboardposities — grootte van beeldpatches, grootte van videopatches, patch-artefacten, trainingsdynamiek in pixelruimte versus VAE-ruimte, modelgrootte, compute-schaling, multimodale contextconditionering, en interfaces voor videobegrip. Dat is een paper geschreven door mensen die proberen te beantwoorden of de aanpak werkt, niet een die een tabel probeert te winnen.

De cijfers zijn van de auteurs zelf.

Elk cijfer hieronder wordt gerapporteerd door de auteurs van PixelUMM in hun eigen preprint. Er is geen onafhankelijke reproductie, geen arena-Elo en geen evaluatie door derden, omdat het model hoogstens zes weken oud is en dateert van vóór enige externe testomgeving. Beschouw deze als claims met een downloadlink, niet als geverifieerde prestaties.

• Beeldbegrip — MMMU 41,67, MMStar 53,99, AI2D 80,12, DocVQA 90,42, ChartQA 82,96, OCRBench 78,00, BLINK 53,46, MMMU-Pro 27,63, volgens het officiële LMMS-Eval-protocol (64.750 generaties over 21 taken).

• Videobegrip — MVBench 70,53, Video-MME 57,33 zonder ondertitels, LongVideoBench 59,61, LVBench 40,41.

• Beeldgeneratie — GenEval algemeen 0.83 met een LLM-promptherschrijver, 0.77 zonder; DPG-Bench algemeen 85.74.

• Videogeneratie — VBench Deel 1 kwaliteitsscore 84,10, semantische score 79,80; VBench Deel 2 totaal 83,24.

De eerlijke lezing is dat dit cijfers zijn die binnen de klasse concurrerend zijn, niet categorieleidend, en de paper zegt dat zelf: er wordt opgemerkt dat, omdat trainingsdata tussen modellen verschillen, de resultaten "niet kunnen vaststellen welke architectuur superieur is". Tegenover Qwen3-VL-8B is de kloof in beeldbegrip groot op MMMU (41,67 tegen 69,60) en op MMMU-Pro, waar de auteurs geen concurrerend cijfer rapporteren. Tegenover Qwen-Image 20B bedraagt de GenEval-kloof 0,83 tot 0,87. Wat PixelUMM op basis van zijn eigen cijfers niet is, is een state-of-the-art model. Wat het op basis van zijn eigen cijfers wel is, is een 15B-model met een werkelijk ongebruikelijke architectuur die in dezelfde band terechtkomt als de gespecialiseerde systemen eromheen.

Het scherpste wapen is de licentie, niet de benchmark

De repository is Apache-2.0 en de modelkaart vermeldt dat ronduit. Het checkpoint is een ander artefact met andere voorwaarden, en dit is het detail dat een team het snelst kan verrassen. De gewichten worden geleverd onder de NVIDIA One-Way Noncommercial License, waarvan het gebruik beperkt is tot niet-commercieel onderzoek of evaluatie — een wezenlijk beperktere licentie dan de code ernaast. Eén bronbestand in de repository, modeling/pixelumm/modeling_utils.py, behoudt bovendien een CC BY-NC 4.0-kennisgeving afkomstig van DiT.

Voor een onderzoeksgroep, een evaluatieteam of iedereen die een paper publiceert, is dit een prima bruikbare licentie. Voor een productteam dat een prototype maakt van een interne functie, is het het eerste dat je aan de juridische afdeling voorlegt, en het antwoord kan nee zijn. Een model dat je niet kunt uitbrengen is een ander soort asset dan een model dat je wel kunt uitbrengen, en geen enkele mate van benchmarkpariteit verandert dat.

A headless-browser capture of the Hugging Face model card for nvidia/PixelUMM, showing the model title, the licence tag, and the repository's download and like counters.

Wat er nodig is om het te laten draaien

Dit is geen download die je even in het weekend doet. De documentatie van de omgeving vraagt om Linux x86-64, Python 3.12, een CUDA 13.0-ontwikkeltoolkit, een NVIDIA-GPU en FlashAttention dat vanaf de bron tegen die toolkit is gebouwd — een CUDA-image met alleen de runtime is niet voldoende. De checkpoint zelf is geen model.safetensors-bestand: het bestaat uit 128 .distcp-shards met een totale omvang van ongeveer 30 GB plus een verborgen .metadata-index, en de loader vereist dat elke shard waarnaar wordt verwezen en die index aanwezig zijn.

Nog twee details bepalen wat je er daadwerkelijk mee kunt doen. Ten eerste gebruikt tekst-naar-video standaard Cosmos-guardrails, en die hebben toegang nodig tot de afgeschermde nvidia/Cosmos-1.0-Guardrail-repository plus een tweede Python-omgeving met een andere hoofdversie van Transformers — alleen inloggen ontgrendelt de gewichten niet. Ten tweede: van het vierstaps toy-trainingsvoorbeeld, het enige gepubliceerde trainingsrecept, staat gedocumenteerd dat er zeven GPU's met elk minstens 48 GiB en ongeveer 61 GB vrije schijfruimte voor de uitvoer nodig zijn. Fine-tuning op een workstation is niet de bedoelde route; inferentie op één enkele moderne kaart is dat wel.

De repository bevat vier checkpoints. S8-F22-R05 is de standaard en degene die voor de evaluatie van het paper wordt gebruikt, en dekt alle vier taken. S8-F18-R01 heeft 10.000 extra fine-tuningstappen ondergaan bij 480p en 720p en geeft over het algemeen iets betere tekst-naar-video-resultaten, maar kan geen video's begrijpen. S8-F19-R03 en S8-F21-R02 zijn tussenstadia. De keuze tussen deze twee is een echte beslissing, geen detail.

Wat is niet bevestigd

Een korte lijst, en die is belangrijker dan de lange hierboven.

• Geen aankondiging van NVIDIA. Op het moment van schrijven verscheen er voor dit model geen persbericht en geen bericht op de eigen blog van het bedrijf. De stille release kan bewust zijn — onderzoeksartefacten worden vaak zo uitgebracht — of er heeft simpelweg nog geen lancering plaatsgevonden.

• Geen onafhankelijke evaluatie.Elk getal in dit artikel is van de auteurs zelf. Er is niets opnieuw uitgevoerd buiten NVIDIA en Waterloo.

• Nergens een gehoste route. Je kunt PixelUMM vandaag niet via een API aanroepen, en dat geldt ook voor OrcaRouter — wij routeren het niet, en dat kan ook niet, want een niet-commercieel gelicentieerd checkpoint is niet iets wat een commercieel platform voor het aanbieden van modellen kan leveren. Iedereen die je iets anders vertelt, beschrijft een self-hosted opzet.

• Geen aangegeven standpunt over toekomstige licentiëring. De niet-commerciële voorwaarden zijn de voorwaarden zoals geleverd. Of ze versoepeld worden, is onbekend en, gezien de geschiedenis van NVIDIA met onderzoekscheckpoints, niet iets waarop te plannen valt.

A headless-browser capture of the GitHub repository page for nv-tlabs/PixelUMM, showing the repository description “Encoder-Free Unified Image and Video Understanding and Generation” and the Apache-2.0 repository licence.

Wat om in de gaten te houden

Drie gebeurtenissen zouden PixelUMM van een onderzoeksartefact veranderen in iets dat een breder publiek kan gebruiken. De eerste is een licentiewijziging op het checkpoint — dat enkele bestand is de hele barrière tussen 'interessant' en 'bruikbaar in een product'. De tweede is een officiële lancering door NVIDIA, die gepaard zou gaan met een positionering die de repository niet kan leveren: waarvoor het model dient, en of het een productrichting of een paper is. De derde is de eerste onafhankelijke reproductie, hoogstwaarschijnlijk een herhaling van GenEval of MVBench door iemand met een GPU-cluster in reserve, en dat is het moment waarop de cijfers van de auteurs niet langer de enige cijfers zijn.

Tot die tijd is de juiste houding de houding die het bewijs ondersteunt. PixelUMM bestaat, de code en het paper zijn openbaar en leesbaar, de weights zijn te downloaden, en geen enkele prestatieclaim is gecontroleerd door iemand buiten het team dat ze heeft gedaan. Dat is geen kritiek op het werk — het is hoe een zes weken oude onderzoeksrelease eruitziet. Het is ook precies de situatie waarin een routeringslaag zich later terugverdient, als de licentie ooit versoepelt: één sleutel voor de modellen die je al vertrouwt, lijstprijzen doorgegeven tegen 0% opslag, en failover waarmee je een deel van het verkeer op iets onbewezens kunt richten zonder er een productiepad op te verwedden. Maar voor nu is de eerlijke samenvatting eenvoudiger. NVIDIA bouwde iets ongewoons, publiceerde het grondig en vertelde het aan niemand. De repository is de aankondiging.