Ett genererat titelkort i OrcaRouters husstil med texten ”NVIDIA PixelUMM”, med fyra statistikrutor: ”1 okt. 2026” (Hugging Face-repositorium skapat, noll nedladdningar), ”15,2B” (återges som ”8B MoT” i artikelns tabeller), ”0” (leverantörsmeddelanden) och ”icke-kommersiell” (checkpoint-licens; koden är Apache-2.0). En sidfotsrad lyder ”Källor: Hugging Face-modellkort · arXiv:2609.38597”. OrcaRouter-logotypen är inkomponerad i den utfyllda remsan längst ned till höger.
Engineering & Research

NVIDIA PixelUMM släpptes utan tillkännagivande – vikterna har precis landat

Författare

Rowan Sterling

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller →
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Det enklaste sättet att få reda på att NVIDIA har byggt en ny enhetlig multimodal modell är att lägga märke till att ingen berättade det för dig. nvidia/PixelUMM-repositoriet dök upp på Hugging Face kl. 21:40 UTC den 1 oktober 2026, med en checkpoint på 15,2 miljarder parametrar vars hela inlärda stack ligger ovanpå en Qwen3-8B-backbone — och det fanns inget blogginlägg, inget pressmeddelande, ingen keynote-bild och ingen lanseringstråd som hörde ihop med den. Sökningar på namnet ger inget resultat på NVIDIAs egen blogg. Det som i stället finns är ett GitHub-repositorium, en projektsida vars egen URL fortfarande säger "preview", en arXiv-förhandsutskrift numrerad 2609.38597 och en checkpoint uppdelad över 128 filer med ett dolt index som inläsaren vägrar köra utan. PixelUMM är på riktigt och går att ladda ner i dag. Huruvida NVIDIA anser att det är släppt är en fråga som företaget inte har besvarat.

Det gapet — mellan en artefakt som existerar och en leverantör som inte har sagt något — är hela historien här, och det är värt att vara precis om vilken sida av det varje faktum ligger på. Allt nedan kommer från repositoriet, modellkortet och artikeln som författarna själva publicerade. Inget kommer från ett tillkännagivande, för det fanns inget.

Vad som dök upp, och när

Trailen pågår i ungefär fyra veckor, och varje del landade tyst.

• 4 september 2026 — nv-tlabs/PixelUMM skapas på GitHub under en Apache-2.0-licens för repositoriet och beskrivs helt enkelt som "Encodarfri enhetlig förståelse och generering av bild och video". Det ligger kvar med en enda initial commit fram till slutet av september.

• 28–29 september 2026 — repots första commit landar, och arXiv tilldelar preprinten arXiv:2609.38597, daterad 29 september, med författare från NVIDIA och University of Waterloo: Cong Wei, Xuanchi Ren, Bryan Chu, Weiming Ren, Huan Ling, Jiahui Huang, Laura Leal-Taixé, Sanja Fidler, Wenhu Chen, Zian Wang och Jay Zhangjie Wu.

• 1 oktober 2026, 21:32 UTC — en sista commit till repositoriet med titeln "docs: add PixelUMM paper citation".

• 1 oktober 2026, 21:40 UTC — Hugging Face-modellarkivet skapas, åtta minuter senare, och fylls med checkpoint-shardarna.

Projektsidan ligger på en sökväg som bokstavligen lyder pixelumm-project-page-preview, och artikeln har ingen venue-rad – ingen CVPR, ingen NeurIPS, inget "accepted to". Tillsammans framstår sekvensen som ett forskningsteam som lägger ut en artefakt till artikeln live och låter HF-uppladdningen vara tillkännagivandet. Det är en iakttagelse om bevisen, inte ett påstående om avsikt: NVIDIA kan mycket väl ha en lansering planerad längre fram, och inget här utesluter det.

A headless-browser capture of the PixelUMM project page, hosted at a URL path that still reads pixelumm-project-page-preview, showing the model's title, its summary line about encoder-free unified image and video understanding and generation, and the project's task links.

Vad PixelUMM egentligen är

Designtesen anges på första raden i modellkortet: ingen VAE, ingen visionskodare. Där en konventionell enhetlig modell har två visuella gränssnitt – en vision transformer som producerar semantiska särdrag för förståelse, och en variationell autoenkodare som producerar rekonstruktionslatenter för generering – har PixelUMM inga. Bilder delas upp i 16×16-pixelpatchar; videor delas upp i spatiotemporala tubelets om 4 bilder; båda når stommen genom inget mer än enkeltskiktiga linjära projektioner. Råa pixlar går in; råa pixlar kommer ut.

• Arkitektur — en decoder-only Transformer med råpixel-patchinbäddningar och ett iterativt pixelgenereringshuvud, som i artikeln beskrivs som en Mixture-of-Transformers vilken kombinerar delad uppmärksamhet med uppgiftsspecifika parametrar.

• Stomme — Qwen3-8B, låst till revisionen b968826d9c46dd6066d109eabc6255188de91218. Endast dess konfigurations- och tokenizerfiler behövs; checkpointen bär sina egna inlärda språkvikter.

• Parametrar — 15 199 672 064 (cirka 15,2 miljarder), återgivet som "8B MoT" i artikelns egna benchmark-tabeller, där storleksbeteckningen räknar bakbonen och genereringsexperten separat.

• Mål — autoregressiv textprediktion och flödesmatchning i pixelrummet tränade gemensamt, vilket är vad som gör att en uppsättning vikter både kan besvara en fråga om en bild och rita en ny.

• Uppgifter — text-till-bild, text-till-video vid 96 bildrutor / 24 fps / 4 sekunder, bildbetingad text och videobetingad text.

Artikelns empiriska avsnitt är ovanligt på ett sätt som är värt att uppmärksamma. Åtta av dess avsnitt är studier av designval snarare än placeringar på leaderboards — bildpatchstorlek, videopatchstorlek, patchartefakter, träningsdynamik i pixelrum kontra VAE-rum, modellstorlek, skalning av beräkningskraft, multimodal kontextbetingning och gränssnitt för videoförståelse. Det är en artikel skriven av människor som försöker svara på huruvida tillvägagångssättet fungerar, inte en som försöker vinna en tabell.

Siffrorna är författarnas egna

Alla siffror nedan rapporteras av PixelUMM-författarna i deras egen preprint. Det finns ingen oberoende reproduktion, inget arena-Elo och ingen tredjepartsutvärdering, eftersom modellen är högst sex veckor gammal och föregår varje extern testrigg. Betrakta dessa som påståenden med en nedladdningslänk, inte som verifierad prestanda.

• Bildförståelse — MMMU 41.67, MMStar 53.99, AI2D 80.12, DocVQA 90.42, ChartQA 82.96, OCRBench 78.00, BLINK 53.46, MMMU-Pro 27.63, enligt det officiella LMMS-Eval-protokollet (64 750 genereringar över 21 uppgifter).

• Videoförståelse — MVBench 70.53, Video-MME 57.33 utan undertexter, LongVideoBench 59.61, LVBench 40.41.

• Bildgenerering — GenEval totalt 0,83 med en LLM-promptomskrivare, 0,77 utan en sådan; DPG-Bench totalt 85,74.

• Videogenerering — VBench del 1 kvalitetspoäng 84,10, semantisk poäng 79,80; VBench del 2 totalt 83,24.

En ärlig läsning är att detta är konkurrenskraftiga siffror inom klassen, inte klassledande, och artikeln säger det själv: den noterar att eftersom träningsdata skiljer sig mellan modeller kan resultaten "inte fastställa vilken arkitektur som är överlägsen". Mot Qwen3-VL-8B är gapet i bildförståelse stort på MMMU (41,67 mot 69,60) och på MMMU-Pro, där författarna inte rapporterar någon jämförande siffra. Mot Qwen-Image 20B är GenEval-gapet 0,83 till 0,87. Vad PixelUMM inte är, utifrån sina egna siffror, är en toppmodern modell. Vad det är, utifrån sina egna siffror, är en 15B-modell med en genuint ovanlig arkitektur som hamnar i samma band som de specialiserade systemen omkring den.

Den vassaste eggen är licensen, inte riktmärket.

Repositoriet är Apache-2.0 och modellkortet säger det rakt ut. Checkpointen är en annan artefakt med andra villkor, och det här är detaljen som med störst sannolikhet överrumplar ett team. Vikterna levereras under NVIDIA One-Way Noncommercial License, vars användning är begränsad till icke-kommersiell forskning eller utvärdering – ett väsentligt snävare medgivande än koden som ligger intill. En källfil i repositoriet, modeling/pixelumm/modeling_utils.py, behåller dessutom en CC BY-NC 4.0-notis som härrör från DiT.

För en forskargrupp, ett utvärderingsteam eller vem som helst som publicerar en artikel är detta en fullt användbar licens. För ett produktteam som prototypar en intern funktion är det det första som bör läggas fram för juridikavdelningen, och svaret kan bli nej. En modell du inte kan släppa är en annan typ av tillgång än en modell du kan, och ingen mängd benchmark-paritet ändrar på det.

A headless-browser capture of the Hugging Face model card for nvidia/PixelUMM, showing the model title, the licence tag, and the repository's download and like counters.

Vad som krävs för att köra det

Det här är inte en nedladdning för en helg. Miljödokumentationen kräver Linux x86-64, Python 3.12, ett CUDA 13.0-utvecklingsverktyg, en NVIDIA-GPU och FlashAttention byggt från källkod mot det verktyget — en CUDA-avbildning med enbart runtime räcker inte. Själva checkpointen är inte en model.safetensors-fil: den består av 128 .distcp-shards som sammanlagt uppgår till ungefär 30 GB plus ett dolt .metadata-index, och inläsaren kräver att varje refererad shard och det indexet finns.

Ytterligare två detaljer formar vad du faktiskt kan göra med det. För det första kör text-till-video Cosmos-skyddsräcken som standard, och dessa kräver åtkomst till det åtkomstbegränsade nvidia/Cosmos-1.0-Guardrail-repositoriet plus en andra Python-miljö med en annan huvudversion av Transformers — enbart en inloggning låser inte upp vikterna. För det andra dokumenteras exemplet med leksaksträning i fyra steg, det enda publicerade träningsreceptet, som att det kräver sju GPU:er med minst 48 GiB vardera och cirka 61 GB ledigt diskutrymme för utdata. Finjustering på en arbetsstation är inte den avsedda vägen; inferens på ett enda modernt grafikkort är det.

Repositoriet innehåller fyra checkpoints. S8-F22-R05 är standard och den som används för utvärderingen i artikeln, och täcker alla fyra uppgifterna. S8-F18-R01 genomgick 10 000 ytterligare finjusteringssteg vid 480p och 720p och ger i allmänhet något bättre text-till-video-resultat, men den klarar inte videoförståelse. S8-F19-R03 och S8-F21-R02 är mellanliggande stadier. Att välja mellan dem är ett verkligt beslut, inte en detalj.

Vad som inte är bekräftat

En kort lista, och den betyder mer än den långa listan ovan.

• Inget tillkännagivande från NVIDIA. Inget pressmeddelande och inget inlägg på företagets egen blogg hade dykt upp för den här modellen när detta skrevs. Den tysta lanseringen kan vara avsiktlig – forskningsartefakter släpps ofta så här – eller så kan en lansering helt enkelt ännu inte ha ägt rum.

• Ingen oberoende utvärdering. Alla siffror i den här artikeln är författarnas egna. Ingenting har körts om utanför NVIDIA och Waterloo.

• Ingen hostad rutt någonstans. Du kan inte anropa PixelUMM via ett API i dag, och det inkluderar OrcaRouter, vi routar den inte, och kan inte, eftersom en icke-kommersiellt licensierad checkpoint inte är något som en kommersiell servingplattform kan erbjuda. Den som säger något annat beskriver en självhostad installation.

• Ingen uttalad position om framtida licensiering. De icke-kommersiella villkoren är villkoren såsom de levereras. Huruvida de lättas upp är okänt och, med tanke på NVIDIAs historia med forskningscheckpoints, inget att planera utifrån.

A headless-browser capture of the GitHub repository page for nv-tlabs/PixelUMM, showing the repository description “Encoder-Free Unified Image and Video Understanding and Generation” and the Apache-2.0 repository licence.

Vad du bör hålla utkik efter härnäst

Tre händelser skulle förvandla PixelUMM från en forskningsartefakt till något som en bredare publik kan använda. Den första är en licensändring för checkpointen – den där enskilda filen utgör hela hindret mellan "intressant" och "användbar i en produkt". Den andra är en officiell NVIDIA-lansering, som skulle komma med en inramning som repot inte kan tillhandahålla: vad modellen är till för, och om det är en produktinriktning eller en artikel. Den tredje är den första oberoende reproduktionen, troligen en omkörning av GenEval eller MVBench av någon med ett ledigt GPU-kluster, och det är ögonblicket då författarnas siffror slutar vara de enda siffrorna.

Fram till dess är den korrekta hållningen den som bevisen stöder. PixelUMM finns, koden och artikeln är offentliga och läsbara, vikterna går att ladda ner, och inga av prestandapåståendena har granskats av någon utanför teamet som lade fram dem. Det är inte en kritik av arbetet – det är så en sex veckor gammal forskningsrelease ser ut. Det är också precis den situationen där ett routningslager lönar sig senare, om licensen någonsin luckras upp: en enda nyckel över de modeller du redan litar på, listpriser som förs vidare med 0 % påslag, och failover som låter dig rikta en del av trafiken mot något obeprövat utan att satsa en produktionsväg på det. Men för närvarande är den ärliga sammanfattningen enklare. NVIDIA byggde något ovanligt, publicerade det utförligt och berättade inte för någon. Repositoriet är tillkännagivandet.