
NVIDIA PixelUMM wurde ohne Ankündigung veröffentlicht – die Gewichte sind gerade eingetroffen
- openaiNEUOpenAI: GPT-6.1 Sol2026-09-2952Intelligenz
- anthropicNEUAnthropic: Claude Sonnet 5.52026-09-2856Intelligenz
- typesafeNEUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 pro 1 Mio. Tokens · 223 tok/s
- OpenAINEUOpenAI: GPT-6 Luna2026-09-2238Intelligenz
- OpenAINEUOpenAI: GPT-6 Sol2026-09-2248Intelligenz
- AnthropicNEUAnthropic: Claude Opus 5.52026-09-2258Intelligenz
- xAINEUGrok 4.72026-09-2146Intelligenz
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 pro 1 Mio. Tokens · 124 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 pro 1 Mio. Tokens · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens · 103 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens · 212 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
Der einfachste Weg herauszufinden, dass NVIDIA ein neues vereinheitlichtes multimodales Modell gebaut hat, ist zu bemerken, dass es einem niemand gesagt hat.nvidia/PixelUMM Repository erschien am 1. Oktober 2026 um 21:40 UTC auf Hugging Face und enthielt einen Checkpoint mit 15,2 Milliarden Parametern, dessen gesamter gelernter Stack auf einem Qwen3-8B-Backbone aufsetzt — und es gab dazu keinen Blogbeitrag, keine Pressemitteilung, keine Keynote-Folie und keinen Launch-Thread. Suchen nach dem Namen ergeben nichts auf NVIDIAs eigenem Blog. Was stattdessen existiert, ist ein GitHub-Repository, eine Projektseite, deren eigene URL immer noch „preview“ lautet, ein arXiv-Preprint mit der Nummer 2609.38597 und ein Checkpoint, der über 128 Dateien aufgeteilt ist, mit einem versteckten Index, ohne den der Loader sich weigert zu starten. PixelUMM ist real und heute herunterladbar. Ob NVIDIA es als veröffentlicht betrachtet, ist eine Frage, die das Unternehmen nicht beantwortet hat.
Diese Lücke – zwischen einem Artefakt, das existiert, und einem Anbieter, der nichts gesagt hat – ist die ganze Geschichte hier, und es lohnt sich, genau zu sein, auf welcher Seite davon die einzelnen Fakten liegen. Alles Folgende stammt aus dem Repository, der Model Card und dem Paper, das die Autoren selbst veröffentlicht haben. Nichts stammt aus einer Ankündigung, denn es gab keine.
Was erschien, und wann
Der Trail dauert etwa vier Wochen, und jedes Stück kam leise an.
• 4. September 2026 — nv-tlabs/PixelUMM wird auf GitHub unter einer Apache-2.0-Repository-Lizenz erstellt, schlicht beschrieben als „Encoder-Free Unified Image and Video Understanding and Generation“. Bis Ende September steht es mit einem einzigen ersten Commit da.
• 28.–29. September 2026 — der erste Commit des Repositorys erfolgt, und arXiv weist dem Preprint die Nummer arXiv:2609.38597 zu, datiert auf den 29. September, mit Autoren von NVIDIA und der University of Waterloo: Cong Wei, Xuanchi Ren, Bryan Chu, Weiming Ren, Huan Ling, Jiahui Huang, Laura Leal-Taixé, Sanja Fidler, Wenhu Chen, Zian Wang und Jay Zhangjie Wu.
• 1. Oktober 2026, 21:32 UTC — ein letzter Commit zum Repository mit dem Titel „docs: add PixelUMM paper citation“.
• 1. Oktober 2026, 21:40 UTC — das Hugging Face-Modell-Repository wird erstellt und füllt sich acht Minuten später mit den Checkpoint-Shards.
Die Projektseite liegt unter einem Pfad, der wörtlich pixelumm-project-page-preview lautet, und das Paper trägt keine Venue-Zeile – kein CVPR, kein NeurIPS, kein „accepted to“. Zusammengenommen liest sich die Abfolge so, als würde ein Forschungsteam ein Paper-Artefakt live schalten und den HF-Upload zur Ankündigung machen. Das ist eine Beobachtung der Beweislage, keine Aussage über die Absicht: NVIDIA könnte durchaus einen Launch für später geplant haben, und nichts hier schließt das aus.

Was PixelUMM eigentlich ist
Die Design-These steht in der ersten Zeile der Modellkarte: kein VAE, kein Vision-Encoder. Während ein konventionelles einheitliches Modell zwei visuelle Schnittstellen trägt – einen Vision-Transformer, der semantische Merkmale für das Verstehen erzeugt, und einen variationalen Autoencoder, der Rekonstruktions-Latenten für die Generierung erzeugt –, trägt PixelUMM keine. Bilder werden in 16×16 Pixel große Patches zerschnitten; Videos werden in raumzeitliche 4-Frame-Tubelets zerschnitten; beide erreichen das Backbone durch nichts weiter als einlagige lineare Projektionen. Rohpixel gehen hinein; Rohpixel kommen heraus.
• Architektur — Decoder-only-Transformer mit Patch-Einbettungen aus Rohpixeln und einem iterativen Pixelgenerierungs-Head, im Paper beschrieben als Mixture-of-Transformers, das geteilte Attention mit aufgabenspezifischen Parametern kombiniert.
• Backbone — Qwen3-8B, festgeschrieben auf Revision b968826d9c46dd6066d109eabc6255188de91218. Es werden nur seine Konfigurations- und Tokenizer-Dateien benötigt; der Checkpoint enthält seine eigenen erlernten Sprachgewichte.
• Parameter — 15.199.672.064 (etwa 15,2 Mrd.), in den Benchmark-Tabellen der Arbeit selbst als „8B MoT“ angegeben, wobei die Größenangabe das Backbone und den Generation-Experten getrennt zählt.
• Ziele — autoregressive Textvorhersage und Flow-Matching im Pixelraum, gemeinsam trainiert, wodurch ein und derselbe Satz Gewichte sowohl eine Frage zu einem Bild beantworten als auch ein neues zeichnen kann.
• Aufgaben — Text-zu-Bild, Text-zu-Video mit 96 Frames / 24 fps / 4 Sekunden, bildkonditionierter Text und videokonditionierter Text.
Der empirische Teil des Papers ist auf eine Weise ungewöhnlich, die es wert ist, hervorgehoben zu werden. Acht seiner Abschnitte sind Untersuchungen von Designentscheidungen statt von Platzierungen in Bestenlisten – Bild-Patch-Größe, Video-Patch-Größe, Patch-Artefakte, Trainingsdynamik im Pixelraum versus VAE-Raum, Modellgröße, Compute-Skalierung, multimodale Kontextkonditionierung und Schnittstellen für Videoverständnis. Das ist ein Paper, das von Leuten geschrieben wurde, die beantworten wollen, ob der Ansatz funktioniert, nicht eines, das versucht, eine Tabelle zu gewinnen.
Die Zahlen sind die eigenen der Autoren
Jede Zahl unten wird von den PixelUMM-Autoren in ihrem eigenen Preprint angegeben. Es gibt keine unabhängige Reproduktion, kein Arena-Elo und keine Bewertung durch Dritte, denn das Modell ist höchstens sechs Wochen alt und existierte bereits, bevor es irgendeine externe Testumgebung gab. Betrachten Sie diese als Behauptungen samt Download-Link, nicht als verifizierte Leistung.
• Bildverständnis — MMMU 41,67, MMStar 53,99, AI2D 80,12, DocVQA 90,42, ChartQA 82,96, OCRBench 78,00, BLINK 53,46, MMMU-Pro 27,63, über das offizielle LMMS-Eval-Protokoll (64.750 Generierungen über 21 Aufgaben hinweg).
• Videoverständnis — MVBench 70.53, Video-MME 57.33 ohne Untertitel, LongVideoBench 59.61, LVBench 40.41.
• Bildgenerierung — GenEval insgesamt 0,83 mit einem LLM-Prompt-Rewriter, 0,77 ohne einen solchen; DPG-Bench insgesamt 85,74.
• Videogenerierung — VBench Teil 1 Qualitätswert 84,10, Semantikwert 79,80; VBench Teil 2 Gesamt 83,24.
Die ehrliche Lesart ist, dass dies Zahlen sind, die innerhalb ihrer Klasse wettbewerbsfähig sind, nicht solche, die die Kategorie anführen, und das Paper sagt das selbst: Es merkt an, dass die Ergebnisse, weil sich die Trainingsdaten zwischen den Modellen unterscheiden, „nicht feststellen können, welche Architektur überlegen ist“. Gegenüber Qwen3-VL-8B ist die Bildverständnislücke bei MMMU groß (41,67 gegenüber 69,60) und bei MMMU-Pro, wo die Autoren keine Vergleichszahl angeben. Gegenüber Qwen-Image 20B beträgt die GenEval-Lücke 0,83 zu 0,87. Was PixelUMM, gemessen an seinen eigenen Zahlen, nicht ist, ist ein State-of-the-Art-Modell. Was es, gemessen an seinen eigenen Zahlen, ist, ist ein 15B-Modell mit einer wirklich ungewöhnlichen Architektur, das im selben Bereich landet wie die spezialisierten Systeme um es herum.
Die schärfste Kante ist die Lizenz, nicht der Benchmark
Das Repository steht unter Apache-2.0, und die Modellkarte gibt das unmissverständlich an. Der Checkpoint ist ein anderes Artefakt mit anderen Bedingungen, und genau dieses Detail dürfte ein Team am ehesten überraschen. Die Gewichte werden unter der NVIDIA One-Way Noncommercial License ausgeliefert, deren Nutzung auf nichtkommerzielle Forschung oder Evaluierung beschränkt ist — eine wesentlich engere Rechtseinräumung als der danebenliegende Code. Eine Quelldatei im Repository, modeling/pixelumm/modeling_utils.py, behält zusätzlich einen von DiT abgeleiteten CC BY-NC 4.0-Hinweis.
Für eine Forschungsgruppe, ein Evaluationsteam oder alle, die ein Paper veröffentlichen, ist dies eine vollkommen brauchbare Lizenz. Für ein Produktteam, das eine interne Funktion prototypisch entwickelt, ist sie das Erste, was man der Rechtsabteilung vorlegt, und die Antwort kann Nein lauten. Ein Modell, das man nicht ausliefern kann, ist eine andere Art von Asset als ein Modell, das man ausliefern kann, und keine noch so große Benchmark-Parität ändert daran etwas.

Was es braucht, um es zu betreiben
Das ist kein Wochenend-Download. Die Umgebungsdokumentation verlangt Linux x86-64, Python 3.12, ein CUDA 13.0-Entwicklungs-Toolkit, eine NVIDIA-GPU und ein aus dem Quellcode gegen dieses Toolkit gebautes FlashAttention – ein reines CUDA-Laufzeit-Image genügt dafür nicht. Der Checkpoint selbst ist keine model.safetensors-Datei: Er besteht aus 128 .distcp-Shards mit insgesamt rund 30 GB sowie einem versteckten .metadata-Index, und der Loader setzt voraus, dass jeder referenzierte Shard und dieser Index vorhanden sind.
Zwei weitere Details bestimmen, was man damit tatsächlich anfangen kann. Erstens verwendet Text-zu-Video standardmäßig die Cosmos-Guardrails, und diese benötigen Zugriff auf das zugangsbeschränkte Repository nvidia/Cosmos-1.0-Guardrail sowie eine zweite Python-Umgebung mit einer anderen Transformers-Hauptversion – ein bloßes Anmelden schaltet die Gewichte nicht frei. Zweitens benötigt das vierstufige Toy-Trainingsbeispiel, das einzige veröffentlichte Trainingsrezept, laut Dokumentation sieben GPUs mit mindestens 48 GiB jeweils und etwa 61 GB freien Speicherplatz für die Ausgabe. Fine-Tuning auf einer Workstation ist nicht der vorgesehene Weg; Inferenz auf einer einzelnen modernen Karte ist es.
Das Repository wird mit vier Checkpoints ausgeliefert. S8-F22-R05 ist der Standard und derjenige, der für die Evaluierung des Papers verwendet wird; er deckt alle vier Aufgaben ab. S8-F18-R01 durchlief 10.000 zusätzliche Fine-Tuning-Schritte bei 480p und 720p und liefert im Allgemeinen etwas bessere Text-zu-Video-Ergebnisse, kann aber kein Videoverständnis durchführen. S8-F19-R03 und S8-F21-R02 sind Zwischenstufen. Die Wahl zwischen ihnen ist eine echte Entscheidung, kein Detail.
Was ist nicht bestätigt?
Eine kurze Liste, und sie ist wichtiger als die lange oben.
• Keine Ankündigung von NVIDIA. Zum Zeitpunkt des Verfassens dieses Textes ist für dieses Modell weder eine Pressemitteilung noch ein Beitrag im firmeneigenen Blog aufgetaucht. Die leise Veröffentlichung könnte bewusst erfolgen – Forschungsartefakte werden oft so veröffentlicht – oder ein Launch hat vielleicht einfach noch nicht stattgefunden.
• Keine unabhängige Bewertung.Jede Zahl in diesem Artikel stammt von den Autoren selbst. Nichts wurde außerhalb von NVIDIA und Waterloo erneut durchgeführt.
• Keine gehostete Route, nirgends. Du kannst PixelUMM heute nicht über eine API aufrufen, und das schließt OrcaRouter ein — wir routen es nicht, und können es auch nicht, denn ein nichtkommerziell lizenzierter Checkpoint ist nichts, was eine kommerzielle Serving-Plattform anbieten kann. Wer dir etwas anderes erzählt, beschreibt ein selbst gehostetes Setup.
• Keine angegebene Position zur künftigen Lizenzierung. Die nichtkommerziellen Bedingungen sind die Bedingungen, wie sie ausgeliefert werden. Ob sie gelockert werden, ist unbekannt und angesichts von NVIDIAs Geschichte mit Forschungs-Checkpoints nichts, worauf man planen sollte.

Worauf als Nächstes zu achten ist
Drei Ereignisse würden PixelUMM von einem Forschungsartefakt in etwas verwandeln, das ein breiteres Publikum nutzen kann. Das erste ist eine Lizenzänderung am Checkpoint – diese einzelne Datei ist die gesamte Hürde zwischen „interessant“ und „in einem Produkt nutzbar“. Das zweite ist ein offizieller NVIDIA-Launch, der mit einer Rahmung einherginge, die das Repository nicht liefern kann: wofür das Modell gedacht ist und ob es eine Produktrichtung oder ein Paper ist. Das dritte ist die erste unabhängige Reproduktion, höchstwahrscheinlich ein erneuter GenEval- oder MVBench-Durchlauf von jemandem mit einem ungenutzten GPU-Cluster, und das ist der Moment, in dem die Zahlen der Autoren aufhören, die einzigen Zahlen zu sein.
Bis dahin ist die richtige Haltung diejenige, die die Belege stützen. PixelUMM existiert, der Code und das Paper sind öffentlich und lesbar, die Gewichte lassen sich herunterladen, und keine der Leistungsbehauptungen wurde von jemandem außerhalb des Teams überprüft, das sie aufgestellt hat. Das ist keine Kritik an der Arbeit – so sieht ein sechs Wochen alter Research-Drop aus. Es ist außerdem genau die Situation, in der sich eine Routing-Schicht später bezahlt macht, falls die Lizenz jemals gelockert wird: ein Schlüssel für die Modelle, denen Sie bereits vertrauen, Listenpreise mit 0 % Aufschlag weitergegeben und Failover, mit dem Sie einen Teil des Verkehrs auf etwas Unbewiesenes lenken können, ohne einen Produktionspfad darauf zu verwetten. Doch für den Moment ist die ehrliche Zusammenfassung einfacher. NVIDIA hat etwas Ungewöhnliches gebaut, es gründlich veröffentlicht und niemandem davon erzählt. Das Repository ist die Ankündigung.
