
PixelUMM vs. InternLumina-U2: Zwei encoderfreie Betas und der einzige Unterschied, der den Ausschlag gibt
- openaiNEUOpenAI: GPT-6.1 Sol2026-09-2952Intelligenz
- anthropicNEUAnthropic: Claude Sonnet 5.52026-09-2856Intelligenz
- typesafeNEUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 pro 1 Mio. Tokens · 223 tok/s
- OpenAINEUOpenAI: GPT-6 Luna2026-09-2238Intelligenz
- OpenAINEUOpenAI: GPT-6 Sol2026-09-2248Intelligenz
- AnthropicNEUAnthropic: Claude Opus 5.52026-09-2258Intelligenz
- xAINEUGrok 4.72026-09-2146Intelligenz
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 pro 1 Mio. Tokens · 124 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 pro 1 Mio. Tokens · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens · 103 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens · 212 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
Zwei Modelle, beide öffentlich, beide ungewöhnlich konzipiert, und nur auf einem davon können Sie ein Produkt aufbauen. PixelUMM ist NVIDIAs encoderfreies einheitliches Modell – 15,2 Milliarden Parameter auf einem Qwen3-8B-Backbone, das rohe Pixel über 16×16-Patches und 4-Frame-Tubelets liest und schreibt, ohne VAE und ohne Vision-Encoder an irgendeiner Stelle im Stack. InternLumina-U2 ist das 16B-Mixture-of-Experts-Diffusionsmodell des Shanghai AI Laboratory, das jede visuelle Eingabe über einen Tokenizer namens AToken in acht komplementäre diskrete Codes komprimiert. Beide wetteten darauf, dass die visuelle Schnittstelle der Engpass ist. Die Wette, die mehr zählt, ist die in den Lizenzdateien: InternLumina-U2 wird mit Apache-2.0-Gewichten ausgeliefert, PixelUMM wird mit einem Checkpoint unter einer nichtkommerziellen Lizenz ausgeliefert. Wenn Sie sich zwischen ihnen für irgendetwas Kommerzielles entscheiden, ist dieser Satz der ganze Vergleich, und der Rest dieser Seite ist Kontext dafür.
Beide unten aufgeführten Zahlenreihen stammen von den Labors selbst. Keines der Modelle verfügt über eine unabhängige Bewertung, ein Arena-Elo oder eine Reproduktion durch Dritte. Keines wird über eine gehostete API angeboten. Was sich unterscheidet, ist, was du mit dem Artefakt tun darfst, sobald du es heruntergeladen hast, und wie weit jedes Release tatsächlich gediehen ist.
Wo jeder gerade steht
Die Release-Zeitpläne haben sich unterschiedlich schnell verschoben, und beide ganz im Stillen.
• PixelUMM — GitHub-Repository erstellt am 4. September 2026; arXiv-Preprint 2609.38597 vom 29. September 2026; Hugging-Face-Modell-Repository erstellt am 1. Oktober 2026 um 21:40 UTC. Dafür ist kein NVIDIA-Blogbeitrag, keine Pressemitteilung und kein Launch-Thread aufgetaucht.
• InternLumina-U2 — GitHub-Repository am 1. September 2026 erstellt; Hugging-Face-Stub am selben Tag registriert; auf Ascend trainiertes Checkpoint-Gewichte am 10. September 2026 hinzugefügt; NVIDIA/CUDA-Checkpoint-Gewichte am 24. September 2026 hinzugefügt. Sieben Shards pro Stack, beide heute herunterladbar.
Das InternLumina-U2, das Anfang September existierte – nur Code, Gewichte „demnächst verfügbar“, ein leeres Modell-Repository –, ist nicht das InternLumina-U2, das jetzt existiert. Wer zu Beginn des Monats darüber gelesen und daraus geschlossen hat, die Gewichte fehlten, sollte noch einmal nachsehen; sowohl die Huawei-Ascend- als auch die NVIDIA/CUDA-Checkpoints sind online, unter Apache-2.0, samt Tokenizer, Konfiguration, Chat-Template und Remote-Modellierungscode.

Zwei Antworten auf dieselbe Frage
Beide Modelle gehen von derselben Beschwerde aus: einen Vision-Encoder für das Verständnis und ein VAE für die Generierung mitzuführen bedeutet, jedes Bild zweimal zu repräsentieren, wodurch der visuelle Kontext ungefähr verdoppelt und eine Trainingspipeline dazu gezwungen wird, zwei Schnittstellen zu pflegen.
PixelUMMs Antwort lautet, beide zu löschen. Rohpixel gehen direkt durch einlagige lineare Projektionen hinein – ein 16×16-Patch pro Bildposition, ein 4-Frame-Tubelet pro Videoposition –, und das Backbone ist ein reiner Decoder-Transformer, dessen Mixture-of-Transformers-Design geteilte Attention mit aufgabenspezifischen Parametern kombiniert. Text wird autoregressiv vorhergesagt; Pixel werden per Flow Matching vorhergesagt. Das Paper widmet acht Abschnitte Design-Studien – Patch-Größe, Patch-Artefakte, Dynamik im Pixelraum versus im VAE-Raum, Compute-Skalierung –, was verrät, dass die eigentliche Frage des Teams war, ob das Paradigma überhaupt trägt.
InternLumina-U2s Antwort besteht darin, eine diskrete Schnittstelle beizubehalten, aber jedes Token weit mehr tragen zu lassen. Der AToken-Tokenizer beschreibt jede visuelle Position mit acht komplementären Codebüchern, die Textur, eingebetteten Text und Geometrie abdecken; die acht Embeddings werden pro Position konkateniert und in ein Backbone-Token projiziert. Die Dekodierung läuft in die andere Richtung, mit räumlich parallelem Denoising und einem autoregressiven Multi-Codebook-Kopf, der die acht Codes der Reihe nach vorhersagt. Das Backbone ist ein sparse Diffusion-LLM aus der LLaDA-2.0-Linie, insgesamt 16B mit 1B aktiv.
• Visuelle Schnittstelle — PixelUMM: rohe Pixel-Patches und Tubelets, überhaupt kein Tokenizer. InternLumina-U2: vollständig diskrete Tokens aus acht Codebüchern von AToken, kein kontinuierliches Latent.
• Backbone — PixelUMM: Qwen3-8B (insgesamt 15,2B), ein einzelner dichter Decoder mit Verstehens- und Generierungsexperten. InternLumina-U2: 16B insgesamt / 1B aktiv, Sparse-MoE-Diffusions-Sprachmodell.
• Generierungsmethode — PixelUMM: Flow-Matching im Pixelraum plus autoregressiver Text. InternLumina-U2: maskierte Diffusions-Entrauschung über diskrete Codes.
• Angegebene Aufgaben — PixelUMM: Text-zu-Bild, Text-zu-Video, Bild-zu-Text, Video-zu-Text. InternLumina-U2: diese plus Bildbearbeitung und 3D-Verständnis.
• Gewichtsformat — PixelUMM: 128 .distcp Shards (~30 GB) hinter einem versteckten .metadata-Index. InternLumina-U2: sieben .safetensors-Shards pro Hardware-Stack, Standard-Hugging-Face-Layout.

Die Anzeigetafel, mit ihrer beigefügten Provenienz
Lesen Sie jede Zeile als eine Behauptung des jeweiligen Labors. Die Angaben von PixelUMM stammen aus dessen Preprint; die von InternLumina-U2 sind die eigene Beschreibung des Labors als „vorläufig, teilweise“, wobei die vollständigen Vergleichstabellen auf einen technischen Bericht verschoben sind, der noch nicht erschienen ist.
• MMMU (Bildschlussfolgerung) — PixelUMM 41.67 (eigene Angabe der Autoren). InternLumina-U2: nicht angegeben.
• ChartQA — PixelUMM 82.96. InternLumina-U2 86.52.
• DocVQA — PixelUMM 90,42. InternLumina-U2: nicht angegeben.
• Video-MME (ohne Untertitel) — PixelUMM 57,33. InternLumina-U2 51,26.
• MVBench — PixelUMM 70,53. InternLumina-U2 59,74.
• GenEval insgesamt — PixelUMM 0,83 mit einem LLM-Prompt-Rewriter, 0,77 ohne. InternLumina-U2 0,81.
• DPG-Bench insgesamt — PixelUMM 85.74. InternLumina-U2 87.10.
• Videogenerierung — PixelUMM VBench Teil 1 Qualität 84,10 / Semantik 79,80, Teil 2 gesamt 83,24. InternLumina-U2: nicht angegeben.
• 3D-Verständnis — PixelUMM: keine solche Aufgabe. InternLumina-U2 meldet 3D MM-Vet 41.8.
Der Vergleich ist unausgewogen, weil die beiden Labs unterschiedliche Tabellen veröffentlichen, nicht weil eines gewinnt. PixelUMM hat einen vollständigen Abschnitt zur Videogenerierung und kein Editing oder 3D; InternLumina-U2 beansprucht sechs Aufgabenfamilien und berichtet eine partielle Tabelle über sie hinweg. Lab-übergreifende Zahlen unter demselben Benchmark-Namen sind nicht dieselbe Messung – Splits, Prompts und Sampling unterscheiden sich –, also betrachte die ChartQA- und GenEval-Zeilen als ungefähr gleichauf und höre dort auf.
Bei der Lizenzierung endet der Gleichstand.
Das ist der Teil, den keine Benchmark-Tabelle zeigt. Das PixelUMM-Repository steht unter Apache-2.0, und die Karte sagt das deutlich. Der Checkpoint ist ein separates Artefakt unter der NVIDIA One-Way Noncommercial License, beschränkt auf nichtkommerzielle Forschung oder Evaluierung, und eine Quelldatei behält zusätzlich einen von DiT geerbten CC BY-NC 4.0-Hinweis. Forschungseinsatz: in Ordnung. Interne Produktfunktion: ein Gespräch mit der Rechtsabteilung, und möglicherweise ein kurzes.
InternLumina-U2 ist durchgängig Apache-2.0 lizenziert, Code und beide Checkpoints, ohne gesonderte nichtkommerzielle Ausnahme. Für ein Team, das ausliefern muss, ist das kein kleiner Vorteil – es ist die gesamte Entscheidung. Beide Modelle sind in ihrer Reife Forschungsniveau. Nur eines von ihnen ist uneingeschränkt nutzbar.
Welches sollte man tatsächlich ausprobieren – und wie?
Wenn es bei Ihrer Arbeit um Videoverständnis geht oder Sie ein Modell möchten, das Video und Bilder aus einem einzigen Gewichtssatz erzeugt, ist PixelUMM das vollständigere Artefakt und sein Paper die nützlichere Lektüre – aber es ist ein Forschungsprojekt unter einer nichtkommerziellen Lizenz, also gehört es auf eine Evaluierungsbank, nicht in eine Pipeline. Wenn es bei Ihrer Arbeit um die Breite von Diagramm-, Dokument- und Bilderzeugung geht oder Sie Bearbeitung und 3D benötigen, deckt InternLumina-U2 mehr ab und hat keine Lizenzobergrenze; der Preis dafür ist, dass das 16B-A1B-Diffusions-Backbone und der AToken-Tokenizer echtes Serving-Engineering bedeuten und seine veröffentlichten Zahlen ausdrücklich unvollständig sind.
Keines der beiden ist zum jetzigen Zeitpunkt in irgendeiner gehosteten API verfügbar, und dazu gehört auch OrcaRouter — wir routen keines der beiden Modelle. Wenn sich das ändert, ist das Argument, auf sie über eine Routing-Schicht statt per direkter Integration zuzugreifen, dasselbe, das für jedes neu zugänglich gemachte Modell gilt: ein Schlüssel für 200+ Modelle, die Listenpreise der Anbieter, durchgereicht mit 0 % Aufschlag, und automatisches Failover, sodass ein Modell, das sich als schlechter erweist, als die Tabelle seines Anbieters nahelegte, herabgestuft werden kann, indem eine Route geändert wird, statt ein Deployment umzuschreiben. Bis dahin ist der ehrliche Rat der langweilige — laden Sie die Lizenz herunter, die Ihren Anwendungsfall erlaubt, führen Sie Ihre eigene Evaluierung mit Ihren eigenen Daten durch und planen Sie nicht mit den Zahlen eines der beiden Labore, bis jemand außerhalb des Labors sie erneut durchführt.
Was würde die Antwort ändern?
Drei Dinge, nach Wirkung geordnet. Eine kommerzielle Lizenz für PixelUMMs Checkpoint würde einen wirklich direkten Vergleich ermöglichen und ihn von „das Paper lesen“ zu „die Gewichte evaluieren“ verschieben. Ein technischer Bericht des Shanghai AI Laboratory mit den vollständigen Vergleichstabellen würde die nur teilweise vorliegenden Zahlen von InternLumina-U2 in etwas Überprüfbares verwandeln und außerdem zeigen, wie viel der Breite über sechs Aufgaben auf Augenhöhe beruht und wie viel auf Token-Tiefe. Und die erste unabhängige Reproduktion eines der beiden Modelle – ein GenEval- oder MVBench-Rerun durch ein Team, das kein Eigeninteresse am Ergebnis hat – ist der Moment, in dem eines von beiden keine Herstellertabelle mehr ist. Bis dahin ist das eine eine ungewöhnliche Architektur, die man nur studieren kann, und das andere eine ungewöhnliche Architektur, die man ausliefern kann.
