Eine generierte Titelkarte im OrcaRouter-Hausstil mit der Aufschrift „PixelUMM vs. Microsoft Mage-VL“, mit vier Statistik-Kacheln: „>75 %“ (die von Mage-VL angegebene Reduktion visueller Token), „3,5ד (die angegebene Wall-Clock-Beschleunigung gegenüber gleichmäßigem Frame-Sampling), „15,2B vs. 4B“ (PixelUMMs Gesamtumfang gegenüber Mage-VLs Qwen3-4B-Backbone) und „0 / 1“ (Mage-VLs Generierungsfähigkeit von null gegenüber dem einen Modell von PixelUMM, das Bilder und Video abdeckt). Eine Fußzeile lautet: „Die eigenen Zahlen beider Labore; kein unabhängiger Nachtest eines der beiden Modelle.“. Das OrcaRouter-Logo ist in den gepolsterten Streifen unten rechts eingearbeitet.
Guides & Insights

PixelUMM vs. Microsoft Mage-VL: Der eine löscht den visuellen Tokenizer, der andere schreibt ihn um.

Autor

Rowan Sterling

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen →
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Sowohl PixelUMM als auch Microsoft Mage-VL wurden von Teams entwickelt, die überzeugt waren, dass die Art und Weise, wie Vision in Tokens umgewandelt wird, der falsche Engpass ist — und sie behoben ihn in entgegengesetzte Richtungen. Mage-VL, Microsofts codec-natives Streaming-Modell, behält einen Tokenizer und macht ihn viel aggressiver: Es folgt der Struktur moderner Videocodecs, behält jeden Anker-Frame und nur die Patches der vorhergesagten Frames, bei denen der Codec Bits aufwendet, und berichtet, visuelle Tokens um mehr als 75 % zu reduzieren, während es eine bis zu 3,5-fache Beschleunigung der realen Laufzeit gegenüber gleichmäßiger Frame-Abtastung erzielt. PixelUMM, NVIDIAs encoderfreies Unified-Modell, entfernt den Tokenizer vollständig — jeder 16×16-Patch roher Pixel erreicht das Backbone durch eine einzige lineare Projektion, ohne VAE und ohne einen Vision Transformer an irgendeiner Stelle. Der eine komprimiert stärker. Der andere weigert sich, überhaupt zu komprimieren. Und nur einer von ihnen kann überhaupt etwas generieren.

Genau dieser letzte Unterschied macht diese Paarung interessanter als einen Streit über Spezifikationen. Mage-VL ist ein Beobachter – ein Streaming-Wahrnehmungsmodell mit einem proaktiven Gate, das entscheidet, wann es spricht. PixelUMM ist ein Leser, der auch zeichnet: Dieselben Gewichte beantworten Fragen zu einem Bild und generieren aus einem Text-Prompt neues Video. Sie sind zwei unvereinbare Antworten auf die Frage, „was ein einheitliches Vision-Modell sein sollte“, und jedes Labor hat seine eigenen Zahlen.

Wo die Komprimierung stattfindet

Mage-VLs Prämisse ist ein modernes Moravec-Paradoxon: Vision-Language-Modelle sind stark bei schwierigem Offline-Reasoning, aber langsam und rechenhungrig bei einfacher Echtzeit-Wahrnehmung. Seine Lösung ist die Codec-Ausrichtung. Anstatt einen Stream in gleichmäßig abgetastete Frames zu dekodieren und ein dichtes Raster durch ein eingefrorenes, web-vortrainiertes ViT zu schicken, trennt Mage-VL einen Stream in Anker-(I-)Frames und vorhergesagte (P-)Frames, behält alle Anker-Patches und behält nur die Patches der vorhergesagten Frames, die echte Bewegung oder neue Details enthalten. Der Encoder, Mage-ViT, wird von Grund auf auf einem 16×16-Patch-Raster mit 3D-Rotary-Positionskodierung trainiert und ist explizit codec-agnostisch — dieselbe Schnittstelle akzeptiert H.264/AVC- oder HEVC-Bewegungsvektoren und Restenergie oder die gelernte Rate-Map eines neuronalen Codecs, ohne Architekturänderung oder Neutraining.

PixelUMMs Prämisse ist, dass der Encoder selbst das Problem ist, nicht seine Effizienz. In seinem Paper wird argumentiert, dass Modelle wie BAGEL zwei visuelle Schnittstellen mit sich bringen – einen ViT für semantische Merkmale und einen VAE für Rekonstruktions-Latents –, was den visuellen Kontext pro Konditionierungsbild ungefähr verdoppelt und dazu führt, dass Vision-Language-Pretraining-Pipelines um einen zweiten Stream herum neu aufgebaut werden müssen. PixelUMM löscht beide: Bilder werden zu 16×16 räumlichen Patches, Videos zu 4-Frame-raumzeitlichen Tubelets, und rohe Pixel erreichen einen Decoder-only-Transformer über einlagige lineare Projektionen. Verstehen ist autoregressiver Text; Generierung ist Flow Matching im Pixelraum.

• Komprimierungsstrategie — Mage-VL: zeitlich, codec-abgeleitet; Anker beibehalten, vorhergesagte Frames ausdünnen. PixelUMM: keine; jeden Patch aus Rohpixeln beibehalten.

• Was von Grund auf trainiert wird — Mage-VL: der gesamte visuelle Stack, auf etwa 100 Mio. unbeschrifteten Bildern und Videos. PixelUMM: die Pixel-Embedder und Decoder, aufbauend auf einem Qwen3-8B-Sprach-Backbone.

• Backbone — Mage-VL: Qwen3-4B-Instruct-2507, die einzige vortrainierte Komponente, hinter einem zweischichtigen MLP-Projektor. PixelUMM: Qwen3-8B, insgesamt etwa 15,2 Mrd. Parameter.

• Streaming-Verhalten — Mage-VL: Ein Kognitions-Gate bewertet jedes rollierende Fenster und bleibt still, bis ein antwortwürdiges Ereignis abgeschlossen ist, und ruft erst dann das vollständige Modell auf. PixelUMM: kein Streaming-Modus; Anfragen sind Generierungs- oder Verständnisaufrufe.

A headless-browser capture of the Hugging Face model card for the Microsoft Mage-VL repository, showing the model title, the Apache-2.0 licence tag, and the repository's download and like counters.

Was jedes einzelne tut und was nicht

Mage-VL ist ein einzelner Checkpoint, der gleichzeitig Bild- und Videoverständnis und das proaktive Streaming-Gate bietet — dieselben Gewichte beantworten Offline-Fragen und steuern ereignisgesteuerte Kommentare. Es bündelt den Codec-Prozessor, das neuronale Codec-Paket und das Gate. Eine zweite Veröffentlichung, microsoft/Mage-ViT, ist der eigenständige visuelle Encoder aus der Pretraining-Phase von Grund auf, angeboten als Drop-in-Frontend für andere multimodale Trainings. Was Mage-VL nicht tut, ist generieren. Es liest.

PixelUMM deckt Text-zu-Bild, Text-zu-Video mit 96 Frames und 24 fps sowie bild- und videokonditionierten Text ab. Es liefert vier Checkpoints — S8-F22-R05 als Standard, der alle vier Aufgaben abdeckt, S8-F18-R01 abgestimmt auf besseres Text-zu-Video bei 480p und 720p, aber nicht zu Video-Verständnis fähig, und zwei Zwischenstufen. Was es nicht kann, ist Streaming, Editing oder 3D. Wenn Sie ein Modell brauchen, das einen Live-Feed beobachtet und spricht, wenn etwas passiert, ist PixelUMM völlig die falsche Form, und keine Benchmark-Spalte wird Ihnen das sagen.

Die Adoptionslücke ist das erste ehrliche Signal.

Die beiden Releases sind nicht gleich ausgereift, und die Download-Zähler sagen das deutlicher als jeder Launch-Post.

• Mage-VL — am 25. Juli 2026 unter Apache-2.0 auf Hugging Face veröffentlicht, zusammen mit einem begleitenden Tech Report und einer arXiv-Kennung. Bis Anfang Oktober verzeichnete es rund 13.800 Downloads und 414 Likes, und rundherum war ein kleines Ökosystem aus Arbeiten der Community entstanden.

• PixelUMM — veröffentlicht auf Hugging Face am 1. Oktober 2026 unter einer nichtkommerziellen Checkpoint-Lizenz. Sein Download-Zähler stand bei null und sein Like-Zähler bei drei, als dies geschrieben wurde. Es ist erst wenige Tage alt.

Es gibt nach wie vor von keinem der beiden Labore eine Ankündigung für die jeweilige Veröffentlichung – Mage-VL wurde im Juli ohne eine solche veröffentlicht, und PixelUMM wurde im Oktober ohne eine solche veröffentlicht. Diese Symmetrie ist real, aber es wäre ein Fehler, sie so zu deuten, dass die beiden gleichwertige Artefakte seien. Mage-VL hat zehn Wochen lang Aufmerksamkeit der Community erhalten; PixelUMM hat erst seit Tagen Aufmerksamkeit. Ein Modell, das niemand außerhalb des Labors ausgeführt hat, ist etwas anderes als ein Modell, das ein paar tausend Menschen heruntergeladen haben, und nur eines der beiden fällt in die zweite Kategorie.

A generated scoreboard card titled “PixelUMM vs Microsoft Mage-VL — the scoreboard”, with the two model names as column headings and six dimension rows spanning both columns: visual tokenizer, backbone, trained from scratch, streaming, generation and licence. Mage-VL's column shows a codec-native sparse token grid, a Qwen3-4B-Instruct-2507 backbone, a Mage-ViT pretrained from scratch on about 100M unlabeled media, proactive streaming with a cognition gate, no generation, and Apache-2.0; PixelUMM's column shows no tokenizer at all, a Qwen3-8B backbone at 15.2B total, pixel embedders and decoders trained on top of it, no streaming mode, text-to-image and text-to-video plus understanding, and a noncommercial checkpoint licence. A footer notes that the figures are vendor-reported with no independent rerun.

Die Anzeigetafel, mit Provenienz

Jede Zahl stammt vom entwickelnden Labor selbst. Die von Mage-VL stammen aus Microsofts Model Card und Tech Report; die von PixelUMM aus dessen Preprint. Weder die einen noch die anderen wurden unabhängig reproduziert.

• Visuelle Tokens — Mage-VL: berichtete Reduktion von über 75 % gegenüber dichtem Frame-Sampling. PixelUMM: keine Reduktion; das Argument ist, dass rohe Patches eine zweite Kodierung entfernen, statt die erste zu verkleinern.

• Reale Geschwindigkeit — Mage-VL: bis zu 3,5× schneller als uniformes Frame-Sampling bei vergleichbarer Genauigkeit, laut Microsoft-Bericht. PixelUMM: keine vergleichende Geschwindigkeitsaussage im Paper.

• Encoder-Qualität — Mage-VL: Mage-ViT erreicht 99,33 % auf CIFAR-10 und 85,69 % auf ImageNet bei einem Budget von 256 Token, aus etwa 100 Mio. unbeschrifteten Medien. PixelUMM: kein vergleichbarer Encoder-Benchmark, da es keinen Encoder zum Benchmarken gibt.

• Videoverständnis — Mage-VL: gemeldete Zugewinne gegenüber Qwen3-VL-4B bei jedem von ihm berichteten Video- und Temporal-Grounding-Benchmark, einschließlich +22,5 bei QVHighlight und +17,1 bei ActivityNet. PixelUMM: MVBench 70,53, Video-MME 57,33 ohne Untertitel, LongVideoBench 59,61, LVBench 40,41.

• Bildverständnis — Mage-VL: bei statischen Bildern auf Augenhöhe mit Qwen3-VL-4B, laut Microsoft. PixelUMM: MMMU 41,67, AI2D 80,12, DocVQA 90,42, ChartQA 82,96.

• Generierung — Mage-VL: keine. PixelUMM: GenEval insgesamt 0,83 mit einem Prompt-Rewriter, DPG-Bench 85,74, VBench Teil 1 Qualität 84,10.

• Streaming — Mage-VL: proaktives Event-Gating mit gemeldeten Spitzenwerten für TimVal, F1, ROC-AUC und PR-AUC auf SoccerNet-Streaming. PixelUMM: nicht unterstützt.

• Lizenz — Mage-VL: Apache-2.0, Code und Gewichte. PixelUMM: Apache-2.0-Code, NVIDIA One-Way Noncommercial License für den Checkpoint.

Die beiden Spalten überschneiden sich nicht genug, um eine Rangfolge zu bilden. Mage-VL berichtet von einem effizienten Encoder, der einen gleich großen Konkurrenten übertrifft; PixelUMM berichtet, dass ein 15B-Modell im selben Bereich landet wie die Spezialsysteme um es herum, und sagt in seinem eigenen Paper unumwunden, dass unterschiedliche Trainingsdaten bedeuten, dass die Ergebnisse „nicht feststellen können, welche Architektur überlegen ist“.

Die praktische Aufteilung

Wählen Sie nach Aufgabe, nicht nach Punktzahl. Wenn Sie Echtzeit-Videowahrnehmung bauen – einen Monitor, der einen Stream beobachtet und kommentiert, wenn etwas passiert, wobei die Token-Kosten die bindende Einschränkung sind –, ist Mage-VL das einzige der beiden, das das tut, es ist Apache-2.0, und seine Größe in der 4B-Klasse bedeutet, dass ein einzelner Knoten ihn bedienen kann. Wenn Sie ein Modell brauchen, das Bilder und Videos liest und sie auch generiert, ist PixelUMM das einzige der beiden, das das tut, aber es ist ein Forschungsartefakt unter einer nichtkommerziellen Lizenz, seine Gewichte sind 128 Shards verteilter Checkpoints hinter einem versteckten Index, und Text-zu-Video läuft standardmäßig unter Cosmos-Guardrails, mit einer separaten Python-Umgebung für das Gate.

Für ein Team, das beide Fähigkeiten benötigt, ist das Argument, sie über eine einzige Routing-Schicht statt über zwei direkte Integrationen zu erreichen, einleuchtend, auch wenn derzeit keine der beiden gehostet wird: ein einziger Schlüssel, Anbieter-Listenpreise, die mit 0 % Aufschlag weitergegeben werden, und Failover-Regeln, mit denen Sie ein neu veröffentlichtes Apache-2.0-Modell vor einen Teil des Datenverkehrs setzen können, während das bewährte Modell den Rest übernimmt. OrcaRouter ist für genau diese Art von Problem gebaut — und um es deutlich zu sagen, wir routen derzeit weder PixelUMM noch Mage-VL, dies ist also eine Beschreibung des Workflows, keine Auflistung.

Was würde es klären

Zwei Ereignisse sind von Bedeutung. Das erste ist ein unabhängiger erneuter Lauf der Encoder-Zahlen von Mage-ViT oder der Videoergebnisse von Mage-VL durch jemanden, der kein Eigeninteresse daran hat – zehn Wochen Downloads haben bisher noch keinen hervorgebracht. Das zweite ist jede Änderung an der Checkpoint-Lizenz von PixelUMM, die der einzige Umstand ist, der derzeit ein Forschungsartefakt von einem einsatzfähigen unterscheidet. Bis eines von beiden eintritt, ist das Nützlichste, was man über dieses Paar sagen kann, dass Microsoft darauf gewettet hat, die visuelle Schnittstelle günstiger zu machen, und NVIDIA darauf, sie zu entfernen, und keine der beiden Wetten wurde von jemandem außerhalb des Labors bewertet, das sie platziert hat.