Eine generierte Titelkarte im OrcaRouter-Hausstil mit der Aufschrift „PixelUMM vs. North Micro Vision Instruct“, mit vier Statistik-Kacheln: „2.4B“ (die Gesamtparameter von North Micro Vision Instruct), „~180k“ (seine Hugging-Face-Downloads bis Anfang Oktober), „0.921 / 90.42“ (sein DocVQA als Genauigkeitsbruch im Vergleich zu PixelUMMs Prozentwert) und „Apache-2.0“ (seine Lizenz für Code und Gewichte, im Gegensatz zu PixelUMMs nichtkommerziellem Checkpoint). Eine Fußzeile lautet: „Vom Anbieter gemeldete Zahlen; kein unabhängiger erneuter Durchlauf eines der beiden Modelle.“ Das OrcaRouter-Logo ist in den gepolsterten Streifen unten rechts eingefügt.
Guides & Insights

PixelUMM vs. North Micro Vision Instruct: Ein nichtkommerzielles Forschungsmodell gegen einen 2,4B-Reader, den Sie ausliefern können

Autor

Alistair Wren

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen →
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Stellen Sie North Micro Vision Instruct und PixelUMM nebeneinander, und der Größenunterschied ist fast eine Ablenkung: 2,4 Milliarden Parameter für Coheres Reader mit nativer Auflösung gegenüber 15,2 Milliarden für NVIDIAs Unified-Modell. Die interessante Achse ist der Encoder. North Micro Vision Instruct ist auf konventionelle Weise gebaut – ein 400M-Vision-Encoder, initialisiert aus SigLIP 2 SO400M, der ein 2B-Sprachmodell speist, verpackt in ein Vokabular mit 262.144 Tokens und unter Apache-2.0 ausgeliefert. PixelUMM basiert auf dem Argument, dass genau diese Anordnung der Engpass ist, und lässt den Encoder weg: rohe 16×16-Pixel-Patches gehen über einlagige lineare Projektionen in ein Qwen3-8B-Backbone, und dieselben Gewichte generieren Videos und beantworten auch Fragen dazu. Das eine ist ein spezialisiertes Lesegerät, das Sie heute herunterladen und einsetzen können. Das andere ist eine Forschungsabhandlung mit Download-Link und einer Lizenz, die es aus Produkten heraushält.

Die unten stehenden Zahlen beider Modelle stammen aus ihren eigenen Labors. Keines der beiden wurde unabhängig reproduziert, und die beiden veröffentlichen unterschiedliche Benchmark-Suiten, sodass die Überschneidung geringer ist, als es den Anschein hat.

Das Plädoyer für die langweilige Architektur

North Micro Vision Instruct wurde am 10. August 2026 auf Hugging Face veröffentlicht, hatte acht Wochen Zeit, Nutzer zu gewinnen, und verzeichnete Anfang Oktober rund 180.000 Downloads und 150 Likes – eine Größenordnung mehr Aufmerksamkeit als das erst wenige Tage alte Repository von PixelUMM. Sein Pitch ist konkret und unspektakulär: Die meisten Vision-Modelle skalieren ein Bild auf ein festes Raster herunter und verlieren dabei die feinen Details, von denen Dokumente leben, deshalb verarbeitet dieses Bilder in nativer Auflösung und bewahrt dabei das Seitenverhältnis sowie kleine Schrift.

• Parameter — insgesamt 2,4B: ein 2B-Sprachmodell plus ein 400M-Vision-Encoder, der individuell aus SigLIP 2 SO400M trainiert wurde.

• Kontext — ein Sprach-Backbone mit 128K Token, aber ein validierter multimodaler Betriebsbereich von etwa 8K Token. Die Modellkarte sagt ausdrücklich, dass längere multimodale Kontexte auf Extrapolation angewiesen sind und nicht durch Benchmarks geprüft wurden.

• Eingaben und Ausgaben — abwechselnd Text und Bilder als Eingabe, Text als Ausgabe. Mehrsprachig in über elf Sprachen. Keinerlei Generierung.

• Gemeldete Werte — DocVQA 0,921, ChartQA 0,808, OCRBench 0,792, alle von Cohere gemeldet und nicht reproduziert. MMMU 0,329, was die Karte nicht verschweigt: Dies ist ein Lesespezialist, kein Generalist für logisches Schlussfolgern.

• Bereitstellung — Transformers 5.16.0 und ein Beschleuniger, eine einzelne moderne GPU bei 2,4B in bfloat16, Flash Attention 2 optional statt erforderlich.

Nichts an diesem Design ist neuartig. Es ist auch der Grund dafür, dass es diese Woche heruntergeladen, feinabgestimmt und vor echte Dokumente gestellt werden kann.

A headless-browser capture of the Hugging Face model card for the North Micro Vision Instruct repository, showing the model title, the Apache-2.0 licence tag, and the repository's download and like counters.

Die Argumente dagegen, vorgebracht von der anderen Seite

PixelUMMs Preprint beginnt damit, die Kosten dieser Architektur zu benennen. Ein eingefrorener, im Web vortrainierter Vision Transformer liefert semantische Merkmale für das Verständnis; ein separates VAE liefert rekonstruktionsorientierte latente Repräsentationen für die Generierung; das Mitführen beider verdoppelt den visuellen Kontext pro Konditionierungsbild ungefähr und zwingt dazu, Vision-Language-Pretraining-Pipelines um einen zweiten Stream herum neu aufzubauen. North Micro Vision Instruct vermeidet die Verdopplung nur, indem es die zweite Aufgabe vollständig ablehnt – es generiert nicht, benötigt also eine Schnittstelle, nicht zwei.

PixelUMM führt das Argument konsequent zu Ende. Kein Encoder, kein VAE, kein Tokenizer: 16×16 Pixel-Patches für Bilder, 4-Frame-raumzeitliche Tubelets für Video, beide erreichen einen Decoder-only-Transformer über einlagige lineare Projektionen, mit Verständnis durch autoregressiven Text und Generierung durch Flow Matching im Pixelraum. Seine acht empirischen Abschnitte sind Studien zu Designentscheidungen statt Bestenlisten-Siegen – Patchgröße, Patch-Artefakte, Trainingsdynamik im Pixelraum versus VAE-Raum, Compute-Skalierung –, was ein Paper ist, das fragt, ob das Paradigma Bestand hat, und nicht eines, das behauptet, es habe bereits gewonnen.

• Visueller Pfad — North Micro Vision Instruct: 400M vortrainierter Vision-Encoder bei nativer Auflösung. PixelUMM: kein Encoder; rohe Patches durch eine lineare Projektion.

• Was es kann — North Micro Vision Instruct: Bilder und Dokumente lesen, in Text antworten, verankern und beschriften. PixelUMM: Bilder und Videos lesen sowie Bilder und 4-Sekunden-Videos aus Text generieren.

• Skalierung — 2,4B dense gegenüber etwa 15,2B insgesamt auf einem Qwen3-8B-Backbone, in den eigenen Tabellen des Papers als „8B MoT“ dargestellt.

• Lizenz — Apache-2.0 für Code und Gewichte gegenüber Apache-2.0 für Code mit der NVIDIA One-Way Noncommercial License für den Checkpoint.

A generated scoreboard card titled “PixelUMM vs North Micro Vision Instruct — the scoreboard”, with the two model names as column headings and six dimension rows spanning both columns: parameters, visual path, inputs and outputs, DocVQA, MMMU and licence. North Micro Vision Instruct's column shows 2.4B total, a 400M SigLIP 2 SO400M vision encoder at native resolution, interleaved text and images in with text out, DocVQA 0.921, MMMU 0.329 and Apache-2.0; PixelUMM's column shows about 15.2B total, no encoder with raw patches through a linear projection, image and video reading plus image and video generation, DocVQA 90.42, MMMU 41.67 and a noncommercial checkpoint licence. A footer notes that the figures are vendor-reported with no independent rerun.

Die zwei Anzeigetafeln ehrlich lesen

Die beiden Modelle veröffentlichen unterschiedliche Benchmarks, und wo sie sich überschneiden, unterscheiden sich die Skalen.

• DocVQA — North Micro Vision Instruct 0,921 als Genauigkeitsbruch. PixelUMM 90,42 als Prozentsatz. Gleicher Benchmark-Name, unterschiedliche Splits und Prompt-Setups, und nur einer der beiden führt die Verarbeitung in nativer Auflösung als Grund an.

• ChartQA — North Micro Vision Instruct 0.808. PixelUMM 82.96. Wieder ungefähr derselbe Bereich, sobald man aufhört, die Rohstrings zu vergleichen.

• OCRBench — North Micro Vision Instruct 0.792. PixelUMM 78.00.

• MMMU — North Micro Vision Instruct 0.329, PixelUMM 41.67. Beide niedrig nach den Maßstäben großer Vision-Language-Modelle, und beide Labore berichten sie ohne Ausschmückung.

• PixelUMM-only — MVBench 70,53, Video-MME 57,33, LongVideoBench 59,61, GenEval 0,83 mit einem Prompt-Rewriter, VBench Teil 1 Qualität 84,10.

• North Micro Vision Instruct-only — Grounding-, Captioning- und Multi-Image-Aufgaben; eine dokumentierte Abwesenheit von Tool-Calling und ausdrücklich kein agentisches Verhalten.

Das Auffällige an der Überlappung ist, wie nah ein 2,4B-Spezialist an einen 15,2B-Generalisten beim Lesen von Dokumenten und Diagrammen herankommt. Das ist kein Beleg dafür, dass der encoderfreie Ansatz scheitert – es ist ein Beleg dafür, dass das Lesen von Dokumenten eine Aufgabe ist, für die ein kompakter Encoder mit nativer Auflösung sehr gut geeignet ist, und die Architektur von PixelUMM zielt auf ein anderes Argument ab. Der Aufsatz von PixelUMM selbst räumt diesen Punkt in einem Satz ein, den es sich zu zitieren lohnt: Weil sich die Trainingsdaten zwischen den Modellen unterscheiden, können seine Ergebnisse „nicht feststellen, welche Architektur überlegen ist“.

Wo die Entscheidung tatsächlich landet

Wenn Sie Dokumente, Diagramme, Formulare oder Screenshots haben und diesen Monat Antworten benötigen, ist North Micro Vision Instruct die praktische Wahl – und das mit Abstand: Apache-2.0, 2.4B, ein standardmäßiger Transformers-Ladepfad, keine Guardrail-Umgebung, kein verteilter Checkpoint-Index, kein zweiter Python-Stack. Feinjustieren Sie es auf Ihrer eigenen Dokumentenverteilung, und Sie haben einen Spezialisten. Die Einschränkung ist der Anwendungsbereich – richten Sie es auf eine Reasoning-Aufgabe, und die MMMU-Zahl wird Sie finden.

PixelUMMs Angebot ist Breite und eine Forschungsfrage. Es liest und generiert, Bild und Video, aus einem einzigen Satz Gewichte, und es ist mit großem Abstand die interessantere Lektüre. Doch sein Checkpoint steht unter einer nichtkommerziellen Lizenz, seine Gewichte sind 128 Shards eines verteilten Checkpoints hinter einem verborgenen Metadatenindex mit insgesamt rund 30 GB, es verlangt ein CUDA-13-Toolkit mit aus dem Quellcode kompiliertem FlashAttention, und sein Text-zu-Video-Pfad verwendet Cosmos-Guardrails, die ein zugangsbeschränktes Repository und eine separate Umgebung erfordern. Das ist ein Laboraufbau, kein Deployment.

Der Routing-Aspekt kommt später, wenn überhaupt. Keines der beiden Modelle ist heute über eine gehostete API verfügbar — OrcaRouter routet keines von beiden — und keines wird es sein, bis deren Lizenzierung es erlaubt. Wenn ein Modell wie North Micro Vision Instruct tatsächlich hinter einem gemeinsamen Endpoint auftaucht, ist der Grund, es einer direkten Integration vorzuziehen, der übliche: ein Schlüssel für über 200 Modelle, durchgereichte Listenpreise der Anbieter mit 0 % Aufschlag, Failover, das ein Modell herabstuft, das hinter seiner Modellkarte zurückbleibt, und kein zweiter Vertrag, der ausgehandelt werden muss, wenn Sie einen Ersatz im A/B-Test vergleichen möchten. Das ist eine Beschreibung des Workflows, keine Aussage über die Verfügbarkeit.

Der eine Test, der sie trennen würde

Führe beide auf demselben Dokumentensatz mit derselben Auflösung aus und bewerte die Fälle mit kleinem Text, dann ändere eine Variable: Nimm den Vision-Encoder aus dem Vergleich heraus, indem du PixelUMM seine Eingaben in nativer Auflösung zuführst. Wenn das encoderfreie Modell bei dichtem Text zu einem Bruchteil der Parameterkosten standhält, ist das der stärkste mögliche Beleg für die These – und es ist ein Test, den jeder mit einer freien Karte ausführen kann, weil beide Checkpoints herunterladbar sind. Bis jemand das tut, gilt weiterhin die pragmatische Zusammenfassung: Ein kleiner Apache-2.0-Reader ist derjenige, den du einsetzt, und ein großer nichtkommerzieller Generalist ist derjenige, den du untersuchst.