Een gegenereerde titelkaart in de OrcaRouter-huisstijl met de tekst “PixelUMM vs North Micro Vision Instruct”, met vier statistiektegels: “2.4B” (het totale aantal parameters van North Micro Vision Instruct), “~180k” (de Hugging Face-downloads ervan begin oktober), “0.921 / 90.42” (de DocVQA ervan als accuratessefractie tegenover het percentage van PixelUMM) en “Apache-2.0” (de licentie voor de code en gewichten ervan, tegenover het niet-commerciële checkpoint van PixelUMM). Een voettekstregel luidt: “Door de leverancier gerapporteerde cijfers; geen onafhankelijke herhaling van beide modellen.”. Het OrcaRouter-logo is samengevoegd in de opgevulde strook rechtsonder.
Guides & Insights

PixelUMM vs North Micro Vision Instruct: een niet-commercieel onderzoeksmodel tegenover een 2,4B-reader die je kunt uitleveren

Auteur

Alistair Wren

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen →
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Zet North Micro Vision Instruct en PixelUMM naast elkaar en het verschil in grootte is bijna een afleiding: 2,4 miljard parameters voor Coheres lezer met native resolutie tegenover 15,2 miljard voor NVIDIA's geünificeerde model. De interessante as is de encoder. North Micro Vision Instruct is op de conventionele manier gebouwd — een vision-encoder van 400M, geïnitialiseerd vanuit SigLIP 2 SO400M, die een taalmodel van 2B voedt, verpakt in een vocabulaire van 262.144 tokens en uitgebracht onder Apache-2.0. PixelUMM is gebouwd op de stelling dat juist deze opzet de bottleneck is, en schrapt de encoder: ruwe pixelpatches van 16×16 gaan via lineaire projecties met één laag een Qwen3-8B-backbone in, en dezelfde gewichten genereren video én beantwoorden er vragen over. De ene is een gespecialiseerd leesapparaat dat je vandaag kunt downloaden en inzetten. De andere is een onderzoeksthese met een downloadlink en een licentie die het buiten producten houdt.

De cijfers van beide modellen hieronder zijn afkomstig van hun eigen labs. Geen van beide is onafhankelijk gereproduceerd, en de twee publiceren verschillende benchmarksuites, dus de overlap is kleiner dan hij lijkt.

Het pleidooi voor de saaie architectuur

North Micro Vision Instruct werd op 10 augustus 2026 gepubliceerd op Hugging Face, heeft acht weken de tijd gehad om gebruikers te verzamelen, en begin oktober vertoonde het ongeveer 180.000 downloads en 150 likes — een orde van grootte meer aandacht dan PixelUMM's enkele dagen oude repository. De propositie is specifiek en onglamoureus: de meeste visionmodellen schalen een afbeelding terug naar een vast raster en verliezen het fijne detail waar documenten van afhankelijk zijn, dus dit model verwerkt afbeeldingen op native resolutie, met behoud van beeldverhouding en kleine tekst.

• Parameters — 2,4 miljard in totaal: een taalmodel van 2 miljard plus een vision-encoder van 400 miljoen, speciaal getraind op basis van SigLIP 2 SO400M.

• Context — een 128K-token taalbackbone, maar een gevalideerd multimodaal operationeel bereik van ongeveer 8K tokens. De kaart vermeldt expliciet dat langere multimodale contexten afhankelijk zijn van extrapolatie en niet gebenchmarkt zijn.

• Invoer en uitvoer — afwisselend tekst en afbeeldingen in, tekst uit. Meertalig in meer dan elf talen. Geen enkele vorm van generatie.

• Gerapporteerde scores — DocVQA 0.921, ChartQA 0.808, OCRBench 0.792, allemaal door Cohere gerapporteerd en niet gereproduceerd. MMMU 0.329, wat de kaart niet verbergt: dit is een leesspecialist, geen generalist in redeneren.

• Implementatie — Transformers 5.16.0 en een accelerator, één moderne GPU bij 2,4B in bfloat16, Flash Attention 2 optioneel in plaats van vereist.

Niets aan dat ontwerp is nieuw. Het is ook de reden dat het deze week kan worden gedownload, gefinetuned en op echte documenten kan worden losgelaten.

A headless-browser capture of the Hugging Face model card for the North Micro Vision Instruct repository, showing the model title, the Apache-2.0 licence tag, and the repository's download and like counters.

De argumenten ertegen, aangevoerd door de andere partij

De preprint van PixelUMM begint met het benoemen van de kosten van die architectuur. Een bevroren, op het web voorgetrainde vision transformer levert semantische kenmerken voor begrip; een aparte VAE levert reconstructiegerichte latents voor generatie; het dragen van beide verdubbelt ruwweg de visuele context per conditioneringsafbeelding en dwingt vision-language-pretrainingspijplijnen om rond een tweede stream opnieuw te worden opgebouwd. North Micro Vision Instruct vermijdt de verdubbeling alleen door de tweede taak volledig te weigeren — het genereert niet, dus het heeft één interface nodig, niet twee.

PixelUMM trekt de redenering tot haar conclusie. Geen encoder, geen VAE, geen tokenizer: 16×16-pixelpatches voor afbeeldingen, spatiotemporele tubelets van 4 frames voor video, die beide via lineaire projecties met één laag een decoder-only Transformer bereiken, met begrip via autoregressieve tekst en generatie via flow matching in de pixelruimte. De acht empirische secties ervan zijn studies naar ontwerpkeuzes in plaats van overwinningen op ranglijsten — patchgrootte, patch-artefacten, trainingsdynamiek in de pixelruimte versus de VAE-ruimte, schaling van rekenkracht — wat een paper is die vraagt of het paradigma standhoudt, niet een die beweert dat het al gewonnen heeft.

• Visueel pad — North Micro Vision Instruct: 400M vooraf getrainde visie-encoder op native resolutie. PixelUMM: geen encoder; ruwe patches via een lineaire projectie.

• Wat het kan doen — North Micro Vision Instruct: afbeeldingen en documenten lezen, in tekst antwoorden, objecten lokaliseren en van bijschriften voorzien. PixelUMM: afbeeldingen en video lezen, en afbeeldingen en een video van 4 seconden genereren op basis van tekst.

• Schaal — 2,4B dense tegenover ongeveer 15,2B totaal op een Qwen3-8B-backbone, weergegeven als "8B MoT" in de eigen tabellen van het artikel.

• Licentie — Apache-2.0 op code en gewichten versus Apache-2.0 op code met de NVIDIA One-Way Noncommercial License op het checkpoint.

A generated scoreboard card titled “PixelUMM vs North Micro Vision Instruct — the scoreboard”, with the two model names as column headings and six dimension rows spanning both columns: parameters, visual path, inputs and outputs, DocVQA, MMMU and licence. North Micro Vision Instruct's column shows 2.4B total, a 400M SigLIP 2 SO400M vision encoder at native resolution, interleaved text and images in with text out, DocVQA 0.921, MMMU 0.329 and Apache-2.0; PixelUMM's column shows about 15.2B total, no encoder with raw patches through a linear projection, image and video reading plus image and video generation, DocVQA 90.42, MMMU 41.67 and a noncommercial checkpoint licence. A footer notes that the figures are vendor-reported with no independent rerun.

De twee scoreborden eerlijk lezen

De twee modellen publiceren verschillende benchmarks, en waar ze overlappen, verschillen de schalen.

• DocVQA — North Micro Vision Instruct 0,921 als een nauwkeurigheidsfractie. PixelUMM 90,42 als een percentage. Dezelfde benchmarknaam, verschillende splits en promptopstellingen, en slechts één van de twee beweert native-resolutieverwerking als reden.

• ChartQA — North Micro Vision Instruct 0.808. PixelUMM 82.96. Weer ongeveer dezelfde band zodra je stopt met het vergelijken van de ruwe strings.

• OCRBench — North Micro Vision Instruct 0,792. PixelUMM 78,00.

• MMMU — North Micro Vision Instruct 0.329, PixelUMM 41.67. Beide laag naar de maatstaven van grote visie-taalmodellen, en beide labs rapporteren ze zonder opsmuk.

• PixelUMM-only — MVBench 70,53, Video-MME 57,33, LongVideoBench 59,61, GenEval 0,83 met een prompt-herschrijver, VBench Deel 1-kwaliteit 84,10.

• North Micro Vision Instruct-only — grounding, captioning en multi-image-taken; een gedocumenteerde afwezigheid van tool calling en expliciet geen agentisch gedrag.

Het opvallende aan de overlap is hoe dicht een 2,4B-specialist bij een 15,2B-generalist komt op het gebied van het lezen van documenten en grafieken. Dat is geen bewijs dat de encoderloze aanpak faalt — het is bewijs dat het lezen van documenten een taak is waar een compacte encoder met native resolutie heel goed bij past, en de architectuur van PixelUMM is gericht op een ander argument. De paper van PixelUMM zelf geeft dat punt toe in een zin die het citeren waard is: omdat trainingsdata tussen modellen verschillen, kunnen de resultaten "niet vaststellen welke architectuur superieur is".

Waar de beslissing daadwerkelijk terechtkomt

Als je documenten, grafieken, formulieren of screenshots hebt en deze maand antwoorden nodig hebt, is North Micro Vision Instruct de praktische keuze, en het is niet eens close: Apache-2.0, 2.4B, een standaard Transformers-laadpad, geen guardrail-omgeving, geen gedistribueerde checkpoint-index, geen tweede Python-stack. Fine-tune het op je eigen documentdistributie en je hebt een specialist. Het voorbehoud is de scope — richt het op een redeneertaak en het MMMU-getal zal je vinden.

PixelUMM's aanbod is breedte en een onderzoeksvraag. Het leest en genereert, beeld en video, vanuit één set gewichten, en het is met een ruime voorsprong de interessantere lectuur. Maar het checkpoint valt onder een niet-commerciële licentie, de gewichten bestaan uit 128 shards van een gedistribueerd checkpoint achter een verborgen metadata-index van in totaal zo'n 30 GB, het wil een CUDA 13-toolkit met FlashAttention dat vanaf de broncode is gecompileerd, en het tekst-naar-video-pad draait Cosmos-guardrails die een gated repository en een aparte omgeving vereisen. Dat is een labopstelling, geen deployment.

De routeringsinvalshoek komt later, als die al komt. Geen van beide modellen is vandaag beschikbaar via een gehoste API — OrcaRouter routeert geen van beide — en dat zal zo blijven tot hun licenties het toestaan. Wanneer een model als North Micro Vision Instruct wel opduikt achter een gedeeld endpoint, is de reden om dat boven een directe integratie te verkiezen de gebruikelijke: één sleutel voor meer dan 200 modellen, de lijstprijzen van providers doorgegeven tegen 0% opslag, failover die een model dat onder zijn kaart presteert degradeert, en geen tweede contract om te onderhandelen wanneer je een vervanger wilt A/B-testen. Dat is een beschrijving van de workflow, geen claim over beschikbaarheid.

De enige test die hen zou scheiden

Draai beide op dezelfde documentenset met dezelfde resolutie en scoor de gevallen met kleine tekst, draai dan één variabele om: haal de vision-encoder uit de vergelijking door PixelUMM zijn inputs op native resolutie te geven. Als het model zonder encoder standhoudt bij dichte tekst tegen een fractie van de parameterkosten, is dat het sterkst mogelijke bewijs voor de these — en het is een test die iedereen met een extra kaart kan uitvoeren, omdat beide checkpoints te downloaden zijn. Totdat iemand dat doet, blijft de pragmatische samenvatting overeind: een kleine Apache-2.0-reader is degene die je uitrolt, en een grote niet-commerciële generalist is degene die je bestudeert.