
PixelUMM vs North Micro Vision Instruct: een niet-commercieel onderzoeksmodel tegenover een 2,4B-reader die je kunt uitleveren
- openaiNIEUWOpenAI: GPT-6.1 Sol2026-09-2952Intelligentie
- anthropicNIEUWAnthropic: Claude Sonnet 5.52026-09-2856Intelligentie
- typesafeNIEUWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 mln tokens · 223 tok/s
- OpenAINIEUWOpenAI: GPT-6 Luna2026-09-2238Intelligentie
- OpenAINIEUWOpenAI: GPT-6 Sol2026-09-2248Intelligentie
- AnthropicNIEUWAnthropic: Claude Opus 5.52026-09-2258Intelligentie
- xAINIEUWGrok 4.72026-09-2146Intelligentie
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1 mln tokens · 124 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 mln tokens · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens · 103 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens · 212 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
Zet North Micro Vision Instruct en PixelUMM naast elkaar en het verschil in grootte is bijna een afleiding: 2,4 miljard parameters voor Coheres lezer met native resolutie tegenover 15,2 miljard voor NVIDIA's geünificeerde model. De interessante as is de encoder. North Micro Vision Instruct is op de conventionele manier gebouwd — een vision-encoder van 400M, geïnitialiseerd vanuit SigLIP 2 SO400M, die een taalmodel van 2B voedt, verpakt in een vocabulaire van 262.144 tokens en uitgebracht onder Apache-2.0. PixelUMM is gebouwd op de stelling dat juist deze opzet de bottleneck is, en schrapt de encoder: ruwe pixelpatches van 16×16 gaan via lineaire projecties met één laag een Qwen3-8B-backbone in, en dezelfde gewichten genereren video én beantwoorden er vragen over. De ene is een gespecialiseerd leesapparaat dat je vandaag kunt downloaden en inzetten. De andere is een onderzoeksthese met een downloadlink en een licentie die het buiten producten houdt.
De cijfers van beide modellen hieronder zijn afkomstig van hun eigen labs. Geen van beide is onafhankelijk gereproduceerd, en de twee publiceren verschillende benchmarksuites, dus de overlap is kleiner dan hij lijkt.
Het pleidooi voor de saaie architectuur
North Micro Vision Instruct werd op 10 augustus 2026 gepubliceerd op Hugging Face, heeft acht weken de tijd gehad om gebruikers te verzamelen, en begin oktober vertoonde het ongeveer 180.000 downloads en 150 likes — een orde van grootte meer aandacht dan PixelUMM's enkele dagen oude repository. De propositie is specifiek en onglamoureus: de meeste visionmodellen schalen een afbeelding terug naar een vast raster en verliezen het fijne detail waar documenten van afhankelijk zijn, dus dit model verwerkt afbeeldingen op native resolutie, met behoud van beeldverhouding en kleine tekst.
• Parameters — 2,4 miljard in totaal: een taalmodel van 2 miljard plus een vision-encoder van 400 miljoen, speciaal getraind op basis van SigLIP 2 SO400M.
• Context — een 128K-token taalbackbone, maar een gevalideerd multimodaal operationeel bereik van ongeveer 8K tokens. De kaart vermeldt expliciet dat langere multimodale contexten afhankelijk zijn van extrapolatie en niet gebenchmarkt zijn.
• Invoer en uitvoer — afwisselend tekst en afbeeldingen in, tekst uit. Meertalig in meer dan elf talen. Geen enkele vorm van generatie.
• Gerapporteerde scores — DocVQA 0.921, ChartQA 0.808, OCRBench 0.792, allemaal door Cohere gerapporteerd en niet gereproduceerd. MMMU 0.329, wat de kaart niet verbergt: dit is een leesspecialist, geen generalist in redeneren.
• Implementatie — Transformers 5.16.0 en een accelerator, één moderne GPU bij 2,4B in bfloat16, Flash Attention 2 optioneel in plaats van vereist.
Niets aan dat ontwerp is nieuw. Het is ook de reden dat het deze week kan worden gedownload, gefinetuned en op echte documenten kan worden losgelaten.

De argumenten ertegen, aangevoerd door de andere partij
De preprint van PixelUMM begint met het benoemen van de kosten van die architectuur. Een bevroren, op het web voorgetrainde vision transformer levert semantische kenmerken voor begrip; een aparte VAE levert reconstructiegerichte latents voor generatie; het dragen van beide verdubbelt ruwweg de visuele context per conditioneringsafbeelding en dwingt vision-language-pretrainingspijplijnen om rond een tweede stream opnieuw te worden opgebouwd. North Micro Vision Instruct vermijdt de verdubbeling alleen door de tweede taak volledig te weigeren — het genereert niet, dus het heeft één interface nodig, niet twee.
PixelUMM trekt de redenering tot haar conclusie. Geen encoder, geen VAE, geen tokenizer: 16×16-pixelpatches voor afbeeldingen, spatiotemporele tubelets van 4 frames voor video, die beide via lineaire projecties met één laag een decoder-only Transformer bereiken, met begrip via autoregressieve tekst en generatie via flow matching in de pixelruimte. De acht empirische secties ervan zijn studies naar ontwerpkeuzes in plaats van overwinningen op ranglijsten — patchgrootte, patch-artefacten, trainingsdynamiek in de pixelruimte versus de VAE-ruimte, schaling van rekenkracht — wat een paper is die vraagt of het paradigma standhoudt, niet een die beweert dat het al gewonnen heeft.
• Visueel pad — North Micro Vision Instruct: 400M vooraf getrainde visie-encoder op native resolutie. PixelUMM: geen encoder; ruwe patches via een lineaire projectie.
• Wat het kan doen — North Micro Vision Instruct: afbeeldingen en documenten lezen, in tekst antwoorden, objecten lokaliseren en van bijschriften voorzien. PixelUMM: afbeeldingen en video lezen, en afbeeldingen en een video van 4 seconden genereren op basis van tekst.
• Schaal — 2,4B dense tegenover ongeveer 15,2B totaal op een Qwen3-8B-backbone, weergegeven als "8B MoT" in de eigen tabellen van het artikel.
• Licentie — Apache-2.0 op code en gewichten versus Apache-2.0 op code met de NVIDIA One-Way Noncommercial License op het checkpoint.

De twee scoreborden eerlijk lezen
De twee modellen publiceren verschillende benchmarks, en waar ze overlappen, verschillen de schalen.
• DocVQA — North Micro Vision Instruct 0,921 als een nauwkeurigheidsfractie. PixelUMM 90,42 als een percentage. Dezelfde benchmarknaam, verschillende splits en promptopstellingen, en slechts één van de twee beweert native-resolutieverwerking als reden.
• ChartQA — North Micro Vision Instruct 0.808. PixelUMM 82.96. Weer ongeveer dezelfde band zodra je stopt met het vergelijken van de ruwe strings.
• OCRBench — North Micro Vision Instruct 0,792. PixelUMM 78,00.
• MMMU — North Micro Vision Instruct 0.329, PixelUMM 41.67. Beide laag naar de maatstaven van grote visie-taalmodellen, en beide labs rapporteren ze zonder opsmuk.
• PixelUMM-only — MVBench 70,53, Video-MME 57,33, LongVideoBench 59,61, GenEval 0,83 met een prompt-herschrijver, VBench Deel 1-kwaliteit 84,10.
• North Micro Vision Instruct-only — grounding, captioning en multi-image-taken; een gedocumenteerde afwezigheid van tool calling en expliciet geen agentisch gedrag.
Het opvallende aan de overlap is hoe dicht een 2,4B-specialist bij een 15,2B-generalist komt op het gebied van het lezen van documenten en grafieken. Dat is geen bewijs dat de encoderloze aanpak faalt — het is bewijs dat het lezen van documenten een taak is waar een compacte encoder met native resolutie heel goed bij past, en de architectuur van PixelUMM is gericht op een ander argument. De paper van PixelUMM zelf geeft dat punt toe in een zin die het citeren waard is: omdat trainingsdata tussen modellen verschillen, kunnen de resultaten "niet vaststellen welke architectuur superieur is".
Waar de beslissing daadwerkelijk terechtkomt
Als je documenten, grafieken, formulieren of screenshots hebt en deze maand antwoorden nodig hebt, is North Micro Vision Instruct de praktische keuze, en het is niet eens close: Apache-2.0, 2.4B, een standaard Transformers-laadpad, geen guardrail-omgeving, geen gedistribueerde checkpoint-index, geen tweede Python-stack. Fine-tune het op je eigen documentdistributie en je hebt een specialist. Het voorbehoud is de scope — richt het op een redeneertaak en het MMMU-getal zal je vinden.
PixelUMM's aanbod is breedte en een onderzoeksvraag. Het leest en genereert, beeld en video, vanuit één set gewichten, en het is met een ruime voorsprong de interessantere lectuur. Maar het checkpoint valt onder een niet-commerciële licentie, de gewichten bestaan uit 128 shards van een gedistribueerd checkpoint achter een verborgen metadata-index van in totaal zo'n 30 GB, het wil een CUDA 13-toolkit met FlashAttention dat vanaf de broncode is gecompileerd, en het tekst-naar-video-pad draait Cosmos-guardrails die een gated repository en een aparte omgeving vereisen. Dat is een labopstelling, geen deployment.
De routeringsinvalshoek komt later, als die al komt. Geen van beide modellen is vandaag beschikbaar via een gehoste API — OrcaRouter routeert geen van beide — en dat zal zo blijven tot hun licenties het toestaan. Wanneer een model als North Micro Vision Instruct wel opduikt achter een gedeeld endpoint, is de reden om dat boven een directe integratie te verkiezen de gebruikelijke: één sleutel voor meer dan 200 modellen, de lijstprijzen van providers doorgegeven tegen 0% opslag, failover die een model dat onder zijn kaart presteert degradeert, en geen tweede contract om te onderhandelen wanneer je een vervanger wilt A/B-testen. Dat is een beschrijving van de workflow, geen claim over beschikbaarheid.
De enige test die hen zou scheiden
Draai beide op dezelfde documentenset met dezelfde resolutie en scoor de gevallen met kleine tekst, draai dan één variabele om: haal de vision-encoder uit de vergelijking door PixelUMM zijn inputs op native resolutie te geven. Als het model zonder encoder standhoudt bij dichte tekst tegen een fractie van de parameterkosten, is dat het sterkst mogelijke bewijs voor de these — en het is een test die iedereen met een extra kaart kan uitvoeren, omdat beide checkpoints te downloaden zijn. Totdat iemand dat doet, blijft de pragmatische samenvatting overeind: een kleine Apache-2.0-reader is degene die je uitrolt, en een grote niet-commerciële generalist is degene die je bestudeert.
