Ett genererat titelkort i OrcaRouters husstil med texten “PixelUMM vs North Micro Vision Instruct”, med fyra statistikrutor: “2.4B” (det totala antalet parametrar för North Micro Vision Instruct), “~180k” (dess nedladdningar på Hugging Face fram till början av oktober), “0.921 / 90.42” (dess DocVQA som ett noggrannhetsvärde i bråkform mot PixelUMMs procenttal) och “Apache-2.0” (dess licens för kod och vikter, mot PixelUMMs icke-kommersiella checkpoint). En sidfotsrad lyder “Leverantörsrapporterade siffror; ingen oberoende omkörning av någon av modellerna.”. OrcaRouter-logotypen är inkomponerad i den utfyllda remsan längst ned till höger.
Guides & Insights

PixelUMM vs North Micro Vision Instruct: En icke-kommersiell forskningsmodell mot en 2,4B-läsare som du kan leverera

Författare

Alistair Wren

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller →
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Ställ North Micro Vision Instruct och PixelUMM sida vid sida och storleksskillnaden är nästan en distraktion: 2,4 miljarder parametrar för Coheres läsare med nativ upplösning mot 15,2 miljarder för NVIDIAs enhetliga modell. Den intressanta axeln är encodern. North Micro Vision Instruct är byggd på det konventionella sättet – en 400M visionsencoder initierad från SigLIP 2 SO400M, som matar en 2B språkmodell, inlindad i ett ordförråd på 262 144 tokens och släppt under Apache-2.0. PixelUMM bygger på argumentet att just detta arrangemang är flaskhalsen, och tar bort encodern: råa 16×16-pixelpatchar går in i en Qwen3-8B-stomme genom enkellagrade linjära projektioner, och samma vikter genererar video likaväl som de svarar på frågor om den. Den ena är en specialiserad läsapparat som du kan ladda ner och driftsätta i dag. Den andra är en forskningstes med en nedladdningslänk och en licens som håller den borta från produkter.

Båda modellernas siffror nedan kommer från deras egna labb. Ingen av dem har reproducerats oberoende, och de två publicerar olika benchmarksviter, så överlappningen är snävare än den ser ut.

Argumentet för den tråkiga arkitekturen

North Micro Vision Instruct publicerades på Hugging Face den 10 augusti 2026, har haft åtta veckor på sig att samla användare och visade i början av oktober ungefär 180 000 nedladdningar och 150 gilla-markeringar – en storleksordning mer uppmärksamhet än PixelUMM:s några dagar gamla kodförråd. Dess pitch är specifik och oglamorös: de flesta visionsmodeller skalar ned en bild till ett fast rutnät och förlorar den finkorniga detalj som dokument är beroende av, så den här bearbetar bilder i ursprunglig upplösning och bevarar bildförhållandet och små textdetaljer.

• Parametrar — 2,4 md totalt: en språkmodell på 2 md plus en visionskodare på 400 mn, egentränad från SigLIP 2 SO400M.

• Kontext — en språklig basmodell på 128K tokens, men ett validerat multimodalt arbetsintervall på omkring 8K tokens. Modellkortet är tydligt med att längre multimodala kontexter bygger på extrapolering och inte har utvärderats i något benchmark.

• Indata och utdata — interfolierad text och bilder som indata, text som utdata. Flerspråkig för över elva språk. Ingen generering av något slag.

• Rapporterade poäng — DocVQA 0,921, ChartQA 0,808, OCRBench 0,792, alla rapporterade av Cohere och inte reproducerade. MMMU 0,329, vilket kortet inte döljer: detta är en lässpecialist, inte en resonemangsgeneralist.

• Driftsättning — Transformers 5.16.0 och en accelerator, en enda modern GPU på 2,4B i bfloat16, Flash Attention 2 valfritt snarare än ett krav.

Inget med den designen är nyskapande. Det är också anledningen till att den kan laddas ner, finjusteras och placeras framför riktiga dokument den här veckan.

A headless-browser capture of the Hugging Face model card for the North Micro Vision Instruct repository, showing the model title, the Apache-2.0 licence tag, and the repository's download and like counters.

Argumenten mot det, framförda av den andra sidan

PixelUMM:s preprint inleds med att namnge kostnaden för den arkitekturen. En fryst webbförtränad vision-transformer tillhandahåller semantiska särdrag för förståelse; en separat VAE tillhandahåller rekonstruktionsorienterade latenter för generering; att ha båda fördubblar ungefär den visuella kontexten per konditioneringsbild och tvingar förträningspipelines för vision-språk att byggas om kring en andra ström. North Micro Vision Instruct undviker dubbleringen endast genom att helt avstå från den andra uppgiften — den genererar inte, så den behöver ett gränssnitt, inte två.

PixelUMM drar argumentet till sin logiska slutsats. Ingen encoder, ingen VAE, ingen tokenizer: 16×16-pixelpatchar för bilder, spatiotemporala tubelets om 4 bildrutor för video, som båda når en decoder-only-Transformer via enkellagrade linjära projektioner, med förståelse genom autoregressiv text och generering genom flow matching i pixelrummet. Dess åtta empiriska avsnitt är studier av designval snarare än leaderboardvinster – patchstorlek, patchartefakter, träningsdynamik i pixelrummet kontra VAE-rummet, beräkningsskalning – vilket är en artikel som frågar om paradigmet håller, inte en som hävdar att det redan har vunnit.

• Visuell väg — North Micro Vision Instruct: 400M förtränad vision-encoder vid ursprunglig upplösning. PixelUMM: ingen encoder; råa patchar genom en linjär projektion.

• Vad den kan göra — North Micro Vision Instruct: läsa bilder och dokument, svara i text, utföra visuell grundning och bildtextning. PixelUMM: läsa bilder och video samt generera bilder och 4-sekundersvideo från text.

• Skala — 2,4B dense mot cirka 15,2B totalt på en Qwen3-8B-stomme, återgivet som "8B MoT" i artikelns egna tabeller.

• Licens — Apache-2.0 för kod och vikter kontra Apache-2.0 för kod med NVIDIA One-Way Noncommercial License på checkpointen.

A generated scoreboard card titled “PixelUMM vs North Micro Vision Instruct — the scoreboard”, with the two model names as column headings and six dimension rows spanning both columns: parameters, visual path, inputs and outputs, DocVQA, MMMU and licence. North Micro Vision Instruct's column shows 2.4B total, a 400M SigLIP 2 SO400M vision encoder at native resolution, interleaved text and images in with text out, DocVQA 0.921, MMMU 0.329 and Apache-2.0; PixelUMM's column shows about 15.2B total, no encoder with raw patches through a linear projection, image and video reading plus image and video generation, DocVQA 90.42, MMMU 41.67 and a noncommercial checkpoint licence. A footer notes that the figures are vendor-reported with no independent rerun.

Att ärligt läsa de två resultattavlorna

De två modellerna publicerar olika riktmärken, och där de överlappar skiljer sig skalorna åt.

• DocVQA — North Micro Vision Instruct 0,921 som noggrannhet i bråkform. PixelUMM 90,42 som en procentsats. Samma benchmarknamn, olika delningar och promptupplägg, och bara en av de två anger hantering av ursprunglig upplösning som orsaken.

• ChartQA — North Micro Vision Instruct 0.808. PixelUMM 82.96. Återigen ungefär samma spann när man slutar jämföra de råa strängarna.

• OCRBench — North Micro Vision Instruct 0,792. PixelUMM 78,00.

• MMMU — North Micro Vision Instruct 0.329, PixelUMM 41.67. Båda är låga enligt måttstocken för stora visionspråkmodeller, och båda labben rapporterar dem utan försköning.

• PixelUMM-only — MVBench 70,53, Video-MME 57,33, LongVideoBench 59,61, GenEval 0,83 med en promptomskrivare, VBench del 1 kvalitet 84,10.

• North Micro Vision Instruct-only — förankring, bildtextning och uppgifter med flera bilder; en dokumenterad avsaknad av verktygsanrop och uttryckligen inget agentiskt beteende.

Det slående med överlappningen är hur nära en 2.4B-specialist kommer en 15.2B-generalist på dokument- och diagramläsning. Det är inte bevis för att den encoder-fria metoden misslyckas — det är bevis för att dokumentläsning är en uppgift där en kompakt encoder med nativ upplösning passar mycket bra, och PixelUMMs arkitektur är inriktad på ett annat argument. PixelUMMs egen artikel medger denna punkt i en mening värd att citera: eftersom träningsdata skiljer sig mellan modeller kan dess resultat "inte fastställa vilken arkitektur som är överlägsen".

Var beslutet faktiskt landar

Om du har dokument, diagram, formulär eller skärmbilder och behöver svar den här månaden, är North Micro Vision Instruct det praktiska valet – och det är inte ens nära: Apache-2.0, 2,4B, en standardiserad laddningsväg för Transformers, ingen guardrail-miljö, inget index för distribuerade checkpoints, ingen andra Python-stack. Finjustera den på din egen dokumentfördelning och du har en specialist. Haken är omfattningen – rikta den mot en resonemangsuppgift och MMMU-siffran kommer att hitta dig.

PixelUMM:s erbjudande är bredd och en forskningsfråga. Den läser och genererar, bild och video, från en enda uppsättning vikter, och den är med bred marginal den mer intressanta läsningen. Men dess checkpoint ligger under en icke-kommersiell licens, dess vikter är 128 distribuerade checkpoint-shards bakom ett dolt metadataindex som totalt uppgår till runt 30 GB, den vill ha ett CUDA 13 Toolkit med FlashAttention kompilerat från källkod, och dess text-till-video-väg kör Cosmos-skyddsräcken som behöver ett åtkomstbegränsat arkiv och en separat miljö. Det är en labbänk, inte en driftsättning.

Routningsaspekten kommer senare, om den alls kommer. Ingen av modellerna är i dag tillgänglig via något hostat API – OrcaRouter routar ingen av dem – och ingen av dem kommer att vara det förrän deras licensiering tillåter det. När en modell som North Micro Vision Instruct väl dyker upp bakom en delad slutpunkt är anledningen att föredra det framför en direkt integration den vanliga: en nyckel över 200+ modeller, leverantörers listpriser som förs vidare med 0 % påslag, failover som nedgraderar en modell som inte lever upp till sitt modellkort, och inget andra avtal att förhandla om när du vill A/B-testa en ersättare. Det är en beskrivning av arbetsflödet, inte ett påstående om tillgänglighet.

Det enda testet som skulle skilja dem åt

Kör båda på samma dokumentuppsättning vid samma upplösning och poängsätt småtextfallen, ändra sedan en variabel: ta bort visionskodaren ur jämförelsen genom att mata PixelUMM med dess indata i nativ upplösning. Om den kodarfria modellen håller måttet på tät text till en bråkdel av parameterkostnaden, är det starkast möjliga bevis för tesen – och det är ett test som vem som helst med ett extra grafikkort kan köra, eftersom båda checkpointerna går att ladda ned. Tills någon gör det står den pragmatiska sammanfattningen fast: en liten Apache-2.0-läsare är den du driftsätter, och en stor icke-kommersiell generalist är den du studerar.