
North Micro Vision Instruct: Coheres stille 2.4B-document-VLM, uitgelegd
- openaiNIEUWOpenAI: GPT-6.1 Sol2026-09-2952Intelligentie
- anthropicNIEUWAnthropic: Claude Sonnet 5.52026-09-2856Intelligentie
- typesafeNIEUWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 mln tokens · 144 tok/s
- OpenAINIEUWOpenAI: GPT-6 Luna2026-09-2238Intelligentie
- OpenAINIEUWOpenAI: GPT-6 Sol2026-09-2248Intelligentie
- AnthropicNIEUWAnthropic: Claude Opus 5.52026-09-2258Intelligentie
- xAINIEUWGrok 4.72026-09-2146Intelligentie
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1 mln tokens · 124 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens · 933 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 mln tokens · 50 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens · 106 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens · 217 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
CohereLabs/North-Micro-Vision-Instruct — kortweg "North Micro Vision" — is een vision-taalmodel met 2,4 miljard parameters dat stilletjes is uitgebracht: de gewichten verschenen op 10 augustus 2026 op Hugging Face, de aankondiging van Cohere volgde op 12 augustus, en een dag later is er nog steeds geen gehoste API, geen prijslijst en geen vermelding op een leaderboard van derden. North Micro Vision is gebouwd voor één taak — documenten lezen op native resolutie, zoals een persoon naar een gescande A4-pagina tuurt in plaats van zoals een bijschriftmodel naar een miniatuur kijkt — en de modelkaart is ongewoon direct over wat het niet is: geen aanroepen van tools, geen redeneerlus, systeemprompts worden actief ontmoedigd. Dit is een artikel over wat we tot nu toe weten, dus elk cijfer hieronder is gelabeld: wat de repository zelf vaststelt, wat Cohere beweert maar niemand heeft gereproduceerd, en wat de enige blik van derden die tot nu toe is gepubliceerd toevoegt.
Wat Cohere daadwerkelijk heeft uitgebracht
Alles in deze sectie wordt rechtstreeks uit de repository gelezen: config.json, de README en de modelkaart. Dit zijn de primaire bronnen van Cohere, en voor het grootste deel van wat er over het model bekend is, zijn het de enige bronnen.
• Grootte — 2,4B parameters in totaal: een ~400M visie-encoder plus een 2B "North Micro LLM" taalmodel, in bfloat16, ongeveer 4,97 GB aan gewichten
• Licentie — Apache 2.0, commercieel permissief, weights en tokenizer open
• Vision encoder — op maat getraind voor native resolutie, geïnitialiseerd vanuit SigLIP 2 SO400M
Taalmodel — de eigen 2B North Micro LLM die de Command A+-architectuur volgt: drie sliding-window-aandachtslagen afgewisseld met één globale aandachtslaag, grouped-query-aandacht (16 query-heads over 8 KV-heads), gekoppelde embeddings, een vocabulaire van 262.144 tokens.
• Projector — "DeepStack": patch-embeddings van meerdere vision-encoderlagen worden in vroege taallagen geïnjecteerd in plaats van in één keer vooraan te worden geplaatst, waardoor kleine tekst en tabelgeometrie behouden blijven.
• Resolutie — invoer met native resolutie, met behoud van aspectverhouding, tot ongeveer 1654 × 2339 pixels, wat overeenkomt met één A4-pagina bij ongeveer 200 DPI
• Context — 128K tekstcontext op de taalbackbone; 8K gevalideerde multimodale context (details hieronder)
• Talen — 11 ondersteund: Engels, Chinees, Duits, Frans, Spaans, Italiaans, Portugees, Hindi, Japans, Koreaans, Arabisch
Het achtervoegsel "Instruct" doet ertoe. Dit is de instructie-afgestelde checkpoint — een chat- en visuele-QA-model — en op dit moment is het de enige checkpoint. De modelboom vermeldt al elf community-kwantificeringen en drie fine-tunes, maar er is geen aparte basisvariant onder een andere naam gepubliceerd.
Waarom de architectuur een paragraaf waard is
De meeste 2-3B VLM's schalen je afbeelding terug naar een vast raster en verliezen daarbij de kleine lettertjes. North Micro Vision's gok is het tegenovergestelde: behoud de resolutie, besteed de tokens. De visie-encoder gebruikt 2D RoPE plus aangeleerde 1D positionele embeddings, en de DeepStack-projector voert patch-embeddings toe aan meerdere taallagen in plaats van een enkele prepend — dat is hoe een dicht opeengepakte tabel of een voetnoot het overleeft. De positionele codering is interleaved mRoPE, waardoor het aantal visuele tokens meeschaalt met de beeldresolutie in plaats van te worden begrensd door een vooraf ingesteld maximum.
Die keuze is het hele product — en die heeft een prijs. RohitAI's lanceeranalyse schat dat een native A4-pagina op maximale resolutie neerkomt op ongeveer 3.800 samengevoegde visuele posities. Lees dat getal naast de contextwaarschuwing hieronder: 3.800 visuele tokens plus een prompt kunnen een groot deel van het gevalideerde multimodale venster vullen voordat je je vraag hebt gesteld.
De benchmarkkaart, eerlijk gelezen

Elk cijfer in deze sectie is door de leverancier gerapporteerd. Geen daarvan is door een onafhankelijk laboratorium gereproduceerd, en het model verschijnt nog niet op een openbare leaderboard. Op papier is het record echt sterk waar Cohere op wijst:
• DocVQA — 0.921 (documentvisuele vraagbeantwoording)
• ChartQA — 0,808 (grafiek lezen)
• OCRBench — 0.792 (OCR in het wild)
• RefCOCO grounding — 0,732 gemiddelde P@1 (aanwijzen van objecten)
• MMMU — 0.329 (multimodale kennis op universitair niveau — de zwakke plek, zoals verwacht bij deze omvang)
• IFEval — 0.749 (instructievolging)
Cohere's framing bij de lancering beweert dat North Micro Vision het beter doet dan Gemma 4 E2B en Ministral 3 3B 'op een reeks benchmarks voor visueel begrip', met het zwaartepunt op documentbegrip en visuele QA. Dat is Cohere's claim over Cohere's model — behandel het als zodanig. Eén kanttekening: Cohere's vergelijking met Liquid's familie gebruikte het 1.6B-checkpoint, niet het 3B-checkpoint, dus er is geen geldige North-vs-LFM2.5-VL-3B-vergelijking in de card, ook al zullen de twee modellen concurreren om hetzelfde edge-documentbudget.
De enige externe beoordeling die tot nu toe is gepubliceerd — een run van één blogger, geen laboratoriumsuite — vult het beeld aan dat de modelkaart weglaat. De beoordeling meldt dat North Micro Vision Ministral 3 3B Instruct verslaat op vijf van de zeven document-, grafiek- en OCR-rijen, wat overeenkomt met de framing van de leverancier. Maar ze meldt ook dat Qwen3.5-2B North Micro Vision verslaat op zes van die zeven rijen en op elke bekendgemaakte algemene VQA-, redeneer-, tel-, hallucinatie- en tekstkennis-rij; de enige overwinning van North Micro Vision op Qwen3.5-2B in die set is AI2D. En Engelse OCRBench v2 komt uit op 0,367 tegenover de aangekondigde OCRBench van 0,792 — een herinnering dat OCR-scores sterk afhangen van welke split en welke moeilijkheidsgraad je draait. Eén run is geen eindoordeel, maar het is het eerste bewijs dat de echte concurrent van North Micro Vision op deze schaal de Qwen 3.5-familie is, niet de modellen die Cohere koos om tegen te benchmarken.
Eén contextvenster, twee getallen
De kaart vermeldt 128K tekstcontext en 8K gevalideerde multimodale context, en de kloof tussen beide doet concreet werk. Het getal 128K heeft uitsluitend betrekking op de taalbackbone; prompts met beeld plus tekst van meer dan 8K tokens zijn nooit getraind of gevalideerd, dus alles voorbij die grens is extrapolatie. Met een dichte A4-pagina die ongeveer 3.800 visuele posities inneemt, kun je dat 8K-venster bereiken met één document en een korte vraag. De praktische consequentie: plan je pijplijn rond het bijsnijden van pagina's tot regio's — de tabel, het handtekeningblok, één enkele factuur — in plaats van hele pagina's in te voeren en te verwachten dat je er een lange heen-en-weer over kunt voeren.
Wat de modelkaart zegt dat je niet moet doen
North Micro Vision is een perceptielaag, geen agent, en Cohere is daar verfrissend duidelijk over. De kaart zegt dat het model geen redeneermodel is, beperkte wiskunde- en codeervaardigheden heeft, geen tool calling of agentische workflows ondersteunt, en geen grotere algemene assistent zou moeten vervangen. Het gaat een stap verder dan de meeste kaarten: het raadt system prompts af, omdat het model daar niet mee is getraind. Er zijn ook geen gekalibreerde betrouwbaarheidsscores. Het ontwerp dat dit impliceert is een splitsing: North Micro Vision leest en extraheert, een schema bepaalt de structuur, regels beheren de invarianten, een sterker model handelt de ambigue gevallen af, en een mens keurt alles wat consequenties heeft goed. Behandel de tekst op de pagina als data, nooit als beleid — een gescande instructie die in een document verborgen zit, is precies het soort visuele prompt-injectie waar deze splitsing tegen beschermt.

Hoe voer je het vandaag uit

De quickstart is eerlijk over zijn eigen frictie: de modelkaart vereist Transformers 5.16.0, die op de lanceringsdag niet de nieuwste stabiele PyPI-release was, dus vroege gebruikers installeren vanuit de broncode. Openbare vLLM-ondersteuning staat vermeld als "binnenkort beschikbaar"; Cohere evalueerde met een interne vLLM-build. Verder is de ecosysteemondersteuning op dag één goed: NVIDIA NeMo AutoModel-recepten voor edge- en GPU-implementatie, Axolotl QLoRA- en volledige fine-tuning-recepten, en community-MLX-kwantisaties voor Apple Silicon — de 4-bit-build is ongeveer 2,17 GB. Eén implementatievalkuil die het benoemen waard is: stel max_pixels expliciet in, want sequence_len begrenst geen afbeeldingstokens, en zonder dat kun je onbedoeld het gevalideerde multimodale venster overschrijden.
North Micro Vision staat niet op OrcaRouter, en volgens zijn eigen kaart staat het op geen enkele inferentieprovider — dit is een self-hostverhaal, punt uit. Dat is precies waarom de routinglaag ertoe doet in de volgende zin: op het moment dat een provider er een endpoint voor opzet, stelt een router je in staat om een dagenoud Apache-2.0-model naast de modellen te zetten die je al in productie aanroept — één API, geen nieuw contract, de catalogusprijs van de provider doorberekend met 0% opslag, en automatische failover zodat een onbewezen model echt verkeer aankan terwijl een bewezen model de calls opvangt die het laat vallen. Totdat dat endpoint bestaat, is de vergelijking die je vandaag daadwerkelijk kunt maken die tussen deze checkpoint en de gehoste documentmodellen waar je al voor betaalt, zij aan zij op je eigen pagina's.
Wie moet zich verplaatsen, en wie moet wachten
Ga ervoor als je een afgebakende documentextractietaak hebt — facturen, bankafschriften, contracten, gestructureerde formulieren — en data-residentie- of auditeisen die een gehoste API onaantrekkelijk maken. Apache 2.0, goedkope QLoRA-domeinaanpassing en een encoder met native resolutie zijn een ronduit ongebruikelijke combinatie voor die workload, en de eigen beperkingen van de modelkaart zijn duidelijk genoeg om je niet te verrassen. Wacht als je een gehost endpoint, prijs per token of agentisch gedrag nodig hebt — niets daarvan bestaat al. En wacht voordat je welke bovenstaande benchmark dan ook als definitief beschouwt: elk kopcijfer is van Cohere, de enige externe run schetst een meer omstreden beeld aan de top van de kleine-modellenklasse, en het model is nog geen week uit. Waar je op moet letten is het serving-verhaal — de dag dat standaard Transformers en een openbare vLLM-release het allebei ondersteunen, houdt North Micro Vision op een repo te zijn waar je mee moet worstelen en wordt het een model dat je gewoon op je documenten kunt richten.
