
North Micro Vision Instruct: Coheres tysta 2.4B-dokument-VLM, förklarad
- openaiNYOpenAI: GPT-6.1 Sol2026-09-2952Intelligens
- anthropicNYAnthropic: Claude Sonnet 5.52026-09-2856Intelligens
- typesafeNYTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M tokens · 144 tok/s
- OpenAINYOpenAI: GPT-6 Luna2026-09-2238Intelligens
- OpenAINYOpenAI: GPT-6 Sol2026-09-2248Intelligens
- AnthropicNYAnthropic: Claude Opus 5.52026-09-2258Intelligens
- xAINYGrok 4.72026-09-2146Intelligens
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1M tokens · 124 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M tokens · 933 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligens76Kodning
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M tokens · 50 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens · 106 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M tokens · 217 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
CohereLabs/North-Micro-Vision-Instruct — "North Micro Vision" för kort — är en vision-språkmodell med 2,4 miljarder parametrar som lanserades tyst: vikterna dök upp på Hugging Face den 10 augusti 2026, Coheres tillkännagivande följde den 12 augusti, och en dag senare finns det fortfarande inget hostat API, ingen prislista och ingen tredjepartsleaderboard-post. North Micro Vision är byggd för en enda uppgift — att läsa dokument i ursprunglig upplösning, på samma sätt som en person kisar mot en skannad A4-sida snarare än på det sätt en bildtextmodell kastar en blick på en miniatyrbild — och dess modellkort är ovanligt rakt på sak om vad den inte är: inget verktygsanrop, ingen resonemangsloop, systemprompter avråds aktivt. Det här är en "vad vi vet hittills"-artikel, så varje siffra nedan är märkt: vad själva repot fastställer, vad Cohere påstår men ingen har återskapat, och vad den enda tredjepartsgranskningen som publicerats hittills tillför.
Vad Cohere faktiskt levererade
Allt i detta avsnitt läses direkt från repositoryt: config.json, README och modellkortet. Dessa är Coheres primära källor, och för det mesta som är känt om modellen är de de enda källorna.
• Storlek — totalt 2,4B parametrar: en ~400M visions-encoder plus en 2B "North Micro LLM" språkmodell, i bfloat16, cirka 4,97 GB vikter.
• Licens — Apache 2.0, kommersiellt tillåtande, vikter och tokenizer öppna.
• Vision-encoder — specialtränad för nativ upplösning, initierad från SigLIP 2 SO400M
• Språkmodell — den egenutvecklade 2B North Micro-LLM:en som följer Command A+-arkitekturen: tre glidande fönster-attention-lager varvat med ett globalt attention-lager, grupperad query-attention (16 query-huvuden över 8 KV-huvuden), delade embeddingar, vokabulär med 262 144 tokens
• Projektor — "DeepStack": patch-embeddingar från flera vision-encoder-lager injiceras i tidiga språklager i stället för att prependeras en enda gång, vilket gör att liten text och tabellgeometri överlever.
• Upplösning — inmatning med ursprunglig upplösning och bibehållet bildförhållande, upp till cirka 1654 × 2339 pixlar, vilket motsvarar en A4-sida vid cirka 200 DPI.
• Kontext — 128K textkontext på språkryggraden; 8K validerad multimodal kontext (detaljer nedan)
• Språk — 11 stödda: Engelska, Kinesiska, Tyska, Franska, Spanska, Italienska, Portugisiska, Hindi, Japanska, Koreanska, Arabiska
Suffixet "Instruct" spelar roll. Detta är den instruktionsjusterade checkpojnten — en chatt- och visuell-QA-modell — och i skrivande stund är den den enda checkpojnten. Modellträdet listar redan elva community-kvantiseringar och tre fine-tuningar, men ingen separat basvariant har publicerats under ett annat namn.
Varför arkitekturen är värd ett stycke
De flesta 2–3B-VLM:er nedskalar din bild till ett fast rutnät och tappar den finstilta texten. North Micro Vision satsar på motsatsen: behåll upplösningen, spendera tokenarna. Bildkodaren använder 2D-RoPE plus inlärda 1D-positionella embeddingar, och DeepStack-projektorn matar patch-embeddingar till flera språklager i stället för en enda prepend, vilket är hur en tätt packad tabell eller en fotnot överlever. Positionskodningen är interfolierad mRoPE, så antalet visuella tokenar skalar med bildupplösningen i stället för att begränsas av en förinställning.
Det valet är hela produkten — och det har ett pris. RohitAIs lanseringsanalys uppskattar att en nativ A4-sida i maximal upplösning landar på ungefär 3 800 sammanslagna visuella positioner. Läs den siffran i relation till kontextförbehållet nedan: 3 800 visuella tokens plus en prompt kan fylla en stor del av det validerade multimodala fönstret innan du har ställt din fråga.
Benchmark-kortet, läst ärligt.

Varje siffra i detta avsnitt är leverantörsrapporterad. Ingen har reproducerats av ett oberoende labb, och modellen finns ännu inte på någon offentlig topplista. På papperet är resultatet verkligen starkt där Cohere pekar:
• DocVQA — 0.921 (dokumentvisuell frågebesvarande)
• ChartQA — 0,808 (avläsning av diagram)
• OCRBench — 0.792 (OCR i det vilda)
• RefCOCO grounding — 0.732 genomsnittlig P@1 (pekande på objekt)
• MMMU — 0,329 (multimodal kunskap på högskolenivå — den svaga punkten, som väntat i den här storleken)
IFEval — 0.749 (instruktionsföljning)
Coheres lanseringsbeskrivning hävdar att North Micro Vision överträffar Gemma 4 E2B och Ministral 3 3B "på en rad riktmärken för visuell förståelse", med styrkan koncentrerad till dokumentförståelse och visuell QA. Det är Coheres påstående om Coheres modell — behandla det som sådant. En hake: Coheres jämförelse mot Liquids modellfamilj använde 1.6B-checkpointen, inte 3B-checkpointen, så det finns ingen giltig North-vs-LFM2.5-VL-3B-jämförelse i kortet, även om de två modellerna kommer att tävla om samma edge-dokumentbudget.
Det enda oberoende test som publicerats hittills — en enskild bloggares körning, inte en laboratoriesvit — ger den bild som kortet utelämnar.{{1}} Det rapporterar att North Micro Vision slår Ministral 3 3B Instruct på fem av sju rader för dokument, diagram och OCR, vilket stämmer med leverantörens beskrivning.{{2}} Men det rapporterar också att Qwen3.5-2B slår North Micro Vision på sex av dessa sju rader och på varje redovisad rad för allmän VQA, resonemang, räkning, hallucinationer och textkunskap; North Micro Visions enda seger över Qwen3.5-2B i den uppsättningen är AI2D.{{3}} Och English OCRBench v2 landar på 0,367 jämfört med rubriksiffran OCRBench 0,792 — en påminnelse om att OCR-poäng i hög grad beror på vilken delmängd och vilken svårighetsgrad du kör.{{4}} En körning är ingen dom, men det är det första beviset på att North Micro Visions verkliga konkurrent i den här storleken är Qwen 3.5-familjen, inte de modeller Cohere valde att benchmarka mot.{{5}}
Ett kontextfönster, två siffror
Modellkortet listar 128K textkontext och 8K validerad multimodalkontext, och gapet mellan de två gör verkligt arbete. Siffran 128K hör enbart till språkryggraden; prompter med bild och text över 8K token tränades eller validerades aldrig, så allt bortom den gränsen är extrapolering. Med en tät A4-sida som förbrukar ungefär 3 800 visuella positioner kan du nå det 8K-fönstret med ett dokument och en kort fråga. Den praktiska konsekvensen: planera din pipeline kring att beskära sidor till regioner — tabellen, signaturblocket, en enskild faktura — snarare än att mata in hela sidor och förvänta dig ett långt fram-och-tillbaka om dem.
Vad modellkortet säger att du inte ska göra
North Micro Vision är ett perceptionslager, inte en agent, och Cohere är uppfriskande tydliga med det. Kortet säger att modellen inte är en resonerande modell, har begränsad matematik- och kodförmåga, stöder inte verktygsanrop eller agentiska arbetsflöden och bör inte ersätta en större allmän assistent. Det går ett steg längre än de flesta kort: det rekommenderar att man inte använder systemprompter, eftersom modellen inte tränats med dem. Det finns inte heller några kalibrerade konfidensvärden. Designen som detta antyder är en uppdelning: North Micro Vision läser och extraherar, ett schema äger strukturen, regler äger invarianterna, en starkare modell hanterar de tvetydiga anropen och en människa godkänner allt av vikt. Behandla texten på sidan som data, aldrig som policy – en skannad instruktion dold i ett dokument är precis den typen av visuell promptinjektion som denna uppdelning skyddar mot.

Hur man kör det idag

Snabbstarten är ärlig med sin egen friktion: modellkortet kräver Transformers 5.16.0, vilket inte var den senaste stabila PyPI-utgåvan vid lanseringen, så tidiga användare installerar från källkod. Offentligt vLLM-stöd anges som "kommer snart"; Cohere utvärderade med en intern vLLM-bygge. Ekosystemstödet från dag ett är annars gott: NVIDIA NeMo AutoModel-recept för edge- och GPU-distribution, Axolotl QLoRA- och full finjusteringsrecept, samt community-MLX-kvantiseringar för Apple Silicon – 4-bitarsbygget är ungefär 2,17 GB. En distributionsfälla värd att nämna: ställ in max_pixels explicit, eftersom sequence_len inte begränsar bildtokens, och utan det kan du oavsiktligt överskrida det validerade multimodala fönstret.
North Micro Vision finns inte på OrcaRouter, och enligt dess eget modellkort finns den hos ingen inferensleverantör — det här är en self-host-historia, punkt slut. Vilket är exakt varför routinglagret spelar roll i nästa mening: i samma stund som någon leverantör sätter upp en endpoint för den, är en router det som låter dig placera en dagar-gammal Apache-2.0-modell bredvid de du redan anropar i produktion — ett API, inget nytt avtal, leverantörens listpris vidarebefordrat med 0 % påslag, och automatisk failover så att en otestad modell kan ta emot verklig trafik medan en beprövad fångar upp de anrop den tappar. Tills den endpointen finns, är jämförelsen du faktiskt kan köra idag den mellan den här checkpointen och de värdbaserade dokumentmodeller du redan betalar för, sida vid sida på dina egna sidor.
Vem ska flytta, och vem ska vänta
Kör om du har ett avgränsat dokumentextraktionsjobb — fakturor, kontoutdrag, avtal, strukturerade formulär — och krav på datahemvist eller revision som gör en värdbaserad API oattraktiv. Apache 2.0, billig QLoRA-domänanpassning och en nativ upplösningskodare är en genuint ovanlig kombination för den arbetsbelastningen, och modellkortets egna begränsningar är tydliga nog för att du inte ska bli överraskad. Vänta om du behöver en hanterad slutpunkt, prissättning per token eller agentiskt beteende — inget av detta finns ännu. Och vänta med att betrakta något av ovanstående riktmärken som fastställt: varje rubriksiffra är Coheres, den enda externa körningen ger en mer omtvistad bild i toppen av småmodellsklassen, och modellen har varit ute i mindre än en vecka. Det man ska hålla ögonen på är serveringshistorien — den dag standardutgåvan av Transformers och en offentlig vLLM-utgåva båda stödjer den, slutar North Micro Vision att vara ett repo du måste brottas med och blir en modell du helt enkelt kan peka mot dina dokument.
