En titelskylt för North Micro Vision Instruct som lyder 'North Micro Vision Instruct' med undertiteln 'Cohere's 2.4B Apache-2.0 document VLM' och en etikett som anger att den släpptes den 12 augusti 2026, ovanför tre linjeikoner för dokumentskanning, diagramavläsning och bounding-box-förankring.
Guides & Insights

North Micro Vision Instruct: Coheres tysta 2.4B-dokument-VLM, förklarad

Författare

Rowan Sterling

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller →
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

CohereLabs/North-Micro-Vision-Instruct — "North Micro Vision" för kort — är en vision-språkmodell med 2,4 miljarder parametrar som lanserades tyst: vikterna dök upp på Hugging Face den 10 augusti 2026, Coheres tillkännagivande följde den 12 augusti, och en dag senare finns det fortfarande inget hostat API, ingen prislista och ingen tredjepartsleaderboard-post. North Micro Vision är byggd för en enda uppgift — att läsa dokument i ursprunglig upplösning, på samma sätt som en person kisar mot en skannad A4-sida snarare än på det sätt en bildtextmodell kastar en blick på en miniatyrbild — och dess modellkort är ovanligt rakt på sak om vad den inte är: inget verktygsanrop, ingen resonemangsloop, systemprompter avråds aktivt. Det här är en "vad vi vet hittills"-artikel, så varje siffra nedan är märkt: vad själva repot fastställer, vad Cohere påstår men ingen har återskapat, och vad den enda tredjepartsgranskningen som publicerats hittills tillför.

Vad Cohere faktiskt levererade

Allt i detta avsnitt läses direkt från repositoryt: config.json, README och modellkortet. Dessa är Coheres primära källor, och för det mesta som är känt om modellen är de de enda källorna.

• Storlek — totalt 2,4B parametrar: en ~400M visions-encoder plus en 2B "North Micro LLM" språkmodell, i bfloat16, cirka 4,97 GB vikter.

• Licens — Apache 2.0, kommersiellt tillåtande, vikter och tokenizer öppna.

• Vision-encoder — specialtränad för nativ upplösning, initierad från SigLIP 2 SO400M

• Språkmodell — den egenutvecklade 2B North Micro-LLM:en som följer Command A+-arkitekturen: tre glidande fönster-attention-lager varvat med ett globalt attention-lager, grupperad query-attention (16 query-huvuden över 8 KV-huvuden), delade embeddingar, vokabulär med 262 144 tokens

• Projektor — "DeepStack": patch-embeddingar från flera vision-encoder-lager injiceras i tidiga språklager i stället för att prependeras en enda gång, vilket gör att liten text och tabellgeometri överlever.

• Upplösning — inmatning med ursprunglig upplösning och bibehållet bildförhållande, upp till cirka 1654 × 2339 pixlar, vilket motsvarar en A4-sida vid cirka 200 DPI.

• Kontext — 128K textkontext på språkryggraden; 8K validerad multimodal kontext (detaljer nedan)

• Språk — 11 stödda: Engelska, Kinesiska, Tyska, Franska, Spanska, Italienska, Portugisiska, Hindi, Japanska, Koreanska, Arabiska

Suffixet "Instruct" spelar roll. Detta är den instruktionsjusterade checkpojnten — en chatt- och visuell-QA-modell — och i skrivande stund är den den enda checkpojnten. Modellträdet listar redan elva community-kvantiseringar och tre fine-tuningar, men ingen separat basvariant har publicerats under ett annat namn.

Varför arkitekturen är värd ett stycke

De flesta 2–3B-VLM:er nedskalar din bild till ett fast rutnät och tappar den finstilta texten. North Micro Vision satsar på motsatsen: behåll upplösningen, spendera tokenarna. Bildkodaren använder 2D-RoPE plus inlärda 1D-positionella embeddingar, och DeepStack-projektorn matar patch-embeddingar till flera språklager i stället för en enda prepend, vilket är hur en tätt packad tabell eller en fotnot överlever. Positionskodningen är interfolierad mRoPE, så antalet visuella tokenar skalar med bildupplösningen i stället för att begränsas av en förinställning.

Det valet är hela produkten — och det har ett pris. RohitAIs lanseringsanalys uppskattar att en nativ A4-sida i maximal upplösning landar på ungefär 3 800 sammanslagna visuella positioner. Läs den siffran i relation till kontextförbehållet nedan: 3 800 visuella tokens plus en prompt kan fylla en stor del av det validerade multimodala fönstret innan du har ställt din fråga.

Benchmark-kortet, läst ärligt.

A single-column scoreboard for North Micro Vision Instruct listing six rows: Size 2.4B (2B LM + 400M vision), License Apache 2.0, DocVQA 0.921, ChartQA 0.808, Multimodal context 8K validated, Tool calling none, with a footer noting the benchmarks are vendor-reported and not independently reproduced.

Varje siffra i detta avsnitt är leverantörsrapporterad. Ingen har reproducerats av ett oberoende labb, och modellen finns ännu inte på någon offentlig topplista. På papperet är resultatet verkligen starkt där Cohere pekar:

• DocVQA — 0.921 (dokumentvisuell frågebesvarande)

• ChartQA — 0,808 (avläsning av diagram)

• OCRBench — 0.792 (OCR i det vilda)

• RefCOCO grounding — 0.732 genomsnittlig P@1 (pekande på objekt)

• MMMU — 0,329 (multimodal kunskap på högskolenivå — den svaga punkten, som väntat i den här storleken)

IFEval — 0.749 (instruktionsföljning)

Coheres lanseringsbeskrivning hävdar att North Micro Vision överträffar Gemma 4 E2B och Ministral 3 3B "på en rad riktmärken för visuell förståelse", med styrkan koncentrerad till dokumentförståelse och visuell QA. Det är Coheres påstående om Coheres modell — behandla det som sådant. En hake: Coheres jämförelse mot Liquids modellfamilj använde 1.6B-checkpointen, inte 3B-checkpointen, så det finns ingen giltig North-vs-LFM2.5-VL-3B-jämförelse i kortet, även om de två modellerna kommer att tävla om samma edge-dokumentbudget.

Det enda oberoende test som publicerats hittills — en enskild bloggares körning, inte en laboratoriesvit — ger den bild som kortet utelämnar.{{1}} Det rapporterar att North Micro Vision slår Ministral 3 3B Instruct på fem av sju rader för dokument, diagram och OCR, vilket stämmer med leverantörens beskrivning.{{2}} Men det rapporterar också att Qwen3.5-2B slår North Micro Vision på sex av dessa sju rader och på varje redovisad rad för allmän VQA, resonemang, räkning, hallucinationer och textkunskap; North Micro Visions enda seger över Qwen3.5-2B i den uppsättningen är AI2D.{{3}} Och English OCRBench v2 landar på 0,367 jämfört med rubriksiffran OCRBench 0,792 — en påminnelse om att OCR-poäng i hög grad beror på vilken delmängd och vilken svårighetsgrad du kör.{{4}} En körning är ingen dom, men det är det första beviset på att North Micro Visions verkliga konkurrent i den här storleken är Qwen 3.5-familjen, inte de modeller Cohere valde att benchmarka mot.{{5}}

Ett kontextfönster, två siffror

Modellkortet listar 128K textkontext och 8K validerad multimodalkontext, och gapet mellan de två gör verkligt arbete. Siffran 128K hör enbart till språkryggraden; prompter med bild och text över 8K token tränades eller validerades aldrig, så allt bortom den gränsen är extrapolering. Med en tät A4-sida som förbrukar ungefär 3 800 visuella positioner kan du nå det 8K-fönstret med ett dokument och en kort fråga. Den praktiska konsekvensen: planera din pipeline kring att beskära sidor till regioner — tabellen, signaturblocket, en enskild faktura — snarare än att mata in hela sidor och förvänta dig ett långt fram-och-tillbaka om dem.

Vad modellkortet säger att du inte ska göra

North Micro Vision är ett perceptionslager, inte en agent, och Cohere är uppfriskande tydliga med det. Kortet säger att modellen inte är en resonerande modell, har begränsad matematik- och kodförmåga, stöder inte verktygsanrop eller agentiska arbetsflöden och bör inte ersätta en större allmän assistent. Det går ett steg längre än de flesta kort: det rekommenderar att man inte använder systemprompter, eftersom modellen inte tränats med dem. Det finns inte heller några kalibrerade konfidensvärden. Designen som detta antyder är en uppdelning: North Micro Vision läser och extraherar, ett schema äger strukturen, regler äger invarianterna, en starkare modell hanterar de tvetydiga anropen och en människa godkänner allt av vikt. Behandla texten på sidan som data, aldrig som policy – en skannad instruktion dold i ett dokument är precis den typen av visuell promptinjektion som denna uppdelning skyddar mot.

A four-step document pipeline diagram reading Scan, North Micro Vision — perception, Schema + rules, and Stronger model — decisions, connected by arrows, with a footer reading 'Keep perception and decisions separate.'

Hur man kör det idag

The Hugging Face model card for CohereLabs/North-Micro-Vision-Instruct, showing the Image-Text-to-Text pipeline badge, Apache 2.0 license, 11 languages, the model tree, and the opening description of a 2.4B-parameter open-weight vision-language model with native-resolution image support, noting it is not deployed by any inference provider.

Snabbstarten är ärlig med sin egen friktion: modellkortet kräver Transformers 5.16.0, vilket inte var den senaste stabila PyPI-utgåvan vid lanseringen, så tidiga användare installerar från källkod. Offentligt vLLM-stöd anges som "kommer snart"; Cohere utvärderade med en intern vLLM-bygge. Ekosystemstödet från dag ett är annars gott: NVIDIA NeMo AutoModel-recept för edge- och GPU-distribution, Axolotl QLoRA- och full finjusteringsrecept, samt community-MLX-kvantiseringar för Apple Silicon – 4-bitarsbygget är ungefär 2,17 GB. En distributionsfälla värd att nämna: ställ in max_pixels explicit, eftersom sequence_len inte begränsar bildtokens, och utan det kan du oavsiktligt överskrida det validerade multimodala fönstret.

North Micro Vision finns inte på OrcaRouter, och enligt dess eget modellkort finns den hos ingen inferensleverantör — det här är en self-host-historia, punkt slut. Vilket är exakt varför routinglagret spelar roll i nästa mening: i samma stund som någon leverantör sätter upp en endpoint för den, är en router det som låter dig placera en dagar-gammal Apache-2.0-modell bredvid de du redan anropar i produktion — ett API, inget nytt avtal, leverantörens listpris vidarebefordrat med 0 % påslag, och automatisk failover så att en otestad modell kan ta emot verklig trafik medan en beprövad fångar upp de anrop den tappar. Tills den endpointen finns, är jämförelsen du faktiskt kan köra idag den mellan den här checkpointen och de värdbaserade dokumentmodeller du redan betalar för, sida vid sida på dina egna sidor.

Vem ska flytta, och vem ska vänta

Kör om du har ett avgränsat dokumentextraktionsjobb — fakturor, kontoutdrag, avtal, strukturerade formulär — och krav på datahemvist eller revision som gör en värdbaserad API oattraktiv. Apache 2.0, billig QLoRA-domänanpassning och en nativ upplösningskodare är en genuint ovanlig kombination för den arbetsbelastningen, och modellkortets egna begränsningar är tydliga nog för att du inte ska bli överraskad. Vänta om du behöver en hanterad slutpunkt, prissättning per token eller agentiskt beteende — inget av detta finns ännu. Och vänta med att betrakta något av ovanstående riktmärken som fastställt: varje rubriksiffra är Coheres, den enda externa körningen ger en mer omtvistad bild i toppen av småmodellsklassen, och modellen har varit ute i mindre än en vecka. Det man ska hålla ögonen på är serveringshistorien — den dag standardutgåvan av Transformers och en offentlig vLLM-utgåva båda stödjer den, slutar North Micro Vision att vara ett repo du måste brottas med och blir en modell du helt enkelt kan peka mot dina dokument.