
MiniCPM-V 4.7 vs North Micro Vision Instruct: Cohere släppte en dokumenterad 2,4B-modell; OpenBMB släppte en 70 GB tomhet
- openaiNYOpenAI: GPT-6.1 Sol2026-09-2952Intelligens
- anthropicNYAnthropic: Claude Sonnet 5.52026-09-2856Intelligens
- typesafeNYTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M tokens · 150 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligens
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligens
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligens
- xAIGrok 4.72026-09-2146Intelligens
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1M tokens · 98 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M tokens · 1202 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligens76Kodning
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M tokens · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens · 248 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M tokens · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
MiniCPM-V 4.7 och North Micro Vision Instruct är båda svar från små labb på samma uppdrag – en kompakt syn- och språkmodell som du kan finjustera och driftsätta själv – men bara en av dem är färdig. Coheres North Micro Vision Instruct kom den 10 augusti 2026 som en modell med nativ upplösning och 2,4 miljarder parametrar under Apache-2.0, med ett tekniskt blogginlägg som förklarar arkitekturen och ett modellkort som listar vad den är avsedd för. MiniCPM-V 4.7 kom den 6 oktober 2026 som en gles mixture-of-experts-checkpoint med 35,2 miljarder parametrar och sexton shards, utan README, utan licensfält och utan benchmark av något slag. Den intressanta jämförelsen är inte "vilken som är smartast". Det är att de två utgåvorna representerar motsatta hållningar gentemot den community som måste använda dem.
De två utgåvorna, och vad som ingick i var och en
North Micro Vision Instruct är en vision-språkmodell med öppna vikter på 2,4B från CohereLabs, släppt under Apache-2.0. Den positioneras uttryckligen som en kompakt grund för prototypframtagning, uppgiftsspecifik finjustering och specialiserat multimodalt arbete. Dess utmärkande egenskap är bildbehandling vid nativ upplösning som bevarar bildförhållanden och fin visuell detalj i stället för att omsampla till ett fast rutnät, och modellkortet hävdar förmåga inom VQA, bildtextning, grounding, OCR, diagram och dokument. Den stöder flera bilder per konversation och elva språk – engelska, tyska, franska, spanska, italienska, portugisiska, hindi, japanska, koreanska, kinesiska och arabiska. Modellvikterna är 2 484 847 856 parametrar i BF16, och sedan släppet har MLX-gemenskapen tagit fram 4-bitars, 5-bitars, 6-bitars, 8-bitars, mxfp8-, mxfp4-, nvfp4- och bf16-konverteringar, vilket är vad ett sunt släpp av en liten modell ser ut som efter ett par månader. Den har omkring 166 500 nedladdningar och 150 gillningar.
MiniCPM-V 4.7 är openbmb/MiniCPM-V-4.7-35B-A3B: 35 212 875 824 parametrar i BF16, 70,4 GB över sexton safetensors-shards, klassen MiniCPMV4_7ForConditionalGeneration, sparad av Transformers 5.2.0 och uppladdad den 6 oktober 2026.

Dess textryggrad är en Qwen3.5-härledd gles MoE – 256 experter, 8 valda per token – med 40 lager som kör ett fast attentionmönster av typen tre linjära till en full, 256K kontext och ett internt 27-lagers visionstorn vid 16× nedskalning. Det finns inget modellkort. Repositoriet har tre gillningar och inga nedladdningar.
Sida vid sida, om de sex saker som spelar roll
• Parametrar — North Micro Vision Instruct: 2,48B tät, varje parameter aktiv per token. MiniCPM-V 4.7: 35,2B totalt, 8-av-256-gles. Inte en direkt jämförbar siffra.
• Licens — North Micro Vision Instruct: Apache-2.0, taggad och angiven. MiniCPM-V 4.7: ingen deklarerad, vilket som standard innebär alla rättigheter förbehållna.
• Fine-tuning-yta — North Micro Vision Instruct: uttryckligen utformad som bas för uppgiftsspecifik finjustering, med kvantiseringar från communityn redan tillgängliga. MiniCPM-V 4.7: en 70 GB BF16-checkpoint utan kvantiseringar och utan angivet träningsrecept.
• Upplösningshantering — North Micro Vision Instruct: inbyggd upplösning, bevarar bildförhållandet. MiniCPM-V 4.7: downsample_mode: "16x" med max_slice_nums: 9, en slicer-baserad högupplösningsväg.
• Språktäckning — North Micro Vision Instruct: elva språk listade på kortet. MiniCPM-V 4.7: anges inte någonstans.
• Kontext — North Micro Vision Instruct: dimensionerad för sin 2.4-driftsättningsklass. MiniCPM-V 4.7: max_position_embeddings: 262K, 256K.
• Bevis på kvalitet — North Micro Vision Instruct: ett publicerat kort, ett tekniskt blogginlägg, community-konverteringar och stor användning. MiniCPM-V 4.7: inget att citera.

Asymmetrin som gör den här jämförelsen ojämn
Det finns en särskild typ av jämförelseartikel som skulle vara lätt att skriva här: hämta siffrorna för MiniCPM-V 4.6 från OpenBMB:s GitHub, konstatera att de slår motsvarande klass av små modeller och antyda att 4.7 ärver dem. Det vore oärligt, och anledningen är värd att formulera exakt. MiniCPM-V 4.7 är inte en större version av 4.6. Den överger den 1,3B täta Qwen3.5-0.8B-stommen till förmån för en 35B gles Qwen-MoE, ändrar uppmärksamhetsmönstret till 3:1 linjär-till-full och byter standardinställningen för visionskompression till 16x. Var och en av dessa är en förändring av den del av modellen som avgör noggrannheten. Familjetillhörighet är inte ett benchmark.
Den andra riktningen av oärlighet är subtilare: att behandla avsaknaden av ett kort som bevis på ett problem. Det är det inte. OpenBMB har släppt nio MiniCPM-V-generationer sedan 2024, flera av dem genuint utmärkta för sin storlek, och ett tolvminutersfönster mellan skapandet av förvaret och den senaste commiten är hur en artefakt som först stageats och sedan publicerats ser ut, inte hur en trasig sådan beter sig. Den korrekta tolkningen av MiniCPM-V 4.7 är "okänd", och okänd är en annan sak än "dålig".
Coheres sida har sina egna ärlighetskrav.

Kvalitetsanspråken för North Micro Vision-kortet är Coheres egna mätningar, och den tekniska djupdykningen är skriven av samma team. Att communityn byggde sexton MLX-kvantiseringar inom några dagar är bevis för adoption, inte för noggrannhet — folk konverterar modeller som är lätta att konvertera, och en ren 2,4B Apache-2.0-utgåva är lätt att konvertera. Varken nedladdningsantalet eller kvantiseringsspridningen bör läsas som en poäng.
Vad var och en faktiskt är till för
North Micro Vision Instruct är ett mål för finjustering. Det är hela designbriefen, formulerad med kortets egna ord: en kompakt grund för prototypframtagning och specialiserade tillämpningar. Om du har en nischad uppgift för dokumenttolkning, diagramextraktion eller flerspråkig bildtextning och några tusen märkta exempel är en 2,4B Apache-2.0-modell med indata i nativ upplösning och kvantiseringar på åtta bitar och uppåt en förnuftig utgångspunkt, och du kan flytta den till en edge-enhet eller ett enda grafikkort i mellanklass när den fungerar.
MiniCPM-V 4.7, om det visar sig vara användbart, är inte det. Vid 70 GB okvantiserat är det en servermodell, och dess utmärkande egenskaper – ett 256K-fönster och linjär attention som håller KV-cachen platt – pekar mot multimodala arbetsbelastningar med lång kontext: timslånga videotranskript, stora dokumentsamlingar, utökad flertursanalys med bilder i historiken. Det är verkliga arbetsbelastningar, och arkitekturen är en rimlig satsning på dem. Satsningen har helt enkelt inte utvärderats.
Det finns en nyans kring de två komprimeringsstrategierna som är värd att hålla kvar. Native resolution och 16× nedskalning är inte bara bättre och sämre. En encoder med native resolution använder tokens för att bevara fina detaljer, vilket är precis vad OCR och grounding behöver. En 16× nedskalning använder färre tokens och riskerar att förlora just den detaljen. Vilket som är rätt beror på om uppgiften går ut på att läsa ett tätt formulär eller beskriva en scen, och MiniCPM-V 4.6:s växlingsbara 4x/16x-läge fanns just för att svaret ändras beroende på uppgift. Huruvida 4.7 behöll den växlingen är en av de saker som konfigurationen inte säger.
Var en router passar in, och var den inte gör det
Båda dessa modeller är vikter som du hostar själv. Varken North Micro Vision Instruct eller MiniCPM-V 4.7 är en hostad modell på OrcaRouter, och inget här bör tolkas som ett påstående att så är fallet. Routningsfrågan kommer in ett steg senare, när den lilla självhostade modellen gör rutinarbetet och något större måste hantera de fall där den misslyckas. Den överlämningen är vad en router med en enda nyckel är till för — över 200 modeller hos olika leverantörer, var och en till sitt listpris utan påslag från vår sida, med automatisk failover när en leverantör får problem — och det är värt att ha gränssnittet på plats innan du behöver det, för den dag din utvärdering av 4.7 lyckas är den dag du vill ha en andra endpoint utan ett andra avtal.
Domen, och vad som skulle ändra den
Cohere släppte en modell. OpenBMB släppte en checkpoint. På varje axel som en läsare kan agera utifrån – licens, licensklarhet, dokumenterat beteende, beredskap för finjustering, kvantisering, språktäckning – är North Micro Vision Instruct svaret i dag, och det är inte ens nära. Det är inte ett påstående om förmåga, eftersom ingen jämförelse av förmåga är möjlig. MiniCPM-V 4.7 har ungefär tio gånger så många parametrar som modellen den jämförs med och har inte publicerat något som rättfärdigar eller vederlägger den storleken. Den ärliga hållningen är att betrakta den som väntande: en verklig artefakt från ett labb med ett verkligt track record, som ligger i ett repo där en fil saknas som skulle förändra allt – README-filen.
