
MiniCPM-V 4.7 vs North Micro Vision Instruct: Cohere leverde een gedocumenteerd 2,4B-model; OpenBMB leverde een blanco bestand van 70 GB
- openaiNIEUWOpenAI: GPT-6.1 Sol2026-09-2952Intelligentie
- anthropicNIEUWAnthropic: Claude Sonnet 5.52026-09-2856Intelligentie
- typesafeNIEUWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 mln tokens · 150 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligentie
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligentie
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligentie
- xAIGrok 4.72026-09-2146Intelligentie
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1 mln tokens · 98 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens · 1202 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 mln tokens · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens · 248 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
MiniCPM-V 4.7 en North Micro Vision Instruct zijn beide antwoorden van kleine labs op dezelfde opdracht — een compact vision-language-model dat je zelf kunt fine-tunen en implementeren — maar slechts één van de twee is af. Cohere's North Micro Vision Instruct verscheen op 10 augustus 2026 als een native-resolutiemodel met 2,4 miljard parameters onder Apache-2.0, met een technische blogpost die de architectuur uitlegt en een modelkaart die aangeeft waarvoor het dient. MiniCPM-V 4.7 verscheen op 6 oktober 2026 als een sparse mixture-of-experts-checkpoint met 35,2 miljard parameters en zestien shards, zonder README, zonder licentieveld en zonder enige benchmark. De interessante vergelijking is niet "welke is slimmer." Het is dat de twee releases tegenovergestelde houdingen vertegenwoordigen tegenover de community die ermee moet werken.
De twee releases, en wat er met elk is meegeleverd.
North Micro Vision Instruct is een open-weight visie-taalmodel van 2,4B van CohereLabs, uitgebracht onder Apache-2.0. Het is expliciet gepositioneerd als een compacte basis voor prototyping, taakspecifieke fine-tuning en gespecialiseerd multimodaal werk. Het onderscheidende kenmerk is beeldverwerking op native resolutie die beeldverhoudingen en fijne visuele details behoudt in plaats van te hersamplen naar een vast raster, en de modelkaart claimt bekwaamheid op het gebied van VQA, captioning, grounding, OCR, grafieken en documenten. Het ondersteunt meerdere afbeeldingen per gesprek en elf talen — Engels, Duits, Frans, Spaans, Italiaans, Portugees, Hindi, Japans, Koreaans, Chinees en Arabisch. De modelgewichten zijn 2.484.847.856 parameters in BF16, en sinds de release heeft de MLX-community 4-bit-, 5-bit-, 6-bit-, 8-bit-, mxfp8-, mxfp4-, nvfp4- en bf16-conversies geproduceerd, wat is hoe een gezonde release van een klein model er na een paar maanden uitziet. Het heeft ongeveer 166.500 downloads en 150 likes.
MiniCPM-V 4.7 is openbmb/MiniCPM-V-4.7-35B-A3B: 35.212.875.824 parameters in BF16, 70,4 GB verdeeld over zestien safetensors-shards, klasse MiniCPMV4_7ForConditionalGeneration, opgeslagen door Transformers 5.2.0 en geüpload op 6 oktober 2026.

De tekstuele backbone is een van Qwen3.5 afgeleide sparse MoE — 256 experts, 8 per token geselecteerd — met 40 lagen volgens een vast patroon van drie lineaire attention-lagen op één volledige attention-laag, 256K-context en een eigen 27-laagse vision tower met 16× downsampling. Er is geen modelkaart. De repository heeft drie likes en geen downloads.
Zij aan zij, over de zes dingen die ertoe doen
• Parameters — North Micro Vision Instruct: 2,48B dense, elke parameter actief per token. MiniCPM-V 4.7: 35,2B totaal, 8-van-256 sparse. Geen één-op-één vergelijkbaar getal.
• Licentie — North Micro Vision Instruct: Apache-2.0, getagd en vermeld. MiniCPM-V 4.7: niets aangegeven, wat standaard neerkomt op alle rechten voorbehouden.
• Fine-tuning-oppervlak — North Micro Vision Instruct: expliciet ontworpen als basis voor taakspecifieke fine-tuning, met al beschikbare community-kwantisaties. MiniCPM-V 4.7: een BF16-checkpoint van 70 GB zonder kwantisaties en zonder opgegeven trainingsrecept.
• Resolutieafhandeling — North Micro Vision Instruct: native resolutie, beeldverhouding behouden. MiniCPM-V 4.7: downsample_mode: "16x" met max_slice_nums: 9, een op slicer gebaseerd pad voor hoge resolutie.
• Taaldekking — North Micro Vision Instruct: elf talen vermeld op de kaart. MiniCPM-V 4.7: nergens vermeld.
• Context — North Micro Vision Instruct: afgestemd op zijn implementatieklasse van 2,4B. MiniCPM-V 4.7: max_position_embeddings: 262144, 256K.
• Bewijs van kwaliteit — North Micro Vision Instruct: een gepubliceerde kaart, een technische blogpost, conversies door de community en brede adoptie. MiniCPM-V 4.7: niets om naar te verwijzen.

De asymmetrie die deze vergelijking scheef maakt
Er is een bepaald soort vergelijkingsartikel dat hier makkelijk te schrijven zou zijn: haal de cijfers van MiniCPM-V 4.6 van de GitHub van OpenBMB, constateer dat ze de equivalente klasse kleine modellen verslaan, en suggereer dat de 4.7 ze erft. Dat zou oneerlijk zijn, en de reden is het waard om precies te noemen. MiniCPM-V 4.7 is geen grotere versie van 4.6. Het vervangt de 1,3B dense Qwen3.5-0.8B-backbone door een 35B sparse Qwen-MoE, verandert het attentionpatroon naar 3:1 lineair-naar-volledig, en schakelt de standaardinstelling voor visuele compressie over naar 16x. Elk van die wijzigingen raakt het deel van het model dat de nauwkeurigheid bepaalt. Afstamming is geen benchmark.
De andere richting van oneerlijkheid is subtieler: het ontbreken van een kaart behandelen als bewijs van een probleem. Dat is het niet. OpenBMB heeft sinds 2024 negen generaties MiniCPM-V uitgebracht, waarvan verschillende echt uitstekend zijn voor hun formaat, en een venster van twaalf minuten tussen het aanmaken van de repository en de laatste commit is hoe een artefact dat eerst is klaargezet en daarna gepubliceerd eruitziet, niet hoe een kapot exemplaar eruitziet. De juiste interpretatie van MiniCPM-V 4.7 is "onbekend", en onbekend is iets anders dan "slecht".
Cohere's kant heeft haar eigen eerlijkheidsvereisten.

De kwaliteitsclaims op de North Micro Vision-kaart zijn de eigen metingen van Cohere, en de technische deep dive is geschreven door hetzelfde team. Dat de community binnen enkele dagen zestien MLX-quantisaties heeft gebouwd, is bewijs van adoptie, niet van nauwkeurigheid — mensen converteren modellen die makkelijk te converteren zijn, en een schone 2.4B Apache-2.0-release is makkelijk te converteren. Noch het aantal downloads, noch de spreiding van quantisaties moet als een score worden gelezen.
Waar elk eigenlijk voor dient
North Micro Vision Instruct is een fine-tuningdoel. Dat is de hele ontwerpopdracht, in de eigen woorden van de kaart: een compacte basis voor prototyping en gespecialiseerde toepassingen. Als je een afgebakende taak hebt op het gebied van documentparsing, grafiekenextractie of meertalige ondertiteling, en een paar duizend gelabelde voorbeelden, dan is een 2.4B Apache-2.0-model met native-resolutie-invoer en 8-bit-plus-kwantisaties een verstandig startpunt, en kun je het naar een edge-apparaat of één middenklasse-GPU verplaatsen zodra het werkt.
MiniCPM-V 4.7, als het bruikbaar blijkt te zijn, is dat niet. Met 70 GB ongekwantiseerd is het een servermodel, en zijn onderscheidende kenmerken — een venster van 256K en lineaire attention die de KV-cache vlak houdt — wijzen op multimodale workloads met een lange context: videotranscripten van een uur, grote documentensets, uitgebreide multi-turn analyses met afbeeldingen in de geschiedenis. Dat zijn echte workloads, en de architectuur is een redelijke gok daarop. De gok is alleen nog niet beoordeeld.
Er is een nuance over de twee compressiestrategieën die het waard is om vast te houden. Native resolutie en 16× downsampling zijn niet simpelweg beter en slechter. Een encoder op native resolutie besteedt tokens om fijne details te behouden, wat precies is wat OCR en grounding nodig hebben. Een 16× downsample besteedt minder tokens en loopt het risico precies dat detail te verliezen. Wat juist is, hangt ervan af of je taak het lezen van een formulier met dichte tekst is of het beschrijven van een scène, en de schakelbare 4x/16x-modus van MiniCPM-V 4.6 bestond juist omdat het antwoord per taak verandert. Of 4.7 die schakelmogelijkheid heeft behouden, is een van de dingen die de config niet vermeldt.
Waar een router past, en waar niet
Beide modellen zijn gewichten die je zelf serveert. Noch North Micro Vision Instruct noch MiniCPM-V 4.7 is een gehost model op OrcaRouter, en niets hier mag worden gelezen als een bewering dat dat wel zo is. De routeringsvraag komt een stap later aan bod, wanneer het kleine zelfgehoste model het routinewerk doet en iets groters de gevallen moet afhandelen waarin het faalt. Die overdracht is waarvoor een router met één sleutel dient — meer dan 200 modellen bij meerdere providers, elk tegen de lijstprijs zonder dat wij er opslag bij rekenen, met automatische failover wanneer een provider achteruitgaat — en het is de moeite waard om de interface geregeld te hebben voordat je die nodig hebt, want de dag dat je evaluatie van 4.7 slaagt, is de dag dat je een tweede endpoint wilt zonder een tweede contract.
Het oordeel, en wat het zou veranderen
Cohere bracht een model uit. OpenBMB bracht een checkpoint uit. Op elke as waarop een lezer kan handelen — licentie, licentieduidelijkheid, gedocumenteerd gedrag, gereedheid voor fine-tuning, kwantisatie, taaldekking — is North Micro Vision Instruct vandaag het antwoord, en het is niet eens dichtbij. Dat is geen bewering over capaciteiten, want een vergelijking van capaciteiten is niet mogelijk. MiniCPM-V 4.7 heeft ruwweg tien keer het aantal parameters van het model waarmee het wordt vergeleken en heeft niets gepubliceerd om die omvang te rechtvaardigen of te weerleggen. De eerlijke houding is om het als openstaand te beschouwen: een echt artefact van een lab met een echte staat van dienst, in een repository waar één bestand ontbreekt dat alles zou veranderen — de README.
