
MiniCPM-V 4.7 vs Microsoft Mage-VL: Twee heel verschillende gokken op wat een visionmodel per frame zou moeten kosten
- openaiNIEUWOpenAI: GPT-6.1 Sol2026-09-2952Intelligentie
- anthropicNIEUWAnthropic: Claude Sonnet 5.52026-09-2856Intelligentie
- typesafeNIEUWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 mln tokens · 150 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligentie
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligentie
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligentie
- xAIGrok 4.72026-09-2146Intelligentie
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1 mln tokens · 98 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens · 1202 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 mln tokens · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens · 248 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
MiniCPM-V 4.7 en Microsoft Mage-VL zijn beide visie-taalmodellen die beweren je tokens te besparen, en ze bereiken dat via tegenovergestelde routes. Mage-VL, op 25 juli 2026 uitgebracht door Microsoft, pakt de videokant aan: het leent de structuur van een videocodec, behoudt elke patch van ankerframes en alleen de patches van voorspelde frames die echte beweging bevatten, en claimt een vermindering van visuele tokens van meer dan 75%, met een wall-clock-versnelling tot 3,5× ten opzichte van uniforme framebemonstering. MiniCPM-V 4.7, op 6 oktober 2026 geüpload door OpenBMB, pakt de sequentiekant aan: een sparse MoE met 35,2 miljard parameters, waarvan 30 van de 40 lagen op een linear-attention-pad liggen, waardoor de KV-cache langzaam groeit over een context van 256K. Het ene model comprimeert wat het bekijkt. Het andere comprimeert wat het onthoudt. En slechts één van de twee komt met iets dat je kunt evalueren.
Wat elk is
Microsoft Mage-VL is een codec-native, proactief-streamend multimodaal basismodel op 4B-schaal, uitgebracht onder Apache-2.0 met een technisch rapport en een substantiële evaluatiesectie. Het is bewust gebouwd tegen wat de auteurs een Moravec-paradox voor VLM's noemen — sterk in offline redeneren, traag in realtime waarneming. De visuele encoder, Mage-ViT, is volledig vanaf nul getraind op ongeveer 100 miljoen niet-gelabelde afbeeldingen en video's in plaats van geïnitialiseerd te worden vanuit een web-voorgetrainde ViT, en het enige voorgetrainde onderdeel in de stack is de Qwen3-4B-Instruct-2507 taal-backbone. De volledige checkpoint is één enkel uniform model dat beeldbegrip, offline videoredeneren en event-gated streaming commentaar uitvoert zonder afzonderlijke varianten, en een bijbehorende microsoft/Mage-ViT release levert de encoder op zichzelf. Het heeft sinds de release ongeveer 10.600 downloads en 420 likes verzameld.
MiniCPM-V 4.7 is openbmb/MiniCPM-V-4.7-35B-A3B, een BF16-checkpoint met 35.212.875.824 parameters in zestien shards met een totale omvang van 70,4 GB, geschreven door Transformers 5.2.0 en geüpload op 6 oktober 2026 zonder modelcard.

De tekstconfiguratie ervan is getagd als qwen3_5_moe_text met 256 experts en 8 actief per token; de layer_types-array loopt over 40 lagen met drie linear-attentionlagen op elke full-attentionlaag; de vision tower is de eigen minicpmv4_7_vision met 27 lagen, 16× downsampling en tot negen afbeeldingsslices. De context bedraagt 256K. De repository heeft nul downloads, drie likes, geen benchmarks en geen licentie.
De zes rijen die een lezer kan controleren
Dezelfde zes dimensies, aan beide zijden. Waar een getal niet bestaat, blijft de leemte zichtbaar.
• Parameters — Mage-VL: 4,74 miljard, dense, alle actief per token. MiniCPM-V 4.7: 35,2 miljard totaal, sparse, 8 van de 256 experts per token. Het MiniCPM-getal is niet vergelijkbaar met dat van een dense model.
• Licentie — Mage-VL: Apache-2.0, vermeld op de kaart en in de repo-tags. MiniCPM-V 4.7: niets aangegeven.
• Waar de tokenbesparingen vandaan komen — Mage-VL: sparsity van visuele tokens bij de encoder, codec-afgestemd, naar verluidt meer dan 75% reductie. MiniCPM-V 4.7: lineaire attention bij de decoder, wat de KV-cache-groei over lange sequenties verkleint, maar niet de tokens die je erin stopt vermindert.
• Context — Mage-VL: getraind via een lange-contextfase op 350K video's als rollende codec-vensters van maximaal 384 of 768 frames. MiniCPM-V 4.7: max_position_embeddings: 262144.
• Herkomst van vision-encoder — Mage-VL: vanaf nul, getraind op ~100M ongelabelde frames; de kaart rapporteert 85,69% ImageNet met 256 tokens en monotone verbetering met tokenbudget. MiniCPM-V 4.7: lineage-toren hergebruikt van MiniCPM-V 4.6's ontwerp in dezelfde 1152-hidden, 27-laags vorm, met een standaard 16x-downsample.
• Bewijs — Mage-VL: een volledige kaart met DocVQA 95,14, InfoVQA 80,33, OCRBench 81,80, ChartQAPro 32,57, MMStar 67,32, CV-Bench-3D 94,75 en een CrossPoint-verschil van +53,1 ten opzichte van Qwen3-VL-4B, allemaal door de leverancier gerapporteerd tegen een overeenkomstige backbone. MiniCPM-V 4.7: geen.
Streaminggedrag — Mage-VL: een cognitiepoort die elk rollend venster scoort en stil blijft totdat een gebeurtenis is voltooid, getraind op ~3,3 mln. streaming-samples. MiniCPM-V 4.7: nergens beschreven.

Het deel dat iedereen verkeerd begrijpt aan de cijfers van Mage-VL
De benchmarktabellen van de Mage-VL-kaart zijn sterk, en de sterkste zijn ook het gemakkelijkst verkeerd te lezen. In de vergelijkingsrijen staat Mage-VL-4B tegenover Qwen3-VL-4B, Phi-4-Multimodal-Instruct en Phi-4-Reasoning-Vision, en de meest in het oog springende winsten — +22,5 op QVHighlight, +24,5 op VideoEval-Pro, +53,1 op CrossPoint — zijn echt in de zin dat ze in de tabellen van de leverancier voorkomen. Het zijn ook de eigen metingen van de leverancier, geproduceerd door het team dat het model heeft getraind, op dezelfde harness. Geen enkele onafhankelijke partij heeft ze gereproduceerd. Dat is normaal voor een model dat vier maanden oud is, en het is geen minpunt, maar het betekent wel dat het juiste werkwoord 'rapporteert' is, niet 'scoort'.
Twee dingen verdienen waardering buiten de tabellen. Ten eerste: het matched-backbone-ontwerp — waarbij de Qwen3-4B-decoder vast wordt gehouden en alleen de ViT wordt verwisseld — is een schoner stuk bewijs dan een positie op een leaderboard, omdat het de visuele stack isoleert in plaats van het hele systeem. Ten tweede: het trainingscorpus voor Mage-ViT bestaat uit ongeveer 100M ongelabelde frames, tegenover de miljarden beeld-tekstparen die web-voorgetrainde encoders gebruiken; dus dat het gedrag van SigLIP2-at-10B-class bij clusterdiscriminatie evenaart, is een specifieke, controleerbare claim over data-efficiëntie in plaats van een algemene opschepperij.
MiniCPM-V 4.7 heeft niets hiervan. Niet een zwakkere versie — niets.

Er is geen tabel, van een leverancier of anderszins, en het configuratiebestand dat de architectuur beschrijft, neemt zichzelf expliciet uit van elke uitspraak over nauwkeurigheid.
Architectuur: twee antwoorden op dezelfde vraag
Beide modellen proberen de vraag te beantwoorden: "hoe maak je multimodale inferentie goedkoop", en het contrast is leerzaam omdat de twee antwoorden elkaar aanvullen in plaats van met elkaar te concurreren.
Mage-VL reduceert de invoer. 16×16patchraster wordt gedeeld tussen anker- en voorspelde frames, en de voorspelde frames dragen alleen patches bij waar de codec bits besteedt — en dat is precies waar beweging en nieuw detail zitten. Het resultaat zijn tokenstromen met variabele lengte per frame; daarom heeft de stack een projector nodig die een variabele sequentie aan een causale decoder kan doorgeven, en daarom kan dezelfde interface bewegingsvectoren van H.264/HEVC of de geleerde rate map van een neurale codec accepteren zonder hertraining. Vervolgens houdt een 3D-rotarycodering de spatiotemporele posities coherent te midden van de sparsity. Het tokenbudget is de grootheid die wordt beheerd.
MiniCPM-V 4.7 verkleint de toestand. De linear-attentielagen houden een recurrente toestand van vaste grootte bij in plaats van een groeiende key-value-cache, zodat de geheugenkosten van een lang gesprek niet langer lineair schalen met het aantal tokens. Het sequentebudget is de grootheid die wordt beheerd, en de 256K-context is de opbrengst. Opmerkelijk is dat de config van MiniCPM-V 4.7 de 16x visuele downsample adverteert — hij comprimeert de invoer ook — maar zwijgt over de vraag of hij de schakelbare 4x-modus behoudt die MiniCPM-V 4.6 beschikbaar stelde.
Simpel gezegd: de truc van Mage-VL werpt zijn vruchten af bij video, waar de meeste frames bijna identiek zijn aan hun buren. De truc van MiniCPM-V 4.7 werpt zijn vruchten af bij lange documenten en lange sessies met meerdere beurten, waarin de tokens zich opstapelen. Een pipeline die een livestream verwerkt en er vervolgens een lang gesprek over voert, zou bij beide baat hebben, en geen van beide modellen doet vooralsnog het werk van het andere.
Ze inzetten in een echte workflow
Mage-VL is vandaag de dag praktisch om uit te proberen: één checkpoint, een gedocumenteerde architectuur, Apache-2.0, en een kaart die je vertelt wat de repository bundelt. Het is al sinds juli beschikbaar en de tooling eromheen heeft de tijd gehad om te stabiliseren.
MiniCPM-V 4.7 is vandaag niet praktisch om te proberen, om de saaie redenen. 70 GB in BF16 zonder kwantisatie betekent acceleratorgeheugen dat je waarschijnlijk niet onbenut hebt, en een ontbrekende licentie betekent dat de vraag of je het überhaupt mag gebruiken openstaat. De aangepaste codepaden vereisen trust_remote_code, en of de combinatie MoE-plus-linear-attention kernels heeft in je servingstack, is ongetest.
Wat voor beide geldt, is dat een zelfgehost visionmodel één onderdeel is van een systeem dat ook frontier-modellen moet aanroepen. Dat pleit ervoor om het gehoste deel achter één enkele router te zetten in plaats van een tweede contract en een tweede SDK: OrcaRouter bereikt meer dan 200 modellen met één sleutel, geeft de lijstprijs van elke provider door zonder dat wij er een opslag op zetten, en schakelt automatisch over wanneer een provider verslechtert. Noch Mage-VL noch MiniCPM-V 4.7 is een gehost model op die dienst — beide zijn gewichten die je zelf serveert — dus beschouw dit als de bedrading aan de andere kant van de overdracht, niet als een beschikbaarheidskanaal voor een van beide modellen.
Vonnis
Mage-VL is een afgerond, gelicentieerd, gebenchmarkt model met een specifieke en goed beargumenteerde ontwerpfilosofie, en de argumenten ervoor berusten op videostreaming en ruimtelijke redenering, waar zijn codec-native encoder iets structureel anders doet dan alle anderen. MiniCPM-V 4.7 is een groter, niet-gelicentieerd, niet-gemeten checkpoint waarvan de ontwerpfilosofie navolgbaar is, maar waarvan het gedrag een onbeschreven blad is. Op alles waarop een lezer vandaag kan afgaan, wint Mage-VL automatisch — niet omdat het beter is, maar omdat het de enige van de twee is die überhaupt kan worden beoordeeld. Kom op deze vergelijking terug zodra de README van MiniCPM-V 4.7 verschijnt; als die dag benchmarks en een licentie brengt, is de interessante vraag of een 256K-context linear-attention MoE een codec-native sparsity-encoder verslaat op lange video, en dat is een echt open strijd.
