Een gegenereerde hero-titelkaart voor 'MiniCPM-V 4.7 vs Microsoft Mage-VL' met de ondertitel 'Twee manieren om de kosten van het kijken naar video te verlagen', een linkerkaart met de tekst 'Mage-VL: codec-native token-sparsity, 75% minder visuele tokens', een rechterkaart met de tekst 'MiniCPM-V 4.7: lineaire attention, platte KV-cache over 256K' en een pill met de tekst 'Comprimeer de invoer, of comprimeer de toestand', met het OrcaRouter-logo in de rechteronderhoek.
Guides & Insights

MiniCPM-V 4.7 vs Microsoft Mage-VL: Twee heel verschillende gokken op wat een visionmodel per frame zou moeten kosten

Auteur

Magnus Corvin

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen →
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

MiniCPM-V 4.7 en Microsoft Mage-VL zijn beide visie-taalmodellen die beweren je tokens te besparen, en ze bereiken dat via tegenovergestelde routes. Mage-VL, op 25 juli 2026 uitgebracht door Microsoft, pakt de videokant aan: het leent de structuur van een videocodec, behoudt elke patch van ankerframes en alleen de patches van voorspelde frames die echte beweging bevatten, en claimt een vermindering van visuele tokens van meer dan 75%, met een wall-clock-versnelling tot 3,5× ten opzichte van uniforme framebemonstering. MiniCPM-V 4.7, op 6 oktober 2026 geüpload door OpenBMB, pakt de sequentiekant aan: een sparse MoE met 35,2 miljard parameters, waarvan 30 van de 40 lagen op een linear-attention-pad liggen, waardoor de KV-cache langzaam groeit over een context van 256K. Het ene model comprimeert wat het bekijkt. Het andere comprimeert wat het onthoudt. En slechts één van de twee komt met iets dat je kunt evalueren.

Wat elk is

Microsoft Mage-VL is een codec-native, proactief-streamend multimodaal basismodel op 4B-schaal, uitgebracht onder Apache-2.0 met een technisch rapport en een substantiële evaluatiesectie. Het is bewust gebouwd tegen wat de auteurs een Moravec-paradox voor VLM's noemen — sterk in offline redeneren, traag in realtime waarneming. De visuele encoder, Mage-ViT, is volledig vanaf nul getraind op ongeveer 100 miljoen niet-gelabelde afbeeldingen en video's in plaats van geïnitialiseerd te worden vanuit een web-voorgetrainde ViT, en het enige voorgetrainde onderdeel in de stack is de Qwen3-4B-Instruct-2507 taal-backbone. De volledige checkpoint is één enkel uniform model dat beeldbegrip, offline videoredeneren en event-gated streaming commentaar uitvoert zonder afzonderlijke varianten, en een bijbehorende microsoft/Mage-ViT release levert de encoder op zichzelf. Het heeft sinds de release ongeveer 10.600 downloads en 420 likes verzameld.

MiniCPM-V 4.7 is openbmb/MiniCPM-V-4.7-35B-A3B, een BF16-checkpoint met 35.212.875.824 parameters in zestien shards met een totale omvang van 70,4 GB, geschreven door Transformers 5.2.0 en geüpload op 6 oktober 2026 zonder modelcard.

A generated two-column comparison scoreboard titled 'MiniCPM-V 4.7 vs Microsoft Mage-VL — the scoreboard'. Left column 'MiniCPM-V 4.7' lists Parameters 35.2B sparse, Licence none declared, Token savings linear attention, Context 256K, Vision 16x downsample, Evidence no card no benchmarks. Right column 'Mage-VL' lists Parameters 4.74B dense, Licence Apache-2.0, Token savings 75% fewer visual tokens, Context up to 768 frame windows, Vision from-scratch Codec-ViT, Evidence full card with tables. The footer reads 'Mage-VL figures vendor-reported; MiniCPM-V 4.7 figures read from config.json.'

De tekstconfiguratie ervan is getagd als qwen3_5_moe_text met 256 experts en 8 actief per token; de layer_types-array loopt over 40 lagen met drie linear-attentionlagen op elke full-attentionlaag; de vision tower is de eigen minicpmv4_7_vision met 27 lagen, 16× downsampling en tot negen afbeeldingsslices. De context bedraagt 256K. De repository heeft nul downloads, drie likes, geen benchmarks en geen licentie.

De zes rijen die een lezer kan controleren

Dezelfde zes dimensies, aan beide zijden. Waar een getal niet bestaat, blijft de leemte zichtbaar.

• Parameters — Mage-VL: 4,74 miljard, dense, alle actief per token. MiniCPM-V 4.7: 35,2 miljard totaal, sparse, 8 van de 256 experts per token. Het MiniCPM-getal is niet vergelijkbaar met dat van een dense model.

• Licentie — Mage-VL: Apache-2.0, vermeld op de kaart en in de repo-tags. MiniCPM-V 4.7: niets aangegeven.

• Waar de tokenbesparingen vandaan komen — Mage-VL: sparsity van visuele tokens bij de encoder, codec-afgestemd, naar verluidt meer dan 75% reductie. MiniCPM-V 4.7: lineaire attention bij de decoder, wat de KV-cache-groei over lange sequenties verkleint, maar niet de tokens die je erin stopt vermindert.

• Context — Mage-VL: getraind via een lange-contextfase op 350K video's als rollende codec-vensters van maximaal 384 of 768 frames. MiniCPM-V 4.7: max_position_embeddings: 262144.

• Herkomst van vision-encoder — Mage-VL: vanaf nul, getraind op ~100M ongelabelde frames; de kaart rapporteert 85,69% ImageNet met 256 tokens en monotone verbetering met tokenbudget. MiniCPM-V 4.7: lineage-toren hergebruikt van MiniCPM-V 4.6's ontwerp in dezelfde 1152-hidden, 27-laags vorm, met een standaard 16x-downsample.

• Bewijs — Mage-VL: een volledige kaart met DocVQA 95,14, InfoVQA 80,33, OCRBench 81,80, ChartQAPro 32,57, MMStar 67,32, CV-Bench-3D 94,75 en een CrossPoint-verschil van +53,1 ten opzichte van Qwen3-VL-4B, allemaal door de leverancier gerapporteerd tegen een overeenkomstige backbone. MiniCPM-V 4.7: geen.

Streaminggedrag — Mage-VL: een cognitiepoort die elk rollend venster scoort en stil blijft totdat een gebeurtenis is voltooid, getraind op ~3,3 mln. streaming-samples. MiniCPM-V 4.7: nergens beschreven.

A screenshot of the Hugging Face model page for openbmb/MiniCPM-V-4.7-35B-A3B (captured 7 October 2026) showing the model header with three likes, the tags safetensors, minicpmv4_7 and region:us, and the file listing with no README or licence field.

Het deel dat iedereen verkeerd begrijpt aan de cijfers van Mage-VL

De benchmarktabellen van de Mage-VL-kaart zijn sterk, en de sterkste zijn ook het gemakkelijkst verkeerd te lezen. In de vergelijkingsrijen staat Mage-VL-4B tegenover Qwen3-VL-4B, Phi-4-Multimodal-Instruct en Phi-4-Reasoning-Vision, en de meest in het oog springende winsten — +22,5 op QVHighlight, +24,5 op VideoEval-Pro, +53,1 op CrossPoint — zijn echt in de zin dat ze in de tabellen van de leverancier voorkomen. Het zijn ook de eigen metingen van de leverancier, geproduceerd door het team dat het model heeft getraind, op dezelfde harness. Geen enkele onafhankelijke partij heeft ze gereproduceerd. Dat is normaal voor een model dat vier maanden oud is, en het is geen minpunt, maar het betekent wel dat het juiste werkwoord 'rapporteert' is, niet 'scoort'.

Twee dingen verdienen waardering buiten de tabellen. Ten eerste: het matched-backbone-ontwerp — waarbij de Qwen3-4B-decoder vast wordt gehouden en alleen de ViT wordt verwisseld — is een schoner stuk bewijs dan een positie op een leaderboard, omdat het de visuele stack isoleert in plaats van het hele systeem. Ten tweede: het trainingscorpus voor Mage-ViT bestaat uit ongeveer 100M ongelabelde frames, tegenover de miljarden beeld-tekstparen die web-voorgetrainde encoders gebruiken; dus dat het gedrag van SigLIP2-at-10B-class bij clusterdiscriminatie evenaart, is een specifieke, controleerbare claim over data-efficiëntie in plaats van een algemene opschepperij.

MiniCPM-V 4.7 heeft niets hiervan. Niet een zwakkere versie — niets.

A screenshot of the Hugging Face model page for microsoft/Mage-VL (captured 7 October 2026) showing the model header, the mage_vl and video-understanding tags, the Apache-2.0 licence badge, the project page and GitHub links, and the opening of the Mage-VL card describing it as a codec-native, proactive-streaming multimodal foundation model at a 4B scale.

Er is geen tabel, van een leverancier of anderszins, en het configuratiebestand dat de architectuur beschrijft, neemt zichzelf expliciet uit van elke uitspraak over nauwkeurigheid.

Architectuur: twee antwoorden op dezelfde vraag

Beide modellen proberen de vraag te beantwoorden: "hoe maak je multimodale inferentie goedkoop", en het contrast is leerzaam omdat de twee antwoorden elkaar aanvullen in plaats van met elkaar te concurreren.

Mage-VL reduceert de invoer. 16×16patchraster wordt gedeeld tussen anker- en voorspelde frames, en de voorspelde frames dragen alleen patches bij waar de codec bits besteedt — en dat is precies waar beweging en nieuw detail zitten. Het resultaat zijn tokenstromen met variabele lengte per frame; daarom heeft de stack een projector nodig die een variabele sequentie aan een causale decoder kan doorgeven, en daarom kan dezelfde interface bewegingsvectoren van H.264/HEVC of de geleerde rate map van een neurale codec accepteren zonder hertraining. Vervolgens houdt een 3D-rotarycodering de spatiotemporele posities coherent te midden van de sparsity. Het tokenbudget is de grootheid die wordt beheerd.

MiniCPM-V 4.7 verkleint de toestand. De linear-attentielagen houden een recurrente toestand van vaste grootte bij in plaats van een groeiende key-value-cache, zodat de geheugenkosten van een lang gesprek niet langer lineair schalen met het aantal tokens. Het sequentebudget is de grootheid die wordt beheerd, en de 256K-context is de opbrengst. Opmerkelijk is dat de config van MiniCPM-V 4.7 de 16x visuele downsample adverteert — hij comprimeert de invoer ook — maar zwijgt over de vraag of hij de schakelbare 4x-modus behoudt die MiniCPM-V 4.6 beschikbaar stelde.

Simpel gezegd: de truc van Mage-VL werpt zijn vruchten af bij video, waar de meeste frames bijna identiek zijn aan hun buren. De truc van MiniCPM-V 4.7 werpt zijn vruchten af bij lange documenten en lange sessies met meerdere beurten, waarin de tokens zich opstapelen. Een pipeline die een livestream verwerkt en er vervolgens een lang gesprek over voert, zou bij beide baat hebben, en geen van beide modellen doet vooralsnog het werk van het andere.

Ze inzetten in een echte workflow

Mage-VL is vandaag de dag praktisch om uit te proberen: één checkpoint, een gedocumenteerde architectuur, Apache-2.0, en een kaart die je vertelt wat de repository bundelt. Het is al sinds juli beschikbaar en de tooling eromheen heeft de tijd gehad om te stabiliseren.

MiniCPM-V 4.7 is vandaag niet praktisch om te proberen, om de saaie redenen. 70 GB in BF16 zonder kwantisatie betekent acceleratorgeheugen dat je waarschijnlijk niet onbenut hebt, en een ontbrekende licentie betekent dat de vraag of je het überhaupt mag gebruiken openstaat. De aangepaste codepaden vereisen trust_remote_code, en of de combinatie MoE-plus-linear-attention kernels heeft in je servingstack, is ongetest.

Wat voor beide geldt, is dat een zelfgehost visionmodel één onderdeel is van een systeem dat ook frontier-modellen moet aanroepen. Dat pleit ervoor om het gehoste deel achter één enkele router te zetten in plaats van een tweede contract en een tweede SDK: OrcaRouter bereikt meer dan 200 modellen met één sleutel, geeft de lijstprijs van elke provider door zonder dat wij er een opslag op zetten, en schakelt automatisch over wanneer een provider verslechtert. Noch Mage-VL noch MiniCPM-V 4.7 is een gehost model op die dienst — beide zijn gewichten die je zelf serveert — dus beschouw dit als de bedrading aan de andere kant van de overdracht, niet als een beschikbaarheidskanaal voor een van beide modellen.

Vonnis

Mage-VL is een afgerond, gelicentieerd, gebenchmarkt model met een specifieke en goed beargumenteerde ontwerpfilosofie, en de argumenten ervoor berusten op videostreaming en ruimtelijke redenering, waar zijn codec-native encoder iets structureel anders doet dan alle anderen. MiniCPM-V 4.7 is een groter, niet-gelicentieerd, niet-gemeten checkpoint waarvan de ontwerpfilosofie navolgbaar is, maar waarvan het gedrag een onbeschreven blad is. Op alles waarop een lezer vandaag kan afgaan, wint Mage-VL automatisch — niet omdat het beter is, maar omdat het de enige van de twee is die überhaupt kan worden beoordeeld. Kom op deze vergelijking terug zodra de README van MiniCPM-V 4.7 verschijnt; als die dag benchmarks en een licentie brengt, is de interessante vraag of een 256K-context linear-attention MoE een codec-native sparsity-encoder verslaat op lange video, en dat is een echt open strijd.