Ett genererat hero-titelkort för 'MiniCPM-V 4.7 vs Microsoft Mage-VL' med underrubriken 'Två sätt att sänka kostnaden för att titta på video', ett kort till vänster med texten 'Mage-VL: codec-native token-sparsitet, 75 % färre visuella tokens', ett kort till höger med texten 'MiniCPM-V 4.7: linjär attention, platt KV-cache över 256K' och en pillerformad etikett med texten 'Komprimera indata, eller komprimera tillståndet', med OrcaRouter-logotypen i det nedre högra hörnet.
Guides & Insights

MiniCPM-V 4.7 mot Microsoft Mage-VL: Två väldigt olika satsningar på vad en visionsmodell bör kosta per bildruta

Författare

Magnus Corvin

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller →
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

MiniCPM-V 4.7 och Microsoft Mage-VL är båda visions- och språkmodeller som påstås spara tokens åt dig, och de når dit via motsatta vägar. Mage-VL, som Microsoft släppte den 25 juli 2026, angriper videosidan: den lånar strukturen från en videokodek, behåller varje patch från ankarbildrutor och endast de patchar från predikterade bildrutor som innehåller verklig rörelse, och uppger en minskning av visuella tokens på över 75 % med upp till 3,5 gånger snabbare väggklockstid jämfört med enhetligt urval av bildrutor. MiniCPM-V 4.7, som laddades upp av OpenBMB den 6 oktober 2026, angriper sekvenssidan: en gles MoE med 35,2 miljarder parametrar där 30 av dess 40 lager ligger på en linjär-attention-väg, vilket gör att KV-cachen växer långsamt över en kontext på 256K. Den ena modellen komprimerar det den tittar på. Den andra komprimerar det den minns. Och bara en av dem kommer med något du kan utvärdera.

Vad var och en är

Microsoft Mage-VL is a codec-native, proactive-streaming multimodal foundation model at a 4B scale, released under Apache-2.0 with a technical report and a substantial evaluation section. It was built deliberately against what its authors call a Moravec's paradox for VLMs — strong at offline reasoning, slow at real-time perception. The visual encoder, Mage-ViT, is trained entirely from scratch on roughly 100 million unlabeled images and videos rather than initialised from a web-pretrained ViT, and the only pretrained component in the stack is the Qwen3-4B-Instruct-2507 language backbone. The full checkpoint is a single unified model that does image understanding, offline video reasoning, and event-gated streaming commentary without separate variants, and a companion microsoft/Mage-ViT release provides the encoder on its own. It has accumulated about 10,600 downloads and 420 likes since release.

MiniCPM-V 4.7 är openbmb/MiniCPM-V-4.7-35B-A3B, en BF16-checkpoint med 35 212 875 824 parametrar i sexton delar med en total storlek på 70,4 GB, skriven av Transformers 5.2.0 och uppladdad den 6 oktober 2026 utan modellkort.

A generated two-column comparison scoreboard titled 'MiniCPM-V 4.7 vs Microsoft Mage-VL — the scoreboard'. Left column 'MiniCPM-V 4.7' lists Parameters 35.2B sparse, Licence none declared, Token savings linear attention, Context 256K, Vision 16x downsample, Evidence no card no benchmarks. Right column 'Mage-VL' lists Parameters 4.74B dense, Licence Apache-2.0, Token savings 75% fewer visual tokens, Context up to 768 frame windows, Vision from-scratch Codec-ViT, Evidence full card with tables. The footer reads 'Mage-VL figures vendor-reported; MiniCPM-V 4.7 figures read from config.json.'

Dess textkonfiguration är taggad qwen3_5_moe_text med 256 experter och 8 aktiva per token; dess layer_types-array kör tre linjära attentionlager för varje fullt attentionlager över 40 lager; dess visionstorn är det egenutvecklade minicpmv4_7_vision med 27 lager, 16× nedsampling och upp till nio bildsnitt. Kontexten är 256K. Repositoriet har noll nedladdningar, tre gillningar, inga benchmarks och ingen licens.

De sex raderna en läsare kan kontrollera

Samma sex dimensioner, på båda sidor. Där ett nummer inte finns lämnas gapet synligt.

• Parametrar – Mage-VL: 4,74B, tät, alla aktiva per token. MiniCPM-V 4.7: 35,2B totalt, gles, 8 av 256 per token. MiniCPM-siffran är inte jämförbar med siffran för en tät modell.

• Licens — Mage-VL: Apache-2.0, anges i kortet och i repots taggar. MiniCPM-V 4.7: inget deklarerat.

• Varifrån token-besparingarna kommer — Mage-VL: gleshet i visuella token i encodern, codec-anpassad, uppges ge över 75 % minskning. MiniCPM-V 4.7: linjär attention i decodern, vilket minskar tillväxten av KV-cache över långa sekvenser men inte minskar antalet token du matar in i den.

• Kontext — Mage-VL: tränad genom en långkontextfas på 350K videor som rullande codec-fönster på upp till 384 eller 768 bildrutor. MiniCPM-V 4.7: max_position_embeddings: 262144.

• Proveniens för visionskodare — Mage-VL: från grunden, tränad på ~100 miljoner omärkta bildrutor; modellkortet rapporterar 85,69 % på ImageNet med 256 token och monoton förbättring med tokenbudgeten. MiniCPM-V 4.7: härkomsttornet återanvänt från MiniCPM-V 4.6:s design i samma 1152-dolda, 27-lagersform, med 16x nedsampling som standard.

• Bevis — Mage-VL: ett fullt kort med DocVQA 95,14, InfoVQA 80,33, OCRBench 81,80, ChartQAPro 32,57, MMStar 67,32, CV-Bench-3D 94,75 och ett +53,1 CrossPoint-gap jämfört med Qwen3-VL-4B, alla leverantörsrapporterade mot en matchad backbone. MiniCPM-V 4.7: inget.

• Streamingbeteende — Mage-VL: en kognitionsgrind som poängsätter varje rullande fönster och förblir tyst tills en händelse har slutförts, tränad på ~3,3 miljoner streamingprover. MiniCPM-V 4.7: beskrivs inte någonstans.

A screenshot of the Hugging Face model page for openbmb/MiniCPM-V-4.7-35B-A3B (captured 7 October 2026) showing the model header with three likes, the tags safetensors, minicpmv4_7 and region:us, and the file listing with no README or licence field.

Delen som alla har fel om när det gäller Mage-VLs siffror

Mage-VL-kortets benchmarktabeller är starka, och de starkaste är också de som lättast misstolkas. Jämförelseraderna ställer Mage-VL-4B mot Qwen3-VL-4B, Phi-4-Multimodal-Instruct och Phi-4-Reasoning-Vision, och de framträdande vinsterna – +22,5 på QVHighlight, +24,5 på VideoEval-Pro, +53,1 på CrossPoint – är verkliga i den meningen att de förekommer i leverantörens tabeller. De är också leverantörens egna mätningar, framtagna av teamet som tränade modellen, i samma testramverk. Ingen oberoende part har reproducerat dem. Det är normalt för en fyra månader gammal modell och är inte ett minus för den, men det innebär att det korrekta verbet är ”rapporterar”, inte ”uppnår”.

Två saker förtjänar erkännande bortom tabellerna. För det första är designen med matchad backbone – att hålla Qwen3-4B-dekodaren fixerad och endast byta ut ViT:n – ett renare bevis än en placering på en resultattavla, eftersom den isolerar den visuella stacken snarare än hela systemet. För det andra är träningskorpusen för Mage-ViT cirka 100 miljoner omärkta bildrutor mot de miljarder bild-text-par som webbförtränade encoders använder, så att matcha SigLIP2-beteende i 10B-klass på kluster är ett specifikt, kontrollerbart påstående om dataeffektivitet snarare än ett allmänt skryt.

MiniCPM-V 4.7 har inget av detta. Inte en svagare version — inget.

A screenshot of the Hugging Face model page for microsoft/Mage-VL (captured 7 October 2026) showing the model header, the mage_vl and video-understanding tags, the Apache-2.0 licence badge, the project page and GitHub links, and the opening of the Mage-VL card describing it as a codec-native, proactive-streaming multimodal foundation model at a 4B scale.

Det finns ingen tabell, varken från leverantör eller annan, och konfigurationsfilen som beskriver arkitekturen utesluter sig själv uttryckligen från att säga något om noggrannhet.

Arkitektur: två svar på samma fråga

Båda modellerna försöker svara på "hur gör man multimodal inferens billig", och kontrasten är lärorik eftersom de två svaren kompletterar varandra snarare än konkurrerar.

Mage-VL reducerar indata. Dess 16×16 patchrutnät delas mellan ankarbildrutor och predikterade bildrutor, och de predikterade bildrutorna bidrar bara med patchar där codec:en spenderar bitar — vilket är där rörelse och nya detaljer finns. Resultatet blir tokenströmmar med variabel längd per bildruta, vilket är varför stacken behöver en projektor som kan skicka en variabel sekvens till en kausal avkodare, och varför samma gränssnitt kan ta emot H.264/HEVC-rörelsevektorer eller en inlärd bithastighetskarta från en neural codec utan omträning. Därefter håller en 3D-rotationskodning spatiotemporala positioner koherenta genom sparsiteten. Tokenbudgeten är den kvantitet som hanteras.

MiniCPM-V 4.7 reducerar tillståndet. Dess linjära attention-lager behåller ett återkommande tillstånd med fast storlek i stället för en växande nyckel-värde-cache, så minneskostnaden för en lång konversation slutar skalas linjärt med antalet tokens. Dess sekvensbudget är den kvantitet som hanteras, och 256K-kontexten är vinsten. Noterbart är att MiniCPM-V 4.7:s config annonserar 16x visuell nedskalning – den komprimerar även indata – men tiger om huruvida den behåller det växlingsbara 4x-läget som MiniCPM-V 4.6 exponerade.

Enkelt uttryckt: Mage-VL:s knep lönar sig på video där de flesta bildrutor är nästan identiska med sina grannar. MiniCPM-V 4.7:s knep lönar sig på långa dokument och långa fleromgångssessioner där tokens ackumuleras. En pipeline som tar in en live-ström och sedan håller en lång konversation om den skulle dra nytta av båda, och ingen av modellerna gör ännu den andras uppgift.

Servera dem i ett verkligt arbetsflöde

Mage-VL är praktiskt att prova redan idag: en checkpoint, en dokumenterad arkitektur, Apache-2.0 och ett kort som berättar vad repot innehåller. Det har funnits sedan juli och verktygen runt det har haft tid att sätta sig.

MiniCPM-V 4.7 är inte praktiskt att prova idag, av de tråkiga skälen. 70 GB i BF16 utan kvantisering innebär acceleratorminne som du förmodligen inte har ledigt, och en saknad licens innebär att frågan om du överhuvudtaget får använda den är öppen. De anpassade kodvägarna kräver trust_remote_code, och huruvida kombinationen av MoE och linjär attention har kärnor i din serveringsstack är otestat.

Det som gäller för båda är att en självhostad visionsmodell är en komponent i ett system som också måste anropa frontier-modeller. Det talar för att lägga den hostade halvan bakom en enda router i stället för ett andra avtal och ett andra SDK: OrcaRouter når fler än 200 modeller med en enda nyckel, vidarebefordrar varje leverantörs listpris utan något påslag från oss och växlar automatiskt över när en leverantörs prestanda försämras. Varken MiniCPM-V 4.7 eller MiniCPM-V 4.7 är en hostad modell på den tjänsten – båda är vikter som du själv serverar – så betrakta detta som rördragningen på andra sidan överlämningen, inte som en tillgänglighetskanal för någon av modellerna.

Dom

Mage-VL är en färdig, licensierad, benchmarkad modell med en specifik och välargumenterad designfilosofi, och argumentet för den vilar på videoströmning och spatialt resonemang där dess codec-native encoder gör något strukturellt annorlunda än alla andra. MiniCPM-V 4.7 är en större, olicensierad, omätt checkpoint vars designfilosofi är läsbar men vars beteende är ett oskrivet blad. På allt en läsare kan agera utifrån vinner Mage-VL automatiskt — inte för att den är bättre, utan för att den är den enda av de två som kan bedömas. Återkom till den här jämförelsen när MiniCPM-V 4.7:s README dyker upp; om den dagen för med sig benchmarks och en licens, kommer den intressanta frågan att vara huruvida en 256K-kontext linjär-attention-MoE slår en codec-native sparsity-encoder på lång video, och det är en genuint öppen kamp.