
MiniCPM-V 4.7 vs. Microsoft Mage-VL: Zwei sehr unterschiedliche Wetten darauf, was ein Vision-Modell pro Frame kosten sollte
- openaiNEUOpenAI: GPT-6.1 Sol2026-09-2952Intelligenz
- anthropicNEUAnthropic: Claude Sonnet 5.52026-09-2856Intelligenz
- typesafeNEUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 pro 1 Mio. Tokens · 150 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligenz
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligenz
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligenz
- xAIGrok 4.72026-09-2146Intelligenz
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 pro 1 Mio. Tokens · 98 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens · 1202 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 pro 1 Mio. Tokens · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens · 248 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
MiniCPM-V 4.7 und Microsoft Mage-VL sind beide Vision-Language-Modelle, die behaupten, Tokens zu sparen, und sie erreichen das auf entgegengesetzten Wegen. Mage-VL, veröffentlicht von Microsoft am 25. Juli 2026, greift die Videoseite an: Es leiht sich die Struktur eines Videocodecs, behält jeden Patch von Ankerframes und nur die Patches vorhergesagter Frames, die echte Bewegung enthalten, und beansprucht eine Reduktion der visuellen Tokens um mehr als 75 % bei einer bis zu 3,5-fachen Wall-Clock-Beschleunigung gegenüber gleichmäßigem Frame-Sampling. MiniCPM-V 4.7, hochgeladen von OpenBMB am 6. Oktober 2026, greift die Sequenzseite an: ein sparse MoE mit 35,2 Milliarden Parametern, bei dem 30 seiner 40 Schichten auf einem Linear-Attention-Pfad liegen, was den KV-Cache über einen 256K-Kontext nur langsam wachsen lässt. Das eine Modell komprimiert, was es ansieht. Das andere komprimiert, was es sich merkt. Und nur eines von beiden bringt etwas mit, das man evaluieren kann.
Was jedes einzelne ist
Microsoft Mage-VL ist ein codec-natives, proaktiv streamendes multimodales Foundation-Modell im 4B-Maßstab, veröffentlicht unter Apache-2.0 mit einem technischen Bericht und einem umfangreichen Evaluierungsabschnitt. Es wurde bewusst gegen das entwickelt, was seine Autoren ein Moravec-Paradoxon für VLMs nennen – stark beim Offline-Reasoning, langsam bei der Echtzeitwahrnehmung. Der visuelle Encoder, Mage-ViT, wird vollständig von Grund auf auf rund 100 Millionen unbeschrifteten Bildern und Videos trainiert, statt aus einem web-vortrainierten ViT initialisiert zu werden, und die einzige vortrainierte Komponente im Stack ist das Sprach-Backbone Qwen3-4B-Instruct-2507. Der vollständige Checkpoint ist ein einziges vereinheitlichtes Modell, das Bildverständnis, Offline-Videoreasoning und ereignisgesteuertes Streaming-Kommentieren ohne separate Varianten übernimmt, und eine begleitende microsoft/Mage-ViTVeröffentlichung stellt den Encoder separat bereit. Seit der Veröffentlichung hat es etwa 10.600 Downloads und 420 Likes angesammelt.
MiniCPM-V 4.7 ist openbmb/MiniCPM-V-4.7-35B-A3B, ein BF16-Checkpoint mit 35.212.875.824 Parametern in sechzehn Shards mit insgesamt 70,4 GB, geschrieben von Transformers 5.2.0 und hochgeladen am 6. Oktober 2026 ohne Modellkarte.

Die Textkonfiguration ist mit qwen3_5_moe_text getaggt und hat 256 Experten und 8 aktive pro Token; ihr layer_types-Array weist über 40 Schichten hinweg auf jede Full-Attention-Schicht drei Linear-Attention-Schichten auf; der Vision-Tower ist der hauseigene minicpmv4_7_vision mit 27 Schichten, 16× Downsampling und bis zu neun Bildausschnitten. Der Kontext beträgt 256K. Das Repository hat null Downloads, drei Likes, keine Benchmarks und keine Lizenz.
Die sechs Zeilen, die ein Leser überprüfen kann
Dieselben sechs Dimensionen, auf beiden Seiten. Wo keine Zahl vorhanden ist, bleibt die Lücke sichtbar.
• Parameter — Mage-VL: 4,74B, dicht, alle pro Token aktiv. MiniCPM-V 4.7: insgesamt 35,2B, dünn besetzt, 8 von 256 Experten pro Token. Die MiniCPM-Zahl ist nicht mit einer dichten vergleichbar.
• Lizenz — Mage-VL: Apache-2.0, angegeben in der Model Card und den Repo-Tags. MiniCPM-V 4.7: nichts angegeben.
• Woher die Token-Einsparungen kommen — Mage-VL: Sparsität visueller Token am Encoder, codec-abgestimmt, gibt über 75 % Reduktion an. MiniCPM-V 4.7: lineare Attention im Decoder, was das Wachstum des KV-Cache über lange Sequenzen verringert, aber nicht die Token reduziert, die man ihm zuführt.
• Kontext — Mage-VL: in einer Langkontext-Phase auf 350K Videos als rollierende Codec-Fenster von bis zu 384 oder 768 Frames trainiert. MiniCPM-V 4.7: max_position_embeddings: 262144.
• Herkunft des Vision-Encoders — Mage-VL: von Grund auf, trainiert auf ~100 Mio. unbeschrifteten Frames; die Modellkarte meldet 85,69 % auf ImageNet mit 256 Tokens und eine monotone Verbesserung mit dem Token-Budget. MiniCPM-V 4.7: Der Lineage-Tower wurde aus dem Design von MiniCPM-V 4.6 bei derselben Form mit 1152 Hidden und 27 Schichten wiederverwendet, standardmäßig mit 16x-Downsampling.
• Belege — Mage-VL: ein vollständiges Datenblatt mit DocVQA 95,14, InfoVQA 80,33, OCRBench 81,80, ChartQAPro 32,57, MMStar 67,32, CV-Bench-3D 94,75 und einem CrossPoint-Vorsprung von +53,1 gegenüber Qwen3-VL-4B, alle vom Anbieter angegeben und auf einen vergleichbaren Backbone bezogen. MiniCPM-V 4.7: keine.
• Streaming-Verhalten — Mage-VL: ein Kognitions-Gate, das jedes rollierende Fenster bewertet und still bleibt, bis ein Ereignis abgeschlossen ist, trainiert auf ~3,3 Mio. Streaming-Samples. MiniCPM-V 4.7: nirgendwo beschrieben.

Der Teil, bei dem alle die Zahlen von Mage-VL falsch verstehen
Die Benchmark-Tabellen der Mage-VL-Karte sind stark, und die stärksten sind zugleich die, die am leichtesten falsch gelesen werden. Die Vergleichszeilen setzen Mage-VL-4B gegen Qwen3-VL-4B, Phi-4-Multimodal-Instruct und Phi-4-Reasoning-Vision, und die prominenten Zuwächse — +22,5 bei QVHighlight, +24,5 bei VideoEval-Pro, +53,1 bei CrossPoint — sind insofern echt, als sie in den Tabellen des Anbieters erscheinen. Sie sind außerdem die eigenen Messungen des Anbieters – erstellt von dem Team, das das Modell trainiert hat, auf demselben Harness. Keine unabhängige Seite hat sie reproduziert. Das ist für ein vier Monate altes Modell normal und kein Makel, aber es bedeutet, dass das richtige Verb „reports“ und nicht „scores“ lautet.
Zwei Dinge verdienen über die Tabellen hinaus Anerkennung. Erstens ist das Design mit abgestimmtem Backbone – den Qwen3-4B-Decoder festzuhalten und nur den ViT auszutauschen – ein saubererer Beleg als eine Platzierung im Leaderboard, weil es den visuellen Stack isoliert statt das gesamte System. Zweitens umfasst der Trainingskorpus für Mage-ViT etwa 100 Mio. unbeschriftete Frames gegenüber den Milliarden von Bild-Text-Paaren, die web-vortrainierte Encoder verwenden. Daher ist das Erreichen von SigLIP2-at-10B-class-Verhalten bei Cluster-Diskriminierung eine konkrete, überprüfbare Aussage zur Dateneffizienz und keine allgemeine Angeberei.
MiniCPM-V 4.7 hat nichts davon. Nicht eine schwächere Version — gar nichts.

Es gibt keine Tabelle, weder vom Anbieter noch sonst eine, und die Konfigurationsdatei, die die Architektur beschreibt, schließt sich selbst ausdrücklich davon aus, irgendetwas über Genauigkeit auszusagen.
Architektur: zwei Antworten auf dieselbe Frage
Beide Modelle versuchen, die Frage zu beantworten, „wie macht man multimodale Inferenz günstig“, und der Kontrast ist aufschlussreich, weil die beiden Antworten sich ergänzen statt zu konkurrieren.
Mage-VL reduziert die Eingabe. Sein 16×16 Patch-Raster wird zwischen Anker- und vorhergesagten Frames geteilt, und die vorhergesagten Frames tragen nur Patches bei, wo der Codec Bits ausgibt — also dort, wo Bewegung und neue Details sind. Das Ergebnis sind Token-Streams variabler Länge pro Frame, weshalb der Stack einen Projektor benötigt, der eine variable Sequenz an einen kausalen Decoder übergeben kann, und dieselbe Schnittstelle H.264/HEVC-Bewegungsvektoren oder die gelernte Ratenkarte eines neuronalen Codecs ohne Neutraining akzeptieren kann. Dann hält eine 3D-Rotationskodierung die raumzeitlichen Positionen über die Sparsität hinweg kohärent. Das Token-Budget ist die Größe, die verwaltet wird.
MiniCPM-V 4.7 reduziert den Zustand. Seine Linear-Attention-Schichten behalten einen rekurrenten Zustand fester Größe bei, anstatt eines wachsenden Key-Value-Caches, sodass die Speicherkosten einer langen Konversation nicht mehr linear mit der Token-Anzahl skalieren. Sein Sequenzbudget ist die Größe, die verwaltet wird, und der 256K-Kontext ist der Gewinn. Bemerkenswert ist, dass die Konfiguration von MiniCPM-V 4.7 den 16-fachen visuellen Downsample bewirbt – auch die Eingabe wird komprimiert –, aber nichts darüber aussagt, ob der umschaltbare 4x-Modus beibehalten wird, den MiniCPM-V 4.6 bot.
Einfach gesagt: Der Trick von Mage-VL zahlt sich bei Video aus, bei dem die meisten Frames nahezu identisch mit ihren Nachbarn sind. Der Trick von MiniCPM-V 4.7 zahlt sich bei langen Dokumenten und langen Multi-Turn-Sitzungen aus, in denen sich die Tokens anhäufen. Eine Pipeline, die einen Live-Stream aufnimmt und dann ein langes Gespräch darüber führt, würde von beidem profitieren, und keines der Modelle erledigt bisher die Aufgabe des anderen.
Sie in einen echten Workflow einbinden
Mage-VL lässt sich heute ganz praktisch ausprobieren: ein Checkpoint, eine dokumentierte Architektur, Apache-2.0 und eine Karte, die verrät, was das Repository mitliefert. Es ist seit Juli verfügbar, und das Tooling drumherum hatte Zeit, sich zu etablieren.
MiniCPM-V 4.7 ist heute aus den langweiligen Gründen nicht praktikabel auszuprobieren. 70 GB in BF16 ohne Quantisierung bedeutet Beschleuniger-Speicher, den Sie wahrscheinlich nicht ungenutzt haben, und eine fehlende Lizenz bedeutet, dass die Frage, ob Sie es überhaupt verwenden dürfen, offen ist. Die benutzerdefinierten Codepfade erfordern trust_remote_code, und ob die Kombination aus MoE und linearer Attention Kernel in Ihrem Serving-Stack hat, ist ungetestet.
Was für beide gilt, ist, dass ein selbst gehostetes Vision-Modell eine Komponente eines Systems ist, das auch Frontier-Modelle aufrufen muss. Das ist das Argument dafür, das gehostete Modell hinter einen einzigen Router zu setzen, statt einen zweiten Vertrag und ein zweites SDK zu nutzen: OrcaRouter bietet mit einem einzigen Schlüssel Zugriff auf über 200 Modelle, gibt den Listenpreis jedes Anbieters ohne von uns hinzugefügten Aufschlag weiter und schaltet automatisch um, wenn die Leistung eines Anbieters nachlässtWeder Mage-VL noch MiniCPC-V 4.7 ist ein gehostetes Modell bei diesem Dienst – beide sind Modelle, die Sie selbst hosten. Behandeln Sie dies also als die Infrastruktur auf der anderen Seite des Modells, nicht als Verfügbarkeitskanal für eines der beiden Modelle.
Urteil
Mage-VL ist ein fertiggestelltes, lizenziertes, benchmarktes Modell mit einer spezifischen und gut begründeten Designphilosophie, und seine Argumentation stützt sich auf Videostreaming und räumliches Reasoning, wo sein codec-nativer Encoder etwas strukturell anderes tut als alle anderen. MiniCPM-V 4.7 ist ein größerer, nicht lizenzierter, nicht evaluierter Checkpoint, dessen Designphilosophie erkennbar ist, dessen Verhalten aber eine Leerstelle bleibt. In allem, worauf ein Leser heute aufbauen kann, gewinnt Mage-VL standardmäßig – nicht weil es besser ist, sondern weil es das einzige der beiden ist, das überhaupt beurteilt werden kann. Kommen Sie auf diesen Vergleich zurück, wenn das README zu MiniCPM-V 4.7 erscheint; wenn dieser Tag Benchmarks und eine Lizenz bringt, wird die interessante Frage sein, ob ein Linear-Attention-MoE mit 256K-Kontext einen codec-nativen Sparsity-Encoder bei langen Videos schlägt, und das ist ein wirklich offenes Kräftemessen.
