
MiniCPM-V 4.7 vs. North Micro Vision Instruct: Cohere hat ein dokumentiertes 2,4B-Modell ausgeliefert; OpenBMB hat eine 70 GB große Leere ausgeliefert
- openaiNEUOpenAI: GPT-6.1 Sol2026-09-2952Intelligenz
- anthropicNEUAnthropic: Claude Sonnet 5.52026-09-2856Intelligenz
- typesafeNEUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 pro 1 Mio. Tokens · 150 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligenz
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligenz
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligenz
- xAIGrok 4.72026-09-2146Intelligenz
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 pro 1 Mio. Tokens · 98 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens · 1202 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 pro 1 Mio. Tokens · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens · 248 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
MiniCPM-V 4.7 und North Micro Vision Instruct sind beides Antworten aus kleinen Laboren auf dieselbe Aufgabenstellung – ein kompaktes Vision-Sprachmodell, das man selbst feinabstimmen und einsetzen kann –, doch nur eines davon ist fertig. North Micro Vision Instruct von Cohere erschien am 10. August 2026 als Modell mit 2,4 Milliarden Parametern und nativer Auflösung unter Apache-2.0, mit einem technischen Blogbeitrag, der die Architektur erklärt, und einer Modellkarte, die auflistet, wofür es gedacht ist. MiniCPM-V 4.7 erschien am 6. Oktober 2026 als Sparse-Mixture-of-Experts-Checkpoint mit 35,2 Milliarden Parametern, sechzehn Shards, keinem README, keinem Lizenzfeld und überhaupt keinem Benchmark. Der interessante Vergleich ist nicht „welches klüger ist“. Sondern dass die beiden Veröffentlichungen gegensätzliche Haltungen gegenüber der Community verkörpern, die sie nutzen muss.
Die beiden Releases und was mit jedem ausgeliefert wurde
North Micro Vision Instruct ist ein Vision-Sprachmodell mit offenen Gewichten und 2,4 Mrd. Parametern von CohereLabs, veröffentlicht unter Apache-2.0. Es ist ausdrücklich als kompakte Grundlage für Prototyping, aufgabenspezifisches Fine-Tuning und spezialisierte multimodale Arbeit positioniert. Sein entscheidendes Merkmal ist die Bildverarbeitung mit nativer Auflösung, die Seitenverhältnisse und feine visuelle Details bewahrt, statt in ein festes Raster umgerechnet zu werden, und die Model Card beansprucht Fähigkeiten in den Bereichen VQA, Captioning, Grounding, OCR, Diagramme und Dokumente. Es unterstützt mehrere Bilder pro Konversation und elf Sprachen – Englisch, Deutsch, Französisch, Spanisch, Italienisch, Portugiesisch, Hindi, Japanisch, Koreanisch, Chinesisch und Arabisch. Die Modellgewichte umfassen 2.484.847.856 Parameter in BF16, und seit der Veröffentlichung hat die MLX-Community 4-Bit-, 5-Bit-, 6-Bit-, 8-Bit-, mxfp8-, mxfp4-, nvfp4- und bf16-Konversionen erstellt, was zeigt, wie eine gesunde Veröffentlichung eines kleinen Modells nach ein paar Monaten aussieht. Es hat etwa 166.500 Downloads und 150 Likes.
MiniCPM-V 4.7 ist openbmb/MiniCPM-V-4.7-35B-A3B: 35.212.875.824 Parameter in BF16, 70,4 GB verteilt auf sechzehn Safetensors-Shards, Klasse MiniCPMV4_7ForConditionalGeneration, von Transformers 5.2.0 gespeichert und am 6. Oktober 2026 hochgeladen.

Sein Text-Backbone ist ein von Qwen3.5 abgeleitetes sparse MoE — 256 Experten, 8 pro Token ausgewählt — mit 40 Schichten, die ein festes Attention-Muster aus drei linearen zu einer vollen Attention fahren, 256K-Kontext und einem hausinternen 27-schichtigen Vision-Tower mit 16-fachem Downsampling. Es gibt keine Model Card. Das Repository verzeichnet drei Likes und keine Downloads.
Seite an Seite, bei den sechs Dingen, die zählen
• Parameter — North Micro Vision Instruct: 2,48B dicht, jeder Parameter pro Token aktiv. MiniCPM-V 4.7: 35,2B insgesamt, 8 von 256 sparse. Keine direkt vergleichbare Zahl.
• Lizenz — North Micro Vision Instruct: Apache-2.0, getaggt und angegeben. MiniCPM-V 4.7: keine deklariert, was standardmäßig „Alle Rechte vorbehalten“ bedeutet.
• Fine-Tuning-Oberfläche — North Micro Vision Instruct: explizit als Basis für aufgabenspezifisches Fine-Tuning konzipiert, mit bereits verfügbaren Community-Quantisierungen. MiniCPM-V 4.7: ein 70-GB-BF16-Checkpoint ohne Quantisierungen und ohne angegebenes Trainingsrezept.
• Auflösungsverarbeitung — North Micro Vision Instruct: native Auflösung, seitenverhältnistreu. MiniCPM-V 4.7: downsample_mode: "16x" mit max_slice_nums: 9, ein slicer-basierter Hochauflösungspfad.
• Sprachabdeckung — North Micro Vision Instruct: elf Sprachen auf der Karte aufgeführt. MiniCPM-V 4.7: nirgends angegeben.
• Kontext — North Micro Vision Instruct: ausgelegt für seine 2,4B-Deployment-Klasse. MiniCPM-V 4.7: max_position_embeddings: 262144, 256K.
• Belege für Qualität — North Micro Vision Instruct: eine veröffentlichte Karte, ein technischer Blogbeitrag, Konvertierungen aus der Community und starke Verbreitung. MiniCPM-V 4.7: nichts, was sich anführen ließe.

Die Asymmetrie, die diesen Vergleich einseitig macht
Es gibt eine bestimmte Art von Vergleichsartikel, die sich hier leicht schreiben ließe: die MiniCPM-V-4.6-Zahlen von OpenBMBs GitHub ziehen, feststellen, dass sie die entsprechende Klasse kleiner Modelle schlagen, und andeuten, dass 4.7 sie erbt. Das wäre unehrlich, und es lohnt sich, den Grund dafür präzise zu benennen. MiniCPM-V 4.7 ist keine größere Version von 4.6. Es ersetzt das dichte 1,3B-Qwen3.5-0.8B-Backbone durch ein 35B-sparses Qwen-MoE, ändert das Attention-Muster auf ein 3:1-Verhältnis von linear zu voll und stellt die Standard-Vision-Kompression auf 16x um. Jede einzelne davon ist eine Änderung an dem Teil des Modells, der die Genauigkeit bestimmt. Familienabstammung ist kein Benchmark.
Die andere Richtung der Unehrlichkeit ist subtiler: das Fehlen einer Model Card als Beweis für ein Problem zu werten. Das ist es nicht. OpenBMB hat seit 2024 neun MiniCPM-V-Generationen veröffentlicht, von denen mehrere für ihre Größe wirklich hervorragend sind, und ein Zwölf-Minuten-Fenster zwischen der Erstellung des Repositorys und dem letzten Commit ist genau das, wie ein erst vorbereitetes und dann veröffentlichtes Artefakt aussieht – nicht wie ein defektes. Die korrekte Lesart von MiniCPM-V 4.7 ist „unbekannt“, und „unbekannt“ ist etwas anderes als „schlecht“.
Coheres Seite hat ihre eigenen Anforderungen an Ehrlichkeit.

Die Qualitätsangaben auf der North Micro Vision Card sind Coheres eigene Messungen, und der technische Deep Dive wurde vom selben Team verfasst. Dass die Community innerhalb weniger Tage sechzehn MLX-Quantisierungen erstellt hat, ist ein Beleg für Akzeptanz, nicht für Genauigkeit – man konvertiert Modelle, die leicht zu konvertieren sind, und ein sauberes 2,4B-Apache-2.0-Release ist leicht zu konvertieren. Weder die Downloadzahl noch die Bandbreite der Quantisierungen sollte als Bewertung gelesen werden.
Wofür jedes tatsächlich da ist
North Micro Vision Instruct ist ein Fine-Tuning-Ziel. Das ist der gesamte Design-Brief, in den eigenen Worten der Karte formuliert: eine kompakte Grundlage für Prototyping und spezialisierte Anwendungen. Wenn Sie eine eng gefasste Aufgabe zur Dokumentenanalyse, Diagrammextraktion oder mehrsprachigen Bildunterschriften haben und ein paar tausend gelabelte Beispiele, ist ein 2,4B-Apache-2.0-Modell mit Eingaben in nativer Auflösung und 8-Bit-plus-Quantisierungen ein vernünftiger Ausgangspunkt, und Sie können es auf ein Edge-Gerät oder eine einzelne Mittelklasse-GPU verschieben, wenn es funktioniert.
MiniCPM-V 4.7 ist, falls es sich als brauchbar erweist, nicht das. Mit 70 GB unquantisiert ist es ein Servermodell, und seine herausragenden Merkmale – ein 256K-Fenster und lineare Attention, die den KV-Cache flach hält – deuten auf Multimodal-Workloads mit langem Kontext hin: stundenlange Video-Transkripte, große Dokumentensätze, ausgedehnte Multi-Turn-Analysen mit Bildern im Verlauf. Das sind echte Workloads, und die Architektur ist eine vernünftige Wette auf sie. Die Wette wurde bisher nur noch nicht bewertet.
Es gibt eine Nuance bei den beiden Komprimierungsstrategien, die man im Hinterkopf behalten sollte. Native Auflösung und 16×-Downsampling sind nicht einfach besser und schlechter. Ein Encoder mit nativer Auflösung verbraucht Tokens, um feine Details zu bewahren, genau das, was OCR und Grounding brauchen. Ein 16×-Downsample verbraucht weniger Tokens und läuft Gefahr, genau diese Details zu verlieren. Was richtig ist, hängt davon ab, ob es bei deiner Aufgabe darum geht, ein dichtes Formular zu lesen oder eine Szene zu beschreiben, und der umschaltbare 4x/16x-Modus von MiniCPM-V 4.6 existierte genau deshalb, weil sich die Antwort je nach Aufgabe ändert. Ob 4.7 diesen Schalter beibehalten hat, ist eines der Dinge, die die Konfiguration nicht verrät.
Wo ein Router passt – und wo nicht
Bei diesen beiden Modellen handelt es sich um Gewichte, die Sie selbst bereitstellen. Weder North Micro Vision Instruct noch MiniCPM-V 4.7 ist ein gehostetes Modell auf OrcaRouter, und nichts hier sollte als Behauptung gelesen werden, dass es so sei. Die Routing-Frage kommt einen Schritt später ins Spiel, wenn das kleine selbst gehostete Modell die Routinearbeit erledigt und etwas Größeres die Fälle übernehmen muss, bei denen es scheitert. Genau für diese Übergabe ist ein Single-Key-Router gedacht – über 200 Modelle verschiedener Anbieter, jeweils zum Listenpreis, ohne Aufschlag unsererseits, mit automatischem Failover bei Leistungseinbußen eines Anbieters – und es lohnt sich, die Schnittstelle geklärt zu haben, bevor Sie sie brauchen, denn der Tag, an dem Ihre 4.7-Evaluierung erfolgreich ist, ist der Tag, an dem Sie einen zweiten Endpunkt ohne einen zweiten Vertrag wollen.
Das Urteil – und was es ändern würde
Cohere hat ein Modell veröffentlicht. OpenBMB hat einen Checkpoint veröffentlicht. Auf jeder Achse, die ein Leser heranziehen kann — Lizenz, Lizenzklarheit, dokumentiertes Verhalten, Fine-Tuning-Bereitschaft, Quantisierung, Sprachabdeckung — ist North Micro Vision Instruct heute die Antwort, und zwar mit deutlichem Abstand. Das ist keine Aussage über die Leistungsfähigkeit, denn ein Vergleich der Leistungsfähigkeit ist nicht möglich. MiniCPM-V 4.7 hat ungefähr zehnmal so viele Parameter wie das Modell, mit dem es verglichen wird, und hat nichts veröffentlicht, was diese Größe rechtfertigen oder widerlegen würde. Die ehrliche Haltung ist, es als ausstehend zu betrachten: ein echtes Artefakt aus einem Labor mit einer echten Erfolgsbilanz, das in einem Repository liegt, in dem eine Datei fehlt, die alles ändern würde — die README.
