Eine generierte Hero-Titelkarte für „MiniCPM-V 4.7“ mit dem Untertitel „Ein 35B-A3B-Vision-Modell, hochgeladen ohne Model Card, ohne Lizenz und ohne Benchmarks“, eine Karte mit der Aufschrift „Hochgeladen am 6. Okt. 2026“, eine Checklisten-Karte mit der Aufschrift „Fehlend: Model Card, Lizenz, Benchmarks, Quants“, eine Pill mit der Aufschrift „35,2B Gesamtparameter“ und eine Pill mit der Aufschrift „256K Kontext“, mit dem OrcaRouter-Logo in der unteren rechten Ecke.
Engineering & Research

MiniCPM-V 4.7: OpenBMB hat ein 35B-A3B Vision-Language-Modell ohne Modellkarte, ohne Lizenz und ohne Benchmarks hochgeladen

Autor

Magnus Corvin

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen →
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

MiniCPM-V 4.7 erschien am Abend des 6. Oktober 2026 auf Hugging Face als das Repository openbmb/MiniCPM-V-4.7-35B-A3B — und es ist eines der seltsamsten Dinge, die die MiniCPM-Reihe je veröffentlicht hat, denn fast nichts wurde zusammen mit ihm ausgeliefert. Es gibt keine Modellkarte. Es gibt keine README-Datei. Es gibt keine deklarierte Lizenz. Es gibt keine Benchmark-Tabellen, keinen Launch-Beitrag, keinen technischen Bericht und keinen Eintrag in OpenBMBs eigener GitHub-Dokumentation, die Stand dieser Woche MiniCPM-V 4.6 noch als „das neueste und effizienteste Modell der MiniCPM-V-Reihe“ bezeichnet. Was es gibt, sind 16 Shards aus bfloat16-Gewichten, 70,4 GB davon, die ein Vision-Language-Modell mit 35,2 Milliarden Parametern und Mixture-of-Experts-Architektur mit einem 256K-Kontextfenster und einem ungewöhnlich aggressiven Hybrid-Attention-Design beschreiben. Das reicht, um zu sagen, was das Modell ist. Es reicht noch nicht, um zu sagen, worin es gut ist, und dieser Artikel hält diese beiden Dinge streng auseinander.

Was tatsächlich gelandet ist, Byte für Byte

Das Repository wurde am 6. Oktober 2026 um 18:36 UTC erstellt und erhielt seinen letzten Commit zwölf Minuten später um 18:48 UTC. Dazwischen hat der Uploader die Gewichtsdateien und die Konfiguration hochgeladen, die ein Transformers-Loader benötigt, und dann aufgehört. Die vollständige Dateiliste umfasst achtzehn Einträge:

• Gewichte — sechzehn safetensors-Shards mit den Namen model-00001-00016 bis model-00016-of-00016, mit der Indexdatei model.safetensors.json, die eine gesamte Tensorgröße von 70.425.751.648 Bytes angibt.

• Parameteranzahl — die Hugging Face API liest 35.212.875.824 Parameter, alle in BF16. Beachten Sie: Dies ist die Gesamtanzahl, die bei einem sparse MoE nicht die Anzahl der Parameter ist, die bei einem beliebigen Token aktiv sind.

• Konfiguration — config.json (2.984 Bytes), generation_config.json (186 Bytes), preprocessor_config.json, processor_config.json.

• Tokenizer — tokenizer.json (20 MB), tokenizer_config.json, und chat_template.jinja (7.250 Bytes).

• Fehlt — README.md. Ein direkter Abruf der Rohdatei liefert HTTP 404. Auf Hugging Face bedeutet ein fehlendes README keine Modellkarte, was bedeutet, dass kein Lizenzfeld vorhanden ist, was wiederum bedeutet, dass das Repo überhaupt kein license:-Tag trägt.

Das Repository hat drei Likes, null Downloads und einen leeren Diskussions-Tab. Ein Community-Upload eines 70-GB-Checkpoints zieht normalerweise innerhalb von Stunden Kommentare an – Fragen zu Quants, zum Serving, dazu, was die Lizenz ist. Bei diesem hier ist das nicht passiert, was dazu passt, dass er von einer Handvoll Leute entdeckt wurde, die die openbmbOrganisation beobachten, statt irgendwem angekündigt worden zu sein.

A generated single-column scoreboard titled 'MiniCPM-V 4.7 — the scoreboard' with six rows: Total parameters 35.2B, 8 of 256 experts; Context 256K tokens; Text backbone Qwen3.5 sparse MoE; Attention 30 of 40 layers linear; Vision 16x downsample, 9 slices; Benchmarks none published, with the footer 'Figures read from config.json and the weight index; no vendor benchmarks exist.'

Die Architektur, direkt aus config.json abgelesen

Da es keine Model Card zum Paraphrasieren gibt, ist die Konfigurationsdatei die primäre Quelle, und sie ist ungewöhnlich informativ. Die Klasse ist MiniCPMV4_7ForConditionalGeneration, der Modelltyp ist minicpmv4_7, und sie wurde von Transformers 5.2.0 gespeichert – all das besagt, dass dies ein First-Party-OpenBMB-Checkpoint in der Hauptlinie der MiniCPM-V-Linie ist, kein Community-Fine-Tune, der den Namen trägt.

• Sprach-Backbone — model_type: qwen3_5_moe_text. Ein von Qwen3.5 abgeleiteter Sparse-MoE, das erste Mal, dass die MiniCPM-V-Reihe einen Qwen-MoE-Text-Stack verwendet statt der dichten kleinen Qwen-Varianten, die MiniCPM-V 4.5 und 4.6 angetrieben haben.

• Sparsität — 256 Experten, 8 pro Token ausgewählt, mit einer Zwischengröße der Experten von 512 und einem geteilten Experten derselben Größe. Ein 35B-Gesamt-Checkpoint mit einem 8-von-256-Routing-Muster aktiviert pro Vorwärtsdurchlauf nur einen kleinen Bruchteil davon, was der ganze Sinn des Namens A3B ist: Die Gewichte sind groß, der Rechenaufwand nicht.

• Tiefe und Breite — 40 verborgene Schichten, verborgene Größe 2048, 16 Attention-Heads mit 2 Key/Value-Heads und einer Head-Dimension von 256.

• Hybride Attention — das layer_types-Array ist 40 Einträge lang, und auf drei linear_attention-Layer kommt genau ein full_attention-Layer in einem festen Intervall von 4. Zehn der vierzig Layer verwenden herkömmliche Attention; die anderen dreißig nutzen einen Pfad im Mamba-Stil mit einem Faltungskern von 4. Dies ist die folgenreichste Designentscheidung in der Datei, und es ist dieselbe Richtung, in die sich das breitere Feld bis 2026 bewegt hat.

• Positionskodierung — RoPE mit einem Theta von 10.000.000 und partial_rotary_factor: 0.25, was bedeutet, dass nur ein Viertel der Dimensionen pro Head rotiert wird. Multimodales RoPE ist aktiviert mit mrope_interleaved: true, einer Abschnittsaufteilung von [11, 11, 10] und mrope_mode: canvas.

• Kontext — max_position_embeddings: 262144, und die model_max_length des Tokenizers stimmt überein. 256K Tokens.

• Multi-Token-Vorhersage — mtp_num_hidden_layers: 1, ein einzelner Kopf für spekulative Dekodierung, derselbe Kniff, den MiniCPM-V 4.6 bereits nutzte.

• Vision-Tower — minicpmv4_7_vision, Hidden-Size 1152, 27 Schichten, GELU-tanh-Aktivierungen, Patch-Größe 14 bei einer image_size von 980 und einer insert_layer_id von 6, wo die visuellen Embeddings in den Sprach-Stack eingespleißt werden. Die Form des Towers ähnelt der in MiniCPM-V 4.6, sodass die Vision-Seite eher eine Weiterentwicklung als ein Neuaufbau ist.

• Vision-Kompression — downsample_mode: "16x" und max_slice_nums: 9 im Bildprozessor. MiniCPM-V 4.6 führte ein umschaltbares 4x/16x-Token-Kompressionsschema ein; die 4.7-Konfiguration gibt die 16x-Einstellung als Standard an, wobei der Slicer bis zu neun Teilbilder für hochauflösende Eingaben zulässt.

• Vokabular — 248.144 Token, mit <|image_pad|> bei ID 248.056 und <|video_pad|> bei 248.057. Video ist eine vollwertige Eingabe, genau wie es seit MiniCPM-V 4.5 der Fall ist.

• Ein merkwürdiges Überbleibsel – die Tokenizer-Konfiguration deklariert weiterhin <|audio_start|>, <|audio_end|> und <|audio_pad|>. Das bedeutet fast sicher, dass das Vokabular mit dem Omni-MiniCPM-o-Zweig geteilt wird und nicht, dass MiniCPM-V 4.7 Audio spricht. Es als Audio-Feature zu lesen, wäre ein Fehler, den allein die Konfiguration nicht ausschließen kann.

A screenshot of the Hugging Face model page for openbmb/MiniCPM-V-4.7-35B-A3B (captured 7 October 2026) showing the model header with three likes, the tag chips safetensors, minicpmv4_7 and region:us, and the repository file listing beginning with .gitattributes, chat_template.jinja, config.json and generation_config.json, with no README or model card rendered.

Was die Familie uns sagt, was dieses Repository nicht tut

Die 4.6-Generation ist der Referenzpunkt, und der Kontrast ist die eigentliche Geschichte. MiniCPM-V 4.6 wurde am 11. Mai 2026 als Modell mit 1,3 Milliarden Parametern veröffentlicht, aufgebaut auf einem SigLIP2-400M-Vision-Encoder und einem Qwen3.5-0.8B-Sprachmodell, unter Apache-2.0, mit einer ausdrücklichen Botschaft: Es erreicht 13 Punkte im Artificial Analysis Intelligence Index — eine vom Anbieter gemeldete Zahl — und verwendet dabei drastisch weniger Tokens als vergleichbare kleine Modelle; außerdem läuft es auf iOS, Android und HarmonyOS, wobei der Edge-Anpassungscode quelloffen ist. Seine ganze Identität war „klein, effizient, auf dem Gerät“.

MiniCPM-V 4.7 ist 1,3B mal ungefähr 27. Der Name 35B-A3B ordnet es in die Klasse ein, die von Sparse-Flaggschiffen besetzt wird, nicht von Telefonen. Ob OpenBMB es als serverseitigen Begleiter der Edge-Linie, als Teacher für ein zukünftiges kleines Modell oder als Test der Fähigkeitsobergrenze beabsichtigt, wird nirgendwo angegeben, und das Repository enthält keinerlei Hinweis in die eine oder andere Richtung.

Was wirklich neu ist und es wert ist, für alle hervorgehoben zu werden, die die Serie verfolgen, ist das Qwen-MoE-Backbone zusammen mit dem 3:1-Verhältnis von linearer zu vollständiger Attention. Beides sind Abweichungen. Alles, was OpenBMB über die Familie veröffentlicht, ist noch um 4.6 herum geschrieben, sodass dieser Checkpoint seiner eigenen Dokumentation voraus ist.

A screenshot of the GitHub repository OpenBMB/MiniCPM-V (captured 7 October 2026) showing the repository header and README, whose model table lists MiniCPM-V 4.6 as the latest and most efficient model in the MiniCPM-V series — with no mention of MiniCPM-V 4.7 anywhere on the page.

Was sich noch nicht wissen lässt – und warum diese Liste wichtig ist

Es lohnt sich, beim Ausmaß der Lücke hier Klartext zu reden, denn bei einem 70-GB-Checkpoint besteht die Versuchung, sie mit plausiblen Schlussfolgerungen zu füllen.

• Keine Lizenz. Das ist keine Formalität. MiniCPM-V 4.6 ist Apache-2.0, und die Community erwartet das von dieser Produktlinie. Bei einem Repo ohne Lizenz:-Tag sind standardmäßig in den meisten Rechtsordnungen alle Rechte vorbehalten — man kann nicht sicher darauf aufbauen, bis das Tag erscheint. Diese eine fehlende Datei ist die folgenschwerste Abwesenheit im Repository.

• Keine Benchmarks, weder vom Anbieter gemeldet noch anderweitig. Es gibt nicht eine einzige Zahl, über die man streiten könnte. Wer heute einen MMMU- oder OCRBench-Score für MiniCPM-V 4.7 zitiert, zitiert etwas, das in der Quelle nicht existiert.

• Keine unabhängige Evaluierung. Artificial Analysis und ähnliche Tracker indexieren Modelle nach Namen; ein Checkpoint ohne Karte und ohne Ankündigung bleibt typischerweise eine Zeit lang ungemessen.

• Kein Serving-Rezept. Ob die veröffentlichten Gewichte in vLLM, SGLang oder llama.cpp standardmäßig laufen, wurde von niemandem außerhalb von OpenBMB getestet. Die benutzerdefinierten Codepfade (MiniCPMV4_7ForConditionalGeneration, MiniCPMV4_7Processor, MiniCPMV4_7ImageProcessor, MiniCPMV4_7VideoProcessor) erfordern allesamt trust_remote_code, und die Kombination aus MoE und Linear-Attention ist keine Form, für die jede Inferenz-Engine einen Kernel hat.

• Keine Quantisierungen. MiniCPM-V 4.6 wurde mit GGUF-, AWQ-, GPTQ- und BNB-Varianten veröffentlicht und erreichte im Juni 2026 die Ollama-Bibliothek. Für 4.7 existiert nichts davon. Für ein 35B-Modell ist das der Unterschied zwischen einem Laptop und einem Cluster.

• Es wird keine Beziehung zu 4.6 angegeben. OpenBMB könnte die Edge-Linie ersetzen, sie erweitern oder etwas Orthogonales testen. Das Repository sagt es nicht, und das GitHub-README ebenfalls nicht, das in seinem Commit vom 8. September 2026 4.6 noch als aktuelles Release aufführt.

Es gibt außerdem eine plausible, aber unbestätigte Lesart der Zeitlinie: Die zwölfminütige Lücke zwischen der Erstellung des Repos und dem letzten Commit, das Fehlen einer Karte und das Fehlen jeglichen Posts sind das, wie ein Checkpoint aussieht, wenn er für einen Launch vorbereitet wird statt nach einem. Das ist eine Hypothese über die Absicht, kein Fakt über das Artefakt, und sollte auch so behandelt werden.

Wie du es tatsächlich ausführen würdest, wenn es etwas auszuführen gibt

Nichts hiervon lässt sich derzeit als unterstützter Pfad anführen, aber die Konfiguration schränkt die Optionen ein. Ein BF16-Checkpoint mit 35B Parametern benötigt grob 70 GB Beschleunigerspeicher, bevor der KV-Cache hinzukommt, also ist ein Hobby-Deployment auf einer einzigen GPU vom Tisch, bis Quantisierungen verfügbar sind. Der 256K-Kontext und das lineare Attention-Verhältnis von 3:1 bedeuten, dass der KV-Cache weit langsamer wächst als bei einem herkömmlichen Transformer gleicher Tiefe, was genau der Grund ist, warum diese Architektur die Komplexität wert ist – multimodale Arbeit mit langem Kontext ist der Bereich, in dem sich das Design bezahlt macht. Wenn eine Karte erscheint, sind die ersten Dinge, die zu prüfen sind, die Lizenz, ob ein offizielles vLLM- oder SGLang-Rezept veröffentlicht ist, und ob der 16x-Downsampling-Standard gegen die 4x-Einstellung getauscht werden kann, die 4.6 offengelegt hat.

Für Teams, die ein Modell wie dieses bewerten möchten, sobald es nutzbar ist, liegt das praktische Problem nicht in den Gewichten, sondern in der Infrastruktur drumherum. Ein Modell, das auf Ihrer eigenen GPU läuft, braucht trotzdem alles drumherum – einen Router, der über 200 gehostete Modelle hinter einem einzigen Schlüssel bündelt, zu den Listenpreisen des jeweiligen Anbieters, ohne dass wir einen Aufschlag darauf erheben, und der automatisch ein Failover ausführt, wenn die Leistung eines Anbieters nachlässt. Dafür ist OrcaRouter da, und es lohnt sich, unumwunden zu sagen, dass MiniCPM-V 4.7 selbst kein gehostetes Modell ist: Es ist ein Open-Weights-Checkpoint, den Sie selbst bereitstellen. Der Router ist hier als die andere Hälfte der Architektur wichtig – das Frontier-Modell, an das Ihre 4.7-Box die schwierigen Fälle übergibt, erreichbar über denselben Client, den Sie bereits geschrieben haben.

Der Stand der Dinge und die eine Datei, die aktualisiert werden muss

MiniCPM-V 4.7 existiert. Seine Gewichte sind heute herunterladbar, die Anzahl seiner Gewichte ist exakt, und seine Designentscheidungen aus der Trainingszeit – dünn besetztes MoE, 3:1 lineare Attention, 256K Kontext, 16-fache visuelle Kompression – lassen sich alle aus der Konfigurationsdatei ablesen. Was nicht existiert, ist irgendeine Aussage von OpenBMB darüber, was das Modell tut, was der Betrieb in der Praxis kostet oder was man damit machen darf. Für ein Labor, dessen letztes Vision-Modell eine 1,3B-Edge-Veröffentlichung unter Apache-2.0 mit einer vollständigen Vergleichstabelle war, ist das eine irritierende Lücke, und die vernünftige Haltung ist, das Repository statt den Diskurs zu beobachten. Die eine Datei, die man immer wieder neu laden sollte, ist README.md: Sobald sie erscheint, wird sie die Lizenz, die Benchmarks und wahrscheinlich die Erklärung enthalten, was ein 35B MiniCPM-V in einer auf kleinen Modellen aufgebauten Serie zu suchen hat.

Bis dahin ist die ehrliche Zusammenfassung die langweilige. Dies ist ein echter Checkpoint aus einem echten Labor, unauffällig hochgeladen, und die interessante Frage – taugt er etwas – hat keine veröffentlichte Antwort.

OrcaRouter erreicht über einen einzigen Schlüssel mehr als 200 gehostete Modelle, wobei der Listenpreis jedes Anbieters direkt mit 0 % Aufschlag weitergegeben wird und automatisches Failover zwischen Anbietern erfolgt. Anbieter-Listenpreis mit 0 % Aufschlag weitergegeben MiniCPM-V 4.7 ist keines davon – es ist ein Checkpoint mit offenen Gewichten, den Sie selbst betreiben, und der Router ist das, was auf der anderen Seite der Übergabe sitzt.