Eine generierte Hero-Titelkarte für 'MiniCPM-V 4.7 vs LFM2.5-VL 3B' mit dem Untertitel '70 GB an Gewichten gegenüber einem 3B-Modell, das auf einem Laptop läuft', eine linke Karte mit der Aufschrift 'MiniCPM-V 4.7: 35,2B sparse, keine Lizenz, keine Karte', eine rechte Karte mit der Aufschrift 'LFM2.5-VL 3B: 3,1B dense, LFM Open License v1.0' und eine Pill mit der Aufschrift 'Das eine ist gemessen, das andere nicht', mit dem OrcaRouter-Logo in der unteren rechten Ecke.
Guides & Insights

MiniCPM-V 4.7 vs. LFM2.5-VL 3B: Ein 70-GB-Rätsel gegen ein 3B-Modell, das du auf einem Laptop ausliefern kannst

Autor

Rowan Sterling

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen →
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

MiniCPM-V 4.7 und LFM2.5-VL 3B werden als dieselbe Art von Sache verkauft – kompakte Vision-Language-Modelle, die man selbst betreibt – und in der Praxis könnten sie kaum weiter auseinanderliegen. LFM2.5-VL 3B ist ein fertiges Produkt: ein dokumentierter Checkpoint mit 3,1 Milliarden Parametern von Liquid AI, mit einer Lizenz, einer Modellkarte, GGUF-Quants, die bereits kursieren, und einer sinkenden Zahl guter Gründe, es nicht einfach herunterzuladen und auszuprobieren. MiniCPM-V 4.7 ist ein Sparse-Mixture-of-Experts-Checkpoint mit 35,2 Milliarden Parametern, den OpenBMB am 6. Oktober 2026 auf Hugging Face hochgeladen hat – ohne Modellkarte, ohne Lizenz und ohne jegliche Benchmarks. Sie zu vergleichen bedeutet nicht, zwei Modelle zu vergleichen. Es bedeutet, ein Modell mit einem Artefakt zu vergleichen, das wahrscheinlich noch zu einem Modell werden wird.

Das Duell, gleich vorweg ehrlich gesagt

Diese Seite kann Ihnen ein vollständiges Bild von LFM2.5-VL 3B vermitteln, weil Liquid AI eine veröffentlicht hat. Sie kann Ihnen ein vollständiges Bild von MiniCPM-V 4.7s Form vermitteln und überhaupt nichts über sein Verhalten, weil OpenBMB eine config.json veröffentlicht hat und dann aufgehört hat. Alles Folgende zur MiniCPM-Seite ist aus dieser Konfigurationsdatei und dem Gewichtsindex abgelesen; alles zur Liquid-Seite stammt aus der Modellkarte, und die Leistungsangaben der Karte selbst sind vom Anbieter gemeldet und als solche gekennzeichnet. Wo eine Zahl für das eine Modell existiert und für das andere nicht, ist es das Ehrliche, die Lücke sichtbar zu lassen, statt sie zu kaschieren.

Was jedes einzelne ist

LFM2.5-VL-3B wurde am 11. August 2026 veröffentlicht. Es ist eine multimodale Variante der LFM2.5-Familie, konzipiert für On-Device-Deployment, und es startet nicht bei null: Es nimmt das Sprach-Backbone LFM2.5-2.6B und kombiniert es mit einem SigLIP2-NaFlex-Vision-Encoder. NaFlex ist der Teil, der für Dokumentenarbeit entscheidend ist – es bewahrt das native Seitenverhältnis und die native Auflösung, statt jedes Bild in ein festes Quadrat zu zwingen, weshalb die herausragenden Verbesserungen der Model Card Grounding mit natürlichsprachlichen Abfragen und Ganzseiten-OCR mit Layout-Annotation sind. Es wird unter der LFM Open License v1.0 veröffentlicht und deckt sechzehn Sprachen ab, darunter Englisch, Chinesisch, Japanisch, Koreanisch, Arabisch, Hindi, Französisch, Deutsch, Spanisch, Portugiesisch, Italienisch, Polnisch, Russisch, Thai, Vietnamesisch und Indonesisch. Da es 3B ist, erschienen GGUF-Builds innerhalb eines Tages nach der Veröffentlichung, und eine DSpark-Variante folgte im September, sodass das Ökosystem darum real ist: Du kannst heute eine Quantisierung herunterladen und sie auf einem Laptop ausführen.

MiniCPM-V 4.7 ist ein BF16-Checkpoint mit 35.212.875.824 Parametern, 70,4 GB verteilt auf sechzehn Shards, Klasse MiniCPMV4_7ForConditionalGeneration, hochgeladen auf openbmb/MiniCPM-V-4.7-35B-A3B am 6. Oktober 2026.

A generated two-column comparison scoreboard titled 'MiniCPM-V 4.7 vs LFM2.5-VL 3B — the scoreboard'. Left column 'MiniCPM-V 4.7' lists Parameters 35.2B sparse, On disk 70.4 GB BF16, Licence none declared, Vision 16x downsample, Context 256K, Benchmarks none, Quants none. Right column 'LFM2.5-VL 3B' lists Parameters 3.12B dense, On disk 6 GB BF16, Licence LFM Open v1.0, Vision SigLIP2 NaFlex, Context on-device class, Benchmarks vendor card, Quants GGUF and MLX. The footer reads 'LFM figures vendor-reported; MiniCPM figures read from config.json.'

Ihr Sprach-Backbone trägt die Bezeichnung qwen3_5_moe_text — ein von Qwen3.5 abgeleiteter Sparse-MoE mit 256 Experten und 8 pro Token ausgewählten — und seine 40 Schichten folgen einem festen Aufmerksamkeitsmuster von drei linearen zu einer vollen, sodass 30 der 40 Schichten einen linearen Pfad im Mamba-Stil statt konventioneller Aufmerksamkeit verwenden. Der Kontext beträgt 256K. Der Vision-Tower entstammt der MiniCPM-V-Linie selbst, mit ungefähr derselben Form, die MiniCPM-V 4.6 verwendete. Im Repository gibt es keine README, was auf Hugging Face bedeutet, dass keine Lizenz vorhanden ist.

Der Vergleich, der tatsächlich möglich ist

Sechs Dimensionen, beide Seiten und zu jeder eine Notiz darüber, wie viel Gewicht die Zahl trägt.

• Parameter insgesamt — LFM2.5-VL 3B: 3,12 Mrd., alle pro Token aktiv. MiniCPM-V 4.7: 35,2 Mrd. insgesamt, sparse, 8 von 256 Experten pro Token aktiv. Die MiniCPM-Angabe ist nicht mit einer Dense-Parameteranzahl vergleichbar, und das tatsächliche Budget aktiver Parameter wird nicht veröffentlicht; behandeln Sie „A3B“ als Namen, nicht als Messung.

• Effektive Größe auf der Festplatte — LFM2.5-VL 3B: eine einzelne ~6 GB große safetensors-Datei in BF16 oder ein Bruchteil davon als GGUF. MiniCPM-V 4.7: 70,4 GB verteilt auf sechzehn Shards, nur BF16.

• Lizenz — LFM2.5-VL 3B: LFM Open License v1.0, veröffentlicht und von der Modellkarte verlinkt. MiniCPM-V 4.7: keine angegeben. Ohne einen Lizenz:-Tag gilt standardmäßig „Alle Rechte vorbehalten“, daher ist dies ein Blocker, keine Fußnote.

• Vision-Ansatz — LFM2.5-VL 3B: SigLIP2 NaFlex, native Auflösung mit Beibehaltung des Seitenverhältnisses, Karte beansprucht Ganzseiten-OCR mit Layout-Annotation. MiniCPM-V 4.7: benutzerdefinierter minicpmv4_7_vision Tower mit downsample_mode: "16x" und max_slice_nums: 9.

• Kontext — LFM2.5-VL 3B: Die Serving-Beispiele der Karte sind bescheiden im Vergleich zu einem Long-Context-Design, und die Familie zielt auf On-Device-Speicherbudgets ab. MiniCPM-V 4.7: max_position_embeddings: 262144, wobei der Tokenizer model_max_length bei 256K übereinstimmt.

• Belege für Qualität — LFM2.5-VL 3B: eine veröffentlichte Model Card mit vom Anbieter gemeldeten Verbesserungen gegenüber LFM2-VL-3B, Quantisierungen von Drittanbietern und einer Hugging-Face-Historie von etwa 25.900 Downloads. MiniCPM-V 4.7: null Downloads, drei Likes, keine Model Card, keine Benchmarks, keine unabhängige Evaluierung. Nichts zum Zitieren.

• Tooling — LFM2.5-VL 3B: GGUF- und MLX-Builds von Drittanbietern, plus eine DSpark-Variante. MiniCPM-V 4.7: keine. Es existiert noch keinerlei Quantisierung.

A screenshot of the Hugging Face model page for openbmb/MiniCPM-V-4.7-35B-A3B (captured 7 October 2026) showing the model header with three likes, the tags safetensors, minicpmv4_7 and region:us, and the file listing with no README or licence field.

Die fehlenden zwei Drittel dieser Seite

Jeder Vergleichsartikel in diesem Bereich wird mit einem Benchmark-Absatz geliefert. Dieser hier nicht. Für MiniCPM-V 4.7 gibt es keinen MMMU-, keinen OCRBench-, keinen DocVQA-Wert, keine Grounding-Zahl, keine Latenzmessung und keinen VRAM-Wert – nicht, weil es unbequem gewesen wäre, sie nachzuschlagen, sondern weil nichts im Repository sie enthält und kein Dritter sie erstellt hat. Ein Modell, das ohne Modellkarte hochgeladen wird, ist aus Bewertungssicht nicht vermessen. Wer Ihnen etwas anderes erzählt, leitet es vom Familiennamen oder von der Parameterzahl ab – beides sind schlechte Prädiktoren für multimodale Qualität.

Dasselbe gilt für eine subtilere Frage: ob das sparse MoE tatsächlich hilft. Ein 35B-A3B-Design tauscht Gesamtspeicher gegen Rechenaufwand pro Token ein, und die Instruction-Following-Qualität eines sparse Modells hängt vollständig davon ab, wie gut der Router trainiert wurde. Die Konfiguration zeigt einen Routing-Auxiliary-Loss-Koeffizienten von 0,001 und einen gemeinsam genutzten Experten neben den 256 gerouteten, was ein konventionelles Setup ist – aber ein konventionelles Setup ist kein Beweis für gutes Routing.

Auf der Liquid-Seite ist das fehlende Element ein anderes: Die Qualitätsversprechen der Karte stammen vom Anbieter selbst.

A screenshot of the Hugging Face model page for LiquidAI/LFM2.5-VL-3B (captured 7 October 2026) showing the model header, the image-text-to-text pipeline tag, the lfm2_vl architecture tag, the multilingual language tags and the opening of the model card explaining that LFM2.5-VL-3B builds on LFM2-VL-3B with a SigLIP2 NaFlex vision encoder.

Die OCR- und Grounding-Verbesserungen werden von den Personen beschrieben, die das Modell trainiert haben, und obwohl Quantisierungen von Drittanbietern und das Downloadvolumen zeigen, dass die Community es nützlich genug fand, um zu konvertieren, ist das ein Beleg für Akzeptanz und nicht für Qualität. Niemand hat einen unabhängigen direkten Vergleich veröffentlicht.

Zu welchem würdest du tatsächlich greifen?

Der Entscheidungsbaum ist hier ungewöhnlich klar, weil die beiden Modelle nicht um dieselbe Aufgabe konkurrieren.

Wenn Sie ein Vision-Language-Modell benötigen, das auf einem Laptop, einem Telefon, einem Jetson oder einer einzelnen bescheidenen GPU läuft, ist LFM2.5-VL 3B das einzige der beiden, das die Frage beantwortet. Es ist klein genug, um quantisiert zu werden, es hat eine Lizenz, die die Arbeit erlaubt, und jemand hat die Konvertierungsarbeit bereits für Sie erledigt. Für Dokumentenlayout, Screenshot-Parsing und verankerte Objektbeschreibung bei einem Größen- und Sprach-Footprint, der in ein Edge-Budget passt, decken sich die auf der Karte angegebenen Stärken mit dem Bereitstellungsziel.

MiniCPM-V 4.7 ist kein Kandidat für diese Aufgabe bei 70 GB in BF16. Es ist ein Kandidat für die entgegengesetzte Aufgabe: ein multimodales Modell mit langem Kontext und hohem Durchsatz auf Serverhardware, in Workloads, bei denen das 256K-Fenster und die KV-Cache-Einsparungen durch Linear Attention entscheidend sind. Ob es diese Aufgabe gut erledigt, ist unbekannt, und die Lizenzfrage muss geklärt werden, bevor es diese Aufgabe überhaupt in irgendeinem kommerziellen Rahmen erledigen kann.

Es gibt eine dritte Option, die es wert ist, genannt zu werden: dass Sie sich möglicherweise nicht entscheiden müssen. Wenn die Architektur „ein kleines lokales Modell bewältigt den Großteil des Verkehrs und übergibt die schwierigen Fälle an etwas Gehostetes“ lautet, dann ist der lokale Teil davon eine Entscheidung, die Sie heute treffen können, und der gehostete Teil ist eine Routing-Entscheidung. OrcaRouter umfasst ein paar hundert gehostete Modelle hinter einem einzigen Schlüssel zum Listenpreis des jeweiligen Anbieters, ohne Aufschlag, mit Failover, wenn die Leistung eines Anbieters nachlässt – aber seien Sie sich im Klaren darüber, was das nicht ist: Weder LFM2.5-VL 3B noch MiniCPM-V 4.7 ist ein gehostetes Modell auf diesem Router. Beides sind Gewichte, die Sie selbst bereitstellen. Der Router ist das, was hinter ihnen sitzt.

Wo das steht und was aufgefrischt werden muss

Liquid AI hat ein fertiges kleines Modell ausgeliefert. OpenBMB hat ein unfertiges großes ausgeliefert. Der Vergleich, den die Leser wollen — Genauigkeit gegen Latenz, OCR gegen OCR —, lässt sich für die MiniCPM-Seite noch nicht schreiben, und der Beitrag, der unehrlich wäre, ist der, der die Lücke mit Arithmetik zur Parameteranzahl füllt. Behalten Sie die README des Repositorys im Auge. An dem Tag, an dem sie erscheint, wird sie die Lizenz und die ersten echten Zahlen tragen, und an diesem Tag wird daraus ein echter direkter Vergleich statt eines Spezifikationsblatts neben einem Produkt.

Die gehostete Hälfte dieses Musters ist eine Routing-Entscheidung und kein zweiter Vertrag.den Listenpreis jedes Anbieters, ohne dass wir einen Aufschlag hinzufügen Weder LFM2.5-VL 3B noch MiniCPM-V 3.5 ist ein gehostetes Modell auf OrcaRouter – beides sind Gewichte, die du selbst hostest.