Eine Hero-Titelkarte für den Vergleich 'MiniCPM5-2B-DSpark vs LFM2.5-2.6B-Base' mit dem Untertitel 'Eines ist eine Zutat für das Serving, eines ist eine Zutat für das Training', die ein Regal mit zwei Gläsern zeigt — das linke mit der Aufschrift 'Serving-Add-on' enthält einen kleinen Chip und das rechte mit der Aufschrift 'Trainingssubstrat' enthält geschichtete Platten — mit einer Waage dazwischen und dem OrcaRouter-Logo in der unteren rechten Ecke.
Guides & Insights

MiniCPM5-2B-DSpark vs LFM2.5-2.6B-Base: Eines ist eine Zutat fürs Serving, eines ist eine Zutat fürs Training

Autor

Alistair Wren

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Zwei der interessantesten Veröffentlichungen kleiner Modelle im Spätsommer 2026 haben eines gemeinsam: Keines von beiden funktioniert ohne Weiteres, und beide Anbieter sagen dies in den ersten Sätzen ihrer Modellkarten. MiniCPM5-2B-DSpark ist der DSpark-Draft-Checkpoint, den OpenBMB am 6. September 2026 still auf Hugging Face veröffentlichte – ein Begleitmodell mit 323,8 M Parametern zu MiniCPM5-2B, dem dichten On-Device-Modell mit 2,52 Mrd. Parametern, das ModelBest am 19. Juli 2026 auf der WAIC ankündigte – und es tut nichts, bis man es neben diesem Zielmodell in einer Engine für spekulatives Dekodieren lädt. LFM2.5-2.6B-Base ist der vortrainierte Text-Checkpoint von Liquid AI, seit dem 1. August 2026 auf Hugging Face, den Liquids eigene Karte als „den vortrainierten reinen Text-Checkpoint" bezeichnet und nur für Aufgaben empfiehlt, die ein intensives Fein-Tuning erfordern. Das eine ist eine Zutat, um ein fertiges Modell schneller auszuliefern; das andere ist eine Zutat, um überhaupt erst ein eigenes Modell zu trainieren. Sie stehen in verschiedenen Regalen, und der Fehler eines Builders wäre es, zum falschen zu greifen.

Der Grund, warum sie einen Vergleich wert sind: Sie zielen auf dieselbe Hardware und dieselbe Ambition für 2026 ab — leistungsfähige KI auf Smartphones, Laptops und Edge-Geräten —, nur von entgegengesetzten Enden des Build-Prozesses aus. Wenn Sie ein einsatzbereites On-Device-Modell plus eine kostenlose Beschleunigung möchten, legt Ihnen OpenBMBs Stack das Ganze offen vor. Wenn Sie das Post-Training selbst übernehmen möchten, gibt Ihnen Liquid das Substrat und die Arbeit in die Hand. In diesem Artikel geht es darum, für welche Ebene Sie eigentlich einkaufen.

Zwei Karten, die in verschiedenen Dialekten „nicht zur direkten Verwendung" sagen.

Lies die beiden Modellkarten nebeneinander – das Verräterische liegt in der Sprache der Paarung. Die Karte von MiniCPM5-2B-DSpark ist vollständig in Bezug auf ein anderes Modell verfasst: ein Zielmodell, einen Tokenizer, den es teilt, Draft-Schichten, Akzeptanzlängen, einen SGLang-Startbefehl, der einen Zielpfad und einen Draft-Pfad übernimmt. Der Draft hat keine eigene Identität – fünf Full-Attention-Schichten, 323.776.001 Parameter, eine Blockgröße von sieben, sechs Epochen lang trainiert auf 7,05 Milliarden Tokens von MiniCPM5-2B-generierten Antworten, veröffentlicht unter Apache-2.0 mit den aktivierten Confidence- und Markov-Heads der DSpark-Methode (arXiv 2607.05147). Sein Zweck ist der Durchsatz: bis zu sieben Tokens vorzuschlagen, das 2,52B-Zielmodell den Block in einem einzigen Durchgang verifizieren zu lassen und das zu behalten, was es akzeptiert.

A screenshot of the Hugging Face model page for openbmb/MiniCPM5-2B-DSpark (captured September 7, 2026) showing the model title, the 'DSpark draft checkpoint trained for exact pairing with MiniCPM5-2B' description, and the Model Specification table listing the MiniCPM5-2B target, five draft layers, and a block size of seven.

Die openbmb/MiniCPM5-2B-DSpark-Karte oben ist die gesamte öffentliche Oberfläche des Releases – ein Serving-Zubehör ohne begleitende Ankündigung, das die Akzeptanzlänge angibt, aber keine End-to-End-Beschleunigung.

Die Modellkarte von LFM2.5-2.6B-Base ist im Hinblick auf ein Modell geschrieben, das es noch nicht gibt: Ihres. Der 2.69B-Hybrid stapelt acht Grouped-Query-Attention-Ebenen auf zweiundzwanzig Dual-Gated-Short-Convolution-Blöcke – Liquids Architektur für die On-Device-Bereitstellung – und wurde auf etwa 34 Billionen Tokens in 16 Sprachen mit einem 128K-Kontext trainiert. Er ist rein textbasiert, verfügt über kein Instruction-Tuning und veröffentlicht keinerlei eigene Benchmarks, denn eine vortrainierte Basis wird nicht bewertet; die feinabgestimmten Produkte, die daraus hervorgehen, schon. Seine Aufgabe ist es, auf Ihren Daten weiter vortrainiert oder per SFT feinabgestimmt zu werden; danach erbt alles, was Sie ausliefern, seine Lizenzbedingungen.

A screenshot of the Hugging Face model page for LiquidAI/LFM2.5-2.6B-Base (reused from a published sibling) showing the model card with the family table contrasting the pre-trained base checkpoint with the post-trained LFM2.5-2.6B agentic model, the text-generation and Transformers tags, and the note that the base is the pre-trained text-only checkpoint.

Die obige Karte für LiquidAI/LFM2.5-2.6B-Base zeigt die Familientabelle – die Basis im Vergleich zum nachtrainierten agentischen Modell LFM2.5-2.6B – sowie den Hinweis auf den „vortrainierten textbasierten Checkpoint", der die Basis als Rohmaterial definiert.

Die Repos, Dimension für Dimension

• Rolle — MiniCPM5-2B-DSpark: beschleunigt ein bestehendes, fertiges Zielmodell. LFM2.5-2.6B-Base: das Substrat, das du zu einem fertigen Modell nachtrainierst.

• Parameter — MiniCPM5-2B-DSpark: 324M-Draft für ein dichtes 2.52B-Ziel. LFM2.5-2.6B-Base: 2.69B-Hybrid (Attention- und Short-Convolution-Blöcke).

• Kontext — MiniCPM5-2B: Ziel 128K nativ. LFM2.5-2.6B-Base: 128K nativ.

• Was Sie hinzufügen müssen — MiniCPM5-2B-DSpark: eine Serving-Engine (SGLang DSPARK) und das Zielmodell. LFM2.5-2.6B-Base: ein Fine-Tuning-Lauf, eine Evaluierungssuite und ein Inferenz-Stack.

• Benchmarks – MiniCPM5-2B-DSpark: nur die Repo-Akzeptanzlänge (Greedy-Aggregat 5,52 pro Schritt), keine Angabe zur Beschleunigung. LFM2.5-2.6B-Base: Für die Basis selbst wurden keine veröffentlicht.

• Lizenz — MiniCPM5-2B-DSpark: Apache-2.0, ohne Bedingungen. LFM2.5-2.6B-Base: LFM Open License v1.0 — kostenlose kommerzielle Nutzung bis zu einem Jahresumsatz von 10 Mio. US-Dollar; diese Obergrenze gilt auch für alles, was Sie darauf aufbauend feinabstimmen.

A two-column scoreboard for MiniCPM5-2B-DSpark vs LFM2.5-2.6B-Base: left column MiniCPM5-2B-DSpark with 'Role: serving add-on for MiniCPM5-2B', 324M draft / 2.52B target, 128K context, 'You add: SGLang DSPARK engine', draft-acceptance-only benchmarks, and Apache-2.0; right column LFM2.5-2.6B-Base with 'Role: pretrain substrate for your fine-tune', 2.69B hybrid params, 128K context, 'You add: fine-tune, eval, serving', no published benchmarks, and LFM Open License v1.0 with a $10M revenue cap, with a footer reading 'MiniCPM figures are card claims; LFM base has no published benchmarks' and the OrcaRouter logo in the bottom-right corner.

Die Anzeigetafel oben ist das als Karte dargestellte Zutatenregal: Die eine Spalte ist ein Servierzusatz für ein fertiges Modell, die andere ein Trainingssubstrat für ein Modell, das erst existiert, wenn du es baust.

Der Unterschied von 10 Millionen Dollar

Für einen Entwickler ist der Lizenzunterschied der am wenigsten glamouröse und zugleich entscheidendste Punkt auf dieser Liste. ModelBest und OpenBMB haben MiniCPM5-2B und das zugehörige Draft-Modell unter Apache-2.0 gestellt: Du kannst das Zielmodell bereitstellen, das Draft-Modell ausführen und ein kommerzielles Produkt darauf aufbauen – ganz ohne Umsatzobergrenze und ohne weitere Verpflichtungen als die Namensnennung. Die LFM Open License v1.0 von Liquid erlaubt kommerzielle Nutzung, begrenzt sie jedoch: Bei einem Jahresumsatz unter 10 Mio. $ ist die Nutzung kostenlos, und die Obergrenze überträgt sich auf abgeleitete Werke; ein Produkt, das du auf der Basis von LFM2.5-2.6B-Base feinabstimmst, unterliegt also derselben Obergrenze. Das macht die Lizenz von Liquid nicht unvernünftig; es macht sie zu einer Bedingung, die ein Startup, das über die Obergrenze hinauswachsen will, von Anfang an einplanen muss. Wenn die Umsatzambition deines Projekts gering ist oder du Forschung evaluierst, ist die Obergrenze kein Thema. Wenn du etwas entwickelst, das du ausbauen willst, ist Apache-2.0 eine andere Art Rohstoff.

Der Scheideweg zwischen Eigenentwicklung und Zukauf für Entwickler

Wenn man es als Build-vs.-Buy-Entscheidung über das Modell selbst betrachtet, wird die Wahl nicht mehr verwirrend. MiniCPM5-2B-DSpark ist der „Kaufen“-Pfad: Die harte Arbeit – das Post-Training eines On-Device-Modells für agentische Arbeit mit langen Kontexten – ist in MiniCPM5-2B bereits erledigt, und der Draft ist eine zusätzliche Beschleunigungsschicht ohne Extralizenz. Sie kaufen ein fertiges Modell und eine Geschwindigkeitssteigerung, beide unter Apache-2.0, und Ihre verbleibende Arbeit ist Serving und Evaluierung. Die offene Frage ist quantitativer Natur: OpenBMB hat die Akzeptanz des Drafts gemessen (5,52 Tokens pro Verifikationsschritt bei Greedy), aber nicht dessen tatsächlichen Zeitgewinn; Sie müssen also das SGLang-Deployment auf Ihrer eigenen Hardware benchmarken, um zu wissen, was Sie gekauft haben.

LFM2.5-2.6B-Base ist der „Build“-Pfad: Sie kaufen das Pretraining-Substrat und erledigen das Post-Training selbst – das ist der einzige ehrliche Grund, ein Basismodell dem post-trainierten LFM2.5-2.6B-Geschwistermodell vorzuziehen, das Liquid bereits verkauft. Dieser Pfad ist sinnvoll, wenn Sie eine Domäne, eine Sprache oder ein Verhaltensprofil haben, das Standardmodelle nicht abdecken – Sie nehmen die Architektur von Liquid und das 34-Billionen-Token-Fundament und machen es sich zu eigen. Es ist deutlich mehr Arbeit, es beginnt mit null veröffentlichten Benchmarks und die Umsatzobergrenze bleibt bestehen. Der Lohn ist ein Modell, das niemand sonst hat.

Die Routing-Realität

Keiner der beiden Checkpoints taucht heute in irgendeinem gehosteten Katalog auf, auch nicht in dem von OrcaRouter — der Draft ist definitionsgemäß ein lokales Serving-Zubehör, und die Basis von Liquid ist ein Self-Host-Feintuning-Projekt. Genau dort bleibt eine Routing-Ebene nützlich, ohne vorzutäuschen, eines der beiden zu hosten: Sobald du eines der Modelle serviert oder feingetunt hast, ist es die Ebene vor deinen eigenen Endpoints, die die Erprobung umkehrbar macht. Richte einen Testpfad auf einen MiniCPM5-2B-plus-draft-SGLang-Build, während die Produktion auf dem bleibt, was du heute servierst, lass das automatische Failover den Stillstand abfangen und reiche die Listenpreise der Anbieter mit 0 % Aufschlag für die gehosteten Modelle durch, mit denen du sie vergleichst. Der Sinn der Ebene ist hier nicht die Bereitstellung — sondern dass keine der beiden Komponenten dich irreversibel festlegt.

In welchem Regal shoppst du gerade?

Wählen Sie MiniCPM5-2B-DSpark (mit seinem Zielmodell), wenn Sie heute ein fertiges, unter Apache-2.0 lizenziertes On-Device-Modell und ein Draft-Modell möchten, das es womöglich schneller macht – und akzeptieren Sie, dass Sie die Beschleunigung des Drafts selbst messen müssen, da der Anbieter dies nicht getan hat. Wählen Sie LFM2.5-2.6B-Base, wenn Sie vorhaben, Ihr eigenes Modell nachzutrainieren, und dabei die hybride Architektur von Liquid sowie die 16 Sprachen umfassende Grundlage als Startgewichte nutzen möchten – und akzeptieren Sie die Rechnung für das Feintuning, die null veröffentlichten Benchmarks und die Umsatzobergrenze von 10 Millionen US-Dollar, die an allem haftet, was Sie ausliefern. Die beiden sind keine Rivalen für dieselbe Aufgabe; sie sind zwei verschiedene Aufgaben auf derselben Hardware, und die einzige falsche Wahl ist, das eine zu kaufen, während man glaubt, das andere zu kaufen.