
MiniCPM5-2B-DSpark vs LFM2.5-2.6B-Base: Eines ist eine Zutat fürs Serving, eines ist eine Zutat fürs Training
- OrcaNEUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 pro 1 Mio. Tokens
- orcaNEUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens
- deepseekNEUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenz69Coding
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenz77Coding
- metaMeta: Muse Spark 1.22026-08-0540Intelligenz72Coding
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligenz76Coding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Intelligenz69Coding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 pro 1 Mio. Tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Zwei der interessantesten Veröffentlichungen kleiner Modelle im Spätsommer 2026 haben eines gemeinsam: Keines von beiden funktioniert ohne Weiteres, und beide Anbieter sagen dies in den ersten Sätzen ihrer Modellkarten. MiniCPM5-2B-DSpark ist der DSpark-Draft-Checkpoint, den OpenBMB am 6. September 2026 still auf Hugging Face veröffentlichte – ein Begleitmodell mit 323,8 M Parametern zu MiniCPM5-2B, dem dichten On-Device-Modell mit 2,52 Mrd. Parametern, das ModelBest am 19. Juli 2026 auf der WAIC ankündigte – und es tut nichts, bis man es neben diesem Zielmodell in einer Engine für spekulatives Dekodieren lädt. LFM2.5-2.6B-Base ist der vortrainierte Text-Checkpoint von Liquid AI, seit dem 1. August 2026 auf Hugging Face, den Liquids eigene Karte als „den vortrainierten reinen Text-Checkpoint" bezeichnet und nur für Aufgaben empfiehlt, die ein intensives Fein-Tuning erfordern. Das eine ist eine Zutat, um ein fertiges Modell schneller auszuliefern; das andere ist eine Zutat, um überhaupt erst ein eigenes Modell zu trainieren. Sie stehen in verschiedenen Regalen, und der Fehler eines Builders wäre es, zum falschen zu greifen.
Der Grund, warum sie einen Vergleich wert sind: Sie zielen auf dieselbe Hardware und dieselbe Ambition für 2026 ab — leistungsfähige KI auf Smartphones, Laptops und Edge-Geräten —, nur von entgegengesetzten Enden des Build-Prozesses aus. Wenn Sie ein einsatzbereites On-Device-Modell plus eine kostenlose Beschleunigung möchten, legt Ihnen OpenBMBs Stack das Ganze offen vor. Wenn Sie das Post-Training selbst übernehmen möchten, gibt Ihnen Liquid das Substrat und die Arbeit in die Hand. In diesem Artikel geht es darum, für welche Ebene Sie eigentlich einkaufen.
Zwei Karten, die in verschiedenen Dialekten „nicht zur direkten Verwendung" sagen.
Lies die beiden Modellkarten nebeneinander – das Verräterische liegt in der Sprache der Paarung. Die Karte von MiniCPM5-2B-DSpark ist vollständig in Bezug auf ein anderes Modell verfasst: ein Zielmodell, einen Tokenizer, den es teilt, Draft-Schichten, Akzeptanzlängen, einen SGLang-Startbefehl, der einen Zielpfad und einen Draft-Pfad übernimmt. Der Draft hat keine eigene Identität – fünf Full-Attention-Schichten, 323.776.001 Parameter, eine Blockgröße von sieben, sechs Epochen lang trainiert auf 7,05 Milliarden Tokens von MiniCPM5-2B-generierten Antworten, veröffentlicht unter Apache-2.0 mit den aktivierten Confidence- und Markov-Heads der DSpark-Methode (arXiv 2607.05147). Sein Zweck ist der Durchsatz: bis zu sieben Tokens vorzuschlagen, das 2,52B-Zielmodell den Block in einem einzigen Durchgang verifizieren zu lassen und das zu behalten, was es akzeptiert.

Die openbmb/MiniCPM5-2B-DSpark-Karte oben ist die gesamte öffentliche Oberfläche des Releases – ein Serving-Zubehör ohne begleitende Ankündigung, das die Akzeptanzlänge angibt, aber keine End-to-End-Beschleunigung.
Die Modellkarte von LFM2.5-2.6B-Base ist im Hinblick auf ein Modell geschrieben, das es noch nicht gibt: Ihres. Der 2.69B-Hybrid stapelt acht Grouped-Query-Attention-Ebenen auf zweiundzwanzig Dual-Gated-Short-Convolution-Blöcke – Liquids Architektur für die On-Device-Bereitstellung – und wurde auf etwa 34 Billionen Tokens in 16 Sprachen mit einem 128K-Kontext trainiert. Er ist rein textbasiert, verfügt über kein Instruction-Tuning und veröffentlicht keinerlei eigene Benchmarks, denn eine vortrainierte Basis wird nicht bewertet; die feinabgestimmten Produkte, die daraus hervorgehen, schon. Seine Aufgabe ist es, auf Ihren Daten weiter vortrainiert oder per SFT feinabgestimmt zu werden; danach erbt alles, was Sie ausliefern, seine Lizenzbedingungen.

Die obige Karte für LiquidAI/LFM2.5-2.6B-Base zeigt die Familientabelle – die Basis im Vergleich zum nachtrainierten agentischen Modell LFM2.5-2.6B – sowie den Hinweis auf den „vortrainierten textbasierten Checkpoint", der die Basis als Rohmaterial definiert.
Die Repos, Dimension für Dimension
• Rolle — MiniCPM5-2B-DSpark: beschleunigt ein bestehendes, fertiges Zielmodell. LFM2.5-2.6B-Base: das Substrat, das du zu einem fertigen Modell nachtrainierst.
• Parameter — MiniCPM5-2B-DSpark: 324M-Draft für ein dichtes 2.52B-Ziel. LFM2.5-2.6B-Base: 2.69B-Hybrid (Attention- und Short-Convolution-Blöcke).
• Kontext — MiniCPM5-2B: Ziel 128K nativ. LFM2.5-2.6B-Base: 128K nativ.
• Was Sie hinzufügen müssen — MiniCPM5-2B-DSpark: eine Serving-Engine (SGLang DSPARK) und das Zielmodell. LFM2.5-2.6B-Base: ein Fine-Tuning-Lauf, eine Evaluierungssuite und ein Inferenz-Stack.
• Benchmarks – MiniCPM5-2B-DSpark: nur die Repo-Akzeptanzlänge (Greedy-Aggregat 5,52 pro Schritt), keine Angabe zur Beschleunigung. LFM2.5-2.6B-Base: Für die Basis selbst wurden keine veröffentlicht.
• Lizenz — MiniCPM5-2B-DSpark: Apache-2.0, ohne Bedingungen. LFM2.5-2.6B-Base: LFM Open License v1.0 — kostenlose kommerzielle Nutzung bis zu einem Jahresumsatz von 10 Mio. US-Dollar; diese Obergrenze gilt auch für alles, was Sie darauf aufbauend feinabstimmen.

Die Anzeigetafel oben ist das als Karte dargestellte Zutatenregal: Die eine Spalte ist ein Servierzusatz für ein fertiges Modell, die andere ein Trainingssubstrat für ein Modell, das erst existiert, wenn du es baust.
Der Unterschied von 10 Millionen Dollar
Für einen Entwickler ist der Lizenzunterschied der am wenigsten glamouröse und zugleich entscheidendste Punkt auf dieser Liste. ModelBest und OpenBMB haben MiniCPM5-2B und das zugehörige Draft-Modell unter Apache-2.0 gestellt: Du kannst das Zielmodell bereitstellen, das Draft-Modell ausführen und ein kommerzielles Produkt darauf aufbauen – ganz ohne Umsatzobergrenze und ohne weitere Verpflichtungen als die Namensnennung. Die LFM Open License v1.0 von Liquid erlaubt kommerzielle Nutzung, begrenzt sie jedoch: Bei einem Jahresumsatz unter 10 Mio. $ ist die Nutzung kostenlos, und die Obergrenze überträgt sich auf abgeleitete Werke; ein Produkt, das du auf der Basis von LFM2.5-2.6B-Base feinabstimmst, unterliegt also derselben Obergrenze. Das macht die Lizenz von Liquid nicht unvernünftig; es macht sie zu einer Bedingung, die ein Startup, das über die Obergrenze hinauswachsen will, von Anfang an einplanen muss. Wenn die Umsatzambition deines Projekts gering ist oder du Forschung evaluierst, ist die Obergrenze kein Thema. Wenn du etwas entwickelst, das du ausbauen willst, ist Apache-2.0 eine andere Art Rohstoff.
Der Scheideweg zwischen Eigenentwicklung und Zukauf für Entwickler
Wenn man es als Build-vs.-Buy-Entscheidung über das Modell selbst betrachtet, wird die Wahl nicht mehr verwirrend. MiniCPM5-2B-DSpark ist der „Kaufen“-Pfad: Die harte Arbeit – das Post-Training eines On-Device-Modells für agentische Arbeit mit langen Kontexten – ist in MiniCPM5-2B bereits erledigt, und der Draft ist eine zusätzliche Beschleunigungsschicht ohne Extralizenz. Sie kaufen ein fertiges Modell und eine Geschwindigkeitssteigerung, beide unter Apache-2.0, und Ihre verbleibende Arbeit ist Serving und Evaluierung. Die offene Frage ist quantitativer Natur: OpenBMB hat die Akzeptanz des Drafts gemessen (5,52 Tokens pro Verifikationsschritt bei Greedy), aber nicht dessen tatsächlichen Zeitgewinn; Sie müssen also das SGLang-Deployment auf Ihrer eigenen Hardware benchmarken, um zu wissen, was Sie gekauft haben.
LFM2.5-2.6B-Base ist der „Build“-Pfad: Sie kaufen das Pretraining-Substrat und erledigen das Post-Training selbst – das ist der einzige ehrliche Grund, ein Basismodell dem post-trainierten LFM2.5-2.6B-Geschwistermodell vorzuziehen, das Liquid bereits verkauft. Dieser Pfad ist sinnvoll, wenn Sie eine Domäne, eine Sprache oder ein Verhaltensprofil haben, das Standardmodelle nicht abdecken – Sie nehmen die Architektur von Liquid und das 34-Billionen-Token-Fundament und machen es sich zu eigen. Es ist deutlich mehr Arbeit, es beginnt mit null veröffentlichten Benchmarks und die Umsatzobergrenze bleibt bestehen. Der Lohn ist ein Modell, das niemand sonst hat.
Die Routing-Realität
Keiner der beiden Checkpoints taucht heute in irgendeinem gehosteten Katalog auf, auch nicht in dem von OrcaRouter — der Draft ist definitionsgemäß ein lokales Serving-Zubehör, und die Basis von Liquid ist ein Self-Host-Feintuning-Projekt. Genau dort bleibt eine Routing-Ebene nützlich, ohne vorzutäuschen, eines der beiden zu hosten: Sobald du eines der Modelle serviert oder feingetunt hast, ist es die Ebene vor deinen eigenen Endpoints, die die Erprobung umkehrbar macht. Richte einen Testpfad auf einen MiniCPM5-2B-plus-draft-SGLang-Build, während die Produktion auf dem bleibt, was du heute servierst, lass das automatische Failover den Stillstand abfangen und reiche die Listenpreise der Anbieter mit 0 % Aufschlag für die gehosteten Modelle durch, mit denen du sie vergleichst. Der Sinn der Ebene ist hier nicht die Bereitstellung — sondern dass keine der beiden Komponenten dich irreversibel festlegt.
In welchem Regal shoppst du gerade?
Wählen Sie MiniCPM5-2B-DSpark (mit seinem Zielmodell), wenn Sie heute ein fertiges, unter Apache-2.0 lizenziertes On-Device-Modell und ein Draft-Modell möchten, das es womöglich schneller macht – und akzeptieren Sie, dass Sie die Beschleunigung des Drafts selbst messen müssen, da der Anbieter dies nicht getan hat. Wählen Sie LFM2.5-2.6B-Base, wenn Sie vorhaben, Ihr eigenes Modell nachzutrainieren, und dabei die hybride Architektur von Liquid sowie die 16 Sprachen umfassende Grundlage als Startgewichte nutzen möchten – und akzeptieren Sie die Rechnung für das Feintuning, die null veröffentlichten Benchmarks und die Umsatzobergrenze von 10 Millionen US-Dollar, die an allem haftet, was Sie ausliefern. Die beiden sind keine Rivalen für dieselbe Aufgabe; sie sind zwei verschiedene Aufgaben auf derselben Hardware, und die einzige falsche Wahl ist, das eine zu kaufen, während man glaubt, das andere zu kaufen.
