Eine Hero-Titelkarte für den Vergleich LFM2.5-8B-A1B-DSpark vs LFM2.5-2.6B-Base, mit dem Untertitel 'Der Geschwindigkeitsteil vs. das Rohmaterial'. Auf der linken Seite ist eine kleine 'Draft 327M'-Box zu sehen, die Token-Chips durch einen Pfeil in eine Karte mit gestapelten Kacheln und der Aufschrift 'LFM2.5-8B-A1B verifiziert' schickt, mit einem Tachometerbogen darunter. Auf der rechten Seite befinden sich ein '2.6B Base'-Block und ein Pfeil zu einer leeren Modellkarte mit der Aufschrift 'Ihr Feintuning', dazu ein Datums-Tag 'August 2026' und das OrcaRouter-Logo, das in der unteren rechten Ecke eingeblendet ist.
Guides & Insights

LFM2.5-8B-A1B-DSpark vs LFM2.5-2.6B-Base: Der Geschwindigkeitsteil vs. das Rohmaterial

Autor

Gideon Frost

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Sortiert man die LFM2.5-Familie danach, was jeder Checkpoint für sich allein kann, landen LFM2.5-8B-A1B-DSpark und LFM2.5-2.6B-Base an entgegengesetzten Enden der Skala — und keines der beiden Enden kann eine Frage beantworten. Das erste ist ein Draft-Modell mit 327,7 Millionen Parametern, das ausschließlich dazu dient, das Edge-Mixture-of-Experts-Modell von Liquid AI Tokens schneller erzeugen zu lassen. Das zweite ist ein roher, vortrainierter Checkpoint mit 2,69 Milliarden Parametern, der ausschließlich dafür existiert, zu etwas anderem feinabgestimmt zu werden. Beide wurden im August 2026 unter Liquids LFM Open License v1.0 veröffentlicht, beide sind auf Hugging Face nur einen Download entfernt, und beide kann man extrem leicht aus Versehen erwischen — weil ihre Namen sie wie zwei Versionen derselben Sache klingen lassen.

Die Namen sind die Falle. „DSpark“ klingt wie das funkensprühende neue Flaggschiff der Familie, und „Base“ klingt wie das schlichte Standardmodell, das man tatsächlich ausführen kann. Keines von beiden trifft zu. Der DSpark-Checkpoint kann für sich allein nichts beantworten – er schlägt nur Token für den LFM2.5-8B-A1B vor, die dieser verifizieren muss. Der Base-Checkpoint kann auch nichts beantworten, aber aus dem gegenteiligen Grund – er ist eine ungefeilte Grundlage, die Text vorhersagt, aber nie zu einem Chat- oder Agentenmodell nachtrainiert wurde. Das ist keine Rivalität; es ist eine Pipeline. Ein Checkpoint sitzt ganz am Ende eines Serving-Stacks, der andere ganz am Anfang eines Trainingslaufs.

Zwei Checkpoints, die sich einen Namen teilen, aber keine Aufgabe.

LFM2.5-8B-A1B-DSpark (veröffentlicht am 20. August 2026) ist ein Draft-Modell für spekulative Dekodierung: ein reines Aufmerksamkeitsnetzwerk mit fünf Schichten, ein Block aus neun vorgeschlagenen Tokens pro Schritt und ein Markov-Kopf über dem 128.000-Token-Vokabular des Ziels. Sie laden es neben dem LFM2.5-8B-A1B — einer MoE mit insgesamt 8,3B und ~1,5B aktiven Parametern, die bereits am 28. Mai ausgeliefert wurde. Das Draft-Modell rät die nächsten Tokens, und das Zielmodell verifiziert den gesamten Block in einem einzigen Vorwärtsdurchlauf und behält, was es akzeptiert. Da das Zielmodell jedes Token prüft, ist die Ausgabe bei gieriger Dekodierung identisch mit der Ausführung des LFM2.5-8B-A1B allein: „verlustfrei durch Konstruktion“, wie Liquid es formuliert. Das Draft-Modell ist ein Geschwindigkeitsteil, kein Gehirn. Es wurde zusammen mit Schwester-Drafts für LFM2.5-1.2B-Instruct und LFM2.5-2.6B veröffentlicht, jeweils in Safetensors und GGUF, mit Unterstützung ab dem ersten Tag in SGLang und llama.cpp.

LFM2.5-2.6B-Base (veröffentlicht am 4. August 2026) ist das andere Ende der Pipeline: ein Fundament mit 2,69 Mrd. Parametern in einem hybriden 30-Schichten-Stack — 22 doppelt gegatterte Short-Convolution-Blöcke plus 8 Grouped-Query-Attention-Blöcke — vortrainiert auf etwa 34 Billionen Tokens, mit einer Mid-Training-Phase, die den Kontext auf 128K erweitert. Es hat keine Chat-Vorlage, kein Instruction Tuning und keine veröffentlichten Benchmarks, und Liquids eigenes Modellkarten-Empfehlung sieht es nur für umfangreiches Fine-Tuning vor. Sein ganzer Zweck ist es, das Rohmaterial zu sein, das eine vierstufige Post-Training-Pipeline — zwei SFT-Runden, Teacher-Spezialisierung, On-Policy-Destillation, dann agentisches Reinforcement Learning — in den Tool-Calling-Agenten LFM2.5-2.6B verwandelt. Gleiche Familie, gleiche Lizenz, gleiche Download-Seite. Völlig unterschiedliche Aufgaben.

Seite an Seite: sieben Dimensionen, zwei Jobs

Da die beiden Checkpoints unterschiedliche Aufgaben erfüllen, hält der ehrliche Vergleich die Rollen beider Seiten klar:

Was es ist — LFM2.5-8B-A1B-DSpark ist ein 0.3B-Draftmodell für spekulative Dekodierung; LFM2.5-2.6B-Base ist ein roh vortrainiertes Basismodell mit 2.69B Parametern.

• Womit es läuft — der DSpark-Draft arbeitet mit dem LFM2.5-8B-A1B-MoE zusammen (8,3B insgesamt, ~1,5B aktiv pro Token); das Base-Modell läuft eigenständig, aber nur als nicht feinabgestimmte Textvorhersage.

• Eigenständige Verwendung — DSpark erzeugt selbst nichts; es beschleunigt nur ein Ziel. Base erzeugt Text, aber kein nützliches Produktverhalten — keine Befolgung von Anweisungen, keinen Tool-Aufruf, keine Chat-Vorlage.

• Ausgabequalität — DSpark erbt die exakte Greedy-Ausgabe des Ziels, da jeder vorgeschlagene Token verifiziert wird; Base hat bewusst keine veröffentlichten Benchmarks für irgendeine Aufgabe.

• Geschwindigkeit — DSpark gibt einen vom Hersteller gemessenen mittleren Speedup von 2,54× auf einer H100 (bis zu 3,18× auf MATH500) und 1,18× auf einem M4 Max gegenüber seinem Ziel an, nicht reproduziert; Base hat überhaupt keine Inferenzgeschwindigkeitsangabe.

• Speicherbedarf — DSpark fügt etwa 0,3 GB an Draft-Gewichten neben dem Ziel hinzu; Base ist die vollständige 2,69B-Variante, lauffähig unter 2,5 GB, das kleinste ernsthafte Fundament in der Familie.

• Formate und Verfügbarkeit — DSpark wird in Safetensors und GGUF ausgeliefert, mit Unterstützung für SGLang und llama.cpp ab dem ersten Tag; Base wird in Safetensors plus GGUF, ONNX und MLX ausgeliefert und läuft auf Transformers, vLLM, SGLang, llama.cpp und MLX. Keines wird derzeit von einem Inferenzanbieter bereitgestellt — beide sind selbst gehostete Checkpoints.

A comparison scoreboard for LFM2.5-8B-A1B-DSpark and LFM2.5-2.6B-Base. The left column shows the draft as a 0.3B speculative-decoding draft, running with the LFM2.5-8B-A1B MoE (1.5B active), no standalone output, a 2.54x mean H100 speedup up to 3.18x, a 1.18x mean on M4 Max, and Safetensors + GGUF self-host formats. The right column shows the Base as a 2.69B raw pre-trained foundation, run with your own fine-tune, untuned text with no chat template, no published benchmarks, 128K context under 2.5GB, and Safetensors + GGUF + ONNX + MLX formats, with a footer reading 'Speed figures vendor-measured Aug 20 2026, unreproduced; Base has no benchmarks by design' and the OrcaRouter logo in the bottom-right corner.

Die einzigen Zahlen in diesem Vergleich stammten aus einem Labor.

Alle quantitativen Angaben hier stammen aus einer einzelnen Messung des Anbieters, die am Tag der Veröffentlichung des Entwurfs durchgeführt und noch nicht unabhängig reproduziert wurde — betrachten Sie sie als vielversprechend, nicht als verifiziert. Liquid hat das LFM2.5-8B-A1B-DSpark bei Batchgröße 1, Temperatur 0, auf einer einzelnen 80-GB-H100 in BF16 unter SGLang und auf einem M4 Max MacBook Pro in FP16 GGUF unter den experimentellen Metal-Kernels von llama.cpp gemessen. Auf der H100 erreichte das Paar durchschnittlich 2,54× (418 → 1.074 Token pro Sekunde), mit einem besten Einzelergebnis von 3,18× bei MATH500 (428 → 1.362 tok/s) und einer durchschnittlichen Akzeptanz von etwa 7 von 10 vorgeschlagenen Token. Auf dem M4 Max erreichte dasselbe Paar durchschnittlich nur 1,18× (90 → 106 tok/s) — der On-Device-Edge-Case, den Liquid selbst hervorgehoben hat, weil die Verifizierung eines Blocks im aktuellen MoE-Metal-Backend mehr Experten aktiviert und mehr Gewichtsdatenverkehr über den Speicherbus bewegt.

Die Base-Seite dieses Vergleichs hat überhaupt keine Zahlen, und genau dieses Fehlen ist die Spezifikation. LFM2.5-2.6B-Base wurde vortrainiert, nicht nachtrainiert; es wurde nie für Chat, Tool-Nutzung oder Agentenverhalten evaluiert, weil niemand beabsichtigte, es auf diese Weise zu verwenden. Seine aussagekräftigen Kennzahlen sind architektonischer Natur: 2,69B Parameter, 128K Kontext, ein Tokenizer für 16 Sprachen, unter 2,5 GB zum Ausführen. Man benchmarkt kein Fundament; man benchmarkt das, wozu man es feinabstimmt.

Es gibt eine Ironie in dieser Modellfamilie, die es wert ist, benannt zu werden, bevor du irgendetwas entscheidest. Der Draft, um den es in diesem Artikel geht – der für 8B-A1B – ist genau der, der auf einem Laptop am wenigsten bringt (1,18×), während der verwandte Draft für die 2.6B-Familie, der das nachtrainierte Geschwistermodell genau dieser Base beschleunigt, auf einem M4 Max durchschnittlich 2,27× erreicht und die Latenz für Multi-Tool-Funktionsaufrufe um 57 % senkt. Wenn es sich bei dem betreffenden Gerät um ein Telefon oder einen Laptop handelt und nicht um eine GPU-Box, liegt die Geschwindigkeitsgeschichte auf dem 2.6B-Pfad.

A screenshot of the Hugging Face model page for LiquidAI/LFM2.5-8B-A1B-DSpark, showing the tags TextGeneration, Safetensors, sglang, qwen3_speculative-decoding, dspark and lfm2_lfm2_moe draft model, the lfm1.0 license, a 0.3B model size, the 'Inference Providers' section, and the card text 'LFM2.5-DSpark is a family of speculative-decoding draft models that adapt DSpark for the LFM2.5 architecture' (captured August 21, 2026).

Also, welche lädst du herunter?

Du musst dich nie direkt zwischen diesen beiden entscheiden, denn sie sind keine Alternativen — aber du musst wissen, in welcher Aufgabe du gerade steckst:

Wenn Sie LFM2.5-8B-A1B auf eigenen GPUs ausführen und mehr Token pro Sekunde aus derselben Hardware herausholen möchten, ist der LFM2.5-8B-A1B-DSpark ein unkompliziertes Add-on: Bauen Sie SGLang oder llama.cpp mit den DSpark-Integrationen vom 20. August, benennen Sie den Draft im Startbefehl, behalten Sie Greedy-Decoding bei, und die Blockgröße wird automatisch aus der Draft-Konfiguration ausgelesen. Der Vorteil liegt bei ungefähr 2,5-fachem Durchsatz ohne Änderungen an den Ausgaben; der Nachteil sind 0,3 GB zusätzliche Gewichte und ein Build, der neu genug ist, um die PRs zu enthalten. Entfernen Sie die beiden spekulativen Flags, und Sie sind zurück beim normalen Zielmodell.

Wenn Sie Ihren eigenen Spezialisten aufbauen möchten — ein Domänenmodell, einen Assistenten für eine eigene Sprache, ein Fine-Tuning auf proprietären Daten — ist das LFM2.5-2.6B-Base einer der günstigsten ernsthaften Ausgangspunkte im Open-Weights-Ökosystem: 2,6B, unter 2,5 GB, 128K Kontext, ein mehrsprachiger Tokenizer. Der DSpark-Checkpoint kann Ihnen dabei überhaupt nicht helfen, weil er kein Base-Modell ist.

Wenn du tatsächlich den On-Device-Agenten von Liquid willst – Tool-Calling, mehrstufige Aufgaben – dann willst du keinen von diesen beiden. Du willst das nachtrainierte LFM2.5-2.6B und kannst danach entscheiden, ob du einen eigenen Draft ankoppeln möchtest. Das Base ist Rohmaterial für Leute, die trainieren wollen; der 8B-A1B-Draft ist ein Geschwindigkeitsteil für Leute, die das MoE bereits einsetzen. Der falsche Schritt ist, das Base herunterzuladen, weil du einen schnelleren Agenten wolltest, oder den Drafter, weil du eine Grundlage zum Trainieren wolltest.

A screenshot of the Hugging Face model page for LiquidAI/LFM2.5-2.6B-Base, showing the TextGeneration tag, Transformers and Safetensors formats, '16 languages', and the model card describing LFM2.5-2.6B-Base as the pre-trained text-only checkpoint used to create the post-trained agentic LFM2.5-2.6B, with a model table listing 'LFM2.5-2.6B-Base 2.6B Pre-trained base model for fine-tuning' (captured August 21, 2026).

Wo die beiden sich verbinden — und wo ein Router hineinpasst

Beide Checkpoints sind Self-Hosting-Geschichten. Der Draft ist ein Zubehör der Servingschicht, das nur innerhalb deines eigenen SGLang- oder llama.cpp-Stacks existiert; die Base ist ein Trainingsartefakt. Keiner von beiden erscheint in einem gehosteten Katalog, und keiner hat einen Listenpreis pro Token. Was das in der Praxis bedeutet, ist, dass jeder der beiden Wege am Ende neben den gehosteten Modellen sitzt, die du bereits aufrufst — und genau diese Mischung ist das, was eine Routing-Ebene vereinheitlichen soll.

Auf der Serving-Seite ist die wirtschaftliche Rechnung des Drafts einfach und real: 2,5× mehr Tokens pro Sekunde von derselben GPU bedeuten 2,5× weniger Zeit und ungefähr 2,5× weniger GPUs für dieselbe Arbeitslast, ohne jede Qualitätsänderung. Aber dieser Hebel existiert nur, wenn du die Inferenz selbst besitzt. Sobald du das 8B-A1B über eine API aufrufst, behält der Anbieter den Geschwindigkeitsvorteil – und genau hier wird der API-Vergleich zum entscheidenden Faktor: was ein Anbieter verlangt und ob eine Preissenkung noch am selben Tag, an dem sie angekündigt wird, bei dir ankommt. Genau das ist der Sinn eines Pass-through-Routers: eine einzige API für über 200 Modelle, die Listenpreise der Anbieter werden mit 0 % Aufschlag durchgereicht, sodass eine Preissenkung sofort auf deiner Seite wirksam ist, und ein automatisches Failover stellt sicher, dass ein Latenzspike eines einzelnen Anbieters nicht zu deiner Latenz wird. Du kannst auch deinen eigenen selbst gehosteten LFM-Stack über denselben Endpoint vorschalten – so testest du ein brandneues Draft-Modell mit echtem Traffic, ohne einen Produktionspfad darauf zu setzen.

LFM2.5-8B-A1B-DSpark und LFM2.5-2.6B-Base teilen sich einen Familiennamen und gegensätzliche Aufgaben: Der eine ist ein Geschwindigkeitsteil, das an das Edge-MoE geschraubt wird, der andere ist das ungestimmte Gehirn, aus dem der 2.6B-Agent erwächst. Keiner läuft für sich allein. Wähle den Drafter, um ein MoE zu beschleunigen, das du bereits auf GPUs bereitstellst, wähle die Base, um ein 2.6B-Fundament zu etwas Eigenem zu feinjustieren, und überspringe beide, wenn du einen funktionierenden Agenten wolltest – denn das Einzige, was beide Checkpoints gemeinsam haben, ist, dass keiner von beiden für sich genommen etwas tut, das du nutzen kannst.

FAQ

Kann ich LFM2.5-8B-A1B-DSpark allein ausführen?

Nein. Es ist ein Draft-Modell ohne eigenständige Ausgabe – es schlägt Kandidaten-Token vor, die das Zielmodell LFM2.5-8B-A1B anschließend verifiziert, sodass es nur innerhalb eines Serving-Stacks für spekulative Dekodierung existiert, der auf den SGLang- oder llama.cpp-Integrationen vom 20. August basiert. Wenn man es allein herunterlädt, erhält man nichts, das man abfragen könnte.

Ist LFM2.5-2.6B-Base der Checkpoint, der als Agent auf dem Gerät läuft?

Nicht unverändert. Die Base ist das rohe, vortrainierte Fundament ohne Instruction-Tuning und ohne Chat-Template. Das Modell, das als Liquid's On-Device-Agent läuft, ist das nachtrainierte LFM2.5-2.6B, das aus der Base durch die vierstufige Post-Training-Pipeline erzeugt wird – und, wenn Sie es schneller möchten, gepaart mit dem LFM2.5-2.6B-DSpark-Draft.

© 2026 OrcaRouter

Für Anbieter

Du betreibst eine Inferenz-Plattform? Bring deine Modelle auf OrcaRouter.

providers@orcarouter.ai

Community beitreten

Discordsupport@orcarouter.aiXGitHubYouTube