Eine Hero-Titelkarte für den Vergleich LFM2.5-8B-A1B-DSpark vs. Qwen3-8B, mit dem Untertitel „Der Entwurf, der ein Modell beschleunigt, gegen die 8B, die alle bereits ausführen“, die links eine „Draft 327M“-Box zeigt, die Token-Chips in eine gestapelte MoE-Karte „LFM2.5-8B-A1B“ schickt, mit einer hohen Tachonadel unter einem „SPECULATIVE DECODING“-Label, und rechts eine Sprechblasen-Karte mit der Bezeichnung „Qwen3-8B“ mit einem Funken- und einem Uhr-Symbol unter einem „GENERALIST MODEL“-Label, mit einem Datumsetikett „August 2026“ und dem OrcaRouter-Logo, das in der unteren rechten Ecke eingefügt ist.
Guides & Insights

LFM2.5-8B-A1B-DSpark vs. Qwen3-8B: Der Draft, der ein Modell beschleunigt, gegen die 8B, die bereits alle einsetzen

Autor

Elias Hawthorne

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Liquid AI hat am 20. August 2026 den Draft-Checkpoint LFM2.5-8B-A1B-DSpark veröffentlicht — einen Helfer für spekulative Dekodierung mit 327,7 Millionen Parametern, der die Edge-MoE LFM2.5-8B-A1B auf einer einzelnen H100 bis zu 3,18× schneller generieren lässt. Bevor dieser Vergleich ehrlich sein kann, muss eine Tatsache auf dem Tisch liegen: Der DSpark-Checkpoint ist kein Modell, das man direkt aufrufen kann. Er beschleunigt lediglich ein anderes Modell. Die eigentliche Deployment-Frage, die dieses Release befeuert, ist also die, die die meisten Teams das ganze Jahr über abgewogen haben — LFM2.5-8B-A1B oder Qwen3-8B, zwei Open-Weight-Modelle der 8B-Klasse in sehr unterschiedlichen Lebensphasen.

Der Rahmen ist hier wichtiger als sonst, weil die beiden Seiten nicht dieselbe Art von Sache sind. Qwen3-8B ist ein vollständiges, einsatzbereites Modell, das Sie heute selbst hosten oder für das Sie Token kaufen können. LFM2.5-8B-A1B ist ebenfalls ein vollständiges, einsatzbereites Modell – der DSpark-Entwurf ist ein Zusatz dazu, keine Version davon. Alles, was der Entwurf verspricht, ist vom Anbieter gemessen und einen Tag alt; alles an den Repos und Formaten ist schlicht da, um überprüft zu werden. Dieser Beitrag hält diese beiden Kategorien getrennt.

Zuerst ist das Wort "DSpark" nicht das Nomen in diesem Satz.

Speculative Decoding lässt ein günstiges Draft-Modell vor dem eigentlichen Modell laufen: Das Draft-Modell errät die nächsten paar Token, das Zielmodell verifiziert den gesamten Block in einem einzigen Vorwärtspass und übernimmt alles, womit es übereinstimmt. Sind die Vorhersagen gut, bewegt man mehrere Token zum Preis eines einzigen Weight-Loading-Passes, sodass der Durchsatz steigt, ohne die Gewichte des Zielmodells anzufassen – und da das Zielmodell jedes vorgeschlagene Token prüft, ist die Ausgabe unter Greedy-Decodierung identisch mit einem alleinigen Lauf von LFM2.5-8B-A1B. Liquid nennt das „konstruktionsbedingt verlustfrei“, und genau das ist der Grund, warum ein Draft bedenkenlos angehängt werden kann.

Liquids LFM2.5-8B-A1B-DSpark ist ein bewusst kleiner Drafter: fünf reine Aufmerksamkeitsebenen, ein Block aus neun vorgeschlagenen Tokens pro Schritt und ein Markov-Kopf über das 128.000-Token-Vokabular des Ziels, trainiert für 15 Epochen auf einer Mischung aus Chat-, Code- und Funktionsaufrufdaten, wobei die Checkpoints nach Akzeptanzrate statt nach Verlust ausgewählt wurden. Es ist einer von drei Entwürfen, die der Anbieter an diesem Tag ausgeliefert hat, zusammen mit LFM2.5-1.2B-Instruct und LFM2.5-2.6B, jeweils in Safetensors und GGUF mit SGLang- und llama.cpp-Unterstützung ab dem ersten Tag. Wichtig für alle, die einen Vergleich mit einem Modell der 8B-Klasse lesen: Es wird von keinem Inferenzanbieter bereitgestellt und hat keinen Preis pro Token. Es existiert nur innerhalb Ihres eigenen Stacks für spekulative Dekodierung.

A screenshot of the Hugging Face model page for LiquidAI/LFM2.5-8B-A1B-DSpark, showing the tags TextGeneration, Safetensors, sglang, qwen3_speculative-decoding, dspark and lfm2_lfm2_moe draft model, the lfm1.0 license, a 0.3B model size, the 'Inference Providers' section, and the card text 'LFM2.5-DSpark is a family of speculative-decoding draft models that adapt DSpark for the LFM2.5 architecture' (captured August 21, 2026).

Die beiden Modelle, die tatsächlich zum Einsatz kommen.

Sieht man vom Draft ab, steht der eigentliche Vergleich zwischen dem Modell, das er beschleunigt, und dem etablierten Modell. Beide sind Open-Weight-Modelle und etwa in der 8B-Klasse angesiedelt, und dann enden die Gemeinsamkeiten:

{{1}}Architektur{{/1}} — LFM2.5-8B-A1B ist ein {{2}}sparse MoE{{/2}} mit insgesamt 8,3 Milliarden Parametern, von denen pro Token jedoch nur etwa 1,5 Milliarden aktiv sind; Qwen3-8B ist ein dichtes Modell mit 8,2 Milliarden Parametern, das bei jedem Token jeden Parameter aktiviert.

• Release — LFM2.5-8B-A1B wurde am 28. Mai 2026 veröffentlicht; Qwen3-8B wurde im April 2025 veröffentlicht und ist über ein Jahr alt, auf einigen Serving-Plattformen bereits als veraltet markiert.

• Kontext — LFM2.5-8B-A1B bietet einen nativen 128K-Kontext mit einem 128K-Token-Vokabular; Qwen3-8B bietet 32K nativ, erweiterbar auf etwa 128K über YaRN.

• Reasoning — LFM2.5-8B-A1B ist ein Reasoning-Modell, das eine explizite Gedankenkette ausgibt; Qwen3-8B wechselt je nach Anfrage zwischen Denk- und Nicht-Denkmodus.

• Intelligenz — laut Artificial Analysis erreicht LFM2.5-8B-A1B einen Intelligenzindex von 8 und Qwen3-8B erreicht 8–8,3, beide unter dem Median von 9 für vergleichbare Open-Weight-Modelle; keines ist ein Spitzengehirn, und beide sind ehrlich darüber.

• Geschwindigkeit — Laut Artificial Analysis liefert LFM2.5-8B-A1B über alle Anbieter hinweg etwa 340 Token pro Sekunde; Qwen3-8B liegt bei etwa 37–40 Token pro Sekunde und gehört damit zu den langsamsten seiner Klasse.

• Lizenz — LFM2.5-8B-A1B ist unter Liquid's LFM Open License v1.0 lizenziert; Qwen3-8B ist Apache-2.0.

A comparison scoreboard for LFM2.5-8B-A1B and Qwen3-8B. The left column shows the Liquid model as an MoE with 8.3B total and 1.5B active parameters, 128K native context, an AA Intelligence Index of 8 (median 9), roughly 340 tokens per second across providers, the DSpark draft adding up to 3.18x on an H100 but only 1.18x on an M4 Max, and self-host-only availability. The right column shows Qwen3-8B as a dense 8.2B model, 32K native context extended to ~128K via YaRN, an AA Intelligence Index of 8-8.3, roughly 37-40 tokens per second, no draft needed, and availability through Alibaba's API plus many open hosts, with a footer reading 'LFM speedups vendor-measured Aug 20 2026, unreproduced; throughput per Artificial Analysis; Qwen3-8B per Alibaba' and the OrcaRouter logo in the bottom-right corner.

Bei der Geschwindigkeit wird es nicht mehr knapp.

Der mit Abstand wichtigste Grund, warum sich die Diskussion über offene Modelle der 8B-Klasse verlagert hat, ist die Geschwindigkeit pro Speichereinheit. Qwen3-8B ist ein dichtes Modell: Jeder Token, den es erzeugt, strömt alle 8.2B Gewichte über den Speicherbus, weshalb es für seine Größe langsam ist und echten VRAM benötigt. LFM2.5-8B-A1B leitet jeden Token durch etwa 1.5B aktive Parameter – das ist der gesamte Designpunkt: ein On-Device-MoE, das schnell und klein bleibt. Liquids eigene Angaben gehen noch weiter: rund 253 Tokens pro Sekunde auf einer M5-Max-CPU bei unter 6 GB Speicher, laut Herstellerangaben. Beim reinen Durchsatz für das einsatzbereite Modell spielt das Draft-Modell für diesen Teil der Geschichte nicht einmal eine Rolle – das MoE ist bereits um ein Vielfaches schneller als das dichte 8B, bevor man spekulative Dekodierung hinzufügt.

Preislich sind beide Open-Weight-Modelle, sodass Self-Hosting jeweils das kostet, was Ihre Hardware kostet. Der Vergleich der gehosteten Dienste ist in Bezug auf Verfügbarkeit einseitig: Qwen3-8B wird über die API von Alibaba zu einem Listenpreis von 0,18 US-Dollar pro Million Input-Tokens und 2,10 US-Dollar pro Million Output-Tokens angeboten sowie von einer breiten Palette von Drittanbietern, die offene Modelle hosten; LFM2.5-8B-A1B hat kein nennenswertes erstklassiges Token-Pricing für gehostete Nutzung, und der Draft hat gar keins. Das bedeutet, dass der praktische Weg, wie die meisten Teams Liquids Edge-MoE heute ausführen werden, Self-Hosting ist – auf einem Laptop, einer Edge-Box oder einer eigenen GPU – und genau dort wird der DSpark-Draft zur relevanten Variable.

Was der Entwurf tatsächlich für diese Entscheidung ändert

Das Draft-Modell ändert nur eine Dimension: wie schnell das LFM2.5-8B-A1B Tokens in einem von Ihnen kontrollierten Serving-Stack erzeugt. Es macht das Modell nicht intelligenter und ändert nicht, was es antwortet – die Greedy-Ausgabe ist bitidentisch mit dem Zielmodell allein. Wo es hilft, ist GPU-Serving bei Single-Request-Durchsatz: Liquid maß im Mittel 2,54× auf einer einzelnen H100 über fünf Benchmarks (418 → 1.074 Tokens pro Sekunde), mit einem Bestwert von 3,18× bei MATH500, bei Batchgröße 1 und Temperatur 0. Wo es kaum hilft, ist Apple Silicon: dasselbe Modell erreichte auf einem M4 Max im Mittel nur 1,18× (90 → 106 tok/s), weil die Verifizierung eines Blocks aus Draft-Tokens im aktuellen Metal-MoE-Backend von llama.cpp mehr Experten aktiviert und mehr Gewichtsdaten transportiert – genau die Kosten, die spekulative Dekodierung amortisieren soll. All das sind Herstellerangaben vom Erscheinungstag, nicht unabhängig reproduziert.

Diese Aufteilung bildet direkt eine Entscheidungsregel ab. Wenn Sie LFM2.5-8B-A1B auf einer eigenen GPU ausführen, ist der Draft ein echter Kostenhebel – etwa 2,5× mehr Tokens pro Sekunde aus demselben Silizium, bei unveränderter Ausgabe, und Sie benötigen lediglich einen Build mit den DSpark-Integrationen vom 20. August. Wenn Sie das Modell stattdessen über eine API aufrufen, behält der Anbieter den Geschwindigkeitsvorteil und der Draft ist für Sie irrelevant. Und wenn das Gerät ein Laptop oder ein Smartphone ist, ist der Draft für dieses spezielle Modell heute nahezu wirkungslos; die verwandten Drafts für das dichte LFM2.5-1.2B-Instruct und LFM2.5-2.6B sind diejenigen mit den On-Device-Vorteilen, mit 2,54× bzw. 2,27×. Qwen3-8B wiederum benötigt überhaupt keinen Draft – es ist einfach ein langsameres, dichteres Modell, das für den Einsatz keine spekulative Dekodierung erfordert.

A screenshot of the Hugging Face model page for Qwen/Qwen3-8B, showing the TextGeneration tag, Transformers and Safetensors formats, the qwen3 conversational tag, the apache-2.0 license, and the Qwen3 Highlights describing the ability to switch seamlessly between thinking mode and non-thinking mode (captured August 18, 2026).

Die Wahl, ein Jahr nach dem Erscheinen von Qwen3-8B.

Qwen3-8B ist die langweilige, korrekte Standardwahl: ausgereift, Apache-2.0, 119 Sprachen, Denk- und Nicht-Denkmodi, überall verfügbar, und immer noch ein vollkommen guter Allrounder für Chat, Code und strukturierten Text. Seine Probleme sind Alter und Geschwindigkeit – ein 16 Monate altes dichtes 8B-Modell, das für seine Klasse langsam ist und auf einigen Plattformen bereits als veraltet gilt, was ein Wartungssignal ist, das man ernst nehmen sollte, wenn man heute ein Greenfield-Projekt startet.

LFM2.5-8B-A1B ist die neuere, engere Wette: ein Edge-first-MoE, das für Tool-Calling und Instruction-Following bei hoher Geschwindigkeit auf Consumer-Hardware entwickelt wurde, mit dem DSpark-Draft als optionalem Serving-Boost für den Fall des GPU-Self-Hostings. Es ist kein intelligenteres Modell — beide liegen bei Artificial Analysis unter dem Median der Open-Weight-Modelle —, aber es ist deutlich schneller bei einem Bruchteil des Speichers pro Token, was der entscheidende Kompromiss für On-Device-Agenten ist. Seine Einschränkungen sind das Spiegelbild derer von Qwen3-8B: eine jüngere Veröffentlichung, keine First-Party-Hosting-Preise und eine Geschichte zum spekulativen Dekodieren, deren Zahlen außerhalb des Anbieters noch niemand reproduziert hat.

Die darunterliegende Routing-Ebene bleibt in beiden Fällen dieselbe. Weder LFM2.5-8B-A1B noch Qwen3-8B befindet sich derzeit in OrcaRouters gehostetem Katalog, daher ist die ehrliche Einordnung, was ein Router für den Mix leistet: eine API für über 200 gehostete Modelle, wobei die Listenpreise der Anbieter ohne Aufschlag (0 %) durchgereicht werden, sodass eine Preissenkung eines Anbieters noch am selben Tag, an dem sie angekündigt wird, auf der Plattform live ist; automatisches Failover, sodass ein unerprobtes neues Modell etwas ist, das man gegen echten Traffic testet, statt einen Produktionspfad darauf zu verwetten; und eine Routing-DSL, die ein selbst gehostetes Modell vorschalten kann – genau so koexistiert ein selbst gehosteter LFM2.5-8B-A1B-Stack mit gehosteten Endpunkten hinter einem einzigen Schlüssel.

Wenn Sie für ein Laptop oder eine Edge-Box bauen und Wert auf Tool-Calling-Geschwindigkeit legen, ist LFM2.5-8B-A1B die Richtung, die Sie testen sollten, und der Draft ist ein kostenloser 2,5×-Gewinn auf dem GPU-Serving-Pfad, wenn es so weit ist. Wenn Sie einen Generalisten möchten, über den Sie nicht mehr nachdenken müssen, funktioniert Qwen3-8B weiterhin – nur sollten Sie wissen, dass es sich um ein Modell von Anfang 2025 handelt, das das Ökosystem allmählich ausmustert. Was weder der Draft noch das Ziel ändert, ist der ehrliche Stand der Evidenz: Alles, was an der DSpark-Veröffentlichung schnell ist, ist die Messung eines einzelnen Anbieters von einem einzigen Tag, und unabhängige Benchmarks sind der offene Punkt, der entscheidet, wie viel Sie davon tatsächlich vertrauen.

© 2026 OrcaRouter

Für Anbieter

Du betreibst eine Inferenz-Plattform? Bring deine Modelle auf OrcaRouter.

providers@orcarouter.ai

Community beitreten

Discordsupport@orcarouter.aiXGitHubYouTube