
LFM2.5-8B-A1B-DSpark vs Qwen3-8B: De draft die een model versnelt, tegen de 8B die iedereen al draait
- DeepSeekNIEUWDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 per 1 mln tokens
- z-aiNIEUWZ.ai: GLM 5.32026-08-1860Intelligentie75Coderen
- obsidianNIEUWQwen3.8 27B2026-08-1552Intelligentie68Coderen
- qwenNIEUWQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekNIEUWDeepSeek: DeepSeek V4 Pro 08132026-08-1253Intelligentie69Coderen
- grokNIEUWSpaceXAI: Grok 4.62026-08-1261Intelligentie77Coderen
- metaMeta: Muse Spark 1.22026-08-0557Intelligentie72Coderen
- qwenQwen: Qwen3.8 Max2026-08-0358Intelligentie72Coderen
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligentie69Coderen
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 mln tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligentie78Coderen
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligentie69Coderen
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligentie49Coderen
- metaMeta: Muse Spark 1.12026-07-1653Intelligentie71Coderen
- kimiMoonshotAI: Kimi K32026-07-1560Intelligentie76Coderen
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligentie71Coderen
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Intelligentie77Coderen
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Intelligentie77Coderen
Liquid AI heeft op 20 augustus 2026 de draft-checkpoint LFM2.5-8B-A1B-DSpark uitgebracht — een hulpmiddel voor speculatieve decodering met 327,7M parameters dat de LFM2.5-8B-A1B edge MoE tot 3,18× sneller laat genereren op één enkele H100. Voordat deze vergelijking eerlijk kan zijn, moet één feit op tafel komen te liggen: de DSpark-checkpoint is geen model dat je kunt aanroepen. Het versnelt alleen een ander model. Dus de echte implementatievraag die deze release oproept, is de vraag die de meeste teams het hele jaar hebben gewikt en gewogen: LFM2.5-8B-A1B of Qwen3-8B, twee open-weight modellen uit de 8B-klasse die zich in zeer verschillende levensfasen bevinden.
Het frame doet er hier meer toe dan normaal, omdat de twee kanten niet van hetzelfde soort zijn. Qwen3-8B is een compleet, inzetbaar model dat je vandaag al zelf kunt hosten of waarvoor je tokens kunt kopen. LFM2.5-8B-A1B is ook een compleet, inzetbaar model — de DSpark-draft is een aanvulling daarop, geen versie ervan. Alles wat de draft belooft, is door de leverancier gemeten en een dag oud; alles wat met de repos en formaten te maken heeft, is er gewoon om gecontroleerd te worden. Dit stuk houdt die twee categorieën gescheiden.
Ten eerste is het woord "DSpark" niet het zelfstandig naamwoord in deze zin.
Speculatieve decoding laat een goedkoop draftmodel vooruitlopen op het echte model: het draftmodel raadt de volgende paar tokens, het doelmodel verifieert het hele blok in één enkele forward pass en houdt alles waarmee het instemt. Wanneer de voorspellingen goed zijn, verplaats je meerdere tokens voor de prijs van één keer het laden van de gewichten, waardoor de doorvoer stijgt zonder de gewichten van het doelmodel aan te raken — en omdat het doelmodel elk voorgesteld token controleert, is de uitvoer onder greedy decoding identiek aan het draaien van LFM2.5-8B-A1B alleen. Liquid noemt dit "verliesvrij door constructie", en dat is de hele reden waarom een draft veilig kan worden toegevoegd.
Liquid's LFM2.5-8B-A1B-DSpark is een bewust kleine drafter: vijf lagen met uitsluitend aandacht, een blok van negen voorgestelde tokens per stap, en een Markov-kop over de woordenschat van 128.000 tokens van het doelmodel, getraind gedurende 15 epochs op een mix van chat-, code- en functieaanroepgegevens, met checkpoints gekozen op acceptatiegraad in plaats van verlies. Het is een van de drie drafts die de leverancier die dag uitbracht, naast LFM2.5-1.2B-Instruct en LFM2.5-2.6B, elk in Safetensors en GGUF met ondersteuning voor SGLang en llama.cpp vanaf dag één. Het is ook, belangrijk voor iedereen die een vergelijking met een model uit de 8B-klasse leest: het wordt door geen enkele inferentieprovider aangeboden en heeft geen prijs per token. Het draait uitsluitend binnen je eigen speculatieve-decoderingstack.

De twee modellen die daadwerkelijk worden ingezet
Haal de draft weg en de echte vergelijking is tussen het model dat het versnelt en de gevestigde. Beide zijn open-weight en ruwweg 8B-klasse, en daarmee houdt de gelijkenis op:
• Architectuur — LFM2.5-8B-A1B is een sparse MoE met 8,3B totale parameters, maar slechts ~1,5B actief per token; Qwen3-8B is een dense 8,2B-model dat elke parameter per token activeert.
Release — LFM2.5-8B-A1B werd uitgebracht op 28 mei 2026; Qwen3-8B werd uitgebracht in april 2025 en is meer dan een jaar oud, al verouderd op sommige servingplatforms.
• Context — LFM2.5-8B-A1B biedt een native 128K-context met een vocabulaire van 128K tokens; Qwen3-8B biedt 32K native, uitbreidbaar tot ongeveer 128K via YaRN.
• Redeneren — LFM2.5-8B-A1B is een redeneermodel dat een expliciete denkketen produceert; Qwen3-8B schakelt per verzoek tussen denk- en niet-denkmodi.
• Intelligentie — volgens Artificial Analysis scoort LFM2.5-8B-A1B een Intelligence Index van 8 en Qwen3-8B scoort 8–8,3, beide onder de mediaan van 9 voor vergelijkbare open-weight modellen; geen van beide is een frontier-brein, en beide zijn daar eerlijk over.
• Snelheid — volgens Artificial Analysis levert LFM2.5-8B-A1B ongeveer 340 tokens per seconde bij verschillende providers; Qwen3-8B zit rond de 37–40 tokens per seconde, een van de langzaamste in zijn klasse.
• Licentie — LFM2.5-8B-A1B valt onder de LFM Open License v1.0 van Liquid; Qwen3-8B is Apache-2.0.

Snelheid is waar dit niet meer spannend is
De allerbelangrijkste reden dat {{1}}de discussie over open-gewichten modellen in de 8B-klasse verschoof{{/1}}, is {{2}}snelheid per eenheid geheugen{{/2}}. Qwen3-8B is een {{3}}dense model{{/3}}: elke token die het produceert, streamt alle {{4}}8.2B gewichten{{/4}} over de geheugenbus, wat verklaart waarom het traag is voor zijn omvang en waarom het {{5}}echte VRAM{{/5}} nodig heeft. LFM2.5-8B-A1B routeert elke token door ongeveer {{6}}1.5B actieve parameters{{/6}}, wat het hele ontwerppunt is — {{7}}een on-device MoE die snel en klein blijft{{/7}}. De eigen claims van Liquid gaan verder: ruwweg 253 tokens per seconde op een {{8}}M5 Max CPU{{/8}} met minder dan 6GB geheugen, {{9}}door de leverancier gerapporteerd{{/9}}. Wat ruwe doorvoer voor het {{10}}inzetbare model{{/10}} betreft, doet het draftmodel er voor dit deel van het verhaal niet eens toe — de MoE is {{11}}al meerdere keren sneller{{/11}} dan de dense 8B voordat je speculatie toevoegt.
Wat de prijs betreft: beide hebben open gewichten, dus zelf hosten kost wat je hardware ook kost. De hosted-vergelijking is scheef wat beschikbaarheid betreft: Qwen3-8B wordt aangeboden via Alibaba's API tegen een lijstprijs van $0,18 per miljoen input-tokens en $2,10 per miljoen output-tokens, en via een breed scala aan third-party open-model hosts; LFM2.5-8B-A1B heeft geen noemenswaardige first-party prijzen voor gehoste tokens, en de draft heeft helemaal geen prijzen. Dat betekent dat de praktische manier waarop de meeste teams Liquid's edge-MoE vandaag de dag draaien, zelf gehost is: op een laptop, een edge-box of een eigen GPU — en dat is precies de opstelling waarin de DSpark-draft de relevante variabele wordt.
Wat het concept daadwerkelijk verandert voor dit besluit
De draft verandert slechts één as: hoe snel de LFM2.5-8B-A1B tokens produceert in een serving-stack die je beheert. Het maakt het model niet slimmer en het verandert niet wat het antwoordt — de greedy-output is bit-identiek aan die van het doelmodel alleen. Waar het helpt, is bij GPU-serving met single-request-doorvoer: Liquid mat een gemiddelde van 2,54× op een enkele H100 over vijf benchmarks (418 → 1.074 tokens per seconde), met als beste resultaat 3,18× op MATH500, bij batchgrootte 1 en temperatuur 0. Waar het nauwelijks helpt, is bij Apple Silicon: hetzelfde model haalde gemiddeld slechts 1,18× op een M4 Max (90 → 106 tok/s), omdat het verifiëren van een blok draft-tokens meer experts activeert in de huidige Metal MoE-backend van llama.cpp en meer gewichtsverkeer verplaatst — precies de kosten die speculatieve decoding zou moeten amortiseren. Dit zijn allemaal leverancierscijfers vanaf de releasedag, niet onafhankelijk gereproduceerd.
Die splitsing leidt direct tot een beslissingsregel. Als je LFM2.5-8B-A1B draait op een GPU die je zelf bezit, is de draft een echte kostenhefboom — ruwweg 2,5× meer tokens per seconde uit dezelfde silicon, zonder enige verandering in output, en je hebt alleen een build nodig met de DSpark-integraties van 20 augustus. Als je het model in plaats daarvan via een API aanroept, houdt de provider de snelheidswinst en is de draft voor jou irrelevant. En als het apparaat een laptop of telefoon is, is de draft voor dit specifieke model tegenwoordig vrijwel een no-op; het zijn de zuster-drafts voor de dichte LFM2.5-1.2B-Instruct en LFM2.5-2.6B die de on-device-winsten opleveren, met respectievelijk 2,54× en 2,27×. Qwen3-8B heeft op zijn beurt helemaal geen draft nodig — het is simpelweg een langzamer, dichter model dat geen speculatieve decodering vereist om inzetbaar te zijn.

De keuze, een jaar na de introductie van Qwen3-8B
Qwen3-8B is de saaie, correcte standaardkeuze: volwassen, Apache-2.0, 119 talen, denk- en niet-denkmodi, overal beschikbaar, en nog steeds een prima generalist voor chat, code en gestructureerde tekst. De problemen zijn ouderdom en snelheid — een 16 maanden oude dichte 8B die langzaam is voor zijn klasse en op sommige platforms al als verouderd wordt beschouwd, wat een onderhoudssignaal is dat je serieus moet nemen als je vandaag een greenfield-project start.
LFM2.5-8B-A1B is de nieuwere, smallere inzet: een edge-first MoE die is gebouwd voor tool calling en het opvolgen van instructies op consumentenhardware, met de DSpark-draft als optionele serveringsboost voor GPU self-host. Het is geen slimmer model — beide liggen onder de mediaan van open-weights op Artificial Analysis — maar het is een stuk sneller en gebruikt een fractie van het geheugen per token, en dat is de afweging die telt voor on-device-agents. De kanttekeningen zijn het spiegelbeeld van die van Qwen3-8B: een recentere release, geen first-party hosted prijsstelling en een speculative-decoding-verhaal waarvan de cijfers buiten de leverancier nog door niemand zijn gereproduceerd.
De routeringslaag eronder blijft in beide gevallen hetzelfde. Noch LFM2.5-8B-A1B, noch Qwen3-8B staat vandaag in de gehoste catalogus van OrcaRouter, dus om eerlijk te zijn, dit is wat een router voor de mix doet: één API voor 200+ gehoste modellen met lijstprijzen van providers die tegen 0% opslag worden doorgegeven, zodat een prijsverlaging van een leverancier dezelfde dag dat deze wordt aangekondigd live is op het platform; automatische failover, zodat je een nieuw, onbewezen model kunt uitproberen tegen echt verkeer in plaats van iets waarop je een productiepad zou gokken; en een routerings-DSL die als front-end kan fungeren voor een model dat je zelf host — zo kunnen een zelfgehoste LFM2.5-8B-A1B-stack en gehoste endpoints achter één sleutel naast elkaar bestaan.
Als je bouwt voor een laptop of een edge-box en geeft om de snelheid van tool-calling, is LFM2.5-8B-A1B de richting om te testen, en de draft levert een gratis 2,5× op het GPU-servingpad wanneer het zover is. Als je een generalist wilt waar je geen omkijken naar hebt, werkt Qwen3-8B nog steeds — weet alleen dat het een model uit begin 2025 is dat het ecosysteem begint uit te faseren. Het enige dat noch de draft noch het target verandert, is de eerlijke stand van het bewijs: alles wat snel is aan de DSpark-release is een meting van één leverancier op één dag, en onafhankelijke benchmarks zijn het openstaande punt dat bepaalt hoeveel hiervan je daadwerkelijk vertrouwt.
