Ett hero-titelkort för jämförelsen LFM2.5-8B-A1B-DSpark vs Qwen3-8B, med undertiteln 'Utkastet som snabbar upp en modell, mot 8B-modellen som alla redan kör', som till vänster visar en 'Draft 327M'-ruta som skickar token-chips till ett MoE-kort med staplade plattor märkt 'LFM2.5-8B-A1B', med en hastighetsmätarnål högt på skalan under etiketten 'SPECULATIVE DECODING', och till höger ett chatbubblakort märkt 'Qwen3-8B' med en gnista och en klockikon under etiketten 'GENERALIST MODEL', med en datumtagg märkt 'August 2026' och OrcaRouter-logotypen inkomponerad i det nedre högra hörnet.
Guides & Insights

LFM2.5-8B-A1B-DSpark vs Qwen3-8B: Utkastet som snabbar upp en modell, mot 8B-modellen alla redan kör

Författare

Elias Hawthorne

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Liquid AI släppte LFM2.5-8B-A1B-DSpark-utkastkontrollpunkten den 20 augusti 2026 — en spekulativ avkodningshjälpare med 327,7 miljoner parametrar som gör att LFM2.5-8B-A1B edge MoE genererar upp till 3,18× snabbare på en enda H100. Innan denna jämförelse kan vara ärlig måste ett faktum läggas på bordet: DSpark-kontrollpunkten är inte en modell du kan anropa. Den accelererar bara en annan modell. Så den verkliga driftsättningsfrågan som denna release ger upphov till är den som de flesta team har vägt hela året — LFM2.5-8B-A1B eller Qwen3-8B, två 8B-klassmodeller med öppna vikter vid mycket olika tidpunkter i sina liv.

Ramen spelar större roll än vanligt här, eftersom de två sidorna inte är samma sorts sak. Qwen3-8B är en komplett, driftsättbar modell som du kan self-hosta eller köpa tokens för idag. LFM2.5-8B-A1B är också en komplett, driftsättbar modell — DSpark-utkastet är ett tillägg till den, inte en version av den. Allt som utkastet lovar är leverantörsmätt och en dag gammalt; allt om repon och format finns helt enkelt där för att kontrolleras. Den här texten håller dessa två fack åtskilda.

Först, ordet "DSpark" är inte substantivet i den här meningen.

Spekulativ avkodning kör en billig utkastsmodell framför den riktiga: den gissar nästa handfull tokens, målmodellen verifierar hela blocket i ett enda framåtpass och behåller det den håller med om. När gissningarna är bra flyttar du flera tokens för priset av en enda viktinläsningspass, så genomströmningen ökar utan att röra målmodellens vikter — och eftersom målmodellen kontrollerar varje föreslagen token är utdata under girig avkodning identisk med att köra LFM2.5-8B-A1B ensamt. Liquid kallar detta "förlustfritt genom konstruktion", och det är hela anledningen till att ett utkast är säkert att koppla på.

Liquids LFM2.5-8B-A1B-DSpark är en medvetet liten drafter: fem lager med enbart attention, ett block med nio föreslagna token per steg och ett Markov-huvud över målmodellens vokabulär på 128 000 token, tränad i 15 epoker på en blandning av chatt-, kod- och funktionsanropsdata med checkpoints utvalda utifrån acceptansgrad snarare än loss. Den är en av tre utkastmodeller som leverantören släppte den dagen, tillsammans med LFM2.5-1.2B-Instruct och LFM2.5-2.6B, var och en i Safetensors- och GGUF-format med SGLang- och llama.cpp-stöd från dag ett. Den är också, viktigt för den som läser en jämförelse med en modell i 8B-klassen: den serveras inte av någon inferensleverantör och har inget pris per token. Den lever bara inuti din egen spekulativa avkodningsstack.

A screenshot of the Hugging Face model page for LiquidAI/LFM2.5-8B-A1B-DSpark, showing the tags TextGeneration, Safetensors, sglang, qwen3_speculative-decoding, dspark and lfm2_lfm2_moe draft model, the lfm1.0 license, a 0.3B model size, the 'Inference Providers' section, and the card text 'LFM2.5-DSpark is a family of speculative-decoding draft models that adapt DSpark for the LFM2.5 architecture' (captured August 21, 2026).

De två modellerna som faktiskt deployas

Ta bort utkastet och den verkliga jämförelsen står mellan modellen den accelererar och den befintliga. Båda är open-weight och ungefär i 8B-klassen, och sedan slutar likheterna:

• Arkitektur — LFM2.5-8B-A1B är en gles MoE med 8,3B totala parametrar men endast ~1,5B aktiva per token; Qwen3-8B är en tät 8,2B-modell som aktiverar varje parameter vid varje token.

• Release — LFM2.5-8B-A1B släpptes 28 maj 2026; Qwen3-8B släpptes i april 2025 och är över ett år gammal, redan utfasad på vissa serverplattformar.

• Kontext — LFM2.5-8B-A1B erbjuder ett inbyggt 128K-sammanhang med ett vokabulär på 128K-token; Qwen3-8B erbjuder 32K inbyggt, utbyggbart till cirka 128K via YaRN.

• Resonemang — LFM2.5-8B-A1B är en resonerande modell som avger en explicit tankekedja; Qwen3-8B växlar mellan tanke- och icke-tankelägen per förfrågan.

• Intelligens — enligt Artificial Analysis får LFM2.5-8B-A1B ett intelligensindex på 8 och Qwen3-8B får 8–8,3, båda under medianen på 9 för jämförbara modeller med öppna vikter; ingen av dem är en frontlinjehjärna, och båda är ärliga med det.

• Hastighet — enligt Artificial Analysis producerar LFM2.5-8B-A1B ungefär 340 tokens per sekund över leverantörer; Qwen3-8B ligger runt 37–40 tokens per sekund, bland de långsammaste i sin klass.

• Licens — LFM2.5-8B-A1B licensieras under Liquid's LFM Open License v1.0; Qwen3-8B är Apache-2.0.

A comparison scoreboard for LFM2.5-8B-A1B and Qwen3-8B. The left column shows the Liquid model as an MoE with 8.3B total and 1.5B active parameters, 128K native context, an AA Intelligence Index of 8 (median 9), roughly 340 tokens per second across providers, the DSpark draft adding up to 3.18x on an H100 but only 1.18x on an M4 Max, and self-host-only availability. The right column shows Qwen3-8B as a dense 8.2B model, 32K native context extended to ~128K via YaRN, an AA Intelligence Index of 8-8.3, roughly 37-40 tokens per second, no draft needed, and availability through Alibaba's API plus many open hosts, with a footer reading 'LFM speedups vendor-measured Aug 20 2026, unreproduced; throughput per Artificial Analysis; Qwen3-8B per Alibaba' and the OrcaRouter logo in the bottom-right corner.

Fart är där detta slutar vara jämnt.

Den enskilt största anledningen till att {{1}}diskussionen om 8B-klassens öppna viktmodeller har skiftat är hastighet per minnesenhet{{/1}}. Qwen3-8B är en tät modell: varje token den producerar strömmar alla 8,2B vikter över minnesbussen, vilket är anledningen till att den är långsam för sin storlek och behöver rejält med VRAM. LFM2.5-8B-A1B dirigerar varje token genom cirka {{2}}1,5B aktiva parametrar{{/2}}, vilket är hela poängen med designen — en MoE på enheten som förblir snabb och liten. Liquids egna påståenden går längre: ungefär {{3}}253 tokens per sekund på en M5 Max CPU med under 6 GB minne{{/3}}, enligt leverantören. När det gäller rå genomströmning för den driftsättbara modellen spelar utkastet inte ens någon roll i den här delen av historien — MoE:n är redan flera gånger snabbare än den täta 8B-modellen innan du lägger till spekulativ avkodning.

När det gäller pris är båda öppna vikter, så att självhosta den ena eller den andra kostar vad din hårdvara kostar. Den värdbaserade jämförelsen är ojämn i tillgänglighet: Qwen3-8B serveras via Alibabas API till ett listpris på 0,18 USD per miljon inmatningstokens och 2,10 USD per miljon utmatningstokens, och av en bred uppsättning tredjepartsvärdar för öppna modeller; LFM2.5-8B-A1B har ingen nämnvärd prissättning för värdbaserade tokens från tillverkaren, och utkastet har ingen alls. Vilket innebär att det praktiska sättet de flesta team idag kommer att köra Liquids edge-MoE är självhosterat, på en bärbar dator, en edge-box eller en GPU de äger — och det är precis den installationen där DSpark-utkastet blir den relevanta variabeln.

Vad utkastet faktiskt ändrar för detta beslut

Draftmodellen ändrar {{1}}bara en enda axel{{/1}}: {{2}}hur snabbt LFM2.5-8B-A1B producerar token i en servingstack du kontrollerar{{/2}}. {{3}}Det gör inte modellen smartare, och det ändrar inte vad den svarar — girig utdata är bitidentisk med enbart målmodellen{{/3}}. {{4}}Där det hjälper är GPU-serving med genomströmning för enstaka förfrågningar: Liquid uppmätte ett genomsnitt på 2,54× på en enda H100 över fem benchmarks (418 → 1 074 token per sekund), med bästa resultatet 3,18× på MATH500, vid batchstorlek 1 och temperatur 0{{/4}}. {{5}}Där det knappt hjälper är Apple silicon: samma modell låg i genomsnitt på bara 1,18× på en M4 Max (90 → 106 tok/s), eftersom verifieringen av ett block med draft-token aktiverar fler experter i llama.cpp:s nuvarande Metal MoE-backend och flyttar mer vikttrafik — exakt den kostnad som spekulativ avkodning är tänkt att amortisera{{/5}}. {{6}}Alla dessa är leverantörssiffror från släppdagen, inte oberoende reproducerade{{/6}}.

Den uppdelningen mappar direkt till en beslutsregel. Om du kör LFM2.5-8B-A1B på en GPU du äger, är draften en verklig kostnadshävstång — ungefär 2,5× fler tokens per sekund från samma kisel, med helt oförändrade utdata, och du behöver bara en build med DSpark-integreringarna från den 20 augusti. Om du istället anropar modellen via ett API, behåller leverantören hastighetsökningen och draften är irrelevant för dig. Och om enheten är en laptop eller en telefon, är draften för just den här modellen närmast en no-op idag; det är draftmodellerna för de täta LFM2.5-1.2B-Instruct och LFM2.5-2.6B som ger vinsterna på enheten, med 2,54× respektive 2,27×. Qwen3-8B å sin sida behöver ingen draft alls — det är helt enkelt en långsammare, tätare modell som inte kräver spekulativ avkodning för att kunna driftsättas.

A screenshot of the Hugging Face model page for Qwen/Qwen3-8B, showing the TextGeneration tag, Transformers and Safetensors formats, the qwen3 conversational tag, the apache-2.0 license, and the Qwen3 Highlights describing the ability to switch seamlessly between thinking mode and non-thinking mode (captured August 18, 2026).

Valet, ett år in i Qwen3-8B:s liv

Qwen3-8B är det tråkiga, korrekta standardvalet: mogen, Apache-2.0, 119 språk, tänkande och icke-tänkande lägen, tillgänglig överallt, och fortfarande en fullt duglig generalist för chatt, kod och strukturerad text. Dess problem är ålder och hastighet — en 16 månader gammal dense 8B som är långsam för sin klass och redan utfasad på vissa plattformar, vilket är en underhållssignal värd att ta på allvar om du startar ett greenfield-projekt idag.

LFM2.5-8B-A1B är det nyare, smalare vadet: en edge-first MoE byggd för verktygsanrop och instruktionsföljning i hög hastighet på konsumenthårdvara, med DSpark-utkastet som ett valfritt serveringslyft för GPU-självvärdsfallet. Det är inte en smartare modell — båda ligger under medianen för öppna vikter på Artificial Analysis — men den är dramatiskt snabbare till en bråkdel av minnet per token, vilket är den avvägning som spelar roll för agenter på enheten. Dess varningar är spegelbilden av Qwen3-8B:s: en nyare release, inga priser för förstapartshostning, och en spekulativ avkodningsberättelse vars siffror ingen utanför leverantören ännu har reproducerat.

Routinglagret under förblir detsamma oavsett. Varken LFM2.5-8B-A1B eller Qwen3-8B finns i OrcaRouters värdkatalog idag, så den ärliga beskrivningen är vad en router gör för mixen: ett API för 200+ värdmodeller med leverantörernas listpriser som slussas vidare med 0 % påslag, så en prissänkning från leverantören är live på plattformen samma dag som den tillkännages; automatisk failover så att en oprövad ny modell är något du testar mot riktig trafik snarare än något du satsar en produktionsväg på; och en routing-DSL som kan fronta en modell som du själv serverar, vilket är hur en självvärd LFM2.5-8B-A1B-stack samexisterar med värdendpunkter bakom en enda nyckel.

Om du bygger för en laptop eller en edge-enhet och bryr dig om verktygsanropshastighet, är LFM2.5-8B-A1B den riktning du bör testa, och utkastet är en gratis 2,5× på GPU-servingsvägen när det väl blir aktuellt. Om du vill ha en generalist du kan sluta fundera över, fungerar Qwen3-8B fortfarande — men kom ihåg att det är en modell från tidigt 2025 som ekosystemet börjar fasa ut. Det enda som varken utkastet eller målmodellen förändrar är den ärliga bilden av evidensen: allt som är snabbt med DSpark-släppet är en enda leverantörs mätning från en enda dag, och oberoende benchmarks är den öppna frågan som avgör hur mycket av detta du faktiskt litar på.

© 2026 OrcaRouter

För leverantörer

Driver du en inferensplattform? Få dina modeller på OrcaRouter.

providers@orcarouter.ai

Gå med i vår community

Discordsupport@orcarouter.aiXGitHubYouTube