
LFM2.5-8B-A1B-DSpark jämfört med LFM2.5-2.6B-Base: Snabbhetsdelen mot råmaterialet
- z-aiNYZ.ai: GLM 5.32026-08-1860Intelligens75Kodning
- obsidianNYQwen3.8 27B2026-08-1552Intelligens68Kodning
- qwenNYQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekNYDeepSeek: DeepSeek V4 Pro 08132026-08-1253Intelligens69Kodning
- grokNYSpaceXAI: Grok 4.62026-08-1261Intelligens77Kodning
- metaMeta: Muse Spark 1.22026-08-0557Intelligens72Kodning
- qwenQwen: Qwen3.8 Max2026-08-0358Intelligens72Kodning
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligens69Kodning
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligens78Kodning
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligens69Kodning
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligens49Kodning
- metaMeta: Muse Spark 1.12026-07-1653Intelligens71Kodning
- kimiMoonshotAI: Kimi K32026-07-1560Intelligens76Kodning
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligens71Kodning
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Intelligens77Kodning
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Intelligens77Kodning
- grokxAI: Grok 4.52026-07-0856Intelligens72Kodning
Sortera LFM2.5-familjen efter vad varje checkpoint kan göra på egen hand, och LFM2.5-8B-A1B-DSpark och LFM2.5-2.6B-Base hamnar i motsatta ändar av linjen — och ingen av ändarna kan svara på en fråga. Det första är en draftmodell med 327.7M parametrar som enbart finns för att få Liquid AI:s edge mixture-of-experts-modell att generera tokens snabbare. Det andra är en rå förtränad checkpoint med 2.69B parametrar som enbart finns för att finjusteras till något annat. Båda släpptes i augusti 2026 under Liquid AI:s LFM Open License v1.0, båda är en nedladdning bort på Hugging Face, och båda är extremt lätta att ta av misstag — eftersom deras namn får dem att låta som två versioner av samma sak.
Namnen är fällan. "DSpark" framstår som familjens sprudlande nya flaggskepp, och "Base" framstår som den enkla standarden du faktiskt kan köra. Inget av detta är sant. DSpark-checkpointen kan inte svara på något på egen hand — den föreslår bara tokens som LFM2.5-8B-A1B ska verifiera. Base kan inte heller svara på något, men av motsatt anledning — den är en ojusterad grundmodell som förutsäger text men som aldrig har eftertränats till en chatt- eller agentmodell. Detta är inte en rivalitet; det är en pipeline. Den ena checkpointen sitter alldeles i slutet av en serveringsstack, den andra alldeles i början av en träningskörning.
Två kontrollpunkter som delar ett namn, inte ett jobb.
LFM2.5-8B-A1B-DSpark (släppt den 20 augusti 2026) är en spekulativ avkodningsmodell: ett nätverk med endast fem uppmärksamhetslager, ett block med nio föreslagna tokens per steg, och ett Markovhuvud över målets vokabulär på 128 000 tokens. Du laddar den bredvid LFM2.5-8B-A1B – en MoE med totalt 8,3B parametrar, varav ~1,5B aktiva, som lanserades redan den 28 maj – modellen gissar de nästföljande tokens, och målet verifierar hela blocket i ett enda framåtpass, och behåller det den accepterar. Eftersom målet kontrollerar varje token är utdata under girig avkodning identisk med att köra LFM2.5-8B-A1B ensam: ”förlustfritt per konstruktion”, som Liquid uttrycker det. Modellen är en hastighetsdel, inte en hjärna. Den släpptes tillsammans med syskonmodeller för LFM2.5-1.2B-Instruct och LFM2.5-2.6B, var och en i Safetensors och GGUF, med stöd från dag ett i SGLang och llama.cpp.
LFM2.5-2.6B-Base (släppt 4 augusti 2026) är den andra änden av pipelinen: en grundmodell med 2,69 miljarder parametrar i en hybridstack med 30 lager — 22 dubbelportade kortkonvolutionsblock plus 8 grupperade frågeuppmärksamhetsblock — förtränad på cirka 34 biljoner token, med en mellanliggande träningsfas som utökar kontexten till 128K. Den har ingen chattmall, ingen instruktionsjustering och inga publicerade riktmärken, och Liquids egen modellkort rekommenderar den endast för omfattande finjustering. Hela dess syfte är att vara råmaterialet som en fyrastegs efterträningspipeline — två SFT-omgångar, lärarspecialisering, on-policy-destillering, sedan agentisk förstärkningsinlärning — förvandlar till verktygsanropande agenten LFM2.5-2.6B. Samma familj, samma licens, samma nedladdningssida. Helt olika uppgifter.
Sida vid sida: sju dimensioner, två jobb
Eftersom de två kontrollpunkterna har olika uppgifter, håller den ärliga jämförelsen reda på båda sidornas roller:
• Vad det är — LFM2.5-8B-A1B-DSpark är en 0,3B utkastsmodell för spekulativ avkodning; LFM2.5-2.6B-Base är en 2,69B rå förtränad grundmodell.
Vad den körs med — DSpark-utkastet paras ihop med LFM2.5-8B-A1B MoE (8,3B totalt, ~1,5B aktiva per token); Base körs på egen hand, men endast som ojusterad textprediktion.
• Fristående användning — DSpark producerar ingenting av sig självt; det accelererar bara ett mål. Base producerar text men inget användbart produktbeteende — ingen instruktionsföljning, inget verktygsanrop, ingen chattmall.
• Utmatningskvalitet — DSpark ärver målmodellens exakta giriga utdata, eftersom varje föreslagen token verifieras; Base har noll publicerade riktmärken på någon uppgift, avsiktligt.
• Hastighet — DSpark lägger till ett av leverantören uppmätt medelvärde på 2.54× på en H100 (upp till 3.18× på MATH500) och 1.18× på en M4 Max till sitt mål, ej reproducerat; Base har inget påstående om inferenshastighet alls.
• Minnesavtryck — DSpark lägger till ungefär 0.3GB draftvikter vid sidan av målmodellen; Base är hela 2.69B, körbar på under 2.5GB, den minsta seriösa grundmodellen i familjen.
• Format och tillgänglighet — DSpark levereras i Safetensors och GGUF med stöd för SGLang och llama.cpp från dag ett; Base levereras i Safetensors samt GGUF, ONNX och MLX och körs på Transformers, vLLM, SGLang, llama.cpp och MLX. Ingen av dem tillhandahålls av någon inferensleverantör i dag — båda är självvärdade checkpoints.

De enda siffrorna i den här matchen kom från ett labb.
Allt kvantitativt här är en enda leverantörs mätning, tagen samma dag som utkastet släpptes och ännu inte oberoende reproducerad – läs det som lovande, inte verifierat. Liquid mätte LFM2.5-8B-A1B-DSpark med batchstorlek 1, temperatur 0, på en enda 80GB H100 i BF16 under SGLang och på en M4 Max MacBook Pro i FP16 GGUF under llama.cpp:s experimentella Metal-kärnor. På H100:en gav paret i genomsnitt 2,54× (418 → 1 074 tokens per sekund), med bästa enskilda resultat 3,18× på MATH500 (428 → 1 362 tok/s) och en genomsnittlig acceptans på cirka 7 av 10 föreslagna tokens. På M4 Max gav samma par i genomsnitt bara 1,18× (90 → 106 tok/s) – det kantfall på enheten som Liquid själva flaggade, eftersom verifiering av ett block aktiverar fler experter i den nuvarande MoE Metal-backenden och flyttar mer vikttrafik över minnesbussen.
Base-sidan i den här jämförelsen har inga siffror alls, och den avsaknaden är i sig specen. LFM2.5-2.6B-Base var förtränad, inte eftertränad; den utvärderades aldrig för chatt, verktygsanvändning eller agentbeteende, eftersom ingen hade för avsikt att den skulle användas på det sättet. Dess meningsfulla siffror är arkitektoniska: 2,69B parametrar, 128K kontext, en 16-språkig tokenizer, under 2,5GB att köra. Man benchmarkar inte en grundmodell; man benchmarkar det man finjusterar den till.
Det finns en familjeironi som är värd att nämna innan du bestämmer något. Utkastet som den här artikeln handlar om — det för 8B-A1B — är just det som vinner minst på en laptop (1.18×), medan systerutkastet för 2.6B-familjen, som accelererar den eftertränade systern till just denna Base, i genomsnitt ger 2.27× på en M4 Max med en 57 % minskning av latensen för funktionsanrop med flera verktyg. Om enheten i fråga är en telefon eller en laptop snarare än en GPU-låda, så är 2.6B-vägen där snabbhetssagan lever.

Så vilken laddar du ner?
Du behöver aldrig välja direkt mellan dessa två, eftersom de inte är alternativ — men du måste veta vilket jobb du är i:
Om du serverar LFM2.5-8B-A1B på GPU:er du äger och vill ha fler tokens per sekund från samma hårdvara, är LFM2.5-8B-A1B-DSpark ett reversibelt tillägg: bygg SGLang eller llama.cpp med DSpark-integreringarna från 20 augusti, ange draften i startkommandot, behåll girig avkodning, och blockstorleken läses automatiskt från draftens konfiguration. Fördelen är ungefär 2,5× genomströmning utan någon förändring av utdata; nackdelen är 0,3 GB extra vikter och en byggversion som är tillräckligt ny för att innehålla PR:erna. Ta bort de två spekulativa flaggorna så är du tillbaka till den vanliga målmodellen.
Om du vill bygga din egen specialist — en domänmodell, en assistent för anpassat språk, en finjustering på proprietär data — är LFM2.5-2.6B-Base en av de billigaste seriösa startpunkterna i ekosystemet för öppna vikter: 2.6B, under 2.5GB, 128K-kontext, en flerspråkig tokenizer. DSpark-checkpointen kan inte hjälpa dig med det alls, eftersom den inte är en bas.
Om du faktiskt vill ha Liquid's on-device agent — verktygsanrop, flerstegsuppgifter — så vill du inte ha någon av dessa två. Du vill ha den post-tränade LFM2.5-2.6B, och du kan bestämma efteråt om du vill koppla på dess egen draft. Base är råmaterial för folk som vill träna; 8B-A1B draft är en hastighetsdel för folk som redan deployar MoE. Fel drag är att ladda ner Base för att du ville ha en snabbare agent, eller draften för att du ville ha en grund att träna på.

Där de två möts — och var en router passar in.
Båda kontrollpunkterna är självhostade historier. Utkastet är ett tjänstelagerstillbehör som bara finns i din egen SGLang- eller llama.cpp-stack; Basen är ett träningsartefakt. Ingen av dem förekommer i någon hostad katalog, och ingen har ett pris per token. I praktiken innebär det att vilken väg som helst hamnar bredvid de hostade modeller du redan anropar – och den blandningen är precis den rördragning som ett routningslager finns till för att kollapsa.
På servingsidan är utkastets ekonomi enkel och påtaglig: 2,5× fler tokens per sekund från samma GPU innebär 2,5× kortare tid och ungefär 2,5× färre GPU:er för samma arbetsbelastning, utan kvalitetsförändring. Men den hävstången finns bara om du själv äger inferensen. I samma stund som du anropar 8B-A1B via ett API behåller leverantören snabbheten – och det är där API-jämförelsen blir den som räknas: vad en leverantör tar betalt och om en prissänkning når dig samma dag som den tillkännages. Det är poängen med en pass-through-router: ett API mot över 200 modeller, leverantörernas listpriser som skickas vidare med 0 % påslag så att en leverantörs sänkning blir omedelbart aktuell hos dig, och automatisk failover så att en enskild leverantörs latensspik inte blir din latens. Du kan också koppla din egen självhostade LFM-stack till samma slutpunkt – på så sätt testar du en helt ny utkastsmodell mot verklig trafik utan att satsa en produktionsväg på den.
LFM2.5-8B-A1B-DSpark och LFM2.5-2.6B-Base delar ett efternamn och motsatta uppgifter: den ena är en snabbkomponent bultad vid kanten av MoE, den andra är den otrimmade hjärnan som 2.6B-agenten växer ur. Ingen av dem körs på egen hand. Välj draftern för att accelerera en MoE du redan serverar på GPU:er, välj Base för att finjustera en 2.6B-grund till något eget, och hoppa över båda om det du ville ha var en fungerande agent — för det enda båda checkpointarna har gemensamt är att ingen av dem, var för sig, gör något du kan använda.
FAQ
Kan jag köra LFM2.5-8B-A1B-DSpark själv?
Nej. Det är en utkastsmodell utan fristående utdata — den föreslår kandidattoken som målmodellen LFM2.5-8B-A1B sedan verifierar, så den existerar bara inuti en serveringsstack för spekulativ avkodning byggd på integrationerna från 20 augusti för SGLang eller llama.cpp. Att ladda ner den ensam ger dig ingenting att fråga.
Är LFM2.5-2.6B-Base den checkpoint som körs på enheten som en agent?
Inte som den är. Base är den råa förtränade grunden utan instruktionsjustering och utan chattmall. Modellen som körs som Liquids enhetsagent är den eftertränade LFM2.5-2.6B, som produceras från Base genom den fyrstegs efterträningspipelinen — och, om du vill ha den snabbare, i par med LFM2.5-2.6B-DSpark-utkastet.
