Karta tytułowa hero do porównania LFM2.5-8B-A1B-DSpark vs Qwen3-8B, z podtytułem „Szkic, który przyspiesza model, kontra 8B, które wszyscy już uruchamiają", przedstawiająca po lewej stronie pole „Draft 327M" wysyłające chipy tokenów do karty MoE „LFM2.5-8B-A1B" z kafelkami ułożonymi w stos, z wysoką wskazówką prędkościomierza pod etykietą „DEKODOWANIE SPEKULATYWNE", a po prawej stronie kartę z dymkiem czatu oznaczoną „Qwen3-8B" z ikoną iskry i zegara pod etykietą „MODEL OGÓLNY", ze znacznikiem daty „Sierpień 2026" i logo OrcaRouter wkomponowanym w prawym dolnym rogu.
Guides & Insights

LFM2.5-8B-A1B-DSpark kontra Qwen3-8B: Szkic, który przyspiesza model, w zestawieniu z 8B, który wszyscy już uruchamiają

Autor

Elias Hawthorne

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele →
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Firma Liquid AI wydała 20 sierpnia 2026 r. draftowy checkpoint LFM2.5-8B-A1B-DSpark — pomocnik dekodowania spekulatywnego o 327,7 mln parametrów, który sprawia, że edge'owy model MoE LFM2.5-8B-A1B generuje do 3,18× szybciej na pojedynczym H100. Zanim to porównanie będzie uczciwe, jeden fakt musi trafić na stół: checkpoint DSpark nie jest modelem, który można wywołać. Przyspiesza on wyłącznie inny model. Zatem prawdziwe pytanie wdrożeniowe, które podsyca ta premiera, to to, które większość zespołów rozważa przez cały rok — LFM2.5-8B-A1B czy Qwen3-8B, dwa modele open-weight klasy 8B w bardzo różnych momentach ich życia.

Kontekst ma tu większe znaczenie niż zwykle, ponieważ te dwie strony nie są tego samego rodzaju. Qwen3-8B to kompletny, gotowy do wdrożenia model, który można hostować samodzielnie lub kupować tokeny już dziś. LFM2.5-8B-A1B to także kompletny, gotowy do wdrożenia model — szkic DSpark jest do niego dodatkiem, a nie jego wersją. Wszystko, co obiecuje szkic, jest mierzone przez dostawcę i ma zaledwie dzień; wszystko, co dotyczy repozytoriów i formatów, można po prostu sprawdzić. Ten tekst trzyma te dwie kategorie oddzielnie.

Po pierwsze, słowo "DSpark" nie jest rzeczownikiem w tym zdaniu.

Spekulacyjne dekodowanie uruchamia tani model szkicowy przed właściwym: szkicownik przewiduje kolejną garść tokenów, a model docelowy weryfikuje cały blok w jednym przejściu w przód i zachowuje to, z czym się zgadza. Gdy przewidywania są dobre, przesuwasz się o kilka tokenów w cenie jednego przejścia z wagami, więc przepustowość rośnie bez dotykania wag modelu docelowego — a ponieważ model docelowy sprawdza każdy proponowany token, wynik przy dekodowaniu zachłannym jest identyczny z uruchomieniem samego LFM2.5-8B-A1B. Liquid nazywa to „bezstratnym z konstrukcji” i to jest cały powód, dla którego szkicowanie jest bezpieczne do dołączenia.

LFM2.5-8B-A1B-DSpark firmy Liquid to celowo mały model szkicujący: pięć warstw wyłącznie z mechanizmem uwagi, blok dziewięciu proponowanych tokenów na krok oraz głowica Markowa na słowniku 128 000 tokenów modelu docelowego, trenowany przez 15 epok na mieszance danych z czatów, kodu i wywołań funkcji, z punktami kontrolnymi wybieranymi według wskaźnika akceptacji, a nie straty. To jeden z trzech modeli szkicujących, które dostawca wypuścił tego dnia, obok LFM2.5-1.2B-Instruct i LFM2.5-2.6B, każdy w formatach Safetensors i GGUF, z obsługą SGLang i llama.cpp od pierwszego dnia. Co istotne dla każdego, kto czyta porównanie z modelem klasy 8B: nie jest udostępniany przez żadnego dostawcę wnioskowania i nie ma ceny za token. Funkcjonuje wyłącznie wewnątrz własnego stosu dekodowania spekulacyjnego.

A screenshot of the Hugging Face model page for LiquidAI/LFM2.5-8B-A1B-DSpark, showing the tags TextGeneration, Safetensors, sglang, qwen3_speculative-decoding, dspark and lfm2_lfm2_moe draft model, the lfm1.0 license, a 0.3B model size, the 'Inference Providers' section, and the card text 'LFM2.5-DSpark is a family of speculative-decoding draft models that adapt DSpark for the LFM2.5 architecture' (captured August 21, 2026).

Dwa modele, które faktycznie są wdrażane

Odrzuć szkic, a prawdziwe porównanie wypada między przyspieszanym modelem a obecnym liderem. Oba są otwartej wagi i mniej więcej klasy 8B, a na tym podobieństwa się kończą:

• Architektura — LFM2.5-8B-A1B to rzadki model MoE z łącznie 8,3 mld parametrów, ale tylko ~1,5 mld aktywnych na token; Qwen3-8B to gęsty model o 8,2 mld parametrów, który aktywuje każdy parametr przy każdym tokenie.

• Wydanie — LFM2.5-8B-A1B wydany 28 maja 2026; Qwen3-8B wydany w kwietniu 2025 i ma ponad rok, już zdeprecjonowany na niektórych platformach serwerowych.

• Kontekst — LFM2.5-8B-A1B oferuje natywny kontekst 128K ze słownikiem 128K tokenów; Qwen3-8B oferuje 32K natywnie, rozszerzalny do około 128K poprzez YaRN.

• Rozumowanie — LFM2.5-8B-A1B to model rozumujący, który generuje jawny łańcuch myśli; Qwen3-8B przełącza się między trybem myślenia i trybem bez myślenia w zależności od żądania.

• Inteligencja — według Artificial Analysis, LFM2.5-8B-A1B osiąga wskaźnik inteligencji 8, a Qwen3-8B osiąga 8–8,3, oba poniżej mediany 9 dla porównywalnych modeli o otwartych wagach; żaden z nich nie jest mózgiem z czołówki i oba szczerze to przyznają.

• Szybkość — według Artificial Analysis, LFM2.5-8B-A1B generuje około 340 tokenów na sekundę u różnych dostawców; Qwen3-8B osiąga około 37–40 tokenów na sekundę, należąc do najwolniejszych w swojej klasie.

• Licencja — LFM2.5-8B-A1B jest na licencji LFM Open License v1.0 firmy Liquid; Qwen3-8B jest na licencji Apache-2.0.

A comparison scoreboard for LFM2.5-8B-A1B and Qwen3-8B. The left column shows the Liquid model as an MoE with 8.3B total and 1.5B active parameters, 128K native context, an AA Intelligence Index of 8 (median 9), roughly 340 tokens per second across providers, the DSpark draft adding up to 3.18x on an H100 but only 1.18x on an M4 Max, and self-host-only availability. The right column shows Qwen3-8B as a dense 8.2B model, 32K native context extended to ~128K via YaRN, an AA Intelligence Index of 8-8.3, roughly 37-40 tokens per second, no draft needed, and availability through Alibaba's API plus many open hosts, with a footer reading 'LFM speedups vendor-measured Aug 20 2026, unreproduced; throughput per Artificial Analysis; Qwen3-8B per Alibaba' and the OrcaRouter logo in the bottom-right corner.

Prędkość to dziedzina, w której to przestaje być blisko.

Najważniejszym powodem, dla którego rozmowa o modelach open-weight klasy 8B przesunęła się w tym kierunku, jest szybkość na jednostkę pamięci. Qwen3-8B to model gęsty: każdy generowany token przesyła wszystkie 8,2 mld wag przez szynę pamięci, dlatego jest wolny jak na swój rozmiar i dlatego potrzebuje prawdziwego VRAM. LFM2.5-8B-A1B kieruje każdy token przez około 1,5 mld aktywnych parametrów — i to jest cały sens tej konstrukcji: MoE działający na urządzeniu, który pozostaje szybki i mały. Własne deklaracje Liquid idą dalej: około 253 tokenów na sekundę na CPU M5 Max przy mniej niż 6 GB pamięci — według danych producenta. Jeśli chodzi o surową przepustowość wdrażanego modelu, szkic nie ma tu nawet znaczenia — MoE jest już kilkakrotnie szybszy niż gęsty model 8B, zanim w ogóle doda się spekulację.

Jeśli chodzi o cenę, oba modele mają otwarte wagi, więc samodzielne hostowanie każdego z nich kosztuje tyle, ile wynosi koszt Twojego sprzętu. Porównanie hostowanych usług jest nierówne pod względem dostępności: Qwen3-8B jest oferowany przez API Alibaby w cenie katalogowej 0,18 USD za milion tokenów wejściowych i 2,10 USD za milion tokenów wyjściowych, a także przez szeroką gamę zewnętrznych hostów modeli otwartych; LFM2.5-8B-A1B nie ma znaczącego cennika tokenów hostowanych przez pierwszego producenta, a draft nie ma go wcale. Oznacza to, że praktycznym sposobem, w jaki większość zespołów będzie dziś uruchamiać edge MoE od Liquid, jest samodzielne hostowanie na laptopie, urządzeniu brzegowym lub własnym GPU — i to właśnie w takiej konfiguracji draft DSpark staje się istotną zmienną.

Co projekt faktycznie zmienia w tej decyzji

Model draftowy zmienia tylko jedną oś: jak szybko LFM2.5-8B-A1B generuje tokeny w stacku serwowania, który kontrolujesz. Nie sprawia, że model jest mądrzejszy, i nie zmienia tego, co odpowiada — wynik zachłanny jest bitowo identyczny z samym modelem docelowym. Pomaga natomiast w serwowaniu na GPU przy przepustowości dla pojedynczych żądań: Liquid zmierzył średnio 2,54× na pojedynczym H100 w pięciu benchmarkach (418 → 1 074 tokenów na sekundę), z najlepszym wynikiem 3,18× na MATH500, przy rozmiarze wsadu 1 i temperaturze 0. Na krzemie Apple pomaga ledwie: ten sam model osiągał średnio tylko 1,18× na M4 Max (90 → 106 tok/s), ponieważ weryfikacja bloku tokenów draftu aktywuje więcej ekspertów w obecnym backendzie Metal MoE w llama.cpp i zwiększa ruch wag — dokładnie ten koszt, który spekulacyjne dekodowanie ma amortyzować. Wszystko to dane producenta z dnia premiery, a nie niezależnie odtworzone.

Ten podział bezpośrednio przekłada się na regułę decyzyjną. Jeśli używasz LFM2.5-8B-A1B na własnym GPU, draft to realna dźwignia kosztowa — mniej więcej 2,5× więcej tokenów na sekundę z tego samego krzemu, przy zerowej zmianie wyników, a potrzebujesz tylko wersji z integracjami DSpark z 20 sierpnia. Jeśli natomiast wywołujesz model przez API, dostawca zachowuje przyspieszenie, a draft jest dla Ciebie nieistotny. A jeśli urządzeniem jest laptop lub telefon, draft dla tego konkretnego modelu jest dziś niemal bez efektu; to drafty towarzyszące dla gęstych modeli LFM2.5-1.2B-Instruct i LFM2.5-2.6B przynoszą korzyści na urządzeniu, odpowiednio 2,54× i 2,27×. Z kolei Qwen3-8B nie potrzebuje żadnego draftu — to po prostu wolniejszy, gęstszy model, który nie wymaga spekulatywnego dekodowania, aby można go było wdrożyć.

A screenshot of the Hugging Face model page for Qwen/Qwen3-8B, showing the TextGeneration tag, Transformers and Safetensors formats, the qwen3 conversational tag, the apache-2.0 license, and the Qwen3 Highlights describing the ability to switch seamlessly between thinking mode and non-thinking mode (captured August 18, 2026).

Wybór, rok po narodzinach Qwen3-8B

Qwen3-8B to nudna, poprawna domyślna opcja: dojrzała, Apache-2.0, 119 języków, tryby myślenia i bez myślenia, dostępna wszędzie i wciąż całkiem dobra jako model ogólnego przeznaczenia do czatów, kodu i tekstu strukturalnego. Jego problemy to wiek i szybkość — 16-miesięczny gęsty model 8B, który jest wolny jak na swoją klasę i już zdeprecjonowany na niektórych platformach, co jest sygnałem konserwacyjnym, który warto potraktować poważnie, jeśli dziś zaczynasz projekt od zera.

LFM2.5-8B-A1B to nowszy, węższy zakład: MoE nastawiony na przetwarzanie brzegowe, stworzony do szybkiego wywoływania narzędzi i realizowania instrukcji na sprzęcie konsumenckim, z DSpark draft jako opcjonalnym przyspieszeniem serwowania w przypadku samodzielnego hostowania na GPU. To nie jest mądrzejszy model — oba plasują się poniżej mediany modeli o otwartych wagach w Artificial Analysis — ale jest zdecydowanie szybszy i zużywa ułamek pamięci na token, co jest kompromisem, który ma znaczenie dla agentów działających na urządzeniach. Jego wady są lustrzanym odbiciem wad Qwen3-8B: nowsze wydanie, brak cennika hostingu od samego producenta i opowieść o spekulacyjnym dekodowaniu, której liczb nikt poza dostawcą jeszcze nie odtworzył.

Warstwa routingu pod spodem pozostaje taka sama w obu przypadkach. Ani LFM2.5-8B-A1B, ani Qwen3-8B nie znajduje się dziś w hostowanym katalogu OrcaRouter, więc uczciwe ujęcie to to, co router robi dla tej mieszanki: jedno API obejmujące 200+ hostowanych modeli z cenami listowymi dostawców przekazywanymi dalej z 0% narzutu, dzięki czemu obniżka ceny dostawcy jest aktywna na platformie tego samego dnia, w którym została ogłoszona; automatyczne przełączanie awaryjne, dzięki któremu niesprawdzony nowy model wypróbowujesz na realnym ruchu, zamiast stawiać na niego ścieżkę produkcyjną; oraz DSL routingu, który może stanowić front dla modelu serwowanego przez Ciebie samodzielnie — w ten sposób samodzielnie hostowany stos LFM2.5-8B-A1B współistnieje z hostowanymi punktami końcowymi za jednym kluczem.

Jeśli budujesz pod laptopa lub urządzenie brzegowe i zależy Ci na szybkości wywoływania narzędzi, LFM2.5-8B-A1B to kierunek do przetestowania, a draft to darmowe 2,5× na ścieżce serwowania GPU, gdy nadejdzie czas. Jeśli chcesz model ogólnego przeznaczenia, o którym możesz zapomnieć, Qwen3-8B nadal działa — tylko pamiętaj, że to model z początku 2025 roku, który ekosystem zaczyna wycofywać. Jedyne, czego nie zmienia ani draft, ani model docelowy, to uczciwy stan dowodów: wszystko, co szybkie w wydaniu DSpark, to pomiar jednego dostawcy z jednego dnia, a niezależne benchmarki pozostają otwartą kwestią, która decyduje, w jakim stopniu możesz temu zaufać.