
LFM2.5-8B-A1B-DSpark kontra Qwen3-8B: Szkic, który przyspiesza model, w zestawieniu z 8B, który wszyscy już uruchamiają
- openaiNOWOŚĆOpenAI: GPT-6.1 Sol2026-09-2952Inteligencja
- anthropicNOWOŚĆAnthropic: Claude Sonnet 5.52026-09-2856Inteligencja
- typesafeNOWOŚĆTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 za 1 mln tokenów · 145 tok/s
- OpenAINOWOŚĆOpenAI: GPT-6 Luna2026-09-2238Inteligencja
- OpenAINOWOŚĆOpenAI: GPT-6 Sol2026-09-2248Inteligencja
- AnthropicNOWOŚĆAnthropic: Claude Opus 5.52026-09-2258Inteligencja
- xAIGrok 4.72026-09-2146Inteligencja
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 za 1 mln tokenów · 128 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów · 933 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 za 1 mln tokenów · 51 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów · 182 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
Firma Liquid AI wydała 20 sierpnia 2026 r. draftowy checkpoint LFM2.5-8B-A1B-DSpark — pomocnik dekodowania spekulatywnego o 327,7 mln parametrów, który sprawia, że edge'owy model MoE LFM2.5-8B-A1B generuje do 3,18× szybciej na pojedynczym H100. Zanim to porównanie będzie uczciwe, jeden fakt musi trafić na stół: checkpoint DSpark nie jest modelem, który można wywołać. Przyspiesza on wyłącznie inny model. Zatem prawdziwe pytanie wdrożeniowe, które podsyca ta premiera, to to, które większość zespołów rozważa przez cały rok — LFM2.5-8B-A1B czy Qwen3-8B, dwa modele open-weight klasy 8B w bardzo różnych momentach ich życia.
Kontekst ma tu większe znaczenie niż zwykle, ponieważ te dwie strony nie są tego samego rodzaju. Qwen3-8B to kompletny, gotowy do wdrożenia model, który można hostować samodzielnie lub kupować tokeny już dziś. LFM2.5-8B-A1B to także kompletny, gotowy do wdrożenia model — szkic DSpark jest do niego dodatkiem, a nie jego wersją. Wszystko, co obiecuje szkic, jest mierzone przez dostawcę i ma zaledwie dzień; wszystko, co dotyczy repozytoriów i formatów, można po prostu sprawdzić. Ten tekst trzyma te dwie kategorie oddzielnie.
Po pierwsze, słowo "DSpark" nie jest rzeczownikiem w tym zdaniu.
Spekulacyjne dekodowanie uruchamia tani model szkicowy przed właściwym: szkicownik przewiduje kolejną garść tokenów, a model docelowy weryfikuje cały blok w jednym przejściu w przód i zachowuje to, z czym się zgadza. Gdy przewidywania są dobre, przesuwasz się o kilka tokenów w cenie jednego przejścia z wagami, więc przepustowość rośnie bez dotykania wag modelu docelowego — a ponieważ model docelowy sprawdza każdy proponowany token, wynik przy dekodowaniu zachłannym jest identyczny z uruchomieniem samego LFM2.5-8B-A1B. Liquid nazywa to „bezstratnym z konstrukcji” i to jest cały powód, dla którego szkicowanie jest bezpieczne do dołączenia.
LFM2.5-8B-A1B-DSpark firmy Liquid to celowo mały model szkicujący: pięć warstw wyłącznie z mechanizmem uwagi, blok dziewięciu proponowanych tokenów na krok oraz głowica Markowa na słowniku 128 000 tokenów modelu docelowego, trenowany przez 15 epok na mieszance danych z czatów, kodu i wywołań funkcji, z punktami kontrolnymi wybieranymi według wskaźnika akceptacji, a nie straty. To jeden z trzech modeli szkicujących, które dostawca wypuścił tego dnia, obok LFM2.5-1.2B-Instruct i LFM2.5-2.6B, każdy w formatach Safetensors i GGUF, z obsługą SGLang i llama.cpp od pierwszego dnia. Co istotne dla każdego, kto czyta porównanie z modelem klasy 8B: nie jest udostępniany przez żadnego dostawcę wnioskowania i nie ma ceny za token. Funkcjonuje wyłącznie wewnątrz własnego stosu dekodowania spekulacyjnego.

Dwa modele, które faktycznie są wdrażane
Odrzuć szkic, a prawdziwe porównanie wypada między przyspieszanym modelem a obecnym liderem. Oba są otwartej wagi i mniej więcej klasy 8B, a na tym podobieństwa się kończą:
• Architektura — LFM2.5-8B-A1B to rzadki model MoE z łącznie 8,3 mld parametrów, ale tylko ~1,5 mld aktywnych na token; Qwen3-8B to gęsty model o 8,2 mld parametrów, który aktywuje każdy parametr przy każdym tokenie.
• Wydanie — LFM2.5-8B-A1B wydany 28 maja 2026; Qwen3-8B wydany w kwietniu 2025 i ma ponad rok, już zdeprecjonowany na niektórych platformach serwerowych.
• Kontekst — LFM2.5-8B-A1B oferuje natywny kontekst 128K ze słownikiem 128K tokenów; Qwen3-8B oferuje 32K natywnie, rozszerzalny do około 128K poprzez YaRN.
• Rozumowanie — LFM2.5-8B-A1B to model rozumujący, który generuje jawny łańcuch myśli; Qwen3-8B przełącza się między trybem myślenia i trybem bez myślenia w zależności od żądania.
• Inteligencja — według Artificial Analysis, LFM2.5-8B-A1B osiąga wskaźnik inteligencji 8, a Qwen3-8B osiąga 8–8,3, oba poniżej mediany 9 dla porównywalnych modeli o otwartych wagach; żaden z nich nie jest mózgiem z czołówki i oba szczerze to przyznają.
• Szybkość — według Artificial Analysis, LFM2.5-8B-A1B generuje około 340 tokenów na sekundę u różnych dostawców; Qwen3-8B osiąga około 37–40 tokenów na sekundę, należąc do najwolniejszych w swojej klasie.
• Licencja — LFM2.5-8B-A1B jest na licencji LFM Open License v1.0 firmy Liquid; Qwen3-8B jest na licencji Apache-2.0.

Prędkość to dziedzina, w której to przestaje być blisko.
Najważniejszym powodem, dla którego rozmowa o modelach open-weight klasy 8B przesunęła się w tym kierunku, jest szybkość na jednostkę pamięci. Qwen3-8B to model gęsty: każdy generowany token przesyła wszystkie 8,2 mld wag przez szynę pamięci, dlatego jest wolny jak na swój rozmiar i dlatego potrzebuje prawdziwego VRAM. LFM2.5-8B-A1B kieruje każdy token przez około 1,5 mld aktywnych parametrów — i to jest cały sens tej konstrukcji: MoE działający na urządzeniu, który pozostaje szybki i mały. Własne deklaracje Liquid idą dalej: około 253 tokenów na sekundę na CPU M5 Max przy mniej niż 6 GB pamięci — według danych producenta. Jeśli chodzi o surową przepustowość wdrażanego modelu, szkic nie ma tu nawet znaczenia — MoE jest już kilkakrotnie szybszy niż gęsty model 8B, zanim w ogóle doda się spekulację.
Jeśli chodzi o cenę, oba modele mają otwarte wagi, więc samodzielne hostowanie każdego z nich kosztuje tyle, ile wynosi koszt Twojego sprzętu. Porównanie hostowanych usług jest nierówne pod względem dostępności: Qwen3-8B jest oferowany przez API Alibaby w cenie katalogowej 0,18 USD za milion tokenów wejściowych i 2,10 USD za milion tokenów wyjściowych, a także przez szeroką gamę zewnętrznych hostów modeli otwartych; LFM2.5-8B-A1B nie ma znaczącego cennika tokenów hostowanych przez pierwszego producenta, a draft nie ma go wcale. Oznacza to, że praktycznym sposobem, w jaki większość zespołów będzie dziś uruchamiać edge MoE od Liquid, jest samodzielne hostowanie na laptopie, urządzeniu brzegowym lub własnym GPU — i to właśnie w takiej konfiguracji draft DSpark staje się istotną zmienną.
Co projekt faktycznie zmienia w tej decyzji
Model draftowy zmienia tylko jedną oś: jak szybko LFM2.5-8B-A1B generuje tokeny w stacku serwowania, który kontrolujesz. Nie sprawia, że model jest mądrzejszy, i nie zmienia tego, co odpowiada — wynik zachłanny jest bitowo identyczny z samym modelem docelowym. Pomaga natomiast w serwowaniu na GPU przy przepustowości dla pojedynczych żądań: Liquid zmierzył średnio 2,54× na pojedynczym H100 w pięciu benchmarkach (418 → 1 074 tokenów na sekundę), z najlepszym wynikiem 3,18× na MATH500, przy rozmiarze wsadu 1 i temperaturze 0. Na krzemie Apple pomaga ledwie: ten sam model osiągał średnio tylko 1,18× na M4 Max (90 → 106 tok/s), ponieważ weryfikacja bloku tokenów draftu aktywuje więcej ekspertów w obecnym backendzie Metal MoE w llama.cpp i zwiększa ruch wag — dokładnie ten koszt, który spekulacyjne dekodowanie ma amortyzować. Wszystko to dane producenta z dnia premiery, a nie niezależnie odtworzone.
Ten podział bezpośrednio przekłada się na regułę decyzyjną. Jeśli używasz LFM2.5-8B-A1B na własnym GPU, draft to realna dźwignia kosztowa — mniej więcej 2,5× więcej tokenów na sekundę z tego samego krzemu, przy zerowej zmianie wyników, a potrzebujesz tylko wersji z integracjami DSpark z 20 sierpnia. Jeśli natomiast wywołujesz model przez API, dostawca zachowuje przyspieszenie, a draft jest dla Ciebie nieistotny. A jeśli urządzeniem jest laptop lub telefon, draft dla tego konkretnego modelu jest dziś niemal bez efektu; to drafty towarzyszące dla gęstych modeli LFM2.5-1.2B-Instruct i LFM2.5-2.6B przynoszą korzyści na urządzeniu, odpowiednio 2,54× i 2,27×. Z kolei Qwen3-8B nie potrzebuje żadnego draftu — to po prostu wolniejszy, gęstszy model, który nie wymaga spekulatywnego dekodowania, aby można go było wdrożyć.

Wybór, rok po narodzinach Qwen3-8B
Qwen3-8B to nudna, poprawna domyślna opcja: dojrzała, Apache-2.0, 119 języków, tryby myślenia i bez myślenia, dostępna wszędzie i wciąż całkiem dobra jako model ogólnego przeznaczenia do czatów, kodu i tekstu strukturalnego. Jego problemy to wiek i szybkość — 16-miesięczny gęsty model 8B, który jest wolny jak na swoją klasę i już zdeprecjonowany na niektórych platformach, co jest sygnałem konserwacyjnym, który warto potraktować poważnie, jeśli dziś zaczynasz projekt od zera.
LFM2.5-8B-A1B to nowszy, węższy zakład: MoE nastawiony na przetwarzanie brzegowe, stworzony do szybkiego wywoływania narzędzi i realizowania instrukcji na sprzęcie konsumenckim, z DSpark draft jako opcjonalnym przyspieszeniem serwowania w przypadku samodzielnego hostowania na GPU. To nie jest mądrzejszy model — oba plasują się poniżej mediany modeli o otwartych wagach w Artificial Analysis — ale jest zdecydowanie szybszy i zużywa ułamek pamięci na token, co jest kompromisem, który ma znaczenie dla agentów działających na urządzeniach. Jego wady są lustrzanym odbiciem wad Qwen3-8B: nowsze wydanie, brak cennika hostingu od samego producenta i opowieść o spekulacyjnym dekodowaniu, której liczb nikt poza dostawcą jeszcze nie odtworzył.
Warstwa routingu pod spodem pozostaje taka sama w obu przypadkach. Ani LFM2.5-8B-A1B, ani Qwen3-8B nie znajduje się dziś w hostowanym katalogu OrcaRouter, więc uczciwe ujęcie to to, co router robi dla tej mieszanki: jedno API obejmujące 200+ hostowanych modeli z cenami listowymi dostawców przekazywanymi dalej z 0% narzutu, dzięki czemu obniżka ceny dostawcy jest aktywna na platformie tego samego dnia, w którym została ogłoszona; automatyczne przełączanie awaryjne, dzięki któremu niesprawdzony nowy model wypróbowujesz na realnym ruchu, zamiast stawiać na niego ścieżkę produkcyjną; oraz DSL routingu, który może stanowić front dla modelu serwowanego przez Ciebie samodzielnie — w ten sposób samodzielnie hostowany stos LFM2.5-8B-A1B współistnieje z hostowanymi punktami końcowymi za jednym kluczem.
Jeśli budujesz pod laptopa lub urządzenie brzegowe i zależy Ci na szybkości wywoływania narzędzi, LFM2.5-8B-A1B to kierunek do przetestowania, a draft to darmowe 2,5× na ścieżce serwowania GPU, gdy nadejdzie czas. Jeśli chcesz model ogólnego przeznaczenia, o którym możesz zapomnieć, Qwen3-8B nadal działa — tylko pamiętaj, że to model z początku 2025 roku, który ekosystem zaczyna wycofywać. Jedyne, czego nie zmienia ani draft, ani model docelowy, to uczciwy stan dowodów: wszystko, co szybkie w wydaniu DSpark, to pomiar jednego dostawcy z jednego dnia, a niezależne benchmarki pozostają otwartą kwestią, która decyduje, w jakim stopniu możesz temu zaufać.
