
LFM2.5-8B-A1B-DSpark vs Qwen3-8B: La bozza che accelera un modello, contro l'8B che tutti già eseguono
- DeepSeekNUOVODeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 per 1M di token
- z-aiNUOVOZ.ai: GLM 5.32026-08-1860Intelligenza75Codice
- obsidianNUOVOQwen3.8 27B2026-08-1552Intelligenza68Codice
- qwenNUOVOQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekNUOVODeepSeek: DeepSeek V4 Pro 08132026-08-1253Intelligenza69Codice
- grokNUOVOSpaceXAI: Grok 4.62026-08-1261Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0557Intelligenza72Codice
- qwenQwen: Qwen3.8 Max2026-08-0358Intelligenza72Codice
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligenza69Codice
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M di token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligenza78Codice
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligenza69Codice
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligenza49Codice
- metaMeta: Muse Spark 1.12026-07-1653Intelligenza71Codice
- kimiMoonshotAI: Kimi K32026-07-1560Intelligenza76Codice
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligenza71Codice
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Intelligenza77Codice
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Intelligenza77Codice
Liquid AI ha rilasciato il checkpoint draft LFM2.5-8B-A1B-DSpark il 20 agosto 2026 — un helper di decodifica speculativa da 327,7 milioni di parametri che accelera la generazione dell'edge MoE LFM2.5-8B-A1B fino a 3,18× su una singola H100. Prima che questo confronto possa essere onesto, un fatto deve stare sul tavolo: il checkpoint DSpark non è un modello che si può chiamare. Accelera soltanto un altro modello. Quindi la vera domanda di deployment che questa release alimenta è quella che la maggior parte dei team valuta da tutto l'anno — LFM2.5-8B-A1B o Qwen3-8B, due modelli open-weight di classe 8B in momenti molto diversi della loro vita.
Il contesto conta più del solito qui, perché le due parti non sono lo stesso tipo di cosa. Qwen3-8B è un modello completo e distribuibile che puoi ospitare da solo o per cui puoi acquistare token oggi. Anche LFM2.5-8B-A1B è un modello completo e distribuibile — la bozza DSpark è un componente aggiuntivo, non una versione di esso. Tutto ciò che promette la bozza è misurato dal fornitore e risale a un giorno fa; tutto ciò che riguarda i repository e i formati è semplicemente lì per essere verificato. Questo articolo tiene separati questi due insiemi.
Innanzitutto, la parola "DSpark" non è il sostantivo in questa frase.
La decodifica speculativa esegue un modello draft economico davanti a quello reale: il modello draft indovina la prossima manciata di token, il target verifica l'intero blocco in un'unica passata in avanti e conserva tutto ciò con cui concorda. Quando le previsioni sono buone, si avanzano diversi token al prezzo di una sola passata di caricamento dei pesi, quindi il throughput aumenta senza toccare i pesi del target — e poiché il target controlla ogni token proposto, l'output con decodifica greedy è identico a quello dell'esecuzione del solo LFM2.5-8B-A1B. Liquid lo definisce "lossless by construction", ed è proprio il motivo per cui è sicuro aggiungere un modello draft.
Il LFM2.5-8B-A1B-DSpark di Liquid è un drafter deliberatamente piccolo: cinque strati di sola attenzione, un blocco di nove token proposti per passaggio e una testa Markov sul vocabolario da 128.000 token del modello target, addestrato per 15 epoche su un mix di dati di chat, codice e chiamate di funzioni, con checkpoint selezionati in base al tasso di accettazione anziché alla loss. È uno dei tre modelli draft che il fornitore ha rilasciato quel giorno, insieme a LFM2.5-1.2B-Instruct e LFM2.5-2.6B, ciascuno in Safetensors e GGUF con supporto SGLang e llama.cpp dal primo giorno. È anche, cosa importante per chiunque legga un confronto con un modello di classe 8B: non è servito da alcun provider di inferenza e non ha un prezzo per token. Vive solo all'interno del tuo stack di decodifica speculativa.

I due modelli che vengono effettivamente distribuiti
Togliendo la bozza, il confronto reale è tra il modello che accelera e quello esistente. Entrambi sono a pesi aperti e di classe 8B, e qui le somiglianze finiscono:
• Architettura — LFM2.5-8B-A1B è un MoE sparso con 8,3B di parametri totali ma solo ~1,5B attivi per token; Qwen3-8B è un modello denso da 8,2B che attiva ogni parametro su ogni token.
• Release — LFM2.5-8B-A1B rilasciato il 28 maggio 2026; Qwen3-8B rilasciato ad aprile 2025 e ha più di un anno, già deprecato su alcune piattaforme di serving.
• Contesto — LFM2.5-8B-A1B offre un contesto nativo di 128K con un vocabolario di 128K token; Qwen3-8B offre 32K nativi, estendibili a circa 128K tramite YaRN.
• Ragionamento — LFM2.5-8B-A1B è un modello di ragionamento che emette una catena di pensiero esplicita; Qwen3-8B alterna tra modalità di pensiero e non-pensiero a seconda della richiesta.
• Intelligenza — secondo Artificial Analysis, LFM2.5-8B-A1B ottiene un Indice di Intelligenza di 8 e Qwen3-8B di 8–8.3, entrambi al di sotto della mediana di 9 per modelli open-weight comparabili; nessuno dei due è un cervello di frontiera, ed entrambi sono onesti al riguardo.
• Velocità — secondo Artificial Analysis, LFM2.5-8B-A1B genera circa 340 token al secondo tra i vari provider; Qwen3-8B si attesta intorno ai 37–40 token al secondo, tra i più lenti della sua categoria.
• Licenza — LFM2.5-8B-A1B è rilasciata sotto la LFM Open License v1.0 di Liquid; Qwen3-8B è Apache-2.0.

La velocità è dove questo smette di essere equilibrato.
La ragione principale per cui il dibattito sugli open-weight di classe 8B si è spostato è la velocità per unità di memoria. Qwen3-8B è un modello denso: ogni token che genera trasmette tutti gli 8.2B di pesi attraverso il bus di memoria, motivo per cui è lento per la sua dimensione e per cui richiede vera VRAM. LFM2.5-8B-A1B instrada ogni token attraverso circa 1.5B di parametri attivi, che è l'intero punto di progettazione: un MoE on-device che resta veloce e compatto. Le affermazioni di Liquid vanno oltre: circa 253 token al secondo su una CPU M5 Max con meno di 6GB di memoria, secondo quanto dichiarato dal vendor. Sul throughput grezzo del modello distribuibile, il draft non ha nemmeno importanza in questa parte della storia — il MoE è già diverse volte più veloce del denso 8B prima ancora di aggiungere la speculazione.
Sul prezzo, entrambi sono a pesi aperti, quindi l'auto-hosting dell'uno o dell'altro costa quanto costa il tuo hardware. Il confronto in hosting è sbilanciato in termini di disponibilità: Qwen3-8B è servito dall'API di Alibaba a un prezzo di listino di 0,18 $ per milione di token in input e 2,10 $ per milione di token in output, e da un'ampia gamma di host di modelli aperti di terze parti; LFM2.5-8B-A1B non ha prezzi di token hosting di prima parte degni di nota, e la bozza non ne ha affatto. Il che significa che il modo pratico con cui la maggior parte dei team eseguirà l'edge MoE di Liquid oggi è in auto-hosting, su un laptop, un edge box o una GPU di propria proprietà — ed è esattamente questo il contesto in cui la bozza DSpark diventa la variabile rilevante.
Cosa cambia effettivamente la bozza per questa decisione
La bozza modifica un solo asse: la velocità con cui LFM2.5-8B-A1B produce token in uno stack di serving che controlli tu. Non rende il modello più intelligente e non cambia ciò che risponde — l'output greedy è bit-identico a quello del solo target. Dove aiuta è il serving GPU a throughput a richiesta singola: Liquid ha misurato una media di 2,54× su una singola H100 in cinque benchmark (418 → 1.074 token al secondo), con un picco di 3,18× su MATH500, con batch size 1 e temperatura 0. Dove aiuta a malapena è il silicio Apple: lo stesso modello ha ottenuto in media solo 1,18× su un M4 Max (90 → 106 tok/s), perché la verifica di un blocco di token draft attiva più esperti nell'attuale backend Metal MoE di llama.cpp e sposta più traffico di pesi — esattamente il costo che la decodifica speculativa dovrebbe ammortizzare. Tutti questi sono dati del vendor risalenti al giorno del rilascio, non riprodotti in modo indipendente.
Questa suddivisione si traduce direttamente in una regola decisionale. Se servi LFM2.5-8B-A1B su una GPU di tua proprietà, il draft è una vera leva di costo — circa 2,5× token in più al secondo dallo stesso silicio, con zero modifiche all'output, e ti serve solo una build con le integrazioni DSpark del 20 agosto. Se invece chiami il modello tramite API, il provider mantiene l'aumento di velocità e il draft è irrilevante per te. E se il dispositivo è un laptop o un telefono, il draft per questo specifico modello è oggi quasi un no-op; i draft gemelli per i modelli densi LFM2.5-1.2B-Instruct e LFM2.5-2.6B sono quelli che offrono i vantaggi su dispositivo, rispettivamente a 2,54× e 2,27×. Qwen3-8B, dal canto suo, non richiede alcun draft — è semplicemente un modello più lento e denso che non necessita di decodifica speculativa per essere distribuito.

La scelta, a un anno di vita di Qwen3-8B
Qwen3-8B è il default noioso ma corretto: maturo, Apache-2.0, 119 lingue, modalità di pensiero e non-pensiero, disponibile ovunque, e comunque un generalista perfettamente valido per chat, codice e testo strutturato. I suoi problemi sono età e velocità — un 8B denso di 16 mesi, lento per la sua classe e già deprecato su alcune piattaforme, un segnale di manutenzione da prendere sul serio se oggi si avvia un progetto greenfield.
LFM2.5-8B-A1B è la scommessa più recente e più ristretta: un MoE edge-first progettato per il tool calling e il seguire istruzioni rapidamente su hardware consumer, con il draft DSpark come boost di serving opzionale per il caso di self-hosting su GPU. Non è un modello più intelligente — entrambi si collocano al di sotto della mediana dei pesi aperti su Artificial Analysis — ma è drammaticamente più veloce a una frazione della memoria per token, che è il trade-off che conta per gli agenti on-device. I suoi limiti sono l'immagine speculare di quelli di Qwen3-8B: un rilascio più recente, nessun prezzo di hosting di prima parte e una storia di decodifica speculativa i cui numeri nessuno al di fuori del fornitore ha ancora riprodotto.
Il livello di routing sottostante rimane lo stesso in entrambi i casi. Né LFM2.5-8B-A1B né Qwen3-8B sono oggi nel catalogo hosted di OrcaRouter, quindi la lettura onesta è ciò che un router fa per la combinazione: una sola API su oltre 200 modelli hosted, con i prezzi di listino dei provider trasferiti con margine dello 0%, così un taglio di prezzo del fornitore è attivo sulla piattaforma lo stesso giorno in cui viene annunciato; failover automatico, così un modello nuovo non testato lo provi sul traffico reale anziché scommetterci un percorso di produzione; e un DSL di routing che può fare da frontend a un modello che servi tu stesso, ed è così che uno stack LFM2.5-8B-A1B self-hosted coesiste con endpoint hosted dietro un'unica chiave.
Se stai sviluppando per un laptop o un edge box e ti interessa la velocità di tool-calling, LFM2.5-8B-A1B è la direzione da testare: il draft è un 2.5× gratuito nel percorso di serving GPU quando arriverà il momento. Se vuoi un generalista di cui puoi smettere di preoccuparti, Qwen3-8B funziona ancora — sappi solo che è un modello dell'inizio del 2025 che l'ecosistema sta iniziando a mettere da parte. L'unica cosa che né il draft né il target cambiano è lo stato onesto delle evidenze: tutto ciò che è veloce nella release DSpark è la misurazione di un singolo vendor fatta in un solo giorno, e i benchmark indipendenti sono il punto aperto che decide quanto di tutto questo è degno di fiducia.
