Une carte titre principale pour la comparaison LFM2.5-8B-A1B-DSpark contre Qwen3-8B, sous-titrée « Le draft qui accélère un modèle, contre le 8B que tout le monde fait déjà tourner », montrant à gauche un encadré « Draft 327M » envoyant des pastilles de tokens dans une carte MoE « LFM2.5-8B-A1B » en tuiles empilées, avec une aiguille de compteur de vitesse bien haute sous une étiquette « DÉCODAGE SPÉCULATIF », et à droite une carte en bulle de discussion étiquetée « Qwen3-8B » avec une étincelle et une icône d'horloge sous une étiquette « MODÈLE GÉNÉRALISTE », avec une étiquette de date « août 2026 » et le logo OrcaRouter composé dans le coin inférieur droit.
Guides & Insights

LFM2.5-8B-A1B-DSpark vs Qwen3-8B : Le Draft qui accélère un modèle, face au 8B que tout le monde fait déjà tourner

Auteur

Elias Hawthorne

Date de publication

Derniers modèles · 20Voir tous les modèles
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

{{1}}Liquid AI a publié le checkpoint draft LFM2.5-8B-A1B-DSpark le 20 août 2026{{/1}} — {{2}}un assistant de décodage spéculatif de 327,7 millions de paramètres{{/2}} qui {{3}}permet au MoE edge LFM2.5-8B-A1B de générer jusqu'à 3,18× plus vite sur un seul H100{{/3}}. {{4}}Pour que cette comparaison soit honnête{{/4}}, {{5}}un fait doit être posé sur la table{{/5}} : {{6}}le checkpoint DSpark n'est pas un modèle que l'on peut appeler{{/6}}. {{7}}Il ne fait qu'accélérer un autre modèle{{/7}}. Ainsi, {{8}}la véritable question de déploiement qu'alimente cette sortie{{/8}} est {{9}}celle que la plupart des équipes soupesent depuis le début de l'année{{/9}} — {{10}}LFM2.5-8B-A1B ou Qwen3-8B{{/10}}, deux modèles open-weight de classe 8B à des moments très différents de leur vie.

Le cadre importe plus que d'habitude ici, car les deux côtés ne sont pas le même type de chose. Qwen3-8B est un modèle complet et déployable que vous pouvez auto-héberger ou dont vous pouvez acheter des tokens dès aujourd'hui. LFM2.5-8B-A1B est également un modèle complet et déployable — le brouillon DSpark est un module complémentaire à celui-ci, pas une version. Tout ce que le brouillon promet est mesuré par le fournisseur et date d'un jour ; tout ce qui concerne les dépôts et les formats est simplement là pour être vérifié. Cet article maintient ces deux catégories séparées.

Premièrement, le mot « DSpark » n'est pas le nom dans cette phrase.

Le décodage spéculatif fait fonctionner un modèle de proposition bon marché en avance sur le vrai modèle : le proposeur devine les quelques tokens suivants, la cible vérifie tout le bloc en un seul passage avant, et elle conserve ce sur quoi les deux sont d'accord. Quand les prédictions sont bonnes, vous avancez de plusieurs tokens pour le prix d'un seul chargement de poids, ce qui fait grimper le débit sans toucher aux poids de la cible — et comme la cible vérifie chaque token proposé, la sortie en décodage glouton est identique à celle obtenue en exécutant LFM2.5-8B-A1B seul. Liquid appelle cela « sans perte par construction », et c'est toute la raison pour laquelle une proposition peut être ajoutée sans risque.

Le LFM2.5-8B-A1B-DSpark de Liquid est un modèle draft délibérément compact : cinq couches d'attention uniquement, un bloc de neuf tokens proposés par étape, et une tête de Markov sur le vocabulaire de 128 000 tokens de la cible, entraîné pendant 15 époques sur un mélange de données de chat, de code et d'appels de fonction, avec des checkpoints sélectionnés en fonction du taux d'acceptation plutôt que de la perte. C'est l'un des trois modèles draft que le fournisseur a expédiés ce jour-là, aux côtés du LFM2.5-1.2B-Instruct et du LFM2.5-2.6B, chacun aux formats Safetensors et GGUF, avec un support SGLang et llama.cpp dès le premier jour. C'est aussi, point important pour quiconque lit une comparaison avec un modèle de classe 8B : il n'est servi par aucun fournisseur d'inférence et n'a pas de prix par token. Il ne vit qu'à l'intérieur de votre propre pile de décodage spéculatif.

A screenshot of the Hugging Face model page for LiquidAI/LFM2.5-8B-A1B-DSpark, showing the tags TextGeneration, Safetensors, sglang, qwen3_speculative-decoding, dspark and lfm2_lfm2_moe draft model, the lfm1.0 license, a 0.3B model size, the 'Inference Providers' section, and the card text 'LFM2.5-DSpark is a family of speculative-decoding draft models that adapt DSpark for the LFM2.5 architecture' (captured August 21, 2026).

Les deux modèles qui se déploient réellement

Une fois le draft écarté, la vraie comparaison oppose le modèle qu'il accélère au modèle en place. Tous deux sont à poids ouverts et comptent environ 8B de paramètres, mais c'est là que s'arrête la ressemblance :

• Architecture — LFM2.5-8B-A1B est un MoE épars avec 8,3 milliards de paramètres au total, mais seulement ~1,5 milliard actifs par jeton ; Qwen3-8B est un modèle dense de 8,2 milliards de paramètres qui active chaque paramètre à chaque jeton.

• Version — LFM2.5-8B-A1B publié le 28 mai 2026 ; Qwen3-8B publié en avril 2025 et vieux de plus d'un an, déjà déprécié sur certaines plateformes de service.

• Contexte — LFM2.5-8B-A1B offre un contexte natif de 128K avec un vocabulaire de 128K tokens ; Qwen3-8B offre 32K natif, extensible à environ 128K via YaRN.

• Raisonnement — LFM2.5-8B-A1B est un modèle de raisonnement qui émet une chaîne de pensée explicite ; Qwen3-8B alterne entre les modes réflexion et non-réflexion selon la requête.

• Intelligence — selon Artificial Analysis, LFM2.5-8B-A1B obtient un indice d'intelligence de 8 et Qwen3-8B obtient 8–8,3, tous deux en dessous de la médiane de 9 pour des modèles open-weight comparables ; aucun n'est un cerveau de pointe, et tous deux sont honnêtes à ce sujet.

• Vitesse — selon Artificial Analysis, LFM2.5-8B-A1B produit environ 340 tokens par seconde, tous fournisseurs confondus ; Qwen3-8B se situe autour de 37–40 tokens par seconde, parmi les plus lents de sa catégorie.

• Licence — LFM2.5-8B-A1B est sous la LFM Open License v1.0 de Liquid ; Qwen3-8B est sous Apache-2.0.

A comparison scoreboard for LFM2.5-8B-A1B and Qwen3-8B. The left column shows the Liquid model as an MoE with 8.3B total and 1.5B active parameters, 128K native context, an AA Intelligence Index of 8 (median 9), roughly 340 tokens per second across providers, the DSpark draft adding up to 3.18x on an H100 but only 1.18x on an M4 Max, and self-host-only availability. The right column shows Qwen3-8B as a dense 8.2B model, 32K native context extended to ~128K via YaRN, an AA Intelligence Index of 8-8.3, roughly 37-40 tokens per second, no draft needed, and availability through Alibaba's API plus many open hosts, with a footer reading 'LFM speedups vendor-measured Aug 20 2026, unreproduced; throughput per Artificial Analysis; Qwen3-8B per Alibaba' and the OrcaRouter logo in the bottom-right corner.

C'est au niveau de la vitesse que cela cesse d'être serré.

La principale raison pour laquelle le débat sur les modèles open-weight de classe 8B a évolué est la vitesse par unité de mémoire. Qwen3-8B est un modèle dense : chaque jeton qu'il produit fait transiter l'intégralité des 8,2 milliards de poids sur le bus mémoire, ce qui explique pourquoi il est lent pour sa taille et pourquoi il nécessite une véritable VRAM. LFM2.5-8B-A1B achemine chaque jeton à travers environ 1,5 milliard de paramètres actifs, ce qui constitue l'essence même de sa conception — un MoE embarqué qui reste rapide et compact. Les affirmations de Liquid vont plus loin : environ 253 jetons par seconde sur un CPU M5 Max avec moins de 6 Go de mémoire, selon le fournisseur. En ce qui concerne le débit brut du modèle déployable, le draft n'a même pas d'importance dans cette partie de l'histoire — le MoE est déjà plusieurs fois plus rapide que le 8B dense avant même d'ajouter la spéculation.

En ce qui concerne le prix, les deux sont à poids ouverts, donc l'auto-hébergement de l'un ou l'autre coûte ce que coûte votre matériel. La comparaison des services hébergés est déséquilibrée en termes de disponibilité : Qwen3-8B est servi par l'API d'Alibaba au prix catalogue de 0,18 $ par million de tokens en entrée et de 2,10 $ par million de tokens en sortie, ainsi que par un large ensemble d'hébergeurs tiers de modèles ouverts ; LFM2.5-8B-A1B n'a pas de tarification de tokens hébergés de première partie digne de mention, et le draft n'en a aucune. Ce qui signifie qu'en pratique, la plupart des équipes exécuteront le MoE edge de Liquid en auto-hébergement, sur un ordinateur portable, une box edge ou un GPU qu'elles possèdent — et c'est exactement la configuration où le draft DSpark devient la variable pertinente.

Ce que le projet change réellement pour cette décision

Le modèle draft ne modifie qu'un seul axe : la vitesse à laquelle le LFM2.5-8B-A1B produit des tokens dans une pile de service que vous contrôlez. Il ne rend pas le modèle plus intelligent et ne change pas ses réponses — la sortie gloutonne est bit-identique à celle de la cible seule. Là où il aide, c'est sur le service GPU en débit à requête unique : Liquid a mesuré une moyenne de 2,54× sur un seul H100 sur cinq benchmarks (418 → 1 074 tokens par seconde), avec un maximum de 3,18× sur MATH500, avec une taille de lot de 1 et une température de 0. Là où il aide à peine, c'est sur les puces Apple : le même modèle n'a atteint en moyenne que 1,18× sur un M4 Max (90 → 106 tok/s), car la vérification d'un bloc de tokens de brouillon active davantage d'experts dans le backend Metal MoE actuel de llama.cpp et déplace davantage de trafic de poids — le coût exact que le décodage spéculatif est censé amortir. Tous ces chiffres sont des données du fournisseur datant du jour de la sortie, non reproduites de manière indépendante.

Cette répartition se traduit directement par une règle de décision. Si vous servez LFM2.5-8B-A1B sur un GPU qui vous appartient, le draft est un véritable levier de coût — environ 2,5× plus de tokens par seconde à partir du même silicium, sans aucun changement de sortie, et il vous suffit d’une version avec les intégrations DSpark du 20 août. Si vous appelez le modèle via une API à la place, le fournisseur conserve l’accélération et le draft ne vous est d’aucune utilité. Et si l’appareil est un ordinateur portable ou un téléphone, le draft pour ce modèle particulier est aujourd’hui proche d’un no-op ; les drafts associés pour les modèles denses LFM2.5-1.2B-Instruct et LFM2.5-2.6B sont ceux qui offrent des gains sur l’appareil, avec respectivement 2,54× et 2,27×. Qwen3-8B, pour sa part, n’a pas besoin de draft du tout — c’est simplement un modèle plus lent et plus dense qui ne nécessite pas de décodage spéculatif pour être déployable.

A screenshot of the Hugging Face model page for Qwen/Qwen3-8B, showing the TextGeneration tag, Transformers and Safetensors formats, the qwen3 conversational tag, the apache-2.0 license, and the Qwen3 Highlights describing the ability to switch seamlessly between thinking mode and non-thinking mode (captured August 18, 2026).

Le choix, un an après le lancement de Qwen3-8B

Qwen3-8B est le choix par défaut ennuyeux mais correct : mature, sous licence Apache-2.0, 119 langues, modes de raisonnement et de non-raisonnement, disponible partout, et toujours un généraliste parfaitement bon pour le chat, le code et le texte structuré. Ses problèmes sont l'âge et la vitesse — un 8B dense vieux de 16 mois, lent pour sa catégorie et déjà déprécié sur certaines plateformes, ce qui est un signal de maintenance à prendre au sérieux si vous démarrez un projet greenfield aujourd'hui.

LFM2.5-8B-A1B est le pari le plus récent et le plus ciblé des deux : un MoE orienté edge, conçu pour un appel d'outils et un suivi d'instructions rapides sur du matériel grand public, avec le modèle draft DSpark comme boost de serving facultatif pour le cas de l'auto-hébergement sur GPU. Ce n'est pas un modèle plus intelligent — les deux se situent sous la médiane des modèles open-weights sur Artificial Analysis — mais il est nettement plus rapide pour une fraction de la mémoire par jeton, et c'est ce compromis qui compte pour les agents on-device. Ses limites sont l'exact miroir de celles de Qwen3-8B : une sortie plus récente, aucune tarification d'hébergement first-party, et une promesse de décodage spéculatif dont personne en dehors du fournisseur n'a encore reproduit les chiffres.

La couche de routage sous-jacente reste la même dans les deux cas. Ni LFM2.5-8B-A1B ni Qwen3-8B ne figurent aujourd'hui au catalogue hébergé d'OrcaRouter. Le cadrage honnête consiste donc à décrire ce qu'un routeur apporte à l'ensemble : une API unique pour plus de 200 modèles hébergés, avec les prix catalogue des fournisseurs répercutés sans marge (0 %), si bien qu'une baisse de prix d'un fournisseur prend effet sur la plateforme le jour même de son annonce ; un basculement automatique, si bien qu'un nouveau modèle non éprouvé se teste sur du trafic réel plutôt que de lui confier un chemin de production ; et un DSL de routage qui peut faire office de façade pour un modèle que vous servez vous-même, ce qui permet à une pile LFM2.5-8B-A1B auto-hébergée de coexister avec des endpoints hébergés derrière une seule clé.

Si vous développez pour un ordinateur portable ou une box edge et que la vitesse d'appel d'outils vous importe, LFM2.5-8B-A1B est la direction à tester, et le draft est un gain gratuit de 2,5× sur la voie de service GPU le moment venu. Si vous voulez un généraliste dont vous n'avez plus à vous soucier, Qwen3-8B fonctionne toujours — sachez simplement que c'est un modèle de début 2025 que l'écosystème commence à écarter. La seule chose que ni le draft ni la cible ne changent, c'est l'état honnête des preuves : tout ce qui est rapide dans la version DSpark est une mesure d'un seul fournisseur sur une seule journée, et les benchmarks indépendants sont l'élément ouvert qui détermine à quel point vous pouvez réellement faire confiance à tout cela.

© 2026 OrcaRouter

Pour les fournisseurs

Vous exploitez une plateforme d'inférence ? Proposez vos modèles sur OrcaRouter.

providers@orcarouter.ai

Rejoignez notre communauté

Discordsupport@orcarouter.aiXGitHubYouTube