Une carte titre héroïque pour la comparaison LFM2.5-8B-A1B-DSpark vs LFM2.5-2.6B-Base, sous-titrée « La partie vitesse vs la matière première », montrant à gauche une petite boîte « Draft 327M » envoyant des chips de tokens à travers une flèche vers une carte en tuiles empilées « LFM2.5-8B-A1B vérifie » avec un arc de compteur de vitesse en dessous, et à droite un bloc « 2.6B Base » avec une flèche vers une carte de modèle vierge « votre fine-tune », avec une étiquette de date « Août 2026 » et le logo OrcaRouter incrusté dans le coin inférieur droit.
Guides & Insights

LFM2.5-8B-A1B-DSpark vs LFM2.5-2.6B-Base : La partie vitesse par rapport à la matière première

Auteur

Gideon Frost

Date de publication

Derniers modèles · 20Voir tous les modèles
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Classez la famille LFM2.5 selon ce que chaque checkpoint peut faire par lui-même, et LFM2.5-8B-A1B-DSpark et LFM2.5-2.6B-Base se retrouvent aux deux extrémités opposées du spectre — et aucune des deux extrémités ne peut répondre à une question. Le premier est un modèle draft de 327,7 millions de paramètres qui existe uniquement pour accélérer la génération de jetons du modèle mixture-of-experts edge de Liquid AI. Le second est un checkpoint brut pré-entraîné de 2,69 milliards de paramètres qui existe uniquement pour être affiné en autre chose. Les deux ont été publiés en août 2026 sous la licence LFM Open License v1.0 de Liquid, les deux sont à un simple téléchargement sur Hugging Face, et les deux sont extrêmement faciles à télécharger par erreur — car leurs noms les font ressembler à deux versions de la même chose.

Les noms sont le piège. « DSpark » évoque le nouveau fleuron pétillant de la famille, et « Base » évoque le simple modèle par défaut que l'on peut réellement exécuter. Ni l'un ni l'autre n'est vrai. Le checkpoint DSpark ne peut répondre à rien par lui-même — il ne propose que des tokens que LFM2.5-8B-A1B doit vérifier. Le modèle Base ne peut pas non plus répondre à quoi que ce soit, mais pour la raison inverse — c'est un modèle de fondation non ajusté qui prédit du texte mais n'a jamais été post-entraîné en modèle de chat ou d'agent. Ce n'est pas une rivalité ; c'est un pipeline. Un checkpoint se situe tout à la fin d'une pile de service, l'autre tout au début d'un entraînement.

Deux points de contrôle qui partagent un nom, pas un métier.

LFM2.5-8B-A1B-DSpark (sorti le 20 août 2026) est un modèle draft pour le décodage spéculatif : un réseau à cinq couches composé uniquement d’attention, un bloc de neuf jetons proposés par étape, et une tête de Markov sur le vocabulaire de 128 000 jetons de la cible. Vous le chargez à côté du LFM2.5-8B-A1B — un MoE de 8,3B au total, ~1,5B actifs, sorti le 28 mai — le draft devine les quelques jetons suivants, et la cible vérifie tout le bloc en une seule passe avant, en gardant ce qu’elle accepte. Comme la cible vérifie chaque jeton, la sortie en décodage glouton est identique à l’exécution du LFM2.5-8B-A1B seul : « sans perte par construction », pour reprendre l’expression de Liquid. Le draft est une pièce de vitesse, pas un cerveau. Il a été publié aux côtés de drafts frères pour LFM2.5-1.2B-Instruct et LFM2.5-2.6B, chacun en Safetensors et GGUF, avec un support dès le lancement dans SGLang et llama.cpp.

LFM2.5-2.6B-Base (publié le 4 août 2026) est l'autre extrémité du pipeline : un modèle de fondation de 2,69 milliards de paramètres dans une pile hybride de 30 couches — 22 blocs de convolution courte à double porte plus 8 blocs d'attention à requêtes groupées — pré-entraîné sur environ 34 billions de tokens, avec une phase d'entraînement intermédiaire qui étend le contexte à 128K. Il n'a pas de template de chat, pas de réglage par instructions et aucun benchmark publié, et la fiche modèle de Liquid ne le recommande que pour un fine-tuning approfondi. Son seul but est d'être la matière première qu'un pipeline de post-entraînement en quatre étapes — deux cycles de SFT, spécialisation des enseignants, distillation on-policy, puis apprentissage par renforcement agentique — transforme en agent d'appel d'outils LFM2.5-2.6B. Même famille, même licence, même page de téléchargement. Des rôles entièrement différents.

Côte à côte : sept dimensions, deux emplois

Parce que les deux points de contrôle ont des fonctions différentes, la comparaison honnête ne mélange pas les rôles des deux côtés :

• Ce que c'est — LFM2.5-8B-A1B-DSpark est un modèle draft de décodage spéculatif de 0,3B ; LFM2.5-2.6B-Base est un modèle de fondation pré-entraîné brut de 2,69B.

• Ce avec quoi il fonctionne — le draft DSpark s’associe au MoE LFM2.5-8B-A1B (8,3B au total, ~1,5B actifs par token) ; le modèle Base fonctionne seul, mais uniquement comme prédiction de texte non affinée.

• Utilisation autonome — DSpark ne produit rien par lui-même ; il ne fait qu'accélérer une cible. Base produit du texte, mais aucun comportement produit utile — ni suivi d'instructions, ni appel d'outils, ni gabarit de chat.

• Qualité de sortie — DSpark hérite de la sortie gloutonne exacte de la cible, car chaque jeton proposé est vérifié ; Base n'a aucun benchmark publié sur aucune tâche, par conception.

• Vitesse — DSpark ajoute une moyenne mesurée par le vendeur de 2.54× sur un H100 (jusqu'à 3.18× sur MATH500) et 1.18× sur un M4 Max à sa cible, non reproduite ; Base ne revendique aucune vitesse d'inférence.

• Empreinte mémoire — DSpark ajoute environ 0,3 Go de poids de draft à côté de la cible ; Base est le 2,69B complet, exécutable en moins de 2,5 Go, la plus petite fondation sérieuse de la famille.

• Formats et disponibilité — DSpark est disponible en Safetensors et GGUF avec une prise en charge de SGLang et llama.cpp dès le premier jour ; Base est disponible en Safetensors ainsi qu'en GGUF, ONNX et MLX et fonctionne avec Transformers, vLLM, SGLang, llama.cpp et MLX. Aucun des deux n'est servi par un fournisseur d'inférence aujourd'hui — ce sont tous deux des checkpoints auto-hébergés.

A comparison scoreboard for LFM2.5-8B-A1B-DSpark and LFM2.5-2.6B-Base. The left column shows the draft as a 0.3B speculative-decoding draft, running with the LFM2.5-8B-A1B MoE (1.5B active), no standalone output, a 2.54x mean H100 speedup up to 3.18x, a 1.18x mean on M4 Max, and Safetensors + GGUF self-host formats. The right column shows the Base as a 2.69B raw pre-trained foundation, run with your own fine-tune, untuned text with no chat template, no published benchmarks, 128K context under 2.5GB, and Safetensors + GGUF + ONNX + MLX formats, with a footer reading 'Speed figures vendor-measured Aug 20 2026, unreproduced; Base has no benchmarks by design' and the OrcaRouter logo in the bottom-right corner.

Les seuls chiffres de cette confrontation provenaient d'un seul laboratoire.

{{1}}Toute mesure quantitative ici provient d'un seul fournisseur, prise le jour de la publication du brouillon et pas encore reproduite indépendamment — à lire comme prometteur, non vérifié.{{/1}} {{2}}Liquid a mesuré le LFM2.5-8B-A1B-DSpark avec une taille de lot de 1, une température de 0, sur un seul H100 de 80 Go en BF16 sous SGLang et sur un MacBook Pro M4 Max en FP16 GGUF sous les kernels Metal expérimentaux de llama.cpp.{{/2}} {{3}}Sur le H100, la paire a atteint en moyenne 2,54× (418 → 1 074 tokens par seconde), avec un meilleur résultat individuel de 3,18× sur MATH500 (428 → 1 362 tok/s) et une acceptation moyenne d'environ 7 tokens proposés sur 10.{{/3}} {{4}}Sur le M4 Max, la même paire n'a atteint en moyenne que 1,18× (90 → 106 tok/s) — le cas limite sur appareil que Liquid lui-même a signalé, car la vérification d'un bloc active davantage d'experts dans le backend Metal MoE actuel et déplace davantage de trafic de poids sur le bus mémoire.{{/4}}

Le côté Base de cette confrontation n'a aucun chiffre, et cette absence est elle-même la spécification. LFM2.5-2.6B-Base a été pré-entraîné, non post-entraîné ; il n'a jamais été évalué pour le chat, l'utilisation d'outils ou le comportement d'agent, car personne n'avait prévu de l'utiliser ainsi. Ses chiffres pertinents sont architecturaux : 2.69B paramètres, contexte 128K, tokenizer en 16 langues, moins de 2.5GB pour fonctionner. Vous ne benchmarkez pas un modèle de fondation ; vous benchmarkez ce en quoi vous le transformez par fine-tuning.

Il y a une ironie de famille qui mérite d'être nommée avant que vous décidiez quoi que ce soit. Le brouillon dont parle cet article — celui pour le 8B-A1B — est précisément celui qui gagne le moins sur un ordinateur portable (1,18×), tandis que le brouillon frère pour la famille 2.6B, qui accélère le frère post-entraîné de cette même Base, atteint en moyenne 2,27× sur un M4 Max avec une réduction de 57 % de la latence d'appel de fonctions multi-outils. Si l'appareil en question est un téléphone ou un ordinateur portable plutôt qu'une station GPU, c'est dans la voie 2.6B que se joue l'histoire de la vitesse.

A screenshot of the Hugging Face model page for LiquidAI/LFM2.5-8B-A1B-DSpark, showing the tags TextGeneration, Safetensors, sglang, qwen3_speculative-decoding, dspark and lfm2_lfm2_moe draft model, the lfm1.0 license, a 0.3B model size, the 'Inference Providers' section, and the card text 'LFM2.5-DSpark is a family of speculative-decoding draft models that adapt DSpark for the LFM2.5 architecture' (captured August 21, 2026).

Alors, lequel télécharges-tu ?

Vous n'avez jamais à choisir directement entre ces deux-là, parce qu'ils ne sont pas des alternatives — mais vous devez savoir quel est votre rôle :

Si vous servez LFM2.5-8B-A1B sur des GPU qui vous appartiennent et souhaitez plus de tokens par seconde à partir du même silicium, le LFM2.5-8B-A1B-DSpark est un module complémentaire réversible : construisez SGLang ou llama.cpp avec les intégrations DSpark du 20 août, nommez le draft dans la commande de lancement, conservez le décodage glouton, et la taille de bloc est lue automatiquement à partir de la configuration du draft. Le gain est d’environ 2,5× de débit avec zéro changement des sorties ; l’inconvénient est 0,3 Go de poids supplémentaires et une build assez récente pour contenir les PR. Supprimez les deux drapeaux spéculatifs et vous revenez à la cible simple.

{{1}}Si vous voulez construire votre propre spécialiste — un modèle de domaine, un assistant en langage personnalisé, un fine-tuning sur des données propriétaires — le LFM2.5-2.6B-Base est l'un des points de départ sérieux les moins chers de l'écosystème à poids ouverts : 2,6B, moins de 2,5 Go, un contexte de 128K, un tokenizer multilingue. Le checkpoint DSpark ne peut pas vous aider du tout, car ce n'est pas un modèle de base.{{/1}}

Si vous voulez vraiment l'agent sur appareil de Liquid — appel d'outils, tâches multi-étapes — alors vous ne voulez ni l'un ni l'autre de ces deux-là. Vous voulez le LFM2.5-2.6B post-entraîné, et vous pouvez décider ensuite d'y ajouter son propre draft. Le Base est une matière première pour ceux qui veulent entraîner ; le draft 8B-A1B est un composant d'accélération pour ceux qui déploient déjà le MoE. La mauvaise décision est de télécharger le Base parce que vous vouliez un agent plus rapide, ou le drafter parce que vous vouliez un socle pour entraîner.

A screenshot of the Hugging Face model page for LiquidAI/LFM2.5-2.6B-Base, showing the TextGeneration tag, Transformers and Safetensors formats, '16 languages', and the model card describing LFM2.5-2.6B-Base as the pre-trained text-only checkpoint used to create the post-trained agentic LFM2.5-2.6B, with a model table listing 'LFM2.5-2.6B-Base 2.6B Pre-trained base model for fine-tuning' (captured August 21, 2026).

Là où les deux se connectent — et où un routeur trouve sa place

Les deux checkpoints relèvent de scénarios auto-hébergés. Le modèle draft est un composant auxiliaire de la couche de service qui n'existe qu'au sein de votre propre pile SGLang ou llama.cpp ; le modèle Base, quant à lui, est un artefact d'entraînement. Aucun des deux n'apparaît dans un catalogue hébergé, et aucun n'a de prix de liste par jeton. En pratique, cela signifie que, quelle que soit la voie choisie, le modèle se retrouve aux côtés des modèles hébergés que vous appelez déjà — et ce mélange est exactement la plomberie qu'une couche de routage existe pour aplatir.

Côté service, l'économie du modèle draft est simple et réelle : 2,5× plus de tokens par seconde sur le même GPU, c'est 2,5× moins de temps et environ 2,5× moins de GPU pour la même charge, sans changement de qualité. Mais ce levier n'existe que si vous possédez l'inférence. Dès que vous appelez le 8B-A1B via une API, le fournisseur conserve l'accélération — c'est là que la comparaison côté API devient celle qui compte : ce qu'un fournisseur facture, et si une baisse de prix vous parvient le jour même de son annonce. C'est tout l'intérêt d'un routeur en transparence : une seule API pour plus de 200 modèles, les prix catalogue des fournisseurs répercutés avec une marge de 0 %, de sorte qu'une réduction du fournisseur soit immédiatement effective chez vous, et un basculement automatique pour qu'un pic de latence d'un seul fournisseur ne devienne pas votre latence. Vous pouvez également faire passer votre propre pile LFM auto-hébergée par le même endpoint, ce qui permet d'essayer un tout nouveau modèle draft sur du trafic réel sans engager une voie de production.

LFM2.5-8B-A1B-DSpark et LFM2.5-2.6B-Base partagent un nom de famille et des rôles opposés : l'un est une pièce de vitesse boulonnée sur le MoE en périphérie, l'autre est le cerveau non ajusté à partir duquel l'agent 2.6B se développe. Aucun des deux ne fonctionne seul. Choisissez le drafter pour accélérer un MoE que vous servez déjà sur GPU, choisissez le Base pour affiner une fondation 2.6B et en faire quelque chose qui vous appartient, et évitez les deux si ce que vous vouliez, c'était un agent fonctionnel — car la seule chose que ces deux checkpoints ont en commun, c'est qu'aucun des deux, pris isolément, ne fait quoi que ce soit d'utilisable.

FAQ

Peut-on exécuter LFM2.5-8B-A1B-DSpark tout seul ?

Non. C'est un modèle de brouillon sans sortie autonome — il propose des jetons candidats que la cible LFM2.5-8B-A1B vérifie ensuite, donc il n'existe que dans une pile de service de décodage spéculatif construite sur les intégrations SGLang ou llama.cpp du 20 août. Le télécharger seul ne vous donne rien que vous puissiez interroger.

Est-ce que LFM2.5-2.6B-Base est le checkpoint qui s'exécute sur l'appareil en tant qu'agent ?

Pas tel quel. La Base est le fondement pré-entraîné brut, sans ajustement par instructions et sans modèle de chat. Le modèle qui fonctionne comme agent sur appareil de Liquid est le LFM2.5-2.6B post-entraîné, qui est produit à partir de la Base par le pipeline de post-entraînement en quatre étapes — et, si vous le voulez plus rapide, associé au brouillon LFM2.5-2.6B-DSpark.

© 2026 OrcaRouter

Pour les fournisseurs

Vous exploitez une plateforme d'inférence ? Proposez vos modèles sur OrcaRouter.

providers@orcarouter.ai

Rejoignez notre communauté

Discordsupport@orcarouter.aiXGitHubYouTube