Une carte de titre générée intitulée « TwIL-LM3-Pro vs LFM2.5 2.6B Base », sous-titrée « L'un est terminé, l'autre est un point de départ », avec deux cartes arrondies affichant « TwIL-LM3-Pro - post-entraîné et fusionné » et « LFM2.5 2.6B Base - checkpoint pré-entraîné ». Le logo OrcaRouter est intégré dans le coin inférieur droit.
Guides & Insights

TwIL-LM3-Pro vs LFM2.5 2.6B Base : L’un est terminé, l’autre est un point de départ

Auteur

Magnus Corvin

Date de publication

Derniers modèles · 20Voir tous les modèles →
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Ce qu'il y a de plus révélateur dans la comparaison publiée entre TwIL-LM3-Pro et LFM2.5 2.6B Base, c'est que webAI n'en a publié aucune contre le 2.6B. Les tableaux Track A et Track B de webAI opposent son spécialiste de logique formelle de 3,66 B à toute une série de concurrents — sa propre base Granite, VibeThinker-3B, Qwen3-8B, Qwen3.5-4B, Llama-3.2-3B, gpt-oss-120b — et l'entrée Liquid AI qu'ils ont choisie est LFM2.5-8B-A1B, pas le 2.6B. Le 2.6B qui apparaît dans le tableau est `LFM2-2.6B`, la génération précédente, un modèle différent issu d'un pré-entraînement différent. Cette omission n'est pas un oubli. LFM2.5 2.6B Base est un point de contrôle pré-entraîné sans instruction tuning, et les benchmarks de suivi d'instructions ne sont pas un test qu'il était conçu pour passer.

Donc cette page compare un artefact fini à une matière première. Le cadrage à la Aion — un modèle a un score et l'autre non — convient, mais la raison est plus précise et plus intéressante : l'un est post-entraîné et fusionné, l'autre s'arrête délibérément avant le post-entraînement, et les deux documents qui les décrivent répondent volontairement à des questions différentes.

Deux comptages de paramètres qui ne correspondent pas à la même mesure

TwIL-LM3-Pro est un modèle dense de 3,66 milliards de paramètres, tous actifs sur chaque token. Il descend de `ibm-granite/granite-4.2-3b` via un affinage LoRA, une distillation multipath, une fusion de checkpoints, une fusion WiSE-FT de retour vers la base et une étape GRPO pondérée par l’entropie — et l’artefact livré par webAI est la politique fusionnée, et non un adaptateur LoRA, donc il s’exécute de manière autonome.

LFM2.5 2.6B Base compte 2,69 milliards de paramètres répartis sur 30 couches : 22 blocs de convolution courte à double porte entrelacés avec 8 couches d'attention à requêtes groupées. Cette conception hybride convolution/attention est l'architecture embarquée de Liquid, et c'est la raison pour laquelle les chiffres de débit de la famille sont ce qu'ils sont plutôt qu'une fonction du seul nombre de paramètres. Il a été entraîné sur 34 billions de tokens avec un vocabulaire de 128 000 tokens et possède une fenêtre de contexte de 131 072 tokens.

Les deux décomptes présentent un écart d’environ 36 % et sont obtenus par des architectures entièrement différentes, de sorte que ni « 3,66 B dépasse 2,69 B » ni l’inverse ne signifie quoi que ce soit en tant qu’affirmation de qualité. La fiche de modèle de webAI elle-même soulève ce point de manière détournée lorsqu’elle refuse de comparer la perplexité de corpus entre tokeniseurs — le vocabulaire de TwIL-LM3-Pro est de 100 352, celui de LFM2.5-2.6B est de 128 000, et la perplexité est calculée par token.

Ce que « Base » supprime, et pourquoi cela change le tableau des scores

Liquid AI publie LFM2.5 2.6B sous deux formes : le checkpoint post-entraîné, ajusté pour les charges de travail agentiques dans les principaux harnais d’agents, et la Base, décrite dans sa propre fiche comme « le checkpoint pré-entraîné texte uniquement, utilisé pour créer toutes les variantes de LFM2.5-2.6B ». La Base est l’entrée du fine-tuning, pas un produit. Elle ne dispose d’aucun ajustement par instructions, d’aucun gabarit de conversation digne de ce nom, ni d’aucune évaluation publiée — car évaluer un modèle de base sur des tâches de suivi d’instructions mesure la mauvaise chose.

La position de TwIL-LM3-Pro est l’inverse. Toute sa valeur réside dans la pile de post-entraînement : webAI indique que, sur son propre banc d’essai, le pipeline a fait passer le seuil macro en domaine de 0,4313 pour son modèle de base à 0,5539, la macro des 10 jeux de données tenus à l’écart restant stable (de 0,7942 à 0,7901) plutôt que de s’effondrer. La rétention sur les données tenues à l’écart est la partie difficile du post-entraînement spécialisé, et c’est la partie à laquelle le Base ne peut pas répondre.

C'est aussi là que la comparaison de taille dans les tableaux de webAI porte ses fruits. TwIL-LM3-Pro est annoncé devant LFM2.5-8B-A1B sur les deux macros en validation — 0,7901 contre 0,7884 sur l'ensemble des dix jeux de données, 0,7425 contre 0,7378 sur les quatorze — avec moins de la moitié du nombre de paramètres de ce modèle MoE. Il s'agit d'un véritable résultat à comparaison égale, et il est disponible précisément parce que LFM2.5-8B-A1B est un modèle post-entraîné qui peut être exécuté dans un harnais d'instructions. Le Base, lui, ne le peut pas, et c'est pourquoi le 2.6B n'a jamais eu de colonne.

Les dimensions qu'il vaut la peine d'aligner

• Paramètres — TwIL-LM3-Pro 3,66 B dense vs LFM2.5 2,6 B Base 2,69 B (30 couches : 22 conv + 8 GQA).

• Post-entraînement — LoRA SFT, distillation, fusion WiSE-FT et GRPO à l'étape 2580 vs aucun ; la Base est par conception la sortie du pré-entraînement.

• Fenêtre de contexte — 131 072 jetons pour les deux, héritée de leurs bases respectives.

• Vocabulaire — 100 352 tokens vs 128 000, c’est pourquoi leurs perplexités ne sont pas comparables.

• Langues — anglais uniquement contre dix-sept, dont l'arabe, le chinois, le japonais, le coréen, l'espagnol et le thaï.

• Format de réflexion — TwIL-LM3-Pro émet par défaut un bloc `<think>` et raisonne longuement (1 902 tokens en moyenne dans le domaine, 24,2 % des générations atteignant le plafond de longueur) par rapport à un checkpoint de base sans aucun format d’instruction.

• Licence — webAI Non-Commercial License ver. 1.0 vs LFM Open License v1.0 de Liquid.

• À quoi cela sert — un point de terminaison d'inférence en logique formelle plutôt qu'un point de départ pour l'affinage.

Les lignes de contexte méritent une note de bas de page que les deux modèles fournissent : chacun transporte 131 072 jetons depuis le pré-entraînement, et aucun des deux fournisseurs n’a validé le comportement en contexte long — la fiche de TwIL-LM3-Pro indique que chaque score publié a été mesuré dans une fenêtre de 8 192 jetons. Les chiffres concordants ici sont hérités, non démontrés.

Licence, et à quoi chacune sert légalement

La webAI Non-Commercial License de TwIL-LM3-Pro autorise la recherche et l’usage personnel et exige un accord distinct avec webAI pour tout déploiement générant des revenus. LFM2.5 2.6B Base est fournie sous la LFM Open License v1.0 propre à Liquid, que l’API Hugging Face signale comme `license: other` plutôt que comme un identifiant SPDX standard — lisez le fichier de licence avant de planifier quoi que ce soit à partir de celle-ci, car les conditions sont propres à Liquid plutôt qu’issues d’un modèle reconnu.

Aucune des deux licences n'est Apache 2.0, et c'est une erreur de considérer « open weights » comme un synonyme de « permissif sur le plan commercial ». La différence pratique entre les deux réside dans ce que les licences protègent : un chercheur non commercial peut utiliser les deux, une entreprise qui construit un produit doit vérifier les deux, et la raison d'être même de la Base — être affinée pour être intégrée au produit de quelqu'un d'autre — rend ses conditions exactes plus importantes qu'elles n'en ont l'air.

Où chacun a sa place dans une pile

The Base est le bon choix lorsque vous avez l’intention d’entraîner. Si votre problème est une tâche d’étiquetage étroite, une tête de classification spécifique à un domaine, ou un fine-tuning sur quelques milliers d’exemples étiquetés, partir d’un checkpoint pré-entraîné de 2.69B avec un vaste vocabulaire multilingue et une architecture convolutionnelle hybride conçue pour le débit est une décision d’ingénierie judicieuse, et le coût du post-training que vous sauteriez est le coût que vous payez délibérément à la place.

TwIL-LM3-Pro est le bon choix lorsque vous ne prévoyez pas d’entraîner et que la tâche relève déjà de la logique formelle. Les étiquettes d’implication, la formalisation d’énoncés Lean, les analyses sémantiques et la critique de preuves sont les tâches auxquelles l’ensemble de son pipeline était destiné, et démarrer depuis un checkpoint déjà passé par la fusion et l’étape de renforcement vous épargne la partie de tout cela qui est véritablement difficile à reproduire — maintenir le niveau de la suite hold-out tout en gagnant en performance dans le domaine.

L’erreur consiste à interpréter « spécialiste post-entraîné de 3.66B » comme strictement meilleur que « checkpoint de base de 2.69B ». Ils se trouvent à des étapes différentes de la même chaîne de production.

Les servir, ou servir en les contournant

Aucun des deux modèles n’est une route dans le catalogue OrcaRouter aujourd’hui, et la raison diffère pour chacun. TwIL-LM3-Pro est sous licence non commerciale et n’a pas d’endpoint hébergé ; LFM2.5 2.6B Base est un artefact de fine-tuning que personne ne servirait intentionnellement comme endpoint d’inférence. Là où un routeur justifie sa place, c’est un cran au-dessus, dans le travail qui entoure un spécialiste : générer et filtrer les données d’entraînement sur lesquelles vous effectueriez le fine-tuning du Base, enrichir les prompts que vous fourniriez à un modèle de logique formelle, et évaluer les sorties. Ce sont des appels textuels, et ils passent par un endpoint compatible OpenAI sur plus de 200 modèles au prix catalogue du fournisseur, avec 0 % de majoration ajoutée, de sorte qu’une baisse de prix d’un fournisseur arrive le jour même et qu’un changement d’un modèle de génération de données à un autre est une modification de configuration plutôt qu’une seconde relation fournisseur.

Le basculement automatique compte plus que d'ordinaire dans un pipeline de fine-tuning, car une tâche par lots qui plante à 80 % gâche toute l'exécution. Une seule clé pour les modèles de génération, avec un repli qui relance en cas d'erreur d'un fournisseur, représente une brique d'infrastructure plus légère que trois intégrations d'API.

A generated two-column scoreboard headed 'TwIL-LM3-Pro vs LFM2.5 2.6B Base - the scoreboard' with six shared dimension rows. TwIL-LM3-Pro: Parameters 3.66B dense; Post-training SFT, merge, GRPO; Context 131,072 tokens; Vocabulary 100,352; Languages English; Licence non-commercial. LFM2.5 2.6B Base: Parameters 2.69B (30 layers); Post-training none by design; Context 131,072 tokens; Vocabulary 128,000; Languages 17; Licence LFM Open License v1.0. A footer line reads 'Both vendor-reported; neither model has a third-party evaluation.' The OrcaRouter logo is composited in the bottom-right corner.

Lequel, déterminé par votre intention

Si vous entraînez, prenez le Base. Si vous faites de l’inférence sur de la logique formelle et que la licence autorise votre utilisation, prenez TwIL-LM3-Pro. Si vous avez besoin aujourd’hui d’un petit modèle capable de suivre des instructions et qu’aucune des deux restrictions ne s’applique, utilisez la variante sœur post-entraînée de LFM2.5 2.6B — le modèle que Liquid publie réellement à cette fin — et réservez le Base pour le fine-tuning que vous comptiez de toute façon faire.

A screenshot of the Hugging Face model card for LiquidAI/LFM2.5-2.6B-Base, showing the Liquid AI author line, the 16-languages tag, the LFM2 and liquid tags, and the card's opening description of LFM2.5 as a family of hybrid models designed for on-device deployment, built on the LFM2 architecture with extended pre-training and reinforcement learning.A screenshot of the Hugging Face model card for LiquidAI/LFM2.5-2.6B, the post-trained sibling, showing the 16-languages and LFM2 tags and the card's description of LFM2.5-2.6B as part of the LFM2.5 family with a 128K context window and agentic post-training.