
Liquid AI d1-3B vs LFM2.5-2.6B-Base : le modèle de décision et son propre ancêtre
- openaiNOUVEAUOpenAI: GPT-6.1 Sol2026-09-2952Intelligence
- anthropicNOUVEAUAnthropic: Claude Sonnet 5.52026-09-2856Intelligence
- typesafeNOUVEAUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 par million de tokens · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligence
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligence
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligence
- xAIGrok 4.72026-09-2146Intelligence
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 par million de tokens · 62 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 par million de tokens · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens · 358 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
Ceci n’est pas un affrontement entre deux rivaux. Liquid AI d1-3B, le modèle décisionnel à poids ouverts que Liquid AI a publié le 7 octobre 2026, a été construit sur une base que le fournisseur a constituée en faisant la moyenne des poids de LFM2.5-2.6B avec le backbone textuel de LFM2.5-VL-3B. LFM2.5-2.6B-Base est ce premier parent — le checkpoint brut pré-entraîné que Liquid a mis en ligne le 1er août 2026, 2,69 milliards de paramètres, 34 billions de jetons d’entraînement, une fenêtre de contexte de 131 072 jetons, sans ajustement par instructions ni gabarit de conversation. Donc, la façon honnête de formuler cette comparaison est descendant contre ancêtre : un modèle qui a été post-entraîné pour un travail très spécifique, placé à côté du substrat non façonné à partir duquel il a été façonné. L’un d’eux répond à des questions ce soir. L’autre est le point de départ si la question à laquelle vous avez besoin de répondre est une question que personne n’a encore posée.
Ce que chacun est réellement
Les deux fiches de modèle se lisent comme des documents issus de différentes étapes d’une chaîne de production, et les différences ne sont pas stylistiques.
Liquid AI d1-3B embarque 3,12 milliards de paramètres, un encodeur visuel SigLIP2 NaFlex de 400 M, une fenêtre de contexte de 32 768 jetons, un vocabulaire de 128 000 jetons et seize langues documentées. C’est un modèle de décision : vous lui fournissez un état et des questions nommées, et il renvoie une probabilité oui/non, une étiquette choisie avec un niveau de confiance et une distribution complète des options, ou un score ordonné — en une seule passe avant, sans génération de jetons de sortie. Il est livré avec un appel system_one pour un état avec plusieurs questions, une variante par lots qui regroupe de nombreuses requêtes sans remplissage, et un accesseur brut probabilities pour les distributions sous-jacentes. Ce n’est pas un modèle de conversation et il n’écrit pas de texte, et la fiche le dit en ces termes.
LFM2.5-2.6B-Basecompte 2,69 milliards de paramètres répartis sur 30 couches — 22 blocs de convolution courte à double porte et 8 blocs d’attention à requêtes groupées — entraîné sur 34 000 milliards de tokens et étendu à un contexte de 131 072 tokens lors de l’entraînement intermédiaire, avec le même vocabulaire de 128 000 tokens et les mêmes seize langues. Il s’agit d’un checkpoint pré-entraîné, texte uniquement, sans ajustement aux instructions, sans benchmarks sur sa fiche, et avec une recommandation qui sonne comme un avertissement : ne l’utilisez que pour des tâches nécessitant un ajustement fin intensif. Il complète du texte. Il ne suit pas les instructions.
Les deux sont des téléchargements sans restriction sous la propre licence ouverte de Liquid. Les deux privilégient le texte avant tout. Ni l'un ni l'autre ne figure dans notre catalogue, et rien ici ne constitue une déclaration de disponibilité pour l'un ou l'autre.

La lignée, c’est la partie intéressante.
Liquid n'a pas affiné un nouveau modèle pour produire la version d1. Il a fait la moyenne de deux checkpoints — LFM2.5-2.6B et la tour de texte de LFM2.5-VL-3B — pour obtenir un meilleur point de départ, puis a affiné plusieurs exécutions avec différentes graines aléatoires et différents mélanges de données, et les a fusionnées à nouveau. Le compte rendu du fournisseur sur ce qui a amélioré le résultat est, de façon frappante, dépourvu de technique exotique : l'entraînement sur des entrées longues, la randomisation de l'ordre d'apparition des options de réponse et la suppression des raccourcis dans les données d'entraînement ont fait plus que toute méthode avancée qu'ils ont essayée.
Ce détail de la suppression des raccourcis mérite qu'on s'y arrête, car il nomme la défaillance que cette catégorie existe pour éviter. Un modèle entraîné à répondre à des questions à choix multiples apprendra volontiers que l'option B est généralement la bonne, ou que l'option la plus longue l'emporte. C'est le brassage de l'ordre des options pendant l'entraînement qui l'en empêche. Un modèle de décision qui a appris un a priori de position au lieu de lire l'état est pire qu'inutile — il se trompe avec assurance à grande échelle — et c'est précisément ce qui distingue un véritable modèle de décision d'un classifieur avec un prompt.
Il y a aussi une régression qu'il vaut la peine de nommer sans détour, car le fournisseur ne le fait pas : le checkpoint de base dispose d'une fenêtre de contexte de 131 072 jetons et Liquid AI d1-3B a 32 768. Le post-entraînement en modèle de décision a coûté trois quarts du contexte utilisable. Si vous imaginiez que le descendant domine strictement son ancêtre sur tous les axes, ce n'est pas le cas, et les décisions sur documents longs sont l'axe sur lequel le checkpoint plus ancien a plus de marge — en principe, même s'il n'a pas de tête de décision pour l'exploiter.
Le tableau des scores, avec l'asymétrie attachée
Comparer ces deux modèles sur des benchmarks relève d'une erreur de catégorie, mais c'est une erreur de catégorie dont la forme est instructive, alors la voici, avec les mises en garde qui s'imposent. Chaque chiffre de d1-3B provient de Liquid lui-même, noté par le fournisseur avec le scorer officiel plutôt que soumis à un classement public, et non reproduit par un tiers. Tous les chiffres de LFM2.5-2.6B-Base sont absents, car un modèle de base n'a rien à mesurer.
Decision Index 0.2.1 — Liquid d1-3 48,57, premier parmi tout ce qui est sous 10B dans le tableau du fournisseur et devant un modèle de décision douze fois plus grand. L2.5-2.6-B-Base — non évalué, non évaluable sans tête de décision.
• Benchmarks textuels — Liquid AI d1-3B obtient une moyenne de 82,9 sur sept benchmarks publics couvrant la compréhension, la toxicité, l’intention, les questions-réponses médicales et la compréhension interlangue. LFM2.5-2.6B-Base ne publie absolument aucun tableau de benchmarks.
• Vision — Liquid AI d1-3B obtient en moyenne 74,1 sur onze benchmarks d'images interprétés comme des décisions ; retirer les images fait chuter les mêmes questions à 45,1. LFM2.5-2.6B-Base est purement textuel, sans tour de vision.
• Paramètres — 3,12 B contre 2,69 B. Le modèle de décision est le plus grand des deux, ce qui est l’inverse du récit habituel post-entraînement.
• Contexte — 32 768 jetons contre 131 072. L’ancêtre remporte cette ligne et c’est la seule ligne qu’il remporte.
• Latence — Liquid AI d-3B répond à une seule question en 8 ms sur une RTX 4090 et en 50 ms sur un Jetson Orin, et traite 64 états packés à 475 par seconde sur la 4090. LFM2.5-2.6B-Base n’a aucune latence à annoncer tant que vous ne l’avez pas affiné pour qu’il réponde à une question, et à ce moment-là, le chiffre est celui de votre fine-tune.

Entre quoi vous choisissez, en pratique
La règle de décision est ici inhabituellement nette, car les deux points de contrôle ne se disputent pas la même ligne budgétaire.
Prenez Liquid AI d1-3B lorsque la question existe déjà et correspond à l’une des trois formes que traite un modèle de décision : un oui ou un non, un choix dans un ensemble nommé, ou une notation sur une échelle ordonnée. Les applications publiées sont toutes des tâches de production reconnaissables — triage et routage, modération, classification d’intention et de sujet, contrôles d’extraction, reclassement, garde-fous d’agents et inspection visuelle. La démo chiffrée réalisée par le fournisseur le 5 octobre compare d1 à GPT-6.1 Sol et Claude Opus 5.5 sur six tâches de ce type et affirme qu’il égale ou dépasse GPT-6.1 Sol sur quatre, tout en coûtant 19 à 200 fois moins cher ; la page de méthodologie indique clairement que chaque application n’a été exécutée qu’une fois par modèle, alors considérez la forme de l’affirmation comme le constat, et non les décimales. La démonstration vraiment frappante est celle de l’inspection : un tri entre bons et défectueux sur quatre lignes de production, avec une précision de 85 à 97 % sur une tâche pour laquelle le modèle n’a jamais été entraîné et qu’il a comprise à partir d’une brève description.
Choisissez LFM2.5-2.6B-Base lorsque la question n’existe pas encore. C’est le point de départ le plus économique pour un fine-tuning dont vous comptez être propriétaire — une tête de décision de domaine, un classifieur sur mesure, une tâche pour laquelle personne n’a de checkpoint. Vous héritez de l’architecture, du tokenizer et du contexte long, et vous payez en calcul, en données et en évaluation. Deux des quatre applications que le fournisseur a construites autour de d1 sont parties de projets open source plutôt que de zéro, ce qui donne une juste idée de ce que produit réellement un checkpoint de base accompagné de discipline.
Le piège pratique consiste à traiter le checkpoint de base comme un remplacement direct. Ce n’est pas un assistant, il ne suivra pas un prompt, et si on l’évalue comme modèle de chat, il obtient un score proche de zéro — ce qui n’est pas un fait sur sa qualité, c’est un fait sur ce que signifie « base ».
Auto-héberger l'un ou l'autre, et la couche au-dessus
Les deux sont fournis sous forme de poids, et le fournisseur a effectué le travail de déploiement pour le côté d1 : prise en charge de llama.cpp dès le premier jour, pile NVIDIA complète de DGX jusqu'à Jetson, quantification NVFP4, variante 8 bits poids et activations, et conversions GGUF sur Hugging Face. Le checkpoint de base dispose de ses propres variantes GGUF, ONNX et MLX via la famille LFM2.5 au sens large. Si vous préférez ne rien héberger, Liquid sert l'offre hébergée d1 depuis sa propre API, facturée uniquement sur les tokens d'entrée, avec les images facturées à 1,5 token par patch de 32×32 pixels ; l'accès texte uniquement est également disponible via des plateformes tierces.
Ce qu'aucune des deux voies ne change, c'est le reste de la pile. Un modèle que vous hébergez est un modèle que vous devez maintenir en vie, versionner et basculer en cas de défaillance — et les décisions qu'il alimente atterrissent toujours à côté des appels génératifs que vous n'hébergez pas. Ce mélange est la couche qu'un routeur fait disparaître : un seul point de terminaison sur plus de 200 modèles, les prix catalogue des fournisseurs répercutés avec 0 % de marge afin qu'un changement de tarif d'un fournisseur soit effectif de votre côté le jour même, et un basculement automatique pour qu'une mauvaise après-midi chez un amont ne devienne pas votre panne. Héberger soi-même un modèle de décision 3B à côté rend la question du routage plus aiguë plutôt que plus simple, car vous possédez désormais la moitié du pipeline et louez l'autre moitié.
Lequel, pour qui
Si la question à laquelle vous devez répondre cette semaine est l’une des trois formes que prend un modèle de décision, et qu’il s’agit d’une question que quelqu’un d’autre a déjà imaginée, le descendant est terminé et gratuit et tourne en 50 ms sur un appareil sans GPU — prenez Liquid AI d1-3B et c’est réglé.
Si vous construisez l’outil qui répond à une question que personne n’a encore posée, et que vous disposez des données et de la puissance de calcul pour maîtriser cela, LFM2.5-2.6B-Base est le point de départ honnête, et il vaut la peine de savoir que le descendant présenté dans cet article en a été créé exactement par la voie que vous êtes sur le point d’emprunter.
Et si vous n'êtes pas sûr de savoir dans laquelle de ces deux situations vous vous trouvez, la réponse est presque toujours la première. Le post-entraînement en une tête de décision est l'option coûteuse ; exécuter celle de quelqu'un d'autre est gratuit.

Comparés dans cet article1
Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement
