
Liquid AI d1-3B et d1-omni-600M : des poids ouverts pour des modèles qui n’écrivent jamais un mot
- openaiNOUVEAUOpenAI: GPT-6.1 Sol2026-09-2952Intelligence
- anthropicNOUVEAUAnthropic: Claude Sonnet 5.52026-09-2856Intelligence
- typesafeNOUVEAUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 par million de tokens · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligence
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligence
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligence
- xAIGrok 4.72026-09-2146Intelligence
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 par million de tokens · 62 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 par million de tokens · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens · 358 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
Liquid AI d1-3B et Liquid AI d1-omni-600M ont été mis en ligne sur Hugging Face le 7 octobre 2026, et les deux checkpoints ont une propriété qui fait que chaque tableau comparatif que vous avez lu cette année a une forme erronée. Aucun des deux ne génère de texte. Vous transmettez à Liquid AI d1-3B un état — un ticket d'assistance, une charge utile JSON, une photographie, ou les trois à la fois — et un ensemble de questions nommées, et il renvoie des réponses prélevées directement dans la distribution du modèle sur vos options. Oui/non sous forme de probabilité. Un choix parmi des étiquettes, avec un niveau de confiance et un vecteur de probabilité complet. Une position sur une échelle ordonnée. Il n'y a pas d'étape d'échantillonnage, pas de JSON à analyser, pas de génération qui s'emballe, et le compteur d'utilisation du fournisseur lui-même rapporte la chose simplement : output_tokens: 0. Le modèle 3B est la vedette — il affiche 48,57 sur le Decision Index 0.2.1 évalué par le fournisseur, devant tous les modèles de moins de 10B et devant un modèle de décision douze fois plus grand. Le frère 600M est celui qu'il faut surveiller : il lit des images et jusqu'à trente secondes de parole via les mêmes poids de tronc, et il est étiqueté comme une version de recherche préliminaire.
Qu’est-ce qu’un modèle de décision, en un paragraphe
La catégorie se constitue depuis un an sous des noms comme « modèles system-one » et « classifieurs qui ne sont pas des classifieurs », et la paire d1 en est l'énoncé le plus net à ce jour. On pose une question à un modèle génératif et il rédige une réponse ; cette réponse doit être analysée, l'analyse peut échouer, et chaque token qu'il écrit vous coûte de l'argent et du temps. On pose une question à un modèle décisionnel et il rapporte ce qu'il croit déjà. Les questions de Liquid se déclinent en trois types. noul est une question oui/non, à laquelle on répond par P(oui) entre 0 et 1. choice sélectionne un libellé dans un ensemble nommé et renvoie le libellé, un indice de confiance et la probabilité de chaque option. score place l'état sur une échelle ordonnée de deux à dix niveaux et renvoie le niveau attendu avec sa distribution et sa légende. Un même état peut porter plusieurs questions à la fois, et l'état ainsi que ses images ne sont lus qu'une seule fois pour toutes ces questions.
Cette dernière propriété constitue tout l’argument commercial. Trois questions sur un même ticket coûtent 1,3 fois le temps d’une seule question, et non 3 fois, parce que le modèle effectue une seule passe avant sur l’entrée et en extrait plusieurs réponses. Il n’y a rien à écrire, donc rien à écrire mal.
Le 3B et le 600M sont construits à partir de directions opposées.
C'est ici que la sortie devient techniquement intéressante, et c'est la partie que la couverture du lancement a surtout passée sous silence. Les deux modèles ne partagent pas la même lignée.
Liquid AI d1-3B descend de LFM2.5-VL-3B, le modèle vision-langage à décodeur seul du fournisseur. Il compte 3,12 milliards de paramètres, un encodeur visuel SigLIP2 NaFlex de 400 M optimisé pour la forme, une fenêtre de contexte de 32 768 jetons, un vocabulaire de 128 000 jetons et seize langues documentées. Pour le construire, Liquid a fait la moyenne des poids de LFM2.5-2.6B et du squelette textuel de LFM2.5-VL-3B, a affiné des points de contrôle issus de plusieurs graines aléatoires et mélanges de données, puis a de nouveau fusionné les résultats. Le résumé du fournisseur sur ce qui a compté est d'une sobriété rafraîchissante : l'entraînement sur de longues entrées, la permutation de l'ordre des options de réponse et la traque des raccourcis dans les données d'entraînement ont davantage contribué au score final que n'importe quelle technique avancée.
Liquid AI d1-omni-600M Il descend de LFM2.5-Encoder-350M, un encodeur bidirectionnel — une espèce de réseau entièrement différente. Il totalise 587 M de paramètres répartis entre un tronc partagé et une tête de décision totalisant 381 M, un encodeur visuel de 94 M emprunté à LFM2.5-VL-450M, et un encodeur audio de 112 M construit à partir d’un FastConformer à 17 couches. Chaque modalité passe par les mêmes poids de tronc. Son contexte est de 16 384 jetons, couvrant conjointement les positions de texte, d’image et d’audio, et lorsque des images sont jointes, le texte d’état et de question est réduit à 896 jetons, car c’est sur cela qu’il a été entraîné. L’audio comporte un avertissement que la fiche énonce sans détour : la capacité a été entraînée sur des requêtes entre un locuteur anglophone et un assistant, et les clips sont coupés à trente secondes.
Donc la famille n’est pas un seul modèle en deux tailles. C’est un décodeur et un encodeur, post-entraînés pour faire le même travail avec deux mécanismes complètement différents, dont l’un voit et l’autre entend.

Les chiffres, et à qui ils appartiennent
Chaque chiffre de cette section est propre à Liquid. Les lignes du Decision Index pour les modèles d1 ont été notées par le fournisseur à l'aide de l'évaluateur officiel — sans être soumises au classement — tandis que chaque ligne concurrente provient du classement public en v0.2.1. Aucun laboratoire indépendant ne l'a encore reproduit, et les modèles ont deux jours au moment où ces lignes sont écrites.
• Decision Index 0.2.1 — Liquid AI d1-3B obtient 48,57, avec des sous-scores de Connaissances 23,8, Langage 56,4, Récupération 52,8, Outils 74,5 et Arts 36,3. Liquid AI d1-omni-600M obtient 15,95, avec Outils à 15,1.
• Où se situe 48,57 — premier parmi tout ce qui est sous les 10B dans le tableau publié par le fournisseur, et devant Decider 35B-A3B à 47,11. Il est deuxième au classement général, derrière Winnow-12B à 50,02, qui est quatre fois plus grand.
• Benchmarks textuels, rapportés par le fournisseur — d1-3B obtient une moyenne de 82,9 sur sept benchmarks publics, devant les 81,1 de Decider 4B ; d1-omni-600M obtient une moyenne de 78,4, ce qui dépasse les 77,1 de Decider 2B avec environ un quart du nombre de paramètres. Le 600M affiche le meilleur score de toxicité du tableau (Civil Comments 95,8) et son meilleur score de paraphrase (PAWS-X 79,5).
• Vision, rapporté par le fournisseur — d1-3B obtient une moyenne de 74,1 sur onze benchmarks d'images publics, interprétés comme des décisions sur les options de chaque benchmark, contre 73,9 pour son backbone LFM2.5-VL-3B. La suppression des images fait chuter les mêmes questions à 45,1, ce qui montre, selon le fournisseur, que les réponses proviennent des pixels.
• Latence, mesurée par le constructeur — une question prend 8 ms sur une RTX 4090 et 9 ms sur une AMD MI325X ; 16 ms sur un Jetson AGX Thor, 26 ms sur un Jetson AGX Orin 64 Go, 50 ms sur le plus petit Jetson Orin Nano, et 30 ms sur un Apple M5 Pro. Soixante-quatre états regroupés en une seule passe s’exécutent à 475 par seconde sur la 4090.
• Ce qui manque — d1-omni-600M n'a pas du tout de table d'inférence. Liquid indique qu'il est en cours de développement actif et ne rapporte tout simplement pas de latence pour lui. Il n'y a également aucun benchmark de décision audio nulle part dans la version, car, selon les termes du fournisseur, les benchmarks dédiés à la décision audio sont actuellement un problème ouvert.
L'affirmation que formule réellement le communiqué
Deux jours avant la mise en ligne des poids, Liquid a publié la version hébergée de ce modèle et l'a comparée à GPT-6.1 Sol et Claude Opus 5.5 sur six applications. Son résumé : d1 égale ou dépasse GPT-6.1 Sol sur quatre des six, coûte de 19 à 200 fois moins cher, et répond plus rapidement à chaque tâche. La méthodologie publiée mérite d'être lue avant de répéter tout cela — chaque application a été exécutée une fois par modèle le 5 octobre 2026, les modèles de chat ont répondu en JSON avec leur paramètre de raisonnement par défaut, et le coût de d1 a été calculé à 0,04 $ par million de tokens d'entrée.
Les démos sont la moitié la plus convaincante. Trier les bonnes et les mauvaises pièces issues de quatre lignes de production — cartes de circuits imprimés, bougies, noix de cajou, chewing-gum — avec une précision de 85 à 97 %, sur un modèle qui n'a jamais été entraîné pour cette tâche et qui l'a comprise à partir d'une brève description. Un prédicat SQL qui répond oui ou non pour chacun des 150 tickets d'assistance. Une boucle de compaction du contexte qui lit la sortie de chaque outil dans la session d'un agent de codage et la conserve, la tronque ou la supprime, éliminant 52 % des tokens tout en gardant chaque sortie dont la tâche a besoin. Dans Tetris, ajouter l'écran à un jeu entièrement descriptible par du texte a fait passer le score de 70 lignes effacées à 81 — un résultat de vision que l'on ne peut obtenir d'un classifieur uniquement textuel, aussi bon soit-il.
Ce sont des démonstrations réalisées par les fournisseurs, avec des tâches choisies par les fournisseurs, et la section consacrée à la méthodologie le dit. Elles restent l'image la plus claire que quiconque ait publiée de ce à quoi sert un modèle de décision.

Où il s'exécute, et ce qu'il en coûte de l'appeler
Les poids ouverts sont conçus pour une exécution locale et le fournisseur a réalisé le travail d'intégration en amont : prise en charge dès le premier jour de llama.cpp, l'ensemble de la pile NVIDIA, de DGX jusqu'à Jetson, la quantification NVFP4, et une variante 8 bits poids/activations publiée aux côtés du checkpoint de base. Les conversions GGUF sont déjà disponibles sur Hugging Face. Si vous préférez ne rien héberger vous-même, Liquid sert la version hébergée d1 depuis sa propre API — jetons d'entrée uniquement, pas de jetons de sortie, les images étant facturées comme entrée à 1,5 jeton par patch de 32×32 pixels, ce qui fait qu'une image de 1024×1024 représente 1 536 jetons. L'accès texte uniquement est également disponible via des plateformes tierces.
La note de routage en toute honnêteté : ni Liquid AI d1-3B ni Liquid AI d1-omni-600M ne figurent dans notre catalogue, et cet article ne constitue en aucun cas une affirmation de disponibilité pour l'un ou l'autre. Ce que le duo d1 change pour un routeur, c'est la forme du pipeline qui l'entoure. Un modèle de décision qui répond en quelques millisecondes et ne coûte rien en tokens de sortie est un filtre, pas un remplacement — le tri entre bons et défectueux et la qualification des tickets se font en amont de l'appel génératif, et c'est l'appel génératif qui fait vraiment valoir un point d'accès unique couvrant plus de 200 modèles, des prix catalogue répercutés à 0 % de marge, et un basculement automatique en cas de défaillance. Une autre couche, le même pipeline.
Qu’est-ce qui réglerait la dispute ?
Trois choses restent en suspens, et toutes trois sont de celles que seul le temps peut clore.
Le premier est la reproduction indépendante. Les chiffres du Decision Index ont été produits par le fournisseur avec le système de notation officiel, et chaque ligne de concurrent a été extraite d’un classement public, ce qui est une méthode défendable et n’est pas la même chose qu’un tiers exécutant votre modèle. Le deuxième est l’audio. Un checkpoint de 600 M qui achemine une commande vocale en une seule passe avant est une capacité véritablement nouvelle, et il n’existe aucun benchmark qui mesure s’il s’en sort bien. Le troisième est la catégorie elle-même : lorsque la réponse est extraite d’une distribution plutôt que rédigée, les modes de défaillance habituels d’un petit modèle — boucler, dériver, refuser, halluciner un format — ne peuvent tout simplement pas se produire, et personne n’a publié de bonne analyse de ce qui les remplace. L’erreur de calibration est le candidat évident, et c’est exactement ce que le champ de confiance sur chaque réponse vous invite à mesurer vous-même.
Dix démos font tourner Liquid AI d1-3B en boucle sur un flux de caméra en direct dans un espace public Hugging Face, ce qui est la façon la moins coûteuse de se faire sa propre opinion. Les poids sont gratuits et les questions sont précises. C'est une meilleure position de départ que celle qu'offrent la plupart des publications de cette année.

Comparés dans cet article1
Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement
