Une carte de titre principale intitulée « De quelle moitié de d1 avez-vous besoin ? » avec le sous-titre « Liquid AI d1-omni-600M vs Liquid AI d1-3B - poids ouverts, 7 octobre 2026 », deux puces libellées « précision » et « modalités », et un diagramme en cascade dans lequel un petit encart libellé d1-omni-600M alimente un encart plus grand libellé d1-3B tandis qu'une seconde flèche bifurque vers une puce indiquant « suffisamment confiant - répondez ici ».
Guides & Insights

Liquid AI d1-omni-600M vs Liquid AI d1-3B : De quelle moitié de la famille d1 avez-vous réellement besoin ?

Auteur

Elias Hawthorne

Date de publication

Derniers modèles · 20Voir tous les modèles →
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Liquid AI d1-omni-600M et Liquid AI d1-3B ont été mis en ligne sur Hugging Face à huit heures d’intervalle le 5 octobre 2026 et publiés ensemble dans la même annonce du 7 octobre, ce qui rend la question habituelle — lequel est le plus récent, lequel est le meilleur — inappropriée. Ils constituent les deux extrémités d’un arbitrage délibéré. Liquid AI d1-3B est le produit fini : 3,12 milliards de paramètres, un score de 48,57 au Decision Index 0.2.1 évalué par le fournisseur, des tableaux de benchmarks, une latence mesurée jusque sur un Jetson Orin Nano, et une place décrite dans le billet d’annonce comme la meilleure qualité de décision à sa taille. Liquid AI d1-omni-600M est l’expérience : 587 millions de paramètres, un 15,95 au même index, une entrée audio dont le 3B ne dispose pas, et une fiche de modèle qui déclare sans détour qu’il s’agit d’une version de recherche préliminaire, sans chiffres d’inférence, car elle est encore en cours de développement actif. Choisir entre les deux n’est pas une question de qualité. C’est une décision qui dépend de si vous avez besoin des modalités supplémentaires en bas de la famille ou de la précision supplémentaire en haut, et les chiffres s’alignent derrière cette division plutôt que de la brouiller.

Tout ce qui suit provient des deux fiches de modèle et de l’article de publication du 7 octobre, l’étiquetage propre à l’article de publication étant respecté : les lignes d1 du Decision Index ont été notées par Liquid AI avec le système de notation officiel plutôt que soumises au classement public, et rien ici n’a été reproduit de manière indépendante.

Deux dorsales qui n'allaient jamais converger

La famille d1 n’a pas décliné une seule recette à plus petite échelle. Les deux checkpoints partent des extrémités opposées du catalogue de modèles de Liquid et se rejoignent au milieu.

Liquid AI d1-3Best bâti sur LFM2.5-VL-3B, le modèle vision-langage à décodeur seul du fournisseur, datant d'août 2026. Sa base a été obtenue en faisant la moyenne des pondérations de LFM2.5-2.6B avec le squelette textuel de LFM2.5-VL-3B, puis en affinant des points de contrôle selon différents germes aléatoires et mélanges de données avant de les fusionner de nouveau. Il embarque un encodeur visuel SigLIP2 NaFlex de 400 M optimisé pour la forme, un contexte de 32 768 jetons, un vocabulaire de 128 000 jetons et seize langues documentées.

Liquid AI d1-omni-600M vient de l'autre direction. Son tronc est LFM2.5-Encoder-350M, un encodeur bidirectionnel, d'abord affiné sur des tâches de décision, puis étendu par étapes — un encodeur FastConformer à 17 couches plus un adaptateur pour l'audio, l'encodeur audio étant ensuite affiné par rapport à un backbone texte gelé, puis une tour SigLIP2 extraite de LFM2.5-VL-450M avec un adaptateur et LoRA sur le backbone pour la vision. Le modèle final a été fusionné à partir des mises à jour LoRA et moyenné avec le checkpoint précédent. Il totalise 587 M de paramètres : un tronc partagé et une tête de décision de 381 M, un encodeur vision de 94 M et un encodeur audio de 112 M.

La différence entre décodeur seul et bidirectionnel est le point à retenir. Le 3B lit un état et produit une décision de la même manière qu’un modèle de langage produit une séquence de tokens, une direction à la fois. Le 600M lit tout l’état d’un coup et décide, ce à quoi on s’attendrait de la part d’un encodeur qui n’a jamais été conçu pour générer. Les deux sont entraînés à rapporter des réponses issues de la distribution du modèle avec zéro token de sortie, mais la mécanique sous-jacente n’appartient pas à la même classe de modèle, et l’écart de précision ci-dessous est le coût visible de la conception plus petite, en forme d’encodeur.

L'écart du Decision Index est important, et les sous-scores sont plus intéressants que le total.

Sur le Decision Index 0.2.1, Liquid rapporte 48,57 pour Liquid AI d1-3B et 15,95 pour Liquid AI d1-omni-600M, contre 50,02 pour Winnow-12B. Cela représente un écart de 32 points entre deux checkpoints publiés le même jour par le même laboratoire, et la lecture des cinq sous-scores explique d’où il vient.

• Connaissances — 23,8 pour Liquid AI d1-3B contre 8,3 pour Liquid AI d1-omni-600M

• Langue — 56,4 contre 12,9

• Récupération — 52,8 contre 35,0

• Outils — 74,5 contre 15,1

• Arts — 36,3 contre 6,8

La récupération est le seul domaine où le petit modèle tient bon, ne perdant que moins d'un tiers du score du 3B là où, dans les quatre autres catégories, il perd 60 à 80 %. Ce schéma est cohérent avec ce qu'est le 600M : un encodeur entraîné doté d'une réelle capacité de représentation pour faire correspondre un état à un contenu, et bien moins de la capacité en couches que le 3B hérite d'un décodeur qui a été pré-entraîné sur bien plus de langage. Si votre charge de travail est une décision de type récupération — ce passage répond-il à cette question, lequel de ces documents est pertinent —, le profil du 600M est moins mauvais que son total ne le suggère. Si votre charge de travail est une décision de routage d'outils, l'écart de 51 points dans cette colonne est le chiffre à regarder fixement.

Le tableau de référence des benchmarks textuels raconte une histoire plus nuancée que l'indice, ce qu'il est utile de savoir avant que l'un ou l'autre chiffre ne serve à étayer un argument. Sur sept benchmarks publics, le 3B arrive en tête avec une moyenne de 82,9 et le 600M atteint 78,4. Le 600M perd de peu sur SQuAD 2.0 (74,0 contre 85,3), PubMedQA (61,3 contre 66,0), BoolQ (77,7 contre 86,7) et XNLI (74,7 contre 85,0), mais il l'emporte sur la détection de toxicité de Civil Comments (95,8 contre 93,0) et sur l'identification de paraphrases de PAWS-X (79,5 contre 76,9). La présentation de Liquid elle-même est que le 600M dépasse la moyenne de 77,1 du Decider 2B avec quatre fois moins de paramètres. Deux suites de benchmarks, deux verdicts apparents différents, tous deux rapportés par le fournisseur — voilà ce que les preuves étayent, et rien de plus.

A two-column scoreboard for Liquid AI d1-omni-600M and Liquid AI d1-3B showing the 600M at Decision Index 0.2.1 of 15.95, 587M parameters, a text benchmark mean of 78.4, text plus image or audio input, a 16,384-token context and no reported latency, against the 3B at 48.57, 3.12B parameters, a mean of 82.9, text plus image input, a 32,768-token context and 8 ms for one question on an RTX 4090, footed 'All figures vendor-reported by Liquid AI, Oct 7 2026; no independent reproduction.'

Ce que le 600M a que le 3B n'a pas

La raison pour laquelle il faut tolérer un écart d’indice de 32 points est que Liquid AI d1-omni-600M fait une chose que Liquid AI d1-3B ne peut pas faire, et ce n’est pas une différence de fidélité.

• Audio — Liquid AI d1-omni-600M prend en charge jusqu’à 30 secondes de parole par requête via son encodeur FastConformer ; Liquid AI d1-3B n’en prend aucune

• Mélange de modalités — le 600M accepte du texte avec des images ou du texte avec de l'audio, et lève une ValueError si les deux arrivent ensemble ; le 3B prend du texte et des images

• Fenêtre de contexte — 16 384 tokens répartis entre les positions texte, image et audio pour le 600M, avec le texte réduit à 896 tokens lorsque des images sont présentes ; 32 768 tokens pour le 3B

• Vocabulaire — 65 536 pour le 600M, 128 000 pour le 3B

• Précision — la fiche 600M recommande float16 sur GPU et avertit que bfloat16 a modifié la meilleure réponse sur certaines lignes ; le 3B propose 15 quantifications, dont une version w8a8

• Langues — le 600M répertorie 16 langues dans un ensemble différent des 16 du 3B, et son audio est décrit comme entraîné sur des échanges entre un locuteur anglophone et un assistant, ce qui ne représente qu'une petite partie de ce que contient un flux audio de production.

La note sur l’entraînement audio est facile à ignorer, et elle ne devrait pas l’être. Un modèle entraîné sur des échanges en anglais entre locuteur et assistant n’a connu qu’une seule géométrie de locuteur, une seule structure de tours de parole et une seule distribution d’accents. Le déployer sur de l’audio de centre d’appels ou des enregistrements de terrain revient à exiger un comportement que la fiche ne revendique pas, et l’article de lancement reconnaît sans détour qu’aucun benchmark de décision audio n’existe pour le vérifier — Liquid qualifie cela de « problème ouvert à l’heure actuelle » et invite la communauté à en construire un.

A capture of Liquid AI's blog post 'Open d1: Edge decision models for text, vision, and audio' dated Oct 7, 2026, showing the announcement that d1-3B and d1-omni-600M were released that day, d1-3B's 48.57 Decision Index v0.2.1 score described as ahead of every model under 10B, and its latency figures of 8 ms on an RTX 4090, 16 ms on a Jetson AGX Thor and 26 ms on a Jetson AGX Orin.

Latence : l'un des frères et sœurs a les tables, l'autre a une note de bas de page.

Pour les modèles de décision, le chiffre intéressant est la latence de bout en bout, car il n’y a pas de décodage à chronométrer. Liquid publie un ensemble complet pour le 3B et aucun pour le 600M.

• Une question — 8 ms sur une RTX 4090, 9 ms sur une MI325X, 16 ms sur un Jetson AGX Thor, 26 ms sur un Jetson AGX Orin 64 Go, 50 ms sur un Orin Nano, 30 ms sur un Apple M5 Pro

• Trois questions sur un seul état — 21 ms sur la RTX 4090 et 20 ms sur l’AGX Thor, soit environ 1,3× le coût d’une seule question plutôt que 3×

• Un état de 3,4 K tokens — 102 ms sur la 4090, 220 ms sur le Thor, 1 640 ms sur l'Orin Nano

• Débit compacté — 475 décisions par seconde sur la RTX 4090, 1 106 par seconde sur le MI325X

• Une image de 384 px — 17 ms sur la 4090, 18 ms sur la MI325X

Ces chiffres ne concernent que Liquid AI d1-3B. Pour Liquid AI d1-omni-600M, la fiche de modèle indique que les chiffres d'inférence ne sont pas communiqués parce que le modèle est une version de recherche préliminaire en cours de développement actif. Ce n'est pas que le petit modèle soit plus lent — l'inverse est presque certain, puisqu'un cinquième des paramètres ne rend pas le modèle plus lent à précision égale — c'est qu'aucun chiffre n'existe, et reprendre les millisecondes du 3B pour le 600M serait une fabrication d'apparence plausible. Ce que l'on peut dire sans rien inventer, c'est qu'à la précision float16 recommandée par la fiche, 587 M de paramètres représentent de l'ordre de 1,2 Go de poids avant les activations, ce qui relève de l'arithmétique sur un nombre de paramètres publié plutôt que d'une mesure.

La cascade est la vraie réponse pour la plupart des charges de travail

Comme les deux checkpoints ont été publiés ensemble et renvoient le même type d’objet — une probabilité, un libellé accompagné d’un score de confiance, ou un score ordonné —, ils se composent d’une manière que deux modèles arbitraires ne permettent pas. Le 600M peut filtrer et le 3B peut trancher. Scorez les éléments entrants avec Liquid AI d1-omni-600M, et faites remonter ceux qu’il place près du milieu de son échelle vers Liquid AI d1-3B pour une décision plus fine. Les règles d’escalade sont la confiance et la distribution que le 600M renvoie déjà, donc la logique de routage n’a pas besoin d’un modèle supplémentaire. Sur une charge de travail avec une forte majorité d’éléments faciles, la majeure partie du trafic n’atteint jamais le 3B et la majeure partie de l’argent n’est jamais dépensée.

Ce schéma est aussi la raison pour laquelle il vaut la peine de faire tourner les deux modèles derrière un routeur. Via OrcaRouter, les deux se trouveraient derrière une seule clé API, facturés au prix catalogue de chaque fournisseur, répercuté avec 0 % de marge, de sorte que la cascade est une règle de routage plutôt qu'une seconde intégration, et qu'une escalade qui échoue au niveau du fournisseur est réessayée sur un repli au lieu de faire échouer la requête. Le basculement automatique compte davantage ici que pour un modèle établi, car l'une des deux moitiés de cette paire est un checkpoint dont le comportement est décrit par l'éditeur lui-même comme en cours de développement actif.

Rien de tout cela ne constitue une affirmation de disponibilité, et la distinction mérite d’être faite clairement : les checkpoints d1 ouverts ne figurent pas dans notre catalogue. La voie du fournisseur consiste à télécharger les poids et à les exécuter localement — la prise en charge de llama.cpp est arrivée dès le premier jour sur les matériels Apple, AMD, Qualcomm et NVIDIA — ou à y accéder via l’API propre au fournisseur et des plateformes tierces.

Choisir, en une seule passe

Si vous avez besoin de texte et d’images, et que la réponse doit être juste, prenez Liquid AI d1-3B. Il dispose des benchmarks, des tableaux de latence, du contexte plus large, du vocabulaire plus étendu et des quantifications, et c’est le membre de la paire que Liquid positionne comme le leader de la qualité à sa taille.

Si vous avez besoin de parole dans le chemin de décision, prenez Liquid AI d1-omni-600M, car c’est la seule option à poids ouverts de cette famille qui accepte l’audio, et acceptez que vous l’adoptez sur des impressions et une démo jusqu’à ce que quelqu’un publie un benchmark de décision audio ou le split vision non divulgué.

Si vous ne savez pas encore lequel de ces éléments décrit votre charge de travail, commencez par le 3B et instrumentez la confiance qu'il renvoie. Les sous-scores sont révélateurs : une tâche qui réside dans les colonnes Tools ou Language sera mal servie par le 600M, tandis qu'un élément de type récupération est le seul endroit où le petit checkpoint est plus proche que son total ne le laisse penser. La famille existe pour vous permettre d'échanger de l'exactitude contre un encombrement réduit, et cet échange n'est sûr que si vous savez quelle colonne votre tâche occupe.

A capture of the Hugging Face model card for LiquidAI/d1-omni-600M showing 76 likes, the image-text-to-text, Transformers and Safetensors tags, the 'd1_omni', 'system-one', 'multimodal', 'vision', 'audio' and 'decision-model' tags, and the opening description of a 600M parameter decision model that takes a state of text or JSON with images or a voice clip and returns typed answers with zero output tokens.

Avec OrcaRouter, les deux modèles se trouvent derrière une seule clé API au moyen d'une règle de routage plutôt que d'une seconde intégration, et une escalade qui échoue au niveau du fournisseur est réessayée sur une solution de repli au lieu de faire échouer la requête.