Une carte de titre principale intitulée « Liquid AI d1-3B vs Granite 4.2 3B », avec le sous-titre « l'un décide, l'autre écrit », montrant à gauche une carte étiquetée d1-3B avec une icône de liste de contrôle, la légende « 3.12B - 32 768 tokens » et des pastilles indiquant probabilité, étiquette et score, et à droite une carte étiquetée Granite 4.2 3B avec une icône de bulle de dialogue, la légende « 3B - 128K tokens » et une pastille indiquant « une réponse écrite ».
Guides & Insights

Liquid AI d1-3B vs Granite 4.2 3B : deux modèles 3B qui ne font jamais le même travail

Auteur

Gideon Frost

Date de publication

Derniers modèles · 20Voir tous les modèles →
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Mettez Liquid AI d1-3B et Granite 4.2 3B sur le même GPU unique et ils tiendront tous les deux confortablement — 3,12B de paramètres d'un côté, 3B de l'autre. Ils se comporteront aussi comme s'ils venaient de disciplines différentes. Granite 4.2 3B, que la fiche modèle d'IBM elle-même date du 25 août 2026, est un modèle de raisonnement : trois modes de réflexion, un <think> bloc, et une réponse que vous lisez. Liquid AI d1-3B, mis en ligne sur Hugging Face le 5 octobre 2026 et annoncé par Liquid deux jours plus tard, est un modèle de décision : il prend un état plus un ensemble explicite de questions typées et renvoie une probabilité, une étiquette ou une position sur une échelle en une seule passe avant, rapportant output_tokens: 0 parce qu'il n'écrit jamais rien. La question utile n'est pas de savoir lequel est meilleur. C'est de savoir lequel de vos appels est réellement une décision, car les deux dépôts sont conçus pour les moitiés opposées de cette division.

Qu'y a-t-il réellement dans chaque dépôt ?

Tout ce qui suit provient des deux fiches de modèle et de l'article d'annonce de Liquid. Rien ici n'a été reproduit de manière indépendante, aucun tiers n'a évalué l'un ou l'autre modèle sur le même banc d'essai, et les chiffres figurant dans les fiches sont ceux des fournisseurs eux-mêmes.

• Taille — Liquid AI d1-3B, 3,12B au total, construit sur le LFM2.5-VL-3B de Liquid ; Granite 4.2 3B, un transformer dense à décodeur uniquement de 3B construit sur granite-4.1-3b-base

• Sortie — d1-3B renvoie des probabilités, des étiquettes et des niveaux de confiance et n'écrit aucun texte du tout ; Granite 4.2 3B génère des jetons, y compris une chaîne de raisonnement facultative à l'intérieur <think> balises

• Contexte — d1-3B 32 768 tokens ; Granite 4.2 3B 128K nativement, avec une extension de contexte long jusqu'à 512K sur la carte

• Entrée — texte, JSON, images ou un mélange, via un encodeur visuel SigLIP2 NaFlex 400M ; Granite 4.2 3B texte uniquement

• Licence — d1-3B sous la LFM Open License v1.0 de Liquid ; Granite 4.2 3B sous Apache 2.0

• Langues — d1-3B en répertorie 16 ; Granite 4.2 3B en répertorie douze testées, la fiche précisant que d'autres n'ont pas été testées

• Inférence — d1-3B fournit du code personnalisé (trust_remote_code=True, transformers>=5.14), avec des dépôts GGUF et w8a8 dans la même famille et des fiches documentées pour llama.cpp, Ollama et LM Studio ; Granite 4.2 3B s'exécute sous vLLM 0.20+ ou SGLang 0.5.18+ avec un analyseur de pensée personnalisé

Deux de ces lignes en font plus que les autres. La ligne de sortie est tout l’argument de cet article, et la ligne de licence est celle que personne ne met dans le tableau comparatif.

A two-column scoreboard for Liquid AI d1-3B and Granite 4.2 3B. The d1-3B column reads: job answers a typed question; parameters 3.12B; output tokens billed 0; context 32,768 tokens; image input yes; one question 8 ms on an RTX 4090. The Granite 4.2 3B column reads: job writes a reasoned answer; parameters 3B; output tokens billed every token it writes; context 128K, to 512K extended; image input no; one question a full thinking pass. The footer reads 'Both columns vendor-reported, neither independently scored.'

L'un écrit une chaîne de pensée, l'autre refuse d'écrire

Granite 4.2 3B justifie son utilité en réfléchissant à voix haute. Sa fiche documente trois modes : la réflexion activée par défaut, la non-réflexion, et un mode à faible effort qui conserve la trace de raisonnement mais la raccourcit. Les piles de service séparent la trace de la réponse finale afin que votre application reçoive un contenu propre plus un champ de raisonnement distinct. C’est une bonne conception pour une question qui doit être travaillée — un problème de mathématiques, une branche de la logique, un morceau de code qui doit être écrit avant de pouvoir être jugé.

d1-3B n'a pas un tel mode, et sa fiche le dit sans détour : « Ce n'est pas un modèle de conversation et il n'écrit pas de texte. » Un appel déclare des questions avec un type. noul est un oui/non renvoyant P(oui) entre 0 et 1. choix choisit une étiquette dans un ensemble d'options nommées et renvoie l'étiquette, un niveau de confiance et une probabilité par option. score place l'état sur une échelle ordonnée de deux à dix et renvoie le niveau attendu avec sa distribution et sa légende. Le signal est lu à partir des logits à une position de remplacement en une seule passe, et non échantillonné jeton par jeton, c'est pourquoi le bloc d'utilisation peut signaler zéro jeton de sortie sans mentir.

Cette différence modifie votre facture avant de modifier votre précision. Un appel de classification Granite qui réfléchit pendant 400 tokens est un appel pour lequel vous payez 400 tokens de sortie, et l’étiquette que vous vouliez est enfouie dans de la prose qu’un analyseur doit ensuite récupérer. Un appel d1-3B ne facture que l’entrée. Si l’essentiel de votre trafic est une étiquette assortie d’une règle, vous avez payé pour le raisonnement, qu’il ait changé l’étiquette ou non.

Là où Granite 4.2 3B est manifestement le meilleur choix

Prenez les benchmarks de raisonnement pour argent comptant — ils sont ceux d’IBM, exécutés via un pipeline interne NeMo Evaluator, et aucun tiers externe ne les a reproduits — et le 3B est étonnamment performant pour sa taille : AIME25 78,33, HMMT février 2025 66,67, GPQA 54,80, LiveCodeBench v6 69,71, MMLU-Pro 67,84, IFBench 74,33, BFCL v4 52,41, tau3-bench 45,78, et RULER 64K 67,52 chutant à 55,30 à 128K.

Quatre tâches découlent de cette liste, et d1-3B ne figure dans aucune d'entre elles.

• Un contexte natif de 128 K, extensible à 512 K, face à 32 768 tokens sur d1-3B — si votre état est un document long, le choix est fait pour vous

• Appel d’outils agentique avec un parseur documenté et des intégrations de harnais pour OpenCode, Pi et OpenHands, ce dont un modèle de décision n’a pas l’équivalent

• Toute tâche dont la réponse est un paragraphe : résumé, rédaction, extraction dans une structure libre, génération de code

• Fine-tuning et redistribution sans plafond de revenus, car Apache 2.0 n’a pas de clause de seuil

Remarquez ce qui ne figure pas sur la fiche Granite : les lignes SWE-Bench et Terminal-Bench sont marquées NA pour le 3B. L'étape d'apprentissage par renforcement agentique d'IBM n'a été appliquée qu'aux membres 8B et 30B de la famille ; le plus petit modèle ne porte donc pas les scores agentiques de ses grands frères. Une équipe qui lit « Granite 4.2 » et suppose que le 3B hérite du profil agentique de la famille sera surprise.

A capture of Liquid AI's own blog post 'Open d1: Edge decision models for text, vision, and audio' dated Oct 7, 2026, showing the opening paragraph that releases d1-3B and d1-omni-600M as open-weight models, d1-3B's Decision Index score of 48.57 and the claim that it is ahead of every model under 10B, and its latency of 8 ms on an NVIDIA GeForce RTX 4090, 16 ms on a Jetson AGX Thor and 26 ms on a Jetson AGX Orin.

Là où d1-3B gagne avant que Granite ait fini de réfléchir

Le tableau de latence de Liquid lui-même, mesuré à chaud, une requête à la fois, constitue le point le plus fort de son argumentation : une seule question en 8 ms sur une RTX 4090 et 9 ms sur une AMD MI325X, 16 ms sur une Jetson AGX Thor et 26 ms sur une Jetson AGX Orin 64GB, avec 64 états traités en une seule passe à 475/s sur la 4090 et 1 106/s sur la MI325X. Pour donner un ordre de grandeur, c'est à peu près le temps dont Granite 4.2 3B a besoin pour émettre quelques tokens de sa trace de raisonnement.

Trois types de questions sur un même état coûtent 21 ms à d1-3B sur la 4090 plutôt que trois appels séparés, car l’état et ses images ne sont lus qu’une fois pour toutes les questions. Dans une pile de modération ou de routage qui déclenchait auparavant une requête HTTP par règle, c’est la différence entre une file d’appels et un seul appel.

Il voit aussi. d1-3B obtient une moyenne de 74,1 sur onze benchmarks publics d’images, contre 73,9 pour son modèle de base, et la fiche indique que, les images retirées, les mêmes questions obtiennent 45,1 — les réponses proviennent de l’image, pas du prompt textuel. Les résultats ligne par ligne jouent dans les deux sens (CV-Bench 82,1 contre 87,6 pour le modèle de base, POPE 88,5 contre 90,1), donc l’affirmation concernant la vision est « au niveau du modèle de base », et non « meilleure que lui ».

Le contrepoids honnête : le 48,57 de d1-3B sur Decision Index 0.2.1 a été produit par Liquid exécutant elle-même l'outil de notation officiel plutôt que par une soumission à un classement, et les lignes concurrentes proviennent du classement public. Sa moyenne de 77,1 sur huit tâches de type benchmark-as-decision et son 71,8 sur DecisionBench sont également de première main. Tout ce qui se trouve du côté d1 de cette comparaison n'est pas vérifié.

A capture of the Hugging Face model card for ibm-granite/granite-4.2-3b, showing the Apache 2.0 licence, the 3B parameter count, the decoder-only dense architecture built on Granite-4.1-3B-Base, the 128K native context with long-context extension to 512K, bfloat16 precision, the tested-language list and the built-in chain-of-thought reasoning mode.

Pourquoi un raisonneur 3B n'est pas un modèle de décision 3B

La tentation est de considérer Granite 4.2 3B comme un substitut moins cher à d1-3B, ou l’inverse. Les deux échouent, et cet échec est structurel plutôt qu’une question de qualité.

Demandez à Granite de décider, et vous obtenez une génération que vous devez analyser, une facture qui dépend de la difficulté que le modèle a eue à répondre à la question, et une latence qui dépend du mode de réflexion que vous avez sélectionné. Demandez à d1-3B de raisonner, et vous n'obtenez rien du tout — il n'a pas de flux de tokens dans lequel raisonner. Les deux modèles se trouvent de part et d'autre d'une ligne que la plupart des pipelines franchissent plusieurs fois par requête : quelque chose doit décider, et quelque chose doit parler. d1-3B a sa place en amont, là où une règle de triage choisit une route et renvoie une confiance calibrée. Granite 4.2 3B a sa place derrière, sur la branche où une réponse doit être écrite.

Il existe un second piège, plus discret. La valeur d'un modèle de décision réside dans sa calibration — une confiance de 0,9 qui se vérifie neuf fois sur dix. La fiche de Granite 4.2 3B ne publie aucune métrique de calibration ni aucune probabilité ; elle publie des scores de précision et de raisonnement. Comparer les deux dans un classement de benchmarks ne vous dit rien sur celui des deux auquel vous devriez faire confiance pour un seuil.

La ligne de licence que personne ne met dans le tableau

Granite 4.2 3B est distribué sous Apache 2.0. d1-3B est distribué sous la LFM Open License v1.0, qui semble permissive jusqu'à la section 5 : l'utilisation commerciale est accordée à condition que vous ou votre entité juridique restiez sous un seuil défini dans le même document comme un chiffre d'affaires annuel de dix millions de dollars américains ou plus, et toute utilisation commerciale au-dessus de ce seuil n'est tout simplement pas sous licence. Les organismes à but non lucratif et les utilisateurs de la recherche sont exemptés.

Pour un amateur ou une startup, ce n'est pas un problème. Pour une entreprise qui franchit cette limite en milieu d'année — ou qui risque d'être rachetée par une telle entreprise —, les deux dépôts ne sont pas des artefacts équivalents, peu importe à quel point leurs nombres de paramètres se ressemblent, et l'audit de licence intervient bien après que quelqu'un a déjà livré le prototype. C'est l'élément le moins coûteux à vérifier tôt sur cette page.

Exécuter la paire comme un seul pipeline

Aucun des deux modèles ne figure dans notre catalogue aujourd'hui, il ne s'agit donc pas d'une affirmation de disponibilité : les deux sont des artefacts auto-hébergés, et Granite 4.2 3B en particulier n'a aucun fournisseur d'inférence listé sur sa fiche. Mais le schéma auquel une équipe aboutit réellement, c'est un appel qui décide et un autre qui parle, et c'est précisément là qu'une couche de routage justifie sa place. OrcaRouter place plus de 200 modèles derrière une seule clé API, avec les tarifs catalogue des fournisseurs répercutés avec 0 % de marge, de sorte qu'une baisse de prix d'un fournisseur se répercute sur votre facture le jour même plutôt qu'à la prochaine renégociation de contrat, et le basculement automatique entre fournisseurs signifie que le composant partagé au milieu d'un pipeline ne devient pas un point de défaillance unique pendant que vous l'évaluez encore. Si vous souhaitez comparer d1-3B en A/B à un généraliste hébergé sur votre propre trafic avant de vous engager dans un déploiement auto-hébergé, le voisin routé le plus proche de la lignée de Granite est Gemma 4 31B, à 0,13 $ par million de jetons d'entrée et 0,38 $ par million de jetons de sortie — un modèle bien plus grand, mais le même rôle de « généraliste qui écrit » dans le pipeline.

Le verdict, énoncé comme une règle

Si ce dont vous avez besoin est un jugement — spam ou non, quelle file d'attente, quel degré d'urgence, cette image correspond-elle à cette description — d1-3B est le seul des deux à faire le travail en une seule passe, et il le fait en quelques millisecondes. Si ce dont vous avez besoin est une réponse écrite, la lecture d'un long document, un appel d'outil ou un morceau de code, Granite 4.2 3B est celui qui a un flux de tokens, tout court, et les scores de raisonnement du 3B sont vraiment impressionnants pour sa taille — d'après les propres évaluations d'IBM, que personne n'a encore vérifiées.

Ce qui changerait la donne, ce n'est pas une nouvelle ligne dans un benchmark. C'est qu'un tiers évalue les deux modèles sur le même harnais de calibration, car la propriété qui détermine si l'on peut appliquer un seuil à un modèle est précisément celle que ni l'une ni l'autre fiche ne permet de comparer aujourd'hui.