Une carte de titre principale intitulée « Liquid AI d1-3B vs Intern-Decision-4B » avec le sous-titre « de quel décideur calibré avez-vous besoin ? », affichant une carte de gauche étiquetée d1-3B portant les pastilles « 32 768 tokens » et « 8 ms sur une RTX 4090 », une carte de droite étiquetée Intern-Decision-4B portant les pastilles « plafond de 8 192 tokens » et « 44 ms sur une RTX 4090 », et un large bandeau sous les deux indiquant « les deux renvoient des probabilités, pas du texte ».
Guides & Insights

Liquid AI d1-3B vs Intern-Decision-4B : De quel décideur calibré avez-vous réellement besoin ?

Auteur

Alistair Wren

Date de publication

Derniers modèles · 20Voir tous les modèles →
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Deux modèles à poids ouverts répondent désormais aux questions en n’écrivant rien, et tant que vous ne mettez pas leurs schémas d’entrée/sortie côte à côte, ils ressemblent à la même idée répétée deux fois. Liquid AI d1-3B, mis en ligne sur Hugging Face le 5 octobre 2026 et annoncé par Liquid deux jours plus tard, est un modèle de décision multimodal de 3,12 B dont la fiche indique sans détour qu’il « n’est pas un modèle de chat et n’écrit pas de texte ». Intern-Decision-4B d’InternLM, mis en ligne discrètement dans l’organisation InternLM le 26 septembre 2026, sans billet de blog, sans tweet ni page de lancement à l’appui, est un modèle de décision de 4 B affiné à partir de Qwen3.5-4B qui renvoie lui aussi une distribution de réponses pour chaque question en une seule passe avant. Même contrat en apparence. Les différences sous-jacentes — une licence qui va vous compliquer la vie, un contrat qui peut écrire du texte par accident, et des machines que personne n’a comparées — sont ce qui détermine lequel a sa place dans votre stack.

À quel point les deux sont réellement proches

La première chose à bien comprendre, c’est quelle part de cette comparaison relève de l’égalité. Les deux modèles prennent un état et un schéma de questions nommées, les deux lisent le signal à partir des logits à une position de placeholder plutôt que d’échantillonner, les deux sont multimodaux, et les deux rapportent qu’ils n’ont rien écrit. Sur la forme de l’appel, ils sont presque identiques, et les différences intéressantes se trouvent dans les détails en périphérie.

• Taille — Liquid AI d1-3B, 3,12B au total, construit sur le LFM2.5-VL-3B de Liquid ; Intern-Decision-4B 4B (environ 4,54B d'après le décompte de tenseurs indiqué sur la fiche), affiné à partir de Qwen3.5-4B

• Types de questions — d1-3B et Intern-Decision-4B utilisent les trois mêmes : noul pour oui/non, choice pour l'un d'un ensemble nommé, score pour un point sur une échelle ordonnée

• Champs de réponse — d1-3B renvoie la réponse ainsi que la confiance et les probabilités ; le schéma InternLM renvoie des distributions ainsi qu’une valeur de confiance dont la fiche du modèle avertit qu’elle n’est pas une probabilité calibrée

• Plafond d'entrée — d1-3B 32 768 tokens de contexte ; Intern-Decision-4B un plafond de 8 192 tokens qui refuse d'emblée les requêtes plus longues plutôt que de les tronquer, les images étant comptées dans cette limite

• Licence — d1-3B sous la LFM Open License v1.0 de Liquid, Apache 2.0 côté InternLM

• Langues — d1-3B en répertorie 16 ; la fiche d’Intern-Decision-4B n’en indique aucune

• Interface — d1-3B est livré comme un modèle que vous chargez et appelez avec trust_remote_code=True ; Intern-Decision-4B est livré comme une bibliothèque Python que vous installez avec pip install, avec un seul backend implémenté et le champ model propre à la requête, explicitement incapable de basculer entre les checkpoints

• Score propre des fournisseurs — d1-3B 48,57 sur la partition publique de Decision Index 0.2.1 ; Intern-Decision-4B 90,02 en moyenne sur son propre tableau à sept ensembles, avec un score de Brier de 0,347 et une erreur de calibration attendue de 0,065

Ces deux derniers chiffres ne sont pas comparables, et les traiter comme un tableau de scores serait l’erreur la plus facile à commettre sur cette page. Ils proviennent de harnais différents, d’ensembles de questions différents et de systèmes de notation différents.

A two-column scoreboard for Liquid AI d1-3B and Intern-Decision-4B. The d1-3B column reads: Decision Index 48.57; parameters 3.12B; context 32,768 tokens; licence LFM Open License v1.0; calibration metric not published; one question 8 ms on an RTX 4090. The Intern-Decision-4B column reads: Decision Index not scored on it; parameters about 4.54B; context 8,192-token cap; licence Apache 2.0; calibration metric Brier 0.347, ECE 0.065; one question 44 ms on an RTX 4090. The footer reads 'Both columns vendor-reported from different harnesses; not comparable, not independently scored.'

La calibration, c’est tout le produit, et un seul d’entre eux l’assume par écrit.

Un modèle de décision ne vaut son temps de latence que si le nombre qu’il renvoie à côté de la réponse a du sens. C’est ce qu’est la calibration : une confiance déclarée de 0,9 devrait être juste environ neuf fois sur dix, et un modèle qui est confiant et se trompe est pire qu’un modèle qui dit qu’il ne sait pas.

InternLM est celui qui aborde ce point. Sa fiche documente une température ajustée de 1,99241824, dérivée par minimisation de la log-vraisemblance négative sur 1 728 cas de calibration désignés, avec 1 693 retenus pour validation, et imprimée à huit décimales afin qu'elle puisse être reproduite. Elle publie également une étude pilote avant-après sur 96 cas qui montre le mécanisme à l'œuvre plutôt que de l'affirmer : Brier 0,628 et ECE 0,213 avant calibration contre 0,550 et 0,089 après. Brier et ECE sont les deux mesures standard pour déterminer si les probabilités déclarées sont honnêtes, et l'ampleur de la tendance est importante.

Liquid ne publie aucun équivalent. La propre fiche de d1-3B comporte des benchmarks de type exactitude — SQuAD 2.0 85,3, Civil Comments 93,0, intention MASSIVE 87,3, PubMedQA 66,0, BoolQ 86,7, XNLI 85,0, PAWS-X 76,9, une moyenne de 77,1 — aux côtés de son 48,57 sur le Decision Index, et l’argument de vente annoncé du modèle réside dans des réponses typées calibrées. Mais il n’y a aucune ligne ECE, aucune ligne Brier, et aucune température ajustée publiée.

Cette asymétrie ne signifie pas que le descendant de Qwen3.5-4B est mieux calibré qu'un 3B construit sur LFM2.5-VL-3B ; elle signifie qu'entre ces deux fiches, l'une vous donne l'arithmétique pour reproduire l'affirmation et l'autre vous donne l'affirmation. Si votre pipeline applique un seuil à une confiance — router au-dessus de 0,8, escalader en dessous de 0,4 — vous pouvez valider le côté InternLM ce soir et vous ne pouvez que vérifier ponctuellement le côté Liquid.

La mise en garde vaut dans les deux sens. Les deux ensembles de chiffres sont internes. Aucun des deux modèles n’a été évalué par un tiers indépendant, et les affirmations de calibration d’InternLM reposent sur l’étude pilote de 96 cas d’InternLM lui-même, comparée à l’ajustement propre d’InternLM.

La licence qui vous demande un numéro

Intern-Decision-4B est sous licence Apache 2.0, héritée de Qwen3.5-4B, avec les mentions amont conservées — utilisation commerciale, redistribution, ajustement fin, il n’y est nulle part question de revenus.

d1-3B est régi par la LFM Open License v1.0 de Liquid, et l'article 5 est la partie que personne ne lit avant que le service des achats ne s'en mêle. L'utilisation commerciale n'est accordée qu'à la condition que vous ou votre entité juridique restiez en dessous d'un Seuil, défini dans ce même document comme un chiffre d'affaires annuel de dix millions de dollars américains ou plus ; une utilisation au-dessus de ce seuil n'est tout simplement pas couverte par la licence. Les organismes à but non lucratif et les utilisateurs de la recherche bénéficient d'une exception.

Pour un particulier ou une petite équipe, les deux sont gratuits. Pour toute structure dotée d’un service financier, les deux dépôts sont des produits différents, et la différence est un nombre au-dessus duquel on se situe ou non.

C’est dans le bas du tableau de benchmark de d1-3B que réside sa véritable revendication.

Le chiffre phare de la carte de Liquid est de 48,57 sur Decision Index 0.2.1, devant les autres lignes de moins de 10B d'un tableau qui va de Winnow-12B à 50,02 jusqu'à Decider 2B à 28,97. Ce qui rend ce chiffre digne d'être cité, c'est l'indice de discrimination qui se trouve juste en dessous. Dans les sous-scores propres au Decision Index, d1-3B obtient 74,5 en Outils et 36,3 en Arts, tout en ne réalisant que 23,8 en Connaissances — face à Decider 35B-A3B, un modèle de mélange d'experts de 36B, 12 fois sa taille, qui obtient 56,5 en Outils, 32,6 en Arts et 31,8 en Connaissances.

A capture of Liquid AI's own blog post 'Open d1: Edge decision models for text, vision, and audio' dated Oct 7, 2026, showing the paragraph that releases d1-3B and d1-omni-600M as open-weight models, the Decision Index v0.2.1 score of 48.57 with the claim that it is ahead of every model under 10B and on par with Decider 35B-A3B, and the 8 ms RTX 4090 latency line.

Autrement dit, le 3B n'est pas un petit modèle uniformément un peu moins bon. C'est un petit modèle inhabituellement fort pour les décisions structurées de type outil et inhabituellement faible pour les questions qui exigent des connaissances du monde, et il bat le 36B sur les deux catégories qui ressemblent le plus à la tâche pour laquelle il a été conçu. Si vos décisions sont « laquelle de ces cinq actions nommées » et « est-ce fondé sur le passage récupéré », l'écart de taille compte moins que vous ne l'attendriez. Si vos décisions reposent sur des faits que le modèle doit déjà détenir, attendez-vous à voir le 23.8 apparaître.

Il existe une deuxième version de cet argument du côté de la vision. d1-3B obtient une moyenne de 74,1 sur onze benchmarks publics d’images, contre 73,9 pour son propre modèle de base, et sans les images, les mêmes questions obtiennent 45,1 — donc, pour les questions portant sur des images, les réponses proviennent réellement de l’image. Il est au même niveau que son modèle de base plutôt que meilleur que lui, et les lignes par benchmark jouent dans les deux sens : CV-Bench 82,1 contre 87,6, POPE 88,5 contre 90,1, BLINK 59,2 contre 58,7.

À noter également la pause dans la fiche InternLM : son score agrégé élevé provient de tâches pilotées par des questions telles que Typed Decision 80,55 et ToolACE 96,45, tandis que Jevbench-Hard se situe à 73,87. Là où le schéma devient difficile, le score chute.

Vitesse : l'écart n'est pas là où vous l'attendez

Le d1-3B annonce 8 ms pour une question unique sur une RTX 4090 et 9 ms sur une MI325X, 21 ms pour trois questions partageant un même état, 16 ms sur un Jetson AGX Thor, et un débit groupé de 475 décisions par seconde sur la 4090 et de 1 106 sur la MI325X.

La fiche d'Intern-Decision-4B mesure 44,16 ms en moyenne de bout en bout sur la même RTX 4090, avec une médiane de 44,03 ms et 44,60 ms au P95.

Cela ressemble à un gain de 5x, et ce n'en est pas un, car les deux mesurent des choses différentes. Les chiffres de Liquid correspondent à des appels de modèle à chaud, une requête à la fois, avec la sélection et la compilation des noyaux payées en amont — la fiche indique explicitement qu'une seule question coûte 16 ms sur la 4090 sans compilation de graphe CUDA, et que le premier appel avec une nouvelle forme paie la compilation. Les 44 ms d'InternLM correspondent à un traitement de bout en bout par requête via une bibliothèque Python dont le seul backend implémenté est l'inférence locale Hugging Face, donc il embarque toute la machinerie environnante. Aucun des deux chiffres n'est faux. Placez les deux dans un même harnais, sur une même machine, avec la même forme de requête, et l'écart se réduit à quelque chose que vous voudriez mesurer plutôt que supposer.

Ce qui ne fait pas débat, c'est le plafond. 8,192 tokens, c'est un refus net du côté d'InternLM, et les tokens d'image puisent dans le même budget : un long document accompagné d'une capture d'écran est donc une requête qui revient rejetée plutôt que tronquée. d1-3B vous donne 32,768 tokens pour travailler. Si vos états sont des tickets et de courts échanges, cet écart ne vous rattrape jamais. S'ils font la taille d'une page, il tranche la question avant même le moindre benchmark.

Exécutez-les en tant que panneau, pas en tant qu’échange.

Répondre à une question précise par oui ou non et répondre à « lequel de six éléments nommés est-ce, et à quel point en êtes-vous sûr » sont des demandes différentes, et les deux fiches sont suffisamment différentes dans leur forme — l'une avec un plafond d'entrée strict et un ajustement de calibration publié, l'autre avec 32K de contexte et une meilleure queue de notation — pour que le déploiement utile, pour une équipe qui évalue les deux, ne soit souvent pas un remplacement mais un panel : le même état soumis aux deux modèles, les désaccords étant acheminés vers un humain ou vers un modèle plus grand.

Aucun des deux modèles ne figure à notre catalogue, et il ne s'agit pas d'une affirmation de disponibilité ; les deux sont des artefacts auto-hébergés. Mais un panel est précisément la configuration où c'est un routeur qui fait le travail, plutôt que la paperasse.les prix catalogue des fournisseurs répercutés avec 0 % de marge — ainsi, quand un fournisseur que vous routez derrière nous baisse ses prix, votre facture évolue le jour même — et le basculement automatique entre fournisseurs empêche un panel de deux modèles de devenir deux points de défaillance uniques. Les modèles que vous routez aujourd'hui ne sont pas ces deux-là ; ce sont les généralistes hébergés que vous chercheriez à remplacer, comme Qwen3.5-27B à 0,086 $ par million de jetons d'entrée et 0,688 $ par million de jetons de sortie, le chiffre qu'un 3B auto-hébergé doit battre une fois que vous avez compté le GPU.

Que faire cette semaine

Si vos décisions sont des états courts, que la licence doit passer la revue de votre entreprise, et que vous voulez la plus large gamme de cibles de compilation — llama.cpp, Ollama, LM Studio, un chemin de traitement par lots compacté qui fait passer 64 états en une seule passe — d1-3B est le plus productisé des deux et sa discrimination entre outils et arts est ce que l'une ou l'autre fiche démontre de plus fort. Si vos décisions portent sur des états longs, ou que vous avez besoin d'une licence sans clause de revenus, ou que vous voulez un ajustement de calibration que vous pouvez reproduire et un harnais où le coût environnant est déjà pris en compte, Intern-Decision-4B est celui dont vous pouvez réellement vérifier les documents.

A capture of the Hugging Face model card for internlm/Intern-Decision-4B, showing the Apache 2.0 licence, the 5B safetensors file size, the description of a multimodal structured decision model fine-tuned from Qwen3.5-4B that returns an answer distribution for every question in one forward pass, the download count of 2,756 for the last month, and the tags qwen3_5, decision-making and multimodal.

La partie inconfortable est la même pour les deux : aucun tiers indépendant n’a fait tourner l’un ou l’autre des modèles, et il n’existe aucune comparaison de calibration qui n’ait été commanditée par le fournisseur qui a rédigé la fiche. Pour une classe de modèles dont toute la valeur tient à la signification d’un nombre à côté d’une réponse, c’est là l’écart qu’il vaut la peine de combler avant de fixer un seuil sur quoi que ce soit.