
Liquid AI d1-3B vs Qwen 3 8B : une charge de travail de classification 8B devrait-elle migrer vers un modèle de décision ?
- openaiNOUVEAUOpenAI: GPT-6.1 Sol2026-09-2952Intelligence
- anthropicNOUVEAUAnthropic: Claude Sonnet 5.52026-09-2856Intelligence
- typesafeNOUVEAUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 par million de tokens · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligence
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligence
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligence
- xAIGrok 4.72026-09-2146Intelligence
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 par million de tokens · 60 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 par million de tokens · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens · 356 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
Quelque part dans la plupart des stacks de production, un Qwen 3 8B est payé pour répondre oui ou non. Il modère un commentaire, étiquette un ticket de support, décide si un passage récupéré est pertinent, ou note la sortie d'un autre modèle selon une grille d'évaluation — et il fait cela en générant du texte qu'un élément en aval analyse ensuite. Liquid AI d1-3B, le modèle de décision 3,12B que Liquid AI a publié en open-weight le 7 octobre 2026, existe pour faire exactement ce travail sans rien générer : un état en entrée, un ensemble de questions nommées en entrée, et des probabilités, des étiquettes et des confiances en sortie en une seule passe avant avec zéro token de sortie. Qwen 3 8B est le cheval de trait open-weight d'avril 2025 du fournisseur — environ 8,2B de paramètres denses, 119 langues, réflexion activée ou désactivée par requête, et seize mois de déploiement communautaire derrière lui. La question que pose réellement ce duo est étroite et pratique : pour la part de votre trafic qui est de la classification, un généraliste 8B est-il le moyen le moins cher d'obtenir une étiquette en 2026, ou la forme de ce travail a-t-elle changé sous ses pieds ?
Ce que vous payez réellement un 8B pour faire
Si l’on met les deux contrats de sortie côte à côte, l’inefficacité apparaît comme structurelle plutôt qu’incrémentale.
Un appel de classification à Qwen 3 8B est une génération. Vous écrivez un prompt qui décrit les libellés, le modèle raisonne éventuellement sur l’entrée — et sur ce modèle, vous pouvez activer ou désactiver ce raisonnement à chaque requête, ce qui est le réglage le plus utile dont il dispose pour ce type de travail — puis il renvoie une réponse. Cette réponse est du texte. Si vous avez demandé du JSON, vous obtiendrez généralement du JSON, et parfois vous obtiendrez du JSON à l’intérieur d’une phrase, ou d’un préambule, ou d’une explication finale dont vous ne vouliez pas. Le libellé qui vous intéresse se trouve quelque part dans le flux de tokens, et un parseur le récupère. Vous êtes facturé pour chaque token que le modèle écrit, y compris ceux que vous jetez.
Liquid AI d1-3B n'a pas de flux de tokens. Les questions sont déclarées avec un type : noul pour oui/non, répondu par P(oui) entre 0 et 1 ; choice pour une étiquette parmi un ensemble d'options nommé, répondu par l'étiquette plus une confiance plus une probabilité par option ; score pour une position sur une échelle ordonnée de deux à dix, répondu par le niveau attendu avec sa distribution et sa légende. La réponse porte un total cumulé qui indique output_tokens: 0. Il n'y a rien à analyser car rien n'a été écrit, et il y a un brut probabilities accesseur lorsque vous voulez la distribution non arrondie plutôt que l'argmax.
Ce qui change votre facture, c’est ce qui se passe avec plusieurs questions. Un même état peut en porter beaucoup : s’agit-il d’une demande de remboursement, quelle équipe devrait en être responsable, quel est son degré d’urgence. L’état et ses images sont lus une seule fois, et Liquid indique que trois questions sur un même état coûtent 1,3 fois le temps d’une seule plutôt que 3 fois. Ce qu’il ne fusionne pas, c’est la facturation des entrées : la note de facturation du fournisseur précise explicitement que chaque question est facturée comme son propre prompt, y compris son texte et toutes ses images. Moins de latence, autant de tokens d’entrée. C’est un astérisque honnête sur le titre principal, et c’est le genre de détail que l’on ne découvre qu’en lisant le paragraphe sur les tarifs plutôt que le benchmark.

Ce que seize mois de Qwen 3 8B vous apportent
Avant de considérer le modèle plus petit comme une amélioration, soyez précis sur ce qu’apporte le modèle en place, car cela va bien au-delà du nombre de paramètres.
• Contexte — Qwen 3 8B fonctionne nativement avec 32 768 tokens et s’étend jusqu’à 131 072, validés via YaRN. Liquid AI d1-3B fonctionne à 32 768 tokens, sans plus, et sans voie d’extension documentée. Pour un état qui correspond à un long document, le 8B est le seul des deux à pouvoir le contenir.
• Langues — 119 langues et dialectes pour Qwen 3 8B, contre seize documentés pour Liquid AI d1-3B.
• Contrôle du raisonnement — Qwen 3 8B vous permet d’activer ou de désactiver la réflexion pour chaque requête. Liquid AI d1-3B n’a aucun mode de raisonnement à contrôler, ce qui constitue soit une simplification, soit une limitation selon l’usage que vous faisiez de la réflexion.
• Étendue — le 8B écrit, explique, résume, traduit et code. Liquid AI d1-3B ne fait rien de tout cela. Sa fiche l’indique clairement : ce n’est pas un modèle de conversation et il n’écrit pas de texte.
• Preuves — Qwen 3 8B bénéficie de seize mois de benchmarking public, de quantification, de réglage fin et d'utilisation en production. Le score de 48,57 au Decision Index de Liquid AI d1-3B a été produit par Liquid à l'aide du système de notation officiel plutôt que d'être soumis au classement public, et il n'a que quelques jours, sans validation par un tiers.
• Vision — cette ligne va dans l’autre sens. Liquid AI d1-3B prend des images, le fournisseur rapportant 74,1 sur onze benchmarks publics d’images, interprétés comme des décisions sur l’ensemble d’options de chaque benchmark, et rapportant que le retrait des images fait s’effondrer les mêmes questions à 45,1. Le Qwen 3 8B purement textuel a besoin d’un modèle de vision séparé devant lui pour tout cela.
• Vitesse — une question en 8 ms sur une RTX 4090, 16 ms sur un Jetson AGX Thor, 50 ms sur un Jetson Orin Nano, et 64 états compactés par passe à 475 par seconde sur la 4090. Un classifieur basé sur la génération n'a pas de nombre comparable, car sa latence dépend de la longueur de la réponse.
Le résumé honnête, c'est que le 8B est le meilleur instrument généraliste et que le modèle de décision 3B est le meilleur spécialisé, et la seule question qui compte est de savoir quelle proportion de votre trafic relève du cas spécialisé.
L’arithmétique des coûts, faite avec soin
C'est ici que la comparaison s'avère rentable ou non, et il vaut donc la peine de la faire avec une véritable structure plutôt qu'avec un slogan.
L'affirmation que Liquid a publiée deux jours avant la publication des poids ouverts est que son modèle décisionnel hébergé égale ou dépasse GPT-6.1 Sol sur quatre des six applications réelles, à un coût inférieur de 19 à 200 fois, et qu'il répond plus rapidement à chaque tâche. Lisez la méthodologie avant de la répéter : chaque application a été exécutée une fois par modèle le 5 octobre 2026, les modèles de chat ont répondu en JSON avec leur réglage de raisonnement par défaut, et le coût de d1 a été calculé à 0,04 $ par million de jetons d'entrée. Ce chiffre de 0,04 $ est le tarif d'entrée hébergé de d1, et c'est le seul tarif qui existe — il n'y a pas de ligne de sortie à ajouter.
Maintenant, construisez la même forme d'estimation pour un classifieur Qwen 3 8B, et l'asymétrie est visible sans citer le prix d'un fournisseur, quel qu'il soit. Le 8B a deux lignes facturables là où le modèle de décision n'en a qu'une, et c'est la seconde ligne qui croît : une classification qui raisonne d'abord paie le raisonnement, et une classification qui remplit son JSON paie le remplissage. Les frais d'entrée du modèle de décision sont fixés par l'état et les questions. Ceux du 8B ne sont fixés par rien que vous puissiez prédire à partir du seul état.
Deux contrepoids empêchent que cela tourne à la déroute. Premièrement, le modèle de décision facture chaque question comme son propre prompt, si bien que poser cinq questions sur un seul long document quintuple l'entrée — le 8B pose les cinq en un seul appel et ne paie le document qu'une fois. Deuxièmement, et c'est plus important, un modèle de décision ne peut répondre qu'aux questions pour lesquelles il a été post-entraîné à répondre sous cette forme. Tout ce qui exige une explication, un résumé ou un jugement exprimé en mots vous ramène au généraliste et, en pratique, vous ramène à payer pour les deux.

Ce en quoi les deux sont réellement bons
Retirez le benchmarking et la séparation est plus nette que ne le laissent penser les nombres de paramètres.
Liquid AI d1-3B est conçu pour le oui/non, le choix dans une liste et la notation, à un plancher de latence qu'aucun modèle génératif n'atteint, sur du matériel qui comprend un Jetson Orin Nano à 50 ms et un ordinateur portable. Les applications que Liquid a présentées en octobre étaient toutes des variantes de cette forme — un prédicat SQL répondant par oui ou non pour 150 tickets d'assistance, une boucle de compactage du contexte d'un agent qui conserve, tronque ou supprime la sortie de chaque outil et élimine 52 % des jetons, une application d'inspection triant les pièces bonnes et défectueuses de quatre lignes de production avec une précision de 85 à 97 % sur une tâche pour laquelle elle n'avait jamais été entraînée et qu'elle avait comprise à partir d'une brève description. Cette dernière démonstration dit le plus clairement à quoi sert cette catégorie : un travail où la réponse est l'une de quelques possibilités, où l'état est une image, et où aucune explication n'a jamais été demandée.
Qwen 3 8B est destiné aux tâches qui doivent revenir sous forme de langage, ou couvrir 119 langues, ou contenir un document de plus de trente-deux mille jetons, ou raisonner à voix haute avant de s'engager. C'est aussi le bon choix lorsque la classification ne correspond à aucune des trois formes ci-dessus — lorsque l'ensemble des étiquettes est ouvert, lorsque les critères sont suffisamment nuancés pour que vous ayez voulu la réflexion, lorsque le même appel doit gérer le cas facile comme le cas difficile sans que vous ayez à router entre deux modèles. Et c'est le choix sûr lorsqu'un évaluateur demande quels benchmarks indépendants existent, car la réponse est : beaucoup, qui remontent à un an et demi.
Les équipes qui y parviennent ne choisissent pas. Elles placent le modèle de décision en amont du généraliste, sur la portion de trafic où la réponse est un nombre, et laissent le 8B gérer tout ce qui nécessite une phrase. Le filtre est 3B et 8 ms ; le 8B reste pour la charge utile.
Déploiement de la paire
Liquid AI d1-3B arrive sous forme de poids, avec le travail de déploiement déjà effectué : prise en charge de llama.cpp dès le premier jour, la pile NVIDIA complète, de DGX jusqu'à Jetson, la quantification NVFP4, une variante 8 bits pour les poids et les activations, et des conversions GGUF sur Hugging Face. Qwen 3 8B dispose de l'écosystème d'auto-hébergement le plus complet de tous les modèles de cette classe de poids. Ni l'un ni l'autre ne figure dans notre catalogue, et rien ici ne constitue une affirmation de disponibilité pour l'un ou l'autre — la voie hébergée pour Liquid AI d1-3B est l'API propre au fournisseur et des plateformes tierces, où le d1 hébergé est facturé uniquement sur les tokens d'entrée, à 0,04 $ par million, les images étant facturées à 1,5 token par zone de 32 × 32 pixels.
Une fois que les deux se trouvent dans le même pipeline, le problème de routage cesse d'être théorique. Vous avez un petit modèle que vous possédez, un 8B que vous pouvez héberger ou louer, et les appels génératifs que vous louez à coup sûr — et décider, pour chaque requête, vers lequel une entrée donnée doit être dirigée est exactement la décision qu'une couche de routage existe pour prendre. Un seul point de terminaison pour plus de 200 modèles, les tarifs catalogue des fournisseurs répercutés à 0 % de marge si bien qu'un changement de prix d'un fournisseur est effectif chez vous le jour même, le basculement automatique afin qu'un mauvais après-midi en amont ne devienne pas votre panne. Lorsque votre trafic de classification se compte en milliards d'appels par an, c'est à cette couche que les économies d'un modèle de décision 3B sont réellement encaissées.
Le verdict
Si votre 8B est interrogé avec des questions fermées — est-ce toxique, est-ce pertinent, à quelle file d'attente cela appartient-il, quel est son degré d'urgence — vous payez la facture à deux lignes d'un généraliste et la latence d'une génération pour une étiquette, et Liquid AI d1-3B est un remplacement direct avec une piste de preuves plus faible et une réelle différence de licence à soupeser. Acceptez le plafond de contexte de 32K, les seize langues, et le fait que personne en dehors de Liquid ne l'a encore évalué.
Si votre 8B est chargé d’expliquer, de résumer, de traduire, de conserver un long document ou de raisonner avant de décider, cette comparaison ne s’applique pas à vous. Gardez le 8B et ne considérez le modèle de décision que comme un pré-filtre pour le trafic que vous pouvez identifier à l’avance comme étant du type facile.
Le chiffre intéressant à surveiller n’est pas le score de benchmark de l’un ou l’autre modèle. C’est la rapidité avec laquelle arrive la première reproduction indépendante du d1 Decision Index, car c’est à ce moment-là que la comparaison cesse d’être une affirmation de fournisseur et commence à devenir un fait sur lequel vous pouvez vous appuyer pour planifier.

