
Liquid AI d1-3B vs Gemma 4 12B : un modèle décisionnel face à un généraliste
- openaiNOUVEAUOpenAI: GPT-6.1 Sol2026-09-2952Intelligence
- anthropicNOUVEAUAnthropic: Claude Sonnet 5.52026-09-2856Intelligence
- typesafeNOUVEAUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 par million de tokens · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligence
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligence
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligence
- xAIGrok 4.72026-09-2146Intelligence
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 par million de tokens · 62 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 par million de tokens · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens · 358 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
Le moyen le plus rapide de se tromper sur cette comparaison est de mettre Liquid AI d1-3B et Gemma 4 12B sur le même benchmark et d'attendre un gagnant. Ils ne répondent pas à la même question. Liquid AI d1-3B est un modèle de décision de 3,12B publié sous forme de poids ouverts le 7 octobre 2026 : vous lui fournissez un état et un ensemble de questions nommées, et il renvoie des probabilités, une étiquette choisie et un score de confiance, avec zéro token de sortie et aucune étape de génération. Gemma 4 12B est le généraliste any-to-any sans encodeur de Google, un checkpoint de 11,96B qui prend en entrée du texte, des images, de l'audio et de la vidéo et écrit une réponse sur une fenêtre de 256 000 tokens en plus de 140 langues. L'un vous dit à laquelle de quatre choses correspond une carte de circuit imprimé. L'autre vous dit pourquoi. Comparez-les sur la seule qualité et vous n'apprendrez rien, car les sorties ne sont pas commensurables — et les fournisseurs ne les ont jamais évalués l'un contre l'autre. Comparez-les sur ce qu'un appel renvoie, sur ce qu'il coûte et sur le point où chacun s'arrête, et l'association devient un test de limites réellement utile.
Deux contrats de sortie différents
La distinction qui fait tout le travail ici, c’est ce qui revient sur le fil.
Liquid AI d1-3B renvoie un objet de réponse structuré. Chaque question d'une requête déclare un type — noul pour oui/non avec P(oui), choice pour l'une d'un ensemble d'options nommées avec une confiance et une probabilité par option, ou score pour une position sur une échelle ordonnée de deux à dix niveaux avec le niveau attendu et sa distribution. Le modèle indique output_tokens: 0 car rien n'est écrit. Plusieurs questions sur un même état sont lues à partir d'une seule passe avant, et l'état et ses images sont encodés une fois pour toutes.
Gemma 4 12Brenvoie de la prose. Parfois, il renvoie le JSON que vous avez demandé, parfois il renvoie un JSON qui ne correspond pas exactement à ce que vous avez demandé, et il peut raisonner avant de répondre. C’est d’abord un modèle de langage : tout ce qu’il sait classer, il l’exprime sous forme de texte. C’est un atout lorsque la réponse doit être expliquée à un humain ou fournie à une étape en aval qui attend du langage, et un coût lorsque la seule chose dont vous aviez besoin était une probabilité.
Tout ce qui est en aval en découle. Une réponse de d1-3B ne peut pas échouer à être parsée. Elle ne peut pas non plus s’expliquer elle-même, et la fiche du modèle le dit directement : ce n’est pas un modèle de chat et il n’écrit pas de texte.
Où en sont les pistes de preuves
La provenance des deux ensembles de chiffres n'est pas équivalente, et c'est plus important ici que les chiffres eux-mêmes.
• Decision Index 0.2.1 — Liquid AI d1-3B obtient 48,57, évalué par le fournisseur avec l'évaluateur officiel, premier parmi les modèles de moins de 10B et devant Decider 35B-A3B à 47,11. Gemma 4 12B n'est pas du tout évalué sur le Decision Index, donc cette ligne n'a pas d'équivalent.
• Benchmarks de raisonnement — Gemma 4 12B obtient 77,5 sur AIME 2026, 78,8 sur GPQA Diamond et un ELO Codeforces de 1 659, et présente un indice d'intelligence Artificial Analysis de 22 en mode raisonnement et de 13 avec le raisonnement désactivé. Liquid AI d1-3B n'a aucun benchmark de raisonnement, car un modèle de décision ne produit pas de trace de raisonnement à évaluer.
• Contexte long — Gemma 4 12B accepte 256 000 tokens et obtient 43,4 % sur MRCR v2 eight-needle à 128k sur la fiche officielle de Google. Liquid AI d1-3B accepte 32 768 tokens. Si votre « état » est un document de quarante pages plus des scans, cet écart fait toute la décision et ce n'est pas serré.
• Vision — Liquid AI d1-3B obtient une moyenne de 74,1 sur onze benchmarks publics d’images, interprétés comme des décisions portant sur l’ensemble d’options de chaque benchmark, contre 73,9 pour le backbone LFM2.5-VL-3B à partir duquel il a été construit, et le fournisseur indique que retirer les images fait chuter ces mêmes questions à 45,1. La vision de Gemma 4 12B est plus forte et plus large, mais elle est présentée comme une qualité de génération, non comme une exactitude décisionnelle sur des options nommées.
• Langues — seize documentées pour Liquid AI d1-3B ; plus de 140 pour Gemma 4 12B.
• Vitesse — Liquid AI d1-3B répond à une question en 8 ms sur une RTX 4090, 16 ms sur un Jetson AGX Thor, 26 ms sur un Jetson AGX Orin 64 GB et 50 ms sur un Jetson Orin Nano, et regroupe 64 états en une seule passe à 475 par seconde sur la 4090. Gemma 4 12B génère, donc sa latence dépend du nombre de tokens qu'il écrit.
• Qualité des preuves — Les résultats de Gemma 4 12B sont ceux de Google, publiés en juin 2026 et depuis passés au crible, quantifiés et réexécutés par une large communauté. Ceux de Liquid AI d1-3B sont ceux de Liquid, publiés il y a deux jours, reproduits par personne en dehors du laboratoire. Lisez la deuxième colonne en conséquence.

Le seul endroit où ils se livrent une véritable concurrence
Il y a un vrai recoupement, et il ne figure pas sur un classement. C'est l'appel LLM-as-a-judge.
De nombreux pipelines de production utilisent déjà un généraliste de taille moyenne comme couche d'évaluation : noter l'urgence de ce ticket, décider si cette sortie satisfait une grille d'évaluation, choisir l'outil que l'agent doit appeler ensuite, vérifier si un passage récupéré répond à la question. Aujourd'hui, la plupart de ces appels sont adressés à un modèle génératif auquel on demande d'émettre un nombre ou une étiquette sous forme de texte, et le nombre qu'il émet est celui qu'a produit l'échantillonneur plutôt qu'un softmax sur votre ensemble d'options. C'est le flux de travail que Liquid AI d1-3B a été post-entraîné pour remplacer, et les démos publiées en sont toutes des versions — un prédicat SQL qui répond oui ou non pour 150 tickets d'assistance, une boucle de compactage du contexte d'un agent qui conserve, élague ou supprime chaque sortie d'outil et élimine 52 % des tokens, une application d'inspection visuelle qui triait les pièces bonnes et défectueuses de quatre lignes de production avec une précision de 85 à 97 % sur une tâche pour laquelle elle n'a jamais été entraînée.
Gemma 4 12B accomplit toutes ces tâches, et fait même plus que cela. Il peut aussi rédiger le résumé, garder un document de 256K en vue, prendre en entrée un appel téléphonique enregistré et répondre dans plus de 140 langues. Si votre pipeline a besoin d'une évaluation et d'une narration, le 12B fait deux tâches en un seul appel et le modèle de décision 3B en fait une.
La frontière, ce sont la longueur du contexte et la forme de la sortie. Un état long, une entrée vocale, de nombreuses langues, ou une explication que le lecteur attend — Gemma 4 12B, sans conteste. Un état court, un ensemble d'options fixe, un budget de latence par requête en millisecondes à un chiffre, ou une garantie ferme que la réponse sera analysable — c'est la colonne d1-3B, et le généraliste paie pour des capacités que vous n'utiliserez pas.
Combien coûte chacun à appeler
Aucun des deux modèles ne figure à notre catalogue, il n'y a donc pas de prix de routage à communiquer pour l'un comme pour l'autre — Gemma 4 12B ne fait pas partie des tailles Gemma que nous servons, et Liquid AI d1-3B est un modèle à poids ouverts que vous hébergez vous-même ou auquel vous accédez via l'API du fournisseur et des plateformes tierces. Pour situer le versant Gemini de cette famille, les deux tailles de Gemma 4 que nous routons sont affichées à 0,06 $ par million de tokens en entrée et 0,33 $ par million de tokens en sortie pour Gemma 4 26B A4B, et à 0,13 $ et 0,38 $ pour Gemma 4 31B, toutes deux avec des contextes de 262 144 tokens et des entrées texte, image et vidéo. Le prix médian des fournisseurs cité ailleurs pour Gemma 4 12B se situe autour de 0,10 $ et 0,30 $.
hébergé par Liquidd1 facture uniquement les jetons d'entrée, à 0,04 $ par million, les images étant comptées en entrée à 1,5 jeton par patch de 32×32 pixels. Une requête de décision n'a donc pas du tout de ligne de jetons de sortie, ce qui est la raison structurelle pour laquelle la propre comparaison de coûts du fournisseur avec des modèles beaucoup plus grands aboutit là où elle aboutit. Les poids ouverts n'ont pas de prix par appel ; vous payez en matériel. Les deux doivent s'inscrire dans le même pipeline que tout le reste de ce que vous appelez, ce qui est la couche pour laquelle un routeur existe — une API unique sur plus de 200 modèles, prix catalogue des fournisseurs répercutés à 0 % de marge, et basculement automatique afin qu'un simple incident en amont ne devienne pas votre panne. C'est la plomberie autour de la comparaison, pas la comparaison.

Comment décider, honnêtement
Partez du format de réponse plutôt que du modèle. Si le système en aval peut consommer une probabilité, un label et une confiance, et que l’ensemble de réponses est petit et connu, Liquid AI d1-3B n’est pas une régression par rapport à un 12B — c’est un instrument différent, et les chiffres de latence en font un déploiement d’une autre catégorie : 50 ms sur un Jetson Orin Nano, c’est un appareil qui n’a pas du tout vocation à faire tourner un 12B.
Si la réponse doit être une phrase, ou si l’état dépasse trente-deux mille tokens, ou si quelqu’un va le prononcer, ou si la langue de sortie est le bengali, alors Gemma 4 12B est le seul des deux à pouvoir faire le travail et la comparaison est terminée avant même de commencer.
La position réellement utile pour la plupart des équipes, c’est les deux, à des endroits différents. Un modèle de décision devant l’appel coûteux, qui fait le triage, le routage et les contrôles de garde-fou qui n’ont pas besoin de langage ; un généraliste derrière, pour le travail qui en a besoin. Il s’agit du même pipeline, l’un est un filtre et l’autre la charge utile — et les équipes qui tireront le meilleur parti de la version d1 sont celles qui paient déjà un 12B pour répondre oui ou non.

