
Intern-Decision-0.8B vs Gemma 4 12B : une tête de scoring face à un généraliste multimodal
- typesafeNOUVEAUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 par million de tokens · 592 tok/s
- openaiNOUVEAUOpenAI: GPT-6 Luna2026-09-2237Intelligence
- openaiNOUVEAUOpenAI: GPT-6 Sol2026-09-2248Intelligence
- anthropicNOUVEAUAnthropic: Claude Opus 5.52026-09-2258Intelligence
- grokNOUVEAUGrok 4.72026-09-2146Intelligence
- OrcaNOUVEAUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 par million de tokens · 187 tok/s
- orcaNOUVEAUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens · 113 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligence69Code
- grokSpaceXAI: Grok 4.62026-08-1244Intelligence77Code
- metaMeta: Muse Spark 1.22026-08-0540Intelligence72Code
La façon la moins coûteuse de voir ce qu’est Intern-Decision-0.8B — et ce qu’il n’est pas — consiste à le placer à côté de Gemma 4 12B, puis à remarquer que la comparaison porte presque entièrement sur ce que chaque modèle fait de sa couche de sortie. Gemma 4 12B, le modèle multimodal sans encodeur de 11,95 milliards de paramètres de DeepMind, publié le 3 juin 2026 sous Apache 2.0, est un généraliste génératif : vous lui donnez du texte, des images, de l’audio ou de la vidéo, et il rédige une réponse. Intern-Decision-0.8B, mis en ligne discrètement par InternLM sur Hugging Face le 26 septembre 2026, sans aucune annonce, est un fine-tuning du bien plus petit Qwen3.5-0.8B qui ne produit aucun texte — il prend un état, un schéma de questions nommées et jusqu’à huit images, et renvoie une distribution de probabilité calibrée pour chaque question après une seule passe avant. L’un écrit. L’autre note. Tout ce qui suit découle de cela.
Cela fait de cette confrontation un drôle de duel à présenter comme un concours, et il vaut la peine de le dire clairement avant les lignes de spécifications : ces deux-là ne sont pas des substituts, et quiconque doit choisir entre eux a déjà mal posé le problème. Gemma 4 12B répond à la question « quelle doit être la réponse ». Intern-Decision-0.8B répond à la question « laquelle de ces seize options est-ce, et quel est votre degré de confiance » — et y répond sans boucle de décodeur, d’où viennent les différences de latence et de coût. La comparaison utile porte donc sur la manière dont on intégrerait chacun dans un même flux de travail, et non sur celui qui l’emporte.
La plus grande différence, et de loin, est le côté sortie de la facture.
Gemma 4 12B est facturé comme n'importe quel modèle génératif : des jetons d'entrée et des jetons de sortie, les deux. Lorsque vous lui demandez du JSON structuré, chacun de ces jetons est généré, échantillonné et facturé, et plus votre schéma est long et imbriqué, plus il y en a. Ce n'est pas une critique du modèle — c'est ce que fait un décodeur — mais c'est le poste de coût que les têtes de décision sont là pour supprimer. Intern-Decision-0.8B n'a pas de jetons de sortie. Sa fiche est explicite quant à la raison : le chemin d'inférence n'appelle jamais generate()/, en lisant les logits aux positions immédiatement avant chaque <decision>/ espace réservé dans un squelette pré-rendu et en prenant un softmax uniquement sur les symboles candidats autorisés pour ce champ. Le compteur d'utilisation appelé output_tokens/ compte les champs notés, pas le texte.
La conséquence s'amplifie à l'échelle. Un pipeline qui étiquette dix mille enregistrements avec Gemma 4 12B paie pour dix mille documents JSON ; le même pipeline sur Intern-Decision-0.8B paie pour les prompts et rien d'autre. Que le nombre absolu soit élevé dépend entièrement de votre volume et de votre schéma, et quiconque dispose d'un budget par token peut le calculer dans un tableur en dix minutes. Mais la direction ne fait aucun doute, et c'est la raison pour laquelle une catégorie de petits modèles de décision a vu le jour.
Latence, et pourquoi l'écart de paramètres est trompeur
• Modèle de débit — Intern-Decision-0.8B : une seule passe avant, aucune boucle de décodage. Gemma 4 12B : génération autorégressive, un token à la fois.
• Latence mesurée — Intern-Decision-0.8B : 33,98 ms en moyenne / 37,50 ms au p95 sur une seule RTX 4090 via le chemin local Hugging Face, selon la propre mesure d’InternLM. Gemma 4 12B : aucun chiffre comparable en une seule passe n’existe, car il n’y a pas de passe unique à mesurer.
• Empreinte — Intern-Decision-0.8B : environ 1,73 Go de stockage de dépôt, 852 985 920 paramètres répartis sur un fragment linguistique de 1,50 Go, un fragment de vision de 176 Mo et un projecteur de 25 Mo. Gemma 4 12B : les documents de lancement de Google l'estiment à 16 Go de VRAM ou de mémoire unifiée.
• Déterminisme des sorties — Intern-Decision-0.8B : argmax sur les logits candidats, donc la même entrée produit la même étiquette à chaque fois. Gemma 4 12B : échantillonnage, sauf si vous fixez la température à zéro, et même dans ce cas l'étiquette arrive sous forme de texte qu'il vous faut analyser.
L'écart de paramètres de 14x entre ces deux modèles ne se traduit pas par un écart de temps d'exécution de 14x sur une tâche de décision, car le travail est différent par nature. Intern-Decision-0.8B consacre son unique passe à lire le prompt — l'état, le schéma, les descriptions des options — puis s'arrête. Gemma 4 12B effectue cette même lecture du prompt, puis y ajoute chaque token de la réponse. Pour un schéma à seize champs avec des libellés d'options descriptifs, la phase de génération n'est pas un détail négligeable ; elle constitue la majeure partie du temps d'horloge. Le propre tableau d'InternLM le démontre involontairement : son homologue 2B affiche une moyenne de 33,28 ms, à peine plus rapide que les 33,98 ms du 0,8B. Quand le traitement du prompt domine, le nombre de paramètres cesse d'être le levier. img src="2.png">

Là où Gemma 4 12B est tout simplement dans une catégorie à part
Il serait malhonnête de laisser la fiche technique au cadrage de la tâche de décision, car en dehors de ce cadrage, Gemma 4 12B n’est pas simplement en avance — il joue à un autre sport.
Intern-Decision-0.8B accepte du texte ainsi que jusqu’à huit images, et c’est là toute sa surface d’entrée. Son plafond d’entrée par défaut est de 8 192 tokens, rejetés plutôt que tronqués, ce qui est bien inférieur à l’embedding positionnel maximal de 262 144 que sa configuration annonce — c’est le plafond, et non l’architecture, qui constitue la fenêtre pratique. Gemma 4 12B prend nativement en charge le texte, l’image, l’audio et la vidéo grâce à une conception sans encodeur qui projette directement des patchs et des formes d’onde bruts dans l’espace d’embedding, dispose d’une fenêtre de contexte de 256K et renvoie du texte. La fiche publiée par Google lui attribue 77,2 % sur MMLU Pro, 77,5 % sur AIME 2026 sans outils, 72,0 % sur LiveCodeBench v6, 78,8 % sur GPQA Diamond, 69,1 % sur MMMU Pro et 79,7 % sur MATH-Vision. Ce sont des chiffres du fournisseur provenant de la propre fiche d’évaluation de Google, et contrairement au tableau d’Intern-Decision-0.8B, ils ont derrière eux un an d’utilisation par des tiers, car Gemma 4 est arrivé dès le premier jour dans un écosystème — LM Studio, Ollama, llama.cpp, MLX, vLLM, SGLang, Unsloth.
Les versions publiées ne se ressemblent pas du tout non plus, et le contraste est instructif. Gemma 4 12B disposait d’un blog de lancement, d’un rapport technique sur arXiv, d’une page de famille de cinq modèles, d’une fiche d’évaluation et d’un lien de téléchargement le jour de sa sortie. Intern-Decision-0.8B disposait d’une fiche de modèle avec une URL GitHub qui renvoie une erreur 404 et un Space de démo qui renvoie une erreur 401, et il est apparu moins de quarante secondes après deux modèles frères plus grands tout aussi peu documentés. L’un de ces deux est un produit. L’autre est un checkpoint que quelqu’un a décidé de mettre sur Internet.
Tous deux sont sous Apache 2.0, et ce n'est pas un point commun anodin
Le seul domaine où les deux se rejoignent véritablement est celui des licences, et cela mérite un paragraphe, car c'est là que la décision change pour les utilisateurs commerciaux. Les deux sont sous Apache 2.0. Gemma 4 12B est distribué selon les termes de la licence Gemma 4 hébergés chez Google, que la fiche du modèle identifie comme Apache 2.0 ; Intern-Decision-0.8B porte Apache-2.0 aux côtés d'un second LICENSE-QWEN/ fichier, ce qui constitue le traitement correct pour un modèle dérivé de poids Qwen et un signe qu'InternLM a fait le travail administratif même pour une version qu'il n'a pas annoncée.
Cela distingue les deux de la famille LFM2.5 de Liquid AI, dont la LFM Open License v1.0 subordonne les droits commerciaux au fait que votre entité juridique reste sous un seuil de chiffre d’affaires annuel de 10 millions de dollars — une contrainte bien réelle qu’un acheteur de modèle décisionnel comparant les options devrait lire avant de supposer que « poids ouverts » signifie la même chose partout. Si votre cas d’usage est commercial et que votre chiffre d’affaires dépasse ce seuil, Apache 2.0 et la licence LFM ne sont pas interchangeables, et ni Gemma 4 12B ni Intern-Decision-0.8B n’est soumis à cette restriction.
Le bilan honnête des chiffres d'Intern-Decision-0.8B
Chaque chiffre de performance d'Intern-Decision-0.8B est déclaré par le fournisseur et non reproduit. Ce n'est pas une formalité — c'est l'état actuel des preuves, et cela devrait déterminer le poids que l'on accorde au tableau. InternLM a choisi les benchmarks, choisi les concurrents, réalisé les évaluations et publié les résultats, et aucune exécution indépendante n'existe sur le moindre classement public. Une recherche du modèle dans Artificial Analysis ne renvoie absolument rien.img src="3.png">

Avec cette étiquette apposée, la forme du résultat reste instructive. Le 0,8B affiche 77,35 sur le benchmark Typed Decision de TypeSafe, contre 73,35 pour Jev 1.13 — le modèle dont le benchmark tire son nom — et 94,52 sur ToolACE contre 91,29. Il obtient une moyenne de 79,38 sur l'ensemble de la suite, ses propres frères 2B et 4B affichant 84,68 et 90,02. La colonne qui devrait faire hésiter un acheteur est WildJailBreak, où il obtient 64,48 contre 96,29 pour Jev : un écart de robustesse au refus de cette ampleur est une propriété du fine-tuning, et la question de savoir s'il provient de la base Qwen3.5-0.8B, de l'objectif de réglage de la décision ou du nombre de paramètres n'est documentée nulle part. Son profil de calibration est la lecture la plus intéressante — un Brier de 0,530 et une erreur de calibration attendue de 0,066, contre 0,358 et 0,095 pour Jev — ce qui signifie qu'il est globalement moins précis, mais que ses niveaux de confiance déclarés suivent de plus près son exactitude. Pour un flux de travail basé sur des seuils, cette distinction compte plus que la précision brute, et c'est le genre de chose qu'InternLM n'avait aucun intérêt à publier.
Face à cela, la fiche d’évaluation de Gemma 4 12B est elle aussi rapportée par le fournisseur — Google a également exécuté ces benchmarks —, mais il est dans la nature depuis juin, il a été déployé via tous les principaux environnements d’exécution locaux, et toute divergence aurait été relevée. L’écart de preuves entre « non reproduit pendant une semaine » et « non reproduit pendant quatre mois et personne ne l’a contredit » est la vraie différence entre ces deux colonnes.
Comment vous les combineriez réellement
Le schéma qui a du sens n’est pas un choix. Une tête de décision gère les appels structurés — routage, triage, classification, notation selon une grille d’évaluation — où l’ensemble des réponses est fermé, la latence compte et les jetons de sortie sont un pur surcoût. Un généraliste gère tout ce qui nécessite de la prose, du code, de la synthèse ou un contexte long : le résumé d’escalade, l’explication de la raison pour laquelle le ticket a été transmis à la facturation, le brouillon qu’un humain modifie.
Si vous cherchez à déterminer où se situe la frontière, l'expérience la moins coûteuse consiste à placer les deux moitiés derrière un seul point de terminaison. OrcaRouter achemine plus de 200 modèles via une seule API compatible OpenAI, avec basculement automatique en cas de défaillance et le prix catalogue du fournisseur répercuté sans marge, ce qui signifie que tester un modèle de décision hébergé et un modèle généraliste hébergé dans le même script ne coûte qu'une seule clé et un après-midi. Il vaut la peine d'être précis sur une frontière ici : Intern-Decision-0.8B n'est pas l'un des nôtres — c'est un checkpoint Apache-2.0 que vous téléchargez et exécutez vous-même, et la raison même de choisir un modèle de 1,73 Go est qu'il réside là où vos données se trouvent déjà. La moitié générative du schéma est la partie qui n'est qu'à une ligne. Quant à Gemma 4 12B en particulier, il ne figure pas non plus dans notre catalogue ; les tailles de Gemma 4 que nous acheminons sont 31B et 26B A4B, et le 12B est un téléchargement local. img src="4.png">

Le verdict, donc, ne désigne pas de gagnant. Intern-Decision-0.8B est une tête de scoring déterministe, bon marché et rapide, issue d’un laboratoire qui ne l’a pas encore expliquée, avec un tableau de benchmark que personne n’a reproduit et une colonne de robustesse au refus qui devrait être testée avant qu’elle n’approche d’entrées non fiables. Gemma 4 12B est un généraliste multimodal mature à poids ouverts, avec une fiche publiée, un rapport technique et quatorze fois plus de paramètres, et c’est le mauvais outil pour un appel de classification à seize champs — non pas parce qu’il est moins bon, mais parce que générer une réponse à une question dont vous avez déjà écrit l’ensemble des réponses est une façon coûteuse d’obtenir une étiquette.
Comparés dans cet article1
Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement
