Une carte de titre générée affichant « Intern-Decision-2B vs Gemma 4 12B », sous-titrée « 8 192 tokens contre 256 000 », avec les badges « un évaluateur qui refuse » et « un généraliste qui écrit », avec le logo OrcaRouter incrusté dans le coin.
Guides & Insights

Intern-Decision-2B vs Gemma 4 12B : un plafond de 8 192 tokens face à une fenêtre de 256 K

Auteur

Gideon Frost

Date de publication

Derniers modèles · 20Voir tous les modèles →
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Supposons que ce que vous devez juger soit un dossier de sinistre d'assurance de quarante pages. internlm/Intern-Decision-2B le refusera. Pas de troncature, pas de résumé — il le refuse, car le moteur d'inférence intégré déclare DecisionEngine(max_length=8192) et la fiche du modèle indique en clair que les entrées surdimensionnées sont « rejetées sans troncature ». google/gemma-4-12B-it — Gemma 4 12B Unified — prendra le même document, plus les photographies numérisées qui y sont agrafées, plus l'appel téléphonique enregistré, et vous écrira une réponse. Ce contraste est toute la comparaison, et il n'a presque rien à voir avec les nombres de paramètres — 2 213 241 664 contre 11 959 730 224 — qu'une lecture de fiche technique placerait en premier.

Intern-Decision-2B est le checkpoint du milieu parmi trois checkpoints de décision qu'InternLM a téléversés sur Hugging Face le 26 septembre 2026 sans annonce, affiné à partir de Qwen/Qwen3.5-2B et sous licence Apache-2.0, avec les conditions Qwen conservées en parallèle. Gemma 4 12B Unified est le modèle multimodal sans encodeur de Google DeepMind de mai 2026, un système any-to-any qui accepte du texte, des images, de l'audio et de la vidéo et génère du texte sur une fenêtre de 256 000 jetons dans plus de 140 langues. L'un des deux est un scoreur. L'autre est un généraliste qui se trouve pouvoir mal scorer si vous l'incitez avec soin. Choisir entre eux est moins une question de benchmark qu'une question sur la forme que votre réponse a déjà.

Là où les deux ne sont pas réellement comparables

Il vaut la peine d'être direct à ce sujet avant d'aborder les chiffres, car l'affiche invite à une fausse symétrie.

Intern-Decision-2B ne produit aucun token. Il prend un état, une à seize questions nommées avec jusqu'à 62 options chacune, et éventuellement jusqu'à huit images ; génère un squelette JSON d'assistant avec un espace réservé <decision> par champ ; exécute une seule passe avant causale ; lit les logits à la position immédiatement avant chaque espace réservé ; applique un softmax sur uniquement les symboles légaux de ce champ ; et applique une température ajustée de 2.100509348278. La sortie est une distribution calibrée et un argmax par champ. La fiche indique explicitement le point négatif : « Cette API effectue un scoring structuré de candidats. Elle n'appelle pas generate() et n'échantillonne pas de texte libre. »

Gemma 4 12B génère. Tout ce qu'il fait — raisonner avec une réflexion configurable, l'appel de fonctions, l'OCR, la compréhension de graphiques, la reconnaissance vocale, une couverture de 140 langues — passe par une boucle de décodage sur un vocabulaire de 262 144 entrées. Demandez-lui une décision de routage avec des probabilités et vous obtiendrez un texte en prose contenant un nombre, et ce nombre sera ce que l'échantillonneur a produit, et non un softmax sur votre ensemble d'options.

Donc la question pratique n'est pas « lequel est le plus précis ». C'est « ma réponse est-elle déjà un ensemble fermé ? » Si oui, le 12B est une façon gaspilleuse de choisir dans une liste. Si non, Intern-Decision-2B ne peut vous aider à quelque niveau de précision que ce soit.

Le plafond d'entrée est la ligne la plus nette entre eux.

Voici la dimension à considérer avant toutes les autres, car elle produit des défaillances franches plutôt que des défaillances dégradées.

• Longueur d'entrée — Intern-Decision-2B accepte 8 192 tokens et rejette bruyamment tout ce qui est plus long ; Gemma 4 12B accepte 256 000 tokens et, sur la propre fiche de Google, obtient un score de 43,4 % sur MRCR v2 eight-needle à 128k.

• Images — jusqu'à huit pour Intern-Decision-2B, et elles sont décomptées du même budget de 8 192 tokens ; rapport d'aspect et résolution variables pour Gemma 4 12B, avec des entrées texte et image entrelacées dans n'importe quel ordre.

• Modalités d’entrée — texte et image pour l’un ; texte, image, audio et vidéo pour l’autre.

• Langue — aucune affirmation multilingue n'est faite nulle part dans la documentation d'Intern-Decision ; Gemma 4 couvre plus de 140 langues pré-entraînées avec un score multilingue évalué de 83,4 sur MMMLU pour le 12B.

• Sortie — une distribution de réponses JSON typée pour l'un ; du texte généré pour l'autre.

La limite de 8 192 n’a rien d’arbitraire, et c’est précisément ce qui la rend difficile à contourner. L’objectif de décision lit un logit à une position fixe par champ, donc le prompt doit contenir l’état, le schéma et le squelette complet en une seule passe ; aucune stratégie de découpage ne permet de préserver le contrat. Un ticket, un e-mail, un court état JSON, une capture d’écran ou deux — voilà le cœur de la conception. Un document qui nécessite une récupération est un document auquel ce modèle n’est pas destiné.

Ce que chacun vous coûte, honnêtement compté

Intern-Decision-2B n'a ni point de terminaison hébergé ni fournisseur. La page de modèle d'OrcaRouter pour celui-ci renvoie une 404, et rien dans cet article ne constitue une affirmation de disponibilité. L'appeler implique de télécharger environ 4,46 Go de dépôt — un fragment linguistique de 3,76 Go, une tour de vision de 612,5 Mo, un projecteur de 50,3 Mo — et d'exécuter inference.py à côté des poids dans un environnement Python 3.12 avec torch 2.9.1 et transformers 5.14.1, sur un GPU que vous payez, qu'il évalue des décisions ou non.

Ce n'est pas un inconvénient dans tous les cas, et le calcul mérite d'être fait plutôt que supposé. À 33,28 ms en moyenne par requête sur une seule RTX 4090, selon la propre mesure d'InternLM, un Intern-Decision-2B hébergé localement ne facture rien par décision. Un généraliste hébergé facture au token, y compris pour les tokens qu'il dépense à réfléchir avant de répondre. À grande échelle, un évaluateur que vous possédez déjà est l'instrument le plus économique — le coût, c'est le GPU et l'ingénierie, pas l'appel.

Gemma 4 12B Unified ne figure pas non plus dans notre catalogue ; si vous le voulez, vous récupérez 11,96 milliards de paramètres en BF16 et vous le servez vous-même. Là où notre catalogue propose de véritables routes Gemma 4, c'est pour les deux autres tailles, et elles sont bon marché : Gemma 4 26B A4B à 0,06 $ par million de jetons d'entrée et 0,33 $ par million de jetons de sortie, et Gemma 4 31B à 0,13 $ et 0,38 $, tous deux affichés avec des contextes de 262 144 jetons et un temps jusqu'au premier jeton P50 que le catalogue indique à 1,73 seconde. Si votre problème relève en fin de compte du raisonnement général plutôt que d'une décision à ensemble fermé, c'est l'élément à comparer à un évaluateur exploité localement — deux modèles de plus sur une seule clé, prix catalogue du fournisseur répercuté sans marge, et un basculement automatique afin qu'un modèle que vous êtes encore en train d'évaluer ne devienne jamais un point de défaillance unique dans un chemin de production.

A screenshot of the OrcaRouter model page for google/gemma-4-31b-it, showing the Google breadcrumb, the model name Gemma 4 31B, a release date of 2026-04-02, the description of it as a 30.78B dense multimodal model with text and image input, a 256K token context window and configurable thinking mode, list pricing of $0.13 input and $0.38 output per million tokens, and a P50 time to first token of 1.73 seconds.

Tableau des scores, avec les réserves qui l'accompagnent.

• Paramètres — Intern-Decision-2B 2 213 241 664 en BF16, plus une tour de vision et un projecteur ; Gemma 4 12B Unified 11 959 730 224 en BF16.

• Contexte — 8 192 tokens, rejeté au-delà, contre 256 000 tokens.

• Sortie — probabilités calibrées et un argmax, aucun texte ; texte généré, un token à la fois.

• Modalité — texte plus jusqu'à huit images, contre texte, image, audio et vidéo en entrée, texte en sortie.

• Données publiées — un tableau du fournisseur à sept suites affichant une moyenne de 84,68 avec un score de Brier de 0,437 et une ECE de 0,100, non reproduit par qui que ce soit en dehors du laboratoire ; une fiche d'évaluation Google avec MMLU Pro 77,2 %, GPQA Diamond 78,8 %, AIME 2026 sans outils 77,5 % et LiveCodeBench v6 72,0, ainsi qu'un classement indépendant à 14,2 sur l'Artificial Analysis Intelligence Index.

• Adoption — un like et zéro téléchargement sur le checkpoint 2B, face à une famille en circulation depuis mai, avec des quantisations, des fine-tunes et des dérivés se comptant par centaines.

Lisez les lignes de preuves de manière asymétrique, parce que c’est ce qu’elles sont. Les chiffres de Google ont été indexés et reproduits indépendamment par des tiers ; ceux d’InternLM n’ont été exécutés par personne en dehors du laboratoire, et le chiffre de calibration en particulier devrait être considéré comme une intention bien documentée tant qu’il n’aura pas été confronté à un jeu de test étranger. Le résumé honnête n’est pas que le tableau du fournisseur est faux. C’est que les deux colonnes n’ont pas la même valeur probante, et une comparaison qui affiche 84,68 à côté de 77,2 sans le dire induit son lecteur en erreur.

A two-column comparison scoreboard titled 'Intern-Decision-2B vs Gemma 4 12B'. The left column reads: Parameters 2.21B BF16 plus vision tower; Context 8,192 tokens, refused above; Output probabilities and an argmax, no text; Input text plus up to 8 images; Published evidence vendor table, unreproduced; Licence Apache 2.0 plus LICENSE-QWEN. The right column reads: Parameters 11.96B BF16; Context 256,000 tokens; Output generated text, token by token; Input text, image, audio and video; Published evidence Google card, AA Index 14.2; Licence Apache 2.0, Gemma 4 terms. A footer notes the Intern-Decision-2B figures are vendor-reported and unreproduced while the Gemma 4 12B figures come from Google's own card plus an independent Artificial Analysis index.

Que faire de ceci

Choisissez Intern-Decision-2B lorsque la décision est réellement arrêtée, que l’état tient confortablement dans huit mille tokens, que vous voulez une probabilité que vous pouvez seuiller plutôt qu’un paragraphe que vous devez analyser, et que vous avez le matériel et l’envie d’exploiter un checkpoint que personne ne prend encore en charge. La taille intermédiaire est justement celle qui affiche la calibration publiée la plus faible des trois qu’InternLM a livrées — ECE 0,100 contre 0,066 pour le modèle deux fois plus petit et 0,065 pour celui qui fait presque deux fois sa taille — donc si vous choisissez au sein de cette famille, le 2B est celui sur lequel ajuster votre propre température, pas celui auquel faire confiance tel quel.

Choisissez Gemma 4 12B — ou, plus pragmatiquement, l’une des deux tailles de Gemma 4 que nous routons réellement — lorsque l’entrée dépasse une page, lorsqu’il s’agit d’audio, de vidéo ou d’une langue autre que l’anglais, lorsque la réponse doit être expliquée plutôt que simplement sélectionnée, ou lorsque vous ne voulez pas prendre en charge vous-même la pile d’inférence. Le 12B est le plus petit des modèles Gemma 4 dotés d’audio natif ; le 26B A4B active environ quatre milliards de paramètres par token et constitue la façon la moins coûteuse d’entrer dans la famille.

Et si ce que vous avez en réalité, c'est un problème de scoring assorti d'un long document, aucun des deux n'est le bon instrument : c'est un problème de retrieval déguisé en article de comparaison.

A screenshot of the google/gemma-4-12B-it model card on Hugging Face, showing the Gemma 4 banner, the Hugging Face, GitHub, launch blog, documentation and technical report links, an Apache 2.0 licence, the note that the card covers the Gemma 4 12B Unified model, and the opening paragraphs describing a multimodal family handling text, image, video and audio with a context window of up to 256K tokens and multilingual support in over 140 languages.