
Kolibri vs Gemma 4 12B : 78 milliards de paramètres contre 12, et un seul d'entre eux a un score
- openaiNOUVEAUOpenAI: GPT-6.1 Sol2026-09-2952Intelligence
- anthropicNOUVEAUAnthropic: Claude Sonnet 5.52026-09-2856Intelligence
- typesafeNOUVEAUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 par million de tokens · 218 tok/s
- OpenAINOUVEAUOpenAI: GPT-6 Luna2026-09-2238Intelligence
- OpenAINOUVEAUOpenAI: GPT-6 Sol2026-09-2248Intelligence
- AnthropicNOUVEAUAnthropic: Claude Opus 5.52026-09-2258Intelligence
- xAINOUVEAUGrok 4.72026-09-2146Intelligence
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 par million de tokens · 115 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens · 982 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 par million de tokens · 47 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens · 105 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens · 215 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
Kolibri et Gemma 4 12B sont les deux extrémités d’un spectre que les sorties de modèles à poids ouverts ne permettent généralement pas de comparer sur un pied d’égalité. Le Kolibri d’Aleph Alpha est sorti le 3 octobre 2026 : 78,1 milliards de paramètres au total, 3,46 milliards d’actifs par token, une fenêtre de contexte validée de 1 048 576 tokens, allemand et anglais uniquement, Apache 2.0. Gemma 4 12B est sorti le 3 juin 2026 : 11,95 milliards de paramètres denses, une fenêtre de contexte de 262 144 tokens, entrées texte, image, audio et vidéo, Apache 2.0. L’un des deux dispose d’un score indépendant, reproductible publiquement. L’autre a un tableau de benchmark du fournisseur. Cette asymétrie n’est pas une note de bas de page dans cette comparaison ; c’est la comparaison, car tout le reste de ce qui importe à un acheteur — coût par tâche, qualité par watt, capacité à fonctionner sur vos documents — passe par elle.
Nous devrions être tout aussi directs sur la forme de la confrontation, car un titre qui oppose un modèle 78B à un modèle 12B invite à une conclusion erronée. Ce ne sont pas des concurrents. L’un est un déploiement de 78 Go destiné au travail documentaire du secteur public allemand et de l’industrie, sur des racks que le client possède ; l’autre est un modèle multimodal unifié de 12 milliards de paramètres qui tourne sur un ordinateur portable et porte un indice indépendant de 14. Ce qui suit décrit ce à quoi chacun sert réellement, les cas où les chiffres publiés permettent ou non de les classer, et ce qu’il en coûte de ne pas disposer d’un score indépendant.
Le seul chiffre auquel vous pouvez vous fier ici, et celui auquel vous ne pouvez pas.
Artificial Analysis a évalué Gemma 4 12B, dans sa configuration de raisonnement. Les résultats, tels que publiés sur leur page de modèle, sont ceux sur lesquels il faut s'appuyer :
• Intelligence — un Artificial Analysis Intelligence Index de 14, ce qui le place dans la bande de classe supérieure avec une position n° 21 parmi les 142 modèles de cette comparaison, contre une médiane de 8 pour les modèles comparables.
• Vitesse — 112,5 tokens de sortie par seconde, n° 21 sur 142 dans la vue vitesse, et au-dessus de la médiane de 91 tokens pour les modèles comparables.
• Prix — 0,10 $ par million de jetons d’entrée et 0,30 $ par million de jetons de sortie, que leur page signale comme plutôt cher par rapport à une médiane de 0,03 $ et 0,15 $ pour des modèles de taille et de catégorie similaires.
• Spécification — fenêtre de contexte de 262 144 jetons, 12 milliards de paramètres au total, Apache 2.0, entrées texte, image, parole et vidéo, sortie texte.
Le verdict de synthèse d’Artificial Analysis est d’une franchise inhabituelle pour une page de classement, et il mérite d’être répété : Gemma 4 12B figure parmi les modèles les plus performants en matière d’intelligence, mais il est quelque peu coûteux par rapport aux autres modèles à poids ouverts de taille similaire. Il s’agit d’une évaluation réelle, indépendante et reproductible, réalisée par un tiers qui n’a aucun intérêt en jeu chez l’un ou l’autre fournisseur.
Kolibri n'a rien d'équivalent. Il n'existe pas de page de modèle Artificial Analysis pour lui, et au moment d'écrire ces lignes, aucun tiers n'a reproduit la suite d'évaluations. Ce qui existe, c'est le tableau comparatif d'Aleph Alpha lui-même, sur lequel Kolibri obtient 75,5 de moyenne en anglais et 70,8 de moyenne en allemand sur sa suite de tâches. Il s'agit de moyennes en pourcentage non pondérées sur un mélange de benchmarks choisi par le fournisseur, exécuté sur un harnais écrit par le fournisseur, avec un effort de raisonnement élevé. Ce n'est pas un Intelligence Index, et ces deux chiffres ne peuvent être convertis l'un en l'autre ni mis côte à côte. Quiconque présente « Kolibri 75,5 contre Gemma 14 » comme un classement compare un pourcentage sur une échelle à un score sur une autre. La position honnête est que la qualité de Gemma 4 12B est mesurée, tandis que celle de Kolibri est déclarée.
Ce que le tableau du fournisseur permet bel et bien de faire, c’est de lire en suivant les lignes. Gemma 4 26B-A4B IT, la déclinaison mixture-of-experts propre à Google et sœur du 12B, apparaît dans le tableau d’Aleph Alpha à 71,9 en anglais et 66,3 en allemand, en dessous de Kolibri dans les deux cas. C’est ce qui s’approche le plus d’une vérification croisée dont on dispose, et cela s’accompagne de la même réserve : harnais du fournisseur, chiffres du fournisseur. C’est un signal faible, pas une preuve.

Dense 12B face à sparse 78B n’est pas le déséquilibre que cela laisse paraître.
L'écart d'architecture est plus grand que l'écart de paramètres quand on tient compte de ce qui est réellement calculé par token.
• Calcul par token — Gemma 4 12B active les 11,95 milliards de paramètres sur chaque token. Kolibri active 3 457 573 120 de ses 78 103 074 560, soit environ un vingt-deuxième du modèle, avec un expert partagé et six experts routés par couche sur 384.
• Mémoire — le compromis joue dans l’autre sens et il est brutal. Gemma 4 12B en bfloat16 représente de l’ordre de 24 Go de poids. La fiche de Kolibri indique des poids FP8 d’environ 78 Go, avec au minimum deux cartes A100 80 Go, deux H100 SXM5, une H200, une B200 ou une B300.
• Attention — Gemma 4 utilise un hybride d’attention locale à fenêtre glissante et d’attention globale complète, la couche finale étant toujours globale. Kolibri utilise une répartition 4:1 entre fenêtre glissante et requêtes groupées sur 50 couches entièrement MoE.
• Contexte — 262 144 jetons pour Gemma 4 12B ; 262 144 natifs pour Kolibri, validé jusqu’à 1 048 576 sans mise à l’échelle des positions.
Donc, la présentation honnête de « 78B contre 12B » est que Kolibri gagne sur le coût d’activation et perd sur l’empreinte des poids, et aucun des deux avantages n’est gratuit. Un modèle parcimonieux qui active 3,46 milliards de paramètres par token doit quand même garder les 78 milliards en mémoire, et c’est pourquoi le plancher de déploiement est une paire d’accélérateurs de 80 Go plutôt qu’une carte grand public. Gemma 4 12B fait le compromis inverse : une part plus importante du modèle s’active à chaque token, mais il tient sur du matériel qu’une personne peut acheter.
Il existe une particularité propre à l’allemand du côté de Kolibri, qui modifie l’arithmétique plutôt que le classement. Son tokeniseur fait en moyenne 4,90 octets par token sur du texte web allemand, contre 4,13 pour Gemini, 4,17 pour la famille Qwen3.5–3.8 et 4,35 pour GPT-5, selon les propres mesures d’Aleph Alpha. Moins de tokens par document allemand constitue une réduction directe du coût d’inférence, et pour une charge de travail qui correspond à du texte administratif allemand par millions, cet effet peut valoir plus que quelques points d’indice. Il est en outre entièrement déclaré par le fournisseur.

Ce que chacun peut réellement voir
C’est ici que la comparaison cesse d’être serrée, et il s’agit d’un fait de spécification plutôt que d’une affirmation de qualité. Gemma 4 12B est un modèle multimodal unifié : sa fiche décrit une architecture sans encodeur qui projette directement des patchs d’image bruts et des formes d’onde audio dans l’espace d’embedding du modèle de langage, avec en entrée du texte, des images, de la parole et de la vidéo, et en sortie du texte. Il est conçu pour fonctionner sur des appareils grand public, sans encodeurs distincts à provisionner.
Kolibri lit du texte, en deux langues, et rien d'autre. Aleph Alpha présente délibérément cela comme la profondeur plutôt que l'étendue : deux langues, minutieusement sélectionnées, plutôt qu'un large mélange multilingue. Il n'y a pas de tour de vision, pas de voie audio, pas de vidéo. Si votre charge de travail comprend des formulaires scannés, des appels enregistrés ou des photographies d'équipement, Gemma 4 12B est un candidat et Kolibri ne l'est pas, quelles que soient les lignes de benchmark. Si votre charge de travail est un corpus de documents allemands et anglais qui ne doivent jamais quitter le bâtiment, l'inverse est plus proche de la vérité — mais notez que l'exigence « ne jamais quitter le bâtiment » est satisfaite par Gemma 4 12B aussi, puisque les poids sont sous Apache 2.0 et téléchargeables.
Lequel est le moins cher dépend de ce que vous achetez.
Les deux modèles sont tarifés dans des devises non convertibles. Gemma 4 12B a un tarif de marché : 0,10 $ et 0,30 $ par million de tokens, tel que mesuré auprès de divers fournisseurs par Artificial Analysis, et moins cher au palier MoE sur les endpoints routés. Kolibri n’a aucun tarif du tout, car Aleph Alpha ne vend pas d’inférence pour ce modèle — la publication se compose des poids, d’un rapport technique et d’une fiche de modèle.
• Gemma 4 12B sur une route hébergée — 0,10 $ par million de jetons en entrée et 0,30 $ par million en sortie, d'après les chiffres d'Artificial Analysis. Dans notre propre catalogue, son homologue MoE, Gemma 4 26B-A4B IT, est affiché à 0,06 $ en entrée et 0,33 $ en sortie avec une fenêtre de 262 144 jetons, et le modèle dense plus grand, Gemma 4 31B IT, à 0,13 $ et 0,38 $ ; ce sont les prix catalogue des fournisseurs, répercutés tels quels — le seul montant auquel nous n'ajoutons rien.
• Kolibri sur votre propre matériel — 78 GB de poids, un plugin vLLM issu du paquet aleph-alpha-inference du fournisseur, et un minimum d’un H200 ou B200, ou d’une paire de H100 SXM5. Le coût correspond à un investissement d’immobilisation, à un emplacement de rack et à une personne capable de faire tourner un déploiement vLLM, amorti sur autant de tokens que vous en générez.
Ce ne sont pas les mêmes achats, et la comparaison ne porte pas sur « lequel est le moins cher ». Il s’agit de savoir si la charge de travail a une forme qui justifie de posséder le matériel. Une équipe qui traite à haut volume un corpus documentaire fixe et sensible peut s’en sortir largement gagnante du côté de l’auto-hébergement. Une équipe qui développe une fonctionnalité produit appelant un modèle quelques millions de tokens par jour n’y gagne presque jamais.
Une voie intermédiaire pragmatique : l'offre Gemma est disponible sur OrcaRouter aujourd'hui, sur le même point de terminaison compatible OpenAI que tout le reste, avec un basculement entre fournisseurs et le prix catalogue du fournisseur répercuté sans rien ajouter par token. Cela en fait un moyen peu coûteux de mesurer votre volume réel de tokens sur une route hébergée avant de décider si un déploiement souverain de 78 Go se justifie. Il vaut la peine de dire clairement ce qu'il n'est pas : nous ne routons pas Kolibri. Nous avons sondé le catalogue sous toutes les orthographes du nom du fournisseur et du modèle, et il n'y figure pas. L'auto-hébergement est actuellement le seul moyen de l'appeler.

Qui devrait choisir lequel ?
La règle de décision est assez courte pour être énoncée en trois lignes.
Choisissez Gemma 4 12B si vous avez besoin de quelque chose d'autre que du texte en allemand et en anglais, si vous avez besoin d'un chiffre de qualité mesuré avant de vous engager, si le modèle doit tourner sur du matériel que vous possédez déjà, ou si vous préférez louer des jetons plutôt que posséder un rack. C'est le seul des deux à disposer d'un score indépendant, d'une vitesse publiée et d'un prix de marché.
Choisissez Kolibri si votre exigence est un modèle de raisonnement de 78 milliards de paramètres dont les poids, la provenance des données d’entraînement, la consommation énergétique et la licence sont tous documentés, déployé à l’intérieur de votre propre périmètre, avec un tokenizer conçu pour la prose administrative allemande et un comportement d’abstention sur lequel un flux de travail réglementé peut compter. C’est une cible étroite, et Aleph Alpha l’a visée délibérément.
Ne choisissez ni l’un ni l’autre sur la seule foi d’une ligne de benchmark que vous avez vue dans une publication de lancement. Le 14 de Gemma 4 12B est une mesure faite par quelqu’un d’autre, et que vous pouvez vérifier. Le 75,5 de Kolibri est une affirmation faite par son auteur, et la seule personne qui puisse actuellement la réfuter est un client disposant de deux H100 et d’un corpus de documents.
