Une carte de titre générée portant « Clef vs Gemma 4 12B », sous-titrée « un modèle de décision à 64K tokens face à un généraliste à 256K tokens », avec des pastilles indiquant « 65 536 vs 256 000 de contexte » et « probabilités vs prose ». Le logo OrcaRouter est intégré dans le coin inférieur droit.
Engineering & Research

Clef vs Gemma 4 12B : une appliance décisionnelle de 64K jetons contre un généraliste de 256K jetons

Auteur

Rowan Sterling

Date de publication

Derniers modèles · 20Voir tous les modèles →
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Le nombre le plus utile dans une comparaison entre Clef et Gemma 4 12B n'est pas un score de benchmark. C'est 65 536 contre 256 000 — les fenêtres de contexte. Cloudflare/clef est un modèle de décision multimodal de 27 milliards de paramètres, post-entraîné à partir de Qwen3.8-27B, qui lit un état et un schéma de questions typées et renvoie une probabilité pour chaque réponse autorisée en une seule passe non autorégressive. Gemma 4 12B — le checkpoint Unified, google/gemma-4-12B-it — est le modèle any-to-any sans encodeur de 11,95 milliards de paramètres du fournisseur, publié à l'été 2026, qui génère du texte sur une fenêtre de 256 000 tokens en plus de 140 langues. Placez un dossier de contrats devant les deux et le modèle de décision manque de place quatre fois plus tôt, car son plafond documenté est de 65 536 tokens, tandis que celui du généraliste est de 256 000. Cette asymétrie n'est pas une note de bas de page. Pour toute une classe de travail de routage — documents longs, fils de discussion collés, formulaires de plusieurs pages —, elle décide du choix avant même que la précision ne soit discutée.

Donc ce n’est pas une page sur le modèle qui est le meilleur. C’est une page sur les deux axes sur lesquels ils diffèrent réellement : la quantité d’état que chacun peut contenir, et la forme de réponse que chacun est physiquement capable de produire. Tout le reste est soit un chiffre de fournisseur que personne n’a reproduit, soit une comparaison qui ne signifie pas ce qu’elle en a l’air.

Ce que chacun est, en un paragraphe chacun

Clef est le modèle de décision 27B de Cloudflare, publié sous Apache-2.0 avec les poids sur Hugging Face et un point de terminaison hébergé sur Workers AI. Cloudflare a gelé le backbone Qwen3.8-27B, y compris son encodeur visuel, a attaché une tête de schéma conjointe ainsi que des adaptateurs de rang faible de rang 256, et l'a entraîné avec une entropie croisée à lissage d'étiquettes pour des réponses de schéma valides, accompagnée d'une perte de Brier afin d'affiner la calibration. Vous fournissez state — texte, JSON, images ou trames vidéo — et de 1 à 64 questions nommées, chacune de type noul (vrai/faux, renvoyant la probabilité de vrai), choice (2 à 26 options nommées) ou score (2 à 26 niveaux ordonnés). Ce qui est renvoyé est une distribution par question et rien d'autre. Il n'y a aucune voie de génération de texte du tout.

Gemma 4 12B est un modèle généraliste qui génère du texte. Il est sans encodeur : au lieu de modules de vision ou d'audio distincts, des patchs d'images bruts et des formes d'onde sont projetés directement dans l'espace d'embedding du modèle de langage par de légères couches linéaires, ce qui lui permet d'accepter du texte, des images, de la vidéo et de l'audio sans pipeline propre à chaque modalité. Il possède des modes de réflexion configurables, un appel de fonctions natif, un vocabulaire de 262 K et un schéma d'attention hybride qui entrelace une attention à fenêtre glissante de 1 024 jetons avec une attention globale complète. Il est sous Apache-2.0, avec en complément les propres conditions d'utilisation du fournisseur, et c'est le checkpoint auquel la plupart des gens pensent lorsqu'ils disent « exécuter cette taille en local ».

Une chose à dire clairement avant d’aller plus loin : aucun des deux modèles n’est une route sur OrcaRouter. Notre catalogue renvoie un 404 pour cloudflare/clef et pour le checkpoint 12B de la même famille, et rien dans cet article ne doit être interprété comme une affirmation de disponibilité de notre part. Ce que nous proposons bien de la famille Gemma, ce sont les deux plus grandes tailles, et leurs prix figurent plus bas.

A two-column comparison scoreboard titled 'Clef vs Gemma 4 12B — the scoreboard'. The left column 'Clef' reads: Parameters: 27B multimodal; Context: 65,536 tokens; Output: probability per option, no text; Input: text, JSON, images, video; Latency: 209.3 ms median, H200; Evidence: vendor's own Decision Index. The right column 'Gemma 4 12B' reads: Parameters: 11.95B dense, encoder-free; Context: 256,000 tokens; Output: generated text; Input: text, image, video, audio; Latency: about 2.4 s to first chunk; Evidence: vendor card plus Artificial Analysis. A footer reads 'Clef figures unaudited; Gemma figures per Google's card and Artificial Analysis.' The OrcaRouter logo is composited in the bottom-right corner.

La liste d'options est une interface, et elle a un mode de défaillance

La différence structurelle entre ces deux réside dans ce qui se passe pour une entrée qui ne convient pas.

• Sortie — Clef renvoie une probabilité par option déclarée, et uniquement ces options. Gemma 4 12B renvoie du texte généré.

• Refus — Clef n’a pas d’option « aucune des réponses ci-dessus » à moins que vous n’en écriviez une vous-même dans les critères. Gemma 4 12B peut décrire un cas qui ne correspond à rien de ce que vous avez demandé.

• Mode de défaillance — L'erreur de Clef est silencieuse : un choix assuré dans votre schéma, aucune exception levée, aucune branche de repli déclenchée. L'erreur du généraliste est généralement bruyante : de la prose qui ne se parse pas.

• Testabilité — un ensemble d’options fixe rend le composant reproductible et peu coûteux à auditer. Le texte libre le rend flexible et coûteux à valider.

Les propres chiffres de Clef pour ce problème de refus sont les données les plus faibles qu'il publie. Sur CLINC150 avec gestion hors périmètre — détection d'intention où l'une des réponses valides est « cela n'appartient à aucune catégorie » — le 27B obtient 97,4 en macro-F1, ce qui est le meilleur score du tableau de Cloudflare et la raison de s'intéresser au 27B plutôt qu'à son propre frère 9B, qui obtient 66,8 sur le même benchmark. Un écart de trente points entre deux modèles construits à partir de la même recette indique que le comportement hors périmètre est ce que l'échelle du post-entraînement permet d'acquérir, et c'est précisément ce dont la plupart des pipelines de routage dépendent discrètement. L'atténuation documentée par Cloudflare consiste en une deuxième question dans le schéma — ajouter un champ noul demandant si l'état correspond ou non, puis y appliquer un seuil — ce qui fonctionne, et ce qui relève de votre travail plutôt que de celui du modèle.

D'où viennent les chiffres importe plus que ce qu'ils disent.

Chaque chiffre de Clef dans cet article provient de Cloudflare : sa fiche modèle, son article de lancement ou son exécution du Decision Index. La suite elle-même appartient à Cloudflare, et le classement qui héberge les scores appartient à Cloudflare. C’est un fournisseur qui mesure son produit sur du matériel qu’il contrôle face à un rival dont il imite délibérément l’API. Aucun tiers ne l’a reproduit, et cet article ne prétendra pas le contraire.

La colonne Gemma 4 12B relève d’un autre type de preuve. La fiche du fournisseur lui-même publie MMLU Pro 77,2 %, GPQA Diamond 78,8 %, AIME 2026 sans outils à 77,5 % et LiveCodeBench v6 à 72,0 %. Artificial Analysis, un outil de suivi indépendant, classe la configuration de raisonnement à un Intelligence Index de 14,18, avec un tarif affiché de 0,10 $ / 0,30 $ par million de jetons et une vitesse de sortie médiane mesurée d’environ 113 jetons par seconde — et sa propre page précise que ces chiffres dépendent de la charge de travail et du matériel.

L’interprétation honnête est que les deux colonnes ne sont pas du tout comparables. L’une est une suite d’évaluation de la qualité des décisions d’un fournisseur, exécutée par ce fournisseur ; l’autre est un mélange de benchmarks de fournisseurs et d’une évaluation indépendante d’un modèle général. Citer un 97,4 à côté d’un 77,2 comme s’il s’agissait de colonnes d’un même tableau serait la chose la plus trompeuse que cette page pourrait faire.

La latence est le seul terrain où les deux peuvent au moins être comparés dans les mêmes unités, et même là, les réserves s'accumulent. Cloudflare rapporte Clef à 209,3 ms en médiane et 238,6 ms en p95, mesurés sur sa propre infrastructure. Artificial Analysis mesure le temps jusqu'au premier chunk du 12B à environ 2,4 secondes dans une configuration de raisonnement, qui inclut un budget de réflexion que le modèle de décision n'a pas. Une passe non autorégressive de 209 ms face à un démarrage de génération de 2,4 secondes constitue une véritable différence architecturale — une passe avant contre une boucle de décodage — et c'est le meilleur argument dont dispose Clef pour un chemin critique. C'est aussi, à 27B, un modèle qui nécessite du matériel de classe H200 pour atteindre ce chiffre, et Cloudflare facture 0,24 $ par million de tokens d'entrée pour le faire tourner pour vous.

A headless capture of the google/gemma-4-12B-it model card on Hugging Face, showing the model title, the Any-to-Any and Transformers and Safetensors tags, the gemma4_unified image-text-to-text architecture line, the Apache 2.0 licence line credited to Google DeepMind, and the note that the card covers the Gemma 4 12B Unified model.

Ce que 64K de contexte vous apporte réellement

C'est dans le contexte que cette comparaison devient concrète et que le généraliste l'emporte largement sur le papier.

• Clé — 65 536 tokens, selon la page du modèle Workers AI et l’article de lancement ; l’assistant d’encodage fourni utilise par défaut max_length=16,384, qui est une valeur par défaut plutôt qu’un plafond, mais c’est la valeur par défaut que vous obtiendrez si vous utilisez le chargeur tel qu’il est fourni.

• Gemma 4 12B — 256 000 tokens, selon la fiche du fournisseur, avec une attention à fenêtre glissante de 1 024 tokens pour réduire le coût du contexte long.

• Images — Clef évalue conjointement les images et les trames vidéo avec l’état textuel via l’encodeur visuel hérité. Gemma 4 12B traite le texte, l’image, la vidéo et l’audio via sa voie sans encodeur.

• Langues — la fiche de Clef ne revendique aucun caractère multilingue ; Gemma 4 12B est documenté dans plus de 140 langues.

Pour un ticket, une facture ou une capture d'écran rendue, 64K est généreux et la différence est académique. Pour un contrat de 200 pages que l'on veut classer champ par champ, c'est là tout l'argument : le généraliste peut tenir le document, et le modèle de décision ne le peut pas. La réponse de Clef à cela, c'est le découpage (chunking), et découper un document avant de décider à son sujet signifie que l'on a déjà pris une décision que le modèle était censé prendre. C'est une véritable limite, et elle mérite d'être énoncée comme telle.

Ce que vous paieriez réellement, et où

Aucun des deux modèles ne figure dans notre catalogue, la question du prix se divise donc en trois.

• Clef — 0,24 $ par million de jetons d'entrée sur Workers AI de Cloudflare, ou auto-hébergé à partir des poids Apache-2.0 ; la latence publiée par Cloudflare a été mesurée sur un seul H200 avec torch 2.11 et transformers 5.10.2, et les quantifications communautaires apparues en deux jours suggèrent qu'on peut la réduire davantage, au prix d'une perte de précision que personne n'a mesurée.

• Gemma 4 12B — aucune voie hébergée ici, absolument aucune. Vous téléchargez environ 24 Go de poids BF16 et les servez vous-même, ou vous faites appel à une plateforme tierce. Il n'existe aucun prix par token que nous puissions citer.

• Le substitut routé — Gemma 4 26B A4B, un mélange d'experts avec 25,2B au total et 3,8B de paramètres actifs, est listé sur OrcaRouter à 0,06 $ par million de tokens en entrée et 0,33 $ par million de tokens en sortie avec un contexte de 262 144 tokens. Gemma 4 31B, le frère dense multimodal avec réflexion configurable et appel de fonctions natif, est listé à 0,13 $ et 0,38 $. Les deux sont sur une seule clé avec prix catalogue du fournisseur répercuté sans marge par token et basculement automatique entre fournisseurs.

Cette dernière ligne est la version honnête de notre implication dans cette comparaison. Si ce dont vous avez besoin est d'un généraliste qui lit un long document et rédige une phrase, la voie économique pour en obtenir un passe par une taille de Gemma 4 que nous servons réellement, et elle coûte moins cher par million de tokens que l'auto-hébergement d'un 12B sur des GPU loués. Si ce dont vous avez besoin est une décision bornée dans le chemin critique, la médiane de 209 ms de Clef est une véritable propriété architecturale, et ce qui s'en rapproche le plus dans notre catalogue est le Jev 1.13 de TypeSafe — le modèle que Cloudflare a évalué et dont il a copié le format de fil — à 0,042 $ par million de tokens d'entrée sur un contexte de 65 536 tokens, servi via la même forme POST /v1/systemone. Comme les deux sont compatibles au niveau de l'API derrière un adaptateur léger, tester Clef face au titulaire relève de l'expérimentation plutôt que de la migration, et l'expérience reste peu coûteuse lorsque les deux parties sont accessibles via un seul point de terminaison.

A headless capture of the OrcaRouter model page for google/gemma-4-31b-it, showing the Google breadcrumb, the Gemma 4 31B title, the import date, a p50 TTFT latency figure, and the code-sample and benchmark navigation tabs.

La décision, énoncée comme une décision

Choisissez Clef lorsque les réponses sont énumérables, que l’état tient dans 64K, que la décision se situe dans un chemin sensible à la latence et que vous êtes prêt à assumer vous-même la classe résiduelle. Le 97,4 du 27B en détection d’intentions hors périmètre est la raison pour laquelle vous paieriez pour lui plutôt que pour son frère 9B, et sa forme de sortie fixe est ce qui rend le composant auditable sans parseur.

Choisissez Gemma 4 12B lorsque l'entrée est longue, lorsque la modalité est audio ou vidéo, lorsque la réponse doit être rédigée en prose, ou lorsque les catégories ne sont pas encore connues — car « classez ce tas selon les regroupements qui ont du sens » est une requête qu'un modèle de décision ne peut pas accepter, pas une qu'il traite mal. C'est un généraliste avec une évaluation indépendante derrière lui, et pour un travail ouvert, cela vaut plus qu'un tableau de fournisseur.

Et soyez sceptique à l’égard des deux ensembles de chiffres pour la raison que cet article ne cesse de répéter : Cloudflare n’a été reproduit indépendamment sur rien, et cette fiche est le propre tableau de référence du fournisseur. Le seul chiffre réellement intéressant de la paire — savoir si une tête de schéma 27B conserve vraiment son score de 97,4 hors périmètre sur des données contre lesquelles elle n’a pas été entraînée — est exactement le chiffre qu’aucun des deux fournisseurs ne peut trancher et qu’un tiers pourrait.