Une carte-titre générée indiquant « Ember-1 vs Gemma 4 12B » avec le sous-titre « Moins de tokens sur un endpoint loué, ou vos propres poids », au-dessus de deux cartes : Ember-1 — « dérivé de Kimi K3 » et « pas de poids, pas de prix publié » ; Gemma 4 12B — « 11,95 B dense, Apache 2.0 » et « contexte de 256 K, multimodal ».
Guides & Insights

Ember-1 vs Gemma 4 12B : l'un vous loue moins de tokens, l'autre vous remet les poids.

Auteur

Magnus Corvin

Date de publication

Derniers modèles · 20Voir tous les modèles
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Ember-1 et Gemma 4 12B ne sont pas en concurrence pour la même ligne sur un bon de commande, et le moyen le plus rapide de comprendre pourquoi est de se demander ce que vous posséderiez à la fin de chaque mois. Gemma 4 12B est le modèle multimodal dense à 11,95 milliards de paramètres de Google, publié le 3 juin 2026 sous Apache 2.0 — vous le téléchargez, et le checkpoint est à vous. Ember-1 est un dérivé spécialisé de Kimi K3 de Moonshot AI, publié par Fireworks Research le 23 septembre 2026 comme aperçu de recherche sur sa propre plateforme serverless — vous l’appelez, et vous ne possédez rien d’autre que la facture. L’un relève d’un raisonnement de location-accession portant sur des tokens ; l’autre est un achat d’immobilisation. Mettez-les côte à côte, et la comparaison utile n’est pas de savoir quel modèle est meilleur, car rien de publié ne permet d’en décider. C’est de savoir laquelle de ces deux formes d’acquisition correspond à ce que vous construisez.

Les deux contrats, énoncés simplement

Gemma 4 12B est une version à poids ouverts finalisée. Goog​le publie les poids, l’architecture, la fiche de benchmarks et la licence, et une communauté de runtimes — llama.cpp, vLLM, MLX, SGLang, Transformers — l’exécute sur du matériel que vous contrôlez. Le coût d’un token après achat, ce sont l’électricité et l’amortissement, pas une ligne de facturation d’un fournisseur. Ce à quoi vous renoncez, c’est ce que les poids ouverts coûtent toujours : vous assumez la planification de capacité, et votre plafond de qualité est fixé à 11,95 milliards de paramètres.

Ember-1 est l'inverse. Il n'y a aucun poids à télécharger — il existe comme option de service sur la plateforme du fournisseur lui-même — et aucun prix publié. Ce qu'il propose à la place, c'est une affirmation plus étroite, exécutée par-dessus un modèle bien plus grand : la précision de Kimi K3, avec environ 40 % de jetons en moins pour y parvenir. Fireworks Research l'a entraîné spécifiquement pour raccourcir les traces de raisonnement sans modifier les réponses, et indique que la longueur du raisonnement pourrait être réduite de 35 à 50 % sans perte de précision sur sept benchmarks et deux tests A/B de production clients. Chacun de ces chiffres est rapporté par le fournisseur et n'a pas été reproduit.

A two-column scoreboard titled "Ember-1 vs Gemma 4 12B — the scoreboard" comparing six dimensions. Ember-1: a Kimi K3 derivative retrained for shorter reasoning; no published weights; context not published (base model 1M); text-only input; price not published, preview only; evidence is vendor benchmarks plus two vendor-run A/B tests. Gemma 4 12B: a dense 11.95B multimodal generalist; Apache 2.0 weights, downloadable; 256K-token context; text, image and audio input; free to download with hardware costs; evidence is Google evaluations plus an independent local-run ecosystem.

Ce que vaut l’argument du jeton dépend entièrement de qui paie les jetons.

L’argumentaire d’Ember-1 repose sur une facturation au token. Cette hypothèse est correcte pour le public auquel il était destiné — des équipes exécutant de longues boucles d’agents sur un modèle de frontière hébergé, où Fireworks Research note que Kimi K3 peut consacrer plus de 90 % des tokens générés au raisonnement interne, et où chaque tour rejoue les tours précédents, si bien que le raisonnement antérieur est relu et refacturé. Dans ce contexte, réduire la longueur de trace réduit directement la facture mensuelle, et le résultat A/B de 29,9 K de tokens de sortie contre 49,3 K pour K3 est le chiffre qui compte.

Appliquez le même modèle selon les termes de Gemma 4 12B et l’argument se dissout. Quand vous auto-hébergez un checkpoint Apache-2.0, les jetons de raisonnement supplémentaires se paient en temps d’horloge et en occupation GPU, pas en dollars par million. Une trace de raisonnement verbeuse sur votre propre ordinateur portable 16 Go est une réponse plus lente, pas une facture plus élevée. Cela ne rend pas l’inefficacité sans conséquence — dans une boucle d’agent, elle continue de s’accumuler et elle se traduit toujours par de la latence — mais le taux de change est différent, et considérer une réduction de 40 % des jetons comme une économie de 40 % sur du matériel auto-hébergé est une erreur de catégorie.

La fiche technique, une ligne par dimension

• De quoi il s'agit — Ember-1 : un dérivé en aperçu de recherche de Kimi K3, réentraîné pour un raisonnement plus court. Gemma 4 12B : un modèle multimodal dense à poids ouverts de 11,95 B issu de la famille Gemma 4 de Google.

• Poids — Ember-1 : aucun poids publié ; servi uniquement via la plateforme du fournisseur. Gemma 4 12B : Apache 2.0, téléchargeable, sans restriction d’accès.

• Taille — Ember-1 : non divulguée ; héritée de l'architecture de Kimi K3. Gemma 4 12B : 11,95 B en dense, 48 couches, environ 18 Go de poids en BF16.

• Fenêtre de contexte — Ember-1 : non publiée pour l’aperçu ; son modèle de base compte 1 048 576 tokens. Gemma 4 12B : 256 K tokens.

• Entrées — Ember-1 : texte. Gemma 4 12B : texte, image et audio via une conception unifiée sans encodeur, la vidéo étant mentionnée par certaines sources.

• Prix — Ember-1 : aucun tarif publié ; les montants en dollars de la feuille de benchmark sont calculés d'après la grille tarifaire de Kimi K3. Gemma 4 12B : gratuit à télécharger ; vous payez le matériel.

• Exigence matérielle minimale — Ember-1 : selon ce que prévoit le fournisseur. Gemma 4 12B : 16 Go de VRAM ou de mémoire unifiée, selon le positionnement de Google.

• Preuves — Ember-1 : benchmarks du fournisseur et deux tests A/B menés par le fournisseur, non reproduits. Gemma 4 12B : évaluations rapportées par Goog​le, ainsi qu’un écosystème indépendant d’exécutions locales.

Ce que Gemma 4 12B publie, et comment il lit

Les propres chiffres de Goog​le pour Gemma 4 12B le situent entre le Gemma 4 E4B, de format edge, et le plus grand 26B MoE : GPQA Diamond 78,8 %, MMLU Pro 77,2 %, AIME 2026 sans outils 77,5 %, LiveCodeBench v6 72,0, Codeforces ELO 1659, moyenne τ-2 de 69,0 %, MMMU Pro 69,1 %, DocVQA 94,9 et BigBench Extra Hard 53,0 %. Ceux-ci sont eux aussi rapportés par le fournisseur — Goog​le a évalué son propre modèle et publié la fiche — mais ils ont l’avantage de décrire un checkpoint que n’importe qui peut télécharger et réexécuter, c’est pourquoi les affirmations sur les poids ouverts ont tendance à être rapidement confirmées par des tiers, contrairement à celles sur les aperçus fermés.

La véritable distinction de ce modèle est structurelle plutôt que numérique. Gemma 4 12B n’a pas d’encodeur visuel ou audio distinct : les patchs d’image et les formes d’onde audio se projettent directement dans l’espace des tokens, ce qui permet tout simplement à un modèle 12B de prendre une capture d’écran ou un enregistrement comme entrée. Il embarque aussi des drafters de prédiction multi-token pour le décodage spéculatif, une fonctionnalité de latence plutôt que de qualité — le genre de chose qui compte quand vous exécutez le modèle vous-même et que chaque milliseconde de préremplissage est à votre charge.

Là où les deux se heurtent réellement

Les deux modèles sont commercialisés pour le codage agentique et l'utilisation d'outils, et c'est le seul domaine où un véritable choix existe. Le score d'Ember-1 à Terminal Bench 2.1 est de 82,0 % contre 80,9 % pour Kimi K3 Max, avec 51,9 % de tokens en moins ; son résultat à SWE-bench Verified est de 92,2 % contre 93,2 % pour K3 Max. Gemma 4 12B n'a pas du tout de score Terminal Bench ou SWE-bench dans l'ensemble publié par Google — sa preuve agentique est τ-2 à 69,0 %. Vous ne pouvez donc pas aligner les deux sur un benchmark commun, et tout article qui le fait invente la comparaison.

Ce que l’on peut dire, c’est qu’ils se situent à des points différents sur une courbe de coûts. Si votre charge de travail d’agent s’exécute sur un modèle de pointe hébergé et que la facture est dominée par les tokens de raisonnement, Ember-1 s’attaque précisément à ce poste — au prix d’une fenêtre d’accès de deux semaines et de l’absence de tarif publié. Si votre charge de travail doit tourner sur du matériel que vous contrôlez, traiter une capture d’écran, ou survivre au fait qu’un fournisseur décide de ne pas poursuivre une préversion, Gemma 4 12B est le seul des deux à répondre vraiment à la question.

A screenshot of the Hugging Face model card for google/gemma-4-12B, showing 97,559 downloads in the last month, a safetensors model size of 12B parameters in BF16, the Apache 2.0 licence, any-to-any modality, and a model tree listing 7 adapters, 62 fine-tunes and 49 quantizations. The Inference Providers panel reads "This model isn't deployed by any Inference Provider."

Une voie médiane, et où la trouver

Il existe une troisième option sur laquelle le marketing d'aucun des deux modèles n'est construit : utiliser les paliers les plus élevés de Gemma 4 comme moitié hébergée d'un dispositif hybride. OrcaRouter achemine les Gemma 4 26B-A4B et Gemma 4 31B de Goog​le aux côtés de plus de 200 autres modèles derrière une seule API, au prix catalogue du fournisseur, avec 0 % de marge, si bien que la même clé qui donne accès à un Gemma de taille intermédiaire donne aussi accès aux modèles de pointe pour lesquels il vous faudrait sinon un second contrat. Gemma 4 12B lui-même n'est pas sur notre plateforme, et Ember-1 non plus — si vous avez besoin du 12B en local, téléchargez-le ; si vous voulez d'abord tester si un Gemma plus grand comble l'écart, ce test ne coûte qu'un seul point de terminaison.

Cette disposition est aussi la manière honnête d’évaluer un aperçu de recherche. Le basculement automatique entre fournisseurs signifie qu’un modèle qui disparaît d’une fenêtre d’aperçu n’emporte pas votre application avec lui, ce qui est le risque spécifique qu’introduit le statut de publication d’Ember-1 et le risque spécifique auquel rien dans son tableau de benchmarks ne répond.

Lequel doit figurer sur votre feuille de route ?

Choisissez Gemma 4 12B si la propriété est une exigence — confidentialité, fonctionnement hors ligne, un plancher de coût fixe, ou un produit qui doit continuer à fonctionner si un fournisseur change d'avis. Son plafond publié est inférieur à celui d'un dérivé de pointe et son entrée multimodale est véritablement différenciante, et aucun de ces deux faits ne dépend de la feuille de route de quelqu'un d'autre.

Choisissez Ember-1 si votre problème est une facture par token sur de longues exécutions d’agents et que vous pouvez absorber le risque lié à la version préliminaire. Faites-le tourner en mode shadow face à votre solution actuelle pendant les deux semaines dont vous disposez, mesurez les tokens par tâche terminée sur votre propre trafic, et considérez les 40 % comme une hypothèse plutôt que comme un taux. Ce que vous ne devez pas faire, c’est choisir entre eux sur la qualité, car personne — y compris le laboratoire qui a créé Ember-1 — n’a publié de comparaison qui vous le permettrait.

A screenshot of OrcaRouter's model page for Gemma 4 31B, showing the google/gemma-4-31b-it listing priced at $0.13 per 1M input tokens and $0.38 per 1M output tokens, a p50 time-to-first-token of 1.44s, 375.3K tokens of traffic over seven days, a 256K-token context window and a Python snippet calling api.orcarouter.ai/v1.

Le point plus important, c’est que ces deux versions représentent les deux façons dont la capacité se vend à la fin de 2026. Un laboratoire publie un checkpoint et laisse l’écosystème trouver son niveau ; un autre reprend un modèle entraîné par quelqu’un d’autre, améliore un axe de son comportement et vend cette amélioration comme un service. Les deux sont légitimes, et ils échouent de manières différentes : les poids ouverts échouent lentement et en public, les aperçus échouent soudainement et par annonce.

Comparés dans cet article1

Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement