Une carte de titre générée indiquant « FrogNano-4B-2609 vs Gemma 4 12B », avec le sous-titre « un agent de dépôt 4B face à un généraliste multimodal de 11,95B », trois puces indiquant « 61,5 % SWE-bench, déclaré par le fournisseur », « 72,0 % LiveCodeBench, déclaré par le fournisseur » et « aucun benchmark commun », un pied de page indiquant « Des benchmarks différents sans recoupement ; les deux tableaux de scores sont déclarés par le fournisseur », et le logo OrcaRouter incrusté dans le coin inférieur droit.
Guides & Insights

FrogNano-4B-2609 vs Gemma 4 12B : 61,5 % sur SWE-bench et personne ne l'a vérifié

Auteur

Elias Hawthorne

Date de publication

Derniers modèles · 20Voir tous les modèles →
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

de MicrosoftFrogNano-4B-2609 est un agent de codage de la classe des quatre milliards, dérivé de Qwen3.5-4B, qui annonce 61,5 % sur SWE-bench Verified. Gemma 4 12B est le modèle multimodal sans encodeur de DeepMind à 11,95 milliards de paramètres, et sa fiche annonce 72,0 % sur LiveCodeBench v6. Voilà les deux chiffres qu'un acheteur mettra côte à côte, et les mettre côte à côte est précisément l'erreur. Ils proviennent de benchmarks différents, de harnais différents, de laboratoires différents et — surtout — un seul des deux dispose d'une méthodologie d'évaluation publiée qu'une personne extérieure a lue. Tout le reste de cette confrontation dépend de ce que chaque modèle est réellement, et la réponse est qu'ils ne relèvent pas du tout de la même catégorie d'objet.

Les chiffres FrogNano ci-dessous proviennent de la fiche de modèle de Microsoft et de son rapport technique, tous deux publics depuis septembre et aucun n'ayant été reproduit par quiconque en dehors du laboratoire. Les chiffres de Gemma 4 12B proviennent de la fiche de modèle de Google, qui est elle aussi un document de fournisseur — la différence, c'est que les chiffres de Gemma ont derrière eux vingt semaines et environ 2,6 millions de téléchargements d'examen attentif, tandis que FrogNano n'a que deux semaines et un compteur de téléchargements qui n'a pas encore atteint la dizaine.

À quoi sert chaque modèle

C'est la partie qui échappe à une fiche technique. FrogNano-4B-2609 n'est pas un modèle qui se trouve être bon en code. C'est un modèle dont le post-entraînement est un logiciel au niveau du dépôt, et qui est conçu pour être utilisé dans un harnais plutôt que pour qu'on lui parle.

Ses cinq outils sont Read, Write, Edit, Glob et Bash. Il émet des appels vers ceux-ci, un bac à sable les exécute et renvoie la sortie, et la boucle tourne jusqu'à ce que le modèle cesse de demander. La configuration évaluée comporte 150 étapes d'interaction dans environ 131 K tokens combinés, et elle a produit un correctif candidat par tâche. La fiche de Microsoft précise explicitement que le modèle est destiné aux dépôts en anglais et à forte composante Python, dotés d'environnements reproductibles et de suites de tests exécutables, et que les composants d'image et de vidéo hérités du modèle de base n'ont jamais fait l'objet d'un post-entraînement et ne sont pas pris en charge.

Gemma 4 12B est de forme opposée. C'est un modèle unifié à 48 couches avec un contexte de 256K et sans encodeur vision ou audio distinct — les patchs d'image bruts et les formes d'onde audio sont projetés directement dans l'espace d'embedding du décodeur unique via des couches linéaires légères. Il prend en entrée du texte, des images et de l'audio, et produit du texte. Il dispose d'un mode de réflexion déclenché par un token dans le prompt système, d'un appel de fonctions natif, et la fiche de Google met un point d'honneur à lister les workflows agentiques parmi ses usages prévus.

Donc la vraie question n’est pas de savoir lequel est le plus intelligent. C’est de savoir si vous voulez un composant spécialisé qui ne fonctionne qu’à l’intérieur d’un ensemble que vous devez exploiter, ou un modèle généraliste qui fait correctement beaucoup de choses et peut être appelé par n’importe quoi.

A screenshot of the google/gemma-4-12B-it model card on Hugging Face showing the Gemma 4 12B Unified heading, the Any-to-Any, Transformers, Safetensors and image-text-to-text tags, the Apache 2.0 license line credited to Google DeepMind, and the model overview explaining that text, audio, image and video inputs are handled without separate encoders.

Ligne par ligne, là où ils diffèrent réellement.

• Paramètres — FrogNano-4B-2609 publie une fourchette, « 500M-5B », sur une fiche dont la description elle-même indique environ 4,66 milliards ; le téléchargement l’établit à 9,32 Go de poids BF16. Gemma 4 12B fait 11,95 B, énoncé une fois et jamais nuancé. Le rapport est d’environ 2,6 pour un, et il se répercute directement sur ce que vous devez louer.

• Contexte — La configuration évaluée de FrogNano totalise environ 131K tokens combinés, le raisonnement et la sortie d’outil partageant le budget. Gemma 4 12B embarque 256 000 tokens et, sur sa propre ligne de contexte long, obtient 43,4 % sur MRCR v2 avec huit aiguilles à 128K. Près du double de la fenêtre, et le second chiffre est une mesure publiée plutôt qu’une revendication de capacité.

• Modalité — FrogNano-4B-2609, c’est texte en entrée, texte en sortie, malgré la tour de vision présente dans son checkpoint. Gemma 4 12B prend en entrée du texte, des images et de l’audio.

• Plafond de sortie — la configuration FrogNano validée autorise 8 192 jetons générés par tour de l'assistant, et sa fiche indique que la configuration d'entraînement RL utilisait ce même plafond. Gemma 4 12B ne publie aucun plafond équivalent par tour ; la contrainte y est la fenêtre de 256K.

• Interface agentique — FrogNano émet des appels Leaf structurés et nécessite un harnais pour les exécuter. Gemma 4 12B embarque l’appel de fonctions natif dans sa version affinée sur instructions et est directement appelable.

• Licence — Gemma 4 12B est sous Apache 2.0 selon les conditions Gemma 4 de Google, clairement énoncé. La fiche de FrogNano est sous MIT dans ses pages liminaires et sous Apache 2.0 dans son corps même, le genre d'ambiguïté qui finit dans un examen juridique plutôt que dans une note de bas de page.

• Chiffres — FrogNano rapporte 61,5 % sur SWE-bench Verified, 37,6 % sur SWE-bench Pro, 31,1 % sur Terminal-Bench 2.0 et 47,3 % sur PatchEval-Verified. Gemma 4 12B rapporte 77,2 % sur MMLU Pro, 72,0 % sur LiveCodeBench v6, un ELO Codeforces de 1659, 78,8 % sur GPQA Diamond et 69,0 % sur Tau2. La fiche de Google ne publie pas de ligne SWE-bench, et celle de Microsoft ne publie pas LiveCodeBench. Il n’y a aucun chevauchement entre les deux tableaux de scores.

Ce dernier point est celui qui devrait mettre fin au réflexe de comparer les chiffres entre eux. Pas un seul benchmark ne figure sur les deux cartes. Un lecteur qui place 61,5 face à 72,0 a comparé un taux de résolution de dépôts à un taux de réussite en programmation compétitive, ce qui revient à peu près à comparer un temps de marathon à un temps sur 100 mètres parce que les deux sont exprimés en secondes.

Pourquoi le silence de Google sur SWE-bench n'est pas un signal d'alarme

La conclusion tentante que l’on tire de la liste à puces est que FrogNano dispose d’un véritable chiffre SWE-bench et que Gemma n’en a pas, donc FrogNano l’emporte sur la question du codage. Cela ne s’ensuit pas, pour une raison qu’il vaut la peine de formuler avec précision.

Gemma 4 12B rapporte un score de 69,0 % sur Tau2 — un benchmark d'utilisation d'outils agentiques sur trois exécutions — aux côtés de sa prise en charge de l'appel de fonctions et de son positionnement explicite pour les flux de travail agentiques. Un modèle qui obtient 69,0 sur Tau2 n'est pas un modèle incapable d'accomplir un travail agentique ; c'est un modèle dont le fournisseur a choisi de rapporter les performances d'utilisation d'outils plutôt que la résolution de dépôts. Google ne rapporte pas non plus de lignes SWE-bench pour le 26B ou le 31B, ce qui relève d'un choix éditorial à l'échelle de la famille plutôt que d'une faiblesse du 12B.

Par ailleurs, le résultat contre-intuitif figurant dans l'article de Microsoft lui-même mérite d'être lu attentivement par tout acheteur de Gemma. FrogNano part de Qwen3.5-4B, un modèle généraliste, qui a obtenu 39,4 % sur SWE-bench Verified via le harnais Leaf. Cinq cycles d'apprentissage par renforcement sur environ 1 500 tâches synthétiques l'ont fait passer à 61,5 %. La leçon n'est pas que « les petits modèles ne savent pas coder » — c'est qu'un point de contrôle généraliste de 4B affichant 39,4 % résolvait déjà plus d'un tiers d'un ensemble de problèmes difficiles validés par des humains, dès lors qu'on l'exécutait dans une boucle d'agent compétente. Gemma 4 12B est trois fois plus gros et vingt semaines plus mature. Personne ne l'a fait passer par Leaf, et tant que ce n'est pas fait, « Gemma n'est pas un agent de dépôt » relève d'une supposition plutôt que d'un constat.

La taxe du harnais, que les classements dissimulent complètement

Voici l’asymétrie pratique, et c’est celle qui détermine l’achat.

Gemma 4 12B est un modèle. Téléchargez 11,95 milliards de poids, dirigez Transformers, vLLM ou SGLang vers eux, envoyez du texte, recevez du texte. Google publie le chemin de serving, la licence est sans ambiguïté, et les personnes derrière 2,6 millions de téléchargements ont déjà rencontré les aspérités et les ont documentées. Si la tâche consiste à « résumer cette stack trace », « lire cette capture d'écran et me dire ce qui est cassé », ou « appeler cette fonction avec ces arguments », ça fonctionne aujourd'hui.

FrogNano-4B-2609 est un modèle plus un harnais, et le README de Microsoft lui-même rend le harnais non facultatif. Le dépôt à github.com/microsoft/FrogNano est le banc d'évaluation Leaf, pas le code d'entraînement — il nécessite un cluster Kubernetes, un espace de noms existant, des autorisations pour gérer les pods et les politiques réseau, un accès en pull aux images de conteneur de benchmark, et un point de terminaison compatible OpenAI configuré avec les analyseurs syntaxiques de raisonnement et d'appel d'outils appropriés. La fiche de Microsoft énonce sans détour la condition de correspondance : des scores identiques exigent un checkpoint, un tokenizer, une configuration de service, des images de tâche et un protocole d'évaluation identiques. La moitié de la version qui génère le score est celle que la fiche renvoie vers un lien GitHub.

Il y a une réelle valeur là-dedans, et cela mérite d’être nommé plutôt que balayé. La contribution de FrogNano est une boucle de synthèse de tâches qui régénère des problèmes d’entraînement en fonction des capacités de la politique actuelle — l’affirmation de l’article est qu’un petit agent peut être entraîné jusqu’à un niveau compétitif sur des tâches synthétiques sans aucune distillation, et cela ouvre une voie à quiconque ne peut pas s’offrir un enseignant de pointe. Son API est publique. Ses méthodes sont reproductibles en principe. C’est une contribution plus forte qu’un autre point de contrôle incrémental, et c’est aussi plus de travail que ce que la plupart des équipes ne s’engagent à fournir.

A generated two-column scoreboard titled 'FrogNano-4B-2609 vs Gemma 4 12B'. The left column reads Parameters approx 4.66B with the card saying 500M-5B, Context about 131K evaluated, Input text only, Harness required Leaf with 5 tools, SWE-bench Verified 61.5% vendor, and Independent evals none. The right column reads Parameters 11.95B, Context 256,000 tokens, Input text, image, audio, Harness none required, LiveCodeBench v6 72.0% vendor, and Independent evals widely run. A footer reads 'Different benchmarks, no overlap; both scoreboards vendor-reported.'

Si vous en choisissez un, choisissez en fonction du travail.

Choisissez Gemma 4 12B si le travail mélange les modalités, si un élément doit voir une image ou entendre de l’audio, si le contexte doit contenir en même temps une grande arborescence de fichiers et une longue transcription, ou si vous voulez un modèle que n’importe quel framework peut charger sans un second système derrière lui. Son score Tau2 de 69,0 et son appel de fonctions natif en font un choix défendable pour les pipelines agentiques, et personne n’a besoin de croire un laboratoire sur parole — le modèle a été évalué par des milliers de personnes et les résultats ne sont pas un secret.

Prenez FrogNano-4B-2609 si vous exécutez déjà un agent de dépôt en sandbox et que vous voulez un checkpoint de classe 4B à y intégrer, et si un téléchargement de 9,32 Go qui tient sur du matériel modeste est la contrainte qui guide la décision. Soyez lucide sur l’enchaînement : vous n’achetez pas un score, vous faites un pari sur une méthode, et la première chose que vous découvrirez est de savoir si votre boucle de polling et votre parseur d’appels d’outils ressemblent suffisamment à Leaf. Certaines équipes obtiendront un comportement proche de 61,5 % le troisième après-midi, et d’autres passeront deux semaines à découvrir que leur jeu d’évaluation était plus facile que SWE-bench Verified, et personne en dehors du labo ne peut encore vous dire dans quel cas vous vous situez.

Si la décision est vraiment serrée, l'expérience la moins coûteuse consiste à exécuter les deux dans le même harnais sur vos propres problèmes plutôt que de débattre de chiffres publiés qui ne partagent aucun benchmark. OrcaRouter regroupe plus de 200 modèles derrière une seule clé compatible OpenAI à 0 % de marge, de sorte que les prix catalogue des fournisseurs sont répercutés sans modification — ce qui permet de placer un modèle général hébergé et le reste de votre ensemble de candidats derrière un seul point de terminaison et une seule ligne de facturation pendant que vous décidez. FrogNano ne fait pas partie de nos routes et aucune date n'est prévue ; les poids sont un téléchargement que vous hébergez vous-même. Ce que nous pouvons éliminer, c'est la friction de l'autre côté de la comparaison : remplacer les modèles candidats dans votre propre harnais sans deuxième contrat, deuxième SDK ni deuxième jeu d'identifiants.

A generated timeline card headed 'Two releases, twenty weeks apart' showing an upper bar labelled Gemma 4 12B uploaded 23 May 2026 with 2.6 million downloads across the family, and a lower bar labelled FrogNano-4B-2609 uploaded 17 September 2026 with no announcement, with a span marker of 20 weeks between them and a footer reading 'Download figures from Hugging Face on 3 October 2026.'

Le résumé honnête, c'est que le chiffre de 61,5 correspond à un vrai travail du laboratoire qui l'a produit, et qu'il est actuellement la seule raison de préférer FrogNano pour le codage. Quand quelqu'un en dehors de Microsoft reproduira 61,5 sur les mêmes 500 tâches — ou échouera à le faire —, cette comparaison trouvera une véritable réponse. D'ici là, le choix par défaut le plus sûr pour la plupart des équipes est le modèle 11,95B avec la licence propre, la mesure de contexte long publiée, et vingt semaines d'erreurs des autres déjà absorbées dans sa documentation.