
FrogNano-4B-2609 : Microsoft a livré un agent de codage 4B sur Hugging Face sans jamais l'annoncer
- openaiNOUVEAUOpenAI: GPT-6.1 Sol2026-09-2952Intelligence
- anthropicNOUVEAUAnthropic: Claude Sonnet 5.52026-09-2856Intelligence
- typesafeNOUVEAUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 par million de tokens · 219 tok/s
- OpenAINOUVEAUOpenAI: GPT-6 Luna2026-09-2238Intelligence
- OpenAINOUVEAUOpenAI: GPT-6 Sol2026-09-2248Intelligence
- AnthropicNOUVEAUAnthropic: Claude Opus 5.52026-09-2258Intelligence
- xAINOUVEAUGrok 4.72026-09-2146Intelligence
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 par million de tokens · 114 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens · 1064 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 par million de tokens · 41 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens · 105 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens · 213 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
Le dépôt a été mis en ligne le 17 septembre 2026 avec le commit initial, et le checkpoint lui-même est arrivé quatre minutes plus tard. Puis plus rien. Aucun tweet de Microsoft AI, aucune entrée sur le blog de Microsoft Research, aucune page de lancement. Sept semaines plus tardmicrosoft/FrogNano-4B-2609 — un agent de codage de classe quatre milliards construit sur Qwen3.5-4B — n'a toujours aucune annonce derrière lui, et ce silence est le fait le plus important de la publication de ce modèle. Ce qu'il possède, en revanche, c'est une fiche de modèle qui revendique un article et un harnais, un dépôt GitHub qui s'avère être le harnais et non l'article, et uncreatedAt du 17 septembre placé sous une fiche qui indique « Release date 22-SEP-2026 ». Les deux dates sont improvisées ; aucune des deux n'est fausse ; elles se contredisent.
Qu'est-ce qui est réellement publié ?
Tout ce qui suit est vérifiable sur le hub dès maintenant, et chaque chiffre de cet article provient de la propre fiche de Microsoft ou des décomptes d’octets dans le dépôt lui-même. Rien n’a été reproduit par un tiers — il n’existe aucune entrée Artificial Analysis, aucune note d’arène, et aucune évaluation indépendante de FrogNano où que ce soit.
• Poids — un dépôt public sous l’organisation Microsoft, sans restriction d’accès, étiqueté MIT sur le hub, 15 fichiers, aucune barrière de téléchargement et aucun accord à signer.
• Poids sur disque — 9,32 Go répartis sur deux fragments safetensors, 59,6 milliards d’octets de données de dépôt, y compris l’ensemble de fichiers sans optimiseur, 738 tenseurs dans l’index.
• Architecture — Qwen3_5ForConditionalGeneration, la pile hybride dense à 32 couches héritée de Qwen3.5-4B, avec une tour de vision à 24 couches qui, d'après la fiche, a été héritée et jamais post-entraînée.
• Le champ de paramètre propre à la carte — « 500M-5B ». Il s’agit d’une plage, pas d’un nombre, et le téléchargement est le document le plus précis.
• Licence — les éléments liminaires de la carte indiquent MIT. Le corps de la carte lui-même indique Apache License 2.0, et le harnais GitHub fournit bien un fichier LICENSE MIT. Ces deux affirmations concernent des artefacts différents dans la même version.
• Annonce — aucune. Ni sur le blog de Microsoft Research, ni sur le site de recherche de l’équipe elle-même, ni dans le flux de l’organisation Hugging Face, autrement que sous forme de liste de dépôts.
Cette dernière ligne est celle qui devrait définir la posture d'un lecteur pour le reste de ce texte. Un point de contrôle mis en ligne discrètement n'est pas un artefact inférieur à un point de contrôle annoncé — sa fiche est souvent plus longue, parce que personne ne la raccourcit pour un communiqué de presse. Mais il n'a pas traversé le seul filtre dont bénéficie gratuitement une publication annoncée : le regard d'autres personnes.

Les partitions, et qui les a toutes produites
Microsoft rapporte que FrogNano atteint 61,5 % sur SWE-bench Verified, 37,6 % sur SWE-bench Pro, 31,1 % sur Terminal-Bench 2.0 et 47,3 % sur PatchEval-Verified, tous en tant que taux de résolution Avg@3 mesurés via le harnais Leaf. La même fiche donne le point de départ : Qwen3.5-4B a obtenu 39,4 % sur SWE-bench Verified avec un harnais et un budget identiques. Cinq itérations d'apprentissage par renforcement l'ont fait passer par 49,1 %, 53,1 %, 56,7 %, 59,1 % et 61,5 % — soit 22,1 points de plus que le modèle de base, ce que la propre formulation de Microsoft arrondit à environ 56 % d'amélioration relative.
Deux choses au sujet de cette échelle méritent qu’on s’y attarde, car ce sont des points où un résumé peut se tromper, plutôt que des points où le fournisseur s’est trompé.
Le premier est l’écart de l’itération 5. Le tableau principal de la fiche indique 61,5 % pour l’itération finale ; l’annexe sur l’efficacité de l’article lui-même rapporte la même progression en cinq points de contrôle : 48,2 %, 53,4 %, 58,3 %, 58,6 % et 61,6 %. Seul le dernier chiffre est proche, et seul le dernier chiffre est celui que tout le monde cite. Considérez le chiffre final comme le résultat stable et les échelons intermédiaires comme des mesures de choses différentes, car, sous une agrégation différente, ils le sont manifestement.
Le deuxième point, c’est que FrogNano n’est pas uniformément meilleur que le modèle dont il est issu, et ce sur tous les axes. Son taux publié d’appels d’outils en parallèle est de 1,71 %. La fiche admet franchement que les itérations ultérieures ont perdu la capacité de déclencher plusieurs appels d’outils en un seul tour, et que le travail de consolidation de l’équipe vise en partie à la récupérer. Un modèle qui résout davantage de problèmes tout en n’émettant presque aucun appel concurrent représente un véritable compromis d’ingénierie, pas une simple note de bas de page.

Le harnais est le produit, et le dépôt est le harnais
FrogNano ne s'exécute pas de lui-même. Il émet des appels structurés vers cinq outils — Read, Write, Edit, Glob et Bash — et quelque chose doit les exécuter dans un environnement isolé et renvoyer la sortie. Ce quelque chose, c'est Leaf, et ici, la piste fait quelque chose de légèrement inhabituel.
La ligne « ressources connexes supplémentaires » de la fiche du modèle renvoie à un rapport technique à l'adresse aka.ms/frognano-tech-report et à un harnais d'évaluation à l'adresse github.com/microsoft/FrogNano. Le lien aka.ms ne pointe pas vers un PDF ; il redirige directement vers la page de résumé arXiv, là où se trouve le rapport proprement dit. Le dépôt GitHub, quant à lui, ne contient ni code d'entraînement, ni recette d'apprentissage par renforcement, ni points de contrôle. Son propre README décrit un harnais d'évaluation qui exécute des agents de codage dans des bacs à sable Kubernetes face à un point de terminaison compatible OpenAI, et renvoie à l'article arXiv pour ce qui concerne l'entraînement. Ainsi, les deux liens de ressources de la fiche sont un pointeur vers l'article et un pointeur vers la réponse à l'article, et le nom est partagé.
Cela compte pour quiconque envisage d’utiliser le modèle, pour une raison pratique. La recette de service documentée est SGLang avec --reasoning-parser qwen3 et --tool-call-parser qwen3_coder, et le harnais souhaite un point de terminaison qui prend déjà en charge les appels d’outils et le raisonnement. Une légère erreur dans la configuration d’analyse et le modèle produit du texte là où le harnais attend du JSON, ce qui, vu de l’extérieur, ressemble exactement à un mauvais modèle plutôt qu’à une mauvaise configuration. La fiche est explicite : tout score correspondant exige un checkpoint, un tokenizer, une configuration de service, des images de tâche et un protocole d’évaluation correspondants — c’est le fournisseur qui vous dit que le harnais représente la moitié du résultat.
Il convient aussi de le dire clairement à quiconque dimensionne son matériel : un checkpoint de 9,32 GB au contexte évalué de la fiche n’est pas un problème d’inférence de 9,32 GB. Les évaluations ont été réalisées sur environ 131K tokens combinés avec un budget de 150 étapes. La mémoire évolue avec le contexte, pas avec les poids, et la fiche indique que la configuration GPU minimale doit encore « être validée avant publication » — une phrase qui apparaît sur un modèle déjà téléchargeable.
Ce que l'entraînement a réellement fait, en un paragraphe
La contribution de l'article n'est pas le modèle, c'est la boucle. TaskPilot génère des tâches d'ingénierie logicielle candidates à partir d'instantanés réels de dépôts, exécute des rollouts depuis le point de contrôle actuel sur celles-ci, conserve celles qui se situent près de la limite de ce que la politique parvient parfois à résoudre, et écarte les candidates définitivement triviales ou définitivement impossibles. L'ensemble accepté entraîne le point de contrôle suivant. Ce point de contrôle suivant calibre ensuite la ronde suivante de génération de tâches, si bien que la distribution des tâches évolue à mesure que la politique évolue. Environ 1 500 environnements validés au total. Pas de distillation : la fiche indique d'emblée que le post-entraînement spécifique à l'agent n'a utilisé aucune trajectoire de solution, action, trace de raisonnement ou cible de correctif issue de modèles plus forts. Les modèles plus forts rédigent des tâches ; ils ne démontrent pas les réponses.
Microsoft a exécuté cette boucle sur cinq itérations et fait état d'un gain de 8,7 points avant toute consolidation, avec une pénalité sur la longueur des logs ajoutée en cours de route, car les traces de raisonnement s'allongeaient plus vite qu'elles ne s'amélioraient.
La fiche de modèle est d'une franchise inhabituelle sur les points où l'ensemble de l'approche est fragile. Les données d'entraînement sont à dominante Python et principalement en anglais ; l'ensemble de langues naturelles prises en charge déclaré par la fiche se limite à l'anglais, et à rien d'autre, la couverture multilingue plus large du modèle de base n'étant pas explicitement revendiquée. Les performances sont sensibles au harnais et à la qualité des tests. Les correctifs générés « peuvent être incorrects ou non sécurisés malgré la réussite des tests disponibles ». La fiche de modèle du 4B clôt ce paragraphe par la phrase que tout lecteur devrait retenir : ne pas être utilisé sans un examen humain qualifié et sans des tests indépendants de régression et de sécurité. C'est une déclaration d'un fournisseur au sujet d'un artefact de fournisseur, et c'est une phrase plus utile que n'importe laquelle des lignes du tableau de bord ci-dessus.
Où cela laisse un acheteur, et où un routeur s’inscrit
FrogNano n’est pas un modèle que l’on appelle. Il n’existe pas d’API first-party, pas de point de terminaison hébergé, ni d’image serverless. C’est un checkpoint, et l’utiliser signifie soit mettre en place votre propre déploiement SGLang derrière un bac à sable hébergé sur Kubernetes, soit l’évaluer comme composant au sein d’une pile d’agents que vous exploitez déjà. C’est tout le parcours d’adoption aujourd’hui, et aucune annonce n’en aurait changé la forme.
Ce qu'une couche de routage peut honnêtement faire ici est plus restreint que cela n'en a l'air au premier abord. Si le plan est de comparer un FrogNano auto-hébergé à un modèle de codage hébergé dans votre propre harnais, la moitié hébergée est celle qui gagne à être derrière une seule clé plutôt qu'un second contrat : OrcaRouter transporte plus de 200 modèles derrière un point de terminaison unique compatible OpenAI à 0 % de marge, ce qui signifie que les prix catalogue des fournisseurs passent sans modification et qu'un changement de prix d'un fournisseur est répercuté de notre côté le jour même. Cela compte pour un comparatif dont l'issue se décide au coût par problème résolu plutôt que sur un seul chiffre de benchmark. Nous n'hébergeons pas FrogNano et aucune date n'est prévue ; les poids et le travail de service vous appartiennent.

Les trois choses qui permettraient de trancher
D'abord, une reproduction indépendante. Chaque chiffre de cet article — 61,5, 37,6, 31,1, 47,3 — a été produit par le laboratoire qui a entraîné le modèle, sur un banc d'essai que ce même laboratoire maintient, par rapport à une valeur de modèle de base que ce même laboratoire a mesurée. C'est un tableau complet et cohérent en interne, et c'est aussi une boucle fermée. Le test utile consiste à vérifier si quelqu'un qui n'a aucun intérêt en jeu reproduit le saut de 39,4 à 61,5 sur les mêmes 500 tâches sans le travail de calibration de Microsoft sur l'ensemble de tâches.
Deuxièmement, quelqu'un doit vérifier de bout en bout l'affirmation concernant le harnais. Le dépôt est public, ce qui est plus que ce que beaucoup de versions parviennent à faire, mais c'est le banc d'évaluation. Si les cinq outils et l'isolation du bac à sable constituent véritablement le mécanisme de performance, un tiers exécutant la configuration publiée devrait obtenir des résultats proches des chiffres publiés. Si ce n'est pas le cas, c'est l'écart qui est le véritable constat.
Troisièmement, et c’est la question la moins coûteuse à trancher : Microsoft devrait dire s’il s’agit d’un produit ou d’un artefact lié à un article. La section distribution de la fiche traite les poids, la fiche et le harnais comme le livrable, ce qui ressemble à une publication plutôt qu’à un lancement. « Date de sortie 22-SEP-2026 » ressemble à un lancement. Un modèle annoncé aurait levé cette ambiguïté dès la première phrase d’un billet de blog, et il n’y a pas de billet de blog.
Jusque-là, la posture correcte est celle qu’implique la publication elle-même. FrogNano-4B-2609 est un checkpoint réel, téléchargeable, sous MIT-et-Apache-et-peut-être-pas, avec une fiche particulièrement complète, un harnais d’évaluation public, une véritable idée méthodologique, et un tableau de scores auquel personne sans adresse Microsoft n’a jamais touché. Pour un laboratoire, c’est un artefact complet et intéressant. Pour une équipe sur le point de mettre un agent devant un dépôt à trois heures du matin, c’est une piste qui vaut la peine d’être suivie, et pas encore une décision qui vaut la peine d’être prise.
