Une carte de titre générée portant « FrogNano-4B-2609 vs Qwen 3.8 », avec le sous-titre « un agent 4B sur votre propre GPU face à un modèle phare hébergé de 2,4 T », trois puces indiquant « 9,32 Go à télécharger », « 2 $ en entrée / 6 $ en sortie par million » et « jusqu’à 150 étapes par tâche », un pied de page indiquant « chiffres FrogNano selon Microsoft ; tarifs Qwen3.8-Max selon Alibaba. Rien ici n’est indépendant », et le logo OrcaRouter incrusté dans le coin inférieur droit.
Guides & Insights

FrogNano-4B-2609 vs Qwen 3.8 : Ce que coûte un agent de codage lorsque les poids vous appartiennent

Auteur

Magnus Corvin

Date de publication

Derniers modèles · 20Voir tous les modèles →
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

microsoft/FrogNano-4B-2609 est un agent de dépôt de la classe des quatre milliards dérivé de Qwen3.5-4B que vous téléchargez et hébergez vous-même. Qwen3.8-Max est le modèle phare hébergé — un modèle à mélange d'experts clairsemé de 2,4 billions de paramètres, avec environ 95 milliards de paramètres actifs par token, une fenêtre multimodale d'un million de tokens, et une grille tarifaire de 2,00 $ par million de tokens en entrée et de 6,00 $ par million en sortie — accessible avec une clé API depuis le 3 août 2026. L'un des deux coûte un GPU et un après-midi. L'autre ne coûte rien tant que vous ne l'utilisez pas, puis facture au token sur les trajectoires les plus longues couramment utilisées. C'est cet arbitrage, et non le tableau de benchmarks, qui constitue la véritable confrontation.

Les chiffres de FrogNano présentés ici proviennent de la fiche modèle et du rapport technique de Microsoft ; les chiffres de Qwen3.8-Max proviennent de la grille tarifaire publiée d'Alibaba et de la fiche du modèle dans notre propre catalogue, les scores indépendants étant étiquetés comme chiffres d'Artificial Analysis partout où ils apparaissent. Remarquez bien la dénomination : Qwen3.8, la version à poids ouverts, a été annoncée mais n'est pas encore disponible, tandis que Qwen3.8-Max est en service et tarifé dès aujourd'hui. Tout ce qui est appelable dans cet article est cette dernière.

L'arithmétique qui décide de la comparaison

Commencez par ce que coûte une seule tâche, car ce n'est pas évident et ce n'est pas négligeable.

Les évaluations de FrogNano ont exécuté chaque trajectoire avec un budget de 150 étapes dans environ 131 K jetons combinés, à hauteur de 8 192 jetons générés maximum par tour de l’assistant, et un plafond de 10 800 secondes. Multipliez les deux limites publiées et vous obtenez un plafond d’environ 1,23 million de jetons générés pour une seule trajectoire dans le pire des cas — ce qui, à 6,00 $ par million de jetons de sortie pour Qwen3.8-Max, représente environ 7,38 $ pour une seule tâche allée au bout de son budget. C’est de l’arithmétique sur deux nombres publiés, pas une mesure : les trajectoires réelles s’arrêtent tôt, la moyenne est bien inférieure au plafond, et les résultats d’outils et la sortie du shell sont facturés au tarif d’entrée moins cher plutôt qu’au tarif de sortie. Mais cela établit la forme de la chose. Un agent de codage ne dépense pas quelques centaines de jetons sur une question ; il dépense une longue conversation avec lui-même, riche en raisonnement, et chaque jeton de cette conversation est généré.

Maintenant, mettez l’autre côté du bilan à côté. FrogNano-4B-2609, ce sont 9,32 Go de poids BF16 répartis en deux fragments, téléchargeables sans contrôle d’accès. Pour le servir, il faut SGLang avec un analyseur de raisonnement Qwen3 et un analyseur d’appels d’outils Qwen3 coder, plus un bac à sable isolé pour les cinq outils. Ensuite, le coût marginal d’une trajectoire, c’est l’électricité, et la mémoire qu’elle occupe correspond à ce que votre contexte finit par atteindre, plutôt qu’à ce que pèsent les poids.

• Modèle de coût — FrogNano-4B-2609, c’est un coût matériel fixe et un coût marginal quasi nul. Qwen3.8-Max, c’est zéro coût fixe et une facturation par token, avec une répartition de 2,00 $ / 6,00 $ qui ne facture rien en amont et reporte tout en aval, au tarif des jetons de sortie.

• Ce que l'argent permet d'acheter — un agent de classe 4B sur votre propre silicium, face à un modèle à l'échelle frontière pour lequel vous n'avez jamais à planifier la capacité.

• Seuil de rentabilité — il est atteint lorsque votre volume mensuel de trajectoires multiplié par la facture moyenne de jetons par trajectoire dépasse le coût du GPU que vous loueriez autrement. Pour une équipe exécutant une poignée de tâches de dépôt par jour, cette ligne est encore loin d'être franchie et le modèle hébergé l'emporte par simple commodité.

Deux modèles qui ne font pas le même travail

La comparaison des coûts n’est équitable que si les résultats sont comparables, et ici ils ne le sont pas, ce que la plupart des fiches techniques passent sous silence.

FrogNano-4B-2609 a été post-entraîné exclusivement sur l'ingénierie logicielle au niveau du dépôt. Toute son interface est une boucle à cinq outils — Read, Write, Edit, Glob et Bash — exécutée par le harness Leaf dans un bac à sable isolé, en boucle jusqu'à ce que le modèle cesse d'appeler. La fiche de Microsoft indique que sa langue prise en charge est l'anglais et que son domaine de programmation validé est Python, et déclare sans détour que les composants d'image et de vidéo du checkpoint n'ont jamais été post-entraînés et ne sont pas pris en charge. Il ne raisonne pas sur votre architecture, ne répond pas aux questions sur votre activité et ne lit pas de capture d'écran.

Qwen3.8-Max est un modèle généraliste. La fiche catalogue d'Alibaba lui attribue des entrées texte, image et vidéo, avec une sortie texte et une fenêtre de contexte de 1 000 000 de tokens. Il raisonne, écrit, lit des documents et tient une conversation, et son appel de fonctions est une caractéristique d'un modèle généraliste plutôt que le but même du checkpoint. Ses chiffres Artificial Analysis, relevés dans la fiche le 2 septembre 2026, sont un indice d'intelligence de 45,4 et un indice de codage de 76,2.

• Entrée — FrogNano-4B-2609 est uniquement textuel. Qwen3.8-Max prend en charge le texte, les images et la vidéo.

• Contexte — environ 131 K tokens combinés pour la configuration évaluée de FrogNano, contre 1 000 000 pour Qwen3.8-Max. Cela représente un facteur de sept et demi, et c’est surtout important pour exactement les entrées de la taille d’un dépôt que reçoit un agent de codage.

• Sortie par tour — La configuration validée de FrogNano plafonne un tour d'assistant unique à 8 192 jetons. Qwen3.8-Max ne publie aucun plafond équivalent par réponse.

• Format de sortie — FrogNano émet des appels d'outil Leaf structurés et a besoin d'un harnais pour les exécuter. Qwen3.8-Max renvoie de la prose ou un appel de fonction au client que vous utilisez déjà.

• Scores indépendants — aucun pour FrogNano-4B-2609 au-delà de sa propre fiche ; les chiffres de Qwen3.8-Max ci-dessus sont des données tierces, issues d’Artificial Analysis.

• Paramètres — environ 4,66 milliards pour FrogNano d’après la description de sa propre fiche, contre 2 400 milliards au total et environ 95 milliards actifs pour Qwen3.8-Max.

A screenshot of the OrcaRouter model page for Qwen3.8 Max showing the breadcrumb Home, Models, Qwen; the model name and the qwen/qwen3.8-max model id; the FEATURED badge with Vision, Tools, JSON and Reasoning capability chips; the 1M-token context, text, image and video input and text output row; the $2.00 and $6.00 per-million price cards with the p50 TTFT figure; the byline 'by Qwen, 2026-08-03'; the on-page section list for Code samples, Pricing, Performance, Public benchmarks, Community buzz, How it compares and FAQ; and the opening of the long description describing Qwen3.8-Max as Alibaba's newest flagship.

Là où le 4B gagne réellement sa place

Il existe un axe sur lequel un agent 4B surclasse purement et simplement un modèle frontière, et ce n’est pas l’exactitude.

L'article de FrogN part de Qwen3.5-4B, qui a obtenu 39,4 % sur SWE-bench Verified via le harnais Leaf en tant que simple modèle généraliste. Cinq itérations d'apprentissage par renforcement sur environ 1 500 tâches synthétiques l'ont fait passer à 61,5 %, l'annexe de ce même article rapportant une progression par itération de 48,2 %, 53,4 %, 58,3 %, 58,6 % et 61,6 %. La méthode — générer des tâches calibrées sur la frontière d'apprenabilité de la politique actuelle, sans distillation d'un modèle plus fort — constitue la contribution, et la raison pour laquelle un groupe de recherche sans budget pour un modèle de pointe s'y intéresserait.

Lisez ce que cela implique pour la comparaison. La fiche de Microsoft reconnaît franchement que FrogNano n'est pas uniformément meilleur que le modèle dont il est issu : son taux d'appels d'outils en parallèle est de 1,71 %, car les itérations ultérieures ont perdu la capacité de déclencher des appels concurrents, et l'équipe a ajouté une étape de consolidation pour tenter de la retrouver. Un modèle qui résout plus de problèmes tout en devenant moins performant sur un comportement précis est un véritable artefact d'ingénierie aux coutures visibles, et sa fiche le dit plutôt que de l'enterrer.

Et le chiffre SWE-bench est une boucle fermée. La référence du modèle de base, le harnais et le score final proviennent tous du même laboratoire, et les deux tableaux d'un même article donnent deux échelles différentes pour la même expérience. Le chiffre de codage de Qwen3.8-Max, en revanche, a été produit par Artificial Analysis plutôt que par Alibaba — un autre type de preuve, un autre type de confiance, et l'on ne devrait jamais soustraire l'un de l'autre.

Le 4B que vous ne pouvez pas encore tout à fait intégrer à vos plans

Deux choses séparent FrogNano-4B-2609 d'un créneau de production, et toutes deux se trouvent dans sa propre documentation plutôt que dans l'avis d'un quelconque relecteur.

Le premier est le matériel. La fiche indique que la mémoire requise pour les poids BF16 est d’environ 9,3 Go, puis ajoute que la mémoire « augmente sensiblement à mesure que le contexte combiné approche environ 131 K tokens », avant de préciser que le modèle de GPU minimum exact, la configuration de VRAM, les versions d’exécution et le profil de performance « doivent encore être validés avant la publication » — une phrase qui apparaît sur un modèle déjà téléchargeable. Personne n’a publié de chiffre de VRAM pour la configuration évaluée, et la fiche n’en contient aucun.

Le second est la posture de sécurité. La propre note d’alignement de Microsoft indique que le post-entraînement spécifique à l’agent n’a utilisé aucun jeu de données de préférence de sécurité, de refus, de contenu préjudiciable ou adversarial, qu’il a plutôt été optimisé pour l’exactitude fonctionnelle et l’évitement des régressions, et que le modèle « should not be considered independently safety-aligned for unrestricted autonomous deployment ». La fiche conclut en nommant les risques concrets : les correctifs peuvent être incorrects ou non sécurisés bien qu’ils réussissent leurs tests, les performances sont sensibles à la qualité de ces tests, et chaque correctif candidat nécessite une revue humaine qualifiée ainsi que des tests indépendants de régression et de sécurité avant utilisation. Un modèle hébergé généraliste ne comporte aucune de ces mises en garde spécifiques, et il n’exécutera pas non plus de commande shell dans votre dépôt.

Une clé pour le camp que vous choisirez

L'intérêt de faire cette comparaison en pratique, c'est que seule une moitié consiste en un téléchargement. Qwen3.8-Max, ainsi que les modèles généralistes avec lesquels on comparerait un agent auto-hébergé, sont tous accessibles via un seul point de terminaison compatible OpenAI sur OrcaRouter à 0 % de marge — le prix catalogue du fournisseur répercuté tel quel, de sorte qu'une modification tarifaire d'un fournisseur arrive de notre côté le jour même, ce qui est le chiffre qui bouge réellement lorsque la facture de tokens de sortie d'un agent de codage est justement ce que vous cherchez à maîtriser. Cela simplifie aussi la question du basculement : si la moitié hébergée de votre pipeline se dégrade, la nouvelle tentative est automatique et l'expérience se poursuit.

FrogNano-4B-2609 ne fait pas partie de nos routes et aucune date ne lui est associée. C'est à vous de servir les poids, et la fiche est honnête quant au fait que la configuration de service n'a pas été entièrement validée. Ce que nous pouvons faire, c'est faire en sorte que l'autre versant de la comparaison ne coûte rien à mettre en place, pour que la question à laquelle vous finirez par répondre soit la vraie — savoir si un agent SWE-bench à 61,5 % annoncé par le fournisseur, sur votre propre GPU, surpasse un modèle frontière facturé à l'usage sur vos propres tâches, à votre propre volume.

A generated two-column scoreboard titled 'FrogNano-4B-2609 vs Qwen3.8-Max'. The left column reads Cost your GPU, electricity; Output tool calls and patches; Context about 131K evaluated; Input text only; Published score 61.5% SWE-bench Verified, vendor, unreproduced; Turn cap 8,192 tokens. The right column reads Cost $2.00 in / $6.00 out per million; Output prose or function call; Context 1,000,000 tokens; Input text, image, video; Published score AA Intelligence 45.4 and AA Coding 76.2, third-party; Turn cap not published. A footer reads 'FrogNano figures per Microsoft; Qwen3.8-Max scores per Artificial Analysis. Different benchmarks; not comparable.'

Lequel choisir

Tournez-vous vers Qwen3.8-Max lorsque le travail est général, lorsque c’est à l’équipe d’exploitation de quelqu’un d’autre de porter la capacité, lorsque l’entrée peut contenir une image ou un long document, ou lorsque vous avez besoin d’une réponse aujourd’hui plutôt que d’une pile de service d’ici vendredi. Ses scores tiers vous permettent de prévoir à peu près ce que vous achetez, et sa facturation au token est un coût variable que vous pouvez voir avant de vous engager. Pour une équipe qui exécute un nombre modeste de tâches sur dépôt par mois, le calcul n’est pas serré.

Privilégiez FrogNano-4B-2609 lorsque le volume est suffisamment élevé pour que la facturation par token sur de longues trajectoires soit la contrainte, lorsque les données ne peuvent pas quitter votre infrastructure, ou lorsque la question de recherche — un petit agent peut-il être entraîné à une compétence à l’échelle d’un dépôt sans enseignant — est ce que vous testez réellement. Lancez-vous en sachant trois choses : les 61,5 % sont une mesure propre à un laboratoire, sur un banc d’essai maintenu par ce laboratoire, personne n’a publié de chiffre de VRAM pour la configuration évaluée, et la fiche elle-même indique que la configuration de service n’est pas encore validée.

Ce qui rend ce duo digne d’intérêt, c’est qu’ils partagent un ancêtre commun deux générations en amont. FrogNano descend de Qwen3.5-4B — un modèle généraliste de la même entreprise, dont le modèle phare à 2,4 billions de paramètres figure de l’autre côté de cette page. Microsoft a pris le petit, a consacré cinq itérations de RL à des dépôts synthétiques et a obtenu un spécialiste. Alibaba a fait le choix inverse et a misé sur l’échelle. Les deux réponses sont publiées, et l’écart entre ce que coûte le téléchargement et ce que coûte l’API est le moyen honnête de choisir entre elles.

A screenshot of the microsoft/FrogNano GitHub repository README showing the description that FrogNano evaluates coding agents with the Leaf harness in isolated Kubernetes sandboxes against OpenAI-compatible endpoints and five tools Read, Write, Edit, Glob and Bash; the requirements list naming a Kubernetes cluster with pod and network-policy permissions and an OpenAI-compatible endpoint with reasoning and tool-call parsers configured for Qwen3.5; the frognano-eval run commands; and the benchmark table listing SWE-bench Verified at 500 tasks with an 8,192-token cap, SWE-bench Pro at 731 with 32,000, Terminal-Bench 2.0 Verified at 89 with 32,000 and PatchEval Verified at 230 with 8,192.

Comparés dans cet article1

Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement