
FrogNano-4B-2609 vs Intern Decision 4B : un seul modèle de base, deux paris entièrement différents
- openaiNOUVEAUOpenAI: GPT-6.1 Sol2026-09-2952Intelligence
- anthropicNOUVEAUAnthropic: Claude Sonnet 5.52026-09-2856Intelligence
- typesafeNOUVEAUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 par million de tokens · 219 tok/s
- OpenAINOUVEAUOpenAI: GPT-6 Luna2026-09-2238Intelligence
- OpenAINOUVEAUOpenAI: GPT-6 Sol2026-09-2248Intelligence
- AnthropicNOUVEAUAnthropic: Claude Opus 5.52026-09-2258Intelligence
- xAINOUVEAUGrok 4.72026-09-2146Intelligence
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 par million de tokens · 114 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens · 1064 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 par million de tokens · 41 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens · 105 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens · 213 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
Deux laboratoires ont pris le même checkpoint, Qwen3.5-4B, et l'ont poussé dans des directions qui ne se ressemblent pas. microsoft/FrogNano-4B-2609 a été post-entraîné par apprentissage par renforcement sur environ 1 500 environnements synthétiques d'ingénierie logicielle jusqu'à pouvoir émettre des appels d'outils structurés et des patchs multi-fichiers via un harnais à cinq outils. internlm/Intern-Decision-4B a été affiné pour n'émettre aucun texte — il prend un état plus un schéma de questions nommées et renvoie une probabilité calibrée pour chaque option en une seule passe avant. L'un écrit du code. L'autre refuse d'écrire quoi que ce soit et renvoie une distribution. Les comparer sur la qualité n'a pas de sens ; les comparer sur ce qu'ils vous coûtent à exécuter et ce à quoi on peut leur faire confiance est l'exercice honnête.
Les deux sont sortis sans annonce, ce qui est l'autre point qu'ils ont en commun. Aucun des deux n'a de fiche sur Artificial Analysis, de note d'arène, ni la moindre évaluation indépendante. Chaque chiffre ci-dessous — l'échelle SWE-bench d'un côté, les lignes de calibration Brier et ECE de l'autre — a été produit par le laboratoire qui a entraîné le modèle, sur le propre harnais de ce laboratoire, et n'a jamais rencontré de jeu de test dont il ne provenait pas.
Le fork a eu lieu avant qu’aucun des deux modèles n’existe.
Le checkpoint de base est un modèle hybride dense à 32 couches combinant Gated DeltaNet et attention à porte, et les deux dérivés en héritent le squelette. Ensuite, les deux pipelines de post-entraînement n'ont plus rien en commun.
Le pipeline de Microsoft est une boucle fermée. TaskPilot génère des tâches de dépôt candidates à partir d’instantanés réels, exécute des rollouts depuis le point de contrôle actuel pour trouver celles que la politique résout parfois, conserve celles-ci et entraîne. Cinq itérations, chacune calibrée par rapport à la politique de l’itération précédente, aboutissant à 61,5 % sur SWE-bench Verified et 37,6 % sur SWE-bench Pro. Aucune distillation — la fiche indique qu’aucune trajectoire, action ou trace de raisonnement d’un modèle plus fort n’a été utilisée comme cible.
Le pipeline d'InternLM est un objectif supervisé unique sur une forme de tâche fixe. Le modèle reçoit une invite système, un état, un schéma de décision et un squelette JSON complet de l'assistant avec un espace réservé par champ. Il exécute une seule passe avant causale, lit les logits à chaque position d'espace réservé et applique un softmax uniquement sur les symboles candidats autorisés pour ce champ. La fiche d'InternLM le dit sans détour : cette voie « n'appelle pas generate() ni n'échantillonne de texte libre. »
Cette différence n'est pas une différence d'échelle. C'est une différence dans ce qu'est l'artefact lui-même. FrogNano-4B-2609 est un agent qui peut se tromper de cent façons intéressantes et être corrigé par des tests. Intern-Decision-4B est un scoreur dont le mode de défaillance est un nombre plein d'assurance.
Deux contrats, et aucun des deux n’est « envoyer un prompt »
Le contrat de FrogNano est une boucle. Le modèle émet des appels à Read, Write, Edit, Glob et Bash ; le harnais Leaf les exécute dans un bac à sable de dépôt isolé et renvoie la sortie ; la boucle continue jusqu'à ce que le modèle arrête d'appeler. Les évaluations se sont déroulées sur 150 étapes, avec environ 131 K tokens combinés, et jusqu'à 8 192 tokens générés par tour d'assistant. Pour le service, il faut SGLang avec un analyseur de raisonnement Qwen3 et un analyseur d'appels d'outils Qwen3 coder — si vous vous trompez, le modèle produit de la prose là où le harnais attend du JSON, ce qui, vu de l'extérieur, ressemble exactement à un modèle défectueux.
Le contrat d'Intern-Decision-4B se joue en une seule tentative, avec une limite stricte. Les questions et les options conservent leur ordre. Les options sont associées à des symboles à un seul token — A à Z, puis a à z, puis 0 à 9, ce qui est la raison arithmétique pour laquelle une question plafonne à 62 options. Le plafond du wrapper est de 8 192 tokens et la fiche d'InternLM précise explicitement que les entrées plus longues sont rejetées sans troncature. Trois types de questions sont pris en charge : choice avec une table de critères ordonnée, score avec une liste ou une table à clés numériques, et noul, un binaire. Jusqu'à huit images sont autorisées et leurs tokens sont comptabilisés dans le même 8 192.
• Forme de sortie — FrogNano-4B-2609 émet des appels d’outils, du texte de raisonnement et un correctif. Intern-Decision-4B émet un symbole par champ et rien d’autre.
• Déterminisme — FrogNano échantillonne à une température de 0,6 sur trois graines, il est donc probabiliste par conception. L’argmax d’Intern-Decision-4B est fixé par la passe avant ; la température ajustée ne modifie que sa confiance.
• Surface de défaillance — FrogNano peut halluciner une API, élargir outrancièrement une modification, ou réussir des tests tout en introduisant une vulnérabilité, autant de choses que sa fiche mentionne. Intern-Decision-4B ne peut pas halluciner une réponse, car il ne peut que choisir parmi les options que vous avez fournies — il peut seulement être mal calibré.
• Plafond d’entrée — environ 131K tokens combinés pour FrogNano dans sa configuration évaluée, contre un maximum absolu de 8 192 pour Intern-Decision-4B, soit un facteur de seize, et il n’existe aucune solution de contournement.
• Profil de coût — FrogNano facture à la trajectoire, et les trajectoires sont longues. Intern-Decision-4B n'a aucun token de sortie à facturer.
• Paramètres — la fiche FrogNano donne une plage « 500M-5B » et décrit environ 4,66 B, avec un téléchargement BF16 de 9,32 Go ; Intern-Decision-4B est indiqué à 4,54 B, avec une tour de vision de 612 Mo et un projecteur de 54 Mo, aux côtés de ses fragments linguistiques.
Le nombre qui décide de cet appariement
La fiche d'InternLM situe Intern-Decision-4B à 44,16 ms de latence moyenne et 44,03 ms de médiane sur une seule RTX 4090 via le chemin local de Hugging Face, avec un P95 de 44,60 ms. Relisez cet écart : l'écart entre la médiane et la queue est bien inférieur à une milliseconde, car une passe avant à forme fixe n'a presque rien à faire varier. Voilà tout l'argument en faveur de l'architecture.
Le chiffre correspondant de FrogNano n'est pas en millisecondes. Ses évaluations autorisaient un budget de 150 étapes avec un plafond d'agent de 10 800 secondes par tâche. Ce ne sont pas des unités comparables et elles ne devraient jamais figurer dans la même phrase qu'une affirmation de latence — mais elles vous indiquent la forme du compromis. Un modèle répond à une décision en quarante-quatre millisecondes et l'autre passe des minutes d'appels d'outils à courir après un correctif. Si votre problème est « acheminez ce ticket vers l'une des six files d'attente et dites-moi à quel point vous êtes sûr », le premier n'est pas une version moins chère du second, c'est une machine différente.
Les deux laboratoires se sont mesurés avec soin, et les deux ensembles de mesures doivent être interprétés comme des intentions plutôt que comme des résultats. InternLM rapporte une moyenne sur sept ensembles de 90,02, avec un score de Brier de 0,347 et une erreur de calibration attendue de 0,065, ajustée à une température de 1,99241824 sur 1 728 cas de calibration désignés. Microsoft rapporte une progression en cinq itérations de 39,4 % à 61,5 % sur SWE-bench Verified, et l’annexe du même article rapporte cette même progression sous la forme de 48,2 %, 53,4 %, 58,3 %, 58,6 % et 61,6 % — un rappel que, même au sein d’un seul laboratoire, le même fait mesuré de deux manières produit deux échelles.

L'indice réside dans ce dont chaque carte choisit de vous avertir.
Les deux cartes sont d'une honnêteté inhabituelle, et cette honnêteté pointe dans des directions opposées — ce qui est la chose la plus utile dans cette comparaison.
La section des limitations connues de Microsoft se lit comme un avertissement de déploiement. Anglais et Python uniquement. Performances sensibles à la qualité du harnais et des tests. Des correctifs qui peuvent être incorrects ou non sécurisés bien qu’ils passent leurs tests. La fiche elle-même affirme que FrogNano « ne doit pas être considéré comme aligné en matière de sécurité de façon indépendante pour un déploiement autonome sans restriction », et elle précise la lacune spécifique : le post-entraînement spécifique à l’agent n’a utilisé aucune donnée de préférence de sécurité, de refus ou adversariale, car il a plutôt été optimisé pour la correction fonctionnelle et l’évitement des régressions. Elle mentionne aussi spontanément le taux de 1,71 % d’appels d’outils en parallèle, ce qui signifie que le modèle ne déclenche presque jamais deux outils en un seul tour alors que le harnais le permet — une véritable régression des capacités par rapport au modèle de base, que l’équipe a tenté de rattraper en ajoutant une étape de consolidation.
La fiche d’InternLM met en garde contre la catégorie opposée de problème. Il n’y a pas de surface d’hallucination à signaler, donc les réserves portent sur les entrées : le rejet à 8 192, le plafond de 62 options, le fait que la tour de texte sous-jacente déclare une limite de position de 262 144 tokens que l’enveloppe publiée refuse d’utiliser. Son risque est qu’un chiffre annoncé avec assurance soit cru au-delà de ce qu’il mérite, et la fiche reconnaît franchement que la calibration réduit un écart avec la baseline Jev sans le combler sur chaque tranche.
Lus ensemble, ils décrivent deux postures de confiance différentes. FrogNano a besoin d’une supervision parce qu’il agit. Intern-Decision-4B a besoin d’un audit parce qu’il attribue des scores — et un chiffre qui influence une décision de production est exactement le genre de résultat que personne ne pense à tester.
Où un routeur trouve sa place, et une note honnête sur les deux
Aucun des deux modèles n'est un point de terminaison hébergé. FrogNano est livré sous forme de poids, plus un harnais d'évaluation Kubernetes ; Intern-Decision-4B est livré sous forme de classe Python que l'on importe après avoir téléchargé quatre shards. Pour une équipe qui souhaite essayer l'un ou l'autre face à quelque chose de réel, le schéma sûr est le même pour les deux, et il n'a rien de glamour : placer le composant expérimental derrière un mécanisme de repli, afin qu'une mauvaise trajectoire ou une journée mal calibrée coûte une nouvelle tentative plutôt qu'un incident.
Ce schéma, c'est précisément le rôle d'une couche de routage. OrcaRouter fait tourner plus de 200 modèles derrière une seule clé compatible OpenAI avec 0 % de marge — le prix catalogue du fournisseur répercuté tel quel, si bien qu'un changement de tarif d'un fournisseur nous parvient le jour même — et son basculement automatique se situe devant le modèle général vers lequel vous retombez, pas devant ces deux-là. Pour être clair : nous ne proposons ni FrogNano-4B-2609 ni Intern-Decision-4B, et aucune date n'est prévue pour l'un comme pour l'autre. Ce qu'un point de terminaison unique vous apporte ici, c'est que la comparaison elle-même devient bon marché — un seul identifiant, une seule ligne de facturation, et pas de deuxième intégration chaque fois que vous changez le modèle général au regard duquel vous évaluez le spécialiste.

Lequel, et quand
Choisissez Intern-Decision-4B lorsque la réponse existe déjà dans votre prompt et que vous avez besoin qu’elle soit sélectionnée, avec un score de confiance associé, à un rythme de milliers par seconde. Routage à taxonomie fixe, notation par rubrique, extraction contrainte par schéma, modération par rapport à un ensemble fermé de libellés. La passe avant de 44 millisecondes et la facturation nulle en tokens de sortie constituent le produit, et la calibration est l’élément à auditer avant de lui faire confiance.
Prenez FrogNano-4B-2609 lorsque la réponse n'existe pas encore et doit être découverte en lisant un dépôt et en exécutant ses tests. C'est un processus de plusieurs minutes, en sandbox, vérifiable, et les 61,5 % sur SWE-bench Verified — rapportés par l'éditeur, non reproduits — constituent la meilleure preuve actuelle qu'un checkpoint de 4B puisse y parvenir tout court.
Ce qui ne devrait passer ni d'un côté ni de l'autre, c'est l'habitude de comparer leurs scores. Une moyenne de 90,02 sur sept ensembles et un taux de 61,5 sur SWE-bench Verified sont les mesures de deux questions différentes, produites par deux laboratoires, sur deux harnais d'évaluation, et aucun de ces deux chiffres n'est passé entre les mains d'un tiers. Ils partagent un ancêtre et rien d'autre.

La seule prédiction réellement utile issue de l’ancêtre commun : comme les deux modèles partent du même checkpoint 4B, la différence entre eux réside presque entièrement dans le post-entraînement, ce qui signifie que la question intéressante pour quiconque développe sur Qwen3.5-4B est de savoir laquelle de ces deux structures de récompense se transpose à son propre domaine. Une boucle de tâches synthétiques qui se calibre sur sa propre politique, ou une tête de notation à forme fixe avec une température ajustée. Ce sont deux recettes, toutes deux publiées, toutes deux issues de laboratoires qui n’ont encore laissé personne d’autre les exécuter. C’est une situation rare, qui mérite d’être observée plutôt que d’y souscrire.
