Une carte de titre générée indiquant « FrogNano-4B-2609 vs Intern-Decision-4B » avec le sous-titre « le même ancêtre Qwen3.5-4B, deux sorties opposées », trois pastilles indiquant « appels d'outils et correctifs », « un symbole par champ » et « ni l'un ni l'autre évalué indépendamment », un pied de page indiquant « Les deux tableaux de scores sont rapportés par le fournisseur ; aucun tiers n'a reproduit ni l'un ni l'autre », et le logo OrcaRouter incrusté dans le coin inférieur droit.
Guides & Insights

FrogNano-4B-2609 vs Intern Decision 4B : un seul modèle de base, deux paris entièrement différents

Auteur

Gideon Frost

Date de publication

Derniers modèles · 20Voir tous les modèles →
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Deux laboratoires ont pris le même checkpoint, Qwen3.5-4B, et l'ont poussé dans des directions qui ne se ressemblent pas. microsoft/FrogNano-4B-2609 a été post-entraîné par apprentissage par renforcement sur environ 1 500 environnements synthétiques d'ingénierie logicielle jusqu'à pouvoir émettre des appels d'outils structurés et des patchs multi-fichiers via un harnais à cinq outils. internlm/Intern-Decision-4B a été affiné pour n'émettre aucun texte — il prend un état plus un schéma de questions nommées et renvoie une probabilité calibrée pour chaque option en une seule passe avant. L'un écrit du code. L'autre refuse d'écrire quoi que ce soit et renvoie une distribution. Les comparer sur la qualité n'a pas de sens ; les comparer sur ce qu'ils vous coûtent à exécuter et ce à quoi on peut leur faire confiance est l'exercice honnête.

Les deux sont sortis sans annonce, ce qui est l'autre point qu'ils ont en commun. Aucun des deux n'a de fiche sur Artificial Analysis, de note d'arène, ni la moindre évaluation indépendante. Chaque chiffre ci-dessous — l'échelle SWE-bench d'un côté, les lignes de calibration Brier et ECE de l'autre — a été produit par le laboratoire qui a entraîné le modèle, sur le propre harnais de ce laboratoire, et n'a jamais rencontré de jeu de test dont il ne provenait pas.

Le fork a eu lieu avant qu’aucun des deux modèles n’existe.

Le checkpoint de base est un modèle hybride dense à 32 couches combinant Gated DeltaNet et attention à porte, et les deux dérivés en héritent le squelette. Ensuite, les deux pipelines de post-entraînement n'ont plus rien en commun.

Le pipeline de Microsoft est une boucle fermée. TaskPilot génère des tâches de dépôt candidates à partir d’instantanés réels, exécute des rollouts depuis le point de contrôle actuel pour trouver celles que la politique résout parfois, conserve celles-ci et entraîne. Cinq itérations, chacune calibrée par rapport à la politique de l’itération précédente, aboutissant à 61,5 % sur SWE-bench Verified et 37,6 % sur SWE-bench Pro. Aucune distillation — la fiche indique qu’aucune trajectoire, action ou trace de raisonnement d’un modèle plus fort n’a été utilisée comme cible.

Le pipeline d'InternLM est un objectif supervisé unique sur une forme de tâche fixe. Le modèle reçoit une invite système, un état, un schéma de décision et un squelette JSON complet de l'assistant avec un espace réservé par champ. Il exécute une seule passe avant causale, lit les logits à chaque position d'espace réservé et applique un softmax uniquement sur les symboles candidats autorisés pour ce champ. La fiche d'InternLM le dit sans détour : cette voie « n'appelle pas generate() ni n'échantillonne de texte libre. »

Cette différence n'est pas une différence d'échelle. C'est une différence dans ce qu'est l'artefact lui-même. FrogNano-4B-2609 est un agent qui peut se tromper de cent façons intéressantes et être corrigé par des tests. Intern-Decision-4B est un scoreur dont le mode de défaillance est un nombre plein d'assurance.

Deux contrats, et aucun des deux n’est « envoyer un prompt »

Le contrat de FrogNano est une boucle. Le modèle émet des appels à Read, Write, Edit, Glob et Bash ; le harnais Leaf les exécute dans un bac à sable de dépôt isolé et renvoie la sortie ; la boucle continue jusqu'à ce que le modèle arrête d'appeler. Les évaluations se sont déroulées sur 150 étapes, avec environ 131 K tokens combinés, et jusqu'à 8 192 tokens générés par tour d'assistant. Pour le service, il faut SGLang avec un analyseur de raisonnement Qwen3 et un analyseur d'appels d'outils Qwen3 coder — si vous vous trompez, le modèle produit de la prose là où le harnais attend du JSON, ce qui, vu de l'extérieur, ressemble exactement à un modèle défectueux.

Le contrat d'Intern-Decision-4B se joue en une seule tentative, avec une limite stricte. Les questions et les options conservent leur ordre. Les options sont associées à des symboles à un seul token — A à Z, puis a à z, puis 0 à 9, ce qui est la raison arithmétique pour laquelle une question plafonne à 62 options. Le plafond du wrapper est de 8 192 tokens et la fiche d'InternLM précise explicitement que les entrées plus longues sont rejetées sans troncature. Trois types de questions sont pris en charge : choice avec une table de critères ordonnée, score avec une liste ou une table à clés numériques, et noul, un binaire. Jusqu'à huit images sont autorisées et leurs tokens sont comptabilisés dans le même 8 192.

• Forme de sortie — FrogNano-4B-2609 émet des appels d’outils, du texte de raisonnement et un correctif. Intern-Decision-4B émet un symbole par champ et rien d’autre.

• Déterminisme — FrogNano échantillonne à une température de 0,6 sur trois graines, il est donc probabiliste par conception. L’argmax d’Intern-Decision-4B est fixé par la passe avant ; la température ajustée ne modifie que sa confiance.

• Surface de défaillance — FrogNano peut halluciner une API, élargir outrancièrement une modification, ou réussir des tests tout en introduisant une vulnérabilité, autant de choses que sa fiche mentionne. Intern-Decision-4B ne peut pas halluciner une réponse, car il ne peut que choisir parmi les options que vous avez fournies — il peut seulement être mal calibré.

• Plafond d’entrée — environ 131K tokens combinés pour FrogNano dans sa configuration évaluée, contre un maximum absolu de 8 192 pour Intern-Decision-4B, soit un facteur de seize, et il n’existe aucune solution de contournement.

• Profil de coût — FrogNano facture à la trajectoire, et les trajectoires sont longues. Intern-Decision-4B n'a aucun token de sortie à facturer.

• Paramètres — la fiche FrogNano donne une plage « 500M-5B » et décrit environ 4,66 B, avec un téléchargement BF16 de 9,32 Go ; Intern-Decision-4B est indiqué à 4,54 B, avec une tour de vision de 612 Mo et un projecteur de 54 Mo, aux côtés de ses fragments linguistiques.

Le nombre qui décide de cet appariement

La fiche d'InternLM situe Intern-Decision-4B à 44,16 ms de latence moyenne et 44,03 ms de médiane sur une seule RTX 4090 via le chemin local de Hugging Face, avec un P95 de 44,60 ms. Relisez cet écart : l'écart entre la médiane et la queue est bien inférieur à une milliseconde, car une passe avant à forme fixe n'a presque rien à faire varier. Voilà tout l'argument en faveur de l'architecture.

Le chiffre correspondant de FrogNano n'est pas en millisecondes. Ses évaluations autorisaient un budget de 150 étapes avec un plafond d'agent de 10 800 secondes par tâche. Ce ne sont pas des unités comparables et elles ne devraient jamais figurer dans la même phrase qu'une affirmation de latence — mais elles vous indiquent la forme du compromis. Un modèle répond à une décision en quarante-quatre millisecondes et l'autre passe des minutes d'appels d'outils à courir après un correctif. Si votre problème est « acheminez ce ticket vers l'une des six files d'attente et dites-moi à quel point vous êtes sûr », le premier n'est pas une version moins chère du second, c'est une machine différente.

Les deux laboratoires se sont mesurés avec soin, et les deux ensembles de mesures doivent être interprétés comme des intentions plutôt que comme des résultats. InternLM rapporte une moyenne sur sept ensembles de 90,02, avec un score de Brier de 0,347 et une erreur de calibration attendue de 0,065, ajustée à une température de 1,99241824 sur 1 728 cas de calibration désignés. Microsoft rapporte une progression en cinq itérations de 39,4 % à 61,5 % sur SWE-bench Verified, et l’annexe du même article rapporte cette même progression sous la forme de 48,2 %, 53,4 %, 58,3 %, 58,6 % et 61,6 % — un rappel que, même au sein d’un seul laboratoire, le même fait mesuré de deux manières produit deux échelles.

A generated two-column scoreboard titled 'FrogNano-4B-2609 vs Intern-Decision-4B'. The left column reads Output tool calls and patch, Latency minutes per trajectory, Context about 131K evaluated, Independent evals none, Base Qwen3.5-4B, and Score 61.5% SWE-bench Verified vendor. The right column reads Output one symbol per field, Latency 44.16 ms mean, Context 8,192 tokens rejected above, Independent evals none, Base Qwen3.5-4B, and Score 90.02 seven-set average vendor. A footer reads 'Both scoreboards vendor-reported; no third party has reproduced either.'

L'indice réside dans ce dont chaque carte choisit de vous avertir.

Les deux cartes sont d'une honnêteté inhabituelle, et cette honnêteté pointe dans des directions opposées — ce qui est la chose la plus utile dans cette comparaison.

La section des limitations connues de Microsoft se lit comme un avertissement de déploiement. Anglais et Python uniquement. Performances sensibles à la qualité du harnais et des tests. Des correctifs qui peuvent être incorrects ou non sécurisés bien qu’ils passent leurs tests. La fiche elle-même affirme que FrogNano « ne doit pas être considéré comme aligné en matière de sécurité de façon indépendante pour un déploiement autonome sans restriction », et elle précise la lacune spécifique : le post-entraînement spécifique à l’agent n’a utilisé aucune donnée de préférence de sécurité, de refus ou adversariale, car il a plutôt été optimisé pour la correction fonctionnelle et l’évitement des régressions. Elle mentionne aussi spontanément le taux de 1,71 % d’appels d’outils en parallèle, ce qui signifie que le modèle ne déclenche presque jamais deux outils en un seul tour alors que le harnais le permet — une véritable régression des capacités par rapport au modèle de base, que l’équipe a tenté de rattraper en ajoutant une étape de consolidation.

La fiche d’InternLM met en garde contre la catégorie opposée de problème. Il n’y a pas de surface d’hallucination à signaler, donc les réserves portent sur les entrées : le rejet à 8 192, le plafond de 62 options, le fait que la tour de texte sous-jacente déclare une limite de position de 262 144 tokens que l’enveloppe publiée refuse d’utiliser. Son risque est qu’un chiffre annoncé avec assurance soit cru au-delà de ce qu’il mérite, et la fiche reconnaît franchement que la calibration réduit un écart avec la baseline Jev sans le combler sur chaque tranche.

Lus ensemble, ils décrivent deux postures de confiance différentes. FrogNano a besoin d’une supervision parce qu’il agit. Intern-Decision-4B a besoin d’un audit parce qu’il attribue des scores — et un chiffre qui influence une décision de production est exactement le genre de résultat que personne ne pense à tester.

Où un routeur trouve sa place, et une note honnête sur les deux

Aucun des deux modèles n'est un point de terminaison hébergé. FrogNano est livré sous forme de poids, plus un harnais d'évaluation Kubernetes ; Intern-Decision-4B est livré sous forme de classe Python que l'on importe après avoir téléchargé quatre shards. Pour une équipe qui souhaite essayer l'un ou l'autre face à quelque chose de réel, le schéma sûr est le même pour les deux, et il n'a rien de glamour : placer le composant expérimental derrière un mécanisme de repli, afin qu'une mauvaise trajectoire ou une journée mal calibrée coûte une nouvelle tentative plutôt qu'un incident.

Ce schéma, c'est précisément le rôle d'une couche de routage. OrcaRouter fait tourner plus de 200 modèles derrière une seule clé compatible OpenAI avec 0 % de marge — le prix catalogue du fournisseur répercuté tel quel, si bien qu'un changement de tarif d'un fournisseur nous parvient le jour même — et son basculement automatique se situe devant le modèle général vers lequel vous retombez, pas devant ces deux-là. Pour être clair : nous ne proposons ni FrogNano-4B-2609 ni Intern-Decision-4B, et aucune date n'est prévue pour l'un comme pour l'autre. Ce qu'un point de terminaison unique vous apporte ici, c'est que la comparaison elle-même devient bon marché — un seul identifiant, une seule ligne de facturation, et pas de deuxième intégration chaque fois que vous changez le modèle général au regard duquel vous évaluez le spécialiste.

A screenshot of the internlm/Intern-Decision-4B model card on Hugging Face showing the model heading and the Qwen3.5-4B base-model line, the five-step explanation of how inference works (single-token symbol mapping, one causal forward pass, a softmax over each field's allowed symbols and the checkpoint's probability calibration), the Benchmark results table listing Intern-Decision-0.8B, Intern-Decision-2B and Intern-Decision-4B against the Jev, Laya, SemIf, Kev and JevK5 comparison rows, and the inference latency table with the 4B row at 44.16 ms mean, 44.03 ms median and 44.60 ms P95.

Lequel, et quand

Choisissez Intern-Decision-4B lorsque la réponse existe déjà dans votre prompt et que vous avez besoin qu’elle soit sélectionnée, avec un score de confiance associé, à un rythme de milliers par seconde. Routage à taxonomie fixe, notation par rubrique, extraction contrainte par schéma, modération par rapport à un ensemble fermé de libellés. La passe avant de 44 millisecondes et la facturation nulle en tokens de sortie constituent le produit, et la calibration est l’élément à auditer avant de lui faire confiance.

Prenez FrogNano-4B-2609 lorsque la réponse n'existe pas encore et doit être découverte en lisant un dépôt et en exécutant ses tests. C'est un processus de plusieurs minutes, en sandbox, vérifiable, et les 61,5 % sur SWE-bench Verified — rapportés par l'éditeur, non reproduits — constituent la meilleure preuve actuelle qu'un checkpoint de 4B puisse y parvenir tout court.

Ce qui ne devrait passer ni d'un côté ni de l'autre, c'est l'habitude de comparer leurs scores. Une moyenne de 90,02 sur sept ensembles et un taux de 61,5 sur SWE-bench Verified sont les mesures de deux questions différentes, produites par deux laboratoires, sur deux harnais d'évaluation, et aucun de ces deux chiffres n'est passé entre les mains d'un tiers. Ils partagent un ancêtre et rien d'autre.

A screenshot of the file listing for the microsoft/FrogNano-4B-2609 repository on Hugging Face showing the model header with its size and the Safetensors, qwen3_5 and license:mit tags, the two safetensors shards model-00000-of-00002 and model-00001-of-00002, the config, tokenizer, vocab, merges, chat template and preprocessor files, and the commit column listing 'Update README.md', 'Upload FrogNano 4B SWE checkpoint' and 'Update FrogNano 4B README.md' across two contributors and four commits.

La seule prédiction réellement utile issue de l’ancêtre commun : comme les deux modèles partent du même checkpoint 4B, la différence entre eux réside presque entièrement dans le post-entraînement, ce qui signifie que la question intéressante pour quiconque développe sur Qwen3.5-4B est de savoir laquelle de ces deux structures de récompense se transpose à son propre domaine. Une boucle de tâches synthétiques qui se calibre sur sa propre politique, ou une tête de notation à forme fixe avec une température ajustée. Ce sont deux recettes, toutes deux publiées, toutes deux issues de laboratoires qui n’ont encore laissé personne d’autre les exécuter. C’est une situation rare, qui mérite d’être observée plutôt que d’y souscrire.