Een gegenereerde titelkaart met de tekst 'FrogNano-4B-2609 vs Intern-Decision-4B', met de ondertitel 'dezelfde Qwen3.5-4B-voorouder, twee tegengestelde outputs', drie chips met de tekst 'toolaanroepen en patches', 'één symbool per veld' en 'geen van beide onafhankelijk gescoord', een voettekst met de tekst 'Beide scoreborden zijn door de leverancier gerapporteerd; geen enkele derde partij heeft een van beide gereproduceerd', en het OrcaRouter-logo dat in de rechteronderhoek is gecomponeerd.
Guides & Insights

FrogNano-4B-2609 vs Intern Decision 4B: één basismodel, twee totaal verschillende gokken

Auteur

Gideon Frost

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen →
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Twee labs namen dezelfde checkpoint, Qwen3.5-4B, en duwden die in richtingen die niet op elkaar lijken. microsoft/FrogNano-4B-2609 werd via reinforcement learning bijgetraind op ongeveer 1.500 synthetische software-engineeringomgevingen totdat het gestructureerde toolaanroepen en patches over meerdere bestanden kon uitsturen via een harness met vijf tools. internlm/Intern-Decision-4B werd fijn afgestemd om helemaal geen tekst te produceren — het neemt een toestand plus een schema van benoemde vragen en retourneert in één forward pass een gekalibreerde waarschijnlijkheid voor elke optie. De ene schrijft code. De andere weigert iets te schrijven en retourneert een verdeling. Ze op kwaliteit vergelijken is zinloos; ze vergelijken op wat ze je kosten om te draaien en wat je aan ze kunt toevertrouwen is de eerlijke exercitie.

Beide zijn zonder aankondiging uitgekomen, wat het andere is dat ze gemeen hebben. Geen van beide heeft een vermelding in Artificial Analysis, een arena-rating of zelfs maar één onafhankelijke evaluatie. Elk cijfer hieronder — de SWE-bench-ladder aan de ene kant, de Brier- en ECE-calibratierijen aan de andere — is geproduceerd door het lab dat het model heeft getraind, op de eigen testomgeving van dat lab, en is nooit een testset tegengekomen waar het niet zelf uit afkomstig was.

De splitsing vond plaats voordat een van beide modellen bestond.

Het basischeckpoint is een dense hybride model met 32 lagen, Gated DeltaNet en gated attention, en beide afgeleiden erven hetzelfde skelet. Daarna hebben de twee post-trainingpijplijnen niets meer gemeen.

De pipeline van Microsoft is een gesloten lus. TaskPilot genereert kandidaat-repositorytaken uit echte snapshots, voert rollouts uit vanaf het huidige checkpoint om taken te vinden die het beleid soms oplost, behoudt die en traint. Vijf iteraties, elk gekalibreerd tegen het beleid van de vorige iteratie, eindigend op 61,5% op SWE-bench Verified en 37,6% op SWE-bench Pro. Geen distillatie — de kaart vermeldt dat er geen trajecten, acties of redeneersporen van sterkere modellen als doelen zijn gebruikt.

De pipeline van InternLM is één enkele gesuperviseerde doelstelling voor een vaste taakvorm. Het model krijgt een systeemprompt, een toestand, een beslissingsschema en een volledig JSON-skelet voor de assistent met één plaatsaanduiding per veld. Er wordt één causale forward pass uitgevoerd, de logits op elke positie van een plaatsaanduiding worden gelezen, en er wordt een softmax genomen over alleen de toegestane kandidaatsymbolen van dat veld. De modelkaart van InternLM zegt het ronduit: dit pad "roept generate() niet aan en bemonstert geen vrije tekst."

Dat verschil is geen schaalverschil. Het is een verschil in wat het artefact nu eigenlijk is. FrogNano-4B-2609 is een agent die op honderd interessante manieren fout kan zijn en door tests gecorrigeerd kan worden. Intern-Decision-4B is een scorer wiens faalmodus een zelfverzekerd getal is.

Twee contracten, en geen van beide is "een prompt verzenden"

Het contract van FrogNano is een lus. Het model stuurt aanroepen naar Read, Write, Edit, Glob en Bash; de Leaf-harness voert ze uit in een geïsoleerde repository-sandbox en retourneert de uitvoer; de lus gaat door totdat het model stopt met aanroepen. Evaluaties liepen op 150 stappen binnen ongeveer 131K gecombineerde tokens, met tot 8.192 gegenereerde tokens per assistentbeurt. Voor het serveren is SGLang nodig met een Qwen3 reasoning-parser en een Qwen3 coder tool-call-parser — doe dat verkeerd en het model produceert proza waar de harness JSON verwacht, wat van buitenaf precies op een kapot model lijkt.

Het contract van Intern-Decision-4B is één shot met een harde grens. Vragen en opties behouden hun volgorde. Opties worden afgebeeld op symbolen van één token — A tot Z, a tot z, 0 tot 9, wat de rekenkundige reden is dat een vraag maximaal 62 opties heeft. Het plafond van de wrapper is 8.192 tokens en de kaart van InternLM is expliciet dat langere inputs worden geweigerd zonder truncatie. Drie vraagtypes worden ondersteund: choice met een geordende criteria-map, score met een lijst of een map met numerieke sleutels, en noul, een binaire vraag. Maximaal acht afbeeldingen zijn toegestaan en hun tokens tellen mee voor dezelfde 8.192.

• Uitvoervorm — FrogNano-4B-2609 zendt tool-aanroepen, redeneringstekst en een patch uit. Intern-Decision-4B zendt één symbool per veld uit en niets anders.

• Determinisme — FrogNano samplet bij temperatuur 0,6 over drie seeds, dus het is per ontwerp probabilistisch. De argmax van Intern-Decision-4B wordt bepaald door de forward pass; de gefitte temperatuur verschuift alleen de confidence ervan.

• Faaloppervlak — FrogNano kan een API hallucineren, een wijziging te ruim maken, of tests doorstaan terwijl het een kwetsbaarheid introduceert, die allemaal in zijn kaart worden genoemd. Intern-Decision-4B kan geen antwoord hallucineren, omdat het alleen kan kiezen uit opties die je hebt aangeleverd — het kan alleen slecht gekalibreerd zijn.

• Invoerplafond — ruwweg 131K gecombineerde tokens voor FrogNano in de geëvalueerde configuratie, tegenover een hard maximum van 8.192 voor Intern-Decision-4B, wat een factor zestien is en er is geen workaround.

Kostenstructuur — FrogNano factureert per traject, en trajecten zijn lang. Intern-Decision-4B heeft helemaal geen outputtokens om af te rekenen.

• Parameters — de FrogNano-kaart geeft een "500M-5B"-band en beschrijft ongeveer 4,66B, met een 9,32 GB BF16-download; Intern-Decision-4B wordt vermeld als 4,54B met een visietoren van 612 MB en een projector van 54 MB naast zijn taal-shards.

Het getal dat deze combinatie bepaalt

De modelkaart van InternLM zet Intern-Decision-4B op 44,16 ms gemiddelde latentie en 44,03 ms mediaan op één RTX 4090 via het lokale Hugging Face-pad, met een P95 van 44,60 ms. Lees die spreiding nog eens: van mediaan tot staart is ruim onder een milliseconde, omdat een forward pass met vaste vorm bijna niets heeft om te variëren. Dat is het hele argument voor de architectuur.

Het overeenkomstige cijfer van FrogNano is niet in milliseconden. De evaluaties ervan stonden een budget van 150 stappen toe met een agent-plafond van 10.800 seconden per taak. Dat zijn geen vergelijkbare eenheden en ze zouden nooit in dezelfde zin als een latentieclaim mogen staan — maar ze vertellen je wel de vorm van de afweging. Het ene model beantwoordt een beslissing in vierenveertig milliseconden en het andere besteedt minuten aan tool calls om een patch achterna te jagen. Als je probleem is "route dit ticket naar een van de zes wachtrijen en vertel me hoe zeker je bent", dan is de eerste geen goedkopere versie van de tweede, het is een andere machine.

Beide labs hebben zichzelf zorgvuldig gemeten, en beide sets metingen moeten worden gelezen als intenties in plaats van resultaten. InternLM rapporteert een gemiddelde over zeven sets van 90,02 met een Brier-score van 0,347 en een verwachte kalibratiefout van 0,065, gefit bij een temperatuur van 1,99241824 op 1.728 aangewezen kalibratiecases. Microsoft rapporteert een stijging over vijf iteraties van 39,4% naar 61,5% op SWE-bench Verified, en de appendix van hetzelfde artikel rapporteert diezelfde progressie als 48,2%, 53,4%, 58,3%, 58,6% en 61,6% — een herinnering dat zelfs binnen één lab hetzelfde feit, op twee manieren gemeten, twee ladders oplevert.

A generated two-column scoreboard titled 'FrogNano-4B-2609 vs Intern-Decision-4B'. The left column reads Output tool calls and patch, Latency minutes per trajectory, Context about 131K evaluated, Independent evals none, Base Qwen3.5-4B, and Score 61.5% SWE-bench Verified vendor. The right column reads Output one symbol per field, Latency 44.16 ms mean, Context 8,192 tokens rejected above, Independent evals none, Base Qwen3.5-4B, and Score 90.02 seven-set average vendor. A footer reads 'Both scoreboards vendor-reported; no third party has reproduced either.'

Het verraad zit in waar elke kaart ervoor kiest je voor te waarschuwen.

Beide kaarten zijn ongewoon eerlijk, en die eerlijkheid wijst in tegengestelde richtingen — wat het nuttigste is aan deze vergelijking.

De bekende beperkingen van Microsoft lezen als een deploymentwaarschuwing. Engels en alleen Engels. Prestaties zijn gevoelig voor de kwaliteit van de harness en de tests. Patches die onjuist of onveilig kunnen zijn, ondanks dat ze hun tests doorstaan. De kaart stelt in zijn eigen bewoordingen dat FrogNano "niet als onafhankelijk veiligheidsafgestemd mag worden beschouwd voor onbeperkte deployment", en noemt de specifieke leemte: de agentspecifieke posttraining gebruikte geen veiligheidsrelevante, weigerings- of adversariële data, omdat deze in plaats daarvan optimaliseerde voor functionele correctheid en het vermijden van regressies. Het noemt ook uit eigen beweging het parallelle toolaanroeppercentage van 1,71%, wat betekent dat het model bijna nooit twee tools in één beurt aanroept, hoewel de harness dit toestaat — een echte capaciteitsregressie ten opzichte van het basismodel, waarvoor het team een consolidatiefase heeft toegevoegd om die te proberen te herstellen.

De kaart van InternLM waarschuwt voor de tegenovergestelde categorie zaken. Er is geen hallucinatieoppervlak om voor te waarschuwen, dus de kanttekeningen gaan over inputs: de 8.192-afwijzing, het plafond van 62 opties, het feit dat de onderliggende teksttoren een positielimiet van 262.144 tokens opgeeft die de uitgebrachte wrapper weigert te gebruiken. Het risico is dat een met vertrouwen gepresenteerd getal meer wordt vertrouwd dan het verdient, en de kaart is openhartig dat de kalibratie een kloof met de Jev-baseline verkleint zonder die op elke slice te dichten.

Samen gelezen beschrijven ze twee verschillende vertrouwenshoudingen. FrogNano heeft toezicht nodig omdat het handelt. Intern-Decision-4B heeft een audit nodig omdat het scoort — en een getal dat een productiebeslissing beïnvloedt, is precies het soort output waarvan niemand zou bedenken om het te testen.

Waar een router past, en een eerlijke noot over beide

Geen van beide modellen is een gehost endpoint. FrogNano wordt geleverd als gewichten plus een Kubernetes-evaluatieharnas; Intern-Decision-4B wordt geleverd als een Python-klasse die je importeert nadat je vier shards hebt gedownload. Voor een team dat een van beide voor iets echts wil uitproberen, is het veilige patroon voor beide hetzelfde en het is niet glamoureus: zet de experimentele component achter een fallback, zodat een slecht traject of een slecht gekalibreerde dag een retry kost in plaats van een incident.

Dat patroon is waar een routeringslaag voor dient. OrcaRouter draait meer dan 200 modellen achter één OpenAI-compatibele sleutel tegen 0% opslag — de lijstprijs van de provider wordt doorgegeven, dus een prijswijziging van een leverancier komt dezelfde dag nog bij ons terecht — en de failover staat vóór het algemene model waarop je terugvalt, niet vóór deze twee. Simpel gezegd: we bieden FrogNano-4B-2609 of Intern-4B niet aan, en voor geen van beide is er een datum. Wat één endpoint je hier oplevert, is dat de verbinding zelf goedkoop wordt — één credential, één facturatieregel, en geen tweede integratie elke keer dat je het algemene model waarmee je de specialist benchmarkt, verwisselt.

A screenshot of the internlm/Intern-Decision-4B model card on Hugging Face showing the model heading and the Qwen3.5-4B base-model line, the five-step explanation of how inference works (single-token symbol mapping, one causal forward pass, a softmax over each field's allowed symbols and the checkpoint's probability calibration), the Benchmark results table listing Intern-Decision-0.8B, Intern-Decision-2B and Intern-Decision-4B against the Jev, Laya, SemIf, Kev and JevK5 comparison rows, and the inference latency table with the 4B row at 44.16 ms mean, 44.03 ms median and 44.60 ms P95.

Welke, en wanneer?

Gebruik Intern-Decision-4B wanneer het antwoord al in je prompt staat en je het gekozen wilt hebben, met een bijbehorende zekerheidsscore, met een snelheid van duizenden per seconde. Routing met vaste taxonomie, scoring aan de hand van rubrieken, extractie met schemabeperkingen, moderatie tegen een gesloten labelset. De forward pass van 44 milliseconden en de rekening van nul outputtokens zijn het product, en de calibratie is wat je moet auditen voordat je erop vertrouwt.

Neem FrogNano-4B-2609 wanneer het antwoord nog niet bestaat en ontdekt moet worden door een repository te lezen en de tests ervan uit te voeren. Dat is een minutenlang, in een sandbox uitgevoerd, beoordeelbaar proces, en de 61,5% op SWE-bench Verified — door de leverancier gerapporteerd, niet gereproduceerd — is het huidige beste bewijs dat een 4B-checkpoint dit überhaupt kan.

Wat in geen geval mag gebeuren, is de gewoonte om hun scores te vergelijken. Een gemiddelde van 90,02 over zeven sets en een SWE-bench Verified-score van 61,5 zijn metingen van twee verschillende vragen, geproduceerd door twee labs, op twee evaluatieraamwerken, en geen van beide cijfers is door de handen van een derde partij gegaan. Ze delen een voorouder en verder niets.

A screenshot of the file listing for the microsoft/FrogNano-4B-2609 repository on Hugging Face showing the model header with its size and the Safetensors, qwen3_5 and license:mit tags, the two safetensors shards model-00000-of-00002 and model-00001-of-00002, the config, tokenizer, vocab, merges, chat template and preprocessor files, and the commit column listing 'Update README.md', 'Upload FrogNano 4B SWE checkpoint' and 'Update FrogNano 4B README.md' across two contributors and four commits.

De enige echt nuttige voorspelling uit de gemeenschappelijke voorouder: omdat beide modellen vanaf hetzelfde 4B-checkpoint vertrekken, zit het verschil tussen hen vrijwel volledig in de post-training, wat betekent dat de interessante vraag voor iedereen die op Qwen3.5-4B voortbouwt, is welke van deze twee beloningsstructuren naar hun eigen domein overdraagt. Een synthetische taaklus die tegen zijn eigen beleid kalibreert, of een scoring-head met vaste vorm en een gefitte temperatuur. Dat zijn twee recepten, beide gepubliceerd, beide van labs die nog niemand anders ze hebben laten draaien. Dat is een zeldzame situatie en de moeite waard om te volgen in plaats van erin mee te gaan.