
FrogNano-4B-2609 vs Intern Decision 4B: En basmodell, två helt olika satsningar
- openaiNYOpenAI: GPT-6.1 Sol2026-09-2952Intelligens
- anthropicNYAnthropic: Claude Sonnet 5.52026-09-2856Intelligens
- typesafeNYTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M tokens · 219 tok/s
- OpenAINYOpenAI: GPT-6 Luna2026-09-2238Intelligens
- OpenAINYOpenAI: GPT-6 Sol2026-09-2248Intelligens
- AnthropicNYAnthropic: Claude Opus 5.52026-09-2258Intelligens
- xAINYGrok 4.72026-09-2146Intelligens
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1M tokens · 114 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M tokens · 1064 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligens76Kodning
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M tokens · 41 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens · 105 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M tokens · 213 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
Två labb tog samma checkpoint, Qwen3.5-4B, och drev det i riktningar som inte liknar varandra. microsoft/FrogNano-4B-2609 eftertränades med förstärkningsinlärning på ungefär 1 500 syntetiska miljöer för programvaruteknik tills det kunde avge strukturerade verktygsanrop och patchar över flera filer genom ett ramverk med fem verktyg. internlm/Intern-Decision-4B finjusterades för att inte avge någon text alls — det tar ett tillstånd plus ett schema med namngivna frågor och returnerar en kalibrerad sannolikhet för varje alternativ i en enda framåtpassning. Den ena skriver kod. Den andra vägrar skriva något alls och returnerar en fördelning. Att jämföra dem utifrån kvalitet är meningslöst; att jämföra dem utifrån vad de kostar dig att köra och vad de kan anförtros är den ärliga övningen.
Båda släpptes utan tillkännagivande, vilket är det andra de har gemensamt. Ingen av dem har en Artificial Analysis-post, ett arena-betyg eller en enda oberoende utvärdering. Varje siffra nedan — SWE-bench-trappan på ena sidan, Brier- och ECE-kalibreringsraderna på den andra — producerades av laboratoriet som tränade modellen, i det laboratoriets egen testrigg, och har aldrig mött en testmängd som den inte kom från.
Forken inträffade innan någon av modellerna existerade.
Bascheckpointen är en tät 32-lagers hybridmodell av Gated DeltaNet och gated-attention, och båda derivaten ärver dess skelett. Efter det har de två efterträningspipelinerna ingenting gemensamt.
Microsofts pipeline är en sluten slinga. TaskPilot genererar kandidatuppgifter för repository utifrån verkliga ögonblicksbilder, kör rollouts från den aktuella checkpunkten för att hitta dem som policyn ibland löser, behåller dem och tränar. Fem iterationer, var och en kalibrerad mot föregående iterations policy, vilket slutar på 61,5 % på SWE-bench Verified och 37,6 % på SWE-bench Pro. Ingen destillation – kortet anger att inga trajektorier, åtgärder eller resonemangsspår från starkare modeller användes som mål.
InternLM:s pipeline är ett enda övervakat mål över en fast uppgiftsform. Modellen ges en systemprompt, en, ett beslutschema och ett komplett assistent-JSON-skelett med en platshållare per fält. Den kör en kausal framåtpassning, läser logitsen vid varje platshållares position och tar en softmax över endast det fältets tillåtna kandidatsymboler. InternLM:s kort säger det rakt ut: denna väg "anropar inte generate() eller samplar fritext."
Den skillnaden är inte en skillnad i skala. Det är en skillnad i vad artefakten ens är. FrogNano-4B-2609 är en agent som kan ha fel på hundra intressanta sätt och korrigeras av tester. Intern-Decision-4B är en poängsättare vars felmod är ett självsäkert tal.
Två kontrakt, och inget av dem är "skicka en prompt"
FrogNanos kontrakt är en loop. Modellen skickar anrop till Read, Write, Edit, Glob och Bash; Leaf-harnesset kör dem i en isolerad sandbox för repositoriet och returnerar utdata; loopen fortsätter tills modellen slutar anropa. Utvärderingarna kördes i 150 steg inom ungefär 131K kombinerade tokens, med upp till 8 192 genererade tokens per assistenttur. Servering kräver SGLang med en Qwen3-resonemangsparser och en Qwen3-coder-verktygsanropsparser — får du det fel producerar modellen prosa där harnesset förväntar sig JSON, vilket utifrån ser ut precis som en trasig modell.
Intern-Decision-4B:s kontrakt är en engångskörning med en skarp gräns. Frågor och alternativ behåller sin ordning. Alternativ mappas till symboler med en enda token — A till och med Z, sedan a till och med z, sedan 0 till och med 9, vilket är det aritmetiska skälet till att en fråga har högst 62 alternativ. Wrapperns tak är 8 192 tokens och InternLM:s kort säger uttryckligen att längre indata avvisas utan trunkering. Tre frågetyper stöds: choice med en ordnad kriteriemappning, score med en lista eller en mappning med numeriska nycklar, och noul, en binär. Upp till åtta bilder är tillåtna och deras tokens räknas mot samma 8 192.
• Utdataform – FrogNano-4B-2609 avger verktygsanrop, resonemangstext och en patch. Intern-Decision-4B avger en symbol per fält och inget annat.
• Determinism — FrogNano samplar vid temperatur 0,6 över tre slumptalsfrön, så det är probabilistiskt till sin konstruktion. Intern-Decision-4B:s argmax bestäms av framåtpassningen; den anpassade temperaturen påverkar bara dess konfidens.
• Felvyta — FrogNano kan hallucinera ett API, bredda en ändring för mycket eller klara tester samtidigt som den introducerar en sårbarhet, vilka alla namnges på dess kort. Intern-Decision-4B kan inte hallucinera ett svar, eftersom den bara kan välja bland alternativ du tillhandahållit — den kan bara vara felkalibrerad.
• Tak för indata — ungefär 131 000 kombinerade tokens för FrogNano i dess utvärderade konfiguration, mot hårda 8 192 för Intern-Decision-4B, vilket är en faktor sexton och det finns ingen möjlighet att kringgå det.
• Kostnadsbild — FrogNano fakturerar per trajektoria, och trajektorier är långa. Intern-Decision-4B har inga utdatatokens att fakturera alls.
• Parametrar — FrogNano-kortet ger ett intervall på "500M-5B" och beskriver cirka 4,66B, med en BF16-nedladdning på 9,32 GB; Intern-Decision-4B anges till 4,54B med ett visionstorn på 612 MB och en projektor på 54 MB tillsammans med sina språk-shards.
Numret som avgör den här matchningen
InternLM:s modellkort anger Intern-Decision-4B vid 44,16 ms genomsnittlig latens och 44,03 ms median på ett enda RTX 4090 via den lokala Hugging Face-vägen, med en P95 på 44,60 ms. Läs den spridningen igen: median till svans ligger en bra bit under en millisekund, eftersom en forward-pass med fast form nästan inte har något som varierar. Det är hela argumentet för arkitekturen.
FrogNanos motsvarande siffra är inte i millisekunder. Dess utvärderingar tillät en budget på 150 steg med ett agenttak på 10 800 sekunder per uppgift. Det är inte jämförbara enheter och bör aldrig placeras i samma mening som ett latenspåstående — men de säger dig ändå hur avvägningen ser ut. En modell besvarar ett beslut på fyrtiofyra millisekunder och den andra lägger minuter av verktygsanrop på att jaga en patch. Om ditt problem är "routa den här biljetten till en av sex köer och säg mig hur säker du är", är den första inte en billigare version av den andra, den är en annan maskin.
Båda laboratorierna mätte sig noggrant, och båda uppsättningarna av mätningar bör läsas som avsikter snarare än resultat. InternLM rapporterar ett medelvärde över sju uppsättningar på 90,02 med en Brier-poäng på 0,347 och ett förväntat kalibreringsfel på 0,065, anpassat vid en temperatur på 1,99241824 på 1 728 utsedda kalibreringsfall. Microsoft rapporterar en klättring över fem iterationer från 39,4 % till 61,5 % på SWE-bench Verified, och appendixet i samma artikel rapporterar samma progression som 48,2 %, 53,4 %, 58,3 %, 58,6 % och 61,6 % — en påminnelse om att även inom ett och samma laboratorium ger samma faktum mätt på två sätt två stegar.

Avslöjandet ligger i vad varje kort väljer att varna dig för.
Båda korten är ovanligt ärliga, och ärligheten pekar i motsatta riktningar – vilket är det mest användbara i den här jämförelsen.
Microsofts avsnitt om kända begränsningar läses som en varning inför driftsättning. Endast engelska och Python. Prestandan är känslig för testramverk och testkvalitet. Patchar som kan vara felaktiga eller osäkra trots att de klarar sina tester. Kortets egen mening är att FrogNano "inte bör betraktas som självständigt säkerhetsanpassad för obegränsad autonom driftsättning", och den pekar ut den specifika luckan: den agentspecifika efterträningen använde inga säkerhetspreferens-, avböjnings- eller adversariella data, eftersom den i stället optimerade för funktionell korrekthet och undvikande av regressioner. Den uppger också självmant den parallella verktygsanropsfrekvensen på 1,71 %, vilket innebär att modellen nästan aldrig anropar två verktyg i samma tur trots att testramverket tillåter det – en verklig kapacitetsförsämring jämfört med basmodellen, något som teamet lade till ett konsolideringssteg för att försöka återställa.
InternLMs kort varnar för den motsatta sortens problem. Det finns ingen hallucinationsyta att varna för, så förbehållen gäller indata: avvisningen vid 8 192, taket på 62 alternativ, och det faktum att det underliggande texttornet deklarerar en positionsgräns på 262 144 token som den släppta wrappern vägrar använda. Risken är att en siffra som presenteras med självsäkerhet får större förtroende än den förtjänar, och kortet är uppriktigt om att kalibreringen minskar ett gap gentemot Jev-baslinjen utan att stänga det på varje slice.
Lästa tillsammans beskriver de två olika tillitshållningar. FrogNano behöver övervakning eftersom den agerar. Intern-Decision-4B behöver en granskning eftersom den poängsätter — och ett tal som påverkar ett produktionsbeslut är precis den typ av utdata som ingen tänker på att testa.
Var en router passar in, och en ärlig kommentar om båda
Ingen av modellerna är en hostad slutpunkt. FrogNano levereras som vikter plus ett Kubernetes-utvärderingsharness; Intern-Decision-4B levereras som en Python-klass som du importerar efter att ha laddat ner fyra shards. För ett team som vill prova någon av dem inför något verkligt är det säkra mönstret detsamma för båda, och det är inte glamoröst: sätt den experimentella komponenten bakom en fallback så att en dålig trajektoria eller en felkalibrerad dag kostar ett nytt försök i stället för en incident.
Det mönstret är vad ett routningslager är till för. OrcaRouter kör över 200 modeller bakom en OpenAI-kompatibel nyckel med 0 % påslag — leverantörens listpris förs vidare, så en leverantörsprisändring slår igenom hos oss samma dag — och dess failover ligger framför den generella modellen du faller tillbaka på, inte framför dessa två. För att vara tydlig: vi har inte FrogNano-4B-2609 eller Intern-Decision-4B, och det finns inget datum för någon av dem. Vad en enda slutpunkt ger dig här är att själva jämförelsen blir billig — en autentiseringsuppgift, en faktureringsrad och ingen ytterligare integration varje gång du byter den generella modellen som du benchmarkar specialisten mot.

Vilken, och när?
Ta Intern-Decision-4B när svaret redan finns i din prompt och du behöver få det valt, med en tillhörande konfidens, i en takt av tusentals per sekund. Routning med fast taxonomi, rubric-poängsättning, schemabegränsad extraktion, moderering mot en sluten etikettuppsättning. Forward-passningen på 44 millisekunder och nollkostnaden för output-tokens är produkten, och kalibreringen är det du bör granska innan du litar på den.
Ta FrogNano-4B-2609 när svaret ännu inte finns och måste upptäckas genom att läsa ett kodförråd och köra dess tester. Det är en minuterlång, sandlådebaserad och granskningsbar process, och de 61,5 % på SWE-bench Verified – rapporterade av leverantören, inte reproducerade – är det bästa beviset för närvarande på att en 4B-checkpoint alls kan göra det.
Det som inte bör passera åt något håll är vanan att jämföra deras poäng. Ett genomsnitt på 90,02 över sju set och en SWE-bench Verified-frekvens på 61,5 är mätningar av två olika frågor, framtagna av två labb, på två testriggar, och inget av talen har gått genom en tredje parts händer. De delar en förfader och inget annat.

Den enda genuint användbara förutsägelsen från den gemensamma förfadern: eftersom båda modellerna utgår från samma 4B-checkpoint ligger skillnaden mellan dem nästan helt i efterträningen, vilket betyder att den intressanta frågan för alla som bygger vidare på Qwen3.5-4B är vilken av dessa två belöningsstrukturer som överförs till deras egen domän. En syntetisk uppgiftsloop som kalibrerar mot sin egen policy, eller ett poängsättningshuvud med fast form och en anpassad temperatur. Det är två recept, båda publicerade, båda från labb som ännu inte har låtit någon annan köra dem. Det är en sällsynt situation och värd att bevaka snarare än att köpa rakt av.
