
FrogNano-4B-2609 vs Gemma 4 12B: 61,5 % på SWE-bench och ingen har kontrollerat det
- openaiNYOpenAI: GPT-6.1 Sol2026-09-2952Intelligens
- anthropicNYAnthropic: Claude Sonnet 5.52026-09-2856Intelligens
- typesafeNYTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M tokens · 219 tok/s
- OpenAINYOpenAI: GPT-6 Luna2026-09-2238Intelligens
- OpenAINYOpenAI: GPT-6 Sol2026-09-2248Intelligens
- AnthropicNYAnthropic: Claude Opus 5.52026-09-2258Intelligens
- xAINYGrok 4.72026-09-2146Intelligens
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1M tokens · 114 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M tokens · 1064 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligens76Kodning
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M tokens · 41 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens · 105 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M tokens · 213 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
Microsofts FrogNano-4B-2609 är en kodningsagent i fyramiljardklassen härledd från Qwen3.5-4B som rapporterar 61,5 % på SWE-bench Verified. Gemma 4 12B är DeepMinds encoderfria multimodala modell med 11,95 miljarder parametrar, och dess modellkort rapporterar 72,0 % på LiveCodeBench v6. Det är de två siffrorna en köpare kommer att ställa sida vid sida, och att ställa dem sida vid sida är misstaget. De kommer från olika benchmarks, olika utvärderingsramverk, olika labb, och – ännu viktigare – bara en av dem har en publicerad utvärderingsmetodik som en utomstående har läst. Allt annat i den här jämförelsen handlar om vad varje modell faktiskt är, och svaret är att de inte alls är samma typ av sak.
FrogNano-siffrorna nedan kommer från Microsofts modellkort och deras tekniska rapport, båda offentliga sedan september och ingen av dem har reproducerats av någon utanför labbet. Siffrorna för Gemma 4 12B kommer från Googles modellkort, som också är ett leverantörsdokument – skillnaden är att Gemmas siffror har tjugo veckor och ungefär 2,6 miljoner nedladdningar av granskning bakom sig, medan FrogNano har två veckor och en nedladdningsräknare som inte har lämnat ensiffriga tal.
Vad varje modell är till för
Det här är delen som ett specifikationsblad döljer. FrogNano-4B-2609 är en generell modell som råkar vara bra på kod. Det är en checkpoint vars hela efterträning var programvaruutveckling på repositorienivå, och som är utformad för att drivas av en testrigg snarare än att pratas med.
Dess fem verktyg är Read, Write, Edit, Glob och Bash. Den avger anrop till dem, en sandlåda kör dem och returnerar utdata, och loopen körs tills modellen slutar begära. Den utvärderade konfigurationen är 150 interaktionssteg inom ungefär 131K kombinerade tokens, och den producerade en kandidatpatch per uppgift. Microsofts modellkort säger uttryckligen att modellen är avsedd för engelskspråkiga, Python-tunga kodförråd med reproducerbara miljöer och körbara testsviter, och att bild- och videokomponenter som ärvts från basmodellen aldrig har eftertränats och inte stöds.
Gemma 4 12B har den motsatta formen. Det är en enhetlig modell med 48 lager och en kontext på 256K, utan separata kodare för bild eller ljud – råa bildpatchar och ljudvågformer projiceras direkt in i den enda dekoderns inbäddningsrymd genom lätta linjära lager. Den tar in text, bild och ljud och skriver ut text. Den har ett tänkandeläge som utlöses av en token i systemprompten, inbyggt funktionsanrop, och Googles kort gör en poäng av att lista agentiska arbetsflöden bland sina avsedda användningsområden.
Så den verkliga frågan är inte vilken av dem som är smartare. Det är om du vill ha en specialistkomponent som bara fungerar inuti en rigg som du måste sköta, eller en generell modell som gör ett hyfsat jobb med många saker och kan anropas av vad som helst.

Rad för rad, där de faktiskt skiljer sig åt
• Parametrar — FrogNano-4B-2609 publicerar ett spann, "500M-5B", på ett kort vars egen beskrivning anger ungefär 4,66 miljarder; nedladdningen fastställer det till 9,32 GB BF16-vikter. Gemma 4 12B är 11,95B, angivet en gång och aldrig med förbehåll. Förhållandet är ungefär 2,6 mot ett, och det syns direkt i vad du måste hyra.
• Kontext — FrogNanos utvärderade konfiguration omfattar cirka 131K kombinerade tokens, där resonemang och verktygsutdata delar budgeten. Gemma 4 12B har 256 000 tokens, och på sin egen långkontextrad får den 43,4 % på MRCR v2 med åtta nålar vid 128K. Nästan dubbelt så stort fönster, och den andra siffran är en publicerad mätning snarare än ett påstående om kapacitet.
• Modalitet — FrogNano-4B-2609 är text in, text ut, trots att visionstornet sitter i dess checkpoint. Gemma 4 12B är text, bild och ljud in.
• Tak för utdata – den validerade FrogNano-konfigurationen tillåter 8 192 genererade token per assistenttur, och dess kort noterar att RL-träningskonfigurationen använde samma gräns. Gemma 4 12B publicerar inget motsvarande tak för en enskild tur; begränsningen där är fönstret på 256K.
• Agentiskt gränssnitt — FrogNano skickar strukturerade Leaf-anrop och behöver en harness för att exekvera dem. Gemma 4 12B levereras med inbyggt funktionsanrop i sin instruktionstränade form och kan anropas direkt.
• Licens — Gemma 4 12B är Apache 2.0 enligt Googles Gemma 4-villkor, tydligt angivet. FrogNanos kort är MIT i dess inledande del och Apache 2.0 i dess egen brödtext, vilket är den typ av oklarhet som hamnar i en juridisk granskning i stället för i en fotnot.
• Siffror — FrogNano rapporterar 61,5 % SWE-bench Verified, 37,6 % SWE-bench Pro, 31,1 % Terminal-Bench 2.0 och 47,3 % PatchEval-Verified. Gemma 4 12B rapporterar 77,2 % MMLU Pro, 72,0 % LiveCodeBench v6, ett Codeforces-ELO på 1659, 78,8 % GPQA Diamond och 69,0 % på Tau2. Googles modellkort publicerar inte någon SWE-bench-rad, och Microsofts modellkort publicerar inte LiveCodeBench. Det finns ingen överlappning alls mellan de två resultattavlorna.
Den sista punkten är den som borde sätta stopp för jämförelseinstinkten. Inte ett enda benchmark förekommer i båda. En läsare som ställer 61,5 mot 72,0 har jämfört en lösningsgrad för repository-uppgifter med en passeringsgrad för tävlingsprogrammering, vilket är som att jämföra en maratontid med en tid på 100 meter eftersom båda anges i sekunder.
Varför Googles tystnad om SWE-bench inte är en varningsflagga
Den frestande slutsatsen från punktlistan är att FrogNano har ett riktigt SWE-bench-tal och att Gemma inte har det, så FrogNano vinner kodningsfrågan. Det följer inte, av en anledning som är värd att vara precis om.
Gemma 4 12B rapporterar Tau2 på 69,0 % – ett agentiskt benchmark för verktygsanvändning över tre körningar – tillsammans med sitt stöd för funktionsanrop och sin explicita positionering för agentiska arbetsflöden. En modell som får 69,0 på Tau2 är inte en modell som inte kan utföra agentiskt arbete; det är en modell vars leverantör valde att rapportera prestanda för verktygsanvändning i stället för repositorielösning. Google rapporterar inte heller SWE-bench-rader för 26B eller 31B, vilket är ett redaktionellt val för hela familjen snarare än en svaghet hos 12B.
Samtidigt är det kontraintuitiva resultatet i Microsofts egen artikel något en Gemma-köpare bör läsa noggrant. FrogNano utgår från Qwen3.5-4B, en allmän modell, som fick 39,4 % på SWE-bench Verified genom Leaf-harnessen. Fem rundor av förstärkningsinlärning på ungefär 1 500 syntetiska uppgifter flyttade den till 61,5 %. Lärdomen är inte ”små modeller kan inte koda” – den är att en allmän 4B-checkpoint vid 39,4 % redan löste mer än en tredjedel av en svår, människovaliderad uppsättning problem när någon körde den i en kompetent agentloop. Gemma 4 12B är tre gånger så stor och tjugo veckor mer mogen. Ingen har kört den genom Leaf, och tills någon gör det är ”Gemma är inte en repo-agent” ett antagande snarare än ett fynd.
Harness-skatten, som resultattavlorna döljer helt
Här är den praktiska asymmetrin, och det är den som avgör köpet.
Gemma 4 12B är en modell. Ladda ner 11,95B vikter, rikta Transformers, vLLM eller SGLang mot dem, skicka text, få text. Google publicerar serveringsvägen, licensen är otvetydig, och människor motsvarande 2,6 miljoner nedladdningar har redan stött på ojämnheterna och dokumenterat dem. Om uppgiften är "sammanfatta denna stack trace", "läs den här skärmbilden och berätta vad som är trasigt" eller "anropa den här funktionen med dessa argument", fungerar det idag.
FrogNano-4B-2609 är en modell plus en harness, och Microsofts egen README gör harnessen obligatorisk. Repositoriet på github.com/microsoft/FrogNano är Leaf-utvärderingsriggen, inte träningskoden — det behöver ett Kubernetes-kluster, ett befintligt namespace, behörigheter att hantera poddar och nätverkspolicyer, pull-åtkomst till benchmark-containeravbildningar, och en OpenAI-kompatibel slutpunkt konfigurerad med rätt resonemangs- och verktygsanropsparsrar. Microsofts kort anger matchningsvillkoret utan omsvep: identiska poäng kräver matchande checkpoint, tokenizer, serveringskonfiguration, uppgiftsavbildningar och utvärderingsprotokoll. Hälften av utgåvan som genererar poängen är den hälft som kortet hänvisar till via en GitHub-länk.
Det finns ett verkligt värde i det, och det är värt att nämna snarare än att avfärda. FrogNanos bidrag är en uppgiftssyntesloop som återgenererar träningsproblem mot den aktuella policyns förmåga – påståendet i artikeln är att en liten agent kan tränas till konkurrenskraftig nivå på syntetiska uppgifter utan någon destillation alls, och det öppnar en väg för alla som inte har råd med en lärare i framkant. Dess API är offentligt. Dess metoder är i princip reproducerbara. Det är ett starkare bidrag än ännu en inkrementell checkpoint, och det är också mer arbete än vad de flesta team som anmäler sig till det har räknat med.

Om du väljer en, välj utifrån jobbet
Välj Gemma 4 12B om arbetet blandar modaliteter, om något behöver se en bild eller höra ljud, om kontexten måste rymma ett stort filträd och en lång transkription samtidigt, eller om du vill ha en modell som vilket ramverk som helst kan ladda utan ett andra system bakom sig. Dess Tau2-poäng på 69,0 och inbyggda funktionsanrop gör den till ett försvarbart val för agentiska pipelines, och ingen behöver ta ett labs ord för det — modellen har utvärderats av tusentals människor och resultaten är ingen hemlighet.
Ta FrogNano-4B-2609 om du redan kör en sandboxad repo-agent och vill ha en checkpoint i 4B-klassen att lägga in i den, och om en nedladdning på 9,32 GB som får plats på blygsam hårdvara är begränsningen som styr beslutet. Var klarsynt om sekvenseringen: du köper inte en poäng, du satsar på en metod, och det första du kommer att upptäcka är om din polling-loop och din verktygsanropsparser liknar Leaf tillräckligt. Vissa team kommer att få beteende nära 61,5 % på tredje eftermiddagen och vissa kommer att lägga två veckor på att upptäcka att deras utvärderingsset var enklare än SWE-bench Verified, och ingen utanför labbet kan ännu säga vilken du är.
Om beslutet verkligen är jämnt är det billiga experimentet att köra båda i samma testramverk på dina egna problem i stället för att debattera publicerade siffror som inte delar någon benchmark. OrcaRouter har över 200 modeller bakom en OpenAI-kompatibel nyckel utan påslag, så leverantörernas listpriser förs vidare oförändrade – vilket gör det möjligt att sätta en hostad generell modell och resten av din kandidatuppsättning bakom en enda slutpunkt och en enda faktureringsrad medan du bestämmer dig. FrogNano är inte en av våra rutter och det finns inget datum för den; vikterna är en nedladdning som du hostar själv. Det vi kan ta bort är friktionen på andra sidan jämförelsen: att byta ut kandidatmodeller i ditt eget testramverk utan ett andra avtal, ett andra SDK eller en andra uppsättning autentiseringsuppgifter.

Den ärliga sammanfattningen är att siffran 61,5 är riktigt arbete av labbet som tog fram den, och att den för närvarande är den enda anledningen att föredra FrogNano för kodning. När någon utanför Microsoft reproducerar 61,5 på samma 500 uppgifter – eller misslyckas med det – får den här jämförelsen ett riktigt svar. Tills dess är det säkrare standardvalet för de flesta team 11,95B-modellen med den rena licensen, den publicerade mätningen av lång kontext och tjugo veckor av andras misstag som redan har absorberats i dess dokumentation.
