Een gegenereerde titelkaart met de tekst 'FrogNano-4B-2609 vs Gemma 4 12B' en de ondertitel 'een repository-agent van 4B tegenover een multimodale generalist van 11,95B', drie chips met de tekst '61,5% SWE-bench, door de leverancier gerapporteerd', '72,0% LiveCodeBench, door de leverancier gerapporteerd' en 'geen gedeelde benchmark', een voettekst met de tekst 'Verschillende benchmarks zonder overlap; beide scoreborden door de leverancier gerapporteerd', en het OrcaRouter-logo dat in de rechteronderhoek is gecompositeerd.
Guides & Insights

FrogNano-4B-2609 vs Gemma 4 12B: 61,5% op SWE-bench en niemand heeft het gecontroleerd

Auteur

Elias Hawthorne

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen →
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Microsofts FrogNano-4B-2609 is een coderingsagent in de vier-miljardklasse, afgeleid van Qwen3.5-4B die 61,5% rapporteert op SWE-bench Verified. Gemma 4 12B is DeepMinds encoderloze multimodale model met 11,95 miljard parameters, en de bijbehorende modelkaart meldt 72,0% op LiveCodeBench v6. Dat zijn de twee cijfers die een koper naast elkaar zal leggen, en ze naast elkaar leggen is de fout. Ze komen uit verschillende benchmarks, verschillende testharnassen, verschillende labs, en — belangrijker nog — slechts één ervan heeft een gepubliceerde evaluatiemethodologie die een buitenstaander heeft gelezen. Al het andere aan deze vergelijking is een kwestie van wat elk model werkelijk is, en het antwoord is dat ze helemaal niet tot dezelfde categorie dingen behoren.

De FrogNano-cijfers hieronder komen uit de modelkaart van Microsoft en het bijbehorende technische rapport; beide zijn sinds september openbaar en geen van beide is gereproduceerd door iemand buiten het lab. De cijfers van Gemma 4 12B komen uit de modelkaart van Google, die ook een leveranciersdocument is — het verschil is dat de cijfers van Gemma twintig weken en ongeveer 2,6 miljoen downloads aan kritische beschouwing achter zich hebben, en FrogNano twee weken en een downloadteller die nog geen tien heeft gehaald.

Waar elk model voor is

Dit is het deel dat een specificatieblad verbergt. FrogNano-4B-2609 is geen algemeen model dat toevallig goed is in code. Het is een checkpoint waarvan de volledige post-training repository-level software-engineering was, en dat ontworpen is om door een harness te worden aangestuurd in plaats van te worden aangesproken.

De vijf tools zijn Read, Write, Edit, Glob en Bash. Het stuurt aanroepen naar hen, een sandbox voert ze uit en retourneert uitvoer, en de lus loopt totdat het model stopt met vragen. De geëvalueerde configuratie is 150 interactiestappen binnen ongeveer 131K gecombineerde tokens, en het produceerde een kandidaat-patch per taak. Microsofts kaart is expliciet dat het model is voor Engelstalige, Python-zware repositories met reproduceerbare omgevingen en uitvoerbare testsuites, en dat beeld- en videocomponenten die van het basismodel zijn geërfd nooit zijn post-getraind en niet worden ondersteund.

Gemma 4 12B is de tegenovergestelde vorm. Het is een uniform model met 48 lagen en een context van 256K, zonder aparte visuele of audio-encoder — ruwe beeldpatches en audiogolfvormen projecteren rechtstreeks in de embeddingruimte van de enkele decoder via lichtgewicht lineaire lagen. Het neemt tekst, beeld en audio als invoer en schrijft tekst als uitvoer. Het heeft een denkmodus die wordt geactiveerd door een token in de systeemprompt, native functieaanroepen, en de kaart van Google noemt agentische workflows met nadruk bij de beoogde toepassingen.

De echte vraag is dus niet welke van de twee slimmer is. Het is of je een gespecialiseerde component wilt die alleen werkt binnen een opstelling die jij moet bedienen, of een algemeen model dat veel dingen redelijk goed doet en door van alles kan worden aangeroepen.

A screenshot of the google/gemma-4-12B-it model card on Hugging Face showing the Gemma 4 12B Unified heading, the Any-to-Any, Transformers, Safetensors and image-text-to-text tags, the Apache 2.0 license line credited to Google DeepMind, and the model overview explaining that text, audio, image and video inputs are handled without separate encoders.

Regel voor regel, waar ze daadwerkelijk van elkaar verschillen.

• Parameters — FrogNano-4B-2609 publiceert een bereik, "500M-5B", op een kaart waarvan de eigen beschrijving ongeveer 4,66 miljard aangeeft; de download zet het op 9,32 GB aan BF16-gewichten. Gemma 4 12B is 11,95B, eenmalig vermeld en nooit afgezwakt. De verhouding is ongeveer 2,6 tegen één, en die zie je direct terug in wat je moet huren.

• Context — De geëvalueerde configuratie van FrogNano omvat ongeveer 131K gecombineerde tokens, waarbij redenering en tooluitvoer het budget delen. Gemma 4 12B beschikt over 256.000 tokens en scoort op zijn eigen lange-contextrij 43,4% op MRCR v2 met acht needles bij 128K. Een bijna dubbel zo groot venster, en het tweede getal is een gepubliceerde meting in plaats van een capaciteitsclaim.

• Modaliteit — FrogNano-4B-2609 is tekst in, tekst uit, ondanks dat de visiontoren in zijn checkpoint zit. Gemma 4 12B is tekst-, beeld- en audio-in.

• Uitvoerplafond — de gevalideerde FrogNano-configuratie staat 8.192 gegenereerde tokens per assistentbeurt toe, en de kaart vermeldt dat de RL-trainingsconfiguratie dezelfde bovengrens gebruikte. Gemma 4 12B publiceert geen equivalent plafond voor één enkele beurt; de beperking daar is het venster van 256K.

• Agentische interface — FrogNano stuurt gestructureerde Leaf-aanroepen uit en heeft een harness nodig om ze uit te voeren. Gemma 4 12B wordt geleverd met native function calling in zijn instructie-afgestemde vorm en is direct aanroepbaar.

• Licentie — Gemma 4 12B is Apache 2.0 onder de Gemma 4-voorwaarden van Google, duidelijk vermeld. De kaart van FrogNano is MIT in het voorwerk en Apache 2.0 in de eigenlijke tekst, wat het soort ambiguïteit is dat in een juridische beoordeling terechtkomt in plaats van in een voetnoot.

• Getallen — FrogNano rapporteert 61,5% SWE-bench Verified, 37,6% SWE-bench Pro, 31,1% Terminal-Bench 2.0 en 47,3% PatchEval-Verified. Gemma 4 12B rapporteert 77,2% MMLU Pro, 72,0% LiveCodeBench v6, een Codeforces-ELO van 1659, 78,8% GPQA Diamond en 69,0% op Tau2. De kaart van Google publiceert geen SWE-bench-rij, en de kaart van Microsoft publiceert geen LiveCodeBench. Er is helemaal geen overlap tussen de twee scoreborden.

Die laatste bullet is degene die een einde zou moeten maken aan de reflex om op cijfers te vergelijken. Geen enkele benchmark komt op beide kaarten voor. Een lezer die 61,5 naast 72,0 legt, heeft een repository-resolutiepercentage vergeleken met een slagingspercentage voor competitief programmeren, wat ongeveer neerkomt op het vergelijken van een marathontijd met een tijd op de honderd meter, omdat beide in seconden zijn.

Waarom het zwijgen van Google over SWE-bench geen rode vlag is

De verleidelijke conclusie uit de opsomming is dat FrogNano een echt SWE-bench-getal heeft en Gemma niet, dus FrogNano wint de codeervraag. Dat volgt daar niet uit, om een reden waar het de moeite loont precies over te zijn.

Gemma 4 12B rapporteert Tau2 op 69,0% — een agentische tool-use-benchmark over drie runs — naast zijn ondersteuning voor function-calling en zijn expliciete positionering voor agentische workflows. Een model dat 69,0 scoort op Tau2 is geen model dat geen agentisch werk kan doen; het is een model waarvan de leverancier ervoor koos om tool-use-prestaties te rapporteren in plaats van repository-resolutie. Google rapporteert ook geen SWE-bench-rijen voor de 26B of de 31B, wat een redactionele keuze voor de hele familie is in plaats van een zwakte van de 12B.

Ondertussen is het contra-intuïtieve resultaat in Microsofts eigen paper er een dat een Gemma-koper aandachtig zou moeten lezen. FrogNano begint bij Qwen3.5-4B, een algemeen model, dat 39,4% scoorde op SWE-bench Verified via de Leaf-harness. Vijf rondes reinforcement learning op ongeveer 1.500 synthetische taken brachten het naar 61,5%. De les is niet "kleine modellen kunnen niet coderen" — ze is dat een algemeen 4B-checkpoint op 39,4% al meer dan een derde van een moeilijke, door mensen gevalideerde issue-set oploste toen iemand het binnen een competente agent-loop liet draaien. Gemma 4 12B is drie keer zo groot en twintig weken volwassener. Niemand heeft het door Leaf laten draaien, en totdat iemand dat doet, is "Gemma is geen repo-agent" een aanname in plaats van een bevinding.

De harness-tax, die de scoreborden volledig verbergen

Hier is de praktische asymmetrie, en juist die bepaalt de aankoop.

Gemma 4 12B is een model. Download 11,95B aan gewichten, richt Transformers, vLLM of SGLang erop, stuur tekst, krijg tekst. Google publiceert het serveringspad, de licentie is eenduidig, en mensen die goed zijn voor 2,6 miljoen downloads zijn al tegen de ruwe randjes aangelopen en hebben ze gedocumenteerd. Als de taak is "vat deze stacktrace samen", "lees deze schermafbeelding en vertel me wat er stuk is", of "roep deze functie met deze argumenten aan", dan werkt het vandaag.

FrogNano-4B-2609 is een model plus een harness, en Microsofts eigen README maakt de harness niet optioneel. De repository op github.com/microsoft/FrogNano is de Leaf-evaluatieopstelling, niet de trainingscode — er is een Kubernetes-cluster nodig, een bestaande namespace, rechten om pods en netwerkbeleid te beheren, pull-toegang tot benchmark-containerimages, en een OpenAI-compatibel endpoint dat is geconfigureerd met de juiste redenerings- en tool-call-parsers. Microsofts modelkaart stelt de overeenstemmingsvoorwaarde botweg: identieke scores vereisen een overeenkomstige checkpoint, tokenizer, servingconfiguratie, taakimages en evaluatieprotocol. De helft van de release die de score genereert, is de helft waarnaar de kaart met een GitHub-link verwijst.

Daar zit echte waarde in, en het is de moeite waard om dat te benoemen in plaats van weg te wuiven. De bijdrage van FrogNano is een taaksynthese-lus die trainingsproblemen opnieuw genereert op basis van het huidige vermogen van het beleid — de bewering in het artikel is dat een kleine agent tot een competitief niveau getraind kan worden op synthetische taken, zonder enige vorm van distillatie, en dat opent een weg voor iedereen die zich geen frontier-leraar kan veroorloven. De API is openbaar. De methoden zijn in principe reproduceerbaar. Dat is een sterkere bijdrage dan nog een incrementele checkpoint, en het is ook meer werk dan waarop de meeste teams rekenen wanneer ze zich hiervoor aanmelden.

A generated two-column scoreboard titled 'FrogNano-4B-2609 vs Gemma 4 12B'. The left column reads Parameters approx 4.66B with the card saying 500M-5B, Context about 131K evaluated, Input text only, Harness required Leaf with 5 tools, SWE-bench Verified 61.5% vendor, and Independent evals none. The right column reads Parameters 11.95B, Context 256,000 tokens, Input text, image, audio, Harness none required, LiveCodeBench v6 72.0% vendor, and Independent evals widely run. A footer reads 'Different benchmarks, no overlap; both scoreboards vendor-reported.'

Als je er één kiest, kies dan op basis van de klus.

Kies Gemma 4 12B als het werk modaliteiten combineert, als iets een afbeelding moet kunnen zien of audio moet kunnen horen, als de context tegelijkertijd een grote bestandsstructuur en een lang transcript moet bevatten, of als je een model wilt dat elk framework kan laden zonder een tweede systeem erachter. De Tau2-score van 69,0 en native functieaanroepen maken het een verdedigbare keuze voor agentische pipelines, en niemand hoeft een laboratorium op zijn woord te geloven — het model is door duizenden mensen geëvalueerd en de resultaten zijn geen geheim.

Neem FrogNano-4B-2609 als je al een repositoryagent in een sandbox draait en je er een checkpoint van 4B-klasse in wilt droppen, en als een download van 9,32 GB die op bescheiden hardware past de beperking is die de beslissing bepaalt. Wees nuchter over de volgorde: je koopt geen score, je neemt een gok op een methode, en het eerste dat je zult ontdekken is of je polling-loop en je tool-callparser voldoende op Leaf lijken. Sommige teams krijgen op de derde middag gedrag dat tegen 61,5% aanleunt en sommige zullen twee weken nodig hebben om te ontdekken dat hun evaluatieset makkelijker was dan SWE-bench Verified, en niemand buiten het lab kan je vooralsnog vertellen welke van de twee je bent.

Als de beslissing echt nipt is, is het goedkope experiment om beide in dezelfde harness op je eigen issues te draaien in plaats van te discussiëren over gepubliceerde cijfers die geen gemeenschappelijke benchmark hebben. OrcaRouter heeft meer dan 200 modellen achter één OpenAI-compatibele sleutel tegen 0% opslag, zodat de lijstprijzen van providers ongewijzigd worden doorgegeven — waardoor het mogelijk is om een gehost algemeen model en de rest van je kandidatenset achter één endpoint en één facturatieregel te zetten terwijl je beslist. FrogNano is geen van onze routes en er is geen datum voor; de gewichten zijn een download die je zelf host. Wat we kunnen wegnemen, is de frictie aan de andere kant van de vergelijking: het wisselen van kandidaatmodellen in je eigen harness zonder een tweede contract, een tweede SDK of een tweede set inloggegevens.

A generated timeline card headed 'Two releases, twenty weeks apart' showing an upper bar labelled Gemma 4 12B uploaded 23 May 2026 with 2.6 million downloads across the family, and a lower bar labelled FrogNano-4B-2609 uploaded 17 September 2026 with no announcement, with a span marker of 20 weeks between them and a footer reading 'Download figures from Hugging Face on 3 October 2026.'

De eerlijke samenvatting is dat het getal 61,5 echt werk is van het lab dat het heeft gemaakt, en dat het momenteel de enige reden is om FrogNano te verkiezen voor coderen. Wanneer iemand buiten Microsoft 61,5 reproduceert op dezelfde 500 taken — of daar niet in slaagt — krijgt deze vergelijking een echt antwoord. Tot dan is de veiligere standaard voor de meeste teams het 11,95B-model met de schone licentie, de gepubliceerde meting van de lange context, en twintig weken aan fouten van anderen die al in de documentatie zijn opgenomen.