
FrogNano-4B-2609: Microsoft heeft een 4B-codeeragent naar Hugging Face uitgebracht en heeft het nooit aangekondigd
- openaiNIEUWOpenAI: GPT-6.1 Sol2026-09-2952Intelligentie
- anthropicNIEUWAnthropic: Claude Sonnet 5.52026-09-2856Intelligentie
- typesafeNIEUWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 mln tokens · 219 tok/s
- OpenAINIEUWOpenAI: GPT-6 Luna2026-09-2238Intelligentie
- OpenAINIEUWOpenAI: GPT-6 Sol2026-09-2248Intelligentie
- AnthropicNIEUWAnthropic: Claude Opus 5.52026-09-2258Intelligentie
- xAINIEUWGrok 4.72026-09-2146Intelligentie
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1 mln tokens · 114 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens · 1064 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 mln tokens · 41 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens · 105 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens · 213 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
De repository verscheen op 17 september 2026 met de eerste commit, en het checkpoint zelf landde vier minuten later. Daarna niets. Geen tweet van Microsoft AI, geen bericht op de Microsoft Research-blog, geen lanceringspagina. Zeven weken later microsoft/FrogNano-4B-2609 — een codingagent uit de vier-miljardklasse, gebouwd op Qwen3.5-4B — heeft er nog steeds geen aankondiging achter zich, en die stilte is het allerbelangrijkste feit over de publicatie van dit model. Wat het wel heeft, is een modelkaart die een paper en een harness claimt, een GitHub-repository die de harness blijkt te zijn en niet de paper, en een createdAt van 17 september onder een kaart waarop staat "Releasedatum 22-SEP-2026". Beide datums zijn geïmproviseerd; geen van beide is onjuist; ze spreken elkaar tegen.
Wat is er eigenlijk gepubliceerd?
Alles hieronder is op dit moment op de hub te controleren, en elk cijfer in dit stuk komt van Microsofts eigen kaart of uit de byte-aantallen in de repository zelf. Niets is door een derde partij gereproduceerd — er is geen Artificial Analysis-vermelding, geen arena-rating en nergens een onafhankelijke evaluatie van FrogNano.
• Gewichten — één openbare repository onder de Microsoft-organisatie, zonder toegangsbeperking, met MIT-tag op de hub, 15 bestanden, geen downloadpoort en geen overeenkomst om te ondertekenen.
• Gewichten op schijf — 9,32 GB verdeeld over twee safetensors-shards, 59,6 miljard bytes aan repositorygegevens, inclusief de optimizer-vrije bestandenset, 738 tensors in de index.
• Architectuur — Qwen3_5ForConditionalGeneration, de dense 32-laagse hybride stack die is overgenomen van Qwen3.5-4B, met een 24-laagse visietoren waarvan de modelkaart zegt dat hij is overgenomen en nooit nagetraind.
• Het parameterveld van de kaart zelf — "500M-5B". Dat is een band, geen getal, en de download is het preciezere document.
• Licentie — het voorwerk van de kaart vermeldt MIT. De hoofdtekst van de kaart zelf vermeldt Apache License 2.0, en de GitHub-harness levert echt een MIT LICENSE-bestand mee. Die twee uitspraken gaan over verschillende artefacten in dezelfde release.
• Aankondiging — geen. Niet op de Microsoft Research-blog, niet op de eigen onderzoekssite van het team, niet in de Hugging Face-organisatiefeed, behalve als een repository-vermelding.
Die laatste regel is degene die de houding van een lezer voor de rest van dit stuk zou moeten bepalen. Een stilletjes geüploade checkpoint is geen minderwaardig artefact dan een aangekondigde — de kaart ervan is vaak langer, omdat niemand hem inkort voor een persbericht. Maar hij is niet door het ene filter gegaan dat een aangekondigde release gratis krijgt: andere mensen die ernaar kijken.

De scores, en wie ze allemaal heeft geproduceerd
Microsoft meldt dat FrogNano 61,5% haalt op SWE-bench Verified, 37,6% op SWE-bench Pro, 31,1% op Terminal-Bench 2.0 en 47,3% op PatchEval-Verified, allemaal als Avg@3-resolutiepercentages gemeten via de Leaf-harness. Dezelfde kaart geeft het startpunt: Qwen3.5-4B scoorde 39,4% op SWE-bench Verified onder de identieke harness en hetzelfde budget. Vijf iteraties van reinforcement learning brachten het via 49,1%, 53,1%, 56,7%, 59,1% en 61,5% — 22,1 punten boven het basismodel, wat Microsoft in zijn eigen bewoordingen afrondt op ongeveer 56% relatieve verbetering.
Twee dingen aan die ladder zijn het waard om even bij stil te staan, want dat zijn plekken waar een samenvatting fout kan gaan, niet plekken waar de leverancier dat deed.
Het eerste is de discrepantie bij Iter 5. De hoofdtabel van de kaart vermeldt 61,5% voor de laatste iteratie; de eigen efficiëntiebijlage van het artikel rapporteert dezelfde progressie over vijf checkpoints als 48,2%, 53,4%, 58,3%, 58,6% en 61,6%. Alleen het laatste getal komt in de buurt, en alleen het laatste getal is het getal dat iedereen citeert. Beschouw het uiteindelijke cijfer als het stabiele resultaat en de tussenliggende treden als metingen van verschillende dingen, want onder een andere aggregatie zijn ze dat duidelijk.
Het tweede is dat FrogNano niet op elk vlak uniform beter is dan het model waarvan het vertrok. Het gepubliceerde percentage parallelle toolaanroepen is 1,71%. De kaart is openhartig dat latere iteraties het vermogen verloren om meerdere toolaanroepen in één beurt af te vuren, en dat het consolidatiewerk van het team deels bestaat om dat te herstellen. Een model dat meer problemen oplost terwijl het bijna geen gelijktijdige aanroepen doet, is een echte engineeringafweging, geen voetnoot.

De harness is het product, en de repository is de harness.
FrogNano draait niet op zichzelf. Het zendt gestructureerde aanroepen naar vijf tools uit — Read, Write, Edit, Glob en Bash — en iets moet ze uitvoeren in een geïsoleerde omgeving en de uitvoer teruggeven. Dat iets is Leaf, en hier doet het spoor iets enigszins ongewoons.
De rij "aanvullende gerelateerde assets" op de modelkaart linkt naar een technisch rapport op aka.ms/frognano-tech-report en een harness op github.com/microsoft/FrogNano. De aka.ms-link verwijst niet naar een pdf; hij leidt rechtstreeks door naar de arXiv-abstractpagina, waar het eigenlijke rapport staat. De GitHub-repository bevat daarentegen geen trainingscode, geen RL-recept en geen checkpoints. De README ervan beschrijft een evaluatieharness die coderingsagenten in Kubernetes-sandboxes draait tegen een OpenAI-compatibel endpoint, en verwijst voor het trainingsverhaal terug naar het arXiv-artikel. De twee assetlinks op de kaart zijn dus een verwijzing naar het artikel en een verwijzing naar het antwoord op het artikel, en de naam is gedeeld.
Dit is om een praktische reden belangrijk voor iedereen die van plan is het model te gebruiken. Het gedocumenteerde serverrecept is SGLang met --reasoning-parser qwen3 en --tool-call-parser qwen3_coder, en de harness wil een endpoint dat al tool calls en reasoning ondersteunt. Zet de parsingconfiguratie net iets verkeerd en het model produceert tekst waar de harness JSON verwacht, wat van buitenaf precies op een slecht model lijkt in plaats van op een slechte configuratie. De kaart vermeldt expliciet dat elke overeenkomstige score een overeenkomstige checkpoint, tokenizer, serverconfiguratie, taakafbeeldingen en evaluatieprotocol vereist — dat is de leverancier die je vertelt dat de harness de helft van het resultaat is.
Ook goed om ronduit te zeggen voor wie hardware dimensioneert: een checkpoint van 9,32 GB bij de geëvalueerde context van de modelkaart is geen inferentieprobleem van 9,32 GB. De evaluaties werden uitgevoerd met ongeveer 131K gecombineerde tokens en een budget van 150 stappen. Geheugen schaalt met de context, niet met de gewichten, en de modelkaart zegt dat de minimale GPU-configuratie nog steeds "moet worden gevalideerd vóór release" — een zin die opduikt bij een model dat al downloadbaar is.
Wat de training daadwerkelijk deed, in één alinea
De bijdrage van het paper is niet het model, het is de lus. TaskPilot genereert kandidaat-software-engineeringtaken uit echte repository-snapshots, voert rollouts vanaf het huidige checkpoint daartegen uit, houdt de taken die zich dicht bij de grens bevinden van wat het beleid soms kan oplossen, en gooit kandidaten weg die permanent triviaal of permanent onmogelijk zijn. De geaccepteerde set traint het volgende checkpoint. Dat volgende checkpoint kalibreert vervolgens de volgende ronde van taakgeneratie, zodat de taakdistributie meebeweegt met het beleid. In totaal ongeveer 1.500 gevalideerde omgevingen. Geen distillatie: de kaart verklaart ronduit dat agent-specifieke post-training geen oplossingspaden, acties, redeneersporen of patchdoelen van sterkere modellen gebruikte. Sterkere modellen schrijven taken; ze demonstreren geen antwoorden.
Microsoft heeft die lus vijf iteraties laten draaien en rapporteert een winst van 8,7 punten vóór enige consolidatie, waarbij halverwege de run een straf voor loglengte is toegevoegd omdat redeneersporen sneller groeiden dan dat ze verbeterden.
De modelkaart is ongewoon direct over waar de hele aanpak kwetsbaar is. De trainingsdata zijn Python-zwaar en voornamelijk Engelstalig; de op de kaart vermelde set ondersteunde natuurlijke talen is Engels en niets anders, waarbij de bredere meertalige dekking van het basismodel expliciet niet wordt geclaimd. De prestaties zijn gevoelig voor het testharnas en voor de kwaliteit van de tests. Gegenereerde patches 'kunnen onjuist of onveilig zijn, zelfs als ze de beschikbare tests doorstaan.' De modelkaart voor de 4B sluit die alinea af met de zin die elke lezer bij zich zou moeten dragen: niet te gebruiken zonder gekwalificeerde menselijke beoordeling en onafhankelijke regressie- en beveiligingstests. Dat is een leveranciersverklaring over een leveranciersartefact, en het is een nuttiger zin dan welke van de scorebordrijen daarboven dan ook.
Wat dit voor een koper betekent, en waar een router in past
FrogNano is geen model dat je aanroept. Er is geen first-party-API, geen gehoste endpoint en geen serverloze image. Het is een checkpoint, en het gebruik ervan betekent ofwel je eigen SGLang-deployment opzetten achter een door Kubernetes gehoste sandbox, ofwel het evalueren als component binnen een agent-stack die je al beheert. Dat is vandaag het hele adoptiepad, en geen enkele aankondiging zou de vorm ervan hebben veranderd.
Wat een routeringslaag hier eerlijk gezegd kan doen, is een beperkter iets dan het in eerste instantie klinkt. Als het plan is om een zelfgehoste FrogNano te vergelijken met een gehost codeermodel binnen je eigen harness, dan is de gehoste helft de helft die er baat bij heeft achter één sleutel te zitten in plaats van een tweede contract: OrcaRouter biedt meer dan 200 modellen achter één OpenAI-compatibel endpoint tegen 0% opslag, wat betekent dat de lijstprijzen van providers ongewijzigd worden doorgegeven en een prijswijziging van een leverancier is dezelfde dag nog live aan onze kant. Dat is belangrijk voor een bake-off waarvan de uitkomst wordt bepaald door de kosten per opgelost issue in plaats van door één benchmarkcijfer. Wij hosten FrogNano niet en er is geen datum voor; de gewichten en het serveerwerk liggen bij jou.

De drie dingen die het zouden beslechten
Ten eerste, een onafhankelijke reproductie. Elk getal in dit artikel — 61,5, 37,6, 31,1, 47,3 — werd geproduceerd door het lab dat het model heeft getraind, op een testharnas dat hetzelfde lab onderhoudt, afgezet tegen een basismodelwaarde die hetzelfde lab heeft gemeten. Dat is een compleet en intern consistent beeld, en het is ook een gesloten circuit. De nuttige test is of iemand zonder enig belang de sprong van 39,4 naar 61,5 reproduceert op dezelfde 500 taken zonder het kalibratiewerk van Microsoft op de takenreeks.
Ten tweede moet iemand de claim over het evaluatieharnas van begin tot eind controleren. De repository is openbaar, wat meer is dan veel releases voor elkaar krijgen, maar het is de evaluatie-opstelling. Als de vijf tools en de sandbox-isolatie echt het prestatiemechanisme zijn, zou een derde partij die de gepubliceerde configuratie draait in de buurt van de gepubliceerde cijfers moeten uitkomen. Als dat niet gebeurt, is de kloof de echte bevinding.
Ten derde, en het goedkoopst te beantwoorden: Microsoft zou moeten zeggen of dit een product of een papieren artefact is. In de distributiesectie van de kaart worden de weights, de kaart en de harness als het deliverable behandeld, wat leest als een publicatie in plaats van een lancering. "Release date 22-SEP-2026" leest als een lancering. Een aangekondigd model zou die ambiguïteit in de eerste zin van een blogpost hebben opgelost, en er is geen blogpost.
Tot dan toe is de juiste houding degene die de release zelf impliceert. FrogNano-4B-2609 is een echte, downloadbare, MIT- en Apache- en misschien-niet-checkpoint met een ongewoon grondige kaart, een openbaar evaluatieharnas, een echt methodologisch idee, en een scorebord dat nog nooit is aangeraakt door iemand zonder een Microsoft-adres. Voor een lab is dat een compleet en interessant artefact. Voor een team dat op het punt staat om drie uur 's ochtends een agent voor een repository te zetten, is het een spoor dat het volgen waard is en nog geen beslissing die het nemen waard is.
