Een gegenereerde titelkaart met de tekst 'FrogNano-4B-2609 vs Qwen 3.8' en als ondertitel 'een 4B-agent op je eigen GPU tegenover een gehoste 2,4T-flagship', drie chips met de tekst '9,32 GB download', '$2 in / $6 uit per miljoen' en 'tot 150 stappen per taak', een voettekst met de tekst 'FrogNano-cijfers volgens Microsoft; prijzen van Qwen3.8-Max volgens Alibaba. Niets hier is onafhankelijk', en het OrcaRouter-logo gecompositeerd in de rechteronderhoek.
Guides & Insights

FrogNano-4B-2609 vs Qwen 3.8: Wat een codingagent kost wanneer de gewichten van jou zijn

Auteur

Magnus Corvin

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen →
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

microsoft/FrogNano-4B-2609 is een repository-agent in de vier-miljardklasse, afgeleid van Qwen3.5-4B, die je zelf downloadt en host. Qwen3.8-Max is het gehoste vlaggenschip — een sparse mixture-of-experts-model met 2,4 biljoen parameters, met ongeveer 95 miljard actieve parameters per token, een multimodaal venster van één miljoen tokens, en een tariefkaart van $2,00 per miljoen inputtokens en $6,00 per miljoen outputtokens — sinds 3 augustus 2026 bereikbaar met een API-sleutel. Een van de twee kost een GPU en een middag. De andere kost niets tot je hem gebruikt, en rekent dan per token af op de langste trajecten die gangbaar in gebruik zijn. Die afweging, en niet de benchmarktabel, is de echte krachtmeting.

De FrogNano-cijfers hier komen uit Microsofts modelkaart en technisch rapport; de Qwen3.8-Max-cijfers komen uit de gepubliceerde prijsstelling van Alibaba en het modelrecord in onze eigen catalogus, waarbij de onafhankelijke scores overal waar ze voorkomen als Artificial Analysis-cijfers worden aangeduid. Let goed op de naamgeving: Qwen3.8, de open-weights-release, is aangekondigd maar nog niet uitgebracht, terwijl Qwen3.8-Max vandaag live is en een prijs heeft. Alles wat in dit artikel aanroepbaar is, is het laatste.

Het rekenwerk dat de vergelijking bepaalt

Begin met wat één enkele taak kost, want het is niet vanzelfsprekend en het is niet gering.

De evaluaties van FrogNano voerden elke trajectorie uit met een budget van 150 stappen, binnen ongeveer 131K gecombineerde tokens, met maximaal 8.192 gegenereerde tokens per assistentbeurt en een plafond van 10.800 seconden. Vermenigvuldig de twee gepubliceerde limieten met elkaar en je krijgt een plafond van ongeveer 1,23 miljoen gegenereerde tokens voor één trajectorie in het slechtste geval — wat bij Qwen3.8-Max tegen $6,00 per miljoen outputtokens neerkomt op ongeveer $7,38 voor één enkele taak die tot het einde van zijn budget liep. Dat is rekenwerk op basis van twee gepubliceerde getallen, geen meting: echte trajectorieën stoppen vroeg, het gemiddelde ligt ver onder het plafond, en toolresultaten en shell-uitvoer worden tegen het goedkopere invoertarief gefactureerd in plaats van tegen het uitvoertarief. Maar het geeft de vorm van het geheel aan. Een coding agent besteedt niet een paar honderd tokens aan een vraag; hij voert een lange, redeneerintensieve conversatie met zichzelf, en elk token van die conversatie wordt gegenereerd.

Zet nu de andere kant van het grootboek ernaast. FrogNano-4B-2609 is 9,32 GB aan BF16-gewichten in twee shards, downloadbaar zonder gate. Het serveren ervan vraagt om SGLang met een Qwen3 reasoning-parser en een Qwen3 coder tool-call-parser, plus een geïsoleerde sandbox voor de vijf tools. Daarna zijn de marginale kosten van een traject elektriciteit, en het geheugen dat het inneemt is hoe groot je context wordt, in plaats van wat de gewichten wegen.

• Kostenmodel — FrogNano-4B-2609 heeft vaste hardwarekosten en bijna nul marginale kosten. Qwen3.8-Max heeft nul vaste kosten en facturering per token, met een splitsing van $2.00 / $6.00 die niets vooraf belast en alles achteraf tegen het outputtarief belast.

• Wat het geld oplevert — een agent van de 4B-klasse op je eigen hardware, tegenover een model van frontier-schaal waarvoor je nooit capaciteit hoeft te plannen.

• Break-even — dat wordt bereikt wanneer je maandelijkse trajectvolume keer de gemiddelde tokenrekening per traject de kosten overschrijdt van de GPU die je anders zou huren. Voor een team dat een handvol repositorytaken per dag draait, ligt die grens nog ver weg en wint het gehoste model het puur op gebruiksgemak.

Twee modellen die niet hetzelfde werk doen.

De kostenvergelijking is alleen eerlijk als de uitkomsten vergelijkbaar zijn, en dat zijn ze hier niet, en dat is nu juist het deel dat de meeste specificatiebladen verbergen.

FrogNano-4B-2609 is uitsluitend post-getraind op software-engineering op repositoryniveau. De volledige interface bestaat uit een lus van vijf tools — Read, Write, Edit, Glob en Bash — uitgevoerd door de Leaf-harness in een geïsoleerde sandbox, die blijft itereren tot het model stopt met aanroepen. In de kaart van Microsoft staat Engels als ondersteunde taal en Python als gevalideerd programmeerdomein, en er staat ronduit dat de beeld- en videocomponenten in het checkpoint nooit post-getraind zijn en niet worden ondersteund. Het redeneert niet over je architectuur, beantwoordt geen vragen over je bedrijf en leest geen schermafbeelding.

Qwen3.8-Max is een algemeen model. Het catalogusrecord van Alibaba geeft het tekst-, beeld- en video-invoer met tekstuitvoer en een contextvenster van 1.000.000 tokens. Het redeneert, schrijft, leest documenten en voert een gesprek, en de functieaanroep is een kenmerk van een algemeen model in plaats van het hele doel van het checkpoint. De Artificial Analysis-cijfers, afgelezen uit het record op 2 september 2026, zijn een Intelligence Index van 45,4 en een Coding Index van 76,2.

• Invoer — FrogNano-4B-2609 is alleen tekst. Qwen3.8-Max ondersteunt tekst, afbeeldingen en video.

• Context — ongeveer 131K gecombineerde tokens voor FrogNano's geëvalueerde configuratie, tegenover 1,000,000 voor Qwen3.8-Max. Dat is een factor zeven en een half, en het is het belangrijkst voor precies de inputs ter grootte van een repository die een codingagent krijgt.

• Uitvoer per beurt — De gevalideerde configuratie van FrogNano beperkt een enkele beurt van de assistent tot 8.192 tokens. Qwen3.8-Max publiceert geen gelijkwaardig maximum per antwoord.

• Uitvoerformaat — FrogNano zendt gestructureerde Leaf-toolaanroepen uit en heeft een harness nodig om ze uit te voeren. Qwen3.8-Max retourneert proza of een functieaanroep naar welke client je al hebt.

• Onafhankelijke scores — geen enkele voor FrogNano-4B-2609 buiten zijn eigen kaart; de cijfers van Qwen3.8-Max hierboven zijn van derden, afkomstig van Artificial Analysis.

• Parameters — ongeveer 4,66B voor FrogNano volgens de eigen beschrijving op zijn kaart, tegenover 2,4 biljoen totaal en ruwweg 95B actief voor Qwen3.8-Max.

A screenshot of the OrcaRouter model page for Qwen3.8 Max showing the breadcrumb Home, Models, Qwen; the model name and the qwen/qwen3.8-max model id; the FEATURED badge with Vision, Tools, JSON and Reasoning capability chips; the 1M-token context, text, image and video input and text output row; the $2.00 and $6.00 per-million price cards with the p50 TTFT figure; the byline 'by Qwen, 2026-08-03'; the on-page section list for Code samples, Pricing, Performance, Public benchmarks, Community buzz, How it compares and FAQ; and the opening of the long description describing Qwen3.8-Max as Alibaba's newest flagship.

Waar de 4B echt zijn plek verdient

Er is één as waarop een 4B-agent een frontiermodel ronduit verslaat, en dat is niet nauwkeurigheid.

De paper van FrogNano begint bij Qwen3.5-4B, dat als een gewoon algemeen model 39,4% scoorde op SWE-bench Verified via de Leaf-harness. Vijf iteraties van reinforcement learning op ongeveer 1.500 synthetische taken brachten het naar 61,5%, waarbij de appendix van dezelfde paper de progressie per iteratie rapporteert als 48,2%, 53,4%, 58,3%, 58,6% en 61,6%. De methode — het genereren van taken die zijn gekalibreerd op de leerbaarheidsgrens van het huidige beleid, zonder distillatie van een sterker model — is de bijdrage, en de reden waarom een onderzoeksgroep zonder budget voor frontier-modellen zich hiervoor zou interesseren.

Lees wat dat impliceert voor de vergelijking. De kaart van Microsoft is openhartig over het feit dat FrogNano niet in alle opzichten beter is dan het model waar het vandaan komt: het percentage parallelle tool-calls is 1,71%, omdat latere iteraties het vermogen verloren om gelijktijdige calls af te vuren, en het team voegde een consolidatiefase toe om het te proberen te herstellen. Een model dat meer problemen oplost terwijl het slechter wordt in één specifiek gedrag, is een echt engineering-artefact met zichtbare naden, en de kaart ervan zegt dat ook in plaats van het te verbergen.

En het SWE-bench-getal is een gesloten circuit. De baseline van het basismodel, het testharnas en de eindscore komen allemaal uit hetzelfde lab, en de twee tabellen in hetzelfde artikel geven twee verschillende ladders voor hetzelfde experiment. De codeerscore van Qwen3.8-Max daarentegen is geproduceerd door Artificial Analysis in plaats van door Alibaba — een ander soort bewijs, een ander soort vertrouwen, en die twee mogen nooit van elkaar worden afgetrokken.

De 4B waar je nog niet helemaal omheen kunt plannen

Twee dingen staan tussen FrogNano-4B-2609 en een plek in productie, en beide staan in zijn eigen documentatie in plaats van in de mening van een reviewer.

Het eerste is hardware. De kaart geeft de BF16-gewichtsvereiste als ongeveer 9,3 GB en voegt er dan aan toe dat geheugen "aanzienlijk toeneemt naarmate de gecombineerde context ongeveer 131K tokens nadert", voordat wordt gesteld dat het exacte minimale GPU-model, de VRAM-configuratie, runtime-versies en het prestatieprofiel "nog moeten worden gevalideerd vóór release" — een zin die op een al downloadbaar model staat. Niemand heeft een VRAM-cijfer gepubliceerd voor de geëvalueerde configuratie, en de kaart bevat er geen.

Het tweede is de veiligheidshouding. Microsofts eigen alignmentnotitie zegt dat de agentspecifieke post-training geen datasets voor veiligheidsvoorkeuren, weigeringen of schadelijke inhoud gebruikte, noch adversariële datasets, dat het in plaats daarvan optimaliseerde voor functionele correctheid en het vermijden van regressies, en dat het model "niet als onafhankelijk veiligheidsafgestemd mag worden beschouwd voor onbeperkte autonome inzet". De modelkaart sluit af met het benoemen van de concrete risico's: patches kunnen onjuist of onveilig zijn, zelfs als ze hun tests doorstaan, de prestatie is gevoelig voor de kwaliteit van die tests, en elke kandidaat-patch vereist gekwalificeerde menselijke beoordeling en onafhankelijke regressie- en beveiligingstests voordat deze wordt gebruikt. Een algemeen gehost model kent geen van die specifieke kanttekeningen, en het zal ook geen shellcommando in je repository uitvoeren.

Eén sleutel voor welke kant je ook kiest

Het handige aan het uitvoeren van deze vergelijking in de praktijk is dat slechts één helft ervan een download is. Qwen3.8-Max, en de algemene modellen waarmee je een zelfgehoste agent zou benchmarken, zijn allemaal bereikbaar via één OpenAI-compatibel endpoint op OrcaRouter met 0% opslag — de lijstprijs van de provider wordt doorberekend, dus een prijswijziging van een leverancier komt dezelfde dag bij ons terecht, wat het getal is dat daadwerkelijk verandert wanneer de outputtokenrekening van een coderingsagent het ding is dat je probeert te beheersen. Dat maakt ook de failovervraag eenvoudig: als de gehoste helft van je pipeline degradeert, de nieuwe poging is automatisch en het experiment gaat verder.

FrogNano-4B-2609 is geen van onze routes en er is geen datum voor. De gewichten zijn van jou om te serveren, en de kaart geeft eerlijk aan dat de serveerconfiguratie niet volledig is gevalideerd. Wat we kunnen doen, is het opzetten van de andere kant van de vergelijking gratis maken, zodat de vraag die je uiteindelijk beantwoordt de echte is — of een door de leverancier gerapporteerde SWE-bench-agent van 61,5% op je eigen GPU een op verbruik gefactureerd frontier-model verslaat op je eigen taken, bij jouw eigen volume.

A generated two-column scoreboard titled 'FrogNano-4B-2609 vs Qwen3.8-Max'. The left column reads Cost your GPU, electricity; Output tool calls and patches; Context about 131K evaluated; Input text only; Published score 61.5% SWE-bench Verified, vendor, unreproduced; Turn cap 8,192 tokens. The right column reads Cost $2.00 in / $6.00 out per million; Output prose or function call; Context 1,000,000 tokens; Input text, image, video; Published score AA Intelligence 45.4 and AA Coding 76.2, third-party; Turn cap not published. A footer reads 'FrogNano figures per Microsoft; Qwen3.8-Max scores per Artificial Analysis. Different benchmarks; not comparable.'

Welke moet je pakken?

Grijp naar Qwen3.8-Max wanneer het werk algemeen is, wanneer het operations-team van iemand anders de capaciteit zou moeten dragen, wanneer de input een afbeelding of een lang document kan bevatten, of wanneer je vandaag een antwoord nodig hebt in plaats van een servingstack tegen vrijdag. De scores van derden betekenen dat je ongeveer kunt voorspellen wat je koopt, en de rekening per token is een variabele kostenpost die je kunt zien voordat je je vastlegt. Voor een team dat per maand een bescheiden aantal repositorytaken uitvoert, is de rekensom niet eens close.

Kies FrogNano-4B-2609 wanneer het volume groot genoeg is dat facturering per token bij lange trajecten de beperkende factor is, wanneer de data je infrastructuur niet mogen verlaten, of wanneer de onderzoeksvraag — kan een kleine agent zonder leraar tot competentie op repositoryniveau worden getraind — precies het ding is dat je eigenlijk aan het testen bent. Begin met de wetenschap van drie dingen: die 61,5% is de eigen meting van een lab op een door dat lab onderhouden harness, niemand heeft een VRAM-cijfer gepubliceerd voor de geëvalueerde configuratie, en op de kaart zelf staat dat de serveeropstelling nog niet is gevalideerd.

Wat deze combinatie de moeite van het beschrijven waard maakt, is dat ze twee generaties terug een gemeenschappelijke voorouder delen. FrogNano stamt af van Qwen3.5-4B — een algemeen model van hetzelfde bedrijf waarvan het vlaggenschip met 2,4 biljoen parameters aan de andere kant van deze pagina staat. Microsoft nam de kleine, besteedde vijf RL-iteraties aan synthetische repositories en kreeg een specialist. Alibaba koos de andere weg en schaalde op. Beide antwoorden zijn gepubliceerd, en het verschil tussen wat de download kost en wat de API kost is de eerlijke manier om tussen beide te kiezen.

A screenshot of the microsoft/FrogNano GitHub repository README showing the description that FrogNano evaluates coding agents with the Leaf harness in isolated Kubernetes sandboxes against OpenAI-compatible endpoints and five tools Read, Write, Edit, Glob and Bash; the requirements list naming a Kubernetes cluster with pod and network-policy permissions and an OpenAI-compatible endpoint with reasoning and tool-call parsers configured for Qwen3.5; the frognano-eval run commands; and the benchmark table listing SWE-bench Verified at 500 tasks with an 8,192-token cap, SWE-bench Pro at 731 with 32,000, Terminal-Bench 2.0 Verified at 89 with 32,000 and PatchEval Verified at 230 with 8,192.

Vergeleken in dit artikel1

Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt