
FrogNano-4B-2609 vs Qwen 3.8: Vad en kodagent kostar när vikterna är dina
- openaiNYOpenAI: GPT-6.1 Sol2026-09-2952Intelligens
- anthropicNYAnthropic: Claude Sonnet 5.52026-09-2856Intelligens
- typesafeNYTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M tokens · 219 tok/s
- OpenAINYOpenAI: GPT-6 Luna2026-09-2238Intelligens
- OpenAINYOpenAI: GPT-6 Sol2026-09-2248Intelligens
- AnthropicNYAnthropic: Claude Opus 5.52026-09-2258Intelligens
- xAINYGrok 4.72026-09-2146Intelligens
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1M tokens · 114 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M tokens · 1064 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligens76Kodning
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M tokens · 41 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens · 105 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M tokens · 213 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
microsoft/FrogNano-4B-2609 är en repositorieagent i fyramiljardklassen som härstammar från Qwen3.5-4B och som du själv laddar ner och driftar. Qwen3.8-Max är den hostade flaggskeppsmodellen – en gles mixture-of-experts-modell med 2,4 biljoner parametrar, varav ungefär 95 miljarder parametrar aktiva per token, ett multimodalt fönster på en miljon token och en prislista på 2,00 USD per miljon indatatoken och 6,00 USD per miljon utdatatoken – åtkomlig med en API-nyckel sedan 3 augusti 2026. Den ena kostar en GPU och en eftermiddag. Den andra kostar ingenting förrän du använder den, och debiterar sedan per token på de längsta trajektorierna i allmänt bruk. Den avvägningen, och inte benchmarktabellen, är den verkliga matchen.
Siffrorna för FrogNano här kommer från Microsofts modellkort och tekniska rapport; siffrorna för Qwen3.8-Max kommer från Alibabas publicerade prissättning och modellposten i vår egen katalog, med de oberoende poängen märkta som Artificial Analysis-siffror var de än förekommer. Notera namngivningen noga: Qwen3.8, utgåvan med öppna vikter, har annonserats men inte släppts, medan Qwen3.8-Max är live och prissatt idag. Allt som går att anropa i den här artikeln är det senare.
Aritmetiken som avgör jämförelsen
Börja med vad en enskild uppgift kostar, för det är inte självklart och det är inte litet.
FrogNanos utvärderingar körde varje trajektoria med en budget på 150 steg inom ungefär 131K kombinerade tokens, med upp till 8 192 genererade tokens per assistenttur och ett tak på 10 800 sekunder. Multiplicera de två publicerade gränserna och du får ett tak på omkring 1,23 miljoner genererade tokens för en trajektoria i värsta fallet – vilket med Qwen3.8-Maxs $6,00 per miljon utdatatokens är ungefär $7,38 för en enda uppgift som kördes ända till slutet av sin budget. Det är aritmetik på två publicerade siffror, inte en mätning: verkliga trajektorier stannar tidigt, genomsnittet ligger långt under taket, och verktygsresultat och shell-utdata debiteras enligt den billigare indatatakten i stället för utdatatakten. Men det fastställer formen på saken. En kodagent spenderar inte några hundra tokens på en fråga; den spenderar en lång, resonemangstung konversation med sig själv, och varje token i den konversationen genereras.
Lägg nu den andra sidan av liggaren bredvid den. FrogNano-4B-2609 är 9,32 GB BF16-vikter i två shards, nedladdningsbara utan åtkomstgrind. Att servera det kräver SGLang med en Qwen3-resoneringsparser och en Qwen3 coder-parser för verktygsanrop, plus en isolerad sandlåda för de fem verktygen. Därefter är marginalkostnaden för en trajektoria el, och minnet den upptar är vad din kontext växer till snarare än vad vikterna väger.
• Kostnadsmodell — FrogNano-4B-2609 har fast hårdvarukostnad och nära noll marginell kostnad. Qwen3.8-Max har noll fast kostnad och fakturering per token, med en $2.00 / $6.00-uppdelning som inte förskottsbelastar något och efterskottsbelastar allt till utdatapriset.
• Vad pengarna köper — en agent i 4B-klassen på din egen hårdvara, mot en modell i frontier-skala som du aldrig behöver kapacitetsplanera för.
• Break-even – den nås när din månatliga trajektorievolym gånger den genomsnittliga tokenkostnaden per trajektoria överstiger kostnaden för den GPU du annars skulle hyra. För ett team som kör en handfull repository-uppgifter om dagen ligger den gränsen långt bort, och den hostade modellen vinner enbart på bekvämlighet.
Två modeller som inte gör samma jobb
Kostnadsjämförelsen är bara rättvis om utdata är jämförbara, och här är de inte det, vilket är den del som de flesta specifikationsblad begraver.
FrogNano-4B-2609 eftertränades uteslutande på mjukvaruteknik på repositorienivå. Hela dess gränssnitt är en loop med fem verktyg — Read, Write, Edit, Glob och Bash — som körs av Leaf-harnessen i en isolerad sandbox och itererar tills modellen slutar anropa. Microsofts kort anger att dess språkstöd är engelska och att dess validerade programmeringsdomän är Python, och säger rent ut att bild- och videokomponenterna i checkpointen aldrig eftertränades och inte stöds. Den resonerar inte om din arkitektur, svarar inte på frågor om din verksamhet och läser inte en skärmbild.
Qwen3.8-Max är en allmän modell. Alibabas katalogpost anger att den har text-, bild- och videoinmatning med textutmatning och ett kontextfönster på 1 000 000 token. Den resonerar, skriver, läser dokument och för en konversation, och dess funktionsanrop är en egenskap hos en allmän modell snarare än hela poängen med checkpointen. Dess Artificial Analysis-siffror, hämtade från posten den 2 september 2026, är ett Intelligence Index på 45,4 och ett Coding Index på 76,2.
• Indata — FrogNano-4B-2609 är endast text. Qwen3.8-Max tar text, bilder och video.
• Kontext — ungefär 131K kombinerade token för FrogNanos utvärderade konfiguration, jämfört med 1 000 000 för Qwen3.8-Max. Det är en faktor på sju och ett halvt, och det spelar störst roll för just de indata i kodförrådsstorlek som en kodagent får.
• Utdata per tur — FrogNanos validerade konfiguration begränsar en enskild assistenttur till 8 192 token. Qwen3.8-Max publicerar inget motsvarande tak per svar.
• Utdataformat — FrogNano avger strukturerade Leaf-verktygsanrop och behöver ett körningsramverk för att exekvera dem. Qwen3.8-Max returnerar prosa eller ett funktionsanrop till vilken befintlig klient du än har.
• Oberoende poäng – inga för FrogNano-4B-2609 utöver dess eget kort; siffrorna för Qwen3.8-Max ovan är tredjepartsuppgifter från Artificial Analysis.
• Parametrar – cirka 4,66 miljarder för FrogNano enligt beskrivningen på dess eget kort, mot 2,4 biljoner totalt och ungefär 95 miljarder aktiva för Qwen3.8-Max.

Där 4B faktiskt förtjänar sin plats
Det finns en axel där en 4B-agent slår en frontiermodell rakt av, och det handlar inte om noggrannhet.
FrogNanos artikel utgår från Qwen3.5-4, som fick 39,4 % på SWE-bench Verified via Leaf-ramverket som en vanlig generell modell. Fem iterationer av förstärkningsinlärning på ungefär 1 500 syntetiska uppgifter förde den till 61,5 %, och appendix i samma artikel rapporterade resultaten per iteration som 48,2 %, 53,4 %, 58,3 %, 58,6 % och 61,6 %. Metoden – att generera uppgifter kalibrerade mot den aktuella policyns inlärbarhetsfront, utan destillation från en starkare modell – är bidraget, och anledningen till att en forskargrupp med frontier-modellbudget skulle bry sig.
Läs vad det innebär för jämförelsen. Microsofts kort är uppriktigt om att FrogNano inte är genomgående bättre än modellen den kom från: dess andel parallella verktygsanrop är 1,71 %, eftersom senare iterationer förlorade förmågan att skicka samtidiga anrop, och teamet lade till ett konsolideringssteg för att försöka återställa den. En modell som löser fler problem men blir sämre på ett specifikt beteende är en verklig ingenjörsartefakt med synliga sömmar, och dess kort säger det i stället för att begrava det.
Och SWE-bench-siffran är en sluten krets. Basmodellens baslinje, testramverket och slutpoängen kommer alla från samma labb, och de två tabellerna i samma artikel ger två olika stegar för samma experiment. Kodningssiffran för Qwen3.8-Max togs däremot fram av Artificial Analysis snarare än av Alibaba – en annan typ av bevis, en annan typ av tillförlitlighet, och de två bör aldrig subtraheras från varandra.
4B:et du ännu inte riktigt kan planera runt
Två saker står mellan FrogNano-4B-2609 och en produktionsplats, och båda finns i dess egen dokumentation snarare än i någon granskares åsikt.
Det första är hårdvara. Kortet anger BF16-viktkravet till omkring 9,3 GB och tillägger sedan att minnet ”ökar betydligt när den kombinerade kontexten närmar sig ungefär 131K tokens”, innan det konstaterar att den exakta lägsta GPU-modellen, VRAM-konfigurationen, körtidsversionerna och prestandaprofilen ”fortfarande måste valideras före släpp” – en mening som förekommer på en modell som redan går att ladda ner. Ingen har publicerat någon VRAM-siffra för den utvärderade konfigurationen, och kortet innehåller ingen sådan.
Den andra är säkerhetshållningen. Microsofts egen anteckning om alignment säger att den agentspecifika efterträningen använde inga dataset för säkerhetspreferenser, vägran, skadligt innehåll eller adversariella data, att den i stället optimerades för funktionell korrekthet och undvikande av regressioner, och att modellen "inte bör betraktas som oberoende säkerhetsalignerad för obegränsad autonom driftsättning". Kortet avslutar med att namnge de konkreta riskerna: patchar kan vara felaktiga eller osäkra trots att de klarar sina tester, prestandan är känslig för kvaliteten på dessa tester, och varje kandidatpatch kräver kvalificerad mänsklig granskning och oberoende regressions- och säkerhetstestning före användning. En allmän hostad modell har inga av dessa specifika förbehåll, och den kommer inte heller att köra ett shell-kommando i ditt kodförråd.
En nyckel för vilken sida du än väljer
Det användbara med att köra den här jämförelsen i praktiken är att bara ena hälften av den är en nedladdning. Qwen3.8-Max, och de generella modeller som du skulle benchmarka en självhostad agent mot, är alla nåbara via en OpenAI-kompatibel slutpunkt på OrcaRouter med 0 % påslag — leverantörens listpris förs vidare, så en leverantörsprisändring landar hos oss samma dag, vilket är siffran som faktiskt rör sig när det du försöker kontrollera är en kodagents output-token-kostnad.sker återförsöket automatiskt och experimentet fortsätter.
FrogNano-4B-2609 är inte en av våra rutter och det finns inget datum för den. Vikterna är dina att servera, och kortet är uppriktigt om att serveringskonfigurationen inte har fullt ut validerats. Det vi kan göra är att se till att den andra sidan av jämförelsen inte kostar något att sätta upp, så att frågan du till slut besvarar är den verkliga – huruvida en 61,5 % leverantörsrapporterad SWE-bench-agent på din egen GPU slår en mätarbaserad frontier-modell på dina egna uppgifter, vid din egen volym.

Vilken att välja
Vänd dig till Qwen3.8-Max när arbetet är allmänt, när någon annans driftsteam bör stå för kapaciteten, när indata kan innehålla en bild eller ett långt dokument, eller när du behöver ett svar i dag i stället för en serveringsstack till fredag. Dess poäng från tredje part innebär att du på ett ungefär kan förutse vad du köper, och kostnaden per token är en rörlig kostnad du kan se innan du binder dig. För ett team som kör ett måttligt antal repository-uppgifter i månaden är kalkylen inte ens nära.
Välj FrogNano-4B-2609 när volymen är tillräckligt hög för att fakturering per token på långa trajektorier är begränsningen, när data inte kan lämna din infrastruktur, eller när forskningsfrågan – kan en liten agent tränas till kompetens på repo-nivå utan en lärare – är det du faktiskt testar. Gå in med vetskapen om tre saker: 61,5 % är ett labs egen mätning på en labbunderhållen testrigg, ingen har publicerat en VRAM-siffra för den utvärderade konfigurationen, och kortet självt säger att serveringsuppsättningen ännu inte är validerad.
Det som gör att paret är värt att skriva om är att de delar en förfader två generationer bakåt. FrogNano härstammar från Qwen3.5-4B – en allmän modell från samma företag vars flaggskepp med 2,4 biljoner parametrar finns på andra sidan av den här sidan. Microsoft tog den lilla, lade fem RL-iterationer på syntetiska repositorier och fick en specialist. Alibaba gick motsatt väg och skalade upp. Båda svaren är publicerade, och gapet mellan vad nedladdningen kostar och vad API:et kostar är det ärliga sättet att välja mellan dem.

Jämförda i den här artikeln1
Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen
