
FrogNano-4B-2609 vs LFM2.5 2.6B Base: een afgewerkte specialist en een zak voorgetrainde gewichten
- openaiNIEUWOpenAI: GPT-6.1 Sol2026-09-2952Intelligentie
- anthropicNIEUWAnthropic: Claude Sonnet 5.52026-09-2856Intelligentie
- typesafeNIEUWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 mln tokens · 219 tok/s
- OpenAINIEUWOpenAI: GPT-6 Luna2026-09-2238Intelligentie
- OpenAINIEUWOpenAI: GPT-6 Sol2026-09-2248Intelligentie
- AnthropicNIEUWAnthropic: Claude Opus 5.52026-09-2258Intelligentie
- xAINIEUWGrok 4.72026-09-2146Intelligentie
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1 mln tokens · 114 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens · 1064 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 mln tokens · 41 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens · 105 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens · 213 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
Typ een vraag in LFM2.5 2.6B Base en het zal je zin aanvullen in plaats van er antwoord op te geven. Dat is geen defect — Liquid AI heeft het gepubliceerd als het vooraf getrainde checkpoint onder de LFM2.5-familie, waarbij instruction tuning bewust aan de niet-Base-tegenhanger is overgelaten, en de modelkaart zegt duidelijk dat het bedoeld is voor intensieve fine-tuning. Microsofts FrogNano-4B-2609 is hoe het andere uiteinde van die pijplijn eruitziet: hetzelfde soort kleine taalmodel, dat vijf iteraties reinforcement learning op synthetische repositorytaken heeft ondergaan tot het gestructureerde tool calls en kandidaat-patches via een harnas met vijf tools uitstuurt. Geen van beide heeft een gepubliceerde onafhankelijke benchmark. Het verschil is dat bij een van de twee de post-training is afgerond, en weten welke dat is, is de hele beslissing.
De onderstaande FrogNano-cijfers zijn afkomstig uit de modelkaart en het technische rapport van Microsoft. De LFM-cijfers zijn afkomstig uit de kaart van Liquid AI, de bijbehorende architectuurconfiguratie en het licentiebestand. Elk getal dat aan een van beide leveranciers wordt toegeschreven, is aangeduid als door de leverancier gerapporteerd, en geen van deze modellen heeft een evaluatie door een derde partij ondergaan — voor LFM2.5 2.6B Base is dat grotendeels bewust, aangezien een checkpoint zonder instructietuning geen eerlijk doelwit is voor een chatbenchmark.
De vergelijking werkt alleen als je weet wat je aan het vergelijken bent.
Leg de twee specificatiebladen naast elkaar en het eerste dat misgaat, is het aantal parameters. LFM2.5 2.6B Base heeft 2,69 miljard dense parameters in 30 lagen — 22 double-gated short-convolution-blokken en 8 grouped-query-attention-lagen, getraind op ongeveer 34 biljoen tokens in 16 talen, met een vocabulaire van 128.000 tokens en een context van 131.072 tokens. De gequantiseerde versie komt uit op ongeveer 1,67 GB in Q4_K_M.
De modelkaart van FrogNano-4B-2609 geeft het parameterveld weer als het bereik "500M-5B", en de modelsamenvatting beschrijft het model als ongeveer 4,66 miljard. De download beslecht de discussie: twee safetensors-shards met in totaal 9,32 GB aan BF16-gewichten, 738 tensors, op een geërfde, dense 32-laagse hybride Gated DeltaNet- en gated-attention-stack. Een 24-laagse visietoren zit in het checkpoint en heeft nooit een post-training ondergaan.
Dus de grootteverhouding is ongeveer 1,7 tegen 1, en de geheugenverhouding ligt dichter bij 5,6 tegen 1 zodra kwantisatie in beeld komt. Dat verschil weegt zwaarder dan de parameterlijn, want beide modellen zijn kandidaten voor self-hosting in plaats van endpoints — en dat is de enige reden dat ze in hetzelfde artikel thuishoren.
• Beoogd gebruik — LFM2.5 2.6B Base is grondstof voor een fine-tuning-run. FrogNano-4B-2609 is een voltooide policy voor software-engineering op repositoryniveau binnen de Leaf-harness.
• Instructieopvolging — LFM2.5 2.6B Base heeft dit niet out of the box; de kaart van Liquid AI raadt het aan voor taken die zware fine-tuning vereisen. FrogNano-4B-2609 volgt een taakbeschrijving en stuurt gestructureerde tool calls uit, omdat dat precies is waarop zijn RL-doelstelling is getraind.
• Context — 131.072 tokens voor LFM2.5 2.6B Base, tegenover ongeveer 131K gecombineerde tokens voor FrogNano's geëvalueerde configuratie. Nominaal identiek, maar FrogNano's venster moet toolresultaten, shell-uitvoer en testlogs bevatten, niet alleen een prompt.
• Uitvoerplafond — FrogNano's gevalideerde configuratie staat 8.192 gegenereerde tokens per assistentbeurt toe. LFM2.5 2.6B Base publiceert geen equivalent, aangezien het niet gebouwd is om een antwoord te beëindigen.
• Modaliteit — beide zijn alleen tekst. De visiecomponenten van FrogNano zijn overgenomen en expliciet niet ondersteund; LFM2.5 2.6B Base is door zijn constructie tekst-in, tekst-uit.
• Licentie — LFM2.5 2.6B Base valt onder de LFM Open License v1.0, die gratis is onder $10M jaarlijkse omzet en een aparte licentie vereist op of boven die grens, waarbij afgeleide werken de limiet erven. Op de kaart van FrogNano staat MIT in het voorwerk en Apache 2.0 in de hoofdtekst.
Het ding waarvoor Microsoft betaalde, en het ding waarvoor je zelf zou moeten betalen
Dit is het dragende gedeelte, want dit is het gedeelte waar een specificatievergelijking misleidend is.
De volledige toegevoegde waarde van FrogNano-4B-2609 zit in post-training, en Microsoft heeft de methode gepubliceerd. Begin met Qwen3.5-4B, dat als algemeen model 39,4% scoorde op SWE-bench Verified via de Leaf-harness. Genereer kandidaattaken voor repositories uit echte snapshots, voer rollouts uit vanaf het huidige checkpoint om taken te vinden die het soms oplost, behoud die, train, en herhaal — vijf iteraties, ruwweg 1.500 gevalideerde synthetische omgevingen in totaal, en op geen enkel moment distillatie uit een groter model. Het resultaat op Microsofts eigen modelkaart is 61,5% op SWE-bench Verified, 37,6% op SWE-bench Pro, 31,1% op Terminal-Bench 2.0 en 47,3% op PatchEval-Verified. De efficiëntiebijlage van het artikel rapporteert dezelfde stijging als 48,2%, 53,4%, 58,3%, 58,6% en 61,6% over de iteraties, wat een nuttige herinnering is dat zelfs de twee eigen tabellen van het lab van hetzelfde experiment niet overeenstemmen over de treden.
Leg dat nu naast LFM2.5 2.6B Base. Het is het checkpoint voordat dat werk begint. De aanbeveling op zijn eigen modelkaart — fine-tune het — is precies het werk dat FrogNano documenteert: een taakomgeving, een uitvoerbare beloning, een harness die langer meegaat, en verschillende trainingsiteraties tegen een veranderend beleid. De paper beweert niet dat dat gemakkelijk is. Er wordt in gerapporteerd dat tussentijdse checkpoints steeds duurder werden om te trainen naarmate redeneersporen langer werden, dat er een straf op loglengte moest worden toegevoegd om de drift te stoppen, en dat latere iteraties het vermogen voor parallelle tool-aanroepen kwijtraakten dat het basismodel had, en eindigden op een snelheid van gelijktijdige aanroepen van 1,71%. Iedereen die het FrogNano-recept op een andere 2.6B-basis wil toepassen, moet specifiek budget inruimen voor die drie problemen.
Wat LFM2.5 2.6B Base je oplevert, is een ander soort voorsprong: een pretrainingsbudget van 34 biljoen tokens, een gedocumenteerde hybride architectuur, een bestaande gekwantiseerde build, en een gedocumenteerde context van 131.072 tokens, allemaal in een formaat dat draait op hardware waar een BF16-checkpoint van 9,32 GB niet op zou passen. Als je taak smal genoeg is dat een kleine fine-tune het wint van een algemeen model, dan is dat een echte positie — en zo niet, dan heb je jezelf een trainingsrun bespaard.

Wat je hoe dan ook moet bouwen
Geen van beide is een netwerkoproep, en dat is bepalender voor de praktische vergelijking dan welke specificatierij dan ook.
LFM2.5 2.6B Base wil een inferentieruntime en een trainingsrun. De modelkaart van Liquid AI vermeldt builds in native-format, GGUF, ONNX en MLX, dus de serverende helft is goed gedekt — llama.cpp op een laptop is een echte optie voor de gekwantiseerde checkpoint. De trainingshelft is aan jou: data, doelstelling, evaluatie en een manier om te bepalen of het resultaat beter is geworden of alleen maar anders.
FrogNano-4B-2609 wil een OpenAI-compatibel endpoint met de juiste parsers en een Kubernetes-cluster met toestemming om pods en netwerkbeleid te beheren. De README van Microsoft is ongewoon direct dat de harness een afhankelijkheid is in plaats van een gemak, en de kaart stelt dat identieke scores een overeenkomstige checkpoint, tokenizer, serveerconfiguratie, taakimages en evaluatieprotocol vereisen. Configuratie is hier geen detail — serveer het zonder een Qwen3 reasoning-parser en een Qwen3 coder tool-call-parser en het model schrijft proza waar de harness een tool call verwacht.
Dat is de vorm van deze confrontatie: aan de ene kant een trainingsproject met een klein servingprobleem; aan de andere kant een servingproject met een groot evaluatieprobleem en geen training meer te doen. Het zijn beide avonden werk. Slechts één ervan is avonden werk dat kan eindigen in "het model is niet goed genoeg", zonder dat het jouw schuld is.

Waar een freesmachine zijn plek verdient in een project als dit
Beide modellen belanden uiteindelijk in een pijplijn die ook iets gehosts aanroept. De eigen evaluatieopstelling van FrogNano is het bewijs: de Leaf-harness praat met een OpenAI-compatibele endpoint, wat betekent dat het model dat wordt getest en elk model waarmee je het vergelijkt via dezelfde interface worden bereikt. Dat is een patroon dat het waard is om te kopiëren, zelfs als de reden alleen hygiëne is, en dat is waar één enkele endpoint iets concreets doet.
OrcaRouter biedt meer dan 200 modellen achter één OpenAI-compatibele sleutel met 0% opslag, zodat lijstprijzen van providers ongewijzigd doorstromen en een prijswijziging van een leverancier dezelfde dag aan onze kant live is — dat is het cijfer dat er echt toe doet wanneer je beslist of een zelfgehoste specialist een gehost algemeen model verslaat op kosten per taak. Automatische failover dekt de gehoste helft van die vergelijking, niet de checkpoint die je zelf serveert. We hosten FrogNano-4B-2609 of LFM2.5 2.6B Base niet; beide zijn downloads. Wat een routeringslaag wegneemt, is de tweede integratie telkens wanneer de gehoste kant van je benchmark verandert.
Eentje kiezen, eerlijk gezegd
Kies LFM2.5 2.6B Base als je taak nauw is, je hardware klein is en je bereid bent de verantwoordelijkheid voor de trainingsrun zelf te nemen — de licentie is gratis onder $10M omzet, de gequantiseerde build is 1,67 GB, en Liquid AI's eigen kaart beveelt het precies hiervoor aan. De afweging is dat je een startpunt krijgt, geen vermogen: niets in de release vertelt je wat een FrogNano-vormige RL-run erbovenop zou scoren, en niemand heeft er een gepubliceerd.
Kies FrogNano-4B-2609 als de taak software-engineering op repositoryniveau is en je wilt dat de post-training al is gedaan. De 61,5%, 37,6%, 31,1% en 47,3% zijn echte gepubliceerde resultaten van een lab dat zijn methode in detail heeft beschreven — en ze zijn op dit moment ook een gesloten cirkel: hetzelfde lab, dezelfde harness, dezelfde baseline van het basismodel. De download van 9,32 GB, de afhankelijkheid van de harness en de samengestelde licenties zijn de prijs voor het overslaan van een trainingsproject dat je anders zou moeten uitvoeren.

De nuttige reframing is dat dit geen concurrenten zijn. LFM2.5 2.6B Base staat stroomopwaarts van een proces dat iets als FrogNano-4B-2609 heeft voortgebracht. Als je jezelf tussen beide ziet kiezen, is de echte vraag of jouw probleem het waard is om er een eigen trainingsrun voor op je te nemen — en als het antwoord nee is, is de 4B-checkpoint met de harness, de gepubliceerde methode en de door de leverancier gerapporteerde SWE-bench-ladder degene die kant-en-klaar aankomt.
