Een gegenereerde titelkaart met de tekst 'FrogNano-4B-2609 vs LFM2.5 2.6B Base' en het ondertitel 'een afgeronde 4B-agent tegenover een voorgetrainde checkpoint van 2,69B', drie chips met de tekst 'RL-na-training voltooid', 'alleen voortraining, 2,69B dense in 30 lagen' en 'geen instructie-tuning', een voettekst met de tekst 'Beide kolommen door de leverancier gerapporteerd; geen enkele derde partij heeft een van beide modellen gescoord', en het OrcaRouter-logo samengevoegd in de rechteronderhoek.
Engineering & Research

FrogNano-4B-2609 vs LFM2.5 2.6B Base: een afgewerkte specialist en een zak voorgetrainde gewichten

Auteur

Elias Hawthorne

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen →
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Typ een vraag in LFM2.5 2.6B Base en het zal je zin aanvullen in plaats van er antwoord op te geven. Dat is geen defect — Liquid AI heeft het gepubliceerd als het vooraf getrainde checkpoint onder de LFM2.5-familie, waarbij instruction tuning bewust aan de niet-Base-tegenhanger is overgelaten, en de modelkaart zegt duidelijk dat het bedoeld is voor intensieve fine-tuning. Microsofts FrogNano-4B-2609 is hoe het andere uiteinde van die pijplijn eruitziet: hetzelfde soort kleine taalmodel, dat vijf iteraties reinforcement learning op synthetische repositorytaken heeft ondergaan tot het gestructureerde tool calls en kandidaat-patches via een harnas met vijf tools uitstuurt. Geen van beide heeft een gepubliceerde onafhankelijke benchmark. Het verschil is dat bij een van de twee de post-training is afgerond, en weten welke dat is, is de hele beslissing.

De onderstaande FrogNano-cijfers zijn afkomstig uit de modelkaart en het technische rapport van Microsoft. De LFM-cijfers zijn afkomstig uit de kaart van Liquid AI, de bijbehorende architectuurconfiguratie en het licentiebestand. Elk getal dat aan een van beide leveranciers wordt toegeschreven, is aangeduid als door de leverancier gerapporteerd, en geen van deze modellen heeft een evaluatie door een derde partij ondergaan — voor LFM2.5 2.6B Base is dat grotendeels bewust, aangezien een checkpoint zonder instructietuning geen eerlijk doelwit is voor een chatbenchmark.

De vergelijking werkt alleen als je weet wat je aan het vergelijken bent.

Leg de twee specificatiebladen naast elkaar en het eerste dat misgaat, is het aantal parameters. LFM2.5 2.6B Base heeft 2,69 miljard dense parameters in 30 lagen — 22 double-gated short-convolution-blokken en 8 grouped-query-attention-lagen, getraind op ongeveer 34 biljoen tokens in 16 talen, met een vocabulaire van 128.000 tokens en een context van 131.072 tokens. De gequantiseerde versie komt uit op ongeveer 1,67 GB in Q4_K_M.

De modelkaart van FrogNano-4B-2609 geeft het parameterveld weer als het bereik "500M-5B", en de modelsamenvatting beschrijft het model als ongeveer 4,66 miljard. De download beslecht de discussie: twee safetensors-shards met in totaal 9,32 GB aan BF16-gewichten, 738 tensors, op een geërfde, dense 32-laagse hybride Gated DeltaNet- en gated-attention-stack. Een 24-laagse visietoren zit in het checkpoint en heeft nooit een post-training ondergaan.

Dus de grootteverhouding is ongeveer 1,7 tegen 1, en de geheugenverhouding ligt dichter bij 5,6 tegen 1 zodra kwantisatie in beeld komt. Dat verschil weegt zwaarder dan de parameterlijn, want beide modellen zijn kandidaten voor self-hosting in plaats van endpoints — en dat is de enige reden dat ze in hetzelfde artikel thuishoren.

• Beoogd gebruik — LFM2.5 2.6B Base is grondstof voor een fine-tuning-run. FrogNano-4B-2609 is een voltooide policy voor software-engineering op repositoryniveau binnen de Leaf-harness.

• Instructieopvolging — LFM2.5 2.6B Base heeft dit niet out of the box; de kaart van Liquid AI raadt het aan voor taken die zware fine-tuning vereisen. FrogNano-4B-2609 volgt een taakbeschrijving en stuurt gestructureerde tool calls uit, omdat dat precies is waarop zijn RL-doelstelling is getraind.

• Context — 131.072 tokens voor LFM2.5 2.6B Base, tegenover ongeveer 131K gecombineerde tokens voor FrogNano's geëvalueerde configuratie. Nominaal identiek, maar FrogNano's venster moet toolresultaten, shell-uitvoer en testlogs bevatten, niet alleen een prompt.

• Uitvoerplafond — FrogNano's gevalideerde configuratie staat 8.192 gegenereerde tokens per assistentbeurt toe. LFM2.5 2.6B Base publiceert geen equivalent, aangezien het niet gebouwd is om een antwoord te beëindigen.

• Modaliteit — beide zijn alleen tekst. De visiecomponenten van FrogNano zijn overgenomen en expliciet niet ondersteund; LFM2.5 2.6B Base is door zijn constructie tekst-in, tekst-uit.

• Licentie — LFM2.5 2.6B Base valt onder de LFM Open License v1.0, die gratis is onder $10M jaarlijkse omzet en een aparte licentie vereist op of boven die grens, waarbij afgeleide werken de limiet erven. Op de kaart van FrogNano staat MIT in het voorwerk en Apache 2.0 in de hoofdtekst.

Het ding waarvoor Microsoft betaalde, en het ding waarvoor je zelf zou moeten betalen

Dit is het dragende gedeelte, want dit is het gedeelte waar een specificatievergelijking misleidend is.

De volledige toegevoegde waarde van FrogNano-4B-2609 zit in post-training, en Microsoft heeft de methode gepubliceerd. Begin met Qwen3.5-4B, dat als algemeen model 39,4% scoorde op SWE-bench Verified via de Leaf-harness. Genereer kandidaattaken voor repositories uit echte snapshots, voer rollouts uit vanaf het huidige checkpoint om taken te vinden die het soms oplost, behoud die, train, en herhaal — vijf iteraties, ruwweg 1.500 gevalideerde synthetische omgevingen in totaal, en op geen enkel moment distillatie uit een groter model. Het resultaat op Microsofts eigen modelkaart is 61,5% op SWE-bench Verified, 37,6% op SWE-bench Pro, 31,1% op Terminal-Bench 2.0 en 47,3% op PatchEval-Verified. De efficiëntiebijlage van het artikel rapporteert dezelfde stijging als 48,2%, 53,4%, 58,3%, 58,6% en 61,6% over de iteraties, wat een nuttige herinnering is dat zelfs de twee eigen tabellen van het lab van hetzelfde experiment niet overeenstemmen over de treden.

Leg dat nu naast LFM2.5 2.6B Base. Het is het checkpoint voordat dat werk begint. De aanbeveling op zijn eigen modelkaart — fine-tune het — is precies het werk dat FrogNano documenteert: een taakomgeving, een uitvoerbare beloning, een harness die langer meegaat, en verschillende trainingsiteraties tegen een veranderend beleid. De paper beweert niet dat dat gemakkelijk is. Er wordt in gerapporteerd dat tussentijdse checkpoints steeds duurder werden om te trainen naarmate redeneersporen langer werden, dat er een straf op loglengte moest worden toegevoegd om de drift te stoppen, en dat latere iteraties het vermogen voor parallelle tool-aanroepen kwijtraakten dat het basismodel had, en eindigden op een snelheid van gelijktijdige aanroepen van 1,71%. Iedereen die het FrogNano-recept op een andere 2.6B-basis wil toepassen, moet specifiek budget inruimen voor die drie problemen.

Wat LFM2.5 2.6B Base je oplevert, is een ander soort voorsprong: een pretrainingsbudget van 34 biljoen tokens, een gedocumenteerde hybride architectuur, een bestaande gekwantiseerde build, en een gedocumenteerde context van 131.072 tokens, allemaal in een formaat dat draait op hardware waar een BF16-checkpoint van 9,32 GB niet op zou passen. Als je taak smal genoeg is dat een kleine fine-tune het wint van een algemeen model, dan is dat een echte positie — en zo niet, dan heb je jezelf een trainingsrun bespaard.

A generated two-column scoreboard titled 'FrogNano-4B-2609 vs LFM2.5 2.6B Base'. The left column reads State RL post-training complete, Params approx 4.66B with the card saying 500M-5B, Weights 9.32 GB BF16, Context about 131K evaluated, Licence MIT in front matter and Apache 2.0 in body, Independent scores none. The right column reads State pretrained checkpoint only, Params 2.69B dense, Weights 1.67 GB in Q4_K_M, Context 131,072 tokens, Licence LFM Open License v1.0, Independent scores none. A footer reads 'Both columns vendor-reported; no third party has scored either model.'

Wat je hoe dan ook moet bouwen

Geen van beide is een netwerkoproep, en dat is bepalender voor de praktische vergelijking dan welke specificatierij dan ook.

LFM2.5 2.6B Base wil een inferentieruntime en een trainingsrun. De modelkaart van Liquid AI vermeldt builds in native-format, GGUF, ONNX en MLX, dus de serverende helft is goed gedekt — llama.cpp op een laptop is een echte optie voor de gekwantiseerde checkpoint. De trainingshelft is aan jou: data, doelstelling, evaluatie en een manier om te bepalen of het resultaat beter is geworden of alleen maar anders.

FrogNano-4B-2609 wil een OpenAI-compatibel endpoint met de juiste parsers en een Kubernetes-cluster met toestemming om pods en netwerkbeleid te beheren. De README van Microsoft is ongewoon direct dat de harness een afhankelijkheid is in plaats van een gemak, en de kaart stelt dat identieke scores een overeenkomstige checkpoint, tokenizer, serveerconfiguratie, taakimages en evaluatieprotocol vereisen. Configuratie is hier geen detail — serveer het zonder een Qwen3 reasoning-parser en een Qwen3 coder tool-call-parser en het model schrijft proza waar de harness een tool call verwacht.

Dat is de vorm van deze confrontatie: aan de ene kant een trainingsproject met een klein servingprobleem; aan de andere kant een servingproject met een groot evaluatieprobleem en geen training meer te doen. Het zijn beide avonden werk. Slechts één ervan is avonden werk dat kan eindigen in "het model is niet goed genoeg", zonder dat het jouw schuld is.

A screenshot of the Hugging Face model card for microsoft/FrogNano-4B-2609 showing the model summary table with the Parameters row reading 500M-5B, the Context length row reading approximately 131K tokens in the evaluated coding-agent configuration, the Training Dates row reading Jun 2026 to Aug 2026, the Release date row reading 22-SEP-2026, the License row reading Apache License 2.0, the Qwen/Qwen3.5-4B model dependency, and the model overview naming the dense 32-layer hybrid Gated DeltaNet and gated-attention architecture.

Waar een freesmachine zijn plek verdient in een project als dit

Beide modellen belanden uiteindelijk in een pijplijn die ook iets gehosts aanroept. De eigen evaluatieopstelling van FrogNano is het bewijs: de Leaf-harness praat met een OpenAI-compatibele endpoint, wat betekent dat het model dat wordt getest en elk model waarmee je het vergelijkt via dezelfde interface worden bereikt. Dat is een patroon dat het waard is om te kopiëren, zelfs als de reden alleen hygiëne is, en dat is waar één enkele endpoint iets concreets doet.

OrcaRouter biedt meer dan 200 modellen achter één OpenAI-compatibele sleutel met 0% opslag, zodat lijstprijzen van providers ongewijzigd doorstromen en een prijswijziging van een leverancier dezelfde dag aan onze kant live is — dat is het cijfer dat er echt toe doet wanneer je beslist of een zelfgehoste specialist een gehost algemeen model verslaat op kosten per taak. Automatische failover dekt de gehoste helft van die vergelijking, niet de checkpoint die je zelf serveert. We hosten FrogNano-4B-2609 of LFM2.5 2.6B Base niet; beide zijn downloads. Wat een routeringslaag wegneemt, is de tweede integratie telkens wanneer de gehoste kant van je benchmark verandert.

Eentje kiezen, eerlijk gezegd

Kies LFM2.5 2.6B Base als je taak nauw is, je hardware klein is en je bereid bent de verantwoordelijkheid voor de trainingsrun zelf te nemen — de licentie is gratis onder $10M omzet, de gequantiseerde build is 1,67 GB, en Liquid AI's eigen kaart beveelt het precies hiervoor aan. De afweging is dat je een startpunt krijgt, geen vermogen: niets in de release vertelt je wat een FrogNano-vormige RL-run erbovenop zou scoren, en niemand heeft er een gepubliceerd.

Kies FrogNano-4B-2609 als de taak software-engineering op repositoryniveau is en je wilt dat de post-training al is gedaan. De 61,5%, 37,6%, 31,1% en 47,3% zijn echte gepubliceerde resultaten van een lab dat zijn methode in detail heeft beschreven — en ze zijn op dit moment ook een gesloten cirkel: hetzelfde lab, dezelfde harness, dezelfde baseline van het basismodel. De download van 9,32 GB, de afhankelijkheid van de harness en de samengestelde licenties zijn de prijs voor het overslaan van een trainingsproject dat je anders zou moeten uitvoeren.

A generated pipeline card headed 'The same pipeline, two positions' showing three stages connected by arrows: 'Pretrained checkpoint' captioned LFM2.5 2.6B Base, 'RL on synthetic tasks, 5 iterations' captioned Microsoft's loop, and 'Finished agent' captioned FrogNano-4B-2609, with a footer reading 'Neither model has been independently evaluated; both appear as vendor-reported figures only.'

De nuttige reframing is dat dit geen concurrenten zijn. LFM2.5 2.6B Base staat stroomopwaarts van een proces dat iets als FrogNano-4B-2609 heeft voortgebracht. Als je jezelf tussen beide ziet kiezen, is de echte vraag of jouw probleem het waard is om er een eigen trainingsrun voor op je te nemen — en als het antwoord nee is, is de 4B-checkpoint met de harness, de gepubliceerde methode en de door de leverancier gerapporteerde SWE-bench-ladder degene die kant-en-klaar aankomt.