
FrogNano-4B-2609 vs LFM2.5 2.6B Base: en färdig specialist och en påse förtränade vikter
- openaiNYOpenAI: GPT-6.1 Sol2026-09-2952Intelligens
- anthropicNYAnthropic: Claude Sonnet 5.52026-09-2856Intelligens
- typesafeNYTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M tokens · 219 tok/s
- OpenAINYOpenAI: GPT-6 Luna2026-09-2238Intelligens
- OpenAINYOpenAI: GPT-6 Sol2026-09-2248Intelligens
- AnthropicNYAnthropic: Claude Opus 5.52026-09-2258Intelligens
- xAINYGrok 4.72026-09-2146Intelligens
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1M tokens · 114 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M tokens · 1064 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligens76Kodning
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M tokens · 41 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens · 105 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M tokens · 213 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
Skriv en fråga i LFM2.5 2.6B Base och den kommer att fortsätta din mening i stället för att svara på den. Det är inte en defekt – Liquid AI publicerade den som den förtränade checkpointen under LFM2.5-familjen, där instruktionsträningen medvetet lämnats till dess syskon som inte är Base, och kortet säger tydligt att den är avsedd för tung finjustering. Microsofts FrogNano-4B-2609 är hur den andra änden av den där pipelinen ser ut: samma typ av liten språkmodell, som har genomgått fem iterationer av förstärkningsinlärning på syntetiska repository-uppgifter tills den avger strukturerade verktygsanrop och kandidatpatchar genom ett ramverk med fem verktyg. Ingen av dem har ett publicerat oberoende benchmark. Skillnaden är att en av dem har fått sin efterträning färdigställd, och att veta vilken som är hela beslutet.
FrogNano-siffrorna nedan kommer från Microsofts modellkort och tekniska rapport. LFM-siffrorna kommer från Liquid AI:s modellkort, dess arkitekturkonfiguration och dess licensfil. Varje siffra som tillskrivs någon av leverantörerna är märkt som leverantörsrapporterad, och ingen av dessa modeller har genomgått en utvärdering av tredje part — för LFM2.5 2.6B Base är det till stor del avsiktligt, eftersom en checkpoint utan instruktionsträning inte är ett rättvist mål för ett chattbenchmark.
Jämförelsen fungerar bara om du vet vad du jämför
Lägg de två specifikationsbladen sida vid sida och det första som blir fel är parameterantalet. LFM2.5 2.6B Base har 2,69 miljarder täta parametrar i 30 lager – 22 dubbelgrindade kortkonvolutionsblock och 8 grouped-query-attention-lager, tränad på ungefär 34 biljoner token över 16 språk, med en vokabulär på 128 000 token och en kontext på 131 072 token. Dess kvantiserade version hamnar på omkring 1,67 GB i Q4_K_M.
FrogNano-4B-2609:s modellkort anger dess parameterfält som intervallet "500M-5B", och modellsammanfattningen beskriver den som ungefär 4,66 miljarder. Nedladdningen avgör tvisten: två safetensors-shards med totalt 9,32 GB BF16-vikter, 738 tensorer, på en ärvd tät 32-lagrig hybridstack av Gated DeltaNet och gated attention. Ett 24-lagrigt visionstorn finns i checkpointen och har aldrig eftertränats.
Så storleksförhållandet är ungefär 1,7 till ett, och minnesförhållandet är närmare 5,6 till ett när kvantisering kommer in i bilden. Det gapet spelar större roll än parameterraden, eftersom båda dessa modeller är tänkbara för självhostning snarare än slutpunkter – vilket är den enda anledningen till att de hör hemma i samma artikel.
• Avsedd användning — LFM2.5 2.6B Base är råmaterial för en finjusteringskörning. FrogNano-4B-2609 är en färdig policy för programvaruutveckling på repositorienivå i Leaf-ramverket.
• Instruktionsföljning — LFM2.5 2.6B Base har inget inbyggt; Liquid AI:s modellkort rekommenderar det för uppgifter som kräver tung finjustering. FrogNano-4B-2609 följer en uppgiftsbeskrivning och avger strukturerade verktygsanrop, eftersom det är precis vad dess RL-mål tränade.
• Kontext — 131 072 tokens för LFM2.5 2.6B Base, mot ungefär 131K sammanlagda tokens för FrogNanos utvärderade konfiguration. Nominellt identiska, men FrogNanos fönster måste rymma verktygsresultat, shell-utdata och testloggar, inte bara en prompt.
• Utdatatak — FrogNanos validerade konfiguration tillåter 8 192 genererade tokens per assistenttur. LFM2.5 2.6B Base publicerar ingen motsvarighet, eftersom den inte är byggd för att avsluta ett svar.
• Modalitet — båda är enbart text. FrogNanos visionskomponenter är ärvda och uttryckligen icke-stödda; LFM2.5 2.6B Base är till sin konstruktion text in, text ut.
• Licens – LFM2.5 2.6B Base lyder under LFM Open License v1.0, som är kostnadsfri under 10 miljoner USD i årlig intäkt och kräver en separat licens vid eller över den gränsen, där derivatverk ärver taket. FrogNanos modellkort anger MIT i sin inledande del och Apache 2.0 i sin brödtext.
Det som Microsoft betalade för, och det som du själv skulle behöva betala för
Det här är avsnittet som bär tyngden, för det är här en jämförelse av specifikationer vilseleder.
FrogNano-4B-2609:s hela mervärde ligger i efterträning, och Microsoft har publicerat metoden. Utgå från Qwen3.5-4B, som fick 39,4 % på SWE-bench Verified via Leaf-testramverket som allmän modell. Generera kandidatuppgifter för repositorier från verkliga ögonblicksbilder, kör rollouts från den aktuella kontrollpunkten för att hitta uppgifter som den ibland löser, behåll dem, träna och upprepa – fem iterationer, ungefär 1 500 validerade syntetiska miljöer totalt, och ingen destillering från en större modell vid någon tidpunkt. Resultatet på Microsofts eget modellkort är 61,5 % på SWE-bench Verified, 37,6 % på SWE-bench Pro, 31,1 % på Terminal-Bench 2.0 och 47,3 % på PatchEval-Verified. I artikelns effektivitetsappendix rapporteras samma klättring som 48,2 %, 53,4 %, 58,3 %, 58,6 % och 61,6 % över iterationerna, vilket är en användbar påminnelse om att inte ens labbets egna två tabeller över samma experiment stämmer överens om stegpinnarna.
Ställ nu det mot LFM2.5 2.6B Base. Det är checkpointen innan det arbetet börjar. Rekommendationen på dess eget kort – finjustera den – är precis det jobb som FrogNano dokumenterar: en uppgiftsmiljö, en körbar belöning, en harness för längre körning och flera träningsiterationer mot en rörlig policy. Artikeln hävdar inte att det är lätt. Den rapporterar att mellanliggande checkpoints blev allt dyrare att träna i takt med att resonemangsspår förlängdes, att ett straff för logglängd måste läggas till för att stoppa driften, och att senare iterationer förlorade förmågan till parallella verktygsanrop som basmodellen hade, och slutade på en frekvens för samtidiga anrop på 1,71 %. Den som planerar att köra FrogNano-receptet på en annan 2,6B-bas bör specifikt budgetera för dessa tre problem.
Det LFM2.5 2.6B Base ger dig är en annan typ av försprång: en förträningsbudget på 34 biljoner tokens, en dokumenterad hybridarkitektur, en befintlig kvantiserad version och en dokumenterad kontext på 131 072 tokens, allt i en storlek som går att köra på hårdvara där en BF16-checkpoint på 9,32 GB inte skulle få plats. Om din uppgift är tillräckligt snäv för att en liten finjustering ska slå en generell modell, är det en verklig position – och om den inte är det har du besparat dig en träningskörning.

Det du måste bygga oavsett
Inget av dessa är ett nätverksanrop, och det påverkar den praktiska jämförelsen mer än någon specifikationsrad.
LFM2.5 2.6B Base vill ha en inferensruntime och en träningskörning. Liquid AIs modellkort listar native-format-, GGUF-, ONNX- och MLX-byggen, så serveringshalvan är väl täckt – llama.cpp på en laptop är ett verkligt alternativ för den kvantiserade checkpointen. Träningshalvan är din: data, målfunktion, utvärdering och ett sätt att avgöra om resultatet blev bättre eller bara annorlunda.
FrogNano-4B-2609 vill ha en OpenAI-kompatibel endpoint med rätt parsers och ett Kubernetes-kluster med behörighet att hantera poddar och nätverkspolicyer. Microsofts README säger ovanligt rakt ut att testriggen är ett beroende snarare än en bekvämlighet, och modellkortet anger att identiska poäng kräver en matchande checkpoint, tokenizer, serveringskonfiguration, uppgiftsavbildningar och utvärderingsprotokoll. Konfiguration är inte en detalj här – servera den utan en Qwen3-resonemangsparser och en Qwen3-coder-parser för verktygsanrop, och modellen skriver prosa där testriggen förväntar sig ett verktygsanrop.
Så ser den här matchningen ut: på ena sidan ett träningsprojekt med ett litet serveringsproblem; på den andra ett serveringsprojekt med ett stort utvärderingsproblem och ingen träning kvar att göra. Båda är kvällar av arbete. Bara en av dem är kvällar av arbete som kan sluta i ”modellen är inte bra nog” utan att det är ditt fel.

Där en router förtjänar sin plats i ett bygge som detta
Båda dessa modeller hamnar i en pipeline som också anropar något hostat. FrogNanos egen utvärderingsrigg är beviset: Leaf-harnessen talar med en OpenAI-kompatibel endpoint, vilket innebär att modellen som testas och alla modeller du jämför med nås via samma gränssnitt. Det är ett mönster värt att kopiera även när anledningen bara är hygien, och det är där en enda endpoint gör något konkret.
OrcaRouter har över 200 modeller bakom en enda OpenAI-kompatibel nyckel med 0 % påslag, så leverantörernas listpriser förs vidare oförändrade och en prisändring från en leverantör är live hos oss samma dag – och det är den siffran som faktiskt ändras när du avgör om en självhostad specialist slår en hostad generell modell i kostnad per uppgift. Automatisk failover täcker den hostade halvan av den jämförelsen, inte den checkpoint du själv serverar. Vi hostar inte FrogNano-4B-2609 eller LFM2.5 2.6B Base; båda är nedladdningar. Det ett routinglager tar bort är den andra integrationen varje gång den hostade sidan av din benchmark ändras.
Att välja en, ärligt talat
Välj LFM2.5 2.6B Base om din uppgift är smal, din hårdvara är liten och du är beredd att äga träningskörningen — licensen är gratis under 10 miljoner dollar i intäkter, den kvantiserade versionen är 1,67 GB, och Liquid AI:s eget modellkort rekommenderar den för exakt detta. Avvägningen är att du får en utgångspunkt, inte en förmåga: inget i utgåvan säger vad en FrogNano-formad RL-körning ovanpå den skulle få för poäng, och ingen har publicerat en.
Välj FrogNano-4B-2609 om uppgiften gäller programvaruutveckling på repositorienivå och du vill ha efterträningen redan gjord. Siffrorna 61,5 %, 37,6 %, 31,1 % och 47,3 % är äkta publicerade resultat från ett labb som beskrev sin metod i detalj – och de är också, i detta nu, en sluten krets: samma labb, samma testramverk, samma baslinje för basmodellen. Nedladdningen på 9,32 GB, beroendet av testramverket och den sammansatta licensieringen är priset för att hoppa över ett träningsprojekt som du annars skulle behöva köra.

Den användbara omramningen är att dessa inte är konkurrenter. LFM2.5 2.6B Base ligger uppströms om en process som producerade något i stil med FrogNano-4B-2609. Om du står inför att välja mellan dem är den egentliga frågan huruvida ditt problem är värt att äga en träningskörning för — och om svaret är nej är 4B-checkpointen med harnessen, den publicerade metoden och den leverantörsrapporterade SWE-bench-stegen den som kommer färdig.
