Ett genererat titelkort med rubriken "TwIL-LM3-Pro vs LFM2.5 2.6B Base", underrubriken "Den ena är färdig, den andra är en utgångspunkt", med två rundade kort som lyder "TwIL-LM3-Pro - eftertränad och sammanslagen" och "LFM2.5 2.6B Base - förtränad checkpoint". OrcaRouter-logotypen är komponerad i nedre högra hörnet.
Guides & Insights

TwIL-LM3-Pro vs LFM2.5 2.6B Base: Den ena är färdig, den andra är en utgångspunkt

Författare

Magnus Corvin

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller →
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Det mest avslöjande med den publicerade jämförelsen mellan TwIL-LM3-Pro och LFM2.5 2.6B Base är att webAI inte publicerade någon mot 2.6B överhuvudtaget. webAI:s Track A- och Track B-tabeller ställer sin 3,66B-specialist på formell logik mot en rad modeller – sin egen Granite-bas, VibeThinker-3B, Qwen3-8B, Qwen3.5-4B, Llama-3.2-3B, gpt-oss-120b – och Liquid AI-bidraget de valde är LFM2.5-8B-A1B, inte 2.6B. Den 2.6B som faktiskt visas i tabellen är `LFM2-2.6B`, den tidigare generationen, som är en annan modell med en annan förträningskörning. Det utelämnandet är inte ett förbiseende. LFM2.5 2.6B Base är en förtränad checkpoint utan instruktionsträning, och benchmarker för instruktionsföljning är inte ett test den byggdes för att klara.

Så den här sidan jämför en färdig artefakt mot ett råmaterial. Inramningen i Aion-stil – en modell har en poäng och den andra inte – passar, men anledningen är mer specifik och mer intressant: den ena är eftertränad och sammanslagen, den andra stannar medvetet före efterträningen, och de två dokument som beskriver dem svarar avsiktligt på olika frågor.

Två parameterantal som inte är samma mätning

TwIL-LM3-Pro har 3,66 miljarder parametrar, är tät, och alla är aktiva på varje token. Den härstammar från `ibm-granite/granite-4.2-3b` genom LoRA-finandjustering, multipath-destillation, checkpoint-fusion, en WiSE-FT-sammanslagning tillbaka mot basen och ett entropivägt GRPO-steg — och artefakten som webAI levererade är den sammanslagna policyn, inte en LoRA-adapter, så den körs fristående.

LFM2.5 2.6B Base består av 2,69B parametrar över 30 lager: 22 dubbelgrindade kortkonvolutionsblock varvade med 8 lager med grouped-query-attention. Den hybrida konv-/attention-designen är Liquids egen arkitektur, och det är anledningen till att familjens genomströmningstal är vad de är, snarare än en funktion av enbart parameterantalet. Den tränades på 34 biljoner tokens med en vokabulär på 128 000 tokens och har ett kontextfönster på 131 072 tokens.

De två antalen ligger inom ungefär 36 % av varandra och har tagits fram genom helt olika arkitekturer, så varken "3.66B slår 2.69B" eller det omvända är meningsfullt som kvalitetsanspråk. webAI:s eget modellkort gör denna poäng på ett indirekt sätt när det avstår från att jämföra korpusperplexitet mellan tokeniserare — TwIL-LM3-Pros vokabulär är 100 352, LFM2.5-2.6B:s är 128 000, och perplexitet är per token.

Vad "Base" tar bort, och varför det ändrar resultattavlan

Liquid AI publicerar LFM2.5 2.6B i två former: den eftertränade checkpointen, trimmad för agentiska arbetsbelastningar i populära agentramverk, och Base, som i sitt eget kort beskrivs som "den förtränade checkpointen för enbart text, som används för att skapa alla LFM2.5-2.6B-varianter". Base är indata till finjustering, inte en produkt. Den har ingen instruktionsträning, ingen chattmall värd namnet och ingen publicerad utvärdering – eftersom att utvärdera en basmodell på uppgifter som rör instruktionsföljning mäter fel sak.

TwIL-LM3-Pro:s position är den omvända. Hela dess värde ligger i efterträningsstacken: webAI rapporterar att pipelinen på sin egen testrigg lyfte den domäninterna makrogrinden från basmodellens 0,4313 till 0,5539, medan makrot för de 10 utelämnade dataseten låg kvar på samma nivå (0,7942 till 0,7901) i stället för att kollapsa. Bibehållandet på utelämnade data är den svåra delen av specialiserad efterträning, och det är den del som Base inte kan svara på.

Det är också här som storleksjämförelsen i webAI:s tabeller lönar sig. TwIL-LM3-Pro rapporteras ligga före LFM2.5-8B-A1B på båda makrovärdena för hållna data – 0,7901 mot 0,7884 på uppsättningen med tio dataset, 0,7425 mot 0,7378 på de fjorton – med mindre än halva parameterantalet för den MoE-modellen. Det är ett äkta resultat på lika villkor, och det är tillgängligt just därför att LFM2.5-8B-A1B är en eftertränad modell som kan köras genom en instruktionsrigg. Det kan inte Base, vilket är anledningen till att 2.6B aldrig fick en kolumn.

Dimensionerna som är värda att linjera upp

• Parametrar — TwIL-LM3-Pro 3,66B tät jämfört med LFM2.5 2,6B Base 2,69B (30 lager: 22 conv + 8 GQA).

• Efterträning — LoRA SFT, destillation, WiSE-FT-sammanslagning och GRPO vid steg 2580 jämfört med ingen; Basen är förträningsutdata per design.

• Kontextfönster: 131 072 tokens för båda, ärvt från deras respektive basmodeller.

• Vokabulär — 100 352 tokens mot 128 000, vilket är anledningen till att deras perplexiteter inte är jämförbara.

• Språk — endast engelska kontra sjutton, inklusive arabiska, kinesiska, japanska, koreanska, spanska och thai.

• Tänkformat — TwIL-LM3-Pro genererar ett `<think>`-block som standard och resonerar utförligt (1 902 tokens i genomsnitt inom domänen, 24,2 % av genereringarna når längdtaket) jämfört med en bas-checkpoint helt utan instruktionsformat.

• Licens — webAI Non-Commercial License ver. 1.0 vs Liquids LFM Open License v1.0.

• Vad det är till för – en slutpunkt för formallogisk inferens kontra en utgångspunkt för finjustering.

Kontextraderna förtjänar en fotnot som båda modellerna tillhandahåller: var och en för 131 072 token vidare från förträningen, och ingen av leverantörerna validerade långkontextbeteende – TwIL-LM3-Pros kort säger att varje publicerad poäng mättes inom ett fönster på 8 192 token. De matchande siffrorna här är ärvda, inte demonstrerade.

Licens, och vad var och en juridiskt sett är till för

TwIL-LM3-Pros webAI Non-Commercial License tillåter forskning och personlig användning och kräver ett separat avtal med webAI för intäktsgenererande driftsättning. LFM2.5 2.6B Base levereras under Liquids egen LFM Open License v1.0, som Hugging Face API rapporterar som `license: other` i stället för en standard-SPDX-identifierare — läs licensfilen innan du planerar utifrån den, eftersom villkoren är Liquids egna snarare än en erkänd mall.

Ingen av licenserna är Apache 2.0, och det är ett misstag att behandla "öppna vikter" som en synonym för "kommersiellt tillåtande". Den praktiska skillnaden mellan de två ligger i vad licenserna skyddar: en icke-kommersiell forskare kan använda båda, ett företag som bygger en produkt behöver granska båda, och hela syftet med Base — att finjusteras till någon annans produkt — gör att dess exakta villkor får större betydelse än de verkar.

Var var och en hör hemma i en stack

The Base är rätt val när du tänker träna. Om ditt problem är en snäv märkningsuppgift, ett domänspecifikt klassificeringshuvud eller en finjustering på några tusen märkta exempel, är det ett välgrundat ingenjörsbeslut att utgå från en förtränad checkpoint på 2,69B med en bred flerspråkig vokabulär och en hybrid conv-arkitektur utformad för genomströmning, och kostnaden för den efterträning du skulle hoppa över är den kostnad du i stället medvetet betalar.

TwIL-LM3-Pro är rätt val när du inte avser att träna och uppgiften redan är formell logik. Entailment-etiketter, formalisering av Lean-påståenden, semantiska parsningar och beviskritik är de uppgifter som hela dess pipeline var inriktad på, och att utgå från en checkpoint som redan har gått igenom merge- och förstärkningsstadiet sparar dig den enda delen av detta som är genuint svår att reproducera — att hålla den hållna testsviten på samma nivå samtidigt som du vinner inom domänen.

Misstaget är att tolka "3,66B eftertränad specialist" som strikt bättre än "2,69B bas-checkpoint." De befinner sig i olika stadier av samma produktionslinje.

Servera dem, eller servera runt dem

Ingen av modellerna är en route i OrcaRouter-katalogen i dag, och anledningen skiljer sig åt för var och en. TwIL-LM3-Pro har en icke-kommersiell licens och ingen hostad slutpunkt; LFM2.5 2.6B Base är en finjusteringsartefakt som ingen medvetet skulle tillhandahålla som inferensslutpunkt. Där en router förtjänar sin plats är ett lager upp, i arbetet som omger en specialist: att generera och filtrera träningsdata som du skulle finjustera Base på, att expandera prompterna som du skulle mata en formallogikmodell med, och att bedöma utdata. Det är textanrop, och de körs över en OpenAI-kompatibel slutpunkt mot 200+ modeller till leverantörens listpris med 0 % påslag, så en prissänkning från en leverantör får genomslag samma dag och ett byte från en datagenereringsmodell till en annan är en konfigurationsändring i stället för en andra leverantörsrelation.

Automatisk failover har större betydelse än vanligt i en finjusteringspipeline, eftersom ett batchjobb som dör vid 80 % slösar bort hela körningen. En enda nyckel för genereringsmodellerna, med en reservlösning som skickar om vid ett leverantörsfel, är en mindre infrastrukturdel än tre API-integrationer.

A generated two-column scoreboard headed 'TwIL-LM3-Pro vs LFM2.5 2.6B Base - the scoreboard' with six shared dimension rows. TwIL-LM3-Pro: Parameters 3.66B dense; Post-training SFT, merge, GRPO; Context 131,072 tokens; Vocabulary 100,352; Languages English; Licence non-commercial. LFM2.5 2.6B Base: Parameters 2.69B (30 layers); Post-training none by design; Context 131,072 tokens; Vocabulary 128,000; Languages 17; Licence LFM Open License v1.0. A footer line reads 'Both vendor-reported; neither model has a third-party evaluation.' The OrcaRouter logo is composited in the bottom-right corner.

Vilken, avgörs av din avsikt

Om du tränar, välj Base. Om du gör inferens på formell logik och licensen tillåter din användning, välj TwIL-LM3-Pro. Om du behöver en liten instruktionsföljande modell i dag och ingen av begränsningarna passar, använd LFM2.5 2.6B:s eftertränade syskon – modellen som Liquid faktiskt publicerar för det syftet – och lämna Base för den finjustering du ändå planerade.

A screenshot of the Hugging Face model card for LiquidAI/LFM2.5-2.6B-Base, showing the Liquid AI author line, the 16-languages tag, the LFM2 and liquid tags, and the card's opening description of LFM2.5 as a family of hybrid models designed for on-device deployment, built on the LFM2 architecture with extended pre-training and reinforcement learning.A screenshot of the Hugging Face model card for LiquidAI/LFM2.5-2.6B, the post-trained sibling, showing the 16-languages and LFM2 tags and the card's description of LFM2.5-2.6B as part of the LFM2.5 family with a 128K context window and agentic post-training.