
TwIL-LM3-Pro vs LFM2.5 2.6B Base: Den ena är färdig, den andra är en utgångspunkt
- openaiNYOpenAI: GPT-6.1 Sol2026-09-2952Intelligens
- anthropicNYAnthropic: Claude Sonnet 5.52026-09-2856Intelligens
- typesafeNYTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M tokens · 219 tok/s
- OpenAINYOpenAI: GPT-6 Luna2026-09-2238Intelligens
- OpenAINYOpenAI: GPT-6 Sol2026-09-2248Intelligens
- AnthropicNYAnthropic: Claude Opus 5.52026-09-2258Intelligens
- xAINYGrok 4.72026-09-2146Intelligens
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1M tokens · 118 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M tokens · 1064 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligens76Kodning
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M tokens · 47 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M tokens · 213 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
Det mest avslöjande med den publicerade jämförelsen mellan TwIL-LM3-Pro och LFM2.5 2.6B Base är att webAI inte publicerade någon mot 2.6B överhuvudtaget. webAI:s Track A- och Track B-tabeller ställer sin 3,66B-specialist på formell logik mot en rad modeller – sin egen Granite-bas, VibeThinker-3B, Qwen3-8B, Qwen3.5-4B, Llama-3.2-3B, gpt-oss-120b – och Liquid AI-bidraget de valde är LFM2.5-8B-A1B, inte 2.6B. Den 2.6B som faktiskt visas i tabellen är `LFM2-2.6B`, den tidigare generationen, som är en annan modell med en annan förträningskörning. Det utelämnandet är inte ett förbiseende. LFM2.5 2.6B Base är en förtränad checkpoint utan instruktionsträning, och benchmarker för instruktionsföljning är inte ett test den byggdes för att klara.
Så den här sidan jämför en färdig artefakt mot ett råmaterial. Inramningen i Aion-stil – en modell har en poäng och den andra inte – passar, men anledningen är mer specifik och mer intressant: den ena är eftertränad och sammanslagen, den andra stannar medvetet före efterträningen, och de två dokument som beskriver dem svarar avsiktligt på olika frågor.
Två parameterantal som inte är samma mätning
TwIL-LM3-Pro har 3,66 miljarder parametrar, är tät, och alla är aktiva på varje token. Den härstammar från `ibm-granite/granite-4.2-3b` genom LoRA-finandjustering, multipath-destillation, checkpoint-fusion, en WiSE-FT-sammanslagning tillbaka mot basen och ett entropivägt GRPO-steg — och artefakten som webAI levererade är den sammanslagna policyn, inte en LoRA-adapter, så den körs fristående.
LFM2.5 2.6B Base består av 2,69B parametrar över 30 lager: 22 dubbelgrindade kortkonvolutionsblock varvade med 8 lager med grouped-query-attention. Den hybrida konv-/attention-designen är Liquids egen arkitektur, och det är anledningen till att familjens genomströmningstal är vad de är, snarare än en funktion av enbart parameterantalet. Den tränades på 34 biljoner tokens med en vokabulär på 128 000 tokens och har ett kontextfönster på 131 072 tokens.
De två antalen ligger inom ungefär 36 % av varandra och har tagits fram genom helt olika arkitekturer, så varken "3.66B slår 2.69B" eller det omvända är meningsfullt som kvalitetsanspråk. webAI:s eget modellkort gör denna poäng på ett indirekt sätt när det avstår från att jämföra korpusperplexitet mellan tokeniserare — TwIL-LM3-Pros vokabulär är 100 352, LFM2.5-2.6B:s är 128 000, och perplexitet är per token.
Vad "Base" tar bort, och varför det ändrar resultattavlan
Liquid AI publicerar LFM2.5 2.6B i två former: den eftertränade checkpointen, trimmad för agentiska arbetsbelastningar i populära agentramverk, och Base, som i sitt eget kort beskrivs som "den förtränade checkpointen för enbart text, som används för att skapa alla LFM2.5-2.6B-varianter". Base är indata till finjustering, inte en produkt. Den har ingen instruktionsträning, ingen chattmall värd namnet och ingen publicerad utvärdering – eftersom att utvärdera en basmodell på uppgifter som rör instruktionsföljning mäter fel sak.
TwIL-LM3-Pro:s position är den omvända. Hela dess värde ligger i efterträningsstacken: webAI rapporterar att pipelinen på sin egen testrigg lyfte den domäninterna makrogrinden från basmodellens 0,4313 till 0,5539, medan makrot för de 10 utelämnade dataseten låg kvar på samma nivå (0,7942 till 0,7901) i stället för att kollapsa. Bibehållandet på utelämnade data är den svåra delen av specialiserad efterträning, och det är den del som Base inte kan svara på.
Det är också här som storleksjämförelsen i webAI:s tabeller lönar sig. TwIL-LM3-Pro rapporteras ligga före LFM2.5-8B-A1B på båda makrovärdena för hållna data – 0,7901 mot 0,7884 på uppsättningen med tio dataset, 0,7425 mot 0,7378 på de fjorton – med mindre än halva parameterantalet för den MoE-modellen. Det är ett äkta resultat på lika villkor, och det är tillgängligt just därför att LFM2.5-8B-A1B är en eftertränad modell som kan köras genom en instruktionsrigg. Det kan inte Base, vilket är anledningen till att 2.6B aldrig fick en kolumn.
Dimensionerna som är värda att linjera upp
• Parametrar — TwIL-LM3-Pro 3,66B tät jämfört med LFM2.5 2,6B Base 2,69B (30 lager: 22 conv + 8 GQA).
• Efterträning — LoRA SFT, destillation, WiSE-FT-sammanslagning och GRPO vid steg 2580 jämfört med ingen; Basen är förträningsutdata per design.
• Kontextfönster: 131 072 tokens för båda, ärvt från deras respektive basmodeller.
• Vokabulär — 100 352 tokens mot 128 000, vilket är anledningen till att deras perplexiteter inte är jämförbara.
• Språk — endast engelska kontra sjutton, inklusive arabiska, kinesiska, japanska, koreanska, spanska och thai.
• Tänkformat — TwIL-LM3-Pro genererar ett `<think>`-block som standard och resonerar utförligt (1 902 tokens i genomsnitt inom domänen, 24,2 % av genereringarna når längdtaket) jämfört med en bas-checkpoint helt utan instruktionsformat.
• Licens — webAI Non-Commercial License ver. 1.0 vs Liquids LFM Open License v1.0.
• Vad det är till för – en slutpunkt för formallogisk inferens kontra en utgångspunkt för finjustering.
Kontextraderna förtjänar en fotnot som båda modellerna tillhandahåller: var och en för 131 072 token vidare från förträningen, och ingen av leverantörerna validerade långkontextbeteende – TwIL-LM3-Pros kort säger att varje publicerad poäng mättes inom ett fönster på 8 192 token. De matchande siffrorna här är ärvda, inte demonstrerade.
Licens, och vad var och en juridiskt sett är till för
TwIL-LM3-Pros webAI Non-Commercial License tillåter forskning och personlig användning och kräver ett separat avtal med webAI för intäktsgenererande driftsättning. LFM2.5 2.6B Base levereras under Liquids egen LFM Open License v1.0, som Hugging Face API rapporterar som `license: other` i stället för en standard-SPDX-identifierare — läs licensfilen innan du planerar utifrån den, eftersom villkoren är Liquids egna snarare än en erkänd mall.
Ingen av licenserna är Apache 2.0, och det är ett misstag att behandla "öppna vikter" som en synonym för "kommersiellt tillåtande". Den praktiska skillnaden mellan de två ligger i vad licenserna skyddar: en icke-kommersiell forskare kan använda båda, ett företag som bygger en produkt behöver granska båda, och hela syftet med Base — att finjusteras till någon annans produkt — gör att dess exakta villkor får större betydelse än de verkar.
Var var och en hör hemma i en stack
The Base är rätt val när du tänker träna. Om ditt problem är en snäv märkningsuppgift, ett domänspecifikt klassificeringshuvud eller en finjustering på några tusen märkta exempel, är det ett välgrundat ingenjörsbeslut att utgå från en förtränad checkpoint på 2,69B med en bred flerspråkig vokabulär och en hybrid conv-arkitektur utformad för genomströmning, och kostnaden för den efterträning du skulle hoppa över är den kostnad du i stället medvetet betalar.
TwIL-LM3-Pro är rätt val när du inte avser att träna och uppgiften redan är formell logik. Entailment-etiketter, formalisering av Lean-påståenden, semantiska parsningar och beviskritik är de uppgifter som hela dess pipeline var inriktad på, och att utgå från en checkpoint som redan har gått igenom merge- och förstärkningsstadiet sparar dig den enda delen av detta som är genuint svår att reproducera — att hålla den hållna testsviten på samma nivå samtidigt som du vinner inom domänen.
Misstaget är att tolka "3,66B eftertränad specialist" som strikt bättre än "2,69B bas-checkpoint." De befinner sig i olika stadier av samma produktionslinje.
Servera dem, eller servera runt dem
Ingen av modellerna är en route i OrcaRouter-katalogen i dag, och anledningen skiljer sig åt för var och en. TwIL-LM3-Pro har en icke-kommersiell licens och ingen hostad slutpunkt; LFM2.5 2.6B Base är en finjusteringsartefakt som ingen medvetet skulle tillhandahålla som inferensslutpunkt. Där en router förtjänar sin plats är ett lager upp, i arbetet som omger en specialist: att generera och filtrera träningsdata som du skulle finjustera Base på, att expandera prompterna som du skulle mata en formallogikmodell med, och att bedöma utdata. Det är textanrop, och de körs över en OpenAI-kompatibel slutpunkt mot 200+ modeller till leverantörens listpris med 0 % påslag, så en prissänkning från en leverantör får genomslag samma dag och ett byte från en datagenereringsmodell till en annan är en konfigurationsändring i stället för en andra leverantörsrelation.
Automatisk failover har större betydelse än vanligt i en finjusteringspipeline, eftersom ett batchjobb som dör vid 80 % slösar bort hela körningen. En enda nyckel för genereringsmodellerna, med en reservlösning som skickar om vid ett leverantörsfel, är en mindre infrastrukturdel än tre API-integrationer.

Vilken, avgörs av din avsikt
Om du tränar, välj Base. Om du gör inferens på formell logik och licensen tillåter din användning, välj TwIL-LM3-Pro. Om du behöver en liten instruktionsföljande modell i dag och ingen av begränsningarna passar, använd LFM2.5 2.6B:s eftertränade syskon – modellen som Liquid faktiskt publicerar för det syftet – och lämna Base för den finjustering du ändå planerade.


