
TwIL-LM3-Pro vs LFM2.5 2.6B Base: de ene is af, de andere is een startpunt
- openaiNIEUWOpenAI: GPT-6.1 Sol2026-09-2952Intelligentie
- anthropicNIEUWAnthropic: Claude Sonnet 5.52026-09-2856Intelligentie
- typesafeNIEUWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 mln tokens · 219 tok/s
- OpenAINIEUWOpenAI: GPT-6 Luna2026-09-2238Intelligentie
- OpenAINIEUWOpenAI: GPT-6 Sol2026-09-2248Intelligentie
- AnthropicNIEUWAnthropic: Claude Opus 5.52026-09-2258Intelligentie
- xAINIEUWGrok 4.72026-09-2146Intelligentie
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1 mln tokens · 118 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens · 1064 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 mln tokens · 47 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens · 213 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
Het meest onthullende aan de gepubliceerde vergelijking tussen TwIL-LM3-Pro en LFM2.5 2.6B Base is dat webAI er helemaal geen enkele tegen de 2.6B heeft gepubliceerd. In de Track A- en Track B-tabellen van webAI wordt zijn 3,66B-formeel-logicaspecialist tegenover een reeks modellen geplaatst — zijn eigen Granite-basis, VibeThinker-3B, Qwen3-8B, Qwen3.5-4B, Llama-3.2-3B, gpt-oss-120b — en de Liquid AI-inzending die ze kozen is LFM2.5-8B-A1B, niet de 2.6B. De 2.6B die wel in de tabel voorkomt is `LFM2-2.6B`, de vorige generatie, een ander model met een andere pretrainingsrun. Die weglating is geen vergissing. LFM2.5 2.6B Base is een vooraf getraind checkpoint zonder instructietuning, en benchmarks voor het volgen van instructies vormen geen test waarvoor het gebouwd is.
Dus deze pagina vergelijkt een afgewerkt artefact met een ruw materiaal. De Aion-achtige framing — het ene model heeft een score en het andere niet — past, maar de reden is specifieker en interessanter: het ene heeft post-training ondergaan en is samengevoegd, het andere stopt bewust vóór post-training, en de twee documenten die ze beschrijven beantwoorden doelbewust verschillende vragen.
Twee parametertellingen die niet dezelfde meting zijn
TwIL-LM3-Pro heeft 3,66 miljard parameters, is dense, waarbij alle parameters actief zijn bij elk token. Het stamt af van `ibm-granite/granite-4.2-3b` via LoRA-finetuning, multipath-distillatie, checkpoint-fusie, een WiSE-FT-samenvoeging terug naar de basis en een entropiegewogen GRPO-fase — en het artefact dat webAI heeft uitgebracht is de samengevoegde policy, geen LoRA-adapter, dus het draait zelfstandig.
LFM2.5 2.6B Base heeft 2,69 miljard parameters verdeeld over 30 lagen: 22 dubbelgegate short-convolution-blokken, afgewisseld met 8 grouped-query-attention-lagen. Dat hybride conv/attention-ontwerp is Liquid's on-device-architectuur, en het is de reden waarom de doorvoercijfers van de familie zijn wat ze zijn, in plaats van louter een functie van het aantal parameters. Het is getraind op 34 biljoen tokens met een vocabulaire van 128.000 tokens en heeft een contextvenster van 131.072 tokens.
De twee aantallen liggen hooguit ongeveer 36% uit elkaar en komen tot stand via volledig verschillende architecturen, dus noch "3,66B verslaat 2,69B", noch het omgekeerde betekent iets als kwaliteitsclaim. De eigen modelkaart van webAI maakt dit punt op een indirecte manier wanneer deze nalaat corpusperplexiteit tussen tokenizers te vergelijken — de vocabulaire van TwIL-LM3-Pro is 100.352, die van LFM2.5-2.6B is 128.000, en perplexiteit is per token.
Wat "Base" verwijdert, en waarom dat het scorebord verandert
Liquid AI publiceert LFM2.5 2.6B in twee vormen: de post-getrainde checkpoint, afgestemd op agentische workloads in populaire agent-harnassen, en de Base, in de eigen modelkaart beschreven als "de voorgetrainde checkpoint met alleen tekst, gebruikt om alle LFM2.5-2.6B-varianten te creëren." De Base is de input voor fine-tuning, geen product. Het heeft geen instructie-tuning, geen chat-template die de naam waard is, en geen gepubliceerde evaluatie — omdat het evalueren van een basismodel op taken voor instructieopvolging het verkeerde meet.
De positie van TwIL-LM3-Pro is het omgekeerde. De volledige waarde ervan zit in de post-training-stack: webAI meldt dat de pipeline op zijn eigen harness de in-domain macro-gate van de 0.4313 van zijn base naar 0.5539 tilde, waarbij de held-out macro over 10 datasets gelijk bleef (0.7942 naar 0.7901) in plaats van in te storten. Het behoud op de held-out set is het moeilijke deel van gespecialiseerde post-training, en het is het deel waarop de Base geen antwoord heeft.
Dit is ook waar de groottevergelijking in de tabellen van webAI zijn vruchten afwerpt. TwIL-LM3-Pro staat naar verluidt voor op LFM2.5-8B-A1B op beide achtergehouden macro's — 0,7901 tegenover 0,7884 op de set met tien datasets, 0,7425 tegenover 0,7378 op de set met veertien — met minder dan de helft van het aantal parameters van dat MoE-model. Dat is een echt vergelijkbaar resultaat, en het is beschikbaar juist omdat LFM2.5-8B-A1B een post-getraind model is dat door een instructieharness kan worden gehaald. Het Base-model kan dat niet, en daarom kreeg de 2.6B nooit een kolom.
De dimensies die het waard zijn om op één lijn te brengen
• Parameters — TwIL-LM3-Pro 3.66B dense vs LFM2.5 2.6B Base 2.69B (30 lagen: 22 conv + 8 GQA).
• Post-training — LoRA SFT, distillatie, WiSE-FT-merge en GRPO bij stap 2580 versus geen; de Base is met opzet de pre-training-output.
• Contextvenster — beide 131.072 tokens, overgenomen van hun respectievelijke basissen.
• Vocabulaire — 100.352 tokens versus 128.000, waardoor hun perplexiteiten niet vergelijkbaar zijn.
• Talen — alleen Engels versus zeventien, waaronder Arabisch, Chinees, Japans, Koreaans, Spaans en Thais.
• Denkformaat — TwIL-LM3-Pro genereert standaard een `<think>`-blok en redeneert uitgebreid (gemiddeld 1.902 tokens in-domein, waarbij 24,2% van de generaties de lengtelimiet bereikt) versus een basis-checkpoint zonder enig instructieformaat.
• Licentie — webAI Non-Commercial License ver. 1.0 vs Liquid's LFM Open License v1.0.
• Waarvoor het dient — een eindpunt voor formeel-logische inferentie versus een startpunt voor fine-tuning.
De contextregels verdienen een voetnoot die beide modellen leveren: elk draagt 131,072 tokens mee vanuit de pretraining, en geen van beide leveranciers heeft langcontextgedrag gevalideerd — de kaart van TwIL-LM3-Pro zegt dat elke gepubliceerde score binnen een venster van 8,192 tokens is gemeten. Overeenkomende cijfers zijn hier geërfd, niet aangetoond.
Licentie, en waar elke licentie juridisch voor dient.
De webAI Non-Commercial License van TwIL-LM3-Pro staat onderzoek en persoonlijk gebruik toe en vereist een afzonderlijke overeenkomst met webAI voor implementaties die inkomsten genereren. LFM2.5 2.6B Base wordt uitgebracht onder Liquid's eigen LFM Open License v1.0, die de Hugging Face API rapporteert als `license: other` in plaats van een standaard SPDX-identifier — lees het licentiebestand voordat je er plannen op baseert, want de voorwaarden zijn van Liquid zelf en niet van een erkend sjabloon.
Geen van beide licenties is Apache 2.0, en het is een fout om "open weights" te behandelen als synoniem voor "commercieel permissief". Het praktische verschil tussen de twee zit in wat de licenties beschermen: een niet-commerciële onderzoeker kan beide gebruiken, een bedrijf dat een product bouwt moet beide controleren, en het hele doel van de Base — worden gefine-tuned tot het product van iemand anders — maakt de exacte voorwaarden ervan ingrijpender dan ze lijken.
Waar elk ervan thuishoort in een stapel
The Base is de juiste keuze wanneer je van plan bent te trainen. Als je probleem een smalle labelingstaak is, een domeinspecifieke classificatiekop, of een fine-tune op een paar duizend gelabelde voorbeelden, dan is beginnen vanaf een voorgetrainde checkpoint van 2,69B met een brede meertalige vocabulaire en een hybride conv-architectuur die op doorvoer is ontworpen een degelijke engineeringbeslissing, en de kosten van de post-training die je zou overslaan zijn de kosten die je in plaats daarvan bewust betaalt.
TwIL-LM3-Pro is de juiste keuze wanneer je niet van plan bent te trainen en de taak al formele logica is. Entailment-labels, formalisering van Lean-statements, semantische parses en bewijskritiek zijn de taken waarop de hele pipeline was gericht, en als je start vanaf een checkpoint dat al door de merge- en de reinforcement-fase is gegaan, bespaart dat je het ene deel hiervan dat echt moeilijk te reproduceren is — het niveau van de held-out-suite vasthouden terwijl je in-domain vooruitgang boekt.
De fout is "3.66B post-trained specialist" te interpreteren als strikt beter dan "2.69B base checkpoint". Ze bevinden zich in verschillende stadia van dezelfde productielijn.
Hen dienen, of om hen heen dienen
Geen van beide modellen is vandaag een route in de OrcaRouter-catalogus, en de reden verschilt per model. TwIL-LM3-Pro heeft een niet-commerciële licentie en heeft geen gehost endpoint; LFM2.5 2.6B Base is een fine-tuning-artefact dat niemand met opzet als inference-endpoint zou aanbieden. Waar een router zijn plek verdient, is een laag hoger, in het werk rondom een specialist: het genereren en filteren van de trainingsdata waarop je de Base zou fine-tunen, het uitbreiden van de prompts die je een formeel-logisch model zou voeren, en het beoordelen van de outputs. Dat zijn tekstcalls, en die lopen via één OpenAI-compatibel endpoint tegen meer dan 200 modellen tegen de lijstprijs van de provider, met 0% toegevoegde markup, zodat een prijsverlaging van een provider dezelfde dag nog doorwerkt en een overstap van het ene datageneratiemodel naar het andere een configuratiewijziging is in plaats van een tweede leveranciersrelatie.
Automatische failover is belangrijker dan gewoonlijk in een fine-tuningpijplijn, want een batchtaak die op 80% sterft, verpest de hele run. Eén sleutel voor alle generatiemodellen, met een fallback die opnieuw wordt verzonden bij een providerfout, is een kleiner stuk infrastructuur dan drie API-integraties.

Welke, bepaald door je intentie
Als je aan het trainen bent, neem de Base. Als je inferentie doet op formele logica en de licentie je gebruik toestaat, neem dan TwIL-LM3-Pro. Als je vandaag een klein instructievolgend model nodig hebt en geen van beide beperkingen van toepassing is, gebruik dan de post-getrainde sibling van LFM2.5 2.6B — het model dat Liquid daadwerkelijk voor dat doel publiceert — en bewaar de Base voor de fine-tuning die je toch al van plan was.


