
TwIL-LM3-Pro vs LFM2.5 2.6B Base: Uno è finito, l'altro è un punto di partenza
- openaiNUOVOOpenAI: GPT-6.1 Sol2026-09-2952Intelligenza
- anthropicNUOVOAnthropic: Claude Sonnet 5.52026-09-2856Intelligenza
- typesafeNUOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M di token · 219 tok/s
- OpenAINUOVOOpenAI: GPT-6 Luna2026-09-2238Intelligenza
- OpenAINUOVOOpenAI: GPT-6 Sol2026-09-2248Intelligenza
- AnthropicNUOVOAnthropic: Claude Opus 5.52026-09-2258Intelligenza
- xAINUOVOGrok 4.72026-09-2146Intelligenza
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1M di token · 118 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token · 1064 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M di token · 47 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token · 213 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
La cosa più rivelatrice del confronto pubblicato tra TwIL-LM3-Pro e LFM2.5 2.6B Base è che webAI non ne ha pubblicato alcuno contro il 2.6B. Le tabelle Track A e Track B di webAI mettono il suo specialista di logica formale da 3,66B contro una serie di contendenti — la sua stessa base Granite, VibeThinker-3B, Qwen3-8B, Qwen3.5-4B, Llama-3.2-3B, gpt-oss-120b — e la voce Liquid AI che hanno scelto è LFM2.5-8B-A1B, non il 2.6B. Il 2.6B che invece compare nella tabella è `LFM2-2.6B`, la generazione precedente, ovvero un modello diverso con un diverso ciclo di pre-addestramento. Questa omissione non è una svista. LFM2.5 2.6B Base è un checkpoint pre-addestrato senza alcun instruction tuning, e i benchmark di instruction-following non sono un test che sia stato costruito per sostenere.
Quindi questa pagina confronta un artefatto finito con una materia prima. L'inquadramento in stile Aion — un modello ha un punteggio e l'altro no — calza, ma la ragione è più specifica e più interessante: uno è post-addestrato e unito, l'altro si ferma deliberatamente prima del post-addestramento, e i due documenti che li descrivono rispondono di proposito a domande diverse.
Due conteggi di parametri che non sono la stessa misura
TwIL-LM3-Pro ha 3,66 miliardi di parametri, è denso, tutti attivi su ogni token. Discende da `ibm-granite/granite-4.2-3b` attraverso fine-tuning LoRA, distillazione multipath, fusione di checkpoint, un merge WiSE-FT di ritorno verso la base e una fase GRPO ponderata per entropia — e l'artefatto distribuito da webAI è la policy fusa, non un adattatore LoRA, quindi funziona in modo autonomo.
LFM2.5 2.6B Base conta 2,69 miliardi di parametri distribuiti su 30 livelli: 22 blocchi a convoluzione breve con doppio gating intervallati a 8 livelli di attenzione con query raggruppate. Questo design ibrido conv/attenzione è l'architettura on-device di Liquid, ed è il motivo per cui i numeri di throughput della famiglia sono quelli che sono, anziché una funzione del solo numero di parametri. È stato addestrato su 34 trilioni di token con un vocabolario di 128.000 token e dispone di una finestra di contesto di 131.072 token.
I due conteggi si collocano entro circa il 36% l'uno dall'altro e sono ottenuti attraverso architetture completamente diverse, quindi né "3,66B batte 2,69B" né il contrario significa qualcosa come affermazione sulla qualità. La model card di webAI stessa lo fa notare indirettamente quando evita di confrontare la perplexity del corpus tra tokenizer — il vocabolario di TwIL-LM3-Pro è 100.352, quello di LFM2.5-2.6B è 128.000, e la perplexity è per token.
Che cosa rimuove "Base" e perché cambia il tabellone
Liquid AI pubblica LFM2.5 2.6B in due forme: il checkpoint post-addestrato, ottimizzato per carichi di lavoro agentici nei popolari harness per agenti, e la Base, descritta nella sua scheda come "il checkpoint pre-addestrato solo testo, usato per creare tutte le varianti di LFM2.5-2.6B". La Base è l'input per il fine-tuning, non un prodotto. Non ha instruction tuning, nessun chat template degno di questo nome e nessuna valutazione pubblicata — perché valutare un modello base su compiti di instruction-following misura la cosa sbagliata.
La posizione di TwIL-LM3-Pro è l'inversa. Il suo intero valore è lo stack di post-training: webAI riferisce che sul proprio harness la pipeline ha sollevato il gate macro in-domain dal 0.4313 del suo base a 0.5539, con il macro held-out su 10 dataset che rimane stabile (da 0.7942 a 0.7901) invece di crollare. La retention held-out è la parte difficile del post-training specialistico, ed è la parte a cui il Base non può rispondere.
È anche qui che il confronto dimensionale nelle tabelle di webAI dà i suoi frutti. TwIL-LM3-Pro viene indicato in vantaggio su LFM2.5-8B-A1B in entrambe le metriche macro held-out — 0,7901 contro 0,7884 sul set di dieci dataset, 0,7425 contro 0,7378 sui quattordici — con meno della metà del numero di parametri di quel modello MoE. Questo è un risultato autentico a parità di condizioni, ed è disponibile proprio perché LFM2.5-8B-A1B è un modello post-addestrato che può essere eseguito attraverso un instruction harness. Il Base non può, ed è per questo che il 2.6B non ha mai avuto una colonna.
Le dimensioni che vale la pena allineare
• Parametri — TwIL-LM3-Pro 3.66B denso vs LFM2.5 2.6B Base 2.69B (30 strati: 22 conv + 8 GQA).
• Post-addestramento — LoRA SFT, distillazione, fusione WiSE-FT e GRPO allo step 2580 vs nessuno; il Base è l'output di pre-addestramento per design.
• Finestra di contesto — 131.072 token per entrambi, ereditata dalle rispettive basi.
• Vocabolario — 100.352 token rispetto a 128.000, motivo per cui le loro perplessità non sono confrontabili.
• Lingue — solo inglese contro diciassette, tra cui arabo, cinese, giapponese, coreano, spagnolo e thai.
• Formato Thinking — TwIL-LM3-Pro emette per impostazione predefinita un blocco `<think>` e ragiona a lungo (1.902 token in media nel dominio, con il 24,2% delle generazioni che raggiunge il limite di lunghezza) rispetto a un checkpoint di base senza alcun formato di istruzioni.
• Licenza — Licenza non commerciale webAI ver. 1.0 vs Licenza aperta LFM di Liquid v1.0.
• A cosa serve — un endpoint di inferenza di logica formale vs un punto di partenza per il fine-tuning.
Le righe relative al contesto meritano una nota a piè di pagina che entrambi i modelli forniscono: ciascuno trasporta 131.072 token dal pretraining, e nessuno dei due fornitori ha validato il comportamento su contesti lunghi — la scheda di TwIL-LM3-Pro afferma che ogni punteggio pubblicato è stato misurato all'interno di una finestra di 8.192 token. I numeri coincidenti qui sono ereditati, non dimostrati.
Licenza, e a cosa serve legalmente ciascuna
La webAI Non-Commercial License di TwIL-LM3-Pro consente l'uso per ricerca e personale e richiede un accordo separato con webAI per un deployment che generi ricavi. LFM2.5 2.6B Base viene distribuito con la LFM Open License v1.0 di Liquid, che l'API di Hugging Face segnala come `license: other` anziché come identificatore SPDX standard — leggi il file di licenza prima di pianificare in base ad essa, perché i termini sono quelli di Liquid e non un modello riconosciuto.
Nessuna delle due licenze è Apache 2.0, ed è un errore considerare "pesi aperti" come sinonimo di "permissivo dal punto di vista commerciale". La differenza pratica tra le due sta in ciò che le licenze proteggono: un ricercatore non commerciale può usare entrambe, un'azienda che costruisce un prodotto deve verificarle entrambe, e lo scopo stesso della Base — essere sottoposta a fine-tuning per diventare parte del prodotto di qualcun altro — rende i suoi termini esatti più importanti di quanto sembrino.
Dove va ciascuno in una pila
La Base è la scelta giusta quando intendi addestrare. Se il tuo problema è un compito di etichettatura ristretto, una testa di classificazione specifica per il dominio o un fine-tuning su qualche migliaio di esempi etichettati, partire da un checkpoint pre-addestrato da 2,69B con un ampio vocabolario multilingue e un'architettura conv ibrida progettata per il throughput è una solida decisione ingegneristica, e il costo del post-addestramento che salteresti è il costo che stai invece pagando deliberatamente.
TwIL-LM3-Pro è la scelta giusta quando non intendi addestrare e il compito è già logica formale. Etichette di entailment, formalizzazione di enunciati Lean, parse semantiche e critica delle dimostrazioni sono i compiti a cui era mirata l'intera pipeline, e partire da un checkpoint che ha già attraversato la fase di merge e quella di reinforcement ti risparmia la parte di tutto questo che è davvero difficile da riprodurre: mantenere il livello della suite held-out mentre si ottengono miglioramenti nel dominio.
L'errore è interpretare «specialista post-addestrato da 3,66B» come strettamente migliore di «checkpoint di base da 2,69B». Si trovano in fasi diverse della stessa linea di produzione.
Servirli, o servire intorno a loro
Nessuno dei due modelli è oggi una route nel catalogo di OrcaRouter, e il motivo è diverso per ciascuno. TwIL-LM3-Pro è con licenza non commerciale e non ha un endpoint ospitato; LFM2.5 2.6B Base è un artefatto di fine-tuning che nessuno servirebbe di proposito come endpoint di inferenza. Un router si guadagna il suo posto un livello più in alto, nel lavoro che circonda uno specialista: generare e filtrare i dati di addestramento su cui si farebbe il fine-tuning della Base, espandere i prompt che si fornirebbero a un modello di logica formale e valutare gli output. Quelle sono chiamate di testo, e passano attraverso un unico endpoint compatibile con OpenAI per oltre 200 modelli al prezzo di listino del provider con 0% di ricarico aggiunto, così un taglio di prezzo del provider arriva lo stesso giorno e passare da un modello di generazione dati a un altro è una modifica di configurazione anziché un secondo rapporto con un fornitore.
Il failover automatico conta più del solito in una pipeline di fine-tuning, perché un job batch che si interrompe all'80% spreca l'intera esecuzione. Una sola chiave per tutti i modelli di generazione, con un fallback che rilancia la richiesta in caso di errore del provider, è un'infrastruttura più leggera rispetto a tre integrazioni API.

Quale, a seconda della tua intenzione
Se stai addestrando, scegli il Base. Se stai facendo inferenza su logica formale e la licenza consente il tuo utilizzo, scegli TwIL-LM3-Pro. Se oggi ti serve un modello piccolo in grado di seguire istruzioni e nessuna delle due restrizioni fa per te, usa il fratello post-addestrato di LFM2.5 2.6B — il modello che Liquid pubblica effettivamente per quello scopo — e lascia il Base per il fine-tuning che avevi comunque in programma.


