
TwIL-LM3-Pro: Un modello di logica formale da 3,66B che viene distribuito su richiesta via email
- openaiNUOVOOpenAI: GPT-6.1 Sol2026-09-2952Intelligenza
- anthropicNUOVOAnthropic: Claude Sonnet 5.52026-09-2856Intelligenza
- typesafeNUOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M di token · 219 tok/s
- OpenAINUOVOOpenAI: GPT-6 Luna2026-09-2238Intelligenza
- OpenAINUOVOOpenAI: GPT-6 Sol2026-09-2248Intelligenza
- AnthropicNUOVOAnthropic: Claude Opus 5.52026-09-2258Intelligenza
- xAINUOVOGrok 4.72026-09-2146Intelligenza
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1M di token · 118 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token · 1064 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M di token · 47 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token · 213 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
TwIL-LM3-Pro è un modello di ragionamento da 3,66 miliardi di parametri di webAI, costruito specificamente per la logica formale anziché per la conversazione generale, ed è su Hugging Face dal 3 settembre 2026. Non è un nuovo rilascio, e la narrazione che circola attorno a esso questa settimana — che webAI "ha rilasciato un modello da 3,66B" — è in ritardo di un mese rispetto ai pesi. Ciò che è realmente cambiato negli ultimi giorni è più piccolo e più utile: il checkpoint è stato rivisto il 30 settembre, e il 1º ottobre webAI ha pubblicato una build LiteRT-LM del modello per l'inferenza su dispositivo Android e iOS. Quindi la domanda interessante non è che cos'è TwIL-LM3-Pro, ma se puoi ottenerlo, e la risposta dipende da quale dei tre canali di distribuzione ti trovi — perché uno di essi è un modulo.
Questa distinzione conta più di quanto non farebbe normalmente, perché TwIL-LM3-Pro non è un prodotto che puoi semplicemente chiamare. È un checkpoint che scarichi, esegui sul tuo hardware e di cui accetti i termini di una licenza che vieta l'uso commerciale. Il confronto a cui invita la sua stessa scheda del modello — con Qwen3-8B, un modello con più del doppio dei parametri — è reale, ma è un confronto tra benchmark eseguiti dal fornitore su un harness costruito dal fornitore, e la scheda del modello lo dice essa stessa in più punti di quanto faccia la maggior parte. Questo articolo legge attentamente quella scheda e separa ciò che webAI ha misurato da ciò che chiunque altro ha misurato.
Che cos'è effettivamente il modello
` block before answering and was evaluated with greedy decoding at a 2,048-token budget." But wait, the user message has no visible markers? Actually the system prompt says "The text contains numbered span markers like {{1}}...{{/1}}, {{2}}...{{/2}}." But the user message doesn't show any markers. It might be that markers are hidden? Let's inspect: The user message text: "TwIL-LM3-Pro is a dense Granite decoder — `GraniteForCausalLM`, 40 layers, hidden size 2,560, 40 attention heads against 8 key-value heads — derived from IBM's `granite-4.2-3b`. The 3.66B parameter count is the real total, 3,659,737,600, and the context window is the base model's 131,072 tokens carried through unchanged. It emits a `<think>…</think>` block before answering and was evaluated with greedy decoding at a 2,048-token budget." No markers. Maybe the system prompt is generic. We should just translate. But we must be careful: "Keep EVERY marker byte-for-byte" but there are none. So just translate to Italian. Need preserve URLs, brand/product names. Preserve code-like names: TwIL-LM3-Pro? Is that brand? Probably keep. `GraniteForCausalLM` keep. `granite-4.2-3b` keep. `<think>…</think>` keep. Numbers keep. Italian translation. We need maintain the em dashes? Yes, punctuation can be adjusted. Let's craft Italian: "TwIL-LM3-Pro è un decoder Granite denso — `GraniteForCausalLM`, 40 livelli, dimensione nascosta 2.560, 40 teste di attenzione contro 8 teste chiave-valore — derivato da `granite-4.2-3b` di IBM. Il conteggio dei parametri di 3,66B è il totale reale, 3.659.737.600, e la finestra di contesto è quella del modello base di 131.072 token mantenuta invariata. Emette un blocco `<think>…</think>` prima di rispondere ed è stato valutato con decodifica greedy a un budget di 2.048 token." Need decide number formatting: Italian uses comma for decimals, dot for thousands. Original: 2,560 -> 2.560; 3.66B -> 3,66B; 3,659,737,600 -> 3.659.737.600; 131,072 -> 131.072; 2,048 -> 2.048. Good. "dense Granite decoder" -> "decoder Granite denso" or "decoder Granite dense"? In Italian, "denso" is used for dense models? Maybe "un decoder Granite denso" is fine. Or "un decoder denso Granite"? The original: "a dense Granite decoder" -> "un decoder Granite denso". "40 attention heads against 8 key-value heads" -> "40 teste di attenzione rispetto a 8 teste chiave-valore" or "contro 8 teste chiave-valore". "contro" means against, fine. "derived from IBM's `granite-4.2-3b`" -> "derivato da `granite-4.2-3b` di IBM". "The 3.66B parameter count is the real total, 3,659,737,600" -> "Il conteggio dei parametri di 3,66B è il totale reale, 3.659.737.600". Maybe "Il numero di parametri di 3,66B è il totale reale". "context window is the base model's 131,072 tokens carried through unchanged" -> "la finestra di contesto è quella di 131.072 token del modello base, mantenuta invariata." Or "la finestra di contesto è di 131.072 token del modello base, trasferita invariata." "carried through unchanged" -> "mantenuta invariata" or "riportata invariata". "It emits a `<think>…</think>` block before answering" -> "Emette un blocco `<think>…</think>` prima di rispondere". "was evaluated with greedy decoding at a 2,048-token budget" -> "è stato valutato con decodifica greedy con un budget di 2.048 token." Should "greedy" remain "greedy" or "avida"? In ML Italian, "decodifica greedy" common. Keep "greedy" maybe. No markers, so output only translation. But the system says output only translated text with its markers. No preamble. Good. Let's finalize. Ensure not to translate inside backticks? The system says preserve URLs and brand/product names. Backtick code names are product? We should keep them exactly. In Italian, we can leave backticks as is. "GraniteForCausalLM" keep. "granite-4.2-3b" keep. "<think>…</think>" keep. Check punctuation: Use em dash — same. Italian uses "—" okay. Final translation: "TwIL-LM3-Pro è un decoder Granite denso — `GraniteForCausalLM`, 40 livelli, dimensione nascosta 2.560, 40 teste di attenzione contro 8 teste chiave-valore — derivato da `granite-4.2-3b` di IBM. Il conteggio dei parametri di 3,66B è il totale reale, 3.659.737.600, e la finestra di contesto è quella di 131.072 token del modello base mantenuta invariata. Emette un blocco `<think>…</think>` prima di rispondere ed è stato valutato con decodifica greedy con un budget di 2.048 token." Check "a 2,048-token budget" -> "con un budget di 2.048 token" fine. Should "attention heads" be "head di attenzione"? In Italian, "teste di attenzione" is okay, but sometimes "head" used. "40 attention heads against 8 key-value heads" -> "40 teste di attenzione contro 8 teste chiave-valore" fine. "dense Granite decoder" maybe "decoder Granite denso" okay. Could use "modello" for model? Fine. Output only.TwIL-LM3-Pro è un decoder Granite denso — `GraniteForCausalLM`, 40 livelli, dimensione nascosta 2.560, 40 teste di attenzione contro 8 teste chiave-valore — derivato da `granite-4.2-3b` di IBM. Il conteggio dei parametri di 3,66B è il totale reale, 3.659.737.600, e la finestra di contesto è quella di 131.072 token del modello base mantenuta invariata. Emette un blocco `<think>…</think>` prima di rispondere ed è stato valutato con decodifica greedy con un budget di 2.048 token.
Lo stack di post-addestramento è la parte che webAI vuole effettivamente che tu guardi, ed è insolitamente ben documentato per un modello di queste dimensioni: un fine-tuning supervisionato LoRA con rank 64 su un corpus sintetico di logica formale, distillazione multipath per produrre diverse tracce di ragionamento per prompt, fusione di checkpoint nello spazio dei parametri invece di prendere il checkpoint finale, un'interpolazione WiSE-FT a α = 0.15 riunita alla base pre-addestrata con TIES e DARE-SLERP, e infine una fase GRPO ponderata per entropia — webAI la chiama MGPO — contro un verificatore programmatico, eseguita fino allo step 2580, che è il checkpoint che è stato distribuito.
L'artefatto pubblicato è la policy unita (merged) anziché un adattatore LoRA, ed è questo il dettaglio pratico: puoi eseguirlo come modello autonomo, in bf16 a 6,82 GiB, oppure come GGUF Q4_K_M a 2,09 GiB su una CPU o 4 GB di VRAM. È questa l'affermazione "gira su un portatile", ed è l'unica affermazione nell'intera scheda che sia banalmente verificabile e quindi degna di fiducia.
Il confronto Qwen3-8B, da leggere attentamente
Il titolo che webAI appone al modello è che TwIL-LM3-Pro raggiunge la vetta delle proprie righe di riepilogo del Track A a 3,66B parametri. Le quattro righe di riepilogo sono un macro gate di 0,5539, strict-7 di 0,2879, una media a sei lane di 0,5389 e macro_primary di 0,5875. Rispetto a Qwen3-8B, il macro gate è 0,5539 contro 0,5336 — e la model card stessa scrive la frase che una pagina di marketing avrebbe cancellato: "il vantaggio del gate su Qwen3-8B è 0,020 — inferiore al rumore di campionamento con n = 200 per lane — quindi interpretalo come parità, non come una vittoria."
Quella è la riga più importante in assoluto della pagina. L'inquadramento che webAI stessa dà al risultato principale è quello di un pareggio. Laddove il confronto non è un pareggio:
• Strict-7 — TwIL-LM3-Pro 0.2879 vs Qwen3-8B 0.2093, e questa riga non utilizza in alcun punto crediti per corrispondenze approssimative, quindi non può essere prodotta dalla fortuna nella formattazione.
• MCQ rigoroso — TwIL-LM3-Pro 0.4100 vs Qwen3-8B 0.0000, il divario di corsia più ampio tra le undici righe riportate.
• Induzione di regole — TwIL-LM3-Pro 0.4195 vs Qwen3-8B 0.3680.
• Aderenza al corpus — la perplessità `lm_corpus` più bassa di qualsiasi braccio, pari a 2.3130, con Qwen3-8B a 2.5478.
• Parametri — 3,66B vs circa 8B, che è l'intera base dell'affermazione "meno della metà dei parametri".
Due avvertenze accompagnano quella tabella e webAI le enuncia entrambe. Le generazioni del Track A da TwIL-LM3-Pro hanno una media di 1.902 token e il 24,2% di essi raggiunge il limite di lunghezza, contro i 564 token del suo predecessore TwIL-LM3; la parola usata dalla scheda per il divario risultante è «indicativo più che esatto». E le cifre di throughput nella tabella sono state misurate in una sessione successiva su una vLLM più recente (0.19.1) rispetto alle colonne di confronto (0.11.2), quindi le righe dei token al secondo sono confrontabili tra loro e solo approssimativamente con il resto.
Dove non vince
Sulla suite tenuta da parte, la scheda del modello è senza mezzi termini: «TwIL-LM3-Pro non è in testa.» La macro su 10 dataset è 0,7901, statisticamente in linea con il suo stesso modello base a 0,7942, e ben dietro Qwen3-8B a 0,8493 e gpt-oss-120b a 0,8689. La sua macro su 14 dataset di 0,7425 supera la sua base di 0,0093, e l'intero guadagno deriva da BBH-logic (0,9540 contro 0,9013 della base) — togli quella singola riga e il modello ha una media di 0,7263 sui restanti tredici, sotto il 0,7350 di VibeThinker-3B.
Ci sono tre punti davvero deboli all'interno della specializzazione, tutti resi noti: corrispondenza esatta della traduzione FOL a 0,0100, `procedural` a 0,1200 strict, e corrispondenza esatta del semantic-parse a 0,0000. L'induzione di regole analizza solo il 56,5% dei suoi output. E il modello è verboso per costruzione — circa 792 token per risposta di Track B contro 482 del suo predecessore — il che è un costo, non una capacità.
Niente di tutto questo è una critica al rilascio. È l'aspetto che ha una model card ben scritta, ed è il motivo per cui i numeri qui possono essere citati.
Tre modi per ottenerlo, e uno di questi è un modulo.
La situazione della distribuzione è la vera notizia della settimana e vale la pena enunciarla con precisione.
I pesi sono su Hugging Face, senza restrizioni di accesso, sotto la webAI Non-Commercial License ver. 1.0 — che consente la ricerca e l'uso personale e richiede un accordo separato con webAI per un deployment che generi ricavi. Quella licenza è il vincolo decisivo per l'intera release, ed è per questo che TwIL-LM3-Pro non è un modello che la maggior parte dei team di prodotto può semplicemente adottare.
webAI afferma che la famiglia ha superato mezzo milione di download in un mese, un dato che l'azienda ha pubblicato nel proprio annuncio e che non è stato verificato in modo indipendente. I download di un checkpoint gratuito e non commerciale non sono un indicatore dell'uso in produzione, e webAI non li presenta come tali.
La piattaforma proprietaria del fornitore, nel frattempo, non è un endpoint pubblico. webAI si descrive come una piattaforma enterprise che porta l'IA ai tuoi dati, con un'applicazione modello local-first, e il suo percorso commerciale è un accordo enterprise piuttosto che un listino prezzi pubblicato per token. TwIL-LM3-Pro è inoltre assente dalle grandi piattaforme di inferenza di terze parti che indicizzano checkpoint aperti — abbiamo verificato, e non è nemmeno nel catalogo OrcaRouter — quindi la risposta pratica a "da dove posso chiamarlo da un'API" è che al momento per lo più non puoi; lo scarichi.
Il terzo canale è quello nuovo. Il repository `TwIL-LM3-Pro-LiteRT-LM` è comparso il 1° ottobre 2026, con artefatti `.litertlm` e taggato per Android e iOS — il packaging runtime LiteRT-LM di webAI degli stessi pesi. Se quella build erediti la licenza non commerciale è la domanda a cui rispondere prima di pianificare attorno ad essa, perché il repository padre lo fa.
Perché uno specialista di logica formale di queste dimensioni è da tenere d'occhio
Il motivo per cui questa release continua a riemergere non è la tabella di benchmark. È che webAI ha pubblicato l'intera pipeline, ha eseguito la stessa identica ricetta su cinque diversi modelli base e ha riportato cosa è successo. La tabella di confronto della famiglia registra un movimento del macro-gate di Track A da +0.012 a +0.145 a seconda del modello base, con la suite held-out che resta entro ±0.013 — la versione documentata di «questo generalizza». L'unico coefficiente scelto per modello è il peso di merge, ottimizzato sulla performance held-out: 0.15 per SmolLM3, 0.20 per Granite e la base TwIL, 0.50 per VibeThinker-3B.
Questa è una ricetta riutilizzabile per trasformare un piccolo modello generalista in uno specialista di nicchia senza distruggere ciò che già sapeva, pubblicata con i risultati negativi allegati. Per chiunque abbia bisogno di etichette di implicazione, formalizzazione di enunciati Lean o analisi semantiche anziché prosa fluente, un GGUF da 2,09 GiB che funziona offline, senza costi per chiamata e senza dipendenze dalla rete, è una proposta diversa da qualsiasi modello ospitato, qualunque cosa dica la tabella Elo.
La questione aperta è se i pesi compariranno mai sotto una licenza che ne consenta l'uso commerciale, e se il port di LiteRT-LM sarà distribuito con la stessa restrizione. Fino ad allora TwIL-LM3-Pro è un artefatto di ricerca con una model card insolitamente onesta — il che non è poco.

Se hai bisogno di questa funzionalità in produzione oggi
Per un deployment commerciale, il blocco è la licenza, non i benchmark, e il sostituto pratico è un modello ospitato a cui puoi instradare. È il livello su cui opera OrcaRouter: un unico endpoint compatibile con OpenAI davanti a oltre 200 modelli al prezzo di listino del fornitore, senza alcun ricarico aggiunto, così un taglio di prezzo del fornitore è attivo lo stesso giorno anziché dopo un ciclo contrattuale. Per le poche situazioni in cui un piccolo checkpoint di logica formale è davvero adatto — etichettatura batch offline, un passaggio di entailment in air-gap, uno step di preelaborazione il cui output è un'etichetta anziché prosa — la divisione onesta è eseguire il modello locale dove il carico è testo-a-etichetta, e instradare il ragionamento circostante, l'espansione dei prompt e la QA verso modelli ospitati sulla stessa chiave.
Un'avvertenza che vale la pena ripetere specificamente in questa sezione: con il failover automatico puoi anche puntare a un modello prima di fidarti di esso su un percorso di produzione, e fare rollback modificando una regola di routing invece di ridistribuire. È il pattern che si adatta a un modello come questo quando il suo stato commerciale non è risolto.

Cosa guardare
Tre cose cambierebbero questa storia. Un cambio di licenza, o un port di LiteRT-LM con licenza chiara, farebbe passare TwIL-LM3-Pro da artefatto di ricerca a componente distribuibile. La comparsa su una grande piattaforma di inferenza ospitata gli darebbe una vera API. E una valutazione indipendente — chiunque altro oltre a webAI che esegua l'harness di Track A — ci direbbe se il vantaggio di strict-7 su Qwen3-8B sopravvive quando viene misurato da qualcuno che non ha costruito l'harness. Nessuna delle tre si è ancora verificata, e la scheda del modello è abbastanza onesta da mostrare esattamente quali condizioni dovrebbero sussistere perché abbiano importanza.

