
TwIL-LM3-Pro vs MathForm 8B: Enunciato e implicazione sono due metà diverse della formalizzazione
- openaiNUOVOOpenAI: GPT-6.1 Sol2026-09-2952Intelligenza
- anthropicNUOVOAnthropic: Claude Sonnet 5.52026-09-2856Intelligenza
- typesafeNUOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M di token · 219 tok/s
- OpenAINUOVOOpenAI: GPT-6 Luna2026-09-2238Intelligenza
- OpenAINUOVOOpenAI: GPT-6 Sol2026-09-2248Intelligenza
- AnthropicNUOVOAnthropic: Claude Opus 5.52026-09-2258Intelligenza
- xAINUOVOGrok 4.72026-09-2146Intelligenza
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1M di token · 118 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token · 1064 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M di token · 47 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token · 213 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
TwIL-LM3-Pro e MathForm-8B mirano allo stesso vasto problema — far produrre a una macchina testo formale e verificabile anziché prosa plausibile — e ne stanno risolvendo metà diverse. MathForm-8B è l'autoformalizzatore da 8 miliardi di parametri di OpenBMB, rilasciato in agosto 2026: dato un problema matematico in linguaggio naturale, emette l'enunciato Lean 4 di quel problema, lasciando l'obbligo di dimostrazione aperto perché un compilatore lo verifichi. TwIL-LM3-Pro è il modello di logica formale da 3,66 miliardi di webAI di settembre 2026, e i suoi output target sono etichette di implicazione logica, traduzioni in logica del primo ordine, parse semantici e critiche di dimostrazioni Lean. Uno produce la cosa da verificare. L'altro ti dice se la cosa che hai implica ciò che affermi.
Poiché i due si sovrappongono esattamente su un unico terreno — la formalizzazione Lean — una pagina di confronto è allettante e fuorviante. La domanda più utile è per che cosa ciascuno è stato addestrato a essere ricompensato, perché il segnale di ricompensa è il punto in cui i due progetti divergono più nettamente e dove risiede davvero la scelta più intelligente.
Enunciato versus implicazione
MathForm-8B è addestrato su FormalVerse, un corpus Lean 4 che il paper di OpenBMB descrive come circa 367.000 esempi verificati, tramite fine-tuning supervisionato seguito da apprendimento per rinforzo. La pipeline attorno ad esso recupera definizioni rilevanti e formalizzazioni esistenti da Mathlib prima della generazione, poi affina usando diagnostica del compilatore e un controllo di coerenza semantica. Il suo output è un enunciato formale — import, tipi, intestazione del teorema — che un compilatore esterno accetta o rifiuta. La scheda del modello è esplicita sul fatto che non risolve il problema e non pretende di farlo; la dimostrazione è compito di qualcun altro.
TwIL-LM3-Pro affronta lo stesso dominio dal versante della logica. La sua pipeline era orientata a sei obiettivi: traduzione in logica del primo ordine, etichettatura dell'implicazione, parsing semantico, formalizzazione in Lean, critica di dimostrazioni Lean e induzione di regole. Mentre MathForm è costruito per generare un enunciato, TwIL-LM3-Pro è costruito per formulare giudizi sugli enunciati — questo è implicato, questa analisi è corretta, questo tentativo di dimostrazione è solido. Inoltre formalizza, e questo è l'unico ambito in cui i due modelli sono davvero confrontabili anziché semplicemente adiacenti.
Ricompensa da un compilatore rispetto a ricompensa da un assegnatore di punteggio
Questa è la differenza progettuale che conta, ed entrambi i fornitori la documentano.
La ricompensa di addestramento di MathForm derivava dalla compilazione con Lean e dal feedback di coerenza semantica. Un compilatore è un oracolo: o accetta la formalizzazione o non la accetta, e non esistono credito parziale né nulla su cui discutere. È il segnale di ricompensa più pulito in questo angolo dell'apprendimento automatico, ed è per questo che i benchmark di autoformalizzazione vengono riportati come tassi di superamento — la metrica è a valle di un programma a cui non importa ciò che chiunque crede.
La fase finale di TwIL-LM3-Pro è stata un'esecuzione GRPO ponderata per entropia contro un verificatore programmatico, con la scheda del modello stesso che descrive credito parziale per corrispondenze non esatte e token-F1, cosicché i gruppi di prompt in cui tutto è fallito producano comunque gradiente. Il suo gate macro principale è la media a pesi uguali di quattro canali di classificazione limitati più l'induzione di regole, e in quel gate i canali a scelta multipla e procedurale sono accreditati come `max(exact_match, loose_match)` — una regola che la scheda enuncia chiaramente, perché una risposta corretta formattata diversamente è un artefatto di formattazione anziché un errore di ragionamento.
Nessuno dei due design è peggiore. Sono calibrati per conseguenze diverse. Una ricompensa valutata da un compilatore produce un modello a cui puoi sottoporre un difficile problema di formalizzazione e di cui puoi fidarti dell'output, perché l'output è verificabile. Una ricompensa valutata da uno scorer con credito parziale produce un modello che può essere addestrato su giudizi più sfumati — implicazione, critica, induzione di regole — dove non esiste alcun compilatore a fare da arbitro e l'alternativa è non addestrare affatto su quei canali. Il costo è che i numeri risultanti valgono solo quanto il sistema di valutazione, e webAI lo dice: la sua riga strict-7, che elimina ogni traccia di credito per corrispondenza approssimativa, esiste proprio perché un lettore possa vedere la cifra più severa accanto a quella principale.
I punteggi non sono sulla stessa scala.
Entrambi i modelli pubblicano numeri riguardanti Lean e non sono sottraibili. Il paper di MathForm riporta un Pass@8 medio dell'88,06% con il controllo di sintassi e del 72,37% con il controllo di coerenza su sei benchmark Lean, con tassi di superamento del controllo di coerenza del 63% e del 37% sui sottoinsiemi più difficili FATE-H e FATE-X, e dichiara di superare diversi autoformalizzatori specializzati da 32B. La scheda di TwIL-LM3-Pro riporta un token-F1 di `lean_formalize` pari a 0,5092 e un'accuratezza di `lean_critic` di 0,7950 sul proprio harness Track A.
Pass@8 sottoposto a un controllo del compilatore e token-F1 rispetto a una stringa di riferimento misurano cose diverse. Pass@8 dà al modello otto tentativi e chiede se uno di essi sia stato compilato e sia rimasto coerente; token-F1 valuta quanto strettamente una singola generazione abbia corrisposto a un riferimento. Un modello può ottenere un buon punteggio su una e scarso sull'altra, e nulla in nessuno dei due documenti autorizza a leggerle fianco a fianco.
Il riassunto onesto del record del benchmark è che le prove di MathForm-8B provengono da un articolo con un compilatore nel ciclo e quelle di TwIL-LM3-Pro provengono da un harness di fornitore con uno scorer nel ciclo, e nessuna terza parte ha fatto passare entrambi attraverso un'unica rubrica. Considera qualsiasi pagina che mette "88.06%" accanto a "0.5092" come se fossero un punteggio come una pagina che non ha letto le definizioni.
Specifiche, a confronto
Parametri — TwIL-LM3-Pro 3.66B denso vs MathForm-8B 8B, circa 2,2 volte la dimensione.
• Modello base — `ibm-granite/granite-4.2-3b` vs `Qwen/Qwen3-8B`.
• Dati di addestramento — un corpus sintetico di logica formale che copre sei obiettivi rispetto a FormalVerse, circa 367.000 esempi Lean 4 verificati.
• Ricompensa — un verificatore programmatico con credito parziale e tolleranza alle corrispondenze approssimative rispetto alla compilazione Lean e al feedback di coerenza semantica.
• Output primario — etichette di implicazione, traduzioni in FOL, analisi semantiche, asserzioni Lean e critiche di dimostrazione rispetto a un'asserzione Lean 4 che un compilatore deve verificare.
• Finestra di contesto — 131.072 token per TwIL-LM3-Pro, misurata all'interno di 8.192 token; MathForm-8B viene servito con budget di generazione fino a 16.384 token nel suo esempio d'uso.
• Licenza — webAI Non-Commercial License ver. 1.0 vs Apache 2.0.
• Footprint quantizzato — TwIL-LM3-Pro distribuisce un GGUF Q4_K_M da 2,09 GiB per CPU o 4 GB di VRAM; MathForm-8B non pubblica alcun GGUF nel proprio repository.
Ancora una volta la licenza decide la questione della produzione.
MathForm-8B è Apache 2.0. Puoi eseguirne il fine-tuning, ridistribuirlo e servirlo all'interno di un prodotto commerciale. TwIL-LM3-Pro è non commerciale: l'uso per ricerca e personale è consentito, e un deployment che genera ricavi richiede un accordo separato con webAI, il cui percorso commerciale è un accordo enterprise anziché un listino prezzi pubblicato.
Per un gruppo di ricerca o uno studente, quella differenza è irrilevante — entrambi sono download senza restrizioni su Hugging Face. Per un'azienda è decisiva, e indica MathForm-8B per qualsiasi attività di autoformalizzazione in produzione, indipendentemente da quale modello ottenga un punteggio migliore in una categoria che nessuno dei due fornitori ha misurato allo stesso modo.
Dove si colloca un router in questa pipeline
Né TwIL-LM3-Pro né MathForm-8B è una rotta nel catalogo OrcaRouter, e le ragioni differiscono: uno ha una licenza non commerciale e nessun endpoint ospitato, l'altro è pubblicato come checkpoint aperto per l'auto-hosting. Su un endpoint compatibile con OpenAI davanti a oltre 200 modelli al prezzo di listino del fornitore con 0% di ricarico aggiunto, quello scambio è un cambio di configurazione, e un taglio di prezzo del fornitore sul modello di generazione arriva lo stesso giorno. Il failover automatico è essenziale in una costruzione di corpus proprio perché un job che muore a due terzi di una passata di generazione costa l'intera esecuzione.

La divisione del lavoro
Se il compito è convertire la matematica da manuale in affermazioni Lean compilabili su larga scala, e il risultato deve essere rilasciato in un prodotto commerciale, MathForm-8B è lo strumento e la licenza Apache 2.0 è il motivo. Se il compito è decidere se un corpo di testo implica un'affermazione, etichettare l'implicazione, analizzare la semantica o criticare un tentativo di dimostrazione, TwIL-LM3-Pro copre ambiti per cui MathForm non è mai stato pensato — e la sua licenza non commerciale è un limite a dove tale capacità può essere utilizzata, non un punto a sfavore della capacità stessa.
La combinazione che ha senso è una pipeline a due stadi più che una scelta: un modello emette l'enunciato formale, l'altro lo giudica. Entrambi hanno pubblicato la pipeline che li ha prodotti, cosa insolita a questa scala ed è la ragione per cui questo confronto può essere fatto.


