
TwIL-LM3-Pro vs MathForm 8B: Bewering en gevolgtrekking zijn verschillende helften van formalisering
- openaiNIEUWOpenAI: GPT-6.1 Sol2026-09-2952Intelligentie
- anthropicNIEUWAnthropic: Claude Sonnet 5.52026-09-2856Intelligentie
- typesafeNIEUWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 mln tokens · 219 tok/s
- OpenAINIEUWOpenAI: GPT-6 Luna2026-09-2238Intelligentie
- OpenAINIEUWOpenAI: GPT-6 Sol2026-09-2248Intelligentie
- AnthropicNIEUWAnthropic: Claude Opus 5.52026-09-2258Intelligentie
- xAINIEUWGrok 4.72026-09-2146Intelligentie
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1 mln tokens · 118 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens · 1064 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 mln tokens · 47 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens · 213 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
TwIL-LM3-Pro en MathForm-8B zijn gericht op hetzelfde brede probleem — een machine formele, controleerbare tekst laten produceren in plaats van plausibel proza — en ze lossen verschillende helften ervan op. MathForm-8B is de autoformaliseerder met 8 miljard parameters van OpenBMB, uitgebracht in augustus 2026: gegeven een wiskundeprobleem in gewone taal, produceert het de Lean 4-formulering van dat probleem, waarbij de bewijsverplichting open blijft voor een compiler om te controleren. TwIL-LM3-Pro is het formeel-logische model van webAI met 3,66B uit september 2026, en de beoogde uitvoer bestaat uit entailment-labels, vertalingen naar eersteordelogica, semantische parses en Lean-bewijskritieken. De ene produceert het ding dat gecontroleerd moet worden. De andere vertelt je of het ding dat je hebt, impliceert wat je beweert.
Omdat de twee op precies één vlak overlappen — Lean-formalisering — is een vergelijkingspagina verleidelijk en misleidend. De nuttigere vraag is waarvoor elk getraind is om beloond te worden, want het beloningssignaal is waar de twee ontwerpen het scherpst uiteenlopen en waar de slimste keuze werkelijk ligt.
Bewering versus implicatie
MathForm-8B is getraind op FormalVerse, een Lean 4-corpus dat de OpenBMB-paper beschrijft als ongeveer 367.000 geverifieerde voorbeelden, via gesuperviseerde fine-tuning gevolgd door reinforcement learning. De pijplijn eromheen haalt relevante definities en bestaande formalisaties uit Mathlib op vóór de generatie, en verfijnt vervolgens met behulp van compilerdiagnostiek en een semantische consistentiecheck. De uitvoer is een formele stelling — imports, types, theorema-header — die een externe compiler accepteert of afwijst. De modelkaart is expliciet dat het het probleem niet oplost en dat ook niet claimt; het bewijs is het werk van iemand anders.
TwIL-LM3-Pro benadert hetzelfde domein vanaf de logische kant. De pijplijn was gericht op zes doelstellingen: vertaling naar eerste-orde logica, labeling van logische implicaties, semantische parsing, Lean-formalisatie, kritiek op Lean-bewijzen en regelinductie. Waar MathForm is gebouwd om een uitspraak te genereren, is TwIL-LM3-Pro gebouwd om oordelen over uitspraken te vellen — volgt dit logisch, is deze parse correct, is deze bewijspoging correct. Het formaliseert ook, en dat is de enige plek waar de twee modellen echt vergelijkbaar zijn in plaats van louter aanpalend.
Beloning van een compiler versus beloning van een scorer
Dit is het ontwerpverschil dat ertoe doet, en beide leveranciers documenteren het.
De trainingsbeloning van MathForm kwam van Lean-compilatie en feedback over semantische consistentie. Een compiler is een orakel: hij accepteert de formalisering of niet, en er zijn geen deelpunten en niets om over te twisten. Dat is het zuiverste beloningssignaal in deze hoek van machine learning, en daarom worden autoformalization-benchmarks gerapporteerd als slagingspercentages — de metriek staat stroomafwaarts van een programma dat er niet om geeft wat iemand gelooft.
De laatste fase van TwIL-LM3-Pro was een entropie-gewogen GRPO-run tegen een programmatische verifier, waarbij de eigen kaart van het model gedeeltelijk krediet beschrijft voor losse matches en token-F1, zodat promptgroepen waarin alles faalde alsnog gradiënt opleveren. De belangrijkste macro-poort is het gelijkgewogen gemiddelde van vier begrensde classificatielanes plus regelinductie, en in die poort worden de meerkeuze- en procedurele lanes gecrediteerd als `max(exact_match, loose_match)` — een regel die de kaart ronduit vermeldt, omdat een correct antwoord dat anders is geformatteerd een formatteerartefact is en geen redeneerfout.
Geen van beide ontwerpen is slechter. Ze zijn afgestemd op verschillende gevolgen. Een door een compiler beoordeelde beloning levert een model op dat je op een moeilijk formalisatieprobleem kunt richten en waarvan je de output kunt vertrouwen, omdat de output verifieerbaar is. Een door een scorer beoordeelde beloning met gedeeltelijke credit levert een model op dat kan worden getraind op vagere beoordelingen — entailment, critique, rule induction — waar geen compiler bestaat om uitsluitsel te geven en het alternatief is om helemaal niet op die sporen te trainen. De keerzijde is dat de resulterende cijfers alleen zo goed zijn als de harness, en webAI zegt dat ook: de strict-7-rij, die elk spoor van loose-matchcredit weglaat, bestaat juist zodat een lezer het hardere cijfer naast het hoofdalcijfer kan zien.
De scores staan niet op dezelfde meetlat.
Beide modellen publiceren Lean-gerelateerde cijfers en die kunnen niet van elkaar worden afgetrokken. De paper van MathForm rapporteert een gemiddelde Pass@8 van 88,06% onder Syntax Check en 72,37% onder Consistency Check over zes Lean-benchmarks, met 63% en 37% consistency-check-slaagpercentages op de moeilijkere FATE-H- en FATE-X-subsets, en claimt beter te presteren dan verschillende gespecialiseerde 32B-autoformalizers. De modelkaart van TwIL-LM3-Pro rapporteert een token-F1 van 0,5092 voor `lean_formalize` en een nauwkeurigheid van 0,7950 voor `lean_critic` op zijn eigen Track A-harness.
Pass@8 onder een compilercontrole en token-F1 tegen een referentietekenreeks meten verschillende dingen. Pass@8 geeft het model acht pogingen en vraagt of er één compileerde en consistent bleef; token-F1 beoordeelt hoe nauwkeurig een enkele generatie overeenkwam met een referentie. Een model kan goed scoren op het ene en slecht op het andere, en niets in een van beide documenten rechtvaardigt om de twee naast elkaar te lezen.
De eerlijke samenvatting van het benchmarkdossier is dat het bewijs voor MathForm-8B uit een paper komt met een compiler in het proces, en dat het bewijs voor TwIL-LM3-Pro uit een leveranciersharnas met een scorer in het proces komt, en dat geen enkele derde partij beide door één beoordelingskader heeft gehaald. Behandel elke pagina die "88.06%" naast "0.5092" zet alsof het een uitslag is, als een pagina die de definities niet heeft gelezen.
Specificaties, naast elkaar
• Parameters — TwIL-LM3-Pro 3,66B dense vs. MathForm-8B 8B, ongeveer 2,2 keer zo groot.
• Basismodel — `ibm-granite/granite-4.2-3b` vs `Qwen/Qwen3-8B`.
• Trainingsdata — een synthetisch corpus voor formele logica dat zes doelstellingen bestrijkt versus FormalVerse, ongeveer 367.000 geverifieerde Lean 4-voorbeelden.
• Beloning — een programmatische verifieerder met gedeeltelijke scores en tolerantie voor losse overeenkomsten versus Lean-compilatie en feedback over semantische consistentie.
• Primaire output — entailment-labels, FOL-vertalingen, semantische parses, Lean-statements en bewijskritieken versus een Lean 4-statement dat een compiler kan controleren.
• Contextvenster — 131.072 tokens voor TwIL-LM3-Pro, gemeten binnen 8.192 tokens; MathForm-8B wordt in het eigen gebruiksvoorbeeld geleverd met generatiebudgetten tot 16.384 tokens.
• Licentie — webAI Non-Commercial License ver. 1.0 vs Apache 2.0.
• Gekwantiseerde voetafdruk — TwIL-LM3-Pro levert een Q4_K_M GGUF van 2,09 GiB voor CPU of 4 GB VRAM; MathForm-8B publiceert geen GGUF in zijn eigen repository.
De licentie beslist opnieuw over de productiekwestie.
MathForm-8B is Apache 2.0. Je kunt het fine-tunen, herdistribueren en het binnen een commercieel product aanbieden. TwIL-LM3-Pro is niet-commercieel: onderzoek en persoonlijk gebruik zijn toegestaan, en voor een implementatie die omzet genereert is een aparte overeenkomst met webAI nodig; de commerciële route daarvan is een enterprise-afspraak in plaats van een gepubliceerde tariefkaart.
Voor een onderzoeksgroep of een student is dat verschil irrelevant — beide zijn niet-gated downloads op Hugging Face. Voor een bedrijf is het doorslaggevend, en het wijst op MathForm-8B voor elk productiewerk op het gebied van autoformalisering, ongeacht welk model beter scoort op een onderdeel dat geen van beide leveranciers op dezelfde manier heeft gemeten.
Waar een router zich in deze pipeline bevindt
Noch TwIL-LM3-Pro noch MathForm-8B is een route in de OrcaRouter-catalogus, en de redenen verschillen: de ene heeft een niet-commerciële licentie zonder gehost endpoint, de andere is gepubliceerd als een open checkpoint voor self-hosting. De routeringsvraag in een formalisatiepijplijn is de laag eromheen. Het bouwen van een corpus in FormalVerse-stijl betekent duizenden informele problemen genereren, ze filteren op welgevormdheid en de semantische-consistentiecontroles schrijven die de output beoordelen — allemaal tekstaanroepen, en allemaal het soort werk waarbij je het model dat bulkdata genereert wilt omwisselen voor het model dat die beoordeelt, zonder een tweede contract. Op één OpenAI-compatibel endpoint voor meer dan 200 modellen tegen de lijstprijs van de provider met 0% opslag, is die omwisseling een configuratiewijziging, en een prijsverlaging van de leverancier op het generatiemodel gaat dezelfde dag in. Automatische failover is cruciaal in een corpusopbouw, juist omdat een taak die op tweederde van een generatieronde sterft de hele run kost.

De arbeidsdeling
Als het de taak is om op grote schaal leerboekwiskunde om te zetten in compileerbare Lean-statements, en het resultaat moet worden uitgebracht in een commercieel product, dan is MathForm-8B het gereedschap en is de Apache 2.0-licentie de reden waarom. Als het de taak is om te bepalen of een tekst een bewering impliceert, entailment te labelen, semantiek te parsen, of een bewijspoging te bekritiseren, dan bestrijkt TwIL-LM3-Pro terrein waarop MathForm nooit was gericht — en de niet-commerciële licentie ervan is een grens aan waar die capaciteit kan worden gebruikt, niet een minpunt voor de capaciteit zelf.
De combinatie die zinvol is, is een tweestaps-pijplijn in plaats van een keuze: het ene model genereert de formele bewering, het andere beoordeelt die. Beide hebben de pijplijn gepubliceerd die hen heeft voortgebracht, wat ongewoon is op deze schaal en de reden is dat deze vergelijking überhaupt kan worden gemaakt.


