Ett genererat titelkort med rubriken "TwIL-LM3-Pro vs MathForm 8B", underrubriken "Påstående vs logisk följd", med två avrundade kort med texten "MathForm 8B – avger Lean 4-påståendet" och "TwIL-LM3-Pro – bedömer påståendet". OrcaRouter-logotypen är inkomponerad i det nedre högra hörnet.
Guides & Insights

TwIL-LM3-Pro vs MathForm 8B: Påstående och logisk följd är olika halvor av formalisering

Författare

Alistair Wren

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller →
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

TwIL-LM3-Pro och MathForm-8B riktar in sig på samma övergripande problem — att få en maskin att producera formell, kontrollerbar text i stället för trovärdig prosa — och de löser olika halvor av det. MathForm-8B är OpenBMB:s autoformaliserare med 8 miljarder parametrar, släppt i augusti 2026: givet ett matematikproblem på vardagligt språk genererar den Lean 4-formuleringen av problemet och lämnar bevisförpliktelsen öppen för en kompilator att kontrollera. TwIL-LM3-Pro är webAI:s formallogiska modell på 3,66B från september 2026, och dess målutdata är entailment-etiketter, översättningar till första ordningens logik, semantiska parsningar och Lean-beviskritik. Den ena producerar det som ska kontrolleras. Den andra talar om för dig huruvida det du har medför det du påstår.

Eftersom de två överlappar på exakt ett spår – Lean-formalisering – är en jämförelsesida frestande och vilseledande. Den mer användbara frågan är vad var och en tränades att belönas för, eftersom belöningssignalen är där de två designerna divergerar skarpast och där det smartare valet faktiskt ligger.

Påstående kontra implikation

MathForm-8B tränas på FormalVerse, en Lean 4-korpus som OpenBMB-artikeln beskriver som ungefär 367 000 verifierade exempel, genom övervakad finjustering följt av förstärkningsinlärning. Pipelineen runt den hämtar relevanta definitioner och befintliga formaliseringar från Mathlib före generering och förfinar sedan med hjälp av kompilatordiagnostik och en semantisk konsistenskontroll. Dess utdata är ett formellt påstående — importer, typer, teoremhuvud — som en extern kompilator accepterar eller avvisar. Modellkortet är tydligt med att den inte löser problemet och inte påstår det heller; beviset är någon annans jobb.

TwIL-LM3-Pro närmar sig samma domän från logiksidan. Dess pipeline syftade till sex mål: översättning till första ordningens logik, märkning av logisk följd, semantisk parsning, Lean-formalisering, Lean-beviskritik och regelinduktion. Där MathForm är byggd för att avge ett påstående, är TwIL-LM3-Pro byggd för att fälla omdömen om påståenden – är detta en logisk följd, är denna parsning korrekt, håller detta bevisförsök. Den formaliserar också, och det är den enda platsen där de två modellerna är genuint jämförbara snarare än bara angränsande.

Belöning från en kompilator kontra belöning från en poängsättare

Detta är den designskillnad som spelar roll, och båda leverantörerna dokumenterar den.

MathForms träningsbelöning kom från Lean-kompilering och återkoppling om semantisk konsistens. En kompilator är ett orakel: den accepterar antingen formaliseringen eller inte, och det finns ingen delpoäng och inget att argumentera emot. Det är den renaste belöningssignalen i den här delen av maskininlärning, och det är därför autoformaliseringsbenchmarkar rapporteras som godkännandegrader — metriken ligger nedströms ett program som inte bryr sig om vad någon tror.

TwIL-LM3-Pros sista steg var en entropiviktad GRPO-körning mot en programmatisk verifierare, där modellens eget kort beskriver delpoäng för lösa matchningar och token-F1 så att promptgrupper där allt misslyckades fortfarande producerar gradient. Dess huvudsakliga makrogrind är det likaviktade medelvärdet av fyra avgränsade klassificeringsbanor plus regelinduktion, och i den grinden tillgodoräknas flervals- och procedurbanorna som `max(exact_match, loose_match)` — en regel som kortet uttryckligen anger, eftersom ett korrekt svar som formaterats annorlunda är en formateringsartefakt snarare än ett resonemangsfel.

Ingen av designerna är sämre. De är inställda för olika konsekvenser. En kompilatorgraderad belöning ger en modell som du kan rikta mot ett svårt formaliseringsproblem och lita på resultatet från, eftersom resultatet är verifierbart. En bedömargraderad belöning med delvis poäng ger en modell som kan tränas på suddigare omdömen – inferens, kritik, regelinduktion – där ingen kompilator finns för att avgöra, och alternativet är att inte träna på dessa banor alls. Kostnaden är att de resulterande siffrorna bara är så bra som testramverket, och webAI säger det själv: dess strict-7-rad, som tar bort varje spår av poäng för lös matchning, finns just för att en läsare ska kunna se den hårdare siffran vid sidan av huvudsiffran.

Poängen ligger inte på samma skala.

Båda modellerna publicerar Lean-nära siffror och de kan inte subtraheras. MathForms artikel rapporterar ett genomsnittligt Pass@8 på 88,06 % under Syntax Check och 72,37 % under Consistency Check över sex Lean-benchmarks, med 63 % och 37 % passningsfrekvens i consistency-check på de svårare delmängderna FATE-H och FATE-X, och hävdar att den överträffar flera specialiserade 32B-autoformaliserare. TwIL-LM3-Pros modellkort rapporterar token-F1 på 0,5092 för `lean_formalize` och träffsäkerhet på 0,7950 för `lean_critic` i sin egen Track A-testrigg.

Pass@8 under en kompilatorkontroll och token-F1 mot en referenssträng mäter olika saker. Pass@8 ger modellen åtta försök och frågar om ett av dem kompilerade och förblev konsekvent; token-F1 poängsätter hur nära en enskild generering matchade en referens. En modell kan få bra resultat på det ena och dåliga på det andra, och inget i något av dokumenten ger stöd för att läsa de två sida vid sida.

Den ärliga sammanfattningen av benchmark-rekordet är att MathForm-8B:s underlag kommer från en artikel med en kompilator i loopen och TwIL-LM3-Pro:s kommer från ett leverantörsramverk med en poängsättare i loopen, och ingen tredje part har kört båda genom en och samma bedömningsmall. Behandla varje sida som ställer "88.06%" bredvid "0.5092" som om de vore en resultatrad som en sida som inte har läst definitionerna.

Specifikationer, sida vid sida

• Parametrar — TwIL-LM3-Pro 3,66B tät mot MathForm-8B 8B, ungefär 2,2 gånger så stor.

• Basmodell — `ibm-granite/granite-4.2-3b` vs `Qwen/Qwen3-8B`.

• Träningsdata — en syntetisk formallogisk korpus som täcker sex mål jämfört med FormalVerse, ungefär 367 000 verifierade Lean 4-exempel.

• Belöning — en programmatisk verifierare med delpoäng och tolerans för lös matchning kontra Lean-kompilering och återkoppling om semantisk konsistens.

• Primär utdata — entailment-etiketter, FOL-översättningar, semantiska parsningar, Lean-påståenden och beviskritik mot ett Lean 4-påstående för en kompilator att kontrollera.

• Kontextfönster — 131 072 tokenar för TwIL-LM3-Pro, mätt inom 8 192 tokenar; MathForm-8B serveras med generationsbudgetar upp till 16 384 tokenar i sitt eget användningsexempel.

• Licens — webAI Non-Commercial License ver. 1.0 vs. Apache 2.0.

• Kvantiserad — TwIL-LM3-Pro levereras med en 2,09 GiB Q4_K_M GGUF för CPU eller 4 GB VRAM; Math-8B publicerar ingen GGUF i sitt eget repository.

Licensen avgör produktionsfrågan igen.

MathForm-8B är Apache 2.0. Du kan finjustera det, vidaredistribuera det och tillhandahålla det i en kommersiell produkt. TwIL-LM3-Pro är icke-kommersiell: forskning och personligt bruk är tillåtna, och intäktsgenererande driftsättning kräver ett separat avtal med webAI, vars kommersiella väg är en företagslösning snarare än en publicerad prislista.

För en forskargrupp eller en student är den skillnaden irrelevant — båda är fritt tillgängliga nedladdningar på Hugging Face. För ett företag är den avgörande, och den pekar på MathForm-8B för allt produktionsarbete med autoformalisering, oavsett vilken modell som får bättre resultat på en bana som ingen av leverantörerna mätte på samma sätt.

Var en router befinner sig i den här pipelinen

Varken TwIL-LM3-Pro eller MathForm-8B är en route i OrcaRouter-katalogen, och skälen skiljer sig: den ena har en icke-kommersiell licens utan hostad endpoint, den andra publiceras som en öppen checkpoint för egen hosting. Routingfrågan i en formaliseringspipeline är lagret runt dem. Att bygga ett korpus i FormalVerse-stil innebär att generera tusentals informella problem, filtrera dem för välformighet och skriva de semantiska konsistenskontroller som betygsätter resultatet – allt är textanrop, och allt är den sorts arbete där man vill byta ut modellen som genererar massdata mot modellen som bedömer den, utan ett andra avtal. På en OpenAI-kompatibel endpoint framför över 200 modeller till leverantörens listpris med 0 % påslagär det bytet en konfigurationsändring, och en leverantörsprissänkning på generationsmodellen träder i kraft samma dag. Automatisk failover är bärande i en korpusbyggnad just för att ett jobb som dör två tredjedelar in i en genereringsomgång kostar hela körningen.

A generated two-column scoreboard headed 'TwIL-LM3-Pro vs MathForm 8B - the scoreboard' with six shared dimension rows. TwIL-LM3-Pro: Parameters 3.66B dense; Base granite-4.2-3b; Reward programmatic verifier; Primary output entailment and critiques; Context 131,072 tokens; Licence non-commercial. MathForm 8B: Parameters 8B; Base Qwen3-8B; Reward Lean compilation; Primary output Lean 4 statements; Generation budget 16,384 tokens; Licence Apache 2.0. A footer line reads 'MathForm figures from the OpenBMB paper; TwIL figures vendor-reported by webAI.' The OrcaRouter logo is composited in the bottom-right corner.

Arbetsdelningen

Om uppgiften är att i stor skala omvandla läroboksmatematik till kompilerbara Lean-påståenden, och resultatet måste levereras i en kommersiell produkt, är MathForm-8B verktyget och Apache 2.0-licensen är anledningen. Om uppgiften är att avgöra huruvida en textmängd medför ett påstående, märka entailment, parsa semantik eller kritisera ett bevisförsök, täcker TwIL-LM3-Pro områden som MathForm aldrig var inriktat på — och dess icke-kommersiella licens är en gräns för var den förmågan kan användas, inte ett minus för själva förmågan.

Den kombination som är vettig är en tvåstegspipeline snarare än ett val: den ena modellen avger det formella påståendet, den andra bedömer det. Båda har publicerat den pipeline som producerade dem, vilket är ovanligt i den här storleken och är anledningen till att den här jämförelsen alls kan göras.

A screenshot of the Hugging Face model card for openbmb/MathForm-8B, showing the OpenBMB author line, tags for Text Generation, Transformers, Safetensors, the openbmb/FormalVerse training dataset, English and arXiv 2608.14221, the apache-2.0 licence badge, and the opening of the paper abstract 'MathForm: Scaling Mathematical Autoformalization with Knowledge Retrieval and Verification-Guided Refinement'.A screenshot of the Hugging Face model card for webAI-Official/TwIL-LM3-Pro, showing the webAI author line, the granite, granite-4.2, formal-logic, reasoning, lora, reinforcement-learning and grpo tags, and the licence badge reading 'License: webai-non-commercial-license-ver.-1.0'.