Eine generierte Titelkarte mit der Überschrift „TwIL-LM3-Pro vs MathForm 8B“, dem Untertitel „Aussage vs. Folgerung“, mit zwei abgerundeten Karten mit den Aufschriften „MathForm 8B – gibt die Aussage in Lean 4 aus“ und „TwIL-LM3-Pro – beurteilt die Aussage“. Das OrcaRouter-Logo ist in der unteren rechten Ecke eingefügt.
Guides & Insights

TwIL-LM3-Pro vs MathForm 8B: Aussage und Folgerung sind unterschiedliche Hälften der Formalisierung

Autor

Alistair Wren

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen →
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

TwIL-LM3-Pro und MathForm-8B zielen auf dasselbe große Problem ab — eine Maschine dazu zu bringen, formale, überprüfbare Texte statt plausibler Prosa zu erzeugen — und sie lösen dabei unterschiedliche Hälften davon. MathForm-8B ist OpenBMBs Autoformalizer mit 8 Milliarden Parametern, veröffentlicht im August 2026: Ausgehend von einem in einfacher Sprache formulierten Mathematikproblem gibt er die Lean-4-Aussage dieses Problems aus und überlässt die Beweisverpflichtung einem Compiler zur Überprüfung. TwIL-LM3-Pro ist webAIs Formal-Logik-Modell mit 3,66 Mrd. Parametern von September 2026, und seine Zielausgaben sind Entailment-Labels, Übersetzungen in die Prädikatenlogik erster Stufe, semantische Parses und Lean-Beweiskritiken. Das eine erzeugt das, was überprüft werden soll. Das andere sagt dir, ob das, was du hast, das impliziert, was du behauptest.

Da sich die beiden in genau einer Hinsicht – der Lean-Formalisierung – überschneiden, ist eine Vergleichsseite verlockend und irreführend. Die nützlichere Frage ist, wofür jedes von ihnen trainiert wurde, belohnt zu werden, denn das Belohnungssignal ist der Punkt, an dem die beiden Designs am stärksten auseinandergehen und an dem die klügere Wahl tatsächlich liegt.

Aussage versus Implikation

MathForm-8B wird auf FormalVerse trainiert, einem Lean-4-Korpus, den das OpenBMB-Papier als ungefähr 367.000 verifizierte Beispiele beschreibt, durch überwachtes Feintuning, gefolgt von Reinforcement Learning. Die Pipeline darum herum ruft vor der Generierung relevante Definitionen und bestehende Formalisierungen aus Mathlib ab und verfeinert dann mithilfe von Compiler-Diagnosen und einer semantischen Konsistenzprüfung. Seine Ausgabe ist eine formale Aussage – Imports, Typen, Theorem-Header –, die ein externer Compiler akzeptiert oder verwirft. Die Modellkarte stellt ausdrücklich klar, dass es das Problem nicht löst und nicht behauptet, es zu lösen; der Beweis ist jemand anderes Aufgabe.

TwIL-LM3-Pro nähert sich derselben Domäne von der Logikseite aus. Seine Pipeline war auf sechs Ziele ausgerichtet: Übersetzung in Prädikatenlogik erster Stufe, Entailment-Labeling, semantisches Parsing, Lean-Formalisierung, Lean-Beweiskritik und Regelinduktion. Während MathForm darauf ausgelegt ist, eine Aussage auszugeben, ist TwIL-LM3-Pro darauf ausgelegt, Urteile über Aussagen zu fällen – ist diese impliziert, ist diese Analyse korrekt, ist dieser Beweisversuch stichhaltig. Es formalisiert auch, und das ist der eine Punkt, an dem die beiden Modelle wirklich vergleichbar und nicht bloß benachbart sind.

Belohnung von einem Compiler versus Belohnung von einem Scorer

Das ist der entscheidende Designunterschied, und beide Anbieter dokumentieren ihn.

MathForms Trainingsbelohnung stammte aus der Lean-Kompilierung und dem Feedback zur semantischen Konsistenz. Ein Compiler ist ein Orakel: Entweder er akzeptiert die Formalisierung oder nicht, und es gibt keine Teilpunkte und nichts, worüber man streiten könnte. Das ist das sauberste Belohnungssignal in dieser Ecke des maschinellen Lernens, und deshalb werden Autoformalisierungs-Benchmarks als Bestehensraten angegeben — die Metrik ist einem Programm nachgelagert, dem egal ist, was irgendjemand glaubt.

Die letzte Phase von TwIL-LM3-Pro war ein entropiegewichteter GRPO-Lauf gegen einen programmatischen Verifizierer, wobei die eigene Karte des Modells Teilgutschrift für lose Übereinstimmungen und Token-F1 beschreibt, sodass Prompt-Gruppen, in denen alles fehlschlug, noch Gradienten erzeugen. Sein Haupt-Makro-Gate ist der gleichgewichtete Mittelwert aus vier begrenzten Klassifikations-Lanes plus Regelinduktion, und in diesem Gate werden die Multiple-Choice- und die prozeduralen Lanes als `max(exact_match, loose_match)` gewertet – eine Regel, die die Karte klar darlegt, weil eine korrekte Antwort, die anders formatiert ist, ein Formatierungsartefakt und kein Reasoning-Fehler ist.

Keines der beiden Designs ist schlechter. Sie sind auf unterschiedliche Konsequenzen abgestimmt. Ein vom Compiler bewerteter Reward erzeugt ein Modell, auf das man bei einem schwierigen Formalisierungsproblem zeigen und dessen Ausgabe man vertrauen kann, weil die Ausgabe verifizierbar ist. Ein von einem Scorer bewerteter Reward mit Teilpunkten erzeugt ein Modell, das auf unscharferen Urteilen trainiert werden kann — Entailment, Kritik, Regelinduktion —, wo kein Compiler zur Entscheidung existiert und die Alternative darin bestünde, auf diesen Spuren gar nicht zu trainieren. Der Preis dafür ist, dass die resultierenden Zahlen nur so gut sind wie das Harness, und webAI sagt das auch: seine strict-7-Zeile, die jede Spur von Loose-Match-Gutschrift entfernt, existiert genau deshalb, damit ein Leser die härtere Zahl neben der Schlagzeile sehen kann.

Die Punktzahlen liegen nicht auf derselben Skala.

Beide Modelle veröffentlichen Lean-nahe Zahlen, und sie können nicht voneinander subtrahiert werden. MathForms Paper berichtet über einen durchschnittlichen Pass@8 von 88,06 % unter Syntax Check und 72,37 % unter Consistency Check über sechs Lean-Benchmarks hinweg, mit Bestehensraten von 63 % und 37 % beim Consistency Check auf den schwierigeren Teilmengen FATE-H und FATE-X, und behauptet, mehrere spezialisierte 32B-Autoformalizer zu übertreffen. Die Model Card von TwIL-LM3-Pro meldet eine Token-F1 von 0,5092 für `lean_formalize` und eine Genauigkeit von 0,7950 für `lean_critic` auf dem eigenen Track-A-Harness.

Pass@8 im Rahmen einer Compiler-Prüfung und Token-F1 gegen einen Referenzstring messen unterschiedliche Dinge. Pass@8 gibt dem Modell acht Versuche und fragt, ob einer sich kompilieren ließ und konsistent blieb; Token-F1 bewertet, wie eng eine einzelne Generierung mit einer Referenz übereinstimmte. Ein Modell kann bei dem einen gut und bei dem anderen schlecht abschneiden, und nichts in einem der beiden Dokumente rechtfertigt es, die beiden Seite an Seite zu lesen.

Die ehrliche Zusammenfassung der Benchmark-Ergebnislage ist, dass die Belege für MathForm-8B aus einem Paper stammen, bei dem ein Compiler im Loop ist, und die für TwIL-LM3-Pro aus einem Anbieter-Harness, bei dem ein Scorer im Loop ist, und dass kein unabhängiger Dritter beide durch ein und dasselbe Bewertungsraster hat laufen lassen. Behandle jede Seite, die „88.06%“ neben „0.5092“ stellt, als wären sie ein Spielstand, wie eine Seite, die die Definitionen nicht gelesen hat.

Spezifikationen im direkten Vergleich

• Parameter — TwIL-LM3-Pro 3,66B dicht vs. MathForm-8B 8B, etwa 2,2-mal so groß.

• Basismodell — `ibm-granite/granite-4.2-3b` vs. `Qwen/Qwen3-8B`.

• Trainingsdaten — ein synthetischer Korpus zur formalen Logik, der sechs Zielsetzungen gegenüber FormalVerse abdeckt, ungefähr 367.000 verifizierte Beispiele in Lean 4.

• Belohnung — ein programmatischer Verifizierer mit Teilpunkten und Toleranz für unscharfe Übereinstimmungen gegenüber Lean-Kompilierung und Feedback zur semantischen Konsistenz.

• Primärausgabe — Folgerungslabels, FOL-Übersetzungen, semantische Parses, Lean-Aussagen und Beweiskritiken gegenüber einer Lean-4-Aussage, die ein Compiler prüfen kann.

• Kontextfenster — 131.072 Token für TwIL-LM3-Pro, gemessen innerhalb von 8.192 Token; MathForm-8B wird in seinem eigenen Anwendungsbeispiel mit Generierungsbudgets von bis zu 16.384 Token bereitgestellt.

• Lizenz — webAI Non-Commercial License Version 1.0 vs. Apache 2.0.

• Quantisierter Speicherbedarf — TwIL-LM3-Pro liefert ein 2,09 GiB großes Q4_K_M-GGUF für CPU oder 4 GB VRAM; MathForm-8B veröffentlicht kein GGUF im eigenen Repository.

Die Lizenz entscheidet erneut über die Produktionsfrage.

MathForm-8B ist Apache 2.0. Sie können es feinabstimmen, weiterverbreiten und in einem kommerziellen Produkt einsetzen. TwIL-LM3-Pro ist nicht kommerziell: Forschung und persönliche Nutzung sind erlaubt, und ein umsatzgenerierender Einsatz erfordert eine separate Vereinbarung mit webAI, dessen kommerzieller Weg eine Unternehmensvereinbarung statt einer veröffentlichten Preisliste ist.

Für eine Forschungsgruppe oder einen Studierenden ist dieser Unterschied irrelevant – beides sind uneingeschränkt zugängliche Downloads auf Hugging Face. Für ein Unternehmen ist er entscheidend, und er spricht für MathForm-8B für jede produktive Autoformalisierungsarbeit, unabhängig davon, welches Modell in einem Bereich besser abschneidet, den kein Anbieter auf dieselbe Weise gemessen hat.

Wo ein Router in dieser Pipeline sitzt

Weder TwIL-LM3-Pro noch MathForm-8B ist eine Route im OrcaRouter-Katalog, und die Gründe unterscheiden sich: Das eine ist nicht kommerziell lizenziert und hat keinen gehosteten Endpunkt, das andere wird als offener Checkpoint fürs Selbsthosting veröffentlicht. Die Routing-Frage in einer Formalisierungspipeline betrifft die Schicht um sie herum. Ein Korpus im FormalVerse-Stil aufzubauen bedeutet, Tausende informelle Probleme zu generieren, sie auf Wohlgeformtheit zu filtern und die Prüfungen der semantischen Konsistenz zu schreiben, die die Ausgabe bewerten — alles Textaufrufe und durchweg Arbeit, bei der man das Modell, das Massendaten generiert, gegen das Modell austauschen möchte, das sie beurteilt, ohne einen zweiten Vertrag. Auf einem einzigen OpenAI-kompatiblen Endpunkt vor über 200 Modellen zum Listenpreis des Anbieters mit 0 % Aufschlagist dieser Austausch eine Konfigurationsänderung, und eine Preissenkung eines Anbieters für das Generierungsmodell schlägt am selben Tag durch. Automatisches Failover ist beim Aufbau eines Korpus unverzichtbar, gerade weil ein Job, der nach zwei Dritteln eines Generierungsdurchlaufs abbricht, den gesamten Lauf kostet.

A generated two-column scoreboard headed 'TwIL-LM3-Pro vs MathForm 8B - the scoreboard' with six shared dimension rows. TwIL-LM3-Pro: Parameters 3.66B dense; Base granite-4.2-3b; Reward programmatic verifier; Primary output entailment and critiques; Context 131,072 tokens; Licence non-commercial. MathForm 8B: Parameters 8B; Base Qwen3-8B; Reward Lean compilation; Primary output Lean 4 statements; Generation budget 16,384 tokens; Licence Apache 2.0. A footer line reads 'MathForm figures from the OpenBMB paper; TwIL figures vendor-reported by webAI.' The OrcaRouter logo is composited in the bottom-right corner.

Die Arbeitsteilung

Wenn die Aufgabe darin besteht, Lehrbuchmathematik im großen Maßstab in kompilierbare Lean-Aussagen zu verwandeln, und das Ergebnis in einem kommerziellen Produkt ausgeliefert werden muss, dann ist MathForm-8B das Werkzeug, und die Apache-2.0-Lizenz ist der Grund dafür. Wenn die Aufgabe darin besteht, zu entscheiden, ob ein Text eine Behauptung impliziert, Entailment zu labeln, Semantik zu parsen oder einen Beweisversuch zu kritisieren, deckt TwIL-LM3-Pro Bereiche ab, auf die MathForm nie abzielte — und seine nichtkommerzielle Lizenz ist eine Grenze dafür, wo diese Fähigkeit eingesetzt werden kann, kein Nachteil der Fähigkeit selbst.

Die Kombination, die Sinn ergibt, ist eine zweistufige Pipeline und keine Entscheidung für eines von beiden: Das eine Modell gibt die formale Aussage aus, das andere beurteilt sie. Beide haben die Pipeline veröffentlicht, die sie hervorgebracht hat, was in dieser Größenordnung ungewöhnlich ist und der Grund dafür, dass dieser Vergleich überhaupt möglich ist.

A screenshot of the Hugging Face model card for openbmb/MathForm-8B, showing the OpenBMB author line, tags for Text Generation, Transformers, Safetensors, the openbmb/FormalVerse training dataset, English and arXiv 2608.14221, the apache-2.0 licence badge, and the opening of the paper abstract 'MathForm: Scaling Mathematical Autoformalization with Knowledge Retrieval and Verification-Guided Refinement'.A screenshot of the Hugging Face model card for webAI-Official/TwIL-LM3-Pro, showing the webAI author line, the granite, granite-4.2, formal-logic, reasoning, lora, reinforcement-learning and grpo tags, and the licence badge reading 'License: webai-non-commercial-license-ver.-1.0'.