Wygenerowana karta tytułowa z nagłówkiem „TwIL-LM3-Pro vs MathForm 8B”, podtytułem „Stwierdzenie vs wynikanie logiczne”, z dwiema zaokrąglonymi kartami o treści „MathForm 8B – emituje stwierdzenie w Lean 4” oraz „TwIL-LM3-Pro – ocenia stwierdzenie”. Logo OrcaRouter zostało nałożone w prawym dolnym rogu.
Guides & Insights

TwIL-LM3-Pro vs MathForm 8B: Stwierdzenie i wynikanie to dwie różne połowy formalizacji

Autor

Alistair Wren

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele →
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

TwIL-LM3-Pro i MathForm-8B są nastawione na ten sam szeroki problem — sprawienie, by maszyna tworzyła tekst formalny, poddający się weryfikacji, a nie wiarygodnie brzmiącą prozę — i rozwiązują jego dwie różne połowy. MathForm-8B to autoformalizator firmy OpenBMB o 8 miliardach parametrów, wydany w sierpniu 2026: otrzymawszy zadanie matematyczne w języku naturalnym, generuje zdanie w Lean 4 opisujące to zadanie, pozostawiając obowiązek dowodowy otwarty do sprawdzenia przez kompilator. TwIL-LM3-Pro to model logiki formalnej firmy webAI o 3,66 mld parametrów z września 2026, a jego docelowymi wynikami są etykiety wynikania, tłumaczenia na logikę pierwszego rzędu, analizy semantyczne i krytyki dowodów w Lean. Jeden tworzy to, co ma zostać sprawdzone. Drugi mówi, czy to, co masz, pociąga to, co twierdzisz.

Ponieważ oba pokrywają się dokładnie w jednym obszarze — formalizacji w Lean — strona porównawcza kusi i wprowadza w błąd. O wiele użyteczniejsze pytanie brzmi, za co każde z nich było trenowane, by otrzymywać nagrodę, ponieważ sygnał nagrody to miejsce, w którym te dwa projekty rozchodzą się najostrzej i w którym tak naprawdę kryje się mądrzejszy wybór.

Stwierdzenie kontra wynikanie

MathForm-8B jest trenowany na FormalVerse, korpusie Lean 4, który w artykule OpenBMB opisano jako około 367 000 zweryfikowanych przykładów, poprzez nadzorowane dostrajanie, a następnie uczenie ze wzmocnieniem. Otaczający go potok przed generowaniem pobiera odpowiednie definicje i istniejące formalizacje z Mathlib, a następnie dopracowuje je, korzystając z diagnostyki kompilatora i kontroli spójności semantycznej. Jego wynikiem jest sformalizowane stwierdzenie — importy, typy, nagłówek twierdzenia — które zewnętrzny kompilator akceptuje lub odrzuca. Karta modelu wyraźnie stwierdza, że nie rozwiązuje on problemu i nie twierdzi, że to robi; dowód jest zadaniem kogoś innego.

TwIL-LM3-Pro podchodzi do tej samej dziedziny od strony logiki. Jego potok przetwarzania był ukierunkowany na sześć celów: tłumaczenie logiki pierwszego rzędu, etykietowanie wynikania, parsowanie semantyczne, formalizacja w Lean, krytyka dowodów Lean i indukcja reguł. Tam, gdzie MathForm jest stworzony do generowania zdania, TwIL-LM3-Pro jest stworzony do wydawania osądów o zdaniach — czy to wynika, czy to parsowanie jest poprawne, czy ta próba dowodu jest poprawna. On także formalizuje i to jest jedyne miejsce, w którym te dwa modele są rzeczywiście porównywalne, a nie tylko sąsiadujące.

Nagroda od kompilatora versus nagroda od skorera

To jest różnica projektowa, która ma znaczenie, i obaj dostawcy ją dokumentują.

Nagroda treningowa MathForm pochodziła z kompilacji w Lean oraz informacji zwrotnej o spójności semantycznej. Kompilator jest wyrocznią: albo akceptuje formalizację, albo nie — nie ma częściowych punktów ani o co się spierać. To najczystszy sygnał nagrody w tym zakątku uczenia maszynowego i dlatego benchmarki autoformalizacji podaje się jako wskaźniki zdawalności — metryka jest pochodną programu, którego nie obchodzi, w co ktokolwiek wierzy.

Ostatnim etapem TwIL-LM3-Pro było uruchomienie GRPO z ważeniem entropijnym przeciwko weryfikatorowi programowemu, przy czym sama karta modelu opisuje częściowe punkty za luźne dopasowania i token-F1, tak aby grupy promptów, w których wszystko zawiodło, nadal generowały gradient. Jego główna bramka makro to średnia równych wag czterech ograniczonych ścieżek klasyfikacji plus indukcja reguł, a w tej bramce ścieżki wielokrotnego wyboru i proceduralne są zaliczane jako `max(exact_match, loose_match)` — reguła, którą karta podaje wprost, ponieważ poprawna odpowiedź sformatowana inaczej jest artefaktem formatowania, a nie błędem rozumowania.

Żadne z tych rozwiązań nie jest gorsze. Są dostrojone do różnych konsekwencji. Nagroda oceniana przez kompilator daje model, który można skierować na trudny problem formalizacyjny i zaufać jego wynikowi, ponieważ wynik jest weryfikowalny. Nagroda przyznawana przez oceniającego z częściową punktacją daje model, który można trenować na bardziej nieostrych osądach — wynikaniu, krytyce, indukcji reguł — gdzie nie ma kompilatora, który mógłby rozstrzygać, a alternatywą jest w ogóle nietrenowanie na tych torach. Koszt jest taki, że uzyskane liczby są tylko tak dobre, jak harness, i webAI to przyznaje: jego wiersz strict-7, który usuwa wszelki ślad punktacji za luźne dopasowanie, istnieje właśnie po to, by czytelnik mógł zobaczyć surowszy wynik obok tego głównego.

Wyniki nie są na tej samej skali

Oba modele publikują liczby związane z Lean i nie można ich odejmować. Artykuł MathForm podaje średni Pass@8 wynoszący 88,06% w Sprawdzeniu składni i 72,37% w Sprawdzeniu spójności w sześciu benchmarkach Lean, z 63% i 37% odsetkiem zaliczeń sprawdzenia spójności na trudniejszych podzbiorach FATE-H i FATE-X, i twierdzi, że przewyższa kilka wyspecjalizowanych autoformalizatorów 32B. Karta TwIL-LM3-Pro podaje token-F1 `lean_formalize` na poziomie 0,5092 i dokładność `lean_critic` na poziomie 0,7950 we własnym harnessie Track A.

Pass@8 w ramach sprawdzenia kompilatora i token-F1 względem ciągu referencyjnego mierzą różne rzeczy. Pass@8 daje modelowi osiem prób i pyta, czy jedna się skompilowała i pozostała spójna; token-F1 ocenia, jak blisko pojedyncze wygenerowanie odpowiadało wzorcowi. Model może osiągać dobry wynik w jednym, a słaby w drugim, i nic w żadnym z tych dokumentów nie uprawnia do czytania ich obok siebie.

Uczciwe podsumowanie zapisu benchmarku jest takie, że dowody MathForm-8B pochodzą z artykułu z kompilatorem w pętli, a dowody TwIL-LM3-Pro pochodzą z harnessu dostawcy z oceniającym w pętli, i żadna strona trzecia nie przepuściła obu przez jeden zestaw kryteriów. Każdą stronę, która stawia „88.06%” obok „0.5092”, tak jakby to był wynik meczu, traktuj jak stronę, która nie przeczytała definicji.

Specyfikacje, obok siebie

• Parametry — TwIL-LM3-Pro 3,66B gęsty vs MathForm-8B 8B, około 2,2 razy większy.

• Model bazowy — `ibm-granite/granite-4.2-3b` vs `Qwen/Qwen3-8B`.

• Dane treningowe — syntetyczny korpus logiki formalnej obejmujący sześć celów w porównaniu z FormalVerse, około 367 000 zweryfikowanych przykładów Lean 4.

• Reward — programowy weryfikator z częściowym zaliczeniem i tolerancją luźnego dopasowania vs kompilacja Lean i informacja zwrotna o spójności semantycznej.

• Główne dane wyjściowe — etykiety wynikania, tłumaczenia FOL, parsowania semantyczne, stwierdzenia Lean i krytyki dowodów w porównaniu ze stwierdzeniem Lean 4 do sprawdzenia przez kompilator.

• Okno kontekstowe — 131 072 tokenów dla TwIL-LM3-Pro, mierzone wewnątrz 8 192 tokenów; MathForm-8B jest obsługiwany z budżetami generacji do 16 384 tokenów w swoim własnym przykładzie użycia.

• Licencja — webAI Non-Commercial License wer. 1.0 vs Apache 2.0.

• Skwantyzowany rozmiar — TwIL-LM3-Pro dostarcza 2,09 GiB Q4_K_M GGUF na CPU lub 4 GB VRAM; MathForm-8B nie publikuje żadnego GGUF we własnym repozytorium.

Licencja ponownie rozstrzyga kwestię produkcji

MathForm-8B jest udostępniany na licencji Apache 2.0. Możesz go dostrajać, redystrybuować i udostępniać w ramach produktu komercyjnego. TwIL-LM3-Pro jest niekomercyjny: badania i użytek osobisty są dozwolone, a wdrożenia generujące przychody wymagają odrębnej umowy z webAI, którego ścieżka komercyjna to ustalenia dla przedsiębiorstw, a nie opublikowany cennik.

Dla grupy badawczej lub studenta ta różnica nie ma znaczenia — oba są dostępne do pobrania bez ograniczeń na Hugging Face. Dla firmy jest rozstrzygająca i wskazuje na MathForm-8B w przypadku wszelkich produkcyjnych prac nad autoformalizacją, niezależnie od tego, który model osiąga lepsze wyniki w obszarze, którego żaden z dostawców nie mierzył w ten sam sposób.

Gdzie router znajduje się w tym potoku

Ani TwIL-LM3-Pro, ani MathForm-8B nie są trasami w katalogu OrcaRouter, a powody są różne: jeden ma licencję niekomercyjną i nie ma hostowanego endpointu, drugi jest publikowany jako otwarty checkpoint do samodzielnego hostowania. Kwestia routingu w pipeline formalizacji dotyczy warstwy wokół nich. Budowanie korpusu w stylu FormalVerse oznacza generowanie tysięcy nieformalnych problemów, filtrowanie ich pod kątem poprawności formalnej oraz pisanie kontroli spójności semantycznej, które oceniają wynik — same wywołania tekstowe i cała ta praca, w której chcesz podmienić model generujący dane masowe na model, który je ocenia, bez drugiej umowy. Na jednym endpoincie zgodnym z OpenAI przed ponad 200 modelami w cenie listowej dostawcy z dodanym 0% narzutem, ta podmiana to zmiana konfiguracji, a obniżka ceny dostawcy na model generujący wchodzi w życie tego samego dnia. Automatyczne przełączanie awaryjne ma kluczowe znaczenie w budowie korpusu właśnie dlatego, że zadanie, które padnie po dwóch trzecich przebiegu generowania, kosztuje cały przebieg.

A generated two-column scoreboard headed 'TwIL-LM3-Pro vs MathForm 8B - the scoreboard' with six shared dimension rows. TwIL-LM3-Pro: Parameters 3.66B dense; Base granite-4.2-3b; Reward programmatic verifier; Primary output entailment and critiques; Context 131,072 tokens; Licence non-commercial. MathForm 8B: Parameters 8B; Base Qwen3-8B; Reward Lean compilation; Primary output Lean 4 statements; Generation budget 16,384 tokens; Licence Apache 2.0. A footer line reads 'MathForm figures from the OpenBMB paper; TwIL figures vendor-reported by webAI.' The OrcaRouter logo is composited in the bottom-right corner.

Podział pracy

Jeśli zadaniem jest przekształcanie matematyki podręcznikowej w kompilowalne stwierdzenia w Lean na dużą skalę, a wynik musi trafić do komercyjnego produktu, to narzędziem jest MathForm-8B, a powodem — licencja Apache 2.0. Jeśli zadaniem jest rozstrzyganie, czy dany tekst pociąga za sobą twierdzenie, etykietowanie wynikania, parsowanie semantyki lub krytykowanie próby dowodu, TwIL-LM3-Pro obejmuje obszary, na które MathForm nigdy nie był ukierunkowany — a jego niekomercyjna licencja wyznacza granicę tego, gdzie tę zdolność można wykorzystać, a nie jest zarzutem przeciwko samej zdolności.

Sensowna kombinacja to dwuetapowy potok, a nie wybór: jeden model generuje formalne stwierdzenie, drugi je ocenia. Oba opublikowały potok, który je wytworzył, co jest nietypowe przy tej skali i jest powodem, dla którego to porównanie w ogóle można przeprowadzić.

A screenshot of the Hugging Face model card for openbmb/MathForm-8B, showing the OpenBMB author line, tags for Text Generation, Transformers, Safetensors, the openbmb/FormalVerse training dataset, English and arXiv 2608.14221, the apache-2.0 licence badge, and the opening of the paper abstract 'MathForm: Scaling Mathematical Autoformalization with Knowledge Retrieval and Verification-Guided Refinement'.A screenshot of the Hugging Face model card for webAI-Official/TwIL-LM3-Pro, showing the webAI author line, the granite, granite-4.2, formal-logic, reasoning, lora, reinforcement-learning and grpo tags, and the licence badge reading 'License: webai-non-commercial-license-ver.-1.0'.