Wygenerowana karta tytułowa z napisem „AREX-2 vs MathForm-8B – Dwa sposoby, by zostać sprawdzonym”, z dwoma panelami. Lewy panel, zatytułowany MathForm-8B, wymienia: 8B dense, wydany w sierpniu 2026; zapisuje twierdzenia w Lean 4; sprawdzany przez kompilator Lean; Pass@8 88,06% zweryfikowane składniowo. Prawy panel, zatytułowany AREX-2, wymienia: repozytorium utworzone 29 września 2026; brak plików, brak karty; nic do pobrania ani uruchomienia; nie ma żadnych danych liczbowych do sprawdzenia. Stopka głosi: „Jeden jest oceniany przez kompilator. Drugi nie ma jeszcze czego oceniać.” Logo OrcaRouter jest wkomponowane w prawym dolnym rogu.
Guides & Insights

AREX-2 vs MathForm-8B: Sprawdzacz dowodów i pętla wyszukiwania to różne rodzaje weryfikacji

Autor

Gideon Frost

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele →
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

MathForm-8B i AREX-2 to dwa najbardziej rygorystycznie weryfikowalne modele w tej serii, a weryfikują się w przeciwny sposób. MathForm-8B to autoformalizator OpenBMB o 8 miliardach parametrów, wydany w sierpniu 2026 r.: wystarczy podać mu zadanie matematyczne napisane prostym angielskim, a tworzy on formalnie poprawne sformułowanie tego zadania w Lean 4, które następnie sprawdza kompilator asystenta dowodzenia. AREX-2 to repozytorium Hugging Face, które BAAI utworzyło 29 września 2026 r. o 17:56 UTC, zawierające jedynie plik .gitattributes i ani wag, ani karty modelu, ani znacznika licencji, ani ogłoszenia — zarezerwowana nazwa dla prawdopodobnej drugiej generacji agentów ds. pogłębionych badań AREX firmy BAAI, których pierwsza generacja weryfikuje się sama, ponownie sprawdzając własną odpowiedź wobec narzuconych jej ograniczeń.

Tak więc interesującym pytaniem nie jest to, który model jest lepszy. Jest nim to, co znaczy, że model jest sprawdzalny, ponieważ jeden z tych dwóch jest sprawdzany przez kompilator, który nie dba o to, w co ktokolwiek wierzy, a drugi jest sprawdzany — jeśli precedens rodziny się utrzymuje — przez pętlę, którą uruchamia ten sam model. To rozróżnienie się utrzymuje, mimo że jedna strona tego starcia nie została jeszcze wydana, i to jest powód, dla którego te dwa w ogóle należą do tej samej rozmowy.

Strona, która istnieje, i powód, dla którego jest sprawdzalna

MathForm-8B ma wąsko zakreślony zakres zadań i warto ująć to precyzyjnie, ponieważ właśnie ta wąskość jest sednem. Nie rozwiązuje problemów matematycznych i nie twierdzi, że to robi. Został dostrojony na FormalVerse, korpusie około 367 000 zweryfikowanych przykładów Lean 4, a jego nagroda treningowa pochodziła z kompilatora Lean, a nie z modelu preferencji człowieka. Otrzymawszy nieformalne sformułowanie, generuje importy, typy i nagłówek twierdzenia — pozostawiając samo zobowiązanie dowodowe otwarte — tak aby kompilator mógł potwierdzić, że formalizacja mówi to, co mówił nieformalny problem.

Jego opublikowane liczby — wszystkie raportowane przez dostawcę OpenBMB i żadna niezależnie nieodtworzona — to średnia Pass@8 wynosząca 88,06% w kontroli składni i 72,37% w surowszej kontroli spójności w sześciu benchmarkach, spadająca do 63% i 37% na najtrudniejszych podzbiorach FATE-H i FATE-X. Odczytuj je jako to, czym są: model mierzony względem formalnego systemu, w którym błędna odpowiedź oznacza niepowodzenie kompilacji, a nie różnicę zdań na temat jakości. To rzadka właściwość. Większość twierdzeń o benchmarkach na tym blogu opiera się na oceniającym, któremu trzeba zaufać; to opiera się na arytmetyce, którą wykonuje maszyna.

Strona, która jeszcze nie istnieje, i dlaczego jej weryfikacja jest inna

Jedynymi potwierdzalnymi faktami dotyczącymi AREX-2 są organizacja, nazwa i znacznik czasu. Niczego nie przesłano, a BAAI nic nie powiedziało. Rodzina stojąca za tą nazwą jednak istnieje i została wydana 23 lipca 2026 r. jako AREX-Base — mieszanka ekspertów o 122 miliardach parametrów i 10 miliardach aktywnych parametrów na bazie Qwen3.5-122B-A10B — wraz z AREX-Turbo, gęstym modelem 4B. Oba na licencji Apache 2.0, oba to modele agentowe, a nie czatowe.

Projekt AREX to dwupętlowe ramy badawcze, a pętla zewnętrzna stanowi krok weryfikacji. Pętla wewnętrzna gromadzi dowody z wyszukiwania i przeglądania, integruje je i tworzy odpowiedź-kandydata z dołączoną wartością pewności. Następnie pętla zewnętrzna sprawdza tego kandydata względem pierwotnych ograniczeń i decyduje: zaakceptować go, udoskonalić czy odrzucić trajektorię i zacząć od nowa. Między iteracjami model utrzymuje blok kontekstu zawierający zweryfikowane ustalenia, otwartych kandydatów, nierozwiązane ograniczenia i następny plan, co pozwala mu podążać długą linią dociekań bez utraty wątku. BAAI podaje 82,5 w BrowseComp, 85,4 w GAIA i 89,9 w DeepSearch QA dla wersji Base oraz 70,7 / 81,6 / 78,5 dla wersji Turbo — to własne liczby dostawcy, nieodtworzone.

To prawdziwa i użyteczna forma samosprawdzania. Jest też kategorycznie słabsza niż kompilator. Kiedy zewnętrzna pętla AREX uznaje, że odpowiedź spełnia jej ograniczenia, ocena pochodzi od modelu językowego czytającego ograniczenia. Kiedy Lean akceptuje formalizację MathForm-8B, ocena pochodzi od sprawdzacza typów implementującego ustalony rachunek. Żadna z nich nie jest wolna od błędów — formalizacja może być poprawnym Lean, który ujmuje niewłaściwe twierdzenie — ale tylko jedna z nich może być błędna, a nikt tego nie zauważy, i różnica nie jest kwestią stopnia.

• Dostępność — MathForm-8B można pobrać z OpenBMB wraz z opublikowaną kartą. AREX-2 to repozytorium, w którym nie ma żadnych plików.

• Parametry — 8B gęsty dla MathForm-8B. Nieznane dla AREX-2; rodzina obejmuje mieszaninę ekspertów 122B oraz gęsty model 4B.

• Co generuje — sformułowania twierdzeń Lean 4 dla MathForm-8B, z dowodem celowo pozostawionym otwartym. Nieznane dla AREX-2; pierwsza generacja utworzyła zbadaną odpowiedź ze wskaźnikiem pewności.

• Jak to jest sprawdzane — kompilator Lean, dla MathForm-8B. Pętla weryfikacyjna wewnątrz tego samego modelu, na podstawie dowodów z AREX-Base.

• Licencja — własne warunki OpenBMB dla MathForm-8B; dla AREX-2 nic jeszcze nie zadeklarowano. Pierwsza generacja AREX była na licencji Apache 2.0.

• Kluczowe liczby — 88,06% sprawdzonych pod kątem składni i 72,37% sprawdzonych pod kątem spójności Pass@8 dla MathForm-8B, według danych dostawcy. Dla AREX-2 nie istnieją żadne.

A screenshot of the Hugging Face model card for openbmb/MathForm-8B, showing the OpenBMB author line, tags for Text Generation, Transformers, Safetensors, the openbmb/FormalVerse training dataset and arXiv 2608.14221, and the opening of the card describing MathForm: Scaling Mathematical Autoformalization with Knowledge Retrieval and Verification-Guided Refinement, with the note that the model is trained on FormalVerse through supervised fine-tuning followed by reinforcement learning using Lean compilation and semantic-consistency feedback.A generated card headed 'Two ways a model can be checked' with rows contrasting MathForm-8B (8B dense, shipped August 2026; emits a Lean 4 theorem statement with the proof obligation left open; checked by the Lean compiler, a type checker implementing a fixed calculus; published figures Pass@8 88.06% syntax-checked and 72.37% consistency-checked, vendor-reported, with FATE-H and FATE-X at 63% and 37%) against AREX-2 (repository created 29 Sep 2026 with no weights, card or licence tag; nothing to check yet), and a row noting the AREX-Base outer loop re-reads the agent's own answer against its constraints - a model reading a model - with BrowseComp 82.5, GAIA 85.4 and DeepSearch QA 89.9 for the 122B Base, unreproduced. A footer reads 'A compiler fails a wrong answer. A verification loop has to notice one.' The OrcaRouter logo is composited in the bottom-right corner.

Dwa zadania, które stos może pomieścić jednocześnie

Te modele nie pokrywają się funkcjonalnie i warto to powiedzieć, zanim ktokolwiek odczyta „versus” jako wybór. MathForm-8B to warstwa front-endowa asystenta dowodzenia. Jej wynikiem jest sformułowanie twierdzenia, nad którym następnie pracuje matematyk lub automatyczny system dowodzenia. Jej naturalne miejsce jest wewnątrz potoku weryfikacji dla matematyki, metod formalnych lub prac nad specyfikacjami, gdzie wartością jest to, że dalsze narzędzie może przetworzyć wynik bez zaufania do modelu.

AREX-2, jeśli będzie kontynuować swoją rodzinę, jest zapleczem dla pytań, które nie mają kompilatora. „Który z tych trzech dokumentów jest niespójny z pozostałymi dwoma” nie ma formalnego systemu, względem którego można by to sprawdzić, a jedyną dostępną obroną jest gromadzenie kolejnych dowodów i ponowne przeanalizowanie własnego rozumowania — czym właśnie jest zewnętrzna pętla AREX. Zespół, który potrzebuje obu, uruchamiałby je w różnych miejscach: formalizację dla tej części problemu, którą da się sformalizować, oraz agenta wyszukującego i weryfikującego dla tej części, której nie można.

Ten podział to również uczciwa odpowiedź na to, na którym z nich możesz działać w tym tygodniu. MathForm-8B jest już wydany, udokumentowany i gotowy do użycia. AREX-2 to nazwa.

Jak wygląda historia routingu, gdy tematem jest weryfikacja

Ponieważ oba są wykorzystywane tak różnie, kwestia infrastruktury także się rozdziela.

W przypadku MathForm-8B obciążenie to seria krótkich, deterministycznych generowań, których wynik trafia bezpośrednio do kompilatora. Liczy się to, że model jest osiągalny i że nieudane wywołanie jest ponawiane, ponieważ pipeline formalizacyjny, który gubi żądanie, wygląda identycznie jak pipeline formalizacyjny, który zawiódł — a tylko jeden z tych przypadków jest faktem o modelu. Automatyczne przełączanie awaryjne między dostawcami to konkretna funkcja, która pozwala odróżnić te dwa przypadki. OrcaRouter nie obsługuje dziś ani MathForm-8B, ani AREX-2, więc wagi OpenBMB pochodzą z własnej dystrybucji OpenBMB, a każdy hostowany endpoint należy do kogoś innego; oferujemy routing z przodu, z ceną katalogową dostawcy przekazywaną dalej i bez doliczania czegokolwiek za token.

W przypadku agenta takiego jak AREX-Base kształt jest trudniejszy, a argument za routingiem mocniejszy. Trajektoria deep research wykonuje dziesiątki wywołań modelu na zapytanie, z których każde ponownie odczytuje kontekst rosnący w miarę gromadzenia dowodów, a tryby awarii się kumulują: dostawca, który przekroczy limit czasu na dziewiętnastym z dwudziestu pięciu kroków, nie pogarsza odpowiedzi — tworzy pewną siebie błędną odpowiedź. To argument za umieszczeniem pętli za jednym API dla ponad 200 modeli z regułą failover, która decyduje w czasie działania, dzięki czemu pojedynczy zawodny dostawca oznacza ponowienie próby, a nie błędne cytowanie.

Jedyna rzecz, na którą trzeba uważać, i jedyna rzecz, której nie należy zakładać.

Trzy fakty odpowiedziałyby na większość otwartych pytań dotyczących AREX-2, a wszystkie trzy są widoczne z zewnątrz: czy w tym repozytorium pojawią się pliki, jaką liczbę parametrów deklaruje karta modelu oraz czy widnieje na niej znacznik Apache 2.0, który miały jego dwa poprzedniki. Dopóki tak się nie stanie, jedynym możliwym do obrony stwierdzeniem na temat AREX-2 jest to, że BAAI zastrzegło tę nazwę 29 września 2026 r. i nic nie ogłosiło.

Nie należy zakładać, że druga generacja dziedziczy kształt pierwszej. „2” to nazwa produktu, a nie architektura. Może oznaczać coś większego niż 122B Base albo małą destylację tego samego frameworku — a biorąc pod uwagę, że rodzina już wypuściła jednocześnie zarówno poziom jakości, jak i poziom kosztu obsługi, obie interpretacje są prawdopodobne. W tej chwili nie jest natomiast prawdopodobne publikowanie dla niej specyfikacji.