
AREX-2 vs MathForm-8B: Sprawdzacz dowodów i pętla wyszukiwania to różne rodzaje weryfikacji
- typesafeNOWOŚĆTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 za 1 mln tokenów · 507 tok/s
- OpenAINOWOŚĆOpenAI: GPT-6 Luna2026-09-2237Inteligencja
- OpenAINOWOŚĆOpenAI: GPT-6 Sol2026-09-2248Inteligencja
- AnthropicNOWOŚĆAnthropic: Claude Opus 5.52026-09-2258Inteligencja
- xAINOWOŚĆGrok 4.72026-09-2146Inteligencja
- OrcaNOWOŚĆOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 za 1 mln tokenów · 194 tok/s
- OrcaNOWOŚĆOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów · 1143 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 za 1 mln tokenów · 55 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów · 106 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencja69Kod
- xAISpaceXAI: Grok 4.62026-08-1244Inteligencja77Kod
MathForm-8B i AREX-2 to dwa najbardziej rygorystycznie weryfikowalne modele w tej serii, a weryfikują się w przeciwny sposób. MathForm-8B to autoformalizator OpenBMB o 8 miliardach parametrów, wydany w sierpniu 2026 r.: wystarczy podać mu zadanie matematyczne napisane prostym angielskim, a tworzy on formalnie poprawne sformułowanie tego zadania w Lean 4, które następnie sprawdza kompilator asystenta dowodzenia. AREX-2 to repozytorium Hugging Face, które BAAI utworzyło 29 września 2026 r. o 17:56 UTC, zawierające jedynie plik .gitattributes i ani wag, ani karty modelu, ani znacznika licencji, ani ogłoszenia — zarezerwowana nazwa dla prawdopodobnej drugiej generacji agentów ds. pogłębionych badań AREX firmy BAAI, których pierwsza generacja weryfikuje się sama, ponownie sprawdzając własną odpowiedź wobec narzuconych jej ograniczeń.
Tak więc interesującym pytaniem nie jest to, który model jest lepszy. Jest nim to, co znaczy, że model jest sprawdzalny, ponieważ jeden z tych dwóch jest sprawdzany przez kompilator, który nie dba o to, w co ktokolwiek wierzy, a drugi jest sprawdzany — jeśli precedens rodziny się utrzymuje — przez pętlę, którą uruchamia ten sam model. To rozróżnienie się utrzymuje, mimo że jedna strona tego starcia nie została jeszcze wydana, i to jest powód, dla którego te dwa w ogóle należą do tej samej rozmowy.
Strona, która istnieje, i powód, dla którego jest sprawdzalna
MathForm-8B ma wąsko zakreślony zakres zadań i warto ująć to precyzyjnie, ponieważ właśnie ta wąskość jest sednem. Nie rozwiązuje problemów matematycznych i nie twierdzi, że to robi. Został dostrojony na FormalVerse, korpusie około 367 000 zweryfikowanych przykładów Lean 4, a jego nagroda treningowa pochodziła z kompilatora Lean, a nie z modelu preferencji człowieka. Otrzymawszy nieformalne sformułowanie, generuje importy, typy i nagłówek twierdzenia — pozostawiając samo zobowiązanie dowodowe otwarte — tak aby kompilator mógł potwierdzić, że formalizacja mówi to, co mówił nieformalny problem.
Jego opublikowane liczby — wszystkie raportowane przez dostawcę OpenBMB i żadna niezależnie nieodtworzona — to średnia Pass@8 wynosząca 88,06% w kontroli składni i 72,37% w surowszej kontroli spójności w sześciu benchmarkach, spadająca do 63% i 37% na najtrudniejszych podzbiorach FATE-H i FATE-X. Odczytuj je jako to, czym są: model mierzony względem formalnego systemu, w którym błędna odpowiedź oznacza niepowodzenie kompilacji, a nie różnicę zdań na temat jakości. To rzadka właściwość. Większość twierdzeń o benchmarkach na tym blogu opiera się na oceniającym, któremu trzeba zaufać; to opiera się na arytmetyce, którą wykonuje maszyna.
Strona, która jeszcze nie istnieje, i dlaczego jej weryfikacja jest inna
Jedynymi potwierdzalnymi faktami dotyczącymi AREX-2 są organizacja, nazwa i znacznik czasu. Niczego nie przesłano, a BAAI nic nie powiedziało. Rodzina stojąca za tą nazwą jednak istnieje i została wydana 23 lipca 2026 r. jako AREX-Base — mieszanka ekspertów o 122 miliardach parametrów i 10 miliardach aktywnych parametrów na bazie Qwen3.5-122B-A10B — wraz z AREX-Turbo, gęstym modelem 4B. Oba na licencji Apache 2.0, oba to modele agentowe, a nie czatowe.
Projekt AREX to dwupętlowe ramy badawcze, a pętla zewnętrzna stanowi krok weryfikacji. Pętla wewnętrzna gromadzi dowody z wyszukiwania i przeglądania, integruje je i tworzy odpowiedź-kandydata z dołączoną wartością pewności. Następnie pętla zewnętrzna sprawdza tego kandydata względem pierwotnych ograniczeń i decyduje: zaakceptować go, udoskonalić czy odrzucić trajektorię i zacząć od nowa. Między iteracjami model utrzymuje blok kontekstu zawierający zweryfikowane ustalenia, otwartych kandydatów, nierozwiązane ograniczenia i następny plan, co pozwala mu podążać długą linią dociekań bez utraty wątku. BAAI podaje 82,5 w BrowseComp, 85,4 w GAIA i 89,9 w DeepSearch QA dla wersji Base oraz 70,7 / 81,6 / 78,5 dla wersji Turbo — to własne liczby dostawcy, nieodtworzone.
To prawdziwa i użyteczna forma samosprawdzania. Jest też kategorycznie słabsza niż kompilator. Kiedy zewnętrzna pętla AREX uznaje, że odpowiedź spełnia jej ograniczenia, ocena pochodzi od modelu językowego czytającego ograniczenia. Kiedy Lean akceptuje formalizację MathForm-8B, ocena pochodzi od sprawdzacza typów implementującego ustalony rachunek. Żadna z nich nie jest wolna od błędów — formalizacja może być poprawnym Lean, który ujmuje niewłaściwe twierdzenie — ale tylko jedna z nich może być błędna, a nikt tego nie zauważy, i różnica nie jest kwestią stopnia.
• Dostępność — MathForm-8B można pobrać z OpenBMB wraz z opublikowaną kartą. AREX-2 to repozytorium, w którym nie ma żadnych plików.
• Parametry — 8B gęsty dla MathForm-8B. Nieznane dla AREX-2; rodzina obejmuje mieszaninę ekspertów 122B oraz gęsty model 4B.
• Co generuje — sformułowania twierdzeń Lean 4 dla MathForm-8B, z dowodem celowo pozostawionym otwartym. Nieznane dla AREX-2; pierwsza generacja utworzyła zbadaną odpowiedź ze wskaźnikiem pewności.
• Jak to jest sprawdzane — kompilator Lean, dla MathForm-8B. Pętla weryfikacyjna wewnątrz tego samego modelu, na podstawie dowodów z AREX-Base.
• Licencja — własne warunki OpenBMB dla MathForm-8B; dla AREX-2 nic jeszcze nie zadeklarowano. Pierwsza generacja AREX była na licencji Apache 2.0.
• Kluczowe liczby — 88,06% sprawdzonych pod kątem składni i 72,37% sprawdzonych pod kątem spójności Pass@8 dla MathForm-8B, według danych dostawcy. Dla AREX-2 nie istnieją żadne.


Dwa zadania, które stos może pomieścić jednocześnie
Te modele nie pokrywają się funkcjonalnie i warto to powiedzieć, zanim ktokolwiek odczyta „versus” jako wybór. MathForm-8B to warstwa front-endowa asystenta dowodzenia. Jej wynikiem jest sformułowanie twierdzenia, nad którym następnie pracuje matematyk lub automatyczny system dowodzenia. Jej naturalne miejsce jest wewnątrz potoku weryfikacji dla matematyki, metod formalnych lub prac nad specyfikacjami, gdzie wartością jest to, że dalsze narzędzie może przetworzyć wynik bez zaufania do modelu.
AREX-2, jeśli będzie kontynuować swoją rodzinę, jest zapleczem dla pytań, które nie mają kompilatora. „Który z tych trzech dokumentów jest niespójny z pozostałymi dwoma” nie ma formalnego systemu, względem którego można by to sprawdzić, a jedyną dostępną obroną jest gromadzenie kolejnych dowodów i ponowne przeanalizowanie własnego rozumowania — czym właśnie jest zewnętrzna pętla AREX. Zespół, który potrzebuje obu, uruchamiałby je w różnych miejscach: formalizację dla tej części problemu, którą da się sformalizować, oraz agenta wyszukującego i weryfikującego dla tej części, której nie można.
Ten podział to również uczciwa odpowiedź na to, na którym z nich możesz działać w tym tygodniu. MathForm-8B jest już wydany, udokumentowany i gotowy do użycia. AREX-2 to nazwa.
Jak wygląda historia routingu, gdy tematem jest weryfikacja
Ponieważ oba są wykorzystywane tak różnie, kwestia infrastruktury także się rozdziela.
W przypadku MathForm-8B obciążenie to seria krótkich, deterministycznych generowań, których wynik trafia bezpośrednio do kompilatora. Liczy się to, że model jest osiągalny i że nieudane wywołanie jest ponawiane, ponieważ pipeline formalizacyjny, który gubi żądanie, wygląda identycznie jak pipeline formalizacyjny, który zawiódł — a tylko jeden z tych przypadków jest faktem o modelu. Automatyczne przełączanie awaryjne między dostawcami to konkretna funkcja, która pozwala odróżnić te dwa przypadki. OrcaRouter nie obsługuje dziś ani MathForm-8B, ani AREX-2, więc wagi OpenBMB pochodzą z własnej dystrybucji OpenBMB, a każdy hostowany endpoint należy do kogoś innego; oferujemy routing z przodu, z ceną katalogową dostawcy przekazywaną dalej i bez doliczania czegokolwiek za token.
W przypadku agenta takiego jak AREX-Base kształt jest trudniejszy, a argument za routingiem mocniejszy. Trajektoria deep research wykonuje dziesiątki wywołań modelu na zapytanie, z których każde ponownie odczytuje kontekst rosnący w miarę gromadzenia dowodów, a tryby awarii się kumulują: dostawca, który przekroczy limit czasu na dziewiętnastym z dwudziestu pięciu kroków, nie pogarsza odpowiedzi — tworzy pewną siebie błędną odpowiedź. To argument za umieszczeniem pętli za jednym API dla ponad 200 modeli z regułą failover, która decyduje w czasie działania, dzięki czemu pojedynczy zawodny dostawca oznacza ponowienie próby, a nie błędne cytowanie.
Jedyna rzecz, na którą trzeba uważać, i jedyna rzecz, której nie należy zakładać.
Trzy fakty odpowiedziałyby na większość otwartych pytań dotyczących AREX-2, a wszystkie trzy są widoczne z zewnątrz: czy w tym repozytorium pojawią się pliki, jaką liczbę parametrów deklaruje karta modelu oraz czy widnieje na niej znacznik Apache 2.0, który miały jego dwa poprzedniki. Dopóki tak się nie stanie, jedynym możliwym do obrony stwierdzeniem na temat AREX-2 jest to, że BAAI zastrzegło tę nazwę 29 września 2026 r. i nic nie ogłosiło.
Nie należy zakładać, że druga generacja dziedziczy kształt pierwszej. „2” to nazwa produktu, a nie architektura. Może oznaczać coś większego niż 122B Base albo małą destylację tego samego frameworku — a biorąc pod uwagę, że rodzina już wypuściła jednocześnie zarówno poziom jakości, jak i poziom kosztu obsługi, obie interpretacje są prawdopodobne. W tej chwili nie jest natomiast prawdopodobne publikowanie dla niej specyfikacji.
