
AREX-2 vs MathForm-8B: Een bewijscontroleur en een zoeklus zijn verschillende soorten verificatie
- typesafeNIEUWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 mln tokens · 507 tok/s
- OpenAINIEUWOpenAI: GPT-6 Luna2026-09-2237Intelligentie
- OpenAINIEUWOpenAI: GPT-6 Sol2026-09-2248Intelligentie
- AnthropicNIEUWAnthropic: Claude Opus 5.52026-09-2258Intelligentie
- xAINIEUWGrok 4.72026-09-2146Intelligentie
- OrcaNIEUWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 mln tokens · 194 tok/s
- OrcaNIEUWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens · 1143 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 mln tokens · 55 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens · 106 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligentie69Coderen
- xAISpaceXAI: Grok 4.62026-08-1244Intelligentie77Coderen
MathForm-8B en AREX-2 zijn de twee meest rigoureus verifieerbare modellen in deze serie, en ze verifiëren op tegenovergestelde manieren. MathForm-8B is de autoformaliseerder van OpenBMB met 8 miljard parameters, uitgebracht in augustus 2026: geef het een wiskundeprobleem in gewoon Engels en het produceert een formeel correcte Lean 4-formulering van dat probleem, die vervolgens door de compiler van een bewijsassistent wordt gecontroleerd. AREX-2 is een Hugging Face-repository die BAAI op 29 september 2026 om 17:56 UTC heeft aangemaakt, met een .gitattributes en geen gewichten, geen modelkaart, geen licentietag en geen aankondiging — een gereserveerde naam voor een waarschijnlijke tweede generatie van BAAI's AREX deepresearch-agenten, waarvan de eerste generatie zichzelf verifieert door zijn eigen antwoord opnieuw te toetsen aan de beperkingen die het heeft gekregen.
De interessante vraag hier is dus niet welk model beter is. Het is wat het betekent voor een model om controleerbaar te zijn, want een van deze twee wordt gecontroleerd door een compiler die er niet om geeft wat iemand gelooft, en de andere wordt, als het precedent van de familie standhoudt, gecontroleerd door een loop die hetzelfde model draait. Dat onderscheid blijft overeind, ook al is de ene kant van de confrontatie nog niet uitgebracht, en het is de reden dat deze twee überhaupt in hetzelfde gesprek thuishoren.
De kant die bestaat, en de reden waarom die controleerbaar is
MathForm-8B heeft een nauwe taakomschrijving, en het is de moeite waard die precies te formuleren, want het nauwe is juist het punt. Het lost geen wiskundige problemen op en beweert dat ook niet. Het is fine-tuned op FormalVerse, een corpus van ongeveer 367.000 geverifieerde Lean 4-voorbeelden, en de trainingsbeloning kwam van de Lean-compiler in plaats van van een menselijk preferentiemodel. Gegeven een informele bewering, levert het de imports, types en theorema-kop op — waarbij de bewijsverplichting zelf open blijft — zodat een compiler kan bevestigen dat de formalisering zegt wat het informele probleem zei.
De gepubliceerde cijfers, allemaal door de leverancier OpenBMB gerapporteerd en geen enkele onafhankelijk gereproduceerd, zijn een gemiddelde Pass@8 van 88,06% bij een syntaxcontrole en 72,37% bij een strengere consistentiecontrole over zes benchmarks, met een daling tot 63% en 37% op de moeilijkste FATE-H- en FATE-X-deelverzamelingen. Lees die als wat ze zijn: een model dat wordt gemeten aan een formeel systeem, waarbij een fout antwoord betekent dat het niet compileert, in plaats van een meningsverschil over kwaliteit. Dat is een zeldzame eigenschap. De meeste benchmarkclaims op deze blog berusten op een beoordelaar die vertrouwd moet worden; deze berust op rekenwerk dat een machine uitvoert.
De kant die nog niet bestaat, en waarom de verificatie ervan anders is
De enige bevestigbare feiten over AREX-2 zijn de organisatie, de naam en de tijdstempel. Er is niets geüpload en BAAI heeft niets gezegd. De familie achter de naam bestaat echter wel, en die werd op 23 juli 2026 uitgebracht als AREX-Base — een mixture-of-experts met 122 miljard parameters en 10 miljard actieve parameters op een Qwen3.5-122B-A10B-basis — samen met AREX-Turbo, een dense 4B. Beide onder Apache 2.0, beide agents in plaats van chatmodellen.
Het AREX-ontwerp is een onderzoeksraamwerk met twee lussen, waarbij de buitenste lus een verificatiestap is. Een binnenste lus verzamelt bewijs uit zoeken en browsen, integreert dit en produceert een kandidaatantwoord met een bijbehorend betrouwbaarheidscijfer. De buitenste lus controleert dat kandidaatantwoord vervolgens aan de oorspronkelijke beperkingen en beslist: het accepteren, het verfijnen of het traject verwerpen en opnieuw beginnen. Tussen iteraties houdt het model een contextblok bij met geverifieerde bevindingen, open kandidaten, onopgeloste beperkingen en het volgende plan, wat het in staat stelt een lange onderzoekslijn te volgen zonder de draad kwijt te raken. BAAI rapporteert 82,5 op BrowseComp, 85,4 op GAIA en 89,9 op DeepSearch QA voor de Base, en 70,7 / 81,6 / 78,5 voor de Turbo — de eigen cijfers van de leverancier, niet gereproduceerd.
Dat is een echte en nuttige vorm van zelfcontrole. Het is ook categorisch zwakker dan een compiler. Wanneer de buitenste lus van AREX besluit dat een antwoord aan zijn beperkingen voldoet, komt het oordeel van een taalmodel dat de beperkingen leest. Wanneer Lean een MathForm-8B-formalisering accepteert, komt het oordeel van een typechecker die een vaste calculus implementeert. Geen van beide is foutloos — een formalisering kan geldige Lean zijn die de verkeerde stelling vastlegt — maar slechts één van beide kan fout zijn zonder dat iemand het merkt, en het verschil is niet een kwestie van gradatie.
Beschikbaarheid — MathForm-8B is downloadbaar vanaf OpenBMB met een gepubliceerde kaart. AREX-2 is een repository die geen bestanden bevat.
• Parameters — 8B dense voor MathForm-8B. Onbekend voor AREX-2; de familie omvat een 122B mixture-of-experts en een dense 4B.
• Wat het oplevert — Lean 4-stellingen voor MathForm-8B, waarbij het bewijs bewust open wordt gelaten. Onbekend voor AREX-2; de eerste generatie produceerde een onderbouwd antwoord met een betrouwbaarheidscijfer.
• Hoe het wordt gecontroleerd — de Lean-compiler, voor MathForm-8B. Een verificatielus binnen hetzelfde model, op basis van het bewijs van AREX-Base.
• Licentie — de eigen voorwaarden van OpenBMB voor MathForm-8B; voor AREX-2 is nog niets aangekondigd. De eerste AREX-generatie was Apache 2.0.
• Kerncijfers — 88,06% op syntaxis gecontroleerd en 72,37% op consistentie gecontroleerd Pass@8 voor MathForm-8B, volgens opgave van de leverancier. Voor AREX-2 bestaan die niet.


Twee taken die een stack tegelijk kan bevatten
Deze modellen overlappen niet in functie, en het is de moeite waard dat te zeggen voordat iemand een 'versus' als een keuze leest. MathForm-8B is een front-end voor een bewijsassistent. De uitvoer is een stelling die een wiskundige of een geautomatiseerde bewijzer vervolgens bewerkt. De natuurlijke plaats ervan is in een verificatiepijplijn voor wiskunde, formele methoden of specificatiewerk, waar de waarde is dat een downstream-tool de uitvoer kan gebruiken zonder het model te vertrouwen.
AREX-2, als het zijn familie voortzet, is een back-end voor vragen die geen compiler hebben. "Welke van deze drie stukken is inconsistent met de andere twee" heeft geen formeel systeem om het tegen te controleren, en het enige beschikbare verweer is meer bewijs verzamelen en je eigen redenering opnieuw onderzoeken — dat is wat de AREX-buitenlus is. Een team dat beide nodig heeft, zou ze op verschillende plekken inzetten: formalisering voor het deel van het probleem dat geformaliseerd kan worden, en een zoek-en-verifieer-agent voor het deel dat dat niet kan.
Dat onderscheid is ook het eerlijke antwoord op de vraag welke van deze je deze week kunt aanpakken. MathForm-8B is uitgebracht, gedocumenteerd en nu bruikbaar. AREX-2 is een naam.
Hoe het routingverhaal eruitziet wanneer verificatie het onderwerp is
Omdat de twee zo verschillend worden gebruikt, valt de infrastructuurvraag ook uiteen.
Voor MathForm-8B is de werklast een burst van korte, deterministische generaties waarvan de output rechtstreeks naar een compiler gaat. Wat telt is dat het model bereikbaar is en dat een mislukte aanroep opnieuw wordt geprobeerd, want een formalisatiepijplijn die een verzoek laat vallen ziet er identiek uit als een formalisatiepijplijn die is mislukt — en slechts een van die twee is een feit over het model. Automatische failover tussen providers is de specifieke functie die deze twee gescheiden houdt. OrcaRouter ondersteunt vandaag noch MathForm-8B noch AREX-2, dus de OpenBMB-gewichten komen uit de eigen distributie van OpenBMB en elke gehoste endpoint is van iemand anders; wat wij bieden is de routing aan de voorkant, met de lijstprijs van de provider doorgegeven en niets extra per token.
Voor een agent zoals AREX-Base is de vorm moeilijker en is het argument voor routering sterker. Een deep-research-traject maakt tientallen modelaanroepen per query, waarbij elke aanroep een context opnieuw leest die groeit naarmate er meer bewijs binnenkomt, en de faalmodi versterken elkaar: een provider die een time-out krijgt bij stap negentien van vijfentwintig degradeert het antwoord niet, maar produceert een zelfverzekerd fout antwoord. Dat is het argument om de loop achter één API voor meer dan 200 modellen met een failover-regel die tijdens runtime beslist, zodat één slechte provider een retry is in plaats van een slechte bronvermelding.
Het enige waar je op moet letten, en het enige dat je niet moet aannemen
Drie feiten zouden de meeste openstaande vragen over AREX-2 beantwoorden, en alle drie zijn van buitenaf zichtbaar: of er bestanden in die repository verschijnen, welk aantal parameters de kaart claimt, en of hij de Apache 2.0-tag draagt die zijn twee voorgangers hadden. Totdat dit het geval is, is de enige verdedigbare uitspraak over AREX-2 dat BAAI de naam op 29 september 2026 heeft gereserveerd en niets heeft aangekondigd.
Wat je vooral niet moet aannemen, is dat een tweede generatie de vorm van de eerste erft. Een "2" is een productnaam, geen architectuur. Die zou groter kunnen zijn dan de 122B Base, of een kleine distillatie van hetzelfde raamwerk kunnen zijn — en aangezien de familie al tegelijkertijd een kwaliteits- en een serving-kostentier heeft uitgebracht, zijn beide lezingen aannemelijk. Wat op dit moment niet aannemelijk is, is het publiceren van een specificatie ervoor.
