
AREX-2 vs MathForm-8B : un vérificateur de preuves et une boucle de recherche sont deux types de vérification différents
- typesafeNOUVEAUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 par million de tokens · 507 tok/s
- OpenAINOUVEAUOpenAI: GPT-6 Luna2026-09-2237Intelligence
- OpenAINOUVEAUOpenAI: GPT-6 Sol2026-09-2248Intelligence
- AnthropicNOUVEAUAnthropic: Claude Opus 5.52026-09-2258Intelligence
- xAINOUVEAUGrok 4.72026-09-2146Intelligence
- OrcaNOUVEAUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 par million de tokens · 194 tok/s
- OrcaNOUVEAUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens · 1143 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 par million de tokens · 55 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens · 106 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligence69Code
- xAISpaceXAI: Grok 4.62026-08-1244Intelligence77Code
MathForm-8B et AREX-2 sont les deux modèles les plus rigoureusement vérifiables de cette série, et ils se vérifient de manière opposée. MathForm-8B est l'autoformaliseur à 8 milliards de paramètres d'OpenBMB, publié en août 2026 : donnez-lui un problème de mathématiques écrit en anglais simple et il produit un énoncé Lean 4 formellement correct de ce problème, que le compilateur d'un assistant de preuve vérifie ensuite. AREX-2 est un dépôt Hugging Face que BAAI a créé le 29 septembre 2026 à 17:56 UTC, contenant un .gitattributes et aucun poids, aucune fiche de modèle, aucune étiquette de licence et aucune annonce — un nom réservé pour une probable deuxième génération d'agents AREX de recherche approfondie de BAAI, dont la première génération se vérifie elle-même en revérifiant sa propre réponse par rapport aux contraintes qui lui ont été données.
Donc, la question intéressante ici n’est pas de savoir quel modèle est meilleur. C’est ce que signifie, pour un modèle, d’être vérifiable, car l’un de ces deux est vérifié par un compilateur qui se moque de ce que quiconque croit, et l’autre est vérifié, si le précédent familial tient, par une boucle que le même modèle exécute. Cette distinction subsiste même si un côté de la confrontation n’a pas encore été livré, et c’est la raison pour laquelle ces deux-là ont leur place dans la même conversation.
Le côté qui existe, et la raison pour laquelle il est vérifiable
MathForm-8B a une description de tâche étroite, et il vaut la peine de l'énoncer précisément, car cette étroitesse est précisément l'essentiel. Il ne résout pas de problèmes mathématiques et ne prétend pas le faire. Il a été affiné sur FormalVerse, un corpus d'environ 367 000 exemples Lean 4 vérifiés, et sa récompense d'entraînement provenait du compilateur Lean plutôt que d'un modèle de préférences humaines. Étant donné un énoncé informel, il émet les imports, les types et l'en-tête du théorème — en laissant ouverte l'obligation de preuve elle-même — afin qu'un compilateur puisse confirmer que la formalisation dit ce que disait le problème informel.
Ses chiffres publiés, tous rapportés par le fournisseur OpenBMB et aucun reproduit indépendamment, font état d'un Pass@8 moyen de 88,06 % sous un contrôle syntaxique et de 72,37 % sous un contrôle de cohérence plus strict sur six benchmarks, avec une chute à 63 % et 37 % sur les sous-ensembles les plus difficiles FATE-H et FATE-X. Lisez-les pour ce qu'ils sont : un modèle mesuré face à un système formel, où une mauvaise réponse est un échec de compilation plutôt qu'un désaccord sur la qualité. C'est une propriété rare. La plupart des affirmations de benchmark sur ce blog reposent sur un évaluateur auquel il faut faire confiance ; celle-ci repose sur de l'arithmétique qu'une machine exécute.
Le côté qui n’existe pas encore, et pourquoi sa vérification est différente
Les seuls faits confirmables concernant AREX-2 sont l'organisation, le nom et l'horodatage. Rien n'a été téléversé et BAAI n'a rien dit. La famille derrière ce nom existe bel et bien, toutefois, et elle a été publiée le 23 juillet 2026 sous le nom d'AREX-Base — un mélange d'experts de 122 milliards de paramètres, avec 10 milliards de paramètres actifs, sur une base Qwen3.5-122B-A10B — aux côtés d'AREX-Turbo, un modèle dense de 4B. Tous deux sous Apache 2.0, tous deux des agents plutôt que des modèles de chat.
La conception d'AREX est un cadre de recherche à deux boucles, et la boucle externe est une étape de vérification. Une boucle interne rassemble des preuves issues de la recherche et de la navigation, les intègre, et produit une réponse candidate assortie d'un indice de confiance. La boucle externe confronte ensuite cette candidate aux contraintes d'origine et décide : l'accepter, l'affiner, ou abandonner la trajectoire et redémarrer. Entre les itérations, le modèle maintient un bloc de contexte composé des constatations vérifiées, des candidats ouverts, des contraintes non résolues et du prochain plan, ce qui lui permet de suivre une longue piste d'investigation sans perdre le fil. BAAI annonce 82,5 sur BrowseComp, 85,4 sur GAIA et 89,9 sur DeepSearch QA pour le Base, et 70,7 / 81,6 / 78,5 pour le Turbo — des chiffres fournis par l'éditeur lui-même, non reproduits.
C’est une forme d’auto-vérification réelle et utile. Elle est aussi catégoriquement plus faible qu’un compilateur. Lorsque la boucle externe d’AREX décide qu’une réponse satisfait à ses contraintes, le jugement provient d’un modèle de langage qui lit les contraintes. Lorsque Lean accepte une formalisation MathForm-8B, le jugement provient d’un vérificateur de types qui implémente un calcul fixe. Ni l’un ni l’autre n’est exempt d’erreur — une formalisation peut être du Lean valide qui capture le mauvais théorème — mais un seul des deux peut être faux sans que personne ne s’en aperçoive, et la différence n’est pas une question de degré.
Disponibilité — MathForm-8B est téléchargeable depuis OpenBMB avec une fiche publiée. AREX-2 est un dépôt ne contenant aucun fichier.
• Paramètres — 8B dense pour MathForm-8B. Inconnu pour AREX-2 ; la famille couvre un mélange d'experts de 122B et un modèle dense de 4B.
• Ce qu'il produit — Énoncés de théorèmes Lean 4 pour MathForm-8B, la preuve étant volontairement laissée ouverte. Inconnu pour AREX-2 ; la première génération a produit une réponse étayée par des recherches, avec un chiffre de confiance.
• Comment c'est vérifié — le compilateur Lean, pour MathForm-8B. Une boucle de vérification au sein du même modèle, sur la base des preuves d'AREX-Base.
• Licence — les propres conditions d'OpenBMB pour MathForm-8B ; rien n'a encore été déclaré pour AREX-2. La première génération d'AREX était sous Apache 2.0.
• Chiffres clés — Pass@8 de 88,06 % vérifié syntaxiquement et de 72,37 % vérifié pour la cohérence pour MathForm-8B, rapportés par le fournisseur. Il n’en existe aucun pour AREX-2.


Deux tâches qu'une pile peut contenir en même temps
Ces modèles ne se chevauchent pas fonctionnellement, et il vaut la peine de le dire avant que quiconque ne lise un « versus » comme un choix. MathForm-8B est une interface frontale pour un assistant de preuve. Sa sortie est un énoncé de théorème sur lequel un mathématicien ou un prouveur automatique travaille ensuite. Sa place naturelle se trouve dans une chaîne de vérification pour les mathématiques, les méthodes formelles ou le travail de spécification, où l’intérêt est qu’un outil en aval puisse consommer la sortie sans faire confiance au modèle.
AREX-2, s'il poursuit sa famille, est un back-end pour les questions qui n'ont pas de compilateur. « Lequel de ces trois documents est incohérent avec les deux autres » ne dispose d'aucun système formel par rapport auquel le vérifier, et la seule défense disponible consiste à rassembler davantage de preuves et à réexaminer votre propre raisonnement — ce qui correspond à la boucle externe d'AREX. Une équipe qui a besoin des deux les exécuterait à des endroits différents : la formalisation pour la partie du problème qui peut être formalisée, et un agent de recherche et de vérification pour la partie qui ne peut pas l'être.
Cette distinction est aussi la réponse honnête à la question de savoir sur lequel de ces éléments vous pouvez agir cette semaine. MathForm-8B est livré, documenté et utilisable dès maintenant. AREX-2 est un nom.
À quoi ressemble l’histoire du routage lorsque la vérification est le sujet
Comme les deux sont utilisés de façon si différente, la question de l’infrastructure se scinde elle aussi.
Pour MathForm-8B, la charge de travail se présente comme une rafale de générations courtes et déterministes dont la sortie part directement dans un compilateur. Ce qui compte, c'est que le modèle soit joignable et qu'un appel échoué soit réessayé, car un pipeline de formalisation qui abandonne une requête ressemble trait pour trait à un pipeline de formalisation qui a échoué — et une seule de ces deux situations est un fait concernant le modèle. Le basculement automatique entre fournisseurs est précisément la fonctionnalité qui permet de distinguer ces deux cas. OrcaRouter ne propose aujourd'hui ni MathForm-8B ni AREX-2, si bien que les poids OpenBMB proviennent de la distribution propre à OpenBMB et que tout point de terminaison hébergé appartient à quelqu'un d'autre ; ce que nous offrons, c'est le routage en amont, avec le prix catalogue du fournisseur répercuté tel quel et rien ajouté par token.
Pour un agent comme AREX-Base, la configuration est plus délicate et l'argument en faveur du routage est plus fort. Une trajectoire de recherche approfondie génère des dizaines d'appels de modèle par requête, chacun relisant un contexte qui s'enrichit à mesure que les preuves s'accumulent, et les modes de défaillance se cumulent : un fournisseur qui expire au délai à l'étape dix-neuf sur vingt-cinq ne dégrade pas la réponse, il en produit une fausse mais assurée. C'est l'argument pour placer la boucle derrière une API unique pour plus de 200 modèles, avec une règle de basculement qui décide à l'exécution, afin qu'un seul fournisseur défaillant donne lieu à une nouvelle tentative plutôt qu'à une mauvaise citation.
La seule chose à surveiller, et la seule chose à ne pas présumer
Trois faits répondraient à la plupart des questions ouvertes sur AREX-2, et tous trois sont visibles de l’extérieur : la présence de fichiers dans ce dépôt, le nombre de paramètres revendiqué par la fiche, et le fait qu’il porte ou non l’étiquette Apache 2.0 que portaient ses deux prédécesseurs. Tant que ce n’est pas le cas, la seule affirmation défendable au sujet d’AREX-2 est que BAAI a réservé le nom le 29 septembre 2026 et n’a rien annoncé.
Ce qu'il ne faut pas supposer, c'est qu'une deuxième génération hérite de la forme de la première. Un « 2 » est un nom de produit, pas une architecture. Il pourrait être plus grand que le 122B Base, ou il pourrait être une petite distillation du même framework — et étant donné que la famille a déjà livré à la fois un palier de qualité et un palier de coût, les deux interprétations sont plausibles. Ce qui n'est pas plausible, pour l'instant, c'est de publier une spécification à son sujet.
