
TwIL-LM3-Pro vs MathForm 8B : L'énoncé et l'implication sont deux moitiés différentes de la formalisation
- openaiNOUVEAUOpenAI: GPT-6.1 Sol2026-09-2952Intelligence
- anthropicNOUVEAUAnthropic: Claude Sonnet 5.52026-09-2856Intelligence
- typesafeNOUVEAUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 par million de tokens · 219 tok/s
- OpenAINOUVEAUOpenAI: GPT-6 Luna2026-09-2238Intelligence
- OpenAINOUVEAUOpenAI: GPT-6 Sol2026-09-2248Intelligence
- AnthropicNOUVEAUAnthropic: Claude Opus 5.52026-09-2258Intelligence
- xAINOUVEAUGrok 4.72026-09-2146Intelligence
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 par million de tokens · 118 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens · 1064 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 par million de tokens · 47 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens · 213 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
TwIL-LM3-Pro et MathForm-8B visent le même problème général — amener une machine à produire du texte formel et vérifiable plutôt que de la prose plausible — et ils en résolvent chacun une moitié différente. MathForm-8B est l'autoformaliseur à 8 milliards de paramètres d'OpenBMB, publié en août 2026 : à partir d'un problème mathématique en langage naturel, il produit l'énoncé Lean 4 de ce problème, laissant l'obligation de preuve ouverte pour qu'un compilateur la vérifie. TwIL-LM3-Pro est le modèle de logique formelle de 3,66 milliards de paramètres de webAI, datant de septembre 2026, et ses sorties cibles sont des étiquettes d'implication, des traductions en logique du premier ordre, des analyses sémantiques et des critiques de preuves Lean. L'un produit la chose à vérifier. L'autre vous dit si la chose que vous avez implique bien ce que vous prétendez.
Étant donné que les deux se recoupent sur exactement un seul terrain — la formalisation Lean — une page de comparaison est tentante et trompeuse. La question plus utile est de savoir ce pour quoi chacun a été entraîné à être récompensé, car c’est dans le signal de récompense que les deux conceptions divergent le plus nettement et que réside réellement le choix le plus judicieux.
Énoncé versus implication
MathForm-8B est entraîné sur FormalVerse, un corpus Lean 4 que l'article d'OpenBMB décrit comme environ 367 000 exemples vérifiés, par ajustement supervisé suivi d'un apprentissage par renforcement. Le pipeline qui l'entoure récupère les définitions pertinentes et les formalisations existantes de Mathlib avant la génération, puis affine à l'aide des diagnostics du compilateur et d'un contrôle de cohérence sémantique. Sa sortie est un énoncé formel — imports, types, en-tête de théorème — qu'un compilateur externe accepte ou rejette. La fiche du modèle précise explicitement qu'il ne résout pas le problème et ne prétend pas le faire ; la preuve incombe à quelqu'un d'autre.
TwIL-LM3-Pro aborde le même domaine par le versant logique. Son pipeline visait six objectifs : la traduction en logique du premier ordre, l’étiquetage d’implication, l’analyse sémantique, la formalisation en Lean, la critique de preuve Lean et l’induction de règles. Là où MathForm est conçu pour émettre un énoncé, TwIL-LM3-Pro est conçu pour porter des jugements sur des énoncés : est-ce impliqué, cette analyse est-elle correcte, cette tentative de preuve est-elle valide. Il formalise aussi, et c’est le seul point où les deux modèles sont véritablement comparables plutôt que simplement adjacents.
Récompense d'un compilateur versus récompense d'un évaluateur
C'est là la différence de conception qui compte, et les deux fournisseurs la documentent.
La récompense d'entraînement de MathForm provenait de la compilation Lean et de retours sur la cohérence sémantique. Un compilateur est un oracle : soit il accepte la formalisation, soit il ne l'accepte pas, et il n'y a ni crédit partiel ni rien à contester. C'est le signal de récompense le plus net dans ce domaine de l'apprentissage automatique, et c'est pourquoi les benchmarks d'autoformalisation sont rapportés sous forme de taux de réussite — la métrique se situe en aval d'un programme qui ne se soucie pas de ce que quiconque croit.
L’étape finale de TwIL-LM3-Pro était une exécution GRPO pondérée par l’entropie face à un vérificateur programmatique, sa propre fiche décrivant un crédit partiel pour les correspondances approximatives et le token-F1 afin que les groupes de prompts où tout a échoué produisent encore du gradient. Son principal critère macro est la moyenne à pondération égale de quatre voies de classification bornées plus l’induction de règles, et dans ce critère, les voies de choix multiple et procédurale sont créditées comme `max(exact_match, loose_match)` — une règle que la fiche énonce clairement, car une réponse correcte formatée différemment est un artefact de formatage plutôt qu’un échec de raisonnement.
Aucune des deux conceptions n'est pire. Elles sont réglées pour des conséquences différentes. Une récompense évaluée par un compilateur produit un modèle que l'on peut pointer vers un problème de formalisation difficile et dont on peut faire confiance à la production, parce que celle-ci est vérifiable. Une récompense notée par un évaluateur avec crédit partiel produit un modèle qui peut être entraîné sur des jugements plus flous — implication, critique, induction de règles — là où aucun compilateur n'existe pour arbitrer et où l'alternative est de ne pas entraîner du tout sur ces voies. Le coût, c'est que les chiffres obtenus ne valent que ce que vaut le harnais, et webAI le dit : sa ligne strict-7, qui élimine la moindre trace de crédit pour correspondance approximative, existe précisément pour qu'un lecteur puisse voir le chiffre plus sévère à côté du chiffre phare.
Les scores ne sont pas sur la même règle
Les deux modèles publient des chiffres proches de Lean, et on ne peut pas les soustraire. L'article de MathForm rapporte un Pass@8 moyen de 88,06 % sous Syntax Check et de 72,37 % sous Consistency Check sur six benchmarks Lean, avec des taux de réussite au Consistency Check de 63 % et 37 % sur les sous-ensembles plus difficiles FATE-H et FATE-X, et affirme surpasser plusieurs autoformaliseurs spécialisés de 32B. La fiche de TwIL-LM3-Pro rapporte un token-F1 de `lean_formalize` de 0,5092 et une exactitude de `lean_critic` de 0,7950 sur son propre harnais Track A.
Pass@8 sous un contrôle de compilateur et le token-F1 par rapport à une chaîne de référence mesurent des choses différentes. Pass@8 donne au modèle huit tentatives et demande si l’une a compilé et est restée cohérente ; le token-F1 évalue à quel point une génération unique correspondait à une référence. Un modèle peut obtenir un bon score sur l’un et un mauvais sur l’autre, et rien dans l’un ou l’autre document ne permet de lire les deux côte à côte.
Le résumé honnête du bilan des benchmarks est que les preuves de MathForm-8B proviennent d’un article avec un compilateur dans la boucle, tandis que celles de TwIL-LM3-Pro proviennent d’un harnais de fournisseur avec un évaluateur dans la boucle, et qu’aucun tiers n’a fait passer les deux par une même grille d’évaluation. Toute page qui place « 88.06% » à côté de « 0.5092 » comme s’il s’agissait d’un score doit être considérée comme une page qui n’a pas lu les définitions.
Caractéristiques, côte à côte
• Paramètres — TwIL-LM3-Pro 3,66B dense vs MathForm-8B 8B, soit environ 2,2 fois la taille.
• Modèle de base — `ibm-granite/granite-4.2-3b` vs `Qwen/Qwen3-8B`.
• Données d'entraînement — un corpus synthétique de logique formelle couvrant six objectifs par rapport à FormalVerse, soit environ 367 000 exemples Lean 4 vérifiés.
• Récompense — un vérificateur programmatique avec crédit partiel et tolérance aux correspondances approximatives, par rapport à la compilation Lean et au retour de cohérence sémantique.
• Sortie principale — étiquettes d’implication, traductions en FOL, analyses sémantiques, énoncés Lean et critiques de preuves vs un énoncé Lean 4 destiné à être vérifié par un compilateur.
• Fenêtre de contexte — 131 072 jetons pour TwIL-LM3-Pro, mesurée à l’intérieur de 8 192 jetons ; MathForm-8B est proposé avec des budgets de génération allant jusqu’à 16 384 jetons dans son propre exemple d’utilisation.
• Licence — webAI Non-Commercial License ver. 1.0 vs Apache 2.0.
• Empreinte quantifiée — TwIL-LM3-Pro fournit un GGUF Q4_K_M de 2,09 GiB pour CPU ou 4 Go de VRAM ; MathForm-8B ne publie aucun GGUF dans son propre dépôt.
La licence tranche à nouveau la question de production.
MathForm-8B est sous licence Apache 2.0. Vous pouvez l'affiner, le redistribuer et l'exploiter dans un produit commercial. TwIL-LM3-Pro est non commercial : la recherche et l'usage personnel sont autorisés, et tout déploiement générant des revenus nécessite un accord séparé avec webAI, dont la voie commerciale passe par un accord d'entreprise plutôt que par une grille tarifaire publiée.
Pour un groupe de recherche ou un étudiant, cette différence est sans importance — les deux sont des téléchargements sans restriction sur Hugging Face. Pour une entreprise, elle est décisive, et elle désigne MathForm-8B pour tout travail d’autoformalisation en production, quel que soit le modèle qui obtient le meilleur score sur un axe que ni l’un ni l’autre des fournisseurs n’a mesuré de la même manière.
Où se situe un routeur dans ce pipeline
Ni TwIL-LM3-Pro ni MathForm-8B ne figurent parmi les routes du catalogue OrcaRouter, et les raisons diffèrent : l’un est sous licence non commerciale, sans point de terminaison hébergé, l’autre est publié comme checkpoint ouvert pour l’auto-hébergement. Dans un pipeline de formalisation, la question du routage se joue dans la couche qui les entoure. Construire un corpus de style FormalVerse signifie générer des milliers de problèmes informels, les filtrer pour en vérifier la bonne formation, et écrire les contrôles de cohérence sémantique qui notent la sortie — autant d’appels textuels, et exactement le genre de travail où l’on veut remplacer le modèle qui génère des données en masse par le modèle qui les juge, sans second contrat. Sur un point de terminaison compatible OpenAI devant plus de 200 modèles au prix catalogue du fournisseur, avec 0 % de marge ajoutée, ce remplacement se résume à un changement de configuration, et une baisse de prix du fournisseur sur le modèle de génération prend effet le jour même. Le basculement automatique est essentiel dans une construction de corpus, précisément parce qu’une tâche qui meurt aux deux tiers d’une passe de génération coûte toute l’exécution.

La division du travail
Si la tâche consiste à transformer des mathématiques de manuel en énoncés Lean compilables à grande échelle, et que le résultat doit être livré dans un produit commercial, MathForm-8B est l’outil et la licence Apache 2.0 en est la raison. Si la tâche consiste à décider si un corps de texte implique une affirmation, à étiqueter l’implication, à analyser la sémantique ou à critiquer une tentative de preuve, TwIL-LM3-Pro couvre un terrain que MathForm n’a jamais visé — et sa licence non commerciale constitue une limite à l’endroit où cette capacité peut être utilisée, et non un reproche envers la capacité elle-même.
La combinaison qui a du sens est un pipeline en deux étapes plutôt qu’un choix : un modèle produit l’énoncé formel, l’autre le juge. Tous deux ont publié le pipeline qui les a produits, ce qui est inhabituel à cette échelle et est la raison pour laquelle cette comparaison peut être faite tout court.


