Une carte de titre générée portant « Clef vs MathForm-8B », sous-titrée « l’un répond à votre question, l’autre rédige une démonstration », avec des pastilles « Apache 2.0 pour les deux » et « deux modèles Qwen affinés ». Le logo OrcaRouter est incrusté dans le coin inférieur droit.
Engineering & Research

Clef vs MathForm-8B : L'un répond à votre question, l'autre écrit une preuve

Auteur

Elias Hawthorne

Date de publication

Derniers modèles · 20Voir tous les modèles →
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

La raison de placer Cloudflare/clef à côté de openbmb/MathForm-8B est qu'ils sont les deux choses les plus faciles à confondre dans les poids ouverts en ce moment, et les confondre coûte une session d'entraînement. Tous deux sont des fine-tunes construits respectivement sur les checkpoints Qwen3.8-27B et Qwen3-8B. Tous deux sont sous Apache-2.0. Tous deux ont été publiés au cours des dix dernières semaines. Tous deux sont étroits, conçus pour un usage précis, et décrits par leurs créateurs comme spécialisés plutôt que généralistes. Et ils n'ont absolument rien à voir l'un avec l'autre, car l'un produit un nombre sélectionné dans une liste que vous avez fournie et l'autre produit du code source Lean 4, token par token, pour qu'un assistant de preuve le vérifie.

Clef est le modèle de décision multimodal à 27 milliards de paramètres de Cloudflare : vous lui donnez un état et un schéma de questions typées, et il renvoie une probabilité calibrée pour chaque réponse autorisée en une seule passe non autorégressive, sans aucune génération de texte à aucun moment du parcours. MathForm-8B, d’OpenBMB, est un modèle d’autoformalisation — un énoncé mathématique en langage naturel entre, du Lean 4 sort, et le pipeline qui l’a entraîné est décrit dans une prépublication arXiv publiée en même temps que les poids le 14 août 2026. Le plafond d’un modèle est la taille de votre liste d’options. Celui de l’autre est la force de la théorie des types de Lean. Demander lequel est meilleur est une erreur de catégorie, et le fait que tous deux soient des modèles affinés à poids ouverts sous Apache-2.0 de huit à vingt-sept milliards de paramètres est exactement ce qui rend cette erreur facile à commettre.

Ce que l’interface de chaque modèle interdit physiquement

Le moyen le plus rapide de voir la division est de lire ce que chacun peut renvoyer.

• Entrée — Clef prend un état (texte, JSON, images ou trames vidéo) ainsi que de 1 à 64 questions nommées et typées ; MathForm-8B prend un énoncé mathématique en langage naturel.

• Sortie — Clef renvoie une probabilité par option autorisée, normalisée par softmax pour chaque question. MathForm-8B renvoie du code source Lean 4.

• Types de questions — Ceux de Clef sont noul (vrai/faux, avec la probabilité de vrai), choix (2 à 26 options nommées) et score (2 à 26 niveaux ordonnés) ; MathForm-8B n'a aucun concept de question du tout.

• Calibration — Clef publie un champ de confiance par réponse ; MathForm-8B publie les taux Pass@8 sous des contrôles de syntaxe et de cohérence.

• Service — Clef est accessible via un corps de requête POST /v1/systemone compatible Jev/SystemOne, hébergé ou exécuté localement ; MathForm-8B est livré avec des instructions pour Transformers, vLLM et SGLang, qui exposent toutes un point de terminaison de complétion compatible OpenAI dans un contexte de 16 384 jetons, max_new_tokens étant défini à 16 384.

La conséquence pratique découle immédiatement. Si vous avez besoin d'un jugement oui/non sur un texte, Clef est le seul des deux qui puisse le produire — il n'existe aucun moyen de poser à MathForm-8B une question qui ne soit pas « écris le Lean 4 pour ceci ». Si vous avez besoin de Lean 4, Clef est le seul des deux qui soit catégoriquement incapable de le produire, et non par faiblesse : demander à un évaluateur lié à un schéma de formaliser un théorème ne relève pas de son contrat, de sorte que la requête est refusée par construction plutôt que mal traitée.

A two-column comparison scoreboard titled 'Clef vs MathForm-8B — the scoreboard'. The left column 'Clef' reads: Parameters: 27B multimodal; Trained from: Qwen3.8-27B; Output: probability per option, no text; Context: 65,536 tokens; Interface: /v1/systemone, 1 to 64 typed questions; Evidence: vendor run, unreproduced. The right column 'MathForm-8B' reads: Parameters: 8B text-only; Trained from: Qwen3-8B; Output: Lean 4 source code; Context: 16,384 tokens; Interface: OpenAI-compatible completion; Evidence: paper, Pass@8 88.06% SC, 72.37% CC. A footer reads 'Clef figures per Cloudflare; MathForm figures per OpenBMB's paper. Neither independently reproduced.' The OrcaRouter logo is composited in the bottom-right corner.

Le pipeline auquel ils appartiennent tous les deux

Il existe une architecture réelle dans laquelle ces deux modèles se trouvent côte à côte, et il vaut la peine de la passer en revue, car elle rend la séparation concrète plutôt qu’abstraite. Prenons le cas d’un service qui formalise les mathématiques pour les chercheurs et les étudiants.

Les énoncés arrivent en langage naturel, sans limite quant à leur nature. Avant toute formalisation, quelque chose doit déterminer ce qui est arrivé. S'agit-il d'un théorème à démontrer, d'une définition à ajouter, d'une demande de vérification d'une preuve existante, ou d'une question qui nécessite des éclaircissements avant que quiconque ne touche à Lean ? Est-ce autonome, ou cela s'appuie-t-il sur un contexte que l'utilisateur n'a pas fourni ? Les symboles sont-ils conventionnels, ou s'agit-il d'une notation que le système n'a jamais vue ? Chacune de ces questions est une question bornée avec un petit ensemble d'options — exactement la forme de Clef — et la probabilité calibrée associée à chaque réponse est ce qui permet au service de faire quelque chose de sensé avec les réponses incertaines : orienter vers un humain tout ce qui se situe sous un seuil plutôt que de deviner.

La deuxième étape revient à MathForm-8B. Prendre un énoncé déjà classé comme théorème autonome doté d'une notation connue, et produire le Lean 4. C'est un problème de génération, et la question de la qualité est de savoir à quelle fréquence la sortie se compile et à quelle fréquence elle signifie la même chose que l'original — ce qui est précisément ce que mesurent les deux axes d'évaluation du fournisseur. Voilà le schéma général qu'il vaut la peine de dégager de cet appariement : un classifieur borné et bon marché placé devant un générateur spécialisé coûteux est généralement moins cher et plus fiable que de demander au générateur de décider s'il devrait être lancé du tout.

Ce que mesurent réellement les chiffres de chaque côté

Le résumé arXiv d'OpenBMB rapporte que MathForm-8B atteint des taux moyens de Pass@8 de 88,06 % selon Syntax Check et de 72,37 % selon Consistency Check sur six benchmarks, et que sur les sous-ensembles FATE-H et FATE-X, il obtient des taux de réussite en cohérence de 63 % et 37 %, tous deux supérieurs aux baselines spécialisées les plus fortes auxquelles l'article se compare. Le pipeline d'entraînement est la partie intéressante de cette affirmation : un planificateur de récupération extrait de Mathlib les définitions pertinentes et les formalisations existantes avant la génération, puis les énoncés générés sont révisés à l'aide des diagnostics du compilateur et de retours de cohérence sémantique, ce qui explique comment le jeu de données FormalVerse d'environ 367 000 exemples Lean 4 vérifiés a été construit avant l'affinage supervisé et l'apprentissage par renforcement. Il s'agit de chiffres rapportés par le fournisseur, issus d'un article et d'une fiche de modèle. Aucun tiers indépendant ne les a reproduits.

Les chiffres de Clef mesurent quelque chose d'entièrement différent et ne sont pas comparables. L'exécution du Decision Index de Cloudflare rapporte un macro-F1 d'intention de 94,2 sur BANKING77, CLINC150 avec gestion des cas hors périmètre à 97,4, GPQA Diamond à 48,0 — où l'ancien Jev obtient 78,3 — et une latence médiane des requêtes de 209,3 ms. C'est un tableau sur la classification et le routage, produit par le fournisseur sur sa propre suite, hébergé sur son propre classement, et non reproduit.

La seule phrase honnête à écrire à propos de ces deux colonnes est qu’elles ne partagent ni benchmark, ni unité, ni philosophie d’évaluation. Le 37 % de MathForm-8B sur un sous-ensemble difficile de formalisation et le 97,4 de Clef sur la détection d’intentions hors périmètre sont tous deux des affirmations réelles de leurs créateurs à propos de tâches différentes, et un lecteur qui les met côte à côte n’a rien appris, si ce n’est que les deux nombres existent.

Ce que vous exécuteriez, et ce que cela coûte

Aucun des deux modèles n'est une route sur OrcaRouter, et cet article n'affirme aucune disponibilité — le catalogue renvoie une erreur 404 pour cloudflare/clef et pour MathForm-8B. Le dépôt MathForm pèse environ 16,4 Go, et les deux modèles sont sous Apache-2.0, donc tous deux peuvent être auto-hébergés dès demain par quiconque dispose du matériel nécessaire.

• Clef sur Cloudflare — 0,24 $ par million de jetons d'entrée sur Workers AI, avec la latence publiée mesurée sur un seul H200.

• MathForm-8B auto-hébergé — aucun hébergement par un fournisseur, aucun tarif par token, et un contexte documenté de 16 384 tokens, ce qui est une contrainte à noter : une longue section d’article ne tiendra pas en une seule passe.

• L'alternative routée pour la moitié classifieur — Jev 1.13 de TypeSafe à 0,042 $ par million de jetons d'entrée sur un contexte de 65 536 jetons, servie via le même corps POST /v1/systemone que Clef utilise, ce qui en fait une solution directement intégrable pour la première étape du pipeline ci-dessus.

C'est là qu'une couche de routage justifie sa place dans ce duo bien particulier. Le schéma associe un décideur et un générateur, et c'est la moitié « décideur » qui dispose d'un substitut en direct — un seul point d'accès devant plus de 200 modèles, prix catalogue du fournisseur répercuté sans majoration par token, et un basculement automatique pour qu'un après-midi difficile chez un fournisseur ne bloque pas la porte d'entrée de votre pipeline. La moitié « générateur » est un artefact de 16,4 Go que vous exécutez vous-même, et aucun point d'accès n'y change rien.

A headless capture of the openbmb/MathForm-8B model card on Hugging Face, showing the model title, the TextGeneration, Transformers and Safetensors tags, a link to the openbmb/FormalVerse dataset, the English language marker, and the qwen3, lean4, autoformalization, mathematics, formal-verification and reasoning subject tags.

Une chose de plus que les tailles cachent

Les nombres de paramètres invitent à une comparaison qui ne tient pas. Clef est un modèle 27B et MathForm-8B est un modèle 8B, il est donc naturel de supposer que le plus grand est le plus capable et que le plus petit est le spécialiste. C’est l’inverse en nature. Clef est volumineux parce qu’il embarque un socle multimodal gelé dont il a besoin pour lire des captures d’écran et des factures ; la partie entraînée par-dessus est une petite tête de schéma avec des adaptateurs de rang 256. MathForm-8B est petit parce que Lean 4 est une cible étroite et que la base Qwen3-8B suffisait pour l’atteindre, l’ingénierie réelle résidant dans le pipeline de récupération et de vérification qui a produit ses données d’entraînement plutôt que dans son nombre de paramètres.

La taille, autrement dit, vous dit ce que chaque modèle a dû porter, pas à quel point le problème qu'il résout est difficile. Un 27B qui lit un reçu et renvoie « facturation, 0,98 » et un 8B qui génère du Lean compilable font tous deux exactement ce pour quoi ils ont été conçus, et le cadrage « huit milliards contre vingt-sept milliards » vous conduira au mauvais choix environ une fois sur deux.

A headless capture of the OrcaRouter model page for typesafe/jev-1.13, showing the TypeSafe breadcrumb, the Jev 1.13 title, text input and output modality labels, a p50 TTFT latency figure, the Performance and Public benchmarks tabs, and the code-sample panel.

La décision, et la question à laquelle aucun des deux fournisseurs n’a répondu

Si vous avez un pipeline qui ingère du langage naturel non borné et doit l'acheminer avant d'y consacrer du calcul, la première étape est un classifieur borné — Clef là où son entrée multimodale compte et où ses chiffres sont bons sur vos données, ou Jev 1.13 là où vous voulez la même forme de requête à un prix catalogue inférieur et sans lier votre architecture à un fournisseur dont personne n'a reproduit l'évaluation. La deuxième étape est un générateur spécialisé, et si ce générateur est Lean 4, MathForm-8B est le modèle ouvert conçu exactement pour cela, avec un pipeline publié et un corpus derrière lui.

Ce qui manque des deux côtés, c’est le même type de preuves. L’exécution du Decision Index de Clef est propre à Cloudflare et n’a jamais été reproduite de manière indépendante ; les chiffres Pass@8 de MathForm-8B proviennent de son propre article. Les deux sont des affirmations ambitieuses dans un domaine où le test honnête est peu coûteux à décrire et coûteux à exécuter — prendre des données sur lesquelles aucun des deux fournisseurs ne s’est entraîné, appliquer le même pipeline, et publier le résultat. Jusqu’à ce que quelqu’un le fasse pour l’un ou l’autre modèle, la chose utile que cette comparaison peut vous apprendre est une forme : l’un d’eux a sa place à l’avant de votre pipeline, pour décider ce qui arrive, et l’autre a sa place derrière, pour faire le travail difficile et étroit, et ni l’un ni l’autre n’est un substitut à l’autre, quel que soit le nombre de paramètres.