Eine generierte Titelkarte mit der Aufschrift „Clef vs MathForm-8B“, dem Untertitel „einer beantwortet deine Frage, der andere schreibt einen Beweis“, sowie Chips mit der Aufschrift „beide Apache 2.0“ und „zwei Qwen-Fine-Tunes“. Das OrcaRouter-Logo ist in der unteren rechten Ecke eingefügt.
Engineering & Research

Clef vs. MathForm-8B: Der eine beantwortet Ihre Frage, der andere schreibt einen Beweis

Autor

Elias Hawthorne

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen →
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Der Grund für die Gegenüberstellung von Cloudflare/clef mit openbmb/MathForm-8B ist, dass sie derzeit die zwei am leichtesten zu verwechselnden Dinge bei offenen Gewichten sind, und sie zu verwechseln kostet einen Trainingslauf. Beide sind Fine-Tunes, die auf den Checkpoints Qwen3.8-27B bzw. Qwen3-8B basieren. Beide sind Apache-2.0. Beide wurden innerhalb der letzten zehn Wochen veröffentlicht. Beide sind eng gefasst, zweckgebaut und werden von ihren Entwicklern als spezialisiert statt allgemein beschrieben. Und sie haben absolut nichts miteinander zu tun, denn das eine erzeugt eine Zahl, die aus einer von Ihnen gelieferten Liste ausgewählt wird, und das andere erzeugt Lean-4-Quellcode, Token für Token, zur Überprüfung durch einen Proof-Assistenten.

Clef ist Cloudflares multimodales Entscheidungsmodell mit 27 Milliarden Parametern: Man gibt ihm einen Zustand und ein Schema typisierter Fragen, und es liefert in einem einzigen nicht-autoregressiven Durchlauf für jede zulässige Antwort eine kalibrierte Wahrscheinlichkeit zurück, wobei im gesamten Ablauf an keiner Stelle Text generiert wird. MathForm-8B von OpenBMB ist ein Autoformalisierungsmodell – eine mathematische Aussage in natürlicher Sprache geht hinein, Lean 4 kommt heraus –, und die Pipeline, die es trainiert hat, wird in einem arXiv-Preprint beschrieben, der am 14. August 2026 zusammen mit den Gewichten veröffentlicht wurde. Die Obergrenze des einen Modells ist die Größe Ihrer Optionsliste. Die Obergrenze des anderen ist die Stärke von Leans Typentheorie. Zu fragen, welches besser sei, ist ein Kategorienfehler, und die Tatsache, dass beide Apache-2.0-Open-Weights-Fine-Tunes mit acht bis siebenundzwanzig Milliarden Parametern sind, ist genau das, was es leicht macht, diesen Fehler zu begehen.

Was die Oberfläche jedes Modells physisch verbietet

Am schnellsten erkennt man den Unterschied, wenn man liest, was jeder einzelne zurückgeben kann.

• Eingabe — Clef nimmt einen Zustand (Text, JSON, Bilder oder Videoframes) plus 1 bis 64 benannte typisierte Fragen entgegen; MathForm-8B nimmt eine mathematische Aussage in natürlicher Sprache entgegen.

• Ausgabe — Clef gibt eine Wahrscheinlichkeit pro zulässiger Option zurück, pro Frage softmax-normalisiert. MathForm-8B gibt Lean 4-Quellcode zurück.

• Fragetypen — Die von Clef sind noul (Wahr/Falsch, mit der Wahrscheinlichkeit für „wahr“), Auswahl (2 bis 26 benannte Optionen) und Bewertung (2 bis 26 geordnete Stufen); MathForm-8B hat überhaupt kein Fragekonzept.

• Kalibrierung — Clef veröffentlicht ein Konfidenzfeld pro Antwort; MathForm-8B veröffentlicht Pass@8-Raten unter Syntax- und Konsistenzprüfungen.

• Bereitstellung — Clef wird über einen Jev/SystemOne-kompatiblen POST /v1/systemone-Body bereitgestellt, gehostet oder selbst betrieben; MathForm-8B wird mit Anweisungen für Transformers, vLLM und SGLang ausgeliefert, die alle einen OpenAI-kompatiblen Completion-Endpunkt mit einem 16.384-Token-Kontext bereitstellen, wobei max_new_tokens auf 16.384 gesetzt ist.

Die praktische Konsequenz ergibt sich unmittelbar. Wenn Sie ein Ja/Nein-Urteil über einen Textabschnitt benötigen, ist Clef die einzige der beiden, die es liefern kann – es gibt keine Möglichkeit, MathForm-8B eine Frage zu stellen, die nicht „Schreibe den Lean-4-Code dafür“ lautet. Wenn Sie Lean 4 benötigen, ist Clef die einzige der beiden, die es kategorisch nicht liefern kann, und zwar nicht aus Schwäche: Einen schema-gebundenen Bewerter zu bitten, ein Theorem zu formalisieren, passt nicht zu seinem Vertrag, daher wird die Anfrage konstruktionsbedingt abgelehnt statt schlecht beantwortet.

A two-column comparison scoreboard titled 'Clef vs MathForm-8B — the scoreboard'. The left column 'Clef' reads: Parameters: 27B multimodal; Trained from: Qwen3.8-27B; Output: probability per option, no text; Context: 65,536 tokens; Interface: /v1/systemone, 1 to 64 typed questions; Evidence: vendor run, unreproduced. The right column 'MathForm-8B' reads: Parameters: 8B text-only; Trained from: Qwen3-8B; Output: Lean 4 source code; Context: 16,384 tokens; Interface: OpenAI-compatible completion; Evidence: paper, Pass@8 88.06% SC, 72.37% CC. A footer reads 'Clef figures per Cloudflare; MathForm figures per OpenBMB's paper. Neither independently reproduced.' The OrcaRouter logo is composited in the bottom-right corner.

Die Pipeline, zu der beide gehören

Es gibt eine reale Architektur, in der diese beiden Modelle nebeneinanderstehen, und es lohnt sich, sie durchzugehen, weil sie die Aufteilung konkret statt abstrakt macht. Man stelle sich einen Dienst vor, der Mathematik für Forschende und Studierende formalisiert.

Aussagen treffen in natürlicher Sprache ein, unbegrenzt in ihrer Art. Bevor irgendetwas formalisiert werden kann, muss etwas entscheiden, was eingetroffen ist. Ist dies ein zu beweisender Satz, eine hinzuzufügende Definition, eine Anfrage zur Prüfung eines bestehenden Beweises oder eine Frage, die geklärt werden muss, bevor irgendjemand Lean anfasst? Ist es in sich geschlossen, oder stützt es sich auf Kontext, den der Nutzer nicht geliefert hat? Sind die Symbole konventionell, oder ist diese Notation etwas, das das System noch nie gesehen hat? Jede davon ist eine begrenzte Frage mit einer kleinen Optionsmenge — Clefs genaue Form — und die kalibrierte Wahrscheinlichkeit, die jeder Antwort beigefügt ist, ist das, was den Dienst in die Lage versetzt, mit den unsicheren vernünftig umzugehen: alles unterhalb eines Schwellenwerts an einen Menschen weiterleiten, statt zu raten.

Der zweite Schritt gehört zu MathForm-8B. Nimm eine Aussage, die bereits als eigenständiger Satz mit bekannter Notation klassifiziert wurde, und gib Lean 4 aus. Das ist ein Generierungsproblem, und die Qualitätsfrage ist, wie oft die Ausgabe kompiliert und wie oft sie dasselbe bedeutet wie das Original — was genau das ist, was die beiden Evaluationsachsen des Anbieters messen. Das ist das allgemeine Muster, das sich aus der Paarung herausziehen lässt: ein günstiger, begrenzter Klassifikator vor einem teuren, spezialisierten Generator ist normalerweise günstiger und zuverlässiger, als den Generator aufzufordern, zu entscheiden, ob er überhaupt laufen sollte.

Was die Zahlen auf jeder Seite tatsächlich messen

Der arXiv-Abstract von OpenBMB berichtet, dass MathForm-8B über sechs Benchmarks hinweg durchschnittliche Pass@8-Raten von 88,06 % unter Syntax Check und 72,37 % unter Consistency Check erreicht und dass es auf den Teilmengen FATE-H und FATE-X Konsistenz-Bestehensraten von 63 % und 37 % erzielt, beide höher als die stärksten spezialisierten Baselines, gegen die das Paper vergleicht. Die Trainingspipeline ist der interessante Teil der Behauptung: Ein Retrieval-Planer zieht vor der Generierung relevante Definitionen und vorhandene Formalisierungen aus Mathlib heraus, und generierte Aussagen werden anschließend mithilfe von Compiler-Diagnosen und Feedback zur semantischen Konsistenz überarbeitet; so wurde der FormalVerse-Datensatz mit rund 367.000 verifizierten Lean-4-Beispielen vor dem überwachten Fine-Tuning und dem Reinforcement Learning aufgebaut. Dies sind vom Anbieter gemeldete Zahlen aus einem Paper und einer Model Card. Keine unabhängige Stelle hat sie nachgerechnet.

Clefs Zahlen messen etwas völlig anderes und sind nicht vergleichbar. Cloudflares Decision Index-Lauf berichtet über BANKING77 Intent-Macro-F1 von 94,2, CLINC150 mit Out-of-Scope-Behandlung bei 97,4, GPQA Diamond bei 48,0 – wobei das ältere Jev 78,3 erzielt – und eine mediane Anfrage-Latenz von 209,3 ms. Es ist eine Tabelle über Klassifikation und Routing, erstellt vom Anbieter auf der eigenen Suite, gehostet auf dem eigenen Leaderboard des Anbieters und nicht reproduziert.

Der einzige ehrliche Satz, den man über diese beiden Spalten schreiben kann, ist, dass sie weder einen Benchmark noch eine Einheit noch eine Evaluierungsphilosophie teilen. Die 37 % von MathForm-8B auf einer schwierigen Formalisierungs-Teilmenge und die 97,4 von Clef bei der Erkennung von Absichten außerhalb des Anwendungsbereichs sind beides echte Behauptungen ihrer Hersteller zu unterschiedlichen Aufgaben, und wer sie nebeneinanderstellt, hat nichts gelernt, außer dass beide Zahlen existieren.

Was Sie ausführen würden, und was es kostet

Keines der beiden Modelle ist eine Route auf OrcaRouter, und dieser Artikel macht keine Aussage zur Verfügbarkeit – der Katalog liefert einen 404 für cloudflare/clef und für MathForm-8B. Das MathForm-Repository umfasst etwa 16,4 GB, und beide Modelle stehen unter Apache-2.0, sodass beide morgen von jedem mit der entsprechenden Hardware selbst gehostet werden können.

• Clef auf Cloudflare — 0,24 $ pro Million Eingabe-Tokens auf Workers AI, mit der veröffentlichten Latenz, gemessen auf einer einzelnen H200.

• MathForm-8B selbst gehostet — kein Anbieter-Hosting, kein Preis pro Token und ein dokumentierter 16.384-Token-Kontext, was eine Einschränkung ist, die Beachtung verdient: Ein langer Abschnitt eines Papers passt nicht in einem Durchgang.

• Die geroutete Alternative für die Klassifizierer-Hälfte – das Jev 1.13 von TypeSafe zu 0,042 $ pro Million Eingabe-Token bei einem Kontext von 65.536 Token, bereitgestellt über denselben POST /v1/systemone Body, den Clef verwendet, was es zu einem Drop-in für den ersten Schritt der obigen Pipeline macht.

Dort verdient sich eine Routing-Schicht in dieser speziellen Paarung ihren Platz. Das Muster besteht aus einem Entscheider und einem Generator, und die Entscheider-Hälfte ist diejenige mit einem Live-Ersatz – ein Endpunkt vor über 200 Modellen, durchgereichter Anbieter-Listenpreis ohne Aufschlag pro Token und automatisches Failover, damit ein schlechter Nachmittag eines Anbieters nicht die Eingangstür Ihrer Pipeline blockiert. Der Generator-Teil ist ein 16,4 GB großes Artefakt, das Sie selbst betreiben, und kein Endpunkt ändert daran etwas.

A headless capture of the openbmb/MathForm-8B model card on Hugging Face, showing the model title, the TextGeneration, Transformers and Safetensors tags, a link to the openbmb/FormalVerse dataset, the English language marker, and the qwen3, lean4, autoformalization, mathematics, formal-verification and reasoning subject tags.

Noch etwas, das die Größen verbergen

Die Parameterzahlen legen einen Vergleich nahe, der nicht standhält. Clef hat 27B und MathForm-8B hat 8B, daher liegt die Annahme nahe, dass das größere Modell das leistungsfähigere und das kleinere der Spezialist ist. Der Art nach ist es genau umgekehrt. Clef ist groß, weil es ein eingefrorenes multimodales Backbone trägt, das es braucht, um Screenshots und Rechnungen zu lesen; der darauf aufsetzende trainierte Teil ist ein kleiner Schema-Head mit Rang-256-Adaptern. MathForm-8B ist klein, weil Lean 4 ein enges Ziel ist und die Qwen3-8B-Basis ausreichte, um es zu treffen; die eigentliche Ingenieursleistung steckt in der Retrieval- und Verifikationspipeline, die seine Trainingsdaten erzeugt hat, und nicht in seiner Parameterzahl.

Die Größe sagt mit anderen Worten, was jedes Modell zu tragen hatte, nicht, wie schwierig das Problem ist, das es löst. Ein 27B-Modell, das einen Beleg liest und „billing, 0.98“ zurückgibt, und ein 8B-Modell, das kompilierbares Lean ausgibt, tun beide genau das, wofür sie gebaut wurden, und die Gegenüberstellung von acht Milliarden und siebenundzwanzig Milliarden wird dich etwa in der Hälfte der Fälle zum falschen Modell führen.

A headless capture of the OrcaRouter model page for typesafe/jev-1.13, showing the TypeSafe breadcrumb, the Jev 1.13 title, text input and output modality labels, a p50 TTFT latency figure, the Performance and Public benchmarks tabs, and the code-sample panel.

Die Entscheidung – und die Frage, die keiner der beiden Anbieter beantwortet hat

Wenn Sie eine Pipeline haben, die unbegrenzte natürliche Sprache aufnimmt und sie weiterleiten muss, bevor Sie Rechenleistung dafür aufwenden, ist der erste Schritt ein begrenzter Klassifikator – Clef, wo seine multimodale Eingabe von Bedeutung ist und seine Zahlen auf Ihren Daten gut aussehen, oder Jev 1.13, wo Sie dieselbe Anfrageform zu einem niedrigeren Listenpreis wünschen und Ihre Architektur nicht an einen Anbieter binden möchten, dessen Evaluation niemand reproduziert hat. Der zweite Schritt ist ein spezialisierter Generator, und wenn dieser Generator Lean 4 ist, ist MathForm-8B das offene Modell, das genau dafür gebaut wurde, mit einer veröffentlichten Pipeline und einem Korpus dahinter.

Was auf beiden Seiten fehlt, ist dieselbe Art von Belegen. Clefs Decision Index-Lauf stammt von Cloudflare selbst und wurde nie unabhängig wiederholt; die Pass@8-Werte von MathForm-8B stammen aus dessen eigener Publikation. Beides sind ambitionierte Behauptungen in einem Bereich, in dem der ehrliche Test billig zu beschreiben und teuer durchzuführen ist – nimm Daten, auf denen kein Anbieter trainiert hat, wende dieselbe Pipeline an und veröffentliche das Ergebnis. Bis jemand das für eines der beiden Modelle tut, ist das Nützliche, was dieser Vergleich dir sagen kann, eine Form: Eines von beiden gehört an den Anfang deiner Pipeline, um zu entscheiden, was ankommt, und das andere gehört dahinter, um die schwere, eng umrissene Arbeit zu erledigen, und keines ersetzt das andere bei irgendeiner Parameteranzahl.