Wygenerowana karta tytułowa z napisem „Clef vs MathForm-8B”, podtytułem „jeden odpowiada na twoje pytanie, drugi pisze dowód” i plakietkami o treści „oba na Apache 2.0” oraz „dwa modele Qwen po fine-tuningu”. Logo OrcaRouter jest wkomponowane w prawym dolnym rogu.
Engineering & Research

Clef vs MathForm-8B: Jeden odpowiada na Twoje pytanie, drugi pisze dowód

Autor

Elias Hawthorne

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele →
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Powód, dla którego należy umieścić Cloudflare/clef obok openbmb/MathForm-8B jest taki, że to obecnie dwie najłatwiej mylone rzeczy w otwartych wagach, a pomylenie ich kosztuje jeden przebieg treningowy. Oba to dostrojone modele zbudowane odpowiednio na checkpointach Qwen3.8-27B i Qwen3-8B. Oba są na licencji Apache-2.0. Oba zostały opublikowane w ciągu ostatnich dziesięciu tygodni. Oba są wąskie, zbudowane do konkretnego celu i opisywane przez twórców jako specjalistyczne, a nie ogólne. I nie mają ze sobą absolutnie nic wspólnego, ponieważ jeden zwraca liczbę wybraną z listy, którą dostarczyłeś, a drugi generuje kod źródłowy Lean 4, token po tokenie, do sprawdzenia przez asystenta dowodzenia.

Clef to multimodalny model decyzyjny Cloudflare o 27 miliardach parametrów: podajesz mu stan i schemat typowanych pytań, a on zwraca skalibrowane prawdopodobieństwo dla każdej dozwolonej odpowiedzi w jednym nieautoregresyjnym przebiegu, bez żadnego generowania tekstu na żadnym etapie ścieżki. MathForm-8B od OpenBMB to model autoformalizacji — matematyczne zdanie w języku naturalnym trafia na wejście, Lean 4 wychodzi na wyjściu, a potok, który go trenował, opisano w preprincie arXiv opublikowanym wraz z wagami 14 sierpnia 2026 r. Górną granicą jednego modelu jest rozmiar twojej listy opcji. Górną granicą drugiego jest siła teorii typów Lean. Pytanie, który jest lepszy, to błąd kategorii, a fakt, że oba są dostrojeniami otwartych wag Apache-2.0 o ośmiu do dwudziestu siedmiu miliardach parametrów, jest dokładnie tym, co sprawia, że ten błąd łatwo popełnić.

Czego fizycznie zabrania interfejs każdego modelu

Najszybszym sposobem dostrzeżenia podziału jest przeczytanie, co każde z nich może zwrócić.

• Dane wejściowe — Clef przyjmuje stan (tekst, JSON, obrazy lub klatki wideo) oraz od 1 do 64 nazwanych pytań z określonym typem; MathForm-8B przyjmuje sformułowanie matematyczne w języku naturalnym.

• Dane wyjściowe — Clef zwraca jedno prawdopodobieństwo na każdą dozwoloną opcję, po zastosowaniu softmaxu dla każdego pytania. MathForm-8B zwraca kod źródłowy w Lean 4.

• Typy pytań — Clef ma noul (prawda/fałsz, z prawdopodobieństwem prawdy), wybór (od 2 do 26 nazwanych opcji) i ocena (od 2 do 26 uporządkowanych poziomów); MathForm-8B nie ma w ogóle pojęcia pytania.

• Kalibracja — Clef publikuje pole pewności dla każdej odpowiedzi; MathForm-8B publikuje wskaźniki Pass@8 w ramach kontroli składni i spójności.

• Udostępnianie — Clef jest obsługiwany przez zgodne z Jev/SystemOne POST /v1/systemone ciało, hostowane lub samodzielnie uruchamiane; MathForm-8B jest dostarczany z instrukcjami dla Transformers, vLLM i SGLang, z których wszystkie udostępniają punkt końcowy uzupełnień zgodny z OpenAI przy kontekście 16 384 tokenów z max_new_tokens ustawionym na 16 384.

Praktyczna konsekwencja jest natychmiastowa. Jeśli potrzebujesz oceny tak/nie dotyczącej fragmentu tekstu, Clef jest jedynym z tych dwóch, który może ją wydać — nie ma sposobu, aby zadać MathForm-8B pytanie, które nie brzmi: „napisz Lean 4 dla tego”. Jeśli potrzebujesz Lean 4, Clef jest jedynym z tych dwóch, który kategorycznie nie może go wygenerować, i nie wynika to ze słabości: proszenie oceniającego ograniczonego schematem o sformalizowanie twierdzenia nie mieści się w jego kontrakcie, więc prośba jest odrzucana z samej konstrukcji, a nie kończy się złą odpowiedzią.

A two-column comparison scoreboard titled 'Clef vs MathForm-8B — the scoreboard'. The left column 'Clef' reads: Parameters: 27B multimodal; Trained from: Qwen3.8-27B; Output: probability per option, no text; Context: 65,536 tokens; Interface: /v1/systemone, 1 to 64 typed questions; Evidence: vendor run, unreproduced. The right column 'MathForm-8B' reads: Parameters: 8B text-only; Trained from: Qwen3-8B; Output: Lean 4 source code; Context: 16,384 tokens; Interface: OpenAI-compatible completion; Evidence: paper, Pass@8 88.06% SC, 72.37% CC. A footer reads 'Clef figures per Cloudflare; MathForm figures per OpenBMB's paper. Neither independently reproduced.' The OrcaRouter logo is composited in the bottom-right corner.

Pipeline, do którego należą oboje

Istnieje rzeczywista architektura, w której te dwa modele są umieszczone obok siebie, i warto ją prześledzić, ponieważ czyni ona ten podział konkretnym, a nie abstrakcyjnym. Rozważmy usługę, która formalizuje matematykę dla badaczy i studentów.

Stwierdzenia przychodzą w języku naturalnym, nieograniczone pod względem rodzaju. Zanim cokolwiek można sformalizować, coś musi zdecydować, co napłynęło. Czy to twierdzenie do udowodnienia, definicja do dodania, prośba o sprawdzenie istniejącego dowodu, czy pytanie wymagające doprecyzowania, zanim ktokolwiek dotknie Lean? Czy jest samowystarczalne, czy opiera się na kontekście, którego użytkownik nie dostarczył? Czy symbole są konwencjonalne, czy to notacja, której system nigdy nie widział? Każde z tych pytań jest pytaniem o ograniczonym zakresie, z niewielkim zestawem opcji — dokładnie taki kształt ma Clef — a skalibrowane prawdopodobieństwo przypisane do każdej odpowiedzi pozwala usłudze zrobić coś sensownego z niepewnymi przypadkami: skierować wszystko poniżej progu do człowieka, zamiast zgadywać.

Drugi krok należy do MathForm-8B. Weź stwierdzenie, które zostało już sklasyfikowane jako samodzielne twierdzenie o znanej notacji, i wygeneruj kod w Lean 4. To problem generowania, a kwestia jakości dotyczy tego, jak często wynik się kompiluje i jak często znaczy to samo co oryginał — co jest dokładnie tym, co mierzą dwie osie oceny dostawcy. To ogólny wzorzec wart wyodrębnienia z tego połączenia: tani klasyfikator o ograniczonym zakresie przed drogim wyspecjalizowanym generatorem jest zwykle tańszy i bardziej niezawodny niż zachęcanie generatora do decydowania, czy w ogóle powinien działać.

Co tak naprawdę mierzą liczby po każdej stronie

W abstrakcie arXiv firmy OpenBMB podano, że MathForm-8B osiąga średnie wskaźniki Pass@8 na poziomie 88,06% w ramach Syntax Check i 72,37% w ramach Consistency Check w sześciu zestawach testowych, a na podzbiorach FATE-H i FATE-X uzyskuje wskaźniki zaliczenia testu spójności wynoszące 63% i 37%, oba powyżej najsilniejszych wyspecjalizowanych modeli bazowych porównywanych w artykule. Najciekawszą częścią tego twierdzenia jest potok treningowy: planer wyszukiwania przed generowaniem wydobywa z Mathlib odpowiednie definicje i istniejące formalizacje, a wygenerowane stwierdzenia są następnie korygowane na podstawie diagnostyki kompilatora i informacji zwrotnej o spójności semantycznej — w ten sposób zbudowano zestaw danych FormalVerse zawierający około 367 000 zweryfikowanych przykładów Lean 4 przed nadzorowanym dostrajaniem i uczeniem ze wzmocnieniem. Są to wartości raportowane przez dostawcę, pochodzące z artykułu i karty modelu. Nikt niezależny ich nie powtórzył.

Liczby Clefa mierzą coś zupełnie innego i nie są porównywalne. Przebieg Decision Index Cloudflare raportuje makro-F1 intencji BANKING77 na poziomie 94,2, CLINC150 z obsługą przypadków poza zakresem na poziomie 97,4, GPQA Diamond na poziomie 48,0 — gdzie starszy Jev osiąga 78,3 — oraz medianę opóźnienia żądania wynoszącą 209,3 ms. To tabela dotycząca klasyfikacji i routingu, wygenerowana przez dostawcę na jego własnym zestawie testowym, hostowana na własnej tablicy wyników dostawcy i nieodtworzona.

Jedno uczciwe zdanie, jakie można napisać o tych dwóch kolumnach, jest takie, że nie łączy ich żaden benchmark, żadna jednostka ani żadna filozofia oceny. 37% MathForm-8B na trudnym podzbiorze formalizacji i 97,4 Clef w wykrywaniu intencji spoza zakresu to prawdziwe twierdzenia ich twórców o różnych zadaniach, a czytelnik, który je zestawi, nie dowiedział się niczego poza tym, że obie liczby istnieją.

Co byś uruchomił i ile to kosztuje

Żaden z modeli nie jest trasą w OrcaRouter, a ten artykuł nie zawiera żadnych twierdzeń o dostępności — katalog zwraca 404 dla cloudflare/clef i dla MathForm-8B. Repozytorium MathForm ma około 16,4 GB, a oba modele są objęte licencją Apache-2.0, więc oba mogą być samodzielnie hostowane już jutro przez każdego, kto ma odpowiedni sprzęt.

• Clef w Cloudflare — 0,24 USD za milion tokenów wejściowych w Workers AI, z opublikowanym opóźnieniem mierzonym na pojedynczym H200.

• MathForm-8B hostowany samodzielnie — brak hostingu u dostawcy, brak opłaty za token i udokumentowany kontekst 16 384 tokenów, co jest ograniczeniem wartym uwagi: długa sekcja artykułu nie zmieści się w jednym przebiegu.

• Alternatywa z routingiem dla części klasyfikatora — Jev 1.13 od TypeSafe w cenie 0,042 USD za milion tokenów wejściowych przy kontekście 65 536 tokenów, obsługiwana przez to samo POST /v1/systemone ciało, którego używa Clef, co czyni ją zamiennikiem typu drop-in dla pierwszego kroku powyższego potoku.

I tu właśnie warstwa routingu zasługuje na swoje miejsce w tym konkretnym zestawieniu. Wzorzec to decydent i generator, a połowa decyzyjna to ta z działającym zamiennikiem — jeden punkt końcowy przed ponad 200 modelami, cena katalogowa dostawcy przekazywana bez narzutu za token, a automatyczne przełączanie awaryjne, dzięki któremu zły dzień dostawcy nie zablokuje drzwi wejściowych twojego pipeline'u. Połowa generatora to artefakt o rozmiarze 16,4 GB, który uruchamiasz samodzielnie, i żaden punkt końcowy tego nie zmienia.

A headless capture of the openbmb/MathForm-8B model card on Hugging Face, showing the model title, the TextGeneration, Transformers and Safetensors tags, a link to the openbmb/FormalVerse dataset, the English language marker, and the qwen3, lean4, autoformalization, mathematics, formal-verification and reasoning subject tags.

Jeszcze jedna rzecz, którą ukrywają rozmiary

Liczby parametrów skłaniają do porównania, które nie jest zasadne. Clef ma 27B, a MathForm-8B ma 8B, więc naturalne jest założenie, że większy model jest zdolniejszy, a mniejszy jest specjalistą. Jest odwrotnie, jeśli chodzi o naturę. Clef jest duży, ponieważ zawiera zamrożony multimodalny backbone, którego potrzebuje do odczytywania zrzutów ekranu i faktur; trenowana część na wierzchu to niewielka głowica schematu z adapterami o randze 256. MathForm-8B jest mały, ponieważ Lean 4 to wąski cel, a baza Qwen3-8B wystarczyła, by go osiągnąć; prawdziwa inżynieria tkwi w potoku wyszukiwania i weryfikacji, który wytworzył jego dane treningowe, a nie w liczbie jego parametrów.

Rozmiar, innymi słowy, mówi ci, co każdy model musiał dźwigać, a nie jak trudny jest problem, który rozwiązuje. Model 27B, który czyta paragon i zwraca „billing, 0.98”, oraz model 8B, który generuje kompilowalny Lean, robią dokładnie to, do czego zostały stworzone, a ujęcie „osiem miliardów kontra dwadzieścia siedem miliardów” w około połowie przypadków doprowadzi cię do wybrania niewłaściwego modelu.

A headless capture of the OrcaRouter model page for typesafe/jev-1.13, showing the TypeSafe breadcrumb, the Jev 1.13 title, text input and output modality labels, a p50 TTFT latency figure, the Performance and Public benchmarks tabs, and the code-sample panel.

Decyzja i pytanie, na które nie odpowiedział żaden z dostawców

Jeśli masz potok, który przyjmuje nieograniczony język naturalny i musi go skierować, zanim przeznaczy na niego zasoby obliczeniowe, pierwszym krokiem jest ograniczony klasyfikator — Clef tam, gdzie liczy się jego multimodalne wejście i jego wyniki dobrze wyglądają na twoich danych, albo Jev 1.13 tam, gdzie chcesz ten sam kształt żądania w niższej cenie katalogowej i bez wiązania swojej architektury z dostawcą, którego ewaluacji nikt nie odtworzył. Drugim krokiem jest wyspecjalizowany generator, a jeśli tym generatorem jest Lean 4, MathForm-8B to otwarty model zbudowany dokładnie do tego, z opublikowanym potokiem i korpusem za nim.

Po obu stronach brakuje tego samego rodzaju dowodów. Test Decision Index firmy Clef został przeprowadzony przez sam Cloudflare i nigdy nie został niezależnie powtórzony; wyniki Pass@8 modelu MathForm-8B pochodzą z jego własnej pracy. Jedno i drugie to ambitne twierdzenia w dziedzinie, w której uczciwy test jest tani do opisania, a drogi do przeprowadzenia — weź dane, na których nie trenował żaden z dostawców, zastosuj ten sam potok i opublikuj wynik. Dopóki ktoś nie zrobi tego dla któregoś z tych modeli, użyteczna rzecz, jaką to porównanie może ci przekazać, to pewien kształt: jeden z nich należy na początek twojego potoku, decydując, co przychodzi, a drugi należy za nim, wykonując ciężką, wąską pracę, i żaden nie zastępuje drugiego przy żadnej liczbie parametrów.