
Clef vs MathForm-8B: Uno risponde alla tua domanda, l'altro scrive una dimostrazione
- openaiNUOVOOpenAI: GPT-6.1 Sol2026-09-2952Intelligenza
- anthropicNUOVOAnthropic: Claude Sonnet 5.52026-09-2856Intelligenza
- typesafeNUOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M di token · 219 tok/s
- OpenAINUOVOOpenAI: GPT-6 Luna2026-09-2238Intelligenza
- OpenAINUOVOOpenAI: GPT-6 Sol2026-09-2248Intelligenza
- AnthropicNUOVOAnthropic: Claude Opus 5.52026-09-2258Intelligenza
- xAINUOVOGrok 4.72026-09-2146Intelligenza
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1M di token · 114 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token · 1064 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M di token · 41 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token · 105 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token · 213 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
Il motivo per cui mettere Cloudflare/clef accanto a openbmb/MathForm-8B è che sono le due cose più facilmente confondibili negli open weights in questo momento, e confonderle costa un ciclo di addestramento. Entrambi sono fine-tune basati rispettivamente sui checkpoint Qwen3.8-27B e Qwen3-8B. Entrambi sono Apache-2.0. Entrambi sono stati pubblicati nelle ultime dieci settimane. Entrambi sono ristretti, progettati per uno scopo specifico e descritti dai loro creatori come specializzati anziché generali. E non hanno assolutamente nulla a che fare l'uno con l'altro, perché uno produce un numero selezionato da un elenco che hai fornito e l'altro produce codice sorgente Lean 4, token per token, affinché un assistente di dimostrazione lo verifichi.
Clef è il modello decisionale multimodale da 27 miliardi di parametri di Cloudflare: gli si fornisce uno stato e uno schema di domande tipizzate, e restituisce una probabilità calibrata per ogni risposta consentita in un'unica passata non autoregressiva, senza alcuna generazione di testo in nessun punto del percorso. MathForm-8B, di OpenBMB, è un modello di autoformalizzazione — entra un enunciato matematico in linguaggio naturale, esce Lean 4, e la pipeline che lo ha addestrato è descritta in un preprint arXiv pubblicato insieme ai pesi il 14 agosto 2026. Il tetto di un modello è la dimensione del tuo elenco di opzioni. Il tetto dell'altro è la solidità della teoria dei tipi di Lean. Chiedere quale sia migliore è un errore di categoria, e il fatto che entrambi siano fine-tune open-weights con licenza Apache-2.0 da otto a ventisette miliardi di parametri è esattamente ciò che rende l'errore facile da commettere.
Ciò che l'interfaccia di ciascun modello vieta fisicamente
Il modo più veloce per vedere la divisione è leggere ciò che ciascuno può restituire.
• Input — Clef accetta uno stato (testo, JSON, immagini o fotogrammi video) più da 1 a 64 domande tipizzate e denominate; MathForm-8B accetta un enunciato matematico in linguaggio naturale.
• Output — Clef restituisce una probabilità per ogni opzione consentita, con softmax per domanda. MathForm-8B restituisce codice sorgente Lean 4.
• Tipi di domanda — quelli di Clef sono booleano (vero/falso, con la probabilità di vero), scelta (da 2 a 26 opzioni denominate) e punteggio (da 2 a 26 livelli ordinati); MathForm-8B non ha alcun concetto di domanda.
• Calibrazione — Clef pubblica un campo di confidenza per ogni risposta; MathForm-8B pubblica tassi Pass@8 sottoposti a controlli di sintassi e coerenza.
• Erogazione — Clef viene servito tramite un corpo POST /v1/systemone compatibile con Jev/SystemOne, ospitato o eseguito autonomamente; MathForm-8B viene fornito con istruzioni per Transformers, vLLM e SGLang, tutti che espongono un endpoint di completamento compatibile con OpenAI con un contesto di 16.384 token e max_new_tokens impostato a 16.384.
La conseguenza pratica salta subito all'occhio. Se ti serve un giudizio sì/no su un frammento di testo, Clef è l'unico dei due in grado di produrlo — non c'è modo di porre a MathForm-8B una domanda che non sia «scrivi il Lean 4 per questo». Se ti serve Lean 4, Clef è l'unico dei due che categoricamente non può produrlo, e non per debolezza: chiedere a un valutatore vincolato a uno schema di formalizzare un teorema non rientra nel suo contratto, quindi la richiesta viene rifiutata per costruzione anziché ricevere una cattiva risposta.

La pipeline a cui appartengono entrambi
Esiste un'architettura reale in cui questi due modelli sono affiancati, e vale la pena esaminarla perché rende la separazione concreta anziché astratta. Si consideri un servizio che formalizza la matematica per ricercatori e studenti.
Gli enunciati arrivano in linguaggio naturale, senza limiti di tipo. Prima che qualsiasi cosa possa essere formalizzata, qualcosa deve decidere che cosa è arrivato. È un teorema da dimostrare, una definizione da aggiungere, una richiesta di verificare una dimostrazione esistente, o una domanda che necessita di chiarimenti prima che qualcuno tocchi Lean? È autosufficiente, oppure si basa su un contesto che l'utente non ha fornito? I simboli sono convenzionali, o si tratta di una notazione che il sistema non ha mai visto? Ognuna di queste è una domanda delimitata con un piccolo insieme di opzioni — la forma esatta di Clef — e la probabilità calibrata associata a ciascuna risposta è ciò che consente al servizio di fare qualcosa di sensato con quelle incerte: instradare tutto ciò che è al di sotto di una soglia a una persona invece di tirare a indovinare.
Il secondo passo appartiene a MathForm-8B. Prendi un'affermazione che è già stata classificata come un teorema autocontenuto con notazione nota ed emetti il Lean 4. Questa è una generazione, e la domanda sulla qualità è quanto spesso l'output compila e quanto spesso significa la stessa cosa dell'originale — che è precisamente ciò che misurano i due assi di valutazione del fornitore. Questo è il modello generale che vale la pena estrarre dall'accoppiamento: un classificatore economico e limitato davanti a un generatore specializzato costoso è di solito più economico e più affidabile che sollecitare il generatore a decidere se dovrebbe essere in esecuzione o meno.
Cosa misurano effettivamente i numeri su ciascun lato
L'abstract arXiv di OpenBMB riporta che MathForm-8B raggiunge tassi medi Pass@8 dell'88,06% con Syntax Check e del 72,37% con Consistency Check su sei benchmark, e che sui subset FATE-H e FATE-X ottiene tassi di superamento della consistenza del 63% e del 37%, entrambi al di sopra delle baseline specializzate più forti con cui il paper si confronta. La pipeline di addestramento è la parte interessante dell'affermazione: un pianificatore di retrieval estrae definizioni rilevanti e formalizzazioni esistenti da Mathlib prima della generazione, e le affermazioni generate vengono poi riviste usando la diagnostica del compilatore e il feedback di consistenza semantica; è così che è stato costruito il dataset FormalVerse di circa 367.000 esempi Lean 4 verificati, prima del fine-tuning supervisionato e dell'apprendimento per rinforzo. Queste sono cifre dichiarate dal fornitore, provenienti da un paper e da una model card. Nessun soggetto indipendente le ha riprodotte.
I numeri di Clef misurano qualcosa di completamente diverso e non sono comparabili. L'esecuzione del Decision Index di Cloudflare riporta un macro-F1 delle intent di BANKING77 pari a 94.2, CLINC150 con gestione out-of-scope a 97.4, GPQA Diamond a 48.0 — dove il più vecchio Jev segna 78.3 — e una latenza mediana delle richieste di 209.3 ms. È una tabella su classificazione e routing, prodotta dal fornitore sulla suite del fornitore stesso, ospitata sulla leaderboard del fornitore stesso e non riprodotta.
L'unica frase onesta da scrivere su queste due colonne è che non condividono alcun benchmark, alcuna unità di misura né alcuna filosofia di valutazione. Il 37% di MathForm-8B su un sottoinsieme difficile di formalizzazione e il 97,4 di Clef sul rilevamento di intenti fuori ambito sono entrambi affermazioni reali dei loro creatori riguardo a lavori diversi, e un lettore che li mette a confronto non ha imparato nulla se non che entrambi i numeri esistono.
Cosa eseguiresti, e quanto costa
Nessuno dei due modelli è una route su OrcaRouter, e questo articolo non avanza alcuna dichiarazione di disponibilità — il catalogo restituisce un 404 per cloudflare/clef e per MathForm-8B. Il repository MathForm misura circa 16,4 GB, ed entrambi i modelli sono Apache-2.0, quindi entrambi possono essere ospitati autonomamente domani da chiunque disponga dell'hardware.
• Clef su Cloudflare — 0,24 $ per milione di token di input su Workers AI, con la latenza pubblicata misurata su un singolo H200.
• MathForm-8B self-hosted — nessun hosting di fornitori, nessun prezzo per token e un contesto documentato di 16.384 token, che è un vincolo che vale la pena notare: una lunga sezione di un paper non entrerà in una sola passata.
• L'alternativa instradata per la metà del classificatore — Jev 1.13 di TypeSafe a $0,042 per milione di token di input su un contesto di 65.536 token, servita attraverso lo stesso POST /v1/systemone che Clef usa come corpo, il che la rende un sostituto diretto per il primo passo della pipeline sopra.
È qui che un livello di routing si guadagna il suo posto in questo particolare abbinamento. Il pattern è un decisore e un generatore, e la metà decisore è quella con un sostituto attivo — un endpoint davanti a oltre 200 modelli, prezzo di listino del provider passato tal quale senza alcun ricarico per token, e failover automatico, così che un pomeriggio no di un provider non blocchi la porta d'ingresso della tua pipeline. La metà generatore è un artefatto da 16,4 GB che esegui tu stesso, e nessun endpoint cambia questo.

Un'altra cosa che le taglie nascondono
Il numero di parametri invita a un confronto che non regge. Clef è 27B e MathForm-8B è 8B, quindi è naturale supporre che il modello più grande sia quello più capace e quello più piccolo sia lo specialista. È il contrario per natura. Clef è grande perché porta con sé un backbone multimodale congelato di cui ha bisogno per leggere screenshot e fatture; la parte addestrata al di sopra è una piccola testa di schema con adapter di rango 256. MathForm-8B è piccolo perché Lean 4 è un obiettivo ristretto e la base Qwen3-8B è bastata per centrarlo, con la vera ingegneria che risiede nella pipeline di retrieval e verifica che ha prodotto i suoi dati di addestramento anziché nel suo numero di parametri.
Le dimensioni, in altre parole, ti dicono che cosa ciascun modello ha dovuto portare, non quanto sia difficile il problema che risolve. Un 27B che legge una ricevuta e restituisce "billing, 0.98" e un 8B che genera Lean compilabile fanno entrambi esattamente ciò per cui sono stati costruiti, e l'impostazione otto miliardi contro ventisette miliardi ti porterà a scegliere quello sbagliato circa la metà delle volte.

La decisione, e la domanda a cui nessuno dei due fornitori ha risposto
Se hai una pipeline che ingerisce linguaggio naturale illimitato e deve instradarlo prima di spendere potenza di calcolo, il primo passo è un classificatore limitato — Clef, dove il suo input multimodale conta e i suoi numeri sono buoni sui tuoi dati, oppure Jev 1.13, dove vuoi la stessa forma di richiesta a un prezzo di listino inferiore e senza legare la tua architettura a un fornitore la cui valutazione nessuno ha replicato. Il secondo passo è un generatore specializzato, e se quel generatore è Lean 4, MathForm-8B è il modello aperto costruito esattamente per questo, con una pipeline pubblicata e un corpus alle spalle.
Ciò che manca da entrambe le parti è lo stesso tipo di prove. L'esecuzione del Decision Index di Clef è di Cloudflare e non è mai stata ripetuta in modo indipendente; i dati Pass@8 di MathForm-8B provengono dal suo stesso paper. Entrambe sono affermazioni ambiziose in un ambito in cui il test onesto è economico da descrivere e costoso da eseguire — prendi dati su cui nessuno dei due fornitori ha addestrato, applica la stessa pipeline e pubblica il risultato. Finché qualcuno non lo farà per l'uno o per l'altro modello, la cosa utile che questo confronto può dirti è una forma: uno di questi appartiene all'inizio della tua pipeline, a decidere cosa arriva, e l'altro appartiene dietro di essa, a svolgere il lavoro duro e ristretto, e nessuno dei due è un sostituto dell'altro a qualsiasi numero di parametri.
