Una tarjeta de título generada que dice «Clef vs MathForm-8B», con el subtítulo «uno responde a tu pregunta, el otro escribe una demostración», con etiquetas que dicen «Apache 2.0 en ambos» y «dos ajustes finos de Qwen». El logotipo de OrcaRouter está compuesto en la esquina inferior derecha.
Engineering & Research

Clef vs MathForm-8B: Uno responde a tu pregunta, el otro escribe una demostración

Autor

Elias Hawthorne

Fecha de publicación

Últimos modelos · 20Ver todos los modelos →
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

La razón para poner Cloudflare/clef junto a openbmb/MathForm-8B es que son las dos cosas más fáciles de confundir en el ámbito de los pesos abiertos ahora mismo, y confundirlas cuesta una ejecución de entrenamiento. Ambos son ajustes finos construidos sobre los checkpoints Qwen3.8-27B y Qwen3-8B, respectivamente. Ambos son Apache-2.0. Ambos se publicaron en las últimas diez semanas. Ambos son acotados, creados para un propósito específico, y descritos por sus creadores como especializados en lugar de generales. Y no tienen absolutamente nada que ver el uno con el otro, porque uno produce un número seleccionado de una lista que proporcionaste y el otro produce código fuente de Lean 4, token por token, para que un asistente de pruebas lo verifique.

Clef es el modelo multimodal de decisión de 27 mil millones de parámetros de Cloudflare: le das un estado y un esquema de preguntas tipadas, y devuelve una probabilidad calibrada para cada respuesta permitida en una sola pasada no autorregresiva, sin generación de texto en ningún punto del proceso. MathForm-8B, de OpenBMB, es un modelo de autoformalización: entra un enunciado matemático en lenguaje natural, sale Lean 4, y el pipeline que lo entrenó se describe en un preprint de arXiv publicado junto con los pesos el 14 de agosto de 2026. El techo de un modelo es el tamaño de tu lista de opciones. El techo del otro es la fuerza de la teoría de tipos de Lean. Preguntar cuál es mejor es un error de categoría, y el hecho de que ambos sean fine-tunes de pesos abiertos Apache-2.0 de entre ocho y veintisiete mil millones de parámetros es exactamente lo que hace fácil cometer el error.

Lo que la interfaz de cada modelo prohíbe físicamente

La forma más rápida de ver la división es leer lo que cada uno puede devolver.

• Entrada — Clef recibe un estado (texto, JSON, imágenes o fotogramas de vídeo) más de 1 a 64 preguntas con nombre y tipo; MathForm-8B recibe un enunciado matemático en lenguaje natural.

• Salida — Clef devuelve una probabilidad por opción permitida, con softmax aplicado por pregunta. MathForm-8B devuelve código fuente de Lean 4.

• Tipos de pregunta — los de Clef son noul (verdadero/falso, con la probabilidad de ser verdadero), choice (2 a 26 opciones con nombre) y score (2 a 26 niveles ordenados); MathForm-8B no tiene ningún concepto de pregunta en absoluto.

• Calibración — Clef publica un campo de confianza por respuesta; MathForm-8B publica tasas de Pass@8 bajo comprobaciones de sintaxis y consistencia.

• Servicio — Clef se sirve mediante un cuerpo POST /v1/systemone compatible con Jev/SystemOne, alojado o autoalojado; MathForm-8B se distribuye con instrucciones para Transformers, vLLM y SGLang, todos los cuales exponen un endpoint de completado compatible con OpenAI en un contexto de 16.384 tokens con max_new_tokens establecido en 16.384.

La consecuencia práctica es inmediata. Si necesitas un juicio de sí/no sobre un fragmento de texto, Clef es el único de los dos que puede producirlo — no hay forma de hacerle a MathForm-8B una pregunta que no sea «escribe el Lean 4 para esto». Si necesitas Lean 4, Clef es el único de los dos que categóricamente no puede producirlo, y no por debilidad: pedirle a un evaluador vinculado a un esquema que formalice un teorema no encaja en su contrato, por lo que la solicitud se rechaza por construcción en lugar de responderse mal.

A two-column comparison scoreboard titled 'Clef vs MathForm-8B — the scoreboard'. The left column 'Clef' reads: Parameters: 27B multimodal; Trained from: Qwen3.8-27B; Output: probability per option, no text; Context: 65,536 tokens; Interface: /v1/systemone, 1 to 64 typed questions; Evidence: vendor run, unreproduced. The right column 'MathForm-8B' reads: Parameters: 8B text-only; Trained from: Qwen3-8B; Output: Lean 4 source code; Context: 16,384 tokens; Interface: OpenAI-compatible completion; Evidence: paper, Pass@8 88.06% SC, 72.37% CC. A footer reads 'Clef figures per Cloudflare; MathForm figures per OpenBMB's paper. Neither independently reproduced.' The OrcaRouter logo is composited in the bottom-right corner.

El pipeline al que pertenecen ambos

Existe una arquitectura real en la que estos dos modelos se sitúan uno junto al otro, y merece la pena recorrerla porque hace que la división sea concreta en lugar de abstracta. Pensemos en un servicio que formaliza las matemáticas para investigadores y estudiantes.

Los enunciados llegan en lenguaje natural, sin límite en cuanto a su tipo. Antes de que algo pueda formalizarse, algo tiene que decidir qué ha llegado. ¿Es un teorema que hay que demostrar, una definición que añadir, una solicitud para revisar una demostración existente o una pregunta que necesita aclaración antes de que alguien toque Lean? ¿Es autónomo o se apoya en contexto que el usuario no proporcionó? ¿Son convencionales los símbolos, o es esta una notación que el sistema nunca ha visto? Cada una de esas es una pregunta acotada con un pequeño conjunto de opciones —la forma exacta de Clef—, y la probabilidad calibrada asociada a cada respuesta es lo que permite que el servicio haga algo sensato con las inciertas: derivar cualquier cosa por debajo de un umbral a una persona en lugar de adivinar.

El segundo paso corresponde a MathForm-8B. Toma un enunciado que ya se haya clasificado como un teorema autocontenido con notación conocida y emite el Lean 4. Eso es un problema de generación, y la cuestión de calidad es con qué frecuencia la salida compila y con qué frecuencia significa lo mismo que el original — que es precisamente lo que miden los dos ejes de evaluación del proveedor. Este es el patrón general que vale la pena extraer del emparejamiento: un clasificador acotado y barato delante de un generador especializado y caro suele ser más barato y más fiable que pedirle al generador que decida si debería estar ejecutándose siquiera.

Qué miden realmente los números de cada lado

El resumen de arXiv de OpenBMB informa que MathForm-8B alcanza tasas medias de Pass@8 del 88,06 % bajo Syntax Check y del 72,37 % bajo Consistency Check en seis benchmarks, y que en los subconjuntos FATE-H y FATE-X logra tasas de aprobación de consistencia del 63 % y el 37 %, ambas por encima de las líneas base especializadas más fuertes con las que el artículo compara. La parte interesante de la afirmación es el pipeline de entrenamiento: un planificador de recuperación extrae definiciones relevantes y formalizaciones existentes de Mathlib antes de la generación, y luego las declaraciones generadas se revisan utilizando diagnósticos del compilador y retroalimentación de consistencia semántica, que es como se construyó el conjunto de datos FormalVerse de aproximadamente 367.000 ejemplos verificados de Lean 4 antes del ajuste fino supervisado y el aprendizaje por refuerzo. Estas son cifras reportadas por el proveedor, procedentes de un artículo y una model card. Nadie independiente las ha vuelto a ejecutar.

Los números de Clef miden algo completamente distinto y no son comparables. La ejecución del Decision Index de Cloudflare reporta un macro-F1 de intención de BANKING77 de 94.2, CLINC150 con manejo de fuera de alcance de 97.4, GPQA Diamond en 48.0 —donde el Jev anterior obtiene 78.3— y una latencia mediana de solicitud de 209.3 ms. Es una tabla sobre clasificación y enrutamiento, producida por el proveedor con el propio conjunto de pruebas del proveedor, alojada en la propia tabla de clasificación del proveedor, y sin reproducir.

La única frase honesta que puede escribirse sobre estas dos columnas es que no comparten ningún benchmark, ninguna unidad ni ninguna filosofía de evaluación. El 37 % de MathForm-8B en un subconjunto difícil de formalización y el 97,4 de Clef en detección de intenciones fuera de alcance son afirmaciones reales de sus creadores sobre trabajos distintos, y quien las pone una junto a otra no ha aprendido nada salvo que ambos números existen.

Lo que ejecutarías y lo que cuesta

Ninguno de los dos modelos es una ruta en OrcaRouter, y este artículo no hace ninguna afirmación sobre su disponibilidad: el catálogo devuelve un 404 para cloudflare/clef y para MathForm-8B. El repositorio de MathForm ocupa unos 16,4 GB, y ambos modelos son Apache-2.0, por lo que cualquiera que tenga el hardware necesario puede autoalojarlos mañana mismo.

• Clef en Cloudflare — $0.24 por millón de tokens de entrada en Workers AI, con la latencia publicada medida en un solo H200.

• MathForm-8B autoalojado — sin alojamiento de proveedor, sin precio por token y un contexto documentado de 16.384 tokens, lo cual es una limitación que vale la pena tener en cuenta: una sección extensa de un artículo no cabrá en una sola pasada.

• La alternativa enrutada para la mitad del clasificador — Jev 1.13 de TypeSafe a $0.042 por millón de tokens de entrada en un contexto de 65,536 tokens, servida a través del mismo cuerpo POST /v1/systemone que usa Clef, lo que la convierte en un reemplazo directo para el primer paso del pipeline anterior.

Ahí es donde una capa de enrutamiento se gana su lugar en este emparejamiento en particular. El patrón es un decisor y un generador, y la mitad decisora es la que tiene un sustituto en vivo: un único endpoint frente a más de 200 modelos, precio de lista del proveedor transferido sin margen por token, y conmutación por error automática para que una mala tarde de un proveedor no bloquee la puerta de entrada de tu pipeline. La mitad generadora es un artefacto de 16,4 GB que ejecutas tú mismo, y ningún endpoint cambia eso.

A headless capture of the openbmb/MathForm-8B model card on Hugging Face, showing the model title, the TextGeneration, Transformers and Safetensors tags, a link to the openbmb/FormalVerse dataset, the English language marker, and the qwen3, lean4, autoformalization, mathematics, formal-verification and reasoning subject tags.

Una cosa más que los tamaños ocultan

El recuento de parámetros invita a una comparación que no se sostiene. Clef tiene 27B y MathForm-8B tiene 8B, así que es natural suponer que el modelo más grande es el más capaz y que el más pequeño es el especialista. En cuanto a su naturaleza, ocurre lo contrario. Clef es grande porque lleva una columna vertebral multimodal congelada que necesita para leer capturas de pantalla y facturas; la parte entrenada que lleva encima es una pequeña cabeza de esquema con adaptadores de rango 256. MathForm-8B es pequeño porque Lean 4 es un objetivo estrecho y la base Qwen3-8B bastó para alcanzarlo, con la ingeniería real en el pipeline de recuperación y verificación que produjo sus datos de entrenamiento, más que en su número de parámetros.

El tamaño, en otras palabras, te dice lo que cada modelo tuvo que cargar, no cuán difícil es el problema que resuelve. Un 27B que lee un recibo y devuelve «facturación, 0.98» y un 8B que emite Lean compilable están ambos haciendo exactamente aquello para lo que fueron creados, y el planteamiento de ocho mil millones frente a veintisiete mil millones te llevará al equivocado aproximadamente la mitad de las veces.

A headless capture of the OrcaRouter model page for typesafe/jev-1.13, showing the TypeSafe breadcrumb, the Jev 1.13 title, text input and output modality labels, a p50 TTFT latency figure, the Performance and Public benchmarks tabs, and the code-sample panel.

La decisión, y la pregunta que ningún proveedor ha respondido

Si tienes un pipeline que ingiere lenguaje natural no acotado y necesitas enrutarlo antes de gastar cómputo en él, el primer movimiento es un clasificador acotado — Clef donde su entrada multimodal importa y sus números se ven bien en tus datos, o Jev 1.13 donde quieres la misma forma de solicitud a un precio de lista más bajo y sin atar tu arquitectura a un proveedor cuya evaluación nadie ha reproducido. El segundo movimiento es un generador especialista, y si ese generador es Lean 4, MathForm-8B es el modelo abierto construido exactamente para eso, con un pipeline publicado y un corpus detrás.

Lo que falta en ambos lados es el mismo tipo de evidencia. La ejecución del Decision Index de Clef es la de Cloudflare y nunca se ha replicado de forma independiente; las cifras de Pass@8 de MathForm-8B provienen de su propio artículo. Ambas son afirmaciones ambiciosas en un área donde la prueba honesta es barata de describir y cara de ejecutar —tomar datos con los que ninguno de los proveedores entrenó, aplicar el mismo pipeline y publicar el resultado. Hasta que alguien haga eso para cualquiera de los dos modelos, lo útil que esta comparación puede decirte es una forma: uno de estos pertenece al frente de tu pipeline, decidiendo qué llega, y el otro pertenece detrás de él, haciendo el trabajo duro y acotado, y ninguno sustituye al otro sea cual sea el número de parámetros.