Una tarjeta de título generada encabezada por 'TwIL-LM3-Pro vs MathForm 8B', subtitulada 'Enunciado vs Implicación', con dos tarjetas redondeadas que dicen 'MathForm 8B - emite el enunciado de Lean 4' y 'TwIL-LM3-Pro - juzga el enunciado'. El logotipo de OrcaRouter está compuesto en la esquina inferior derecha.
Guides & Insights

TwIL-LM3-Pro vs MathForm 8B: Enunciado e implicación son dos mitades distintas de la formalización

Autor

Alistair Wren

Fecha de publicación

Últimos modelos · 20Ver todos los modelos →
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

TwIL-LM3-Pro y MathForm-8B apuntan al mismo problema general —lograr que una máquina produzca texto formal y verificable en lugar de prosa verosímil— y están resolviendo mitades distintas de él. MathForm-8B es el autoformalizador de 8 mil millones de parámetros de OpenBMB, publicado en agosto de 2026: dado un problema matemático en lenguaje natural, emite el enunciado en Lean 4 de ese problema, y deja la obligación de prueba abierta para que un compilador la verifique. TwIL-LM3-Pro es el modelo de lógica formal de 3,66B de webAI, de septiembre de 2026, y sus salidas objetivo son etiquetas de implicación, traducciones a lógica de primer orden, análisis semánticos y críticas de pruebas en Lean. Uno produce la cosa que hay que verificar. El otro te dice si la cosa que tienes implica lo que afirmas.

Como los dos se solapan en exactamente un carril —la formalización en Lean—, una página comparativa es tentadora y engañosa. La pregunta más útil es aquello por lo que se entrenó a cada uno para que recibiera recompensa, porque la señal de recompensa es donde ambos diseños divergen más acusadamente y donde reside en realidad la elección más inteligente.

Enunciado versus implicación

MathForm-8B se entrena con FormalVerse, un corpus de Lean 4 que el artículo de OpenBMB describe como aproximadamente 367.000 ejemplos verificados, mediante ajuste fino supervisado seguido de aprendizaje por refuerzo. El pipeline que lo rodea recupera definiciones relevantes y formalizaciones existentes de Mathlib antes de la generación, y luego refina usando diagnósticos del compilador y una comprobación de consistencia semántica. Su salida es un enunciado formal —importaciones, tipos, encabezado del teorema— que un compilador externo acepta o rechaza. La tarjeta del modelo es explícita en que no resuelve el problema ni pretende hacerlo; la demostración es tarea de otro.

TwIL-LM3-Pro aborda el mismo dominio desde el lado de la lógica. Su pipeline estaba orientado a seis objetivos: traducción de lógica de primer orden, etiquetado de implicación, análisis semántico, formalización en Lean, crítica de pruebas en Lean e inducción de reglas. Mientras que MathForm está construido para emitir un enunciado, TwIL-LM3-Pro está construido para hacer juicios sobre enunciados: ¿se sigue esto?, ¿es correcto este parseo?, ¿es sólido este intento de prueba? También formaliza, y ese es el único punto en el que los dos modelos son genuinamente comparables en lugar de meramente adyacentes.

Recompensa de un compilador frente a recompensa de un evaluador

Esta es la diferencia de diseño que importa, y ambos proveedores la documentan.

La recompensa de entrenamiento de MathForm provenía de la compilación en Lean y de la retroalimentación de consistencia semántica. Un compilador es un oráculo: o acepta la formalización o no lo hace, y no hay crédito parcial ni nada que discutir. Esa es la señal de recompensa más limpia en este rincón del aprendizaje automático, y es la razón por la que los benchmarks de autoformalización se reportan como tasas de aprobación: la métrica está aguas abajo de un programa al que no le importa lo que crea nadie.

La etapa final de TwIL-LM3-Pro fue una ejecución de GRPO ponderada por entropía contra un verificador programático, con la propia tarjeta del modelo describiendo crédito parcial para coincidencias laxas y token-F1, de modo que los grupos de prompts donde todo falló todavía produzcan gradiente. Su compuerta macro principal es la media de igual peso de cuatro carriles de clasificación acotados más inducción de reglas, y en esa compuerta los carriles de opción múltiple y procedimentales se acreditan como `max(exact_match, loose_match)` — una regla que la tarjeta establece claramente, porque una respuesta correcta formateada de manera diferente es un artefacto de formato en lugar de un fallo de razonamiento.

Ninguno de los dos diseños es peor. Están ajustados para consecuencias diferentes. Una recompensa calificada por un compilador produce un modelo al que puedes señalarle un problema de formalización difícil y confiar en su resultado, porque el resultado es verificable. Una recompensa calificada por un evaluador con crédito parcial produce un modelo que puede entrenarse con juicios más difusos —implicación, crítica, inducción de reglas— donde no existe un compilador que adjudique y la alternativa es no entrenar en esos carriles en absoluto. El costo es que los números resultantes son tan buenos como el arnés, y webAI lo dice: su fila strict-7, que elimina todo rastro de crédito por coincidencia flexible, existe precisamente para que un lector pueda ver la cifra más severa junto a la principal.

Las puntuaciones no están en la misma escala.

Ambos modelos publican cifras relacionadas con Lean y no se pueden restar. El artículo de MathForm reporta un Pass@8 promedio de 88,06 % en Syntax Check y 72,37 % en Consistency Check en seis benchmarks de Lean, con tasas de aprobación de Consistency Check del 63 % y 37 % en los subconjuntos más difíciles FATE-H y FATE-X, y afirma superar a varios autoformalizadores especializados de 32B. La tarjeta de TwIL-LM3-Pro reporta un token-F1 de `lean_formalize` de 0,5092 y una precisión de `lean_critic` de 0,7950 en su propio harness de Track A.

Pass@8 bajo una verificación del compilador y token-F1 frente a una cadena de referencia miden cosas diferentes. Pass@8 le da al modelo ocho intentos y pregunta si uno de ellos compiló y se mantuvo consistente; token-F1 puntúa qué tan cerca coincidió una única generación con una referencia. Un modelo puede obtener una buena puntuación en una y una mala en la otra, y nada en ninguno de los dos documentos autoriza a leerlas lado a lado.

El resumen honesto del registro de benchmark es que la evidencia de MathForm-8B proviene de un artículo con un compilador en el circuito y la de TwIL-LM3-Pro proviene de un arnés de proveedor con un evaluador en el circuito, y ninguna tercera parte ha pasado a ambos por una misma rúbrica. Considera cualquier página que ponga "88.06%" junto a "0.5092" como si se tratara de un marcador, como una página que no ha leído las definiciones.

Especificaciones, lado a lado

• Parámetros — TwIL-LM3-Pro 3,66B denso frente a MathForm-8B 8B, aproximadamente 2,2 veces el tamaño.

• Modelo base — `ibm-granite/granite-4.2-3b` vs `Qwen/Qwen3-8B`.

• Datos de entrenamiento — un corpus sintético de lógica formal que abarca seis objetivos frente a FormalVerse, aproximadamente 367.000 ejemplos verificados de Lean 4.

• Recompensa — un verificador programático con crédito parcial y tolerancia a coincidencias flexibles frente a la compilación de Lean y retroalimentación de consistencia semántica.

• Salida principal — etiquetas de implicación, traducciones a FOL, análisis semánticos, enunciados Lean y críticas de pruebas frente a un enunciado de Lean 4 para que un compilador lo verifique.

• Ventana de contexto — 131,072 tokens para TwIL-LM3-Pro, medida dentro de 8,192 tokens; MathForm-8B se sirve con presupuestos de generación de hasta 16,384 tokens en su propio ejemplo de uso.

• Licencia — webAI Non-Commercial License ver. 1.0 vs Apache 2.0.

• Tamaño cuantizado — TwIL-LM3-Pro incluye un GGUF Q4_K_M de 2,09 GiB para CPU o 4 GB de VRAM; MathForm-8B no publica ningún GGUF en su propio repositorio.

La licencia vuelve a decidir la cuestión de la producción.

MathForm-8B es Apache 2.0. Puedes ajustarlo, redistribuirlo y servirlo dentro de un producto comercial. TwIL-LM3-Pro no es comercial: se permiten la investigación y el uso personal, y el despliegue que genere ingresos requiere un acuerdo por separado con webAI, cuya vía comercial es un acuerdo empresarial en lugar de una lista de precios publicada.

Para un grupo de investigación o un estudiante, esa diferencia es irrelevante — ambas son descargas sin restricciones en Hugging Face. Para una empresa, es decisiva, y apunta a MathForm-8B para cualquier trabajo de autoformalización en producción, sin importar qué modelo obtenga mejores puntuaciones en un terreno que ninguno de los dos proveedores midió de la misma manera.

Dónde se sitúa un router en este pipeline

Ni TwIL-LM3-Pro ni MathForm-8B son una ruta en el catálogo de OrcaRouter, y las razones difieren: uno tiene licencia no comercial sin endpoint alojado, el otro se publica como un checkpoint abierto para autoalojamiento. La cuestión de enrutamiento en una canalización de formalización es la capa que los rodea. Construir un corpus al estilo FormalVerse significa generar miles de problemas informales, filtrarlos por buena formación y escribir las comprobaciones de consistencia semántica que evalúan la salida —todas llamadas de texto, y todo el tipo de trabajo en el que quieres cambiar el modelo que genera datos masivos por el modelo que los juzga sin un segundo contrato. En un endpoint compatible con OpenAI delante de más de 200 modelos al precio de lista del proveedor con 0 % de recargo añadido, esa sustitución es un cambio de configuración, y una reducción de precio del proveedor en el modelo de generación llega el mismo día. La conmutación automática por error es fundamental en una compilación de corpus específicamente porque un trabajo que muere a dos tercios de una pasada de generación cuesta toda la ejecución.

A generated two-column scoreboard headed 'TwIL-LM3-Pro vs MathForm 8B - the scoreboard' with six shared dimension rows. TwIL-LM3-Pro: Parameters 3.66B dense; Base granite-4.2-3b; Reward programmatic verifier; Primary output entailment and critiques; Context 131,072 tokens; Licence non-commercial. MathForm 8B: Parameters 8B; Base Qwen3-8B; Reward Lean compilation; Primary output Lean 4 statements; Generation budget 16,384 tokens; Licence Apache 2.0. A footer line reads 'MathForm figures from the OpenBMB paper; TwIL figures vendor-reported by webAI.' The OrcaRouter logo is composited in the bottom-right corner.

La división del trabajo

Si la tarea consiste en convertir matemáticas de libro de texto en enunciados Lean compilables a escala, y el resultado tiene que distribuirse en un producto comercial, MathForm-8B es la herramienta y la licencia Apache 2.0 es la razón. Si la tarea consiste en decidir si un cuerpo de texto implica una afirmación, etiquetar la implicación, analizar semántica o criticar un intento de demostración, TwIL-LM3-Pro cubre un terreno que MathForm nunca se propuso cubrir — y su licencia no comercial es una frontera sobre dónde puede usarse esa capacidad, no un punto en contra de la capacidad en sí.

La combinación que tiene sentido es un pipeline de dos etapas en lugar de una elección: un modelo emite el enunciado formal y el otro lo juzga. Ambos han publicado el pipeline que los produjo, lo cual es inusual en esta escala y es la razón por la que esta comparación puede hacerse siquiera.

A screenshot of the Hugging Face model card for openbmb/MathForm-8B, showing the OpenBMB author line, tags for Text Generation, Transformers, Safetensors, the openbmb/FormalVerse training dataset, English and arXiv 2608.14221, the apache-2.0 licence badge, and the opening of the paper abstract 'MathForm: Scaling Mathematical Autoformalization with Knowledge Retrieval and Verification-Guided Refinement'.A screenshot of the Hugging Face model card for webAI-Official/TwIL-LM3-Pro, showing the webAI author line, the granite, granite-4.2, formal-logic, reasoning, lora, reinforcement-learning and grpo tags, and the licence badge reading 'License: webai-non-commercial-license-ver.-1.0'.