Una tarjeta de título principal generada que dice «Solar Mini 4 vs MathForm 8B», con el subtítulo «Uno responde a la pregunta, el otro la hace verificable» y dos insignias que dicen «Un generalista contra un autoformalizador» y «Compilación de Lean 4 en el bucle».
Guides & Insights

Solar Mini 4 vs MathForm 8B: Un modelo responde la pregunta, el otro la hace verificable

Autor

Magnus Corvin

Fecha de publicación

Últimos modelos · 20Ver todos los modelos →
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

Si pones Solar Mini 4 junto a MathForm 8B, estás comparando dos modelos que no compiten por el mismo token. Solar Mini 4 es el modelo de mezcla dispersa de expertos de 35.000 millones de parámetros de Upstage, publicado el 22 de septiembre de 2026 con aproximadamente 3.000 millones de parámetros activos por token, y responde preguntas: lee un documento largo, razona sobre él y devuelve un resultado escrito. MathForm 8B es el autoformalizador de 8.000 millones de parámetros de OpenBMB, publicado el 14 de agosto de 2026 bajo Apache 2.0, y hace algo que ningún modelo de razonamiento hace en absoluto: toma un enunciado matemático en lenguaje natural y lo reescribe como un teorema de Lean 4 que el compilador de un asistente de pruebas comprobará que está bien tipado. Uno produce respuestas. El otro produce preguntas verificables por máquina, y el segundo es el producto más escaso.

La comparación vale la pena hacerla de todos modos, porque ambos terminan en el mismo tipo de pipeline y porque los dos tienen fortalezas opuestas de un modo que hace que la elección sea inusualmente sencilla. El modelo de Upstage es fuerte con documentos largos, débil en razonamiento complejo y costoso por tarea completada. El modelo de OpenBMB es tan limitado que resulta inútil fuera de su nicho, jamás ha sido puntuado por un evaluador independiente y no cuesta nada ejecutarlo una vez que se tiene una GPU.

Lado a lado, sobre las cosas que difieren

• Qué es — Solar Mini 4 es un modelo de razonamiento general con un contexto de 1M de tokens (512K según la propia documentación de Upstage) y una puntuación medida de 24,1 en el Artificial Analysis Intelligence Index. MathForm 8B es un autoformalizador de tarea única, sin puntuación publicada en el índice, sin evaluación independiente y sin afirmaciones de capacidad general.

• Parámetros — 35B en total / 3B activos, disperso, para Solar Mini 4; 8,19B denso para MathForm 8B, ajustado a partir de Qwen3-8B sobre el corpus FormalVerse de OpenBMB, con aproximadamente 367.000 ejemplos verificados de Lean 4.

• Licencia y entrega — Solar Mini 4 es propietario y se accede a él a través de la API de Upstage y plataformas de terceros. MathForm 8B son pesos Apache-2.0 con una plantilla de chat, cuatro fragmentos safetensors y una ruta de despliegue con Transformers, vLLM o SGLang detrás de un endpoint compatible con OpenAI.

• Precio — Solar Mini 4 a $0.10 / $0.01 en caché / $0.40 por millón de tokens, actualmente con un 50 % de descuento hasta el 22 de octubre de 2026. MathForm 8B no tiene tarifa; su costo es la GPU que le pongas debajo.

• Velocidad — 204 tokens de salida por segundo para Solar Mini 4 en el entorno de pruebas de Artificial Analysis, con 88.300 tokens de salida por tarea de índice y alrededor de 430 segundos de trabajo por tarea. La salida de MathForm 8B es un encabezado de teorema de Lean 4, unos pocos cientos de tokens como máximo.

• Independencia de sus cifras — Solar Mini 4 ha sido ejecutado por un tercero. MathForm 8B no: todas las cifras de su artículo son de los propios autores, y el modelo es demasiado nuevo y demasiado especializado como para haber atraído una ejecución independiente.

Donde los dos modelos coinciden, y donde no

A two-column comparison scoreboard titled 'Solar Mini 4 vs MathForm 8B', subtitled 'One produces answers, the other produces machine-checkable questions'. Solar Mini 4: parameters 35B total / 3B active; job reads long documents and answers; weights proprietary; price per 1M $0.10 / $0.01 / $0.40; Intelligence Index 24.05 independently measured; cost per index task $0.36; core skill long-context reasoning at 83.3% on AA-LCR; weakest result Terminal-Bench 4.0 at 1%. MathForm 8B: parameters 8.19B dense, from Qwen3-8B; job writes Lean 4 statements for a compiler; weights Apache 2.0 on Hugging Face; price per 1M self-hosted on your own GPU; Intelligence Index none, never independently scored; cost per index task not applicable; core skill a consistency check at 72.37% Pass@8 claimed; weakest result untested outside formalisation.

Los modos de fallo son lo que hace interesante esta combinación, porque son opuestos exactos. El resultado publicado más débil de Solar Mini 4 es Terminal-Bench 4.0 con un 1%, con AutomationBench-AA en 22.3% — es malo verificando su propio trabajo en un entorno que le da retroalimentación. La premisa de diseño completa de MathForm 8B es la verificación: OpenBMB distingue una Comprobación de sintaxis, que pregunta si la declaración de Lean 4 compila, de una Comprobación de consistencia, que pregunta si la declaración que compiló realmente significa lo mismo que el problema informal. El fallo clásico que existe para prevenir es una declaración que pasa la verificación de tipos mientras debilita silenciosamente la afirmación.

Esa es una distinción real y vale la pena ser preciso al respecto. Un modelo de razonamiento que produce una demostración tiene un problema de autoverificación bien conocido: nada en la generación te dice si la respuesta es correcta. Un compilador sí. Si tu flujo de trabajo es «convertir un banco de problemas en algo que una máquina pueda comprobar», MathForm 8B está haciendo la mitad del trabajo que Solar Mini 4 no puede hacer en absoluto, y lo que queda no es una cuestión de grado.

Los números del proveedor, etiquetados como tales: el artículo de OpenBMB reporta un Pass@8 promedio de 88.06% bajo Syntax Check y 72.37% bajo Consistency Check en seis benchmarks, y afirma que superan a varios autoformalizadores especializados de 32B. Nada de eso ha sido reproducido por un tercero. La caída de 16 puntos entre las dos comprobaciones es el número más informativo: mide con qué frecuencia un enunciado compilado no es exactamente el problema que preguntaste, y es la razón por la que Consistency Check existe como una columna separada.

Por qué un equipo ejecutaría ambos

Porque el pipeline natural tiene una etapa barata y de gran volumen y una etapa costosa y de bajo volumen. MathForm 8B se ejecuta en tu propio hardware y convierte problemas informales en encabezados de Lean 4, con un compilador disponible para rechazar resultados defectuosos antes de que los vea una persona. Solar Mini 4 se encarga de lo que ocurre alrededor de eso: leer el artículo de apoyo, extraer los supuestos, resumir el resultado en coreano o inglés y enrutar el trabajo. Los dos nunca compiten por la misma solicitud, y el más pequeño es el que se encarga de la parte del trabajo con una señal objetiva de éxito o fracaso.

Ninguno de los dos modelos es algo que podamos enrutar hacia ti — los modelos de Upstage no están en OrcaRouter, y los de OpenBMB tampoco —, así que si quieres Solar Mini 4, viene de la propia API de Upstage, y si quieres MathForm 8B, viene de Hugging Face y de tu propia GPU. Lo que sí podemos hacer es poner el resto de ese pipeline detrás de una sola clave: más de 200 modelos con un 0 % de recargo sobre el precio de lista del proveedor, conmutación automática ante fallos entre proveedores, y un DSL de enrutamiento que te permite encadenar modelos en una sola llamada. En un flujo de trabajo en el que un pequeño especialista se encarga del paso de formalización y un gran generalista hace todo lo demás a su alrededor, poder cambiar el generalista editando una cadena de modelo — en lugar de lanzar una nueva integración — es la diferencia entre un cambio de dos semanas y una tarde.

A screenshot of the Hugging Face model card for openbmb/MathForm-8B showing the Apache-2.0 licence, the English language tag, the openbmb/FormalVerse dataset, the formal-verification and autoformalization tags, three safetensors shards at an 8B BF16 model size, the paper title 'MathForm: Scaling Mathematical Autoformalization with Knowledge Retrieval and Verification-Guided Refinement', the description that MathForm 8B translates natural-language mathematical statements into Lean 4 and was trained on FormalVerse through supervised fine-tuning followed by reinforcement learning using Lean compilation and semantic-consistency feedback, and a model tree showing Qwen/Qwen3-8B-Base as its base model.

Qué llevarse

Si tu pregunta es "¿cuál de estos debería usar?", la respuesta honesta es que depende de si necesitas una respuesta o una formalización, y ningún benchmark lo resolverá. Si tu pregunta es "¿vale la pena descargar MathForm 8B?", la respuesta es sí para una tarea muy concreta y no para cualquier otra cosa: es un formalizador, no un demostrador, y la obligación de prueba queda abierta en la salida que produce. Si tu pregunta es "¿vale Solar Mini 4 $0.36 por tarea?", la respuesta es sí para documentos largos a gran escala y no para cualquier cosa que requiera que verifique su propio trabajo.

A screenshot of Upstage's blog post headlined 'Solar Mini 4: Built for High-Volume Agent Workloads', with the summary line 'Only 3B active parameters per token, with leading performance in its class and lower costs for repetitive agent workloads' and a View API Docs link.

Fuentes, para cerrar. Todas las cifras de Solar Mini 4 anteriores son una medición independiente de Artificial Analysis, excepto la ventana de contexto, que es una cifra propia de Upstage y no coincide con la de Artificial Analysis. Todas las cifras de MathForm 8B están reportadas por el proveedor en arXiv 2608.14221 y no han sido reproducidas, y su lanzamiento no se anunció: los pesos, el conjunto de datos FormalVerse y el artículo aparecieron el 14 de agosto de 2026, sin ninguna publicación en el blog del proveedor y sin ninguna ejecución de benchmark independiente hasta la fecha.