Una tarjeta de título principal que dice 'Intern-Decision-0.8B vs MathForm 8B' con el subtítulo 'Uno de estos puede verificar su propio trabajo', con las insignias 'salida de Lean 4 verificada por compilador' y 'solo confianza autodeclarada', con el logotipo de OrcaRouter compuesto en la esquina.
Guides & Insights

Intern-Decision-0.8B vs MathForm 8B: Uno de estos puede verificar su propio trabajo

Autor

Magnus Corvin

Fecha de publicación

Últimos modelos · 20Ver todos los modelos →
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

La pregunta más útil que puedes hacer sobre cualquier modelo especializado pequeño es quién lo verifica. Intern-Decision-0.8B y MathForm 8B existen porque un modelo general fue ajustado finamente para convertirlo en uno estrecho, ambos son derivados Apache-2.0 de pesos de Qwe​n, y ambos se subieron a Hugging Face sin una campaña de marketing — pero se encuentran en lados opuestos de una línea que determina cómo los desplegarías. MathForm 8B es el modelo de autoformalización de 8B de OpenBMB, lanzado el 14 de agosto de 2026, que traduce matemáticas en lenguaje natural a Lean 4 y entrega el resultado a un compilador, que lo acepta o no. Intern-Decision-0.8B es la cabeza de decisión de 852,985,920 parámetros de InternLM, subida el 26 de septiembre de 2026, que devuelve una distribución de probabilidad calibrada sobre opciones que proporcionaste de antemano — y nada en el mundo verifica de forma independiente si la etiqueta que devuelve es correcta. Uno de estos modelos produce una salida con una demostración. El otro produce una salida con una puntuación de confianza, y la diferencia en lo que puedes hacer con esas dos cosas es el artículo completo.

Ese planteamiento también explica por qué la brecha de tamaño —8B frente a 0.8B, un factor de diez— es el número menos interesante de la comparación. Ninguno de los dos modelos intenta ser bueno en lo que hace el otro, y la evaluación de ninguno de los dos te dice nada sobre el otro. Lo que comparten es un patrón de lanzamiento y un linaje Qwen, y ambas cosas importan menos que la cuestión de la verificación.

Lo que realmente es cada uno

MathForm 8B es el artefacto entregado de una receta de dos etapas descrita en el artículo MathForm: Escalado de la autoformalización matemática con recuperación de conocimiento y refinamiento guiado por verificación (arXiv 2608.14221). Un planificador de recuperación extrae definiciones relevantes y formalizaciones existentes de Mathlib antes de que se ejecute el generador; las declaraciones generadas se revisan luego utilizando diagnósticos del compilador y retroalimentación de consistencia semántica; el corpus resultante, FormalVerse, contiene aproximadamente 367,000 ejemplos verificados de Lean 4; y MathForm 8B se entrena con él mediante ajuste fino supervisado seguido de aprendizaje por refuerzo usando señales de compilación de Lean y de consistencia semántica como recompensa. Es un modelo solo de texto basado en Qwen3-8B, servido a través de Transformers, vLLM o SGLang con una API compatible con OpenAI, con una longitud de contexto recomendada de 16,384 tokens y un presupuesto máximo de generación de 16,384 tokens. Su canalización de evaluación, sus archivos de benchmark y sus scripts de Pass@k están todos en el repositorio de GitHub de OpenBMB, y el conjunto de datos de entrenamiento es público.

Intern-Decision-0.8B es el artefacto publicado de una receta que nadie ha descrito. La tarjeta del modelo dice que es "un modelo multimodal de decisión estructurada ajustado a partir de Qwen3.5-0.8B" y ahí se detiene: ninguna descripción de datos, ningún procedimiento de entrenamiento, ningún artículo, ningún repositorio. Lo que sí documenta exhaustivamente es el contrato de inferencia. El motor incluido asigna las opciones de cada pregunta a símbolos de un solo token, genera un esqueleto con un <decision> como marcador de posición por campo, ejecuta una única pasada causal hacia adelante, lee los logits en la posición anterior a cada marcador de posición, aplica softmax solo sobre los símbolos permitidos de ese campo, aplica una calibración ajustada y asigna los símbolos de vuelta a los valores de tus opciones. No hay ninguna llamada a generate() ni muestreo en ningún punto de la ruta. Acepta texto además de hasta ocho imágenes, maneja de una a dieciséis preguntas con hasta 62 opciones cada una, y rechaza las entradas que superen los 8.192 tokens en lugar de truncarlas. La temperatura de calibración predeterminada es 2,747760550703, ajustada por checkpoint mediante minimización de NLL sobre 1.728 casos.

Lea esos dos párrafos en paralelo y la asimetría es marcada. MathForm 8B viene con un artículo, un conjunto de datos, una canalización de evaluación y un repositorio. Intern-Decision-0.8B viene con una descripción de API y una tabla comparativa.

La asimetría de verificación, que es la verdadera historia

MathForm 8B's output is checkable by something other than a human. It emits Lean 4, and Lean 4 either compiles or it does not. OpenBMB's numbers are reported under two regimes for exactly this reason: Pass@8 of 88.06% under Syntax Check, which means the output compiles, and 72.37% under Consistency Check, which means it compiles and a semantic-consistency check agrees the formal statement means what the informal one said. Both figures are averages across six benchmarks, and the paper also reports CC pass rates of 63% on FATE-H and 37% on the harder FATE-X subsets, with the claim that this exceeds specialised 32B autoformalizers. Those are vendor-reported — OpenBMB ran them — but the property that matters is structural, not statistical: a downstream system consuming MathForm 8B's output can reject a bad formalization without asking a model to judge it. The compiler is the oracle.

Intern-Decision-0.8B tiene un contrato de tipos y ningún oráculo. La forma de la salida está garantizada: un campo declarado choice devuelve una distribución sobre los valores de opción que enumeraste, un score devuelve un valor esperado ponderado por probabilidad según tu rúbrica, un noul devuelve una probabilidad de sí. Nada fuera del modelo puede decirte si el argmax era correcto. El valor de confianza es la propia estimación del modelo sobre su propia corrección, y el trabajo de calibración de la tarjeta es un intento honesto de hacer que esa estimación sea significativa —una temperatura ajustada que conserva el argmax mientras agudiza o suaviza las probabilidades, validada en casos reservados—, pero una respuesta incorrecta bien calibrada sigue siendo una respuesta incorrecta. Si tu pipeline necesita saber si una etiqueta es correcta, necesitas datos etiquetados, y necesitas medirlo tú mismo.

Eso no es un defecto exclusivo de Intern-Decision-0.8B. Es la condición de todo clasificador, y es el problema no resuelto en toda la categoría de modelos de decisión que incluye el Jev de TypeSafe y la Laya de Convai. Vale la pena decirlo con claridad porque una tabla de benchmark con una columna de puntuación de Brier puede dar la impresión de que la calibración es verificación. No lo es. La calibración te dice que cuando este modelo dice 80%, acierta aproximadamente el 80% de las veces en la distribución evaluada, lo cual es genuinamente útil para establecer umbrales y calcular el valor esperado, y no es una garantía de corrección por elemento.

El marcador, en las filas que ambos modelos tienen

• Parámetros — Intern-Decision-0.8B: 852.985.920 en un fragmento de lenguaje de 1,50 GB, un fragmento de visión de 176 MB y un proyector de 25 MB. MathForm 8B: 8B denso, basado en Qwen3-8B.

• Modelo base — Intern-Decision-0.8B: Qwen3.5-0.8B, lanzado en febrero de 2026. MathForm 8B: Qwen3-8B.

• Tarea — Intern-Decision-0.8B: decisiones tipadas sobre un esquema que tú escribes — elección, puntuación, binario. MathForm 8B: matemáticas en lenguaje natural a formalización en Lean 4.

• Salida — Intern-Decision-0.8B: distribución calibrada más argmax por campo, sin texto generado. MathForm 8B: código fuente Lean 4 generado, típicamente largo.

• Verificación — Intern-Decision-0.8B: ninguna externa; la confianza es autodeclarada. MathForm 8B: el compilador Lean 4, más una comprobación de coherencia semántica.

• Evidencia publicada — Intern-Decision-0.8B: una tabla comparativa de proveedor en siete benchmarks, no reproducida, sin artículo. MathForm 8B: un artículo, un conjunto de datos público de aproximadamente 367.000 ejemplos, una canalización de evaluación y un repositorio, ejecutados por el proveedor.

• Licencia — Ambas son Apache 2.0, e Intern-Decision-0.8B además conserva el archivo de licencia de Qwen preservado para sus pesos upstream.

A two-column scoreboard comparing Intern-Decision-0.8B with MathForm 8B on six shared rows: parameters 852,985,920 against 8B dense based on Qwen3-8B, task typed decisions over a schema you write against natural-language mathematics to Lean 4, output a calibrated distribution plus argmax with no text against generated Lean 4 source, verification none external with self-reported confidence against the Lean 4 compiler plus a consistency check, published evidence a vendor table with no paper or dataset against a paper with a roughly 367k-example dataset and an eval pipeline, and Apache 2.0 on both sides.

El costo y la latencia no son comparables, y eso no es una evasiva

InternLM midió Intern-Decision-0.8B en 33,98 ms de media y 37,50 ms de p95 por consulta en una única RTX 4090 a través de la ruta local de Hugging Face, mientras que su hermano de 2B registró 33,28 ms de media. La propia ficha de MathForm 8B recomienda hasta 16.384 tokens nuevos por formalización a temperatura 0,6 y top_p 0,95. Esas dos mediciones no son la misma cantidad. Una es una única pasada hacia delante sobre un prompt; la otra es una generación autorregresiva que puede ejecutarse durante miles de tokens. Multiplicar un presupuesto de formalización por una decisión de 34 ms no te dice nada sobre la eficiencia relativa, porque los modelos no están haciendo la misma cantidad de trabajo: uno lee y puntúa, el otro lee y escribe un script de demostración. Si el rendimiento es tu restricción, los hechos relevantes son más simples que una proporción. MathForm 8B formaliza un enunciado por generación, y a 16K tokens por salida en un modelo denso de 8B, eso es una carga que satura la GPU y un candidato para el batching mediante vLLM o SGLang, ambos documentados por OpenBMB. Intern-Decision-0.8B responde dieciséis preguntas que cubren un registro completo en una sola pasada, así que la unidad de trabajo es un registro en lugar de un campo, y el presupuesto del registro es el límite de entrada de 8.192 tokens, que llega más rápido de lo que un lector podría esperar cuando estás metiendo un estado largo, un esquema rico y hasta ocho imágenes.

Donde cada uno es la herramienta adecuada

MathForm 8B pertenece a un pipeline cuyo cuello de botella es la revisión humana de las matemáticas. La autoformalización existe porque escribir en Lean es más lento que leerlo, y porque un enunciado verificable por máquina es uno que un asistente de pruebas puede atacar después. La propiedad que lo hace confiable — salida verificada por el compilador — es también la propiedad que lo hace limitado: formaliza, no demuestra, y la tarjeta es explícita en que las comprobaciones de compilación requieren un servidor Kimina Lean en ejecución y que los experimentos usaron Lean 4.21.0. Quien lo adopte estará adoptando ese stack. Como con cualquier modelo de pesos abiertos de días o semanas de antigüedad, apuntar una ruta de prueba hacia él y recurrir a un modelo probado cuando se estanca es la forma de bajo riesgo de evaluarlo, que es para lo que sirve una puerta de enlace con conmutación por error automática a través de una cadena de respaldo — reintentos que llegan antes de que comience la respuesta, de modo que una formalización estancada nunca llega a tu invocador.

Intern-Decision-0.8B pertenece allí donde ya existe un conjunto cerrado de respuestas y el coste de generar texto para recuperarlo es puro desperdicio. Triaje, enrutamiento, puntuación con rúbricas, adjudicación de un registro conforme a una política escrita: los casos en los que se usa un modelo generativo como una forma cara de elegir de una lista. Sus ventajas son que es determinista, que devuelve una probabilidad utilizable en lugar de una cadena que hay que analizar, y que, con 1,73 GB en disco, se ejecuta holgadamente por debajo del coste de memoria de un navegador de portátil. Sus desventajas son que la documentación se queda en la superficie de la API, que nadie fuera de InternLM ha publicado un resultado para él, y que la única columna de benchmark que sugiere un problema de seguridad —una puntuación de WildJailBreak de 64,48 frente al 96,29 de Jev— carece de explicación. No lo pongas frente a entradas adversariales sin ejecutar tú mismo esa prueba.

A screenshot of the Hugging Face model card for internlm/Intern-Decision-0.8B, showing the tags image-text-to-text, Transformers, Safetensors, qwen3_5, decision-making, multimodal and conversational, an Apache-2.0 licence, a model size of 0.9B params in F32-BF16, a seven-file repository, and a model tree naming Qwen/Qwen3.5-0.8B-Base as the base model. The card text reads that Intern-Decision-0.8B is 'a multimodal structured decision model fine-tuned from Qwen3.5-0.8B' which 'accepts a shared state, a schema of named questions, and optional images, and returns an answer distribution for every question in one model forward pass', followed by a three-step 'How inference works' list.

Ambos modelos comparten un linaje que vale la pena señalar porque cambia lo que «abierto» te aporta. Cada uno es un ajuste fino de un checkpoint de Qwen, y cada uno conserva correctamente la licencia upstream: MathForm 8B bajo Apache 2.0 con la procedencia de Qwen3-8B indicada en la tarjeta, Intern-Decision-0.8B bajo Apache 2.0 con un archivo separado LICENSE-QWEN en el repositorio. Ninguno de los dos incluye un umbral de ingresos ni una restricción de campo de uso — a diferencia de la LFM Open License v1.0 de Liquid AI, que condiciona los derechos comerciales a que tu entidad se mantenga por debajo de un límite de ingresos anuales de 10 millones de dólares. Si estás desarrollando con fines comerciales, esa es una distinción que separa estos dos lanzamientos de partes del ecosistema de modelos pequeños, y se aplica a ambos por igual.

Si quieres la capa de decisión sin el punto de control no documentado

La brecha entre «una cabeza de decisión tiene la forma correcta para este problema» y «esta cabeza de decisión en particular es una que puedes defender ante un revisor» es lo que cierra una alternativa alojada. Jev 1.13 de TypeSafe es el modelo con el que InternLM comparó su familia en Jevbench, en Typed Decision y en ToolACE, y es invocable hoy a través de un único endpoint compatible con OpenAI a $0.042 por millón de tokens de entrada, con la salida facturada a cero — la tarifa publicada por el proveedor, transferida sin margen en lugar de con recargo por el camino. Para un lector que quiera medir si una cabeza de decisión ayuda en absoluto antes de comprometerse con un checkpoint de 0,8B con un repositorio faltante, ese es el primer experimento barato, y las propias evaluaciones de terceros de Jev le dan un historial documentado que Intern-Decision-0.8B todavía no tiene.

A screenshot of the OrcaRouter model page for typesafe/jev-1.13, dated 2026-09-24, showing a 65K token context, text input and text output, a P95 time to first token of 170 ms, and list pricing of $0.042 per million input tokens with no output rate. The description reads that Jev is TypeSafe's structured decision and evaluation model, taking a state and a set of named questions (noul, choice, score) and returning a structured answer for each, served non-streaming via POST /v1/systemone. A performance panel lower down reports a P50 time to first token of 178 ms and an output speed of 569 tokens per second.

La respuesta corta

Estos dos no son alternativas. MathForm 8B es un especialista cuya salida puede verificar un programa, orientado a una tarea donde la verificación es la parte difícil, y viene con el artículo, el conjunto de datos y el arnés de evaluación para demostrar la afirmación. Intern-Decision-0.8B es un especialista cuya salida solo tú puedes verificar, orientado a tareas en las que las respuestas ya estaban escritas y la parte difícil era llegar a ellas de forma rápida y barata, y viene con un módulo de inferencia y una tabla. Si necesitas una formalización, solo hay uno de estos que considerar. Si necesitas una etiqueta y estás dispuesto a construir la verdad de referencia para comprobarla, el 0.8B es la descarga más interesante: rápido, determinista, Apache 2.0, y lo bastante pequeño como para que el coste de averiguar si vale para algo sea una tarde en lugar de una partida presupuestaria.