Um cartão de título de destaque com a inscrição Intern-Decision-0.8B vs MathForm 8B e o subtítulo Um deles consegue verificar o próprio trabalho, trazendo os selos saída Lean 4 verificada pelo compilador e apenas confiança autodeclarada, com o logotipo OrcaRouter composto no canto.
Guides & Insights

Intern-Decision-0.8B vs MathForm 8B: Um deles consegue verificar o próprio trabalho

Autor

Magnus Corvin

Data de publicação

Modelos mais recentes · 20Ver todos os modelos →
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

A pergunta mais útil que você pode fazer sobre qualquer modelo especialista pequeno é quem o verifica. O Intern-Decision-0.8B e o MathForm 8B existem porque um modelo geral foi ajustado para se tornar um modelo restrito, ambos são derivados Apache-2.0 dos pesos do Qwen, e ambos foram publicados no Hugging Face sem uma campanha de marketing — mas ficam em lados opostos de uma linha que determina como você os implantaria. O MathForm 8B é o modelo de autoformalização de 8B da OpenBMB, lançado em 14 de agosto de 2026, que traduz matemática em linguagem natural para Lean 4 e entrega o resultado a um compilador, que o aceita ou não. O Intern-Decision-0.8B é a cabeça de decisão de 852.985.920 parâmetros da InternLM, enviada em 26 de setembro de 2026, que retorna uma distribuição de probabilidade calibrada sobre opções que você forneceu com antecedência — e nada no mundo verifica de forma independente se o rótulo que ela retorna está correto. Um desses modelos produz saída com uma prova. O outro produz saída com uma pontuação de confiança, e a diferença no que você pode fazer com essas duas coisas é o artigo inteiro.

Esse enquadramento também explica por que a diferença de tamanho — 8B contra 0,8B, um fator de dez — é o número menos interessante da comparação. Nenhum dos modelos tenta ser bom no que o outro faz, e a avaliação de nenhum dos dois diz qualquer coisa sobre o outro. O que eles têm em comum é um padrão de lançamento e uma linhagem Qwen, e essas duas coisas importam menos do que a questão da verificação.

O que cada um realmente é

MathForm 8B é o artefato entregue de uma receita de dois estágios descrita no artigo MathForm: Escalando a Autoformalização Matemática com Recuperação de Conhecimento e Refinamento Guiado por Verificação (arXiv 2608.14221). Um planejador de recuperação extrai definições relevantes e formalizações existentes do Mathlib antes de o gerador ser executado; as declarações geradas são então revisadas usando diagnósticos do compilador e feedback de consistência semântica; o corpus resultante, FormalVerse, contém aproximadamente 367.000 exemplos verificados de Lean 4; e o MathForm 8B é treinado nele por meio de ajuste fino supervisionado seguido de aprendizado por reforço usando a compilação Lean e sinais de consistência semântica como recompensa. É um modelo somente texto baseado no Qwen3-8B, servido através do Transformers, vLLM ou SGLang com uma API compatível com OpenAI, com um comprimento de contexto recomendado de 16.384 tokens e um orçamento máximo de geração de 16.384 tokens. Seu pipeline de avaliação, arquivos de benchmark e scripts Pass@k estão todos no repositório GitHub da OpenBMB, e o conjunto de dados de treinamento é público.

O Intern-Decision-0.8B é o artefato entregue de uma receita que ninguém descreveu. O cartão do modelo diz que ele é "um modelo multimodal de decisão estruturada com ajuste fino a partir do Qwen3.5-0.8B" e para por aí — sem descrição de dados, sem procedimento de treinamento, sem artigo, sem repositório. O que ele documenta minuciosamente é o contrato de inferência. O motor incluído mapeia as opções de cada pergunta para símbolos de token único, renderiza um esqueleto com um <decision> placeholder por campo, executa uma passagem forward causal, lê os logits na posição anterior a cada placeholder, aplica softmax apenas sobre os símbolos permitidos daquele campo, aplica uma calibração ajustada e mapeia os símbolos de volta para os valores das suas opções. Não há generate() e nem amostragem em qualquer ponto do caminho. Ele aceita texto mais até oito imagens, lida com entre uma e dezesseis perguntas com até 62 opções cada, e rejeita entradas acima de 8.192 tokens em vez de truncá-las. A temperatura de calibração padrão é 2,747760550703, ajustada por checkpoint por minimização de NLL sobre 1.728 casos.

Leia esses dois parágrafos lado a lado e a assimetria é gritante. O MathForm 8B vem com um artigo, um conjunto de dados, um pipeline de avaliação e um repositório. O Intern-Decision-0.8B vem com uma descrição de API e uma tabela de benchmark.

A assimetria de verificação, que é o que realmente importa

A saída do MathForm 8B é verificável por algo que não seja um humano. Ele emite Lean 4, e o Lean 4 ou compila ou não. Os números da OpenBMB são reportados sob dois regimes exatamente por esse motivo: Pass@8 de 88,06% sob Syntax Check, o que significa que a saída compila, e 72,37% sob Consistency Check, o que significa que compila e uma verificação de consistência semântica concorda que a declaração formal significa o que a informal dizia. Ambos os números são médias de seis benchmarks, e o artigo também relata taxas de aprovação de CC de 63% em FATE-H e 37% nos subconjuntos mais difíceis do FATE-X, com a afirmação de que isso supera autoformalizadores especializados de 32B. Esses são relatados pelo fornecedor — a OpenBMB os executou —, mas a propriedade que importa é estrutural, não estatística: um sistema a jusante que consome a saída do MathForm 8B pode rejeitar uma formalização ruim sem pedir a um modelo que a julgue. O compilador é o oráculo.

O Intern-Decision-0.8B tem um contrato de tipos e nenhum oráculo. O formato da saída é garantido — um campo declarado choice retorna uma distribuição sobre os valores de opção que você listou, um score retorna um valor esperado ponderado por probabilidade sobre sua rubrica, um noul retorna uma probabilidade de "sim". Nada fora do modelo pode lhe dizer se o argmax estava correto. O valor de confiança é a estimativa do próprio modelo sobre sua própria correção, e o trabalho de calibração do card é uma tentativa honesta de tornar essa estimativa significativa — uma temperatura ajustada que preserva o argmax enquanto aguça ou suaviza as probabilidades, validada em casos separados para teste — mas uma resposta errada bem calibrada ainda é uma resposta errada. Se o seu pipeline precisa saber se um rótulo está certo, você precisa de dados rotulados e precisa medir isso por conta própria.

Isso não é um defeito exclusivo do Intern-Decision-0.8B. É a condição de todo classificador, e é o problema não resolvido em toda a categoria de modelos de decisão que inclui o Jev da TypeSafe e a Laya da Convai. Vale a pena declarar isso claramente porque uma tabela de benchmark com uma coluna de pontuação de Brier pode criar a impressão de que calibração é verificação. Não é. A calibração diz que, quando este modelo diz 80%, ele está certo cerca de 80% das vezes ao longo da distribuição avaliada — o que é genuinamente útil para definir limiares e calcular o valor esperado, e não é uma garantia de correção por item.

O placar, nas linhas que ambos os modelos têm

• Parâmetros — Intern-Decision-0.8B: 852.985.920 distribuídos por um shard de linguagem de 1,50 GB, um shard de visão de 176 MB e um projetor de 25 MB. MathForm 8B: 8B denso, baseado no Qwen3-8B.

• Modelo base — Intern-Decision-0.8B: Qwen3.5-0.8B, lançado em fevereiro de 2026. MathForm 8B: Qwen3-8B.

• Tarefa — Intern-Decision-0.8B: decisões tipadas sobre um esquema que você escreve — escolha, pontuação, binário. MathForm 8B: matemática em linguagem natural para formalização em Lean 4.

• Saída — Intern-Decision-0.8B: distribuição calibrada mais argmax por campo, nenhum texto gerado. MathForm 8B: código-fonte em Lean 4 gerado, geralmente longo.

• Verificação — Intern-Decision-0.8B: nenhuma externa; a confiança é autorrelatada. MathForm 8B: o compilador Lean 4, além de uma verificação de consistência semântica.

• Evidência publicada — Intern-Decision-0.8B: uma tabela de benchmark de fornecedor em sete benchmarks, não reproduzida, sem artigo. MathForm 8B: um artigo, um conjunto de dados público de aproximadamente 367.000 exemplos, um pipeline de avaliação e repositório, executado pelo fornecedor.

• Licença — Ambas Apache 2.0, e o Intern-Decision-0.8B carrega adicionalmente o arquivo de licença Qwen preservado para seus pesos upstream.

A two-column scoreboard comparing Intern-Decision-0.8B with MathForm 8B on six shared rows: parameters 852,985,920 against 8B dense based on Qwen3-8B, task typed decisions over a schema you write against natural-language mathematics to Lean 4, output a calibrated distribution plus argmax with no text against generated Lean 4 source, verification none external with self-reported confidence against the Lean 4 compiler plus a consistency check, published evidence a vendor table with no paper or dataset against a paper with a roughly 367k-example dataset and an eval pipeline, and Apache 2.0 on both sides.

Custo e latência não são comparáveis, e isso não é uma evasiva.

A InternLM mediu o Intern-Decision-0.8B em 33,98 ms de média e 37,50 ms de p95 por consulta em uma única RTX 4090 pelo caminho local do Hugging Face, com seu irmão de 2B registrando 33,28 ms de média. O próprio card do MathForm 8B recomenda até 16.384 novos tokens por formalização a temperatura 0,6 e top_p 0,95. Essas duas medições não são a mesma grandeza. Uma é uma única passagem direta sobre um prompt; a outra é uma geração autorregressiva que pode chegar a milhares de tokens. Multiplicar um orçamento de formalização por uma decisão de 34 ms não diz nada sobre eficiência relativa, porque os modelos não estão fazendo a mesma quantidade de trabalho — um lê e pontua, o outro lê e escreve um script de prova. Se o throughput é sua restrição, os fatos relevantes são mais simples do que uma razão. O MathForm 8B formaliza uma afirmação por geração e, a 16K tokens por saída em um modelo denso de 8B, essa é uma carga de trabalho que satura a GPU e uma candidata ao processamento em lote via vLLM ou SGLang, ambos documentados pela OpenBMB. O Intern-Decision-0.8B responde a dezesseis perguntas cobrindo um registro inteiro em uma única passada, então a unidade de trabalho é um registro, e não um campo, e o orçamento do registro é o teto de entrada de 8.000 tokens — que chega mais rápido do que um leitor poderia esperar quando você está empacotando um estado longo, um esquema rico e até oito imagens.

Onde cada um é a ferramenta certa

O MathForm 8B pertence a um pipeline cujo gargalo é a revisão humana de matemática. A autoformalização existe porque escrever em Lean é mais lento do que lê-lo, e porque um enunciado verificável por máquina é aquele que um assistente de provas pode então atacar. A propriedade que o torna confiável — saída verificada pelo compilador — é também a propriedade que o torna restrito: ele formaliza, não prova, e o card é explícito ao dizer que os requisitos de verificação por compilação exigem um Kimina Lean Server em execução e que os experimentos usaram Lean 4.21.0. Quem o adota, adota esse stack. Como acontece com qualquer modelo de pesos abertos com dias ou semanas de vida, apontar um caminho de teste para ele e recorrer a um modelo já comprovado quando ele trava é a forma de baixo risco de avaliá-lo, que é exatamente para o que serve um gateway com failover automático ao longo de uma cadeia de fallback — novas tentativas que acontecem antes de a resposta começar, para que uma formalização travada nunca chegue ao seu chamador.

O Intern-Decision-0.8B é adequado sempre que já existe um conjunto fechado de respostas e o custo de gerar texto para recuperá-lo é puro desperdício. Triagem, roteamento, pontuação por rubrica, julgamento de um registro com base em uma política escrita — os casos em que um modelo generativo está sendo usado como uma forma cara de escolher de uma lista. Suas vantagens são ser determinístico, retornar uma probabilidade utilizável em vez de uma string que você precisa analisar e, com 1,73 GB em disco, rodar confortavelmente abaixo do custo de memória de um navegador de laptop. Suas desvantagens são que a documentação para na superfície da API, que ninguém fora da InternLM publicou um resultado para ele e que a única coluna de benchmark que sugere um problema de segurança — uma pontuação de 64,48 no WildJailBreak contra 96,29 do Jev — não tem explicação. Não o coloque diante de entradas adversariais sem executar esse teste você mesmo.

A screenshot of the Hugging Face model card for internlm/Intern-Decision-0.8B, showing the tags image-text-to-text, Transformers, Safetensors, qwen3_5, decision-making, multimodal and conversational, an Apache-2.0 licence, a model size of 0.9B params in F32-BF16, a seven-file repository, and a model tree naming Qwen/Qwen3.5-0.8B-Base as the base model. The card text reads that Intern-Decision-0.8B is 'a multimodal structured decision model fine-tuned from Qwen3.5-0.8B' which 'accepts a shared state, a schema of named questions, and optional images, and returns an answer distribution for every question in one model forward pass', followed by a three-step 'How inference works' list.

Ambos os modelos compartilham uma linhagem que vale a pena notar, porque ela muda o que "open" oferece a você. Cada um é um fine-tune de um checkpoint Qwen, e cada um preserva corretamente a licença upstream: MathForm 8B sob Apache 2.0 com a proveniência do Qwen3-8B declarada no card, Intern-Decision-0.8B sob Apache 2.0 com um arquivo LICENSE-QWEN separado no repositório. Nenhum dos dois traz um limite de receita ou uma restrição de campo de uso — ao contrário da LFM Open License v1.0 da Liquid AI, que condiciona os direitos comerciais a que sua entidade permaneça abaixo de um patamar de receita anual de US$ 10 milhões. Se você está construindo comercialmente, essa é uma distinção que separa esses dois lançamentos de partes do ecossistema de modelos pequenos, e ela se aplica igualmente aos dois.

Se você quer a camada de decisão sem o checkpoint não documentado

A lacuna entre "uma cabeça de decisão é a forma certa para este problema" e "esta cabeça de decisão específica é uma que você consegue defender diante de um revisor" é o que uma alternativa hospedada preenche. O Jev 1.13 da TypeSafe é o modelo contra o qual a InternLM comparou sua família no Jevbench, no Typed Decision e no ToolACE, e ele é chamável hoje por meio de um único endpoint compatível com OpenAI a US$ 0,042 por milhão de tokens de entrada, com a saída cobrada a zero — a tarifa publicada pelo fornecedor, repassada sem markup, em vez de receber markup no caminho. Para um leitor que quer medir se uma cabeça de decisão ajuda em algo antes de se comprometer com um checkpoint de 0,8B com um repositório ausente, esse é o primeiro experimento barato, e as próprias avaliações de terceiros do Jev lhe conferem um histórico documentado que o Intern-Decision-0.8B ainda não tem.

A screenshot of the OrcaRouter model page for typesafe/jev-1.13, dated 2026-09-24, showing a 65K token context, text input and text output, a P95 time to first token of 170 ms, and list pricing of $0.042 per million input tokens with no output rate. The description reads that Jev is TypeSafe's structured decision and evaluation model, taking a state and a set of named questions (noul, choice, score) and returning a structured answer for each, served non-streaming via POST /v1/systemone. A performance panel lower down reports a P50 time to first token of 178 ms and an output speed of 569 tokens per second.

A resposta curta

Estes dois não são alternativas. O MathForm 8B é um especialista cuja saída um programa consegue verificar, voltado para uma tarefa em que a verificação é a parte difícil, e vem com o artigo, o conjunto de dados e o harness de avaliação para comprovar a alegação. O Intern-Decision-0.8B é um especialista cuja saída só você consegue verificar, voltado para tarefas em que as respostas já estavam escritas e a parte difícil era chegar a elas de forma rápida e barata, e vem com um módulo de inferência e uma tabela. Se você precisa de uma formalização, só há um destes a considerar. Se você precisa de um rótulo e está preparado para construir a verdade de referência para verificá-lo, o 0.8B é o download mais interessante — rápido, determinístico, Apache 2.0 e pequeno o suficiente para que o custo de descobrir se ele é bom seja uma tarde, e não uma linha orçamentária.