
TwIL-LM3-Pro vs MathForm 8B: Declaração e Implicação São Metades Diferentes da Formalização
- openaiNOVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligência
- anthropicNOVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligência
- typesafeNOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 223 tok/s
- OpenAINOVOOpenAI: GPT-6 Luna2026-09-2238Inteligência
- OpenAINOVOOpenAI: GPT-6 Sol2026-09-2248Inteligência
- AnthropicNOVOAnthropic: Claude Opus 5.52026-09-2258Inteligência
- xAINOVOGrok 4.72026-09-2146Inteligência
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 118 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1064 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 213 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
TwIL-LM3-Pro e MathForm-8B visam ao mesmo problema amplo — fazer uma máquina produzir texto formal e verificável, em vez de prosa plausível — e estão resolvendo metades diferentes dele. MathForm-8B é o autoformalizador de 8 bilhões de parâmetros da OpenBMB, lançado em agosto de 2026: dado um problema de matemática em linguagem simples, ele emite o enunciado em Lean 4 desse problema, deixando a obrigação de prova em aberto para um compilador verificar. TwIL-LM3-Pro é o modelo de lógica formal de 3,66B da webAI, de setembro de 2026, e suas saídas-alvo são rótulos de implicação, traduções para lógica de primeira ordem, análises semânticas e críticas de provas em Lean. Um produz a coisa a ser verificada. O outro diz se a coisa que você tem implica o que você afirma.
Como os dois se sobrepõem em exatamente uma frente — a formalização em Lean —, uma página de comparação é tentadora e enganosa. A pergunta mais útil é por que tipo de recompensa cada um foi treinado a ser recompensado, porque o sinal de recompensa é onde os dois designs divergem mais acentuadamente e onde a escolha mais inteligente realmente reside.
Declaração versus implicação
O MathForm-8B é treinado no FormalVerse, um corpus Lean 4 que o artigo da OpenBMB descreve como aproximadamente 367.000 exemplos verificados, por meio de ajuste fino supervisionado seguido de aprendizado por reforço. O pipeline em torno dele recupera definições relevantes e formalizações existentes do Mathlib antes da geração e, em seguida, refina usando diagnósticos do compilador e uma verificação de consistência semântica. Sua saída é um enunciado formal — importações, tipos, cabeçalho do teorema — que um compilador externo aceita ou rejeita. O cartão do modelo deixa explícito que ele não resolve o problema e não pretende fazê-lo; a prova é tarefa de outra pessoa.
O TwIL-LM3-Pro aborda o mesmo domínio pelo lado da lógica. Seu pipeline visava a seis objetivos: tradução para lógica de primeira ordem, rotulagem de acarretamento, parsing semântico, formalização em Lean, crítica de provas em Lean e indução de regras. Enquanto o MathForm é construído para emitir um enunciado, o TwIL-LM3-Pro é construído para fazer julgamentos sobre enunciados — isto é acarretado, este parsing está correto, esta tentativa de prova é sólida. Ele também formaliza, e esse é o único ponto em que os dois modelos são genuinamente comparáveis, e não apenas adjacentes.
Recompensa de um compilador versus recompensa de um pontuador
Esta é a diferença de design que importa, e ambos os fornecedores a documentam.
A recompensa de treinamento do MathForm veio da compilação do Lean e do feedback de consistência semântica. Um compilador é um oráculo: ou ele aceita a formalização ou não, e não há crédito parcial e nada para argumentar. Esse é o sinal de recompensa mais limpo neste canto do aprendizado de máquina, e é por isso que os benchmarks de autoformalização são relatados como taxas de aprovação — a métrica está a jusante de um programa que não se importa com o que qualquer um acredita.
A fase final do TwIL-LM3-Pro foi uma execução de GRPO com ponderação por entropia contra um verificador programático, com o próprio cartão do modelo a descrever crédito parcial para correspondências flexíveis e token-F1, para que grupos de prompts onde tudo falhou ainda produzam gradiente. O seu principal macro gate é a média de pesos iguais de quatro faixas de classificação limitadas mais indução de regras, e nesse gate as faixas de escolha múltipla e procedimentais são creditadas como `max(exact_match, loose_match)` — uma regra que o cartão afirma claramente, porque uma resposta correta formatada de forma diferente é um artefacto de formatação e não uma falha de raciocínio.
Nenhum dos dois designs é pior. Eles são ajustados para consequências diferentes. Uma recompensa avaliada por compilador produz um modelo para o qual você pode apontar um problema de formalização difícil e confiar na saída, porque a saída é verificável. Uma recompensa avaliada por pontuador com crédito parcial produz um modelo que pode ser treinado com julgamentos mais difusos — implicação, crítica, indução de regras — nos quais não existe compilador para arbitrar e a alternativa é não treinar nessas frentes em absoluto. O custo é que os números resultantes são tão bons quanto o harness, e a webAI diz isso: sua linha strict-7, que elimina todo vestígio de crédito por correspondência flexível, existe justamente para que o leitor possa ver o número mais severo ao lado do número principal.
As pontuações não estão na mesma régua.
Ambos os modelos publicam números relativos ao Lean e eles não podem ser subtraídos. O artigo da MathForm relata uma média de Pass@8 de 88,06% no Syntax Check e 72,37% no Consistency Check em seis benchmarks de Lean, com taxas de aprovação no Consistency Check de 63% e 37% nos subconjuntos mais difíceis FATE-H e FATE-X, e afirma superar vários autoformalizadores especializados de 32B. O cartão do TwIL-LM3-Pro relata um token-F1 de 0,5092 para `lean_formalize` e uma acurácia de 0,7950 para `lean_critic` em seu próprio harness do Track A.
Pass@8 sob uma verificação de compilador e token-F1 contra uma string de referência medem coisas diferentes. Pass@8 dá ao modelo oito tentativas e pergunta se uma delas compilou e permaneceu consistente; token-F1 pontua quão proximamente uma única geração correspondeu a uma referência. Um modelo pode obter boa pontuação em uma e ruim na outra, e nada em nenhum dos dois documentos autoriza ler as duas lado a lado.
O resumo honesto do histórico de benchmark é que as evidências do MathForm-8B vêm de um artigo com um compilador no circuito, e as do TwIL-LM3-Pro vêm de um harness de fornecedor com um pontuador no circuito, e nenhum terceiro submeteu ambos à mesma rubrica. Trate qualquer página que coloque "88.06%" ao lado de "0.5092" como se fossem um placar, como uma página que não leu as definições.
Especificações, lado a lado
• Parâmetros — TwIL-LM3-Pro 3,66B denso vs MathForm-8B 8B, aproximadamente 2,2 vezes o tamanho.
• Modelo base — `ibm-granite/granite-4.2-3b` vs `Qwen/Qwen3-8B`.
• Dados de treinamento — um corpus sintético de lógica formal cobrindo seis objetivos vs FormalVerse, aproximadamente 367.000 exemplos verificados de Lean 4.
• Recompensa — um verificador programático com crédito parcial e tolerância a correspondências flexíveis vs compilação Lean e feedback de consistência semântica.
• Saída principal — rótulos de acarretamento, traduções para LPO, análises semânticas, declarações Lean e críticas de provas versus uma declaração Lean 4 para um compilador verificar.
• Janela de contexto — 131.072 tokens para TwIL-LM3-Pro, medida dentro de 8.192 tokens; MathForm-8B é servido com orçamentos de geração de até 16.384 tokens em seu próprio exemplo de uso.
• Licença — Licença Não Comercial webAI ver. 1.0 vs Apache 2.0.
• Pegada quantizada — TwIL-LM3-Pro fornece um GGUF Q4_K_M de 2,09 GiB para CPU ou 4 GB de VRAM; MathForm-8B não publica nenhum GGUF em seu próprio repositório.
A licença decide novamente a questão da produção
MathForm-8B é Apache 2.0. Você pode ajustá-lo, redistribuí-lo e executá-lo dentro de um produto comercial. TwIL-LM3-Pro é não comercial: pesquisa e uso pessoal são permitidos, e implantação que gere receita exige um acordo separado com a webAI, cuja rota comercial é um arranjo empresarial, e não uma tabela de preços publicada.
Para um grupo de pesquisa ou um estudante, essa diferença é irrelevante — ambos são downloads sem restrição no Hugging Face. Para uma empresa, ela é decisiva e aponta para o MathForm-8B para qualquer trabalho de autoformalização em produção, independentemente de qual modelo tenha melhor pontuação em um quesito que nenhum dos fornecedores mediu da mesma forma.
Onde um roteador se encaixa neste pipeline
Nem o TwIL-LM3-Pro nem o MathForm-8B é uma rota no catálogo do OrcaRouter, e as razões diferem: um tem licença não comercial e nenhum endpoint hospedado, o outro é publicado como um checkpoint aberto para auto-hospedagem. A questão do roteamento num pipeline de formalização é a camada ao redor deles. Construir um corpus no estilo FormalVerse significa gerar milhares de problemas informais, filtrá-los quanto à boa formação e escrever as verificações de consistência semântica que avaliam a saída — todas chamadas de texto, e todo o tipo de trabalho em que você quer trocar o modelo que gera dados em massa pelo modelo que os julga sem um segundo contrato. Em um endpoint compatível com OpenAI à frente de mais de 200 modelos pelo preço de tabela do provedor com 0% de markup adicionado, essa troca é uma mudança de configuração, e um corte de preço do fornecedor no modelo de geração entra em vigor no mesmo dia. O failover automático é essencial numa construção de corpus especificamente porque um trabalho que morre dois terços do caminho numa passagem de geração custa a execução inteira.

A divisão do trabalho
Se a tarefa é transformar matemática de livros didáticos em declarações Lean compiláveis em escala, e o resultado tem de ser entregue em um produto comercial, o MathForm-8B é a ferramenta, e a licença Apache 2.0 é o motivo. Se a tarefa é decidir se um corpo de texto implica uma afirmação, rotular implicação, fazer parsing semântico ou criticar uma tentativa de prova, o TwIL-LM3-Pro abrange áreas que o MathForm nunca visou — e sua licença não comercial é um limite quanto a onde essa capacidade pode ser usada, não um ponto negativo contra a própria capacidade.
A combinação que faz sentido é um pipeline de dois estágios, em vez de uma escolha: um modelo emite a declaração formal, e o outro a julga. Ambos publicaram o pipeline que os produziu, o que é incomum neste porte e é a razão pela qual esta comparação pode ser feita.


