
Solar Mini 4 vs MathForm 8B: Um Modelo Responde à Pergunta, o Outro Torna-a Verificável
- openaiNOVOOpenAI: GPT-6.1 Sol2026-09-29$2.00 / $10.00 por 1M de tokens
- anthropicNOVOAnthropic: Claude Sonnet 5.52026-09-28$2.00 / $10.00 por 1M de tokens · 159 tok/s
- typesafeNOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 220 tok/s
- OpenAINOVOOpenAI: GPT-6 Luna2026-09-2238Inteligência
- OpenAINOVOOpenAI: GPT-6 Sol2026-09-2248Inteligência
- AnthropicNOVOAnthropic: Claude Opus 5.52026-09-2258Inteligência
- xAINOVOGrok 4.72026-09-2146Inteligência
- OrcaNOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 118 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 102 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 217 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
Coloque o Solar Mini 4 ao lado do MathForm 8B e você estará comparando dois modelos que não competem pelo mesmo token. O Solar Mini 4 é a mistura esparsa de especialistas de 35 bilhões de parâmetros da Upstage, lançada em 22 de setembro de 2026 com cerca de 3 bilhões de parâmetros ativos por token, e ele responde a perguntas: ler um documento longo, raciocinar sobre ele, retornar um resultado escrito. O MathForm 8B é o autoformalizador de 8 bilhões de parâmetros da OpenBMB, publicado em 14 de agosto de 2026 sob a licença Apache 2.0, e faz algo que nenhum modelo de raciocínio faz de forma alguma — ele pega um enunciado matemático em linguagem natural e o reescreve como um teorema Lean 4 que passará pela checagem de tipos do compilador de um assistente de provas. Um produz respostas. O outro produz perguntas verificáveis por máquina, e o segundo é o recurso mais raro.
Vale a pena fazer a comparação de qualquer forma, porque ambos acabam no mesmo tipo de pipeline e porque os dois têm pontos fortes opostos de um modo que torna a escolha incomumente simples. O modelo da Upstage é forte em documentos longos, fraco em raciocínio difícil e caro por tarefa concluída. O modelo da OpenBMB é restrito a ponto de ser inútil fora do seu nicho, nunca foi avaliado por um avaliador independente e não custa nada para executar depois que você tem uma GPU.
Lado a lado, sobre as coisas que diferem
• O que é — O Solar Mini 4 é um modelo de raciocínio geral com contexto de 1M tokens (512K segundo a própria documentação da Upstage) e uma pontuação medida de 24,1 no Artificial Analysis Intelligence Index. O MathForm 8B é um autoformalizador de tarefa única, sem pontuação publicada no índice, sem avaliação independente e sem alegações de capacidade geral.
• Parâmetros — 35B no total / 3B ativos, esparso, para o Solar Mini 4; 8,19B denso para o MathForm 8B, com ajuste fino a partir do Qwen3-8B no corpus FormalVerse da OpenBMB de aproximadamente 367.000 exemplos verificados de Lean 4.
• Licença e entrega — Solar Mini 4 é proprietário, acessado através da API da Upstage e de plataformas de terceiros. MathForm 8B são pesos Apache-2.0 com um template de chat, quatro shards de safetensors, e um caminho de implantação Transformers, vLLM ou SGLang por trás de um endpoint compatível com OpenAI.
• Preço — Solar Mini 4 a $0,10 / $0,01 em cache / $0,40 por milhão de tokens, atualmente com 50% de desconto até 22 de outubro de 2026. O MathForm 8B não tem tabela de preços; seu custo é a GPU que você coloca embaixo dele.
• Velocidade — 204 tokens de saída por segundo para o Solar Mini 4 no harness da Artificial Analysis, com 88.300 tokens de saída por tarefa de índice e cerca de 430 segundos de trabalho por tarefa. A saída do MathForm 8B é um cabeçalho de teorema Lean 4, algumas centenas de tokens no máximo.
• Independência dos seus números — O Solar Mini 4 foi executado por terceiros. O MathForm 8B não: cada número no seu artigo é dos próprios autores, e o modelo é demasiado novo e demasiado especializado para ter atraído uma execução independente.
Onde os dois modelos se encontram, e onde não

Os modos de falha são o que torna este pareamento interessante, porque são exatamente opostos. O resultado publicado mais fraco do Solar Mini 4 é o Terminal-Bench 4.0, com 1%, e o AutomationBench-AA, com 22,3% — ele é ruim em verificar o próprio trabalho em um ambiente que lhe dá feedback. Toda a premissa de design do MathForm 8B é a verificação: a OpenBMB distingue um Syntax Check, que pergunta se a declaração em Lean 4 compila, de um Consistency Check, que pergunta se a declaração que compilou realmente significa a mesma coisa que o problema informal. A falha clássica que ele existe para prevenir é uma declaração que passa na verificação de tipos enquanto enfraquece silenciosamente a afirmação.
Isso é uma distinção real e vale a pena ser preciso a respeito dela. Um modelo de raciocínio que produz uma prova tem um problema de autoverificação bem conhecido: nada na geração lhe diz se a resposta está certa. Um compilador diz. Se o seu fluxo de trabalho é "converter um banco de problemas em algo que uma máquina possa verificar", o MathForm 8B está fazendo a metade do trabalho que o Solar Mini 4 não consegue fazer de forma alguma, e o que sobra não é uma questão de grau.
Os números do fornecedor, rotulados como tal: o artigo da OpenBMB relata uma média de Pass@8 de 88,06% sob Verificação de Sintaxe e 72,37% sob Verificação de Consistência em seis benchmarks, e afirma que eles superam vários autoformalizadores especializados de 32B. Nada disso foi reproduzido por terceiros. A queda de 16 pontos entre as duas verificações é o número mais informativo — ela mede com que frequência uma declaração compilada não é exatamente o problema sobre o qual você perguntou, e é a razão pela qual a Verificação de Consistência existe como uma coluna separada.
Por que uma equipe executaria ambos
Porque o pipeline natural tem um estágio barato e de grande volume e um estágio caro e de baixo volume. O MathForm 8B roda no seu próprio hardware e converte problemas informais em cabeçalhos Lean 4, com um compilador disponível para rejeitar saídas ruins antes que um humano as veja. O Solar Mini 4 cuida do que acontece ao redor disso: ler o artigo de apoio, extrair as premissas, resumir o resultado em coreano ou inglês e encaminhar o trabalho. Os dois nunca competem pela mesma solicitação, e o menor é o que detém a parte do trabalho com um sinal objetivo de aprovação ou reprovação.
Nenhum dos modelos é algo que possamos encaminhar para você — os modelos da Upstage não estão no OrcaRouter, e os da OpenBMB também não — então, se você quiser o Solar Mini 4, ele vem da própria API da Upstage, e se você quiser o MathForm 8B, ele vem do Hugging Face e da sua própria GPU. O que podemos fazer é colocar o resto desse pipeline atrás de uma única chave: mais de 200 modelos com 0% de acréscimo sobre o preço de tabela do provedor, failover automático entre provedores, e uma DSL de roteamento que permite encadear modelos em uma única chamada. Em um fluxo de trabalho em que um pequeno especialista faz a etapa de formalização e um grande generalista faz tudo ao redor dela, poder trocar o generalista editando uma string de modelo — em vez de lançar uma nova integração — é a diferença entre uma mudança de duas semanas e uma tarde.

O que levar
Se a sua pergunta é “qual destes devo usar”, a resposta honesta é que depende de você precisar de uma resposta ou de uma formalização, e nenhum benchmark vai resolver isso. Se a sua pergunta é “o MathForm 8B vale o download”, a resposta é sim para um trabalho específico e restrito e não para qualquer outra coisa — ele é um formalizador, não um provador, e a obrigação de prova permanece em aberto na saída que ele produz. Se a sua pergunta é “o Solar Mini 4 vale $0.36 por tarefa”, a resposta é sim para documentos longos em volume e não para qualquer coisa que exija que ele verifique o próprio trabalho.

Fontes, para encerrar. Todos os números do Solar Mini 4 acima são medições independentes da Artificial Analysis, exceto a janela de contexto, que é um número da própria Upstage e diverge do deles. Todos os números do MathForm 8B são relatados pelo fornecedor, provenientes do arXiv 2608.14221, e não foram reproduzidos, e o seu lançamento foi feito sem anúncio — os pesos, o conjunto de dados FormalVerse e o artigo surgiram todos a 14 de agosto de 2026, sem qualquer publicação no blogue do fornecedor e sem qualquer avaliação de referência independente até à data.
