Card de destaque gerado para Kolibri vs MathForm 8B, intitulado 'Kolibri vs MathForm 8B', com a linha de apoio 'um generalista contra um autoformalizador Lean 4', um ícone de beija-flor à esquerda e um símbolo de quadrado de prova à direita, em ambos os lados de um fino divisor. O logotipo OrcaRouter fica na faixa abaixo da arte.
Guides & Insights

Kolibri vs MathForm-8B: Uma dessas alegações de precisão pode ser verificada por um compilador

Autor

Magnus Corvin

Data de publicação

Modelos mais recentes · 20Ver todos os modelos →
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Kolibri e MathForm-8B compartilham uma licença e quase nada mais. Ambos são Apache 2.0, ambos são de pesos abertos, ambos foram lançados nos últimos três meses — o Kolibri da Aleph Alpha em 3 de outubro de 2026, o MathForm-8B da OpenBMB em 14 de agosto de 2026 — e ambos dedicam grande parte de suas fichas de modelo à matemática. É aí que termina a semelhança. Kolibri é um modelo de mistura de especialistas de 78,1 bilhões de parâmetros, em alemão e inglês, que ativa 3,46 bilhões de parâmetros por token e deve integrar um fluxo de trabalho documental regulado. MathForm-8B é um modelo denso de 8 bilhões de parâmetros, com ajuste fino a partir do Qwen3-8B, com uma única função: pegar um problema de matemática escrito em inglês comum e emitir um enunciado Lean 4 formalmente correto a partir dele. A diferença que importa para quem avalia qualquer um dos dois não é a contagem de parâmetros. É que a alegação de acurácia do MathForm-8B é executável. Você pode verificar sua saída com um compilador. A do Kolibri não pode ser verificada por nada além de outra execução de benchmark.

Essa assimetria é o artigo inteiro, e ela se generaliza muito além desses dois modelos. Uma tabela de benchmark de fornecedor é uma alegação. Um assistente de provas aceitar uma formalização é um resultado. Quando todo o espaço de saída de um modelo é algo que uma máquina pode verificar, a camada de marketing desaparece — ou o compilador Lean aceita a afirmação, ou não aceita, e nenhum enquadramento de post de lançamento consegue mudar isso.

O que o MathForm-8B realmente produz

A autoformalização é uma tarefa restrita, pouco glamorosa e genuinamente difícil, e o cartão do modelo é agradavelmente específico quanto à configuração.

• Entrada e saída — entra uma afirmação matemática em linguagem natural, sai uma formalização em Lean 4, completa com um cabeçalho de teorema.

• Modelo base — Qwen/Qwen3-8B, com ajuste fino; Apache 2.0, juntamente com o restante do lançamento da OpenBMB.

• Treinamento — ajuste fino supervisionado seguido de aprendizado por reforço no conjunto de dados FormalVerse, com compilação Lean e feedback de consistência semântica impulsionando o sinal de reforço.

• Pipeline de dados — recuperação de conhecimento do Mathlib, compilação e verificação semântica, refinamento iterativo e, em seguida, reconstrução de trajetória. O diagrama do pipeline no cartão do modelo é a coisa mais informativa do lançamento.

• Avaliação — taxas de aprovação Pass@8 sob duas verificações separadas, Verificação de Sintaxe e Verificação de Consistência, em seis benchmarks, relatadas como uma média macro igualmente ponderada em uma figura no cartão, em vez de como uma tabela que possamos citar linha por linha.

• Toolchain — um Kimina Lean Server em execução para as verificações de compilação, Lean 4.21.0 para os experimentos, e uma sequência máxima de 16.384 tokens com temperatura 0,6 e top-p 0,95.

• Serving — vLLM ou SGLang com um contexto de 16.384 tokens, exposto por meio de uma interface de chat compatível com OpenAI. Esse último detalhe importa mais do que parece, porque significa que o modelo se encaixa em um pipeline existente como um endpoint comum.

Observe as duas verificações separadas. A Verificação de Sintaxe é se a declaração Lean é sequer analisada sintaticamente e verificada quanto a tipos. A Verificação de Consistência é se a declaração formal significa a mesma coisa que o problema em linguagem natural — uma propriedade muito mais difícil, porque uma declaração Lean sintaticamente válida que formaliza o teorema errado é pior do que um erro de compilação. O OpenBMB relata ambos, o que é exatamente a maneira correta de fazer isso e é a razão pela qual esta tarefa tem uma história de verificação que o raciocínio de propósito geral não tem.

O que o Kolibri faz com a matemática e por que ele é um tipo diferente de número

Kolibri é bom em matemática no sentido de benchmark. No próprio harness de pós-treinamento da Aleph Alpha, com esforço de raciocínio alto, ele pontua 96,9 no AIME 2025 em inglês e 87,5 em alemão, 96,0 e 90,0 no AIME 2026, e uma média de 96,5 em inglês em sua suíte de matemática, contra 88,8 em alemão. Para contexto na mesma tabela, o 96,9 de Kolibri no AIME 2025 em inglês fica acima do Nemotron 3 Super 120B-A12B com 91,7 e do Qwen3.6 35B-A3B com 84,6, e logo abaixo do Qwen3.8 27B com 97,9.

Todos esses números são relatados pelo fornecedor, em um harness do fornecedor, sem reprodução independente, e não há página do Artificial Analysis para o Kolibri com a qual fazer uma verificação cruzada. Isso não é uma crítica aos números; é uma constatação sobre que tipo de objeto eles são. Uma pontuação no AIME é uma porcentagem de respostas finais corretas em um exame de múltipla escolha. Ela diz que o modelo consegue chegar a um número inteiro. Não diz nada sobre se o raciocínio que a produziu era sólido, e não há artefato algum deixado para trás que um terceiro possa inspecionar.

Colocada ao lado da saída do MathForm-8B, essa diferença é gritante. A resposta do Kolibri a um problema da AIME é um número. A saída do MathForm-8B é um enunciado de teorema em Lean 4 que ou compila contra a Mathlib, ou não. Se você está construindo um sistema no qual uma afirmação matemática precisa ser defensável — um pipeline de verificação formal, um fluxo de trabalho de assistente de provas, uma trilha de auditoria —, o segundo artefato vale consideravelmente mais do que o primeiro, e nenhuma linha de benchmark expressa isso.

Generated two-column scoreboard for Kolibri and MathForm-8B. Left column Kolibri: purpose 'general reasoning', output 'free-form text', checkable 'no, benchmark only', parameters '78.1B MoE, 3.46B active', context '262,144 native, 1M validated', licence Apache 2.0. Right column MathForm-8B: purpose 'Lean 4 autoformalization', output 'Lean 4 theorem statements', checkable 'yes, a compiler checks it', parameters '8B dense', context 16,384, licence Apache 2.0. The footer reads 'Kolibri figures vendor-reported; MathForm-8B Pass@8 per its model card.'

Onde os dois realmente se encontrariam

Enquadrada como uma luta, esta disputa não é interessante: um especialista de 8B vence um generalista de 78B em formalizar matemática e perde em todo o resto, incluindo prosa administrativa alemã, raciocínio em documentos de contexto longo e chamada de ferramentas ao longo de uma trajetória de agente de cem passos. Mas os dois não são substitutos, e a pergunta útil é como se parece um pipeline construído a partir de ambos.

A composição natural é de roteamento. Um generalista com forte raciocínio e chamadas de ferramentas cuida da ingestão, da desambiguação e da recuperação; um especialista é invocado para os dois por cento dos casos que precisam de um artefato formal. Fazer isso manualmente significa dois fornecedores, dois contratos, dois SDKs, dois conjuntos de credenciais e uma camada de despacho que alguém mantém. É o caso em que um único endpoint se justifica: uma chave compatível com OpenAI, uma regra de roteamento que envia as solicitações com formato matemático para o endpoint de formalização e todo o resto para o generalista, e failover quando um deles está lento. Esse é o trabalho da DSL de roteamento — compor vários modelos em uma única chamada em vez de fixar uma escolha no momento do desenvolvimento — e, onde um painel de modelos respondendo em conjunto é útil, a fusão de modelos cobre isso. Nem o Kolibri nem o MathForm-8B estão no OrcaRouter hoje; procuramos no catálogo por ambos sob todas as grafias de fornecedor e modelo e nenhum dos dois está lá. O argumento de composição é sobre a forma do problema, não sobre esses dois endpoints específicos.

O que está no catálogo é a metade generalista desse padrão a um preço que dá para medir. O Qwen3.8-27B está listado a US$ 0,33 por milhão de tokens de entrada e US$ 2,40 de saída, com uma janela de 262.144 tokens, e o Qwen3.8-Max a US$ 2,00 e US$ 6,00 com uma janela de 1 milhão de tokens. Para uma equipe que está avaliando se vale a pena, afinal, acrescentar uma etapa de formalização a um pipeline de documentos, o experimento barato é encaminhar o trabalho generalista para lá, medir o volume de solicitações que realmente precisam de um artefato Lean e só então decidir se vale a pena provisionar um endpoint especializado de 16.384 tokens. O preço de tabela do provedor é repassado sem nada acrescentado por token, então os números mudam no dia em que um fornecedor os mudar.

Screenshot of the OrcaRouter model page for qwen/qwen3.8-27b, showing the 256K-token context badge, fine-tuning with self-serve deployment, text, image and video input with text output, the Vision, Tools, JSON and Reasoning capability tags, a p50 time-to-first-token of 1.88 seconds, the attribution 'Public benchmarks by Qwen - 2026-08-13', the description as Alibaba's open-weight 27B dense multimodal model released under Apache-2.0 and self-hosted on OrcaRouter's own infrastructure, with a dedicated vision tower, the pricing tiles $0.33 and $2.40, and the pricing block listing $0.330 per million input tokens and $2.40 per million output tokens.

A licença é a única linha em que são idênticos.

Ambos são Apache 2.0 e, numa categoria em que licenças de investigação à medida e cláusulas de uso aceitável são comuns, isso é um ponto genuíno que vale a pena mencionar — significa que nenhum dos modelos exige uma revisão jurídica antes de poder ser usado comercialmente, modificado ou redistribuído.

As obrigações divergem em outros pontos. O Kolibri traz uma pegada de pesos de aproximadamente 78 GB e um requisito mínimo de hardware de duas placas A100 80 GB, duas H100 SXM5, uma H200, uma B200 ou uma B300, além do pacote aleph-alpha-inference do fornecedor e do plugin vLLM. O MathForm-8B em bfloat16 tem cerca de 16 GB de pesos e é executado em um único acelerador moderno com um contexto de 16.384 tokens; suas dependências são um toolchain Lean e, para o pipeline de avaliação, um Kimina Lean Server em execução. Uma dessas implantações cabe em uma estação de trabalho. A outra não.

Os números de contexto apontam no sentido oposto, e por uma margem ampla. A janela nativa do Kolibri é de 262.144 tokens, validada para 1.048.576, e é isso que faz dele um modelo de documentos: um documento regulatório alemão completo ou um manual de manutenção aeroespacial cabe em uma única chamada. O MathForm-8B é limitado a 16.384 tokens por design, porque uma solicitação de formalização é um único enunciado de problema e não há razão para que seja mais longa. Nenhum dos números é uma deficiência. Eles simplesmente descrevem tarefas diferentes.

Screenshot of the Hugging Face model card for openbmb/MathForm-8B, showing the apache-2.0 licence badge, the pipeline figure caption describing Mathlib knowledge retrieval, compilation and semantic verification, iterative refinement, trajectory reconstruction and training, and the start of the Results table with the MATHFORM-8B-SFT and MATHFORM-8B rows above the specialist autoformalizers including Goedel-Formalizer-V2-8B, StepFun-Formalizer-7B and Kimina-Autoformalizer-7B.

Escolher, e a pergunta de verificação logo abaixo

• Escolha o MathForm-8B se a sua saída precisar ser verificável. Se um sistema a jusante consumir Lean 4, ou se o ponto central for que um assistente de provas valide o resultado, nenhum generalista o substitui, e os números de Pass@8 em Verificação de Sintaxe e Verificação de Consistência são os que devem ser examinados, em vez de qualquer linha do AIME.

• Escolha o Kolibri se precisar de um modelo que lê documentos em alemão e inglês com contexto longo, raciocina entre eles, chama ferramentas, abstém-se quando o contexto não sustenta uma resposta e pode ser implantado dentro do seu próprio perímetro sob uma licença que pode enunciar numa única linha. A matemática é uma capacidade que ele tem, não um produto que ele é.

• Considere ambos se estiver construindo um pipeline de formalização. Não como alternativas, mas como dois endpoints por trás de uma única regra de roteamento, com o especialista chamado para a pequena fatia de solicitações que precisam dele.

E se você estiver avaliando qualquer um dos dois com base na força de um número de benchmark, aplique primeiro um teste: pergunte que artefato o número deixa para trás. Para o MathForm-8B, há um arquivo Lean e um compilador que o aceita ou não, e você pode executar ambos você mesmo hoje à tarde. Para o Kolibri, há uma porcentagem em uma tabela de lançamento, relatada pelo fornecedor, não reproduzida, sem uma página de índice independente para conferir — e a única maneira de refutá-la é baixar 78 GB de pesos, alugar o hardware e executar novamente o harness. Essa assimetria vale mais do que a própria pontuação quando você está decidindo o que colocar em produção.