Um cartão de título gerado com o texto 'Clef vs MathForm-8B', com o subtítulo 'um responde à sua pergunta, o outro escreve uma prova', e chips com os dizeres 'Apache 2.0 nos dois' e 'dois fine-tunes do Qwen'. O logotipo do OrcaRouter está composto no canto inferior direito.
Engineering & Research

Clef vs MathForm-8B: Um Responde à Sua Pergunta, o Outro Escreve uma Prova

Autor

Elias Hawthorne

Data de publicação

Modelos mais recentes · 20Ver todos os modelos →
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

A razão de colocar Cloudflare/clef ao lado de openbmb/MathForm-8B é que eles são as duas coisas mais facilmente confundidas em pesos abertos neste momento, e confundi-las custa uma execução de treinamento. Ambos são ajustes finos construídos sobre os checkpoints Qwen3.8-27B e Qwen3-8B, respectivamente. Ambos são Apache-2.0. Ambos foram publicados nas últimas dez semanas. Ambos são de escopo estreito, criados para uma finalidade específica e descritos por seus criadores como especializados, e não gerais. E não têm absolutamente nada a ver um com o outro, porque um produz um número selecionado de uma lista que você forneceu e o outro produz código-fonte Lean 4, token por token, para um assistente de provas verificar.

A Clef é o modelo multimodal de decisão de 27 bilhões de parâmetros da Cloudflare: você fornece a ele um estado e um esquema de perguntas tipadas, e ele retorna uma probabilidade calibrada para cada resposta permitida em uma única passagem não autorregressiva, sem qualquer geração de texto no caminho. MathForm-8B, da OpenBMB, é um modelo de autoformalização — uma afirmação matemática em linguagem natural entra, Lean 4 sai, e o pipeline que o treinou é descrito em um preprint do arXiv publicado junto com os pesos em 14 de agosto de 2026. O teto de um modelo é o tamanho da sua lista de opções. O teto do outro é a força da teoria de tipos do Lean. Perguntar qual é melhor é um erro de categoria, e o fato de ambos serem ajustes finos de pesos abertos Apache-2.0 de oito a vinte e sete bilhões de parâmetros é exatamente o que torna o erro fácil de cometer.

O que a interface de cada modelo proíbe fisicamente

A maneira mais rápida de ver a divisão é ler o que cada um pode retornar.

• Entrada — Clef recebe um estado (texto, JSON, imagens ou quadros de vídeo) mais de 1 a 64 perguntas nomeadas e tipadas; MathForm-8B recebe uma entrada matemática em linguagem natural.

• Saída — Clef retorna uma probabilidade por opção permitida, com softmax por pergunta. MathForm-8B retorna código-fonte em Lean 4.

• Tipos de pergunta — os da Clef são noul (verdadeiro/falso, com a probabilidade de ser verdadeiro), escolha (2 a 26 opções nomeadas) e pontuação (2 a 26 níveis ordenados); o MathForm-8B não tem nenhum conceito de pergunta.

• Calibração — A Clef publica um campo de confiança por resposta; o MathForm-8B publica taxas Pass@8 sob verificações de sintaxe e consistência.

• Serviço — Clef é servido por meio de um corpo POST /v1/systemone compatível com Jev/SystemOne, hospedado ou autoexecutado; MathForm-8B vem com instruções para Transformers, vLLM e SGLang, todas expondo um endpoint de conclusão compatível com OpenAI em um contexto de 16.384 tokens com max_new_tokens definido como 16.384.

A consequência prática é imediata. Se você precisa de um julgamento sim/não sobre um trecho de texto, Clef é o único dos dois que pode produzi-lo — não há como fazer ao MathForm-8B uma pergunta que não seja "escreva o Lean 4 para isto". Se você precisa de Lean 4, Clef é o único dos dois que categoricamente não pode produzi-lo, e não por fraqueza: pedir a um pontuador vinculado a esquema que formalize um teorema não se encaixa no contrato dele, então o pedido é recusado por construção em vez de ser respondido mal.

A two-column comparison scoreboard titled 'Clef vs MathForm-8B — the scoreboard'. The left column 'Clef' reads: Parameters: 27B multimodal; Trained from: Qwen3.8-27B; Output: probability per option, no text; Context: 65,536 tokens; Interface: /v1/systemone, 1 to 64 typed questions; Evidence: vendor run, unreproduced. The right column 'MathForm-8B' reads: Parameters: 8B text-only; Trained from: Qwen3-8B; Output: Lean 4 source code; Context: 16,384 tokens; Interface: OpenAI-compatible completion; Evidence: paper, Pass@8 88.06% SC, 72.37% CC. A footer reads 'Clef figures per Cloudflare; MathForm figures per OpenBMB's paper. Neither independently reproduced.' The OrcaRouter logo is composited in the bottom-right corner.

O pipeline ao qual ambos pertencem

Existe uma arquitetura real na qual esses dois modelos ficam lado a lado, e vale a pena percorrê-la porque torna a divisão concreta, e não abstrata. Considere um serviço que formaliza a matemática para pesquisadores e estudantes.

As afirmações chegam em linguagem natural, ilimitadas em tipo. Antes que qualquer coisa possa ser formalizada, algo tem de decidir o que chegou. Isto é um teorema a provar, uma definição a adicionar, um pedido para verificar uma prova existente, ou uma pergunta que precisa de esclarecimento antes de alguém tocar no Lean? É autónomo, ou depende de contexto que o utilizador não forneceu? Os símbolos são convencionais, ou esta notação é algo que o sistema nunca viu? Cada uma dessas é uma pergunta limitada com um pequeno conjunto de opções — a forma exata do Clef — e a probabilidade calibrada associada a cada resposta é o que permite ao serviço fazer algo sensato com as incertas: encaminhar qualquer coisa abaixo de um limiar para um humano em vez de adivinhar.

O segundo passo pertence ao MathForm-8B. Tome um enunciado que já foi classificado como um teorema autocontido com notação conhecida e emita o Lean 4. Esse é um problema de geração, e a questão de qualidade é com que frequência a saída compila e com que frequência significa a mesma coisa que o original — que é precisamente o que os dois eixos de avaliação do fornecedor medem. Este é o padrão geral que vale a pena extrair do emparelhamento: um classificador barato e limitado à frente de um gerador especializado caro geralmente é mais barato e mais confiável do que instruir o gerador a decidir se ele deveria sequer estar em execução.

O que os números de cada lado realmente medem

O resumo no arXiv da OpenBMB relata que o MathForm-8B alcança taxas médias de Pass@8 de 88,06% na Verificação de Sintaxe e 72,37% na Verificação de Consistência em seis benchmarks, e que, nos subconjuntos FATE-H e FATE-X, obtém taxas de aprovação de consistência de 63% e 37%, ambas acima das baselines especializadas mais fortes com que o artigo compara. O pipeline de treinamento é a parte interessante da afirmação: um planejador de recuperação extrai definições relevantes e formalizações existentes do Mathlib antes da geração, e os enunciados gerados são então revisados usando diagnósticos do compilador e feedback de consistência semântica, que foi como o conjunto de dados FormalVerse, com cerca de 367.000 exemplos verificados de Lean 4, foi construído antes do ajuste fino supervisionado e da aprendizagem por reforço. Estes são números relatados pelo fornecedor, provenientes de um artigo e de um cartão de modelo. Ninguém independente os reproduziu.

Os números da Clef medem algo completamente diferente e não são comparáveis. O relatório de execução do Decision Index da Cloudflare apresenta macro-F1 de intenção do BANKING77 de 94,2, CLINC150 com tratamento de fora de escopo em 97,4, GPQA Diamond em 48,0 — enquanto o Jev mais antigo pontua 78,3 — e uma latência mediana de solicitação de 209,3 ms. É uma tabela sobre classificação e roteamento, produzida pelo fornecedor em sua própria suíte, hospedada no próprio leaderboard do fornecedor e não reproduzida.

A única frase honesta a escrever sobre estas duas colunas é que elas não compartilham nenhum benchmark, nenhuma unidade nem nenhuma filosofia de avaliação. Os 37% do MathForm-8B num subconjunto difícil de formalização e os 97,4 do Clef na detecção de intenções fora do escopo são ambas alegações reais dos seus criadores sobre tarefas diferentes, e um leitor que as coloque lado a lado não aprendeu nada, exceto que ambos os números existem.

O que você executaria, e quanto custa

Nenhum dos modelos é uma rota no OrcaRouter, e este artigo não faz nenhuma afirmação de disponibilidade — o catálogo retorna um 404 para cloudflare/clef e para MathForm-8B. O repositório MathForm mede cerca de 16,4 GB, e ambos os modelos são licenciados sob Apache-2.0, então ambos podem ser auto-hospedados amanhã por qualquer pessoa com o hardware.

• Clef na Cloudflare — $0,24 por milhão de tokens de entrada no Workers AI, com a latência publicada medida em um único H200.

• MathForm-8B auto-hospedado — sem hospedagem de fornecedor, sem preço por token e um contexto documentado de 16.384 tokens, o que é uma restrição que vale a pena notar: uma seção longa de artigo não caberá em uma única passagem.

• A alternativa roteada para a metade do classificador — Jev 1.13 da TypeSafe a US$ 0,042 por milhão de tokens de entrada em um contexto de 65.536 tokens, servida através do mesmo corpo do POST /v1/systemone que Clef usa, o que a torna uma opção de substituição direta para a primeira etapa do pipeline acima.

É aí que uma camada de roteamento justifica seu lugar nesse pareamento específico. O padrão é um decisor e um gerador, e a metade decisora é a que tem um substituto ativo — um endpoint na frente de mais de 200 modelos, preço de tabela do provedor repassado sem margem por token, e failover automático para que uma tarde ruim de um provedor não trave a porta de entrada do seu pipeline. A metade geradora é um artefato de 16,4 GB que você mesmo executa, e nenhum endpoint muda isso.

A headless capture of the openbmb/MathForm-8B model card on Hugging Face, showing the model title, the TextGeneration, Transformers and Safetensors tags, a link to the openbmb/FormalVerse dataset, the English language marker, and the qwen3, lean4, autoformalization, mathematics, formal-verification and reasoning subject tags.

Mais uma coisa que os tamanhos escondem

As contagens de parâmetros convidam a uma comparação que não se sustenta. O Clef tem 27B e o MathForm-8B tem 8B, então é natural supor que o modelo maior seja o mais capaz e o menor seja o especialista. É o contrário em natureza. O Clef é grande porque carrega um backbone multimodal congelado de que precisa para ler capturas de tela e faturas; a parte treinada por cima é uma pequena cabeça de schema com adaptadores de rank 256. O MathForm-8B é pequeno porque o Lean 4 é um alvo estreito e a base Qwen3-8B foi suficiente para atingi-lo, com a engenharia de verdade residindo no pipeline de recuperação e verificação que produziu seus dados de treinamento, e não na sua contagem de parâmetros.

O tamanho, em outras palavras, diz o que cada modelo teve de carregar, não o quão difícil é o problema que ele resolve. Um modelo de 27B que lê um recibo e retorna “cobrança, 0,98” e um de 8B que emite Lean compilável estão ambos fazendo exatamente aquilo para que foram feitos, e o enquadramento de oito bilhões versus vinte e sete bilhões vai levar você ao modelo errado em cerca de metade das vezes.

A headless capture of the OrcaRouter model page for typesafe/jev-1.13, showing the TypeSafe breadcrumb, the Jev 1.13 title, text input and output modality labels, a p50 TTFT latency figure, the Performance and Public benchmarks tabs, and the code-sample panel.

A decisão, e a pergunta que nenhum dos fornecedores respondeu

Se você tem um pipeline que ingere linguagem natural ilimitada e precisa encaminhá-la antes de gastar poder computacional com ela, o primeiro passo é um classificador limitado — Clef, onde sua entrada multimodal importa e seus números parecem bons nos seus dados, ou Jev 1.13, onde você quer o mesmo formato de requisição a um preço de tabela menor e sem vincular sua arquitetura a um fornecedor cuja avaliação ninguém conseguiu reproduzir. O segundo passo é um gerador especialista e, se esse gerador for Lean 4, o MathForm-8B é o modelo aberto criado exatamente para isso, com um pipeline publicado e um corpus por trás dele.

O que falta em ambos os lados é o mesmo tipo de evidência. A execução do Decision Index da Clef é da própria Cloudflare e nunca foi repetida de forma independente; os números de Pass@8 do MathForm-8B vêm do próprio artigo dele. Ambas são alegações ambiciosas numa área em que o teste honesto é barato de descrever e caro de executar — pegue dados com os quais nenhum dos fornecedores treinou, aplique o mesmo pipeline e publique o resultado. Até que alguém faça isso para qualquer um dos modelos, a coisa útil que esta comparação pode lhe dizer é um formato: um deles pertence à frente do seu pipeline, decidindo o que chega, e o outro pertence atrás dele, fazendo o trabalho árduo e específico, e nenhum substitui o outro em qualquer número de parâmetros.