
Clef vs MathForm-8B: Um Responde à Sua Pergunta, o Outro Escreve uma Prova
- openaiNOVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligência
- anthropicNOVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligência
- typesafeNOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 219 tok/s
- OpenAINOVOOpenAI: GPT-6 Luna2026-09-2238Inteligência
- OpenAINOVOOpenAI: GPT-6 Sol2026-09-2248Inteligência
- AnthropicNOVOAnthropic: Claude Opus 5.52026-09-2258Inteligência
- xAINOVOGrok 4.72026-09-2146Inteligência
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 114 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1064 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 41 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 105 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 213 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
A razão de colocar Cloudflare/clef ao lado de openbmb/MathForm-8B é que eles são as duas coisas mais facilmente confundidas em pesos abertos neste momento, e confundi-las custa uma execução de treinamento. Ambos são ajustes finos construídos sobre os checkpoints Qwen3.8-27B e Qwen3-8B, respectivamente. Ambos são Apache-2.0. Ambos foram publicados nas últimas dez semanas. Ambos são de escopo estreito, criados para uma finalidade específica e descritos por seus criadores como especializados, e não gerais. E não têm absolutamente nada a ver um com o outro, porque um produz um número selecionado de uma lista que você forneceu e o outro produz código-fonte Lean 4, token por token, para um assistente de provas verificar.
A Clef é o modelo multimodal de decisão de 27 bilhões de parâmetros da Cloudflare: você fornece a ele um estado e um esquema de perguntas tipadas, e ele retorna uma probabilidade calibrada para cada resposta permitida em uma única passagem não autorregressiva, sem qualquer geração de texto no caminho. MathForm-8B, da OpenBMB, é um modelo de autoformalização — uma afirmação matemática em linguagem natural entra, Lean 4 sai, e o pipeline que o treinou é descrito em um preprint do arXiv publicado junto com os pesos em 14 de agosto de 2026. O teto de um modelo é o tamanho da sua lista de opções. O teto do outro é a força da teoria de tipos do Lean. Perguntar qual é melhor é um erro de categoria, e o fato de ambos serem ajustes finos de pesos abertos Apache-2.0 de oito a vinte e sete bilhões de parâmetros é exatamente o que torna o erro fácil de cometer.
O que a interface de cada modelo proíbe fisicamente
A maneira mais rápida de ver a divisão é ler o que cada um pode retornar.
• Entrada — Clef recebe um estado (texto, JSON, imagens ou quadros de vídeo) mais de 1 a 64 perguntas nomeadas e tipadas; MathForm-8B recebe uma entrada matemática em linguagem natural.
• Saída — Clef retorna uma probabilidade por opção permitida, com softmax por pergunta. MathForm-8B retorna código-fonte em Lean 4.
• Tipos de pergunta — os da Clef são noul (verdadeiro/falso, com a probabilidade de ser verdadeiro), escolha (2 a 26 opções nomeadas) e pontuação (2 a 26 níveis ordenados); o MathForm-8B não tem nenhum conceito de pergunta.
• Calibração — A Clef publica um campo de confiança por resposta; o MathForm-8B publica taxas Pass@8 sob verificações de sintaxe e consistência.
• Serviço — Clef é servido por meio de um corpo POST /v1/systemone compatível com Jev/SystemOne, hospedado ou autoexecutado; MathForm-8B vem com instruções para Transformers, vLLM e SGLang, todas expondo um endpoint de conclusão compatível com OpenAI em um contexto de 16.384 tokens com max_new_tokens definido como 16.384.
A consequência prática é imediata. Se você precisa de um julgamento sim/não sobre um trecho de texto, Clef é o único dos dois que pode produzi-lo — não há como fazer ao MathForm-8B uma pergunta que não seja "escreva o Lean 4 para isto". Se você precisa de Lean 4, Clef é o único dos dois que categoricamente não pode produzi-lo, e não por fraqueza: pedir a um pontuador vinculado a esquema que formalize um teorema não se encaixa no contrato dele, então o pedido é recusado por construção em vez de ser respondido mal.

O pipeline ao qual ambos pertencem
Existe uma arquitetura real na qual esses dois modelos ficam lado a lado, e vale a pena percorrê-la porque torna a divisão concreta, e não abstrata. Considere um serviço que formaliza a matemática para pesquisadores e estudantes.
As afirmações chegam em linguagem natural, ilimitadas em tipo. Antes que qualquer coisa possa ser formalizada, algo tem de decidir o que chegou. Isto é um teorema a provar, uma definição a adicionar, um pedido para verificar uma prova existente, ou uma pergunta que precisa de esclarecimento antes de alguém tocar no Lean? É autónomo, ou depende de contexto que o utilizador não forneceu? Os símbolos são convencionais, ou esta notação é algo que o sistema nunca viu? Cada uma dessas é uma pergunta limitada com um pequeno conjunto de opções — a forma exata do Clef — e a probabilidade calibrada associada a cada resposta é o que permite ao serviço fazer algo sensato com as incertas: encaminhar qualquer coisa abaixo de um limiar para um humano em vez de adivinhar.
O segundo passo pertence ao MathForm-8B. Tome um enunciado que já foi classificado como um teorema autocontido com notação conhecida e emita o Lean 4. Esse é um problema de geração, e a questão de qualidade é com que frequência a saída compila e com que frequência significa a mesma coisa que o original — que é precisamente o que os dois eixos de avaliação do fornecedor medem. Este é o padrão geral que vale a pena extrair do emparelhamento: um classificador barato e limitado à frente de um gerador especializado caro geralmente é mais barato e mais confiável do que instruir o gerador a decidir se ele deveria sequer estar em execução.
O que os números de cada lado realmente medem
O resumo no arXiv da OpenBMB relata que o MathForm-8B alcança taxas médias de Pass@8 de 88,06% na Verificação de Sintaxe e 72,37% na Verificação de Consistência em seis benchmarks, e que, nos subconjuntos FATE-H e FATE-X, obtém taxas de aprovação de consistência de 63% e 37%, ambas acima das baselines especializadas mais fortes com que o artigo compara. O pipeline de treinamento é a parte interessante da afirmação: um planejador de recuperação extrai definições relevantes e formalizações existentes do Mathlib antes da geração, e os enunciados gerados são então revisados usando diagnósticos do compilador e feedback de consistência semântica, que foi como o conjunto de dados FormalVerse, com cerca de 367.000 exemplos verificados de Lean 4, foi construído antes do ajuste fino supervisionado e da aprendizagem por reforço. Estes são números relatados pelo fornecedor, provenientes de um artigo e de um cartão de modelo. Ninguém independente os reproduziu.
Os números da Clef medem algo completamente diferente e não são comparáveis. O relatório de execução do Decision Index da Cloudflare apresenta macro-F1 de intenção do BANKING77 de 94,2, CLINC150 com tratamento de fora de escopo em 97,4, GPQA Diamond em 48,0 — enquanto o Jev mais antigo pontua 78,3 — e uma latência mediana de solicitação de 209,3 ms. É uma tabela sobre classificação e roteamento, produzida pelo fornecedor em sua própria suíte, hospedada no próprio leaderboard do fornecedor e não reproduzida.
A única frase honesta a escrever sobre estas duas colunas é que elas não compartilham nenhum benchmark, nenhuma unidade nem nenhuma filosofia de avaliação. Os 37% do MathForm-8B num subconjunto difícil de formalização e os 97,4 do Clef na detecção de intenções fora do escopo são ambas alegações reais dos seus criadores sobre tarefas diferentes, e um leitor que as coloque lado a lado não aprendeu nada, exceto que ambos os números existem.
O que você executaria, e quanto custa
Nenhum dos modelos é uma rota no OrcaRouter, e este artigo não faz nenhuma afirmação de disponibilidade — o catálogo retorna um 404 para cloudflare/clef e para MathForm-8B. O repositório MathForm mede cerca de 16,4 GB, e ambos os modelos são licenciados sob Apache-2.0, então ambos podem ser auto-hospedados amanhã por qualquer pessoa com o hardware.
• Clef na Cloudflare — $0,24 por milhão de tokens de entrada no Workers AI, com a latência publicada medida em um único H200.
• MathForm-8B auto-hospedado — sem hospedagem de fornecedor, sem preço por token e um contexto documentado de 16.384 tokens, o que é uma restrição que vale a pena notar: uma seção longa de artigo não caberá em uma única passagem.
• A alternativa roteada para a metade do classificador — Jev 1.13 da TypeSafe a US$ 0,042 por milhão de tokens de entrada em um contexto de 65.536 tokens, servida através do mesmo corpo do POST /v1/systemone que Clef usa, o que a torna uma opção de substituição direta para a primeira etapa do pipeline acima.
É aí que uma camada de roteamento justifica seu lugar nesse pareamento específico. O padrão é um decisor e um gerador, e a metade decisora é a que tem um substituto ativo — um endpoint na frente de mais de 200 modelos, preço de tabela do provedor repassado sem margem por token, e failover automático para que uma tarde ruim de um provedor não trave a porta de entrada do seu pipeline. A metade geradora é um artefato de 16,4 GB que você mesmo executa, e nenhum endpoint muda isso.

Mais uma coisa que os tamanhos escondem
As contagens de parâmetros convidam a uma comparação que não se sustenta. O Clef tem 27B e o MathForm-8B tem 8B, então é natural supor que o modelo maior seja o mais capaz e o menor seja o especialista. É o contrário em natureza. O Clef é grande porque carrega um backbone multimodal congelado de que precisa para ler capturas de tela e faturas; a parte treinada por cima é uma pequena cabeça de schema com adaptadores de rank 256. O MathForm-8B é pequeno porque o Lean 4 é um alvo estreito e a base Qwen3-8B foi suficiente para atingi-lo, com a engenharia de verdade residindo no pipeline de recuperação e verificação que produziu seus dados de treinamento, e não na sua contagem de parâmetros.
O tamanho, em outras palavras, diz o que cada modelo teve de carregar, não o quão difícil é o problema que ele resolve. Um modelo de 27B que lê um recibo e retorna “cobrança, 0,98” e um de 8B que emite Lean compilável estão ambos fazendo exatamente aquilo para que foram feitos, e o enquadramento de oito bilhões versus vinte e sete bilhões vai levar você ao modelo errado em cerca de metade das vezes.

A decisão, e a pergunta que nenhum dos fornecedores respondeu
Se você tem um pipeline que ingere linguagem natural ilimitada e precisa encaminhá-la antes de gastar poder computacional com ela, o primeiro passo é um classificador limitado — Clef, onde sua entrada multimodal importa e seus números parecem bons nos seus dados, ou Jev 1.13, onde você quer o mesmo formato de requisição a um preço de tabela menor e sem vincular sua arquitetura a um fornecedor cuja avaliação ninguém conseguiu reproduzir. O segundo passo é um gerador especialista e, se esse gerador for Lean 4, o MathForm-8B é o modelo aberto criado exatamente para isso, com um pipeline publicado e um corpus por trás dele.
O que falta em ambos os lados é o mesmo tipo de evidência. A execução do Decision Index da Clef é da própria Cloudflare e nunca foi repetida de forma independente; os números de Pass@8 do MathForm-8B vêm do próprio artigo dele. Ambas são alegações ambiciosas numa área em que o teste honesto é barato de descrever e caro de executar — pegue dados com os quais nenhum dos fornecedores treinou, aplique o mesmo pipeline e publique o resultado. Até que alguém faça isso para qualquer um dos modelos, a coisa útil que esta comparação pode lhe dizer é um formato: um deles pertence à frente do seu pipeline, decidindo o que chega, e o outro pertence atrás dele, fazendo o trabalho árduo e específico, e nenhum substitui o outro em qualquer número de parâmetros.
