
Clef vs Qwen3.8-27B: Um Backbone, Dois Contratos de Saída
- openaiNOVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligência
- anthropicNOVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligência
- typesafeNOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 219 tok/s
- OpenAINOVOOpenAI: GPT-6 Luna2026-09-2238Inteligência
- OpenAINOVOOpenAI: GPT-6 Sol2026-09-2248Inteligência
- AnthropicNOVOAnthropic: Claude Opus 5.52026-09-2258Inteligência
- xAINOVOGrok 4.72026-09-2146Inteligência
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 114 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1064 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 41 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 105 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 213 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
Clef não consegue escrever uma frase, e é construído a partir de um modelo que consegue. O Cloudflare/clef é um modelo de decisão multimodal de 27 bilhões de parâmetros: você entrega a ele um estado e um esquema de perguntas tipadas, e ele retorna uma probabilidade para cada opção permitida sem produzir um token de prosa. A espinha dorsal por baixo dele é Qwen3.8-27B, um modelo denso de visão-linguagem com pesos abertos, congelado no lugar com uma pequena cabeça extra acoplada. Isso faz desta uma das poucas páginas de modelo contra modelo em que os dois lados não são rivais de modo algum — eles são um checkpoint e seu derivado, compartilhando 55 gigabytes de pesos e discordando sobre se a resposta é algo que você lê ou algo com que você computa.
Os pesos de ambos tornaram-se públicos antes das palavras. A Cloudflare criou Cloudflare/clef, o repositório no Hugging Face às 21:15 UTC de 30 de setembro de 2026, sob Apache-2.0, e publicou o post de anúncio — "Apresentando o Clef: nossos modelos de decisão de código aberto e a nova plataforma de ajuste fino por RL" — na tarde seguinte. Por cerca de dezoito horas, um modelo de 55 gigabytes estava disponível para download e sendo executado nas próprias GPUs de borda da Cloudflare antes que seu fornecedor dissesse qualquer coisa sobre ele. Em três dias, ele já tinha uma página na biblioteca do Ollama por trás do Ollama 0.35.1, que é onde este artigo o encontrou, e builds NVFP4, FP8, EXL3, INT8, Q4 e Q8 de uma dúzia de uploaders diferentes.
O que é possível saber a partir do repositório é extraordinariamente completo, e vale a pena separar isso daquilo que não é. É possível saber: a arquitetura, o checkpoint base, a licença, uma implementação de referência que funciona e uma matriz de avaliação completa. Não é possível saber: se algum desses números sobrevive a uma nova execução feita por alguém que não seja a Cloudflare. Toda pontuação atribuída a Clef abaixo vem da execução do próprio fornecedor de uma suíte que o fornecedor hospeda. Essa assimetria em relação a um modelo com um mês de uso independente por trás é o cerne honesto desta comparação, e o restante do texto trata de onde isso realmente pesa.
Os dois repositórios, lado a lado
Comece pelo download, porque a semelhança é o ponto. Os safetensors do Clef totalizam 54,97 GB distribuídos por doze fragmentos. Os do modelo pai totalizam 55,56 GB distribuídos por dezoito. O Clef mantém o codificador de visão do Qwen3.8-27B — o processador, a torre de visão, todo o front-end multimodal —, portanto nada foi removido para torná-lo menor. O que a Cloudflare acrescentou é uma cabeça de esquema conjunta de 256 MB: quatro camadas, 1.024 de largura, dezesseis cabeças, um feedforward de 4.096 de largura, duas camadas de roteamento que leem os estados ocultos finais do backbone. A receita de treinamento é um backbone congelado, essa cabeça e adaptadores de baixo rank de rank 256, com entropia cruzada com suavização de rótulos para respostas de esquema válidas, emparelhada com uma perda de Brier para afinar a calibração.
Então, a divergência, que está inteiramente naquilo que o modelo tem permissão para emitir.
• Parâmetros — Clef 27B, pós-treinado a partir de Qwen/Qwen3.8-27B. Qwen3.8-27B, denso de 27B, 64 camadas, 5.120 dimensões ocultas, vocabulário de 248.320 tokens, 16 × (3 × Gated DeltaNet → FFN) intercalados com Gated Attention.
• Saída — Clef: um logit por opção permitida, softmax por pergunta, sem nenhum caminho de geração. Qwen3.8-27B: tokens, chamadas de ferramentas e um bloco de raciocínio que fica ativado por padrão.
• Formatos de pergunta — Clef aceita de 1 a 64 perguntas tipadas por requisição em três formas: noul (probabilidade de ser verdadeiro), choice (2 a 255 opções nomeadas), score (2 a 10 níveis ordenados, retornando um valor ponderado por probabilidade que pode ficar entre eles). Qwen3.8-27B não tem esse contrato; você recebe texto livre e escreve o parser.
• Licença — Apache-2.0 em ambos, e é por isso que a quantização de terceiros aconteceu num fim de semana.
• Custo da metade congelada — A cabeça do Clef é 256 MB contra 54,97 GB de backbone. Quase todo o download é o pai. Se você já tem o Qwen3.8-27B no disco, está baixando-o uma segunda vez para obter uma opinião diferente sobre como responder.

Quanto custa a reorientação, em dois números
A avaliação da Cloudflare é a suíte Decision Index 0.2.1, executada internamente, e é uma tabela sobre modelos de decisão — seis colunas: Clef, Clef-flash, Jev, DiffusionGemma Jev, Kev 9B e Laya. O Qwen3.8-27B não tem linha nela, e o Clef não tem linha no Artificial Analysis Intelligence Index. Portanto, não há um placar compartilhado, e este texto não vai inventar um.
Há, no entanto, um benchmark ao qual ambos os lados foram submetidos, e a diferença é grande o suficiente para ser o número mais relevante para a decisão no lançamento. No GPQA Diamond — questões de ciências de nível de pós-graduação, de múltipla escolha — a Cloudflare mede o Clef em 48,0. O modelo pai fica em 90,5 no harness da Artificial Analysis e 89,2 no model card do próprio fornecedor. Isso é um abismo de quarenta pontos em conhecimento geral, e não é nenhum mistério: o Clef responde pontuando um conjunto fixo de opções que lhe foram entregues, e a múltipla escolha de conhecimento geral está tão longe de "roteie este ticket" quanto os mesmos pesos podem ser direcionados. Trate a comparação como indicativa, e não controlada — dois harnesses, dois laboratórios, nem o do fornecedor nem o do rastreador. Mas a direção não está em dúvida, e é o preço do contrato.
O mesmo padrão aparece no restante das células de uso geral do Clef. MMLU-Pro 65,9, BBH 73,7, CLINC150 com tratamento de fora do escopo 97,4 para o 27B contra os 89,3 do Jev — essa última é a rara célula em que o derivado supera o modelo de decisão mais antigo de forma inequívoca, e isso importa porque recusar-se a classificar é a metade difícil do roteamento. Onde o Clef é forte, ele é forte exatamente onde um classificador treinado internamente deveria ser: macro-F1 de intenção do BANKING77 em 94,2, exatidão de caso do BFCL em 98,5, API-Bank em 91,9. Onde ele é fraco, um modelo de decisão apenas de texto de um laboratório concorrente — o Jev da TypeSafe — o supera em trinta pontos no GPQA Diamond enquanto cobra US$ 0,042 por milhão de tokens de entrada em nosso próprio catálogo, o que é um lembrete útil de que "27B" não é, por si só, um argumento.
O que o modelo pai mantém é tudo aquilo sobre o que o Decision Index não pergunta. No seu próprio cartão e nas linhas provenientes da AA, nosso catálogo traz: Terminal-Bench 2.1 em 73,0, SWE-bench Pro 61,7, LiveCodeBench v6 90,3, OSWorld-Verified 84,3, DeepSWE 1.1 em 42,2, AA Coding 68,1 na posição 35 de 138 modelos amostrados. Nenhum deles tem uma linha do Clef, porque o Clef não consegue tentá-los. Ele não tem caminho de chamada de ferramentas, nem planejamento de longo horizonte, nem maneira de emitir o patch.
O que custa uma única decisão, e por que a linha de resultado é todo o argumento
A página do modelo Workers AI lista exatamente um preço unitário para o Clef: $0,24 por milhão de tokens de entrada. Não há linha de saída, e o motivo está nas respostas. O próprio exemplo documentado do Ollama — um tíquete de suporte encaminhado por três perguntas — retorna com "usage": {"input_tokens": 1204, "output_tokens": 3}. Três tokens de saída para três perguntas. Se a Cloudflare cobra ou não esses três tokens é quase irrelevante: o custo de saída de uma decisão não é uma taxa, é uma contagem de perguntas.
Compare isso com a tabela de preços do modelo pai no nosso próprio catálogo, que é $0,33 por milhão de tokens de entrada e $2,40 por milhão de saída com uma janela de 262.144 tokens. Mesmo estado de 1.204 tokens, mesma única decisão de roteamento:
• Clef — 1.204 tokens de entrada a US$ 0,24 por milhão é cerca de US$ 0,00029 por decisão, e cerca de US$ 289 por milhão de decisões. O número quase não muda quando a resposta fica mais difícil, só quando o estado fica mais longo.
• Qwen3.8-27B com o pensamento desativado — o mesmo estado custa cerca de $0,00040 em entrada, mais aproximadamente dez tokens de saída a $2,40 por milhão. Chame isso de $0,00042, ou $421 por milhão. O Clef é cerca de 1,5× mais barato, o que não é a história que estão contando.
• Qwen3.8-27B com o raciocínio ativado — que é o padrão neste checkpoint. Se o modelo gasta 400 tokens raciocinando sobre em qual de quatro categorias um e-mail de redefinição de senha se encaixa, isso é mais $0,00096 e a decisão fica perto de $0,0014, ou $1.357 por milhão. Esses 400 tokens são uma suposição, não uma medição, e o múltiplo varia linearmente com ela.
Então, a versão honesta do argumento de precificação é mais restrita do que parece à primeira vista. Contra um generalista rodando com o raciocínio desativado, o Clef vence em dólares por um fator de cerca de um e meio — algo real, mas não transformador. Contra o mesmo modelo em sua configuração padrão, a diferença é uma função da verbosidade, e a verbosidade é exatamente o que um modelo de linguagem tem e um design de pontuadores sobre opções não tem de forma alguma. Essa é a afirmação estrutural: o custo do Clef é limitado pelo comprimento do estado, e o do pai é limitado por quanto o pai decide dizer.

O único número que não está próximo
Cloudflare relata latência mediana de requisição de 209,3 ms para Clef e p95 de 238,6 ms, medidas em 43 benchmarks em sua execução, em suas próprias GPUs de borda. Ninguém fora da Cloudflare o reproduziu, e a infraestrutura do fornecedor é a razão pela qual o número é tão baixo — este modelo foi projetado para ficar na mesma rede que o chamador.
Para a matriz, podemos fazer melhor do que um número de fornecedor, porque é uma das nossas rotas. Na janela de sete dias terminada em 2 de outubro de 2026, o próprio playground da OrcaRouter mediu o Qwen3.8-27B com um p50 de 1,929 ms e 235.8 tokens de saída por segundo, sobre 136.3 milhões de tokens de tráfego nessa janela. A série diária é a parte interessante: o p95 fica em exatamente 10,000 ms em seis dos sete dias, o que soa como um teto em vez de uma medição, e o p50 oscila entre 1,751 ms e 4,296 ms dependendo do dia. Considere a mediana como cerca de nove vezes a da Clef, e considere a cauda como não informativa até que alguém publique uma distribuição real.
Essa lacuna não é uma diferença de ajuste e não vai se fechar. Uma passada somente de prefill mais uma cabeça de pontuação paralela termina em uma única varredura; um modelo autorregressivo termina quando fica sem coisas para dizer. Os números absolutos do fornecedor para o Clef merecem o desconto de sempre, mas a ordenação é uma propriedade da arquitetura, não do hardware da Cloudflare.
O contexto é citado de três formas para um deles.
Ambos os modelos aceitam texto, JSON, imagens e vídeo. As janelas não são as mesmas, e uma delas é citada de forma inconsistente dependendo de onde você lê.
• Clef, hospedado — 65.536 tokens, de acordo com a página do modelo Workers AI e o post de anúncio. Esse é o número que vincula um chamador de API, e o enquadramento da própria Cloudflare é comparativo: o dobro do estado que a janela de 32K do Jev comporta.
• Clef, no disco — o config.json lançado declara max_position_embeddings de 262.144, porque o backbone congelado é o do progenitor e ainda carrega o teto de posições do progenitor. O helper encode_record incluído tem como padrão max_length=16.384, com max_state_tokens disponível para limitar o estado separadamente. Nenhum desses três números está errado; eles respondem a perguntas diferentes, e uma listagem de runtime que anuncia 256K está lendo a config, não o endpoint.
• Qwen3.8-27B — 262.144 nativamente, extensível a 1.000.000 com a configuração de serving adequada, de acordo com a ficha do fornecedor e a linha do nosso catálogo. No mínimo, quatro vezes a janela do Clef hospedado.
A consequência prática é menor do que a proporção sugere. O Clef consome um estado — um ticket, uma fatura, uma captura de ecrã — não uma conversa, e um dos seus argumentos de venda é que pode entregar-lhe um grande payload achatado e fazer sessenta e quatro perguntas sobre ele sem pagar novamente pelo payload a cada pergunta. O pai precisa da janela porque tem de manter o histórico, os resultados das ferramentas e o seu próprio raciocínio. Requisitos diferentes, tetos diferentes.
Ambos veem os mesmos pixels
O codificador de visão é herdado, então este não é um caso de um modelo ser multimodal e o outro não. O Clef aceita até quatro imagens por requisição, codificadas em base64 nos formatos PNG, JPEG ou WebP, compartilhadas por todas as perguntas do payload, e quadros de vídeo podem ser adicionados como arrays de quadros — o exemplo de recibo no cartão faz uma pergunta de sim ou não sobre se um total é legível, o que é o design em miniatura. O Qwen3.8-27B é um modelo nativo de visão e linguagem com OmniDocBench 1.5 em 91,1, RealWorldQA em 85,9 e CharXiv em 78,8 no cartão do fornecedor.
O que difere é o que você recebe de volta. O Clef fornece uma decisão campo a campo com uma probabilidade associada, que é uma resposta tipada sobre um documento. O parent fornece uma descrição do documento, que você então analisa. Para uma grande classe de trabalho com documentos — verifique este formulário, localize esta cláusula, este total está acima do limite —, a resposta tipada é o trabalho inteiro, e a descrição é uma sobrecarga pela qual você paga e depois joga fora.
Onde a linha realmente fica
• Use o Clef — as respostas são enumeráveis com antecedência e você prefere não escrever um parser. Roteamento, triagem, gating, verificações de políticas, extração de campos de documentos. Conjuntos fechados, 2 a 255 opções por pergunta, até 64 perguntas pontuadas em conjunto.
• Opte pelo Clef — a decisão está em um hot path e 209 ms contra 1.929 ms muda o que o pipeline pode fazer. Esta é a razão mais forte, isoladamente, para migrar, e é uma razão de latência, não de acurácia.
• Escolha o Clef — você quer determinismo. Uma opção que você não declarou não pode retornar, porque não há uma etapa de geração para produzi-la.
• Mantenha o Qwen3.8-27B — a resposta não é uma escolha numa lista: resumir, redigir, raciocinar sobre um problema inédito, escrever código, operar ferramentas ao longo de um horizonte longo. O Clef não consegue fazer nada disso, e não lhe dirá isso.
• Mantenha o Qwen3.8-27B — você precisa que o modelo diga "nenhuma destas". Um modelo de decisão pontua as opções que lhe foram dadas. Entregue a ele um esquema de cobrança/técnico/vendas e uma solicitação de privacidade, e ele retorna a menos ruim dessas três, em vez de uma recusa. O pai traz à tona a pergunta que você não pensou em fazer.
• Mantenha o Qwen3.8-27B — para trabalho com contexto ou documentos longos. Quatro vezes a janela do serviço hospedado, antes da extensão de um milhão de tokens.
Leia essa lista como um pipeline em vez de um veredito, porque é isso que ela é. A arquitetura torna a relação literal: Clef é a passagem de prefill do pai com um mecanismo de resposta diferente no final. Um design sensato coloca o Clef na frente — decide a rota, a prioridade, a flag de escalonamento — e mantém o Qwen3.8-27B logo atrás para agir sobre a decisão. Os dois são complementos que por acaso compartilham um download.
Onde executar cada um deles
O Clef está hospedado no Workers AI da Cloudflare, ao preço de US$ 0,24 por milhão de tokens de entrada indicado acima, e os pesos sob licença Apache-2.0 são seus para rodar localmente. A listagem na biblioteca do Ollama é a superfície mais recente: ollama pull clef exige o Ollama 0.35.1 ou mais recente, porque o modelo se comunica pelo endpoint /v1/systemone que o Ollama adicionou para modelos de decisão. Fique de olho nas tags, não na manchete — as tags padrão e clef:27b têm 18 GB, o que é uma build de quatro bits de um modelo de 55 gigabytes; clef:27b-q8_0 tem 30 GB, clef:27b-nvfp4 tem 18 GB, clef:27b-mxfp8 tem 31 GB, e clef:27b-mlx-bf16 é o modelo completo de 55 GB para Apple silicon. O próprio SDK de Python da TypeSafe conversará com ele se você apontá-lo para um Ollama local e fornecer qualquer chave de API, que o runtime ignora. Um alerta que vai morder em produção: confidence mede o quão concentradas estão as probabilidades, não a chance de a resposta estar correta, e os empates são resolvidos na ordem das opções que você declarou.
O pai é o mais fácil de colocar atrás de uma API hoje. O Qwen3.8-27B pode ser roteado no OrcaRouter às tarifas de US$ 0,33 e US$ 2,40 por milhão usadas acima, com a janela de 262.144 tokens, e é um dos mais de 200 modelos acessíveis por meio de uma única chave compatível com OpenAI. Como o preço de tabela do provedor é repassado com 0% de markup, um corte de preço do fornecedor em qualquer um dos lados desta comparação já vale nas nossas rotas no mesmo dia em que entra em vigor.
O próprio Clef não é uma das nossas rotas — nosso catálogo público não retorna nada para ele, e nada aqui deve ser lido como uma alegação de disponibilidade da nossa parte. O que nós oferecemos é o modelo que torna o padrão de decisão alcançável sem uma conta Cloudflare: da TypeSafe, o Jev 1.13 é uma rota listada a $0.042 por milhão de tokens de entrada com um contexto de 65.536 tokens, medido em um p50 de 148 ms ao longo da mesma janela de sete dias, e ele fala o mesmo — POST /v1/systemone — formato de requisição. Como o Clef é compatível com a API do Jev de propósito, um pipeline construído para um ou outro está a uma mudança de configuração de distância do outro — que é o caso que uma camada de roteamento existe para tornar gratuito. Mantenha ambos acessíveis, meça com seus próprios rótulos, e deixe o vencedor ser um dado em vez de um compromisso arquitetural. Se um modelo de decisão acabar controlando o acesso de um agente, o modelo que age com base na decisão ainda precisa estar acessível, e essa metade já está atrás da mesma chave.

O que mudaria essa leitura?
Três coisas, em ordem crescente do quanto elas o moveriam.
Uma terceira parte precisa executar novamente o Decision Index. A suíte é pública e a Cloudflare descreve as avaliações como reproduzíveis, então isso é factível — e a célula fora do escopo do CLINC150 é a que merece atenção, porque um 97,4 para o 27B é ou uma vantagem genuína sobre os 89,3 de Jev na metade mais difícil do roteamento, ou um artefato de uma estrutura de avaliação construída internamente. Ninguém fora da Cloudflare sabe ainda.
Alguém precisa avaliar Clef e Qwen3.8-27B na mesma tarefa de classificação, com os mesmos rótulos. Essa é a única comparação que resolveria se a troca de cabeçote (re-heading) é uma troca de qualidade ou uma melhoria de qualidade para decisões de conjunto fechado, e nenhum dos fornecedores tem incentivo para realizá-la. Até então, a diferença de quarenta pontos no GPQA permanece como a melhor evidência disponível sobre o que foi removido, e é evidência sobre a tarefa errada.
E a latência do Clef precisa de um p95 sob concorrência. A mediana de 209 ms foi medida pelo fornecedor, em hardware que o fornecedor controla, para um modelo cujo argumento de venda inteiro é o facto de estar num caminho crítico. A ordenação face a um progenitor autorregressivo é arquitetural e vai sobreviver. Os milissegundos absolutos são o número em que não se deve confiar, e são o número em que assenta todo o caso de negócio.
Qwen3.8-27B é um dos mais de 200 modelos acessíveis por meio de uma única chave compatível com OpenAI — Qwen3.8-27B.
