Um cartão de título gerado com o texto 'Clef', com o subtítulo 'os modelos de decisão da Cloudflare que nunca escrevem um token', com dois chips com o texto 'pesos 30 de setembro de 2026' e 'blog 1 de outubro de 2026'. O logotipo da OrcaRouter está composto no canto inferior direito.
Engineering & Research

Clef copia a API do Jev de propósito — e essa é a parte interessante.

Autor

Alistair Wren

Data de publicação

Modelos mais recentes · 20Ver todos os modelos →
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Clef é um modelo multimodal de 27 bilhões de parâmetros da Cloudflare que responde a perguntas tipadas e nada mais. Você entrega a ele um estado — texto, JSON, uma imagem, um quadro de vídeo — mais um esquema de até 64 perguntas nomeadas, e ele retorna uma probabilidade para cada opção permitida em uma única passagem direta. Sem texto gerado, sem parser, sem loop de decodificação. O que torna Cloudflare/clef digno de leitura não é esse design, que ele tomou emprestado, mas o formato de transmissão que escolheu: a Cloudflare criou o Clef para falar o corpo de requisição e resposta de Jev System One, o modelo de decisão que a TypeSafe lançou primeiro, servido no mesmo POST /v1/systemone caminho. A interoperabilidade aqui é todo o argumento comercial. Se seu pipeline já faz perguntas a um modelo de decisão nesse formato, o Clef é uma mudança de URL e uma string de modelo, não uma migração.

Isso é uma coisa incomum de se enterrar num post de lançamento, e a Cloudflare não a enterra — o model card afirma categoricamente que a API é "totalmente compatível com Jev e SystemOne", e o blog começa atribuindo à TypeSafe o mérito de colocar a categoria no mapa antes de posicionar a Clef como a versão de segunda geração de um experimento interno. Portanto, uma leitura honesta deste lançamento tem três partes: o que a decisão de compatibilidade lhe proporciona, o que os próprios números da Cloudflare dizem sobre onde a Clef ganha e perde, e o que permanece não verificado, porque todos os números daquela tabela foram produzidos pelo fornecedor que entrega o modelo.

A categoria veio de outro lugar

A publicação da Cloudflare é franca sobre a linhagem. A ideia de um modelo que retorna saídas estruturadas limitadas em vez de prosa é creditada ao Jev System One da TypeSafe. A própria via de entrada da Cloudflare foi uma demonstração anterior que forçou um modelo de difusão a emitir probabilidades determinísticas ao expor logprobs, além do trabalho comunitário de Matt Mastracci para fazer o motor de inferência lidar com esse padrão. O Clef se baseia nesse conceito com um backbone diferente, uma cabeça de pontuação criada especificamente e — a parte que importa comercialmente — um corpo de requisição que corresponde ao do incumbente.

Quando um fornecedor copia o formato de transmissão de um rival e faz benchmark contra o índice do rival, a compatibilidade não é uma nota de rodapé do modelo, é a estratégia de produto. Trocar um modelo de decisão por trás de um endpoint existente é a forma mais barata possível de um novo entrante ser testado, e o experimento mais barato possível para uma equipe que já tem um desses integrado.

O que realmente foi lançado, e quanto custa

• Parâmetros — 27B, construído congelando o Qwen3.8-27B com seu codificador de visão e treinando uma cabeça de esquema conjunta mais adaptadores de baixo rank de rank 256 por cima.

• Irmão — Clef-Flash, a mesma receita em 9B do Qwen3.5-9B. Artigo separado, trade-offs separados.

• Contexto — 65.536 tokens, de acordo com a página do modelo Workers AI e o post do blog. O auxiliar de codificação incluído tem como padrão max_length=16,384, um valor padrão e não um limite máximo, mas o padrão que você obtém se usar o carregador como fornecido.

• Tipos de perguntas — noul (verdadeiro/falso, retornando a probabilidade de ser verdadeiro), escolha (2 a 26 opções nomeadas), pontuação (2 a 26 níveis ordenados). De uma a 64 perguntas por solicitação.

• Preço — $0,24 por milhão de tokens de entrada no Workers AI da Cloudflare, ou auto-hospedado a partir de pesos Apache-2.0 que ocupam aproximadamente 55 GB em doze fragmentos.

• Licença — Apache 2.0, seguindo o checkpoint base Qwen3.8-27B.

A single-column scoreboard titled 'Clef — the scoreboard', with six rows: Parameters: 27B, vision encoder kept; Trained from: Qwen3.8-27B, head plus rank-256 adapters; Context: 65,536 tokens; Output: a probability per option, no generated text; Latency: 209.3 ms median, 238.6 ms p95; Licence: Apache 2.0. A footer reads 'Cloudflare figures, self-run on the Jev Decision Index, unreproduced.' The OrcaRouter logo is composited in the bottom-right corner.

Onde ele ganha, e onde não ganha

A rodada do Decision Index da Cloudflare é a fonte de tudo nesta seção, e o leaderboard que a hospeda é da Cloudflare. Nada abaixo foi reproduzido de forma independente. Leia como o melhor cenário apresentado por um fornecedor, e observe como ele é irregular.

As vitórias concentram-se onde um classificador treinado em casa deveria vencer. Clef obtém macro-F1 de intenção no BANKING77 em 94,2 contra 79,7 do Jev, e CLINC150 com tratamento de fora do escopo em 97,4 contra 89,3 — uma diferença de trinta pontos que é a célula mais relevante para a decisão na tabela, porque recusar classificar é a metade difícil do roteamento. Também obtém CRUXEval em 86,7, CLadder em 94,0, e o simulador de eletrodomésticos em 83,0.

As perdas são igualmente reais e pertencem ao mesmo parágrafo. Em conhecimento geral e raciocínio difícil, o Jev mais antigo vence de forma absoluta: GPQA Diamond 78,3 a 48,0, MMLU-Pro 82,7 a 65,9, BBH 92,9 a 73,7. Essas são as três maiores lacunas da tabela, e todas apontam na mesma direção. O Clef também não é o melhor modelo em sua própria comparação no conjunto PhishNChips do domínio de segurança, onde fica com 79,6 e uma entrada concorrente obtém pontuação mais alta.

Nas quatro avaliações de fluxo de trabalho de ponta a ponta, extraídas do próprio conjunto público de avaliação da TypeSafe e pontuadas em relação a rótulos de consenso, os dois estão próximos o suficiente para ser cara ou coroa. Clef leva a melhor no processamento de faturas em ações exatas, por 64,7 contra 61,8, e no conjunto de incidentes de segurança, por 62,9 contra 61,7; Jev leva a melhor na observabilidade de rastreamento de agente, por 71,6 contra 68,5; atendimento ao cliente é um empate de 76,3 contra 76,0 que não significa nada nessa margem.

A latência é onde a diferença é estrutural, e não marginal. A Cloudflare relata 209,3 ms de mediana e 238,6 ms de p95 para o Clef, contra 524,1 e 536,0 para o Jev. Essa ordenação decorre do design não autorregressivo, e não de peculiaridades de um benchmark, e é por isso que é o número com maior probabilidade de sobreviver ao contato com uma implantação real. Os milissegundos absolutos foram medidos no hardware da própria Cloudflare e significam pouco por si sós.

O dado mais convincente no lançamento não é uma linha de benchmark. A Cloudflare diz que sua equipe de inteligência de ameaças entregou um domínio ao Clef junto com seu serviço de renderização de navegador e obteve um veredito de categoria em 2,2 segundos, contra 4,7 segundos do seu próprio LLM geral mais rápido no mesmo fluxo de trabalho, com mais classificações retornadas. Anedota interna, não um estudo — mas é o tipo de história que explica por que alguém construiria isto em vez de fazer um prompt para um modelo geral.

A headless capture of Cloudflare's blog post announcing Clef, showing the Cloudflare site header, the breadcrumb 'Blog', the banner date 'October 1, 2026', the headline 'Introducing Clef: our open-source decision models, and new RL fine-tuning platform', and the three named authors.

Duas coisas que a referência da API informa a você, e uma que não informa.

As armadilhas documentadas são pequenas e vale a pena lê-las antes de portar qualquer coisa. O campo confiança mede o quão concentradas são as probabilidades, não a probabilidade de que a resposta esteja correta — um modelo bem calibrado pode retornar uma resposta correta com baixa confiança e uma errada com alta confiança. E quando duas opções empatam, a resposta segue a ordem das opções do modelo, então coloque sua opção preferida primeiro. Qualquer pessoa que porte um classificador baseado em prompt sem ler essas duas frases vai interpretar mal seus próprios logs.

A restrição maior não está documentada em lugar nenhum porque é estrutural. O Clef não tem nenhum caminho de geração de texto, o que significa que não consegue redigir uma resposta, resumir um tópico, chamar uma ferramenta ou manter uma conversa, e não vai inventar uma categoria que você não declarou. Todo o projeto pressupõe que você consiga enumerar antecipadamente as respostas permitidas. Isso exclui silenciosamente uma grande classe de problemas, e nenhum nível de desempenho em benchmarks muda isso.

Quanto vale o argumento da compatibilidade

É aqui que o lançamento deixa de ser uma revisão de modelo e se torna uma questão de arquitetura. Se o Clef fala o formato de requisição do Jev, então o modelo por trás do seu endpoint de decisão é um valor de configuração, e a maneira sensata de adotá-lo é lado a lado, em vez de como substituto — execute os dois contra o seu próprio tráfego, mantenha o que mede melhor nos seus dados e deixe a troca continuar barata.

O próprio Clef não está na nossa lista de rotas; o catálogo do OrcaRouter retorna um 404 para ele, e nada aqui deve ser lido como uma alegação de disponibilidade da nossa parte. O que nós oferecemos é o incumbente que ele foi criado para substituir. O Jev 1.13 da TypeSafe é uma rota listada a US$ 0,042 por milhão de tokens de entrada em um contexto de 65.536 tokens, servida pelo mesmo corpo POST /v1/systemone, de modo que um teste A/B entre os dois é uma string de modelo, e não uma reescrita. Ter ambos atrás de uma única chave — mais de 200 modelos, preço de tabela do provedor repassado sem markup por token, failover automático entre provedores — é o que mantém esse teste em funcionamento depois da semana em que alguém decide se importar com ele, em vez de decair para um comentário obsoleto em um arquivo de configuração. O modelo geral que você mantém por perto para agir sobre o que quer que o modelo de decisão conclua é acessível a partir dessa mesma chave, e não de um segundo contrato.

A headless capture of the OrcaRouter model page for typesafe/jev-1.13, showing the TypeSafe breadcrumb, the model title, the description naming the noul, choice and score question types served over POST /v1/systemone, a code sample set to model 'typesafe/jev-1.13', and the performance strip reading p50 TTFT 148 ms.

O que mudaria essa leitura?

Alguém fora da Cloudflare precisa executar novamente o Decision Index. A suíte é pública e as avaliações são descritas como reprodutíveis, então uma execução por terceiros é a diferença entre a tabela de um fornecedor e um fato — e as células que mais importam são as que apontam em direções opostas. Um 97,4 em detecção de intenções fora do escopo ao lado de um 48,0 no GPQA Diamond não é uma curva de capacidade suave; descreve um modelo que é muito bom nas formas de classificação da sua distribuição de treinamento e bem mais fraco em raciocínio que não viu. Se isso se mantiver em testes independentes, é o fato operacionalmente mais importante sobre o Clef e não está nos destaques.

O tráfego de produção também precisa se parecer com a tabela de latência. Uma mediana de 209 ms medida em um único H200 não diz nada sobre o p95 sob concorrência, e o principal argumento de venda do projeto é que ele fica em um caminho crítico.

E a plataforma de ajuste fino precisa produzir algo. O post da Cloudflare descreve um ciclo de RL — AI Gateway para capturar um conjunto de dados do seu próprio tráfego, Workers AI para gerar rollouts, Containers como o sandbox de pontuação, Trainer para atualizar os pesos, e depois reimplantar no Workers AI — no mesmo post que anuncia os modelos, sem nenhum resultado de cliente associado. Um Clef ajustado finamente que supere o modelo base numa tarefa para a qual o base nunca foi treinado seria uma evidência muito mais forte para a categoria do que qualquer linha da tabela.

Até então, o resumo justo é este: a Cloudflare lançou um modelo de decisão real, com licença permissiva e genuinamente rápido, e o tornou trivialmente substituível pelo que veio primeiro. Essa é uma história melhor do que a maioria dos lançamentos abertos oferece, e ainda é, até agora, inteiramente o próprio relato da fornecedora sobre si mesma.