
Clef vs Gemma 4 12B: Um dispositivo de decisão de 64K tokens contra um generalista de 256K tokens
- openaiNOVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligência
- anthropicNOVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligência
- typesafeNOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 219 tok/s
- OpenAINOVOOpenAI: GPT-6 Luna2026-09-2238Inteligência
- OpenAINOVOOpenAI: GPT-6 Sol2026-09-2248Inteligência
- AnthropicNOVOAnthropic: Claude Opus 5.52026-09-2258Inteligência
- xAINOVOGrok 4.72026-09-2146Inteligência
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 114 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1064 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 41 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 105 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 213 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
O número mais útil numa comparação entre Clef e Gemma 4 12B não é uma pontuação de benchmark. É 65.536 contra 256.000 — as janelas de contexto. Cloudflare/clef é um modelo de decisão multimodal com 27 bilhões de parâmetros, pós-treinado a partir do Qwen3.8-27B, que lê um estado e um esquema de perguntas tipadas e devolve uma probabilidade para cada resposta permitida numa única passagem não autorregressiva. Gemma 4 12B — o checkpoint Unified, google/gemma-4-12B-it — é o modelo any-to-any sem codificador de 11,95 bilhões de parâmetros do fornecedor, lançado no verão de 2026, que gera texto numa janela de 256.000 tokens em mais de 140 idiomas. Coloque uma pasta de contratos diante de ambos e o modelo de decisão fica sem espaço quatro vezes mais cedo, porque seu teto documentado é de 65.536 tokens, enquanto o do generalista é 256.000. Essa assimetria não é uma nota de rodapé. Para toda uma classe de trabalho de roteamento — documentos longos, threads coladas, formulários de várias páginas —, ela decide a escolha antes mesmo de a precisão ser discutida.
Então, esta não é uma página sobre qual modelo é melhor. É uma página sobre os dois eixos nos quais eles realmente diferem: quanto estado cada um consegue reter, e que formato de resposta cada um é fisicamente capaz de produzir. Todo o resto é ou um número de fornecedor que ninguém reproduziu ou uma comparação que não significa o que parece.
O que cada um é, em um parágrafo cada
Clef é o modelo de decisão 27B da Cloudflare, publicado sob Apache-2.0 com os pesos no Hugging Face e um endpoint hospedado no Workers AI. A Cloudflare congelou o backbone Qwen3.8-27B, incluindo seu codificador de visão, anexou uma cabeça de esquema conjunta mais adaptadores de baixo posto com rank 256, e treinou-o com entropia cruzada suavizada por rótulos para respostas de esquema válidas, juntamente com uma perda de Brier para afiar a calibração. Você fornece estado — texto, JSON, imagens ou quadros de vídeo — e de uma a 64 perguntas nomeadas, cada uma tipada booleano (verdadeiro/falso, retornando a probabilidade de verdadeiro), escolha (2 a 26 opções nomeadas) ou pontuação (2 a 26 níveis ordenados). O que retorna é uma distribuição por pergunta e nada mais. Não há nenhum caminho de geração de texto.
Gemma 4 12B é um modelo generalista que gera texto. Ele não tem encoder: em vez de torres separadas de visão ou áudio, patches de imagem brutos e formas de onda são projetados diretamente no espaço de embeddings do modelo de linguagem por meio de camadas lineares leves, e é isso que lhe permite receber texto, imagem, vídeo e áudio sem um pipeline por modalidade. Ele tem modos de raciocínio configuráveis, chamada nativa de funções, um vocabulário de 262K e um esquema de atenção híbrido que intercala atenção de janela deslizante de 1.024 tokens com atenção global completa. Ele é Apache-2.0, acompanhado dos próprios termos de uso do fornecedor, e é o checkpoint a que a maioria das pessoas se refere quando diz "executar este tamanho localmente".
Uma coisa a declarar com clareza antes de prosseguir: nenhum dos modelos é uma rota no OrcaRouter. Nosso catálogo retorna um 404 para cloudflare/clef e para o checkpoint 12B da mesma família, e nada neste texto deve ser lido como uma alegação de disponibilidade da nossa parte. O que nós de fato oferecemos da família Gemma são os dois tamanhos maiores, e seus preços aparecem mais abaixo.

A lista de opções é uma interface e tem um modo de falha
A diferença estrutural entre estes dois é o que acontece com a entrada que não se encaixa.
• Saída — Clef retorna uma probabilidade por opção declarada, e somente essas opções. Gemma 4 12B retorna texto gerado.
• Recusa — O Clef não tem "nenhuma das opções acima", a menos que você mesmo escreva uma nos critérios. O Gemma 4 12B pode descrever um caso que não se encaixa em nada do que você perguntou.
• Modo de falha — O erro do Clef é silencioso: uma escolha confiante dentro do seu schema, nenhuma exceção levantada, nenhum ramo de fallback acionado. O erro do generalista costuma ser ruidoso: texto em prosa que não é analisável.
• Testabilidade — um conjunto fixo de opções torna o componente reproduzível e barato de auditar. Texto livre o torna flexível e caro de validar.
Os próprios números da Clef para esse problema de recusa são as estatísticas mais fracas que ela publica. No CLINC150 com tratamento fora de escopo — detecção de intenção em que uma resposta válida é "isto não pertence a nenhuma categoria" — o 27B obtém 97,4 de macro-F1, que é o melhor da tabela da Cloudflare e o motivo para se importar com o 27B em vez de seu irmão 9B, que obtém 66,8 no mesmo benchmark. Uma diferença de trinta pontos entre dois modelos construídos com a mesma receita diz que o comportamento fora de escopo é o que a escala de pós-treinamento compra, e é aquilo de que a maioria dos pipelines de roteamento depende silenciosamente. A mitigação que a Cloudflare documenta é uma segunda pergunta no esquema — adicione um noul campo perguntando se o estado se encaixa de fato, e então aplique um limiar a ele — o que funciona, e o que é seu trabalho e não do modelo.
De onde os números vêm importa mais do que o que eles dizem
Todos os números do Clef neste artigo vêm da Cloudflare: seu model card, seu post de lançamento ou sua execução do Decision Index. A suíte em si é da própria Cloudflare, e o leaderboard que hospeda as pontuações é da própria Cloudflare. Isso é um fornecedor medindo seu produto em hardware que ele controla contra um rival cuja API ele deliberadamente espelha. Nenhum terceiro reproduziu nada disso, e este texto não vai fingir o contrário.
A coluna Gemma 4 12B é um tipo diferente de evidência. O próprio cartão do fornecedor publica MMLU Pro 77,2%, GPQA Diamond 78,8%, AIME 2026 sem ferramentas em 77,5% e LiveCodeBench v6 em 72,0%. A Artificial Analysis, um rastreador independente, indexa a configuração de raciocínio em um Intelligence Index de 14,18, com um valor listado de US$ 0,10 / US$ 0,30 por milhão de tokens e uma velocidade mediana de saída medida de cerca de 113 tokens por segundo — e sua própria página observa que esses números dependem da carga de trabalho e do hardware.
A leitura honesta é que as duas colunas não são comparáveis de forma alguma. Uma é um conjunto de avaliação de qualidade de decisão de um fornecedor, executado pelo próprio fornecedor; a outra é uma mistura de benchmarks de fornecedores e uma avaliação independente de um modelo geral. Citar 97,4 ao lado de 77,2 como se fossem colunas da mesma tabela seria a coisa mais enganosa que esta página poderia fazer.
A latência é o único ponto em que os dois podem ao menos ser discutidos nas mesmas unidades e, mesmo aí, as ressalvas se acumulam. A Cloudflare reporta o Clef com mediana de 209,3 ms e p95 de 238,6 ms, medidos em sua própria infraestrutura. A Artificial Analysis mede o tempo até o primeiro chunk do 12B em cerca de 2,4 segundos numa configuração de raciocínio, que inclui um orçamento de pensamento que o modelo de decisão não tem. Uma passagem não autorregressiva de 209 ms contra um início de geração de 2,4 segundos é uma diferença arquitetural real — uma passagem direta versus um loop de decodificação — e é o argumento mais forte que o Clef tem para um hot path. Além disso, com 27B, é um modelo que precisa de hardware da classe H200 para atingir esse número, e a Cloudflare cobra US$ 0,24 por milhão de tokens de entrada para executá-lo para você.

O que 64K de contexto realmente lhe rende
É no contexto que esta comparação se torna prática e onde o generalista vence no papel por uma margem ampla.
• Clef — 65.536 tokens, de acordo com a página do modelo Workers AI e o post de lançamento; o auxiliar de codificação incluído usa por padrão max_length=16,384, que é um valor padrão e não um teto, mas é o padrão que você obterá se usar o loader como fornecido.
• Gemma 4 12B — 256.000 tokens, conforme a ficha do fornecedor, com atenção de janela deslizante de 1.024 tokens para manter baixo o custo de contexto longo.
• Imagens — Clef avalia imagens e quadros de vídeo em conjunto com o estado do texto por meio do codificador de visão herdado. O Gemma 4 12B recebe texto, imagem, vídeo e áudio pelo seu caminho sem codificador.
• Idiomas — A ficha de Clef não faz nenhuma alegação multilíngue; o Gemma 4 12B está documentado em mais de 140 idiomas.
Para um ticket, uma fatura ou uma captura de tela renderizada, 64K é generoso e a diferença é acadêmica. Para um contrato de 200 páginas que você quer classificar campo por campo, é a questão toda: o generalista consegue abarcar o documento, e o modelo de decisão não. A resposta da Clef para isso é o chunking, e fazer chunking de um documento antes de decidir sobre ele significa que você já tomou uma decisão que o modelo deveria tomar. Esse é um limite real e merece ser declarado como tal.
O que você realmente pagaria, e onde
Nenhum dos dois modelos consta no nosso catálogo, por isso a questão do preço se divide de três maneiras.
• Clef — US$ 0,24 por milhão de tokens de entrada no Workers AI da Cloudflare, ou auto-hospedado a partir dos pesos Apache-2.0; a latência publicada pela Cloudflare foi medida em uma única H200 com torch 2.11 e transformers 5.10.2, e as quantizações da comunidade que apareceram em dois dias sugerem que ele pode ser comprimido ainda mais, com algum custo de precisão que ninguém mediu.
• Gemma 4 12B — nenhuma rota hospedada aqui. Você baixa cerca de 24 GB de pesos BF16 e os serve por conta própria, ou recorre a uma plataforma de terceiros. Não existe preço por token que possamos cotar.
• O substituto roteado — Gemma 4 26B A4B, uma mistura de especialistas com 25,2 bilhões de parâmetros totais e 3,8 bilhões de parâmetros ativos, está listado no OrcaRouter a US$ 0,06 por milhão de tokens de entrada e US$ 0,33 por milhão de tokens de saída, com um contexto de 262.144 tokens. O Gemma 4 31B, o irmão denso multimodal com pensamento configurável e chamada de função nativa, está listado a US$ 0,13 e US$ 0,38. Ambos estão em uma única chave com preço de tabela do provedor repassado sem markup por token e failover automático entre provedores.
Essa última frase é a versão honesta do nosso envolvimento nesta comparação. Se o que você precisa é de um generalista que leia um documento longo e escreva uma frase, a rota barata para isso é um tamanho do Gemma 4 que nós realmente servimos, e custa menos por milhão de tokens do que hospedar por conta própria um 12B em GPUs alugadas. Se o que você precisa é de uma decisão delimitada no caminho crítico, a mediana de 209 ms do Clef é uma propriedade arquitetural real, e a coisa mais próxima disso no nosso catálogo é o Jev 1.13 da TypeSafe — o modelo com o qual a Cloudflare fez benchmark e de quem copiou o formato de transmissão — a US$ 0,042 por milhão de tokens de entrada em um contexto de 65.536 tokens, servido através do mesmo formato POST /v1/systemone. Como os dois são compatíveis em termos de API por trás de um adaptador fino, testar o Clef contra o incumbente é um experimento, e não uma migração, e o experimento continua barato quando os dois lados são acessíveis por um único endpoint.

A decisão, declarada como uma decisão
Escolha o Clef quando as respostas forem enumeráveis, o estado couber em 64K, a decisão estiver em um caminho sensível à latência e você estiver disposto a assumir a classe residual por conta própria. Os 97,4 do 27B na detecção de intenção fora do escopo são o motivo pelo qual você pagaria por ele em vez do irmão 9B, e seu formato de saída fixo é o que torna o componente auditável sem um parser.
Escolha o Gemma 4 12B quando a entrada for longa, quando a modalidade for áudio ou vídeo, quando a resposta precisar ser em prosa, ou quando as categorias ainda não forem conhecidas — porque "triar esta pilha em quaisquer agrupamentos que façam sentido" é um pedido que um modelo de decisão não consegue aceitar, e não um que ele trate mal. É um generalista com uma avaliação independente por trás dele, e para trabalho de escopo aberto isso vale mais do que uma tabela de fornecedor.
E seja cético em relação a ambos os conjuntos de números pelo motivo que este artigo repete continuamente: a Cloudflare não foi reproduzida de forma independente em nada, e esse cartão é a própria tabela de benchmark do fornecedor. O único número genuinamente interessante do par — se uma cabeça de esquema de 27B realmente mantém sua pontuação de 97,4 fora do escopo em dados com os quais não foi treinada — é exatamente o número que nenhum dos fornecedores consegue resolver e que uma terceira parte conseguiria.
