Um cartão hero gerado para 'Claude Haiku 5.5 vs Gemma 4 12B' com dois painéis divididos por uma linha fina: o da esquerda rotulado 'Claude Haiku 5.5' com 'Índice 43' e 'API proprietária', o da direita rotulado 'Gemma 4 12B' com 'Índice 14' e 'pesos Apache 2.0'. Uma linha de rodapé diz 'Pontuações segundo a Artificial Analysis'. O logotipo da OrcaRouter é composto no canto inferior direito.
Guides & Insights

Claude Haiku 5.5 vs. Gemma 4 12B: Um modelo com pesos que você pode ter em mãos contra uma API de fornecedor

Autor

Gideon Frost

Data de publicação

Modelos mais recentes · 20Ver todos os modelos →
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Claude Haiku 5.5 e G​emma 4 12B não estão realmente competindo pelo mesmo espaço, e a maneira mais rápida de perceber isso é uma única frase: um deles é distribuído como pesos Apache-2.0 que você pode baixar, quantizar e executar no seu próprio hardware, e o outro existe apenas por trás de uma API. Claude Haiku 5.5 chegou em 7 de outubro de 2026 e imediatamente redefiniu o que uma categoria pequena pode pontuar — 43 no independente Artificial Analysis Intelligence Index. G​emma 4 12B está em 14 no mesmo ranking. Essa diferença é enorme, e não é o motivo pelo qual a maioria das equipes acaba escolhendo entre eles.

A escolha geralmente é imposta antes que qualquer benchmark seja consultado: um pipeline regulado que não pode enviar tokens a um fornecedor, um dispositivo de borda sem saída de rede confiável, um orçamento de latência medido em milissegundos, ou um requisito de ajuste fino que uma API fechada nunca satisfará. Se nenhum desses casos se aplicar a você, a resposta não é nem de perto acirrada. Se um deles se aplicar, a diferença de pontuação deixa de importar e a restrição de implantação decide tudo.

O que o conselho mediu, e quando

Os números independentes abaixo vêm da Artificial Analysis, e as tarifas dos fornecedores vêm da documentação própria da Anthropic e do Google. Eles são dois tipos diferentes de números e são rotulados como tal em todo o texto.

A generated two-column scoreboard titled 'Claude Haiku 5.5 vs Gemma 4 12B - the scoreboard'. The Claude Haiku 5.5 column reads independent score 43 (AA, #2 of 182), weights Proprietary API, context 1,000,000 tokens, input price $0.10 / 1M, output price $0.50 / 1M and throughput 240.4 tok/s. The Gemma 4 12B column reads independent score 14 (AA, #21 of 142), weights Apache 2.0 12B dense, context 262,000 tokens, input price $0.10 / 1M, output price $0.30 / 1M and throughput 113.1 tok/s. A footer line reads 'Both columns per Artificial Analysis; pricing per each vendor.'

• Pontuação independente — Claude Haiku 5.5 com 43 no Intelligence Index, segundo de 182 modelos. G​emma 4 12B (Reasoning) com 14, 21º de 142 em sua classe. Uma diferença de 29 pontos.

• Preço de entrada por milhão de tokens — Claude Haiku 5.5 $0.10 até 100.000 tokens e $0.50 acima; G​emma 4 12B $0.10.

• Preço de saída por milhão de tokens — Claude Haiku 5.5 US$ 0,50 até 100.000 tokens e US$ 2,50 acima disso; G​emma 4 12B US$ 0,30.

• Janela de contexto — 1.000.000 de tokens para o Claude Haiku 5.5; 262.000 para o Gemma 4 12B.

• Vazão — 240,4 tokens de saída por segundo para o Claude Haiku 5.5; 113,1 para o Gemma 4 12B, com tempo até o primeiro token de 2,48 segundos.

• Custo por tarefa Index concluída — US$ 0,21 para Claude Haiku 5.5. O Gemma 4 12B é barato o suficiente por token para que a cifra combinada do painel chegue a US$ 0,12 por milhão de tokens, mas o custo derivado por tarefa não é o número que deve decidir esta comparação.

• Pesos — Apache 2.0 para o Gemma 4 12B, disponível para download, com aproximadamente 12 bilhões de parâmetros densos. O Claude Haiku 5.5 é proprietário; não há liberação de pesos e nenhuma está planejada.

• Idade — G​emma 4 12B está disponível desde junho de 2026. Claude Haiku 5.5 tem dois dias de vida no momento em que escrevo isto.

A diferença é de 29 pontos, e a diferença de preço é quase nada.

Veja as duas linhas de preço novamente: US$ 0,10 de entrada para ambos, e US$ 0,30 contra US$ 0,50 na saída. O G​emma 4 12B é mais barato, e a diferença é pequena o suficiente para ser engolida pela contagem de tokens — o tokenizador mais recente do Claude Haiku 5.5 faz com que o mesmo texto se torne cerca de 30% mais tokens, então uma vantagem bruta de 40% na taxa de saída do lado do G​emma fica mais próxima de um empate em uma fatura real.

Então você está pagando quase o mesmo preço por um modelo 29 pontos de índice atrás, ou está pagando quase o mesmo preço por um modelo 29 pontos de índice à frente, dependendo da coluna que ler primeiro. Esse é o enquadramento honesto, e deve ser dito de forma clara: em qualquer tarefa que ambos os modelos consigam realizar, Claude Haiku 5.5 é a melhor compra pelo preço de tabela, e é melhor por uma margem que nenhuma quantidade de engenharia de prompt no modelo menor conseguirá fechar.

A pergunta interessante, portanto, não é “qual é melhor”. É “em quais das tarefas da minha fila o G​emma 4 12B falha”, e a resposta a isso é a única coisa que decide a comparação.

O que os pesos lhe proporcionam que uma API não consegue.

A screenshot of the Artificial Analysis page for Gemma 4 12B (Reasoning), showing an Intelligence Index of 14 at rank 21 of 142, speed rank 19 of 142, input $0.10 and output $0.30, 113.1 output tokens per second, a summary noting text, image, speech and video input with text output and a 262k-token context window, and the note that the score places it well above the median of 8 for comparable models.

Um modelo baixado é um tipo diferente de ativo, e as vantagens são estruturais, e não incrementais.

• Limite de dados — com o G​emma 4 12B, não há absolutamente nenhum fornecedor envolvido. Para cargas de trabalho de saúde, jurídicas, de defesa ou financeiras, esse é, com frequência, o único requisito que importa, e nenhuma pontuação, por mais alta que seja, torna uma API aceitável.

• Custo fixo em vez de variável — um modelo denso de 12B quantizado para quatro bits cabe confortavelmente em um único acelerador moderno. Nesse ponto, o custo marginal por token é eletricidade, e uma carga de trabalho pode ser dimensionada em relação a uma máquina, e não a um medidor.

• Sem tráfego de saída, sem latência de rede — um modelo 12B local responde em milissegundos porque nada sai da máquina. Uma API de fornecedor arca com uma ida e volta e uma cauda de inicialização a frio que uma implantação de borda simplesmente não tem.

• Ajuste fino e destilação — você pode adaptar o Gemma 4 12B aos seus próprios dados, distribuir o adaptador e congelá-lo. Se a Anthropic algum dia permitirá que você faça ajuste fino em um modelo do nível Haiku não é algo em torno do qual se possa planejar um roadmap.

• Um piso sob o seu roadmap — os pesos não podem ser descontinuados debaixo dos seus pés. A​nthropic se comprometeu a não aposentar o Claude Haiku 5.5 antes de 7 de outubro de 2027, o que é generoso, mas um compromisso com uma data marcada ainda é um compromisso com uma data marcada.

• Modalidade, curiosamente — o quadro registra o G​emma 4 12B recebendo entrada de texto, imagem, fala e vídeo para saída de texto, o que representa uma gama de entradas mais ampla do que a de texto e imagem do Claude Haiku 5.5. Para um pipeline local que ingere áudio sem um serviço de transcrição separado, essa é uma capacidade real que o lado da API não tem.

A screenshot of the Hugging Face model card for gemma-4-12B, showing the Google uploader, the 'Any-to-Any' and 'Transformers / Safetensors' tags, the gemma4_unified_image-text-to-text identifier, 'Eval Results', 'Model card', 'Files and versions' and 'Community' tabs, a licence line reading 'License: Apache 2.0, Authors: Google DeepMind', and the opening of the card describing the Gemma 4 12B Unified model as sharing the multimodal functionality of Gemma 4 E2B and E4B with native audio and vision understanding and no separate encoders.

Onde o 12B não sobrevive ao contato

O mesmo painel que mede a diferença de 29 pontos também registra as coisas que um modelo denso pequeno não consegue fazer bem, e omiti-las seria desonesto:

• Contexto longo — 262.000 tokens contra 1.000.000. Um pipeline que enfia uma base de código ou um ano de registros em um único prompt não tem caminho no G​emma 4 12B, e fragmentá-lo em um loop de recuperação adiciona engenharia que a janela maior teria evitado.

• Trabalho agêntico e de uso de computador — a classe de tarefas em que a falha de um modelo pequeno é silenciosa e cara. Os próprios números divulgados pela A​nthropic para o Claude Haiku 5.5 colocam o OSWorld 2.1 em 72,4%, contra 15,7% do Haiku anterior; um modelo de 12B com um Index de 14 não é a ferramenta para esse trabalho, e os números do fornecedor aqui são um sinal útil, mesmo levando em conta que nenhuma execução independente os reproduziu.

• Vazão por dólar em uma frota compartilhada — 113 tokens por segundo em uma instância hospedada é aceitável, mas o motivo para auto-hospedar não é a velocidade, e uma implantação com uma única GPU será ainda mais lenta.

• Ninguém é seu fallback — se você executa o Gemma 4 12B em produção, uma indisponibilidade do seu próprio hardware é a sua indisponibilidade, sem um segundo provedor para o qual fazer failover, a menos que você construa um.

Executando qualquer um deles por um único endpoint

O OrcaRouter traz hoje o Gemma 4 31B e o Gemma 4 26B-A4B no catálogo, pelo preço de tabela do Google e com 0% de acréscimo, mas não o 12B — e vale a pena dizer isso com clareza, em vez de dar a entender o contrário. O 12B pode ser acessado pela distribuição própria do fornecedor e por várias plataformas de terceiros. O Claude Haiku 5.5 também ainda não está no catálogo; ele está disponível na API da A​nthropic e nas principais nuvens.

O que um roteador oferece é o formato que esta comparação realmente exige. Uma implantação sensata de um modelo local barato e um modelo de API caro não é uma bifurcação — é uma rota: G​emma 4 12B ou uma variante G​emma 4 hospedada responde à maioria fácil, e as solicitações que disparam uma condição de qualidade ou de comprimento escalam para um trecho A​nthropic. Claude Haiku 4.5, Claude Sonnet 5.5 e Claude Opus 5.5 estão no catálogo agora, então o caminho de escalonamento pode ser construído e testado sob carga antes mesmo de o trecho de pequeno porte estar disponível. No OrcaRouter, essa composição é uma expressão de DSL de roteamento e failover automático em vez de um serviço que você mantém, e com os preços de tabela dos provedores repassados com 0% de markup, uma mudança de preço em qualquer trecho entra em vigor no mesmo dia em que acontece.

A regra

Escolha o Claude Haiku 5.5, a menos que alguma restrição o exclua. Ele está 29 pontos do Index à frente do Gemma 4 12B por um preço de tabela quase igual, aceita um milhão de tokens de contexto e é o modelo mais forte em todas as tarefas que ambos conseguem realizar. Não existe nenhuma versão desta comparação em que o 12B vença por mérito.

Escolha o Gemma 4 12B quando a restrição é o ponto central — quando os tokens não podem sair das suas instalações, quando o orçamento é uma máquina em vez de um medidor, quando você precisa fazer ajuste fino, ou quando você precisa dos pesos em mãos em vez de uma tabela de preços e uma data de descontinuação. Essas não são preferências, são requisitos, e diante de um requisito uma diferença de 29 pontos simplesmente não é o número decisivo.