Cartão hero gerado para Kolibri vs Gemma 4 12B, com o título 'Kolibri vs Gemma 4 12B' e a linha secundária 'um MoE de 78B contra um modelo denso de 11,95B', um ícone de beija-flor à esquerda e um diamante à direita, de cada lado de um fino divisor. O logótipo OrcaRouter fica na faixa abaixo da arte.
Guides & Insights

Kolibri vs Gemma 4 12B: 78 bilhões de parâmetros contra 12, e apenas um deles tem uma pontuação

Autor

Rowan Sterling

Data de publicação

Modelos mais recentes · 20Ver todos os modelos →
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Kolibri e Gemma 4 12B são os dois extremos de um espectro que os lançamentos de pesos abertos normalmente não permitem comparar em condições de igualdade. O Kolibri da Aleph Alpha foi lançado em 3 de outubro de 2026: 78,1 bilhões de parâmetros totais, 3,46 bilhões ativos por token, uma janela de contexto validada de 1.048.576 tokens, apenas alemão e inglês, Apache 2.0. O Gemma 4 12B foi lançado em 3 de junho de 2026: 11,95 bilhões de parâmetros densos, uma janela de contexto de 262.144 tokens, entrada de texto, imagem, áudio e vídeo, Apache 2.0. Um deles tem uma pontuação independente e publicamente reproduzível. O outro tem uma tabela de benchmarks do fornecedor. Essa assimetria não é uma nota de rodapé desta comparação; ela é a comparação, porque todo o resto que importa para um comprador — custo por tarefa, qualidade por watt, se vai funcionar nos seus documentos — passa por ela.

Devemos ser igualmente diretos quanto à natureza da comparação, porque uma manchete que opõe um modelo de 78B a um modelo de 12B convida à conclusão errada. Eles não são concorrentes. Um é uma implantação de 78 GB voltada ao trabalho documental no setor público alemão e na indústria, em racks que pertencem ao cliente; o outro é um modelo multimodal unificado de 12 bilhões de parâmetros que roda em um laptop e traz um índice independente de 14. O que segue é um relato de para que cada um realmente serve, de onde os números publicados permitem — e não permitem — classificá-los, e de quanto custa não ter uma pontuação independente.

O único número em que você pode confiar aqui, e o único em que não pode.

A Artificial Analysis mediu o Gemma 4 12B, em sua configuração de raciocínio. As conclusões, conforme publicadas na página do modelo deles, são as que devem servir de base:

• Inteligência — um Artificial Analysis Intelligence Index de 14, o que o coloca na faixa de classe superior, com a posição #21 entre os 142 modelos dessa comparação, contra uma mediana de 8 para modelos comparáveis.

• Velocidade — 112,5 tokens de saída por segundo, nº 21 de 142 na visualização de velocidade, e acima da mediana de 91 tokens para modelos comparáveis.

• Preço — $0,10 por milhão de tokens de entrada e $0,30 por milhão de saída, que a página deles sinaliza como um tanto caro em comparação com uma mediana de $0,03 e $0,15 para modelos de tamanho e classe semelhantes.

• Especificação — contexto de 262.144 tokens, 12B de parâmetros totais, Apache 2.0, entrada de texto, imagem, fala e vídeo, saída de texto.

O próprio veredito resumido da Artificial Analysis é incomumente direto para uma página de ranking, e vale a pena repetir: o Gemma 4 12B está entre os principais modelos em inteligência, mas é um tanto caro em comparação com outros modelos de pesos abertos de tamanho semelhante. Essa é uma avaliação real, independente e reproduzível de um terceiro sem qualquer interesse em nenhum dos dois fornecedores.

Kolibri não tem nada equivalente. Não há uma página de modelo do Artificial Analysis para ele e, no momento em que escrevo, nenhum terceiro reproduziu a suíte de avaliação. O que existe é a própria tabela de comparação da Aleph Alpha, na qual o Kolibri obtém 75,5 na média em inglês e 70,8 na média em alemão em sua suíte de tarefas. Essas são médias percentuais não ponderadas sobre uma combinação de benchmarks escolhida pelo fornecedor, em uma estrutura de avaliação escrita pelo fornecedor, com esforço de raciocínio alto. Essas médias não são um Intelligence Index, e os dois números não podem ser convertidos um no outro nem colocados lado a lado. Qualquer pessoa que apresente “Kolibri 75,5 versus Gemma 14” como um ranking está comparando uma porcentagem em uma escala com uma pontuação em outra. A posição honesta é que a qualidade do Gemma 4 12B é medida, e a do Kolibri é alegada.

O que a tabela do fornecedor permite fazer é ler ao longo das linhas. O Gemma 4 26B-A4B IT, o modelo irmão de mistura de especialistas do 12B, da própria Google, aparece na tabela da Aleph Alpha com 71,9 em inglês e 66,3 em alemão, abaixo do Kolibri nos dois. Isso é o mais próximo que existe de uma verificação cruzada, e vem com a mesma ressalva: harness do fornecedor, números do fornecedor. É um sinal fraco, não uma evidência.

Screenshot of the Artificial Analysis model page for Gemma 4 12B (Reasoning), marked 'Open weights model, Released June 2026', showing an Intelligence Index of 14 against a median of 8, a #21/142 intelligence rank and a #21/142 speed rank, 112.5 output tokens per second against a 91-token median, input pricing $0.10 per million tokens against a $0.03 median and output pricing $0.30 against a $0.15 median, a 262k-token context window, the summary verdict that the model is amongst the leading models in intelligence but somewhat expensive compared with other open-weight models of similar size, and the 142 models in this class count.

Denso 12B contra esparso 78B não é o descompasso que parece.

A lacuna de arquitetura é maior do que a lacuna de parâmetros quando se leva em conta o que de fato é computado por token.

• Computação por token — O Gemma 4 12B ativa todos os 11,95 bilhões de parâmetros em cada token. O Kolibri ativa 3.457.573.120 dos seus 78.103.074.560, aproximadamente um vinte e dois avos do modelo, com um especialista compartilhado e seis especialistas roteados por camada, de um total de 384.

• Memória — o trade-off vai no sentido oposto e é brutal. O Gemma 4 12B em bfloat16 fica na ordem de 24 GB de pesos. A ficha do Kolibri indica os pesos FP8 em cerca de 78 GB, com um mínimo de duas placas A100 80 GB, dois H100 SXM5, um H200, um B200 ou um B300.

• Atenção — Gemma 4 usa um híbrido de atenção local de janela deslizante e atenção global completa, com a camada final sempre global. Kolibri usa uma divisão 4:1 entre janela deslizante e consulta agrupada ao longo de 50 camadas totalmente MoE.

• Contexto — 262.144 tokens para o Gemma 4 12B; 262.144 nativos para o Kolibri, validado até 1.048.576 sem escalonamento de posição.

Então, a forma honesta de enquadrar “78B contra 12B” é que o Kolibri vence no custo de ativação e perde no espaço ocupado pelos pesos, e nenhuma das duas vantagens é gratuita. Um modelo esparso que ativa 3,46 bilhões de parâmetros por token ainda precisa manter todos os 78 bilhões na memória, e é por isso que o piso de implantação é um par de aceleradores de 80 GB, e não uma única placa de consumidor. O Gemma 4 12B faz a troca oposta: uma parcela maior do modelo é acionada a cada token, mas ele cabe em hardware que uma pessoa pode comprar.

Há uma peculiaridade específica do alemão do lado do Kolibri que altera a aritmética, e não o ranking. Seu tokenizador tem uma média de 4,90 bytes por token em textos web em alemão, contra 4,13 do Gemini, 4,17 da família Qwen3.5–3.8 e 4,35 do GPT-5, segundo as próprias medições da Aleph Alpha. Menos tokens por documento em alemão representa uma redução direta no custo de inferência e, para uma carga de trabalho que é texto administrativo alemão aos milhões, esse efeito pode valer mais do que alguns pontos de índice. Além disso, trata-se de dados inteiramente fornecidos pelo fornecedor.

Generated two-column scoreboard for Kolibri and Gemma 4 12B. Left column Kolibri: independent score 'none published', context '262,144 native, 1M validated', parameters '78.1B MoE, 3.46B active', modalities 'text only', licence Apache 2.0, price 'self-host, 78 GB'. Right column Gemma 4 12B: independent score 'AA Index 14', context 262,144, parameters '11.95B dense', modalities 'text, image, audio, video', licence Apache 2.0, price '$0.10 in / $0.30 out'. The footer reads 'Kolibri figures vendor-reported; Gemma 4 12B figures per Artificial Analysis.'

O que cada um consegue realmente ver

É aqui que a comparação deixa de ser equilibrada, e isso é um fato de especificação, não uma alegação de qualidade. O Gemma 4 12B é um modelo multimodal unificado: sua ficha técnica descreve uma arquitetura sem encoder que projeta patches brutos de imagem e formas de onda de áudio diretamente no espaço de embeddings do modelo de linguagem, com entrada de texto, imagem, fala e vídeo e saída de texto. Ele foi criado para rodar em dispositivos de consumo, sem codificadores separados a provisionar.

Kolibri lê texto, em dois idiomas, e nada mais. A Aleph Alpha enquadra isso como profundidade em vez de amplitude, deliberadamente: dois idiomas, fortemente curados, em vez de uma ampla mistura multilíngue. Não há torre de visão, nem caminho de áudio, nem vídeo. Se a sua carga de trabalho inclui formulários digitalizados, chamadas gravadas ou fotografias de equipamentos, o Gemma 4 12B é um candidato e o Kolibri não, independentemente do que as linhas de benchmark digam. Se a sua carga de trabalho for um corpus de documentos em alemão e inglês que nunca deve sair do edifício, o inverso é mais próximo da verdade — mas observe que o requisito de "nunca sair do edifício" também é satisfeito pelo Gemma 4 12B, já que os pesos são Apache 2.0 e podem ser baixados.

Qual deles é mais barato depende do que você está comprando

Os dois modelos têm preços em moedas que não se convertem. O Gemma 4 12B tem uma tarifa de mercado: US$ 0,10 e US$ 0,30 por milhão de tokens, conforme medido em diversos provedores pela Artificial Analysis, e mais barato no nível MoE em endpoints roteados. O Kolibri não tem tarifa alguma, porque a Aleph Alpha não está vendendo inferência para ele — o lançamento consiste em pesos, um relatório técnico e um model card.

• Gemma 4 12B numa rota hospedada — $0,10 por milhão de tokens de entrada e $0,30 por milhão de tokens de saída, segundo os números da Artificial Analysis. No nosso próprio catálogo, o irmão MoE Gemma 4 26B-A4B IT está listado a $0,06 de entrada e $0,33 de saída, com uma janela de 262 144 tokens, e o modelo denso maior, Gemma 4 31B IT, a $0,13 e $0,38; esses são preços de tabela do fornecedor repassados, que é o único número ao qual não acrescentamos nada.

• Kolibri no seu próprio hardware — 78 GB de pesos, um plug-in vLLM do pacote aleph-alpha-inference do fornecedor, e um mínimo de uma H200 ou B200, ou um par de H100 SXM5. O custo é uma compra de capital, um slot de rack e uma pessoa que consiga executar uma implantação vLLM, amortizado ao longo de tantos tokens quanto você gerar.

Essas não são a mesma compra, e a comparação não é "qual é mais barato". É se a carga de trabalho tem um formato que justifica possuir o hardware. Uma equipe que processa um corpus fixo e sensível de documentos em alto volume pode sair muito à frente no lado auto-hospedado. Uma equipe que constrói uma funcionalidade de produto que chama um modelo alguns milhões de tokens por dia quase nunca leva vantagem.

Um caminho intermédio prático: o nível Gemma está no OrcaRouter hoje, no mesmo endpoint compatível com OpenAI que tudo o resto, com failover entre fornecedores e o preço de tabela do fornecedor repassado sem qualquer acréscimo por token. Isso torna-o uma forma barata de medir o seu volume real de tokens numa rota alojada antes de decidir se uma implementação soberana de 78 GB se justifica. Vale a pena dizer claramente o que não é: não encaminhamos o Kolibri. Sondámos o catálogo com todas as grafias do nome do fornecedor e do modelo, e ele não está lá. Atualmente, a auto-hospedagem é a única forma de o chamar.

Screenshot of the OrcaRouter model page for google/gemma-4-26b-a4b-it, showing the 262K-token context badge, text, image and video input with text output, the Vision, Tools, JSON and Reasoning capability tags, the attribution 'Public benchmarks by Google - 2026-04-05', the description of Gemma 4 26B A4B IT as an instruction-tuned mixture-of-experts model from Google DeepMind with roughly 26B total parameters of which about 4B activate per token, the pricing tiles $0.06 and $0.33, and the OpenAI-compatible base URL https://api.orcarouter.ai/v1.

Quem deve escolher qual?

A regra de decisão é curta o suficiente para ser enunciada em três linhas.

Escolha o Gemma 4 12B se precisar de qualquer coisa além de texto em alemão e inglês, se precisar de um número de qualidade medido antes de se comprometer, se o modelo tiver de rodar em hardware que você já tem, ou se preferir alugar tokens em vez de possuir um rack. É o único dos dois com uma pontuação independente, uma velocidade publicada e um preço de mercado.

Escolha o Kolibri se o seu requisito for um modelo de raciocínio de 78 bilhões de parâmetros cujos pesos, proveniência dos dados de treinamento, consumo de energia e licença são todos documentados, e que é implantado dentro do seu próprio perímetro, com um tokenizador construído para a prosa administrativa alemã e um comportamento de abstenção no qual um fluxo de trabalho regulamentado possa confiar. Esse é um alvo estreito e a Aleph Alpha mirou-o deliberadamente.

Não escolha nenhum dos dois com base na linha de um benchmark que você viu em um post de lançamento. O 14 do Gemma 4 12B é uma medição que outra pessoa fez e que você pode verificar. O 75,5 do Kolibri é uma afirmação feita pelo próprio autor, e a única pessoa que atualmente pode refutá-la é um cliente com duas H100s e um corpus de documentos.