Um card de título hero com o texto 'Kolibri vs MiniCPM5 2B' em tipo grande e negrito, com uma única linha menor abaixo com o texto 'um modelo de nível de servidor contra um agente no dispositivo', e dois pequenos ícones de linha plana lado a lado — um beija-flor à esquerda e o contorno de um pequeno chip móvel à direita — separados por um fino divisor vertical, sobre um fundo branco com suaves detalhes de gradiente azul e ciano e o logotipo da OrcaRouter no canto inferior direito.
Guides & Insights

Kolibri vs MiniCPM5-2B: 78 bilhões de parâmetros contra 2,5, e por que o pequeno não é a opção barata

Autor

Rowan Sterling

Data de publicação

Modelos mais recentes · 20Ver todos os modelos →
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Coloque o Kolibri ao lado do MiniCPM5-2B e a leitura instintiva é que esta é uma comparação de tamanho, e que o modelo de 2,5 bilhões de parâmetros é a escolha econômica. Essa leitura está errada de uma forma instrutiva. Kolibri é o modelo de mistura de especialistas de 78,1 bilhões de parâmetros da Aleph Alpha, lançado em 3 de outubro de 2026, ativando 3,46 bilhões de parâmetros por token, com uma pegada FP8 de cerca de 78 GB e uma configuração mínima de serviço de duas placas A100 de 80 GB. MiniCPM5-2B é o modelo denso de 2,52 bilhões de parâmetros da ModelBest e da OpenBMB, apresentado na Conferência Mundial de Inteligência Artificial em 19 de julho de 2026, com os pesos chegando ao Hugging Face em 6 de setembro. MiniCPM5-2B é trinta e uma vezes menor em número de parâmetros. É também aquele que exige um orçamento de avaliação antes de confiar nele, porque seus números mais citados são executados pelo fornecedor e não reproduzidos — o que é precisamente o oposto do que "modelo pequeno" costuma implicar em termos de risco.

Ambos foram lançados discretamente; apenas um deles foi lançado recentemente

Eles têm histórias de origem semelhantes e idades muito diferentes, e as idades importam. O repositório da Aleph Alpha para o Kolibri foi criado em 2 de outubro de 2026, com uma data de lançamento declarada para 3 de outubro, e o anúncio da própria sala de imprensa do fornecedor foi divulgado naquela manhã, no Dia da Reunificação Alemã. A imprensa geral de IA em grande parte não deu atenção no dia, e foi daí que veio o enquadramento de "lançamento discreto", mas um cartão de modelo, um relatório técnico e uma publicação do fornecedor não constituem um lançamento silencioso. O MiniCPM5-2B foi genuinamente mais discreto: o anúncio na WAIC em julho foi uma apresentação em conferência de um pitch e especificações, e os pesos propriamente ditos só apareceram em 6 de setembro, publicados sem um evento de lançamento, ao lado de checkpoints GGUF, MLX, GPTQ, base, SFT e draft e dos corpora de treinamento por trás deles.

Vale a pena lembrar desse intervalo de cinco semanas entre o anúncio e os pesos, porque é por isso que circulam dois conjuntos diferentes de números para este modelo. O material de julho alardeava uma janela de contexto de 512K tokens. A configuração enviada define 131.072. O artefato lançado é o que conta.

Para que cada modelo realmente serve

Kolibri foi criado para o trabalho com documentos em alemão e inglês, e a Aleph Alpha é incomumente específica sobre por que isso exigiu engenharia de verdade. Pequenos experimentos com modelos proxy definiram uma meta de cerca de 20 por cento de alemão na mistura de treinamento, o que, para uma execução de 20 trilhões de tokens, significava encontrar 4 trilhões de tokens em alemão. Conjuntos de dados alemães abertos, deduplicados e filtrados, renderam 390 bilhões — uma ordem de magnitude a menos —, então o laboratório reajustou um filtro do Common Crawl especificamente para o alemão, produzindo 1,3 trilhão de tokens orgânicos únicos, e reformulou documentos alemães existentes em verbetes de enciclopédia, diálogos e trechos, rendendo aproximadamente mais um trilhão, que se tornou a maior fonte única em alemão. A tradução, usada no predecessor Kolibri Origin, foi descartada no Kolibri. O detalhe do filtro é o que se deve guardar: um pipeline padrão de dados linguísticos descarta documentos com excesso de palavras longas, e a prosa administrativa alemã rotineiramente ultrapassa o limite inglês para o comprimento médio das palavras, então as configurações padrão apagam silenciosamente o registro em que a administração pública escreve.

MiniCPM5-2B foi construído para o extremo oposto — um agente no dispositivo. A ficha descreve um transformer denso com 2,52 bilhões de parâmetros totais, 1,98 bilhão sem embeddings, 42 camadas com tamanho oculto 2048, atenção de consulta agrupada com 16 cabeças de consulta e 2 cabeças KV, e uma arquitetura padrão LlamaForCausalLM sem kernels personalizados. O pipeline de treinamento pende para o agêntico: treinamento intermediário de agente em escala de 200 bilhões, um grande conjunto de SFT para agentes, alinhamento por RL para agentes, e um estágio final de Destilação On-Policy que reintegra dezesseis modelos especialistas de RL em uma única rede densa pequena. Ele inclui chamadas de ferramentas no estilo XML com um parser SGLang integrado, e sua configuração divulgada define uma janela de 131.072 tokens.

• Parâmetros — Kolibri: 78.103.074.560 no total, 3.457.573.120 ativos, esparsidade de 22,6:1. MiniCPM5-2B: 2.516.756.480 no total, 1,98B sem embeddings, denso.

• Lançado — Kolibri: 3 de outubro de 2026. MiniCPM5-2B: anunciado em 19 de julho de 2026, pesos em 6 de setembro de 2026.

• Contexto — Kolibri: 16.384 treinados, 65.536 com treinamento intermediário, 262.144 nativos, 1.048.576 validados. MiniCPM5-2B: 131.072 na configuração disponibilizada; a alegação de 512K de julho não consta nela.

• Pegada — Kolibri: cerca de 78 GB em FP8; no mínimo duas A100 de 80 GB, duas H100 SXM5, uma H200, uma B200 ou uma B300. MiniCPM5-2B: um único shard BF16, de classe laptop.

• Idiomas — Kolibri: alemão e inglês, por design e nada mais. MiniCPM5-2B: inglês e chinês, com todos os conjuntos de avaliação publicados em inglês.

• Chamada de ferramentas — Kolibri: estilo Hermes com um parser do vLLM já incluído. MiniCPM5-2B: estilo XML com um parser do SGLang.

• Licença — ambos Apache 2.0, ambos sem cláusula adicional de uso aceitável.

A two-column comparison scoreboard titled 'Kolibri vs MiniCPM5 2B'. Left column Kolibri: Parameters 78.1B MoE / 3.46B active, Context 262,144 native / 1M validated, Footprint about 78 GB in FP8, Languages German and English, Tool calling Hermes-style with a vLLM parser, Licence Apache 2.0. Right column MiniCPM5 2B: Parameters 2.52B total / 1.98B non-embedding, Context 131,072 in the shipped config, Footprint a single BF16 shard, laptop-class, Languages English and Chinese, Tool calling XML-style with an SGLang parser, Licence Apache 2.0. A footer line reads 'Kolibri figures vendor-reported; MiniCPM5 2B figures per its model card.' with the OrcaRouter logo in the bottom-right corner.

Os placares, e a origem por trás deles

Não existe, em lugar nenhum, nenhum número de comparação direta para esta combinação, no material de nenhum dos fornecedores, e não vamos montar um a partir de duas estruturas de teste diferentes e chamar isso de comparação. Vale a pena separar cuidadosamente o que cada lado publica, porque os dois conjuntos de números carregam quantidades muito diferentes de evidências.

Os números do Kolibri vêm da própria tabela comparativa de catorze modelos da Aleph Alpha, executada em um único harness com o Kolibri no esforço de raciocínio alto: 75,5 na média em inglês, 70,8 na média em alemão. Essa tabela não favorece seu objeto — Qwen3.8 27B pontua 80,2 e 79,9 nas mesmas duas médias e lidera no GPQA Diamond, LiveCodeBench v6, SWE-Bench Verified e em ambos os benchmarks de contexto longo, enquanto ativa aproximadamente um oitavo dos parâmetros do Kolibri. O enquadramento do fornecedor para essa diferença é uma fronteira de Pareto de qualidade contra tokens decodificados por segundo por GPU, que nenhum dos modelos comparados supera. É um argumento de economia de serviço, não um argumento de capacidade, e nenhum terceiro o mediu: não há entrada do Artificial Analysis para o Kolibri e nenhuma replicação do harness.

Os números do MiniCPM5-2B vêm da própria ficha dele: uma média interna de 53,9 em um conjunto de comparação selecionado pelo fornecedor, AIME 2025/2026 em 86,5, MATH-500 em 94,6, e um 46,4 executado pelo fornecedor no SWE-bench Verified que seria notável para um modelo denso de 2,5 bilhões de parâmetros se sobreviver a testes independentes. Nessa ficha, o Granite 4.2 3B da IBM fica em 42,7 contra os 53,9 do MiniCPM5-2B — um fornecedor executando os dois modelos em uma única suíte que ele escolheu. Suítes diferentes, harnesses diferentes, fornecedores diferentes. Nada disso é um veredito sobre este pareamento.

O que é genuinamente útil do lado do MiniCPM5-2B é a divulgação. A OpenBMB lançou os corpora de treinamento UltraData juntamente com os pesos — Ultra-FineWeb, UltraX, UltraData-Code, UltraData-Math, os conjuntos SFT e RL do agente — todos Apache 2.0, o que transforma uma caixa preta numa receita que você pode inspecionar e continuar no seu próprio domínio. O modelo também vem com adaptação day-zero em nove famílias de chips através da comunidade FlagOS da ModelBest, da Huawei Ascend à NVIDIA e ARM, o que é uma declaração de implantação e não de benchmark. Em contrapartida, a IBM publicou os pesos do Granite 4.2 3B e um relato técnico detalhado da construção, mas não os seus dados de treinamento, e a Aleph Alpha publicou o pipeline de dados e a contabilidade energética do Kolibri — 20 trilhões de tokens de pré-treinamento, 9,5×10² MWh incluindo a sobrecarga do centro de dados e excluindo o ajuste fino supervisionado e a aprendizagem por reforço — mas não o corpus em si.

Onde a diferença de tamanho realmente aparece

A forma mais útil de colocar estes dois lado a lado é nos dois eixos que decidem uma implementação real: o que tem de estar no local e o que acontece quando o modelo erra.

Em hardware, o MiniCPM5-2B vence, e não é por pouco. Um modelo denso de 2,52 bilhões de parâmetros em um único shard BF16 roda em um laptop, em um dispositivo de borda ou em uma única GPU de consumidor, e o suporte do FlagOS em nove famílias de chips significa que ele roda em hardware que não é, de modo algum, um acelerador NVIDIA. O Kolibri exige, no mínimo, duas placas A100 80 GB ou uma B200, aproximadamente 78 GB de pesos FP8, servidos por meio do plugin vLLM aleph-inference ou do contêiner publicado. Para uma carga de trabalho de cockpit inteligente ou baseada em celular, o 2B é o único dos dois que se qualifica, e o Kolibri nunca foi projetado para fazer isso.

Em termos de verificabilidade, a Kolibri vence por uma razão mais sutil. A sua afirmação mais citada — a economia de serving — não foi testada, mas os seus números de qualidade estão pelo menos publicados em comparação com treze concorrentes nomeados num único harness, com as configurações divulgadas, e a própria tabela do fornecedor dá a vitória, na maioria das linhas, a um adversário. Os números de destaque do MiniCPM5-2B são do fornecedor, na suíte do fornecedor, sem qualquer harness de comparação divulgado, e o modelo carrega a incerteza extra de um checkpoint com semanas de idade, em vez de dias. Nenhum dos modelos foi avaliado por benchmarks independentes. A diferença é que um fornecedor registou uma comparação que faz o seu próprio modelo perder, e o outro registou uma que faz o seu próprio modelo ganhar por uma margem ampla.

Propositalmente, não há competição alguma. O Kolibri existe para processamento de documentos em alemão on-premises, com um tokenizador bilíngue que a Aleph Alpha reporta a 4,90 bytes médios por token em texto web alemão, contra 4,35 do GPT-5 e 3,28 do Kimi K3 — todos medidos pelos fornecedores, e um efeito de custo por token, não uma alegação de qualidade. O MiniCPM5-2B existe para agentes de chamada de ferramentas em inglês e chinês em hardware restrito. Uma equipe com contratos em alemão e uma exigência de conformidade não está escolhendo entre eles.

A screenshot of the Hugging Face model card for openbmb/MiniCPM5-2B, showing the card header with the OpenBMB organisation and its like count, the TextGeneration, Transformers and Safetensors tags, the English and Chinese language tags, the on-device and tool-calling tags, the Apache 2.0 licence, and the model-size line reading 3B parameters in BF16 tensor type.

A realidade do roteamento e o experimento que vale a pena realizar

Nenhum dos dois modelos está hoje em um catálogo hospedado, e verificamos ambos em vez de presumir. O Kolibri não tem SKU de API do fornecedor — o lançamento é composto de pesos, um relatório técnico e uma imagem de contêiner — e não está no OrcaRouter: sondamos o catálogo com todas as grafias do prefixo do fornecedor e do nome do modelo, e ele retorna não encontrado. O MiniCPM5-2B também não tem endpoint hospedado da ModelBest, e não é roteado conosco. Ambos são propostas auto-hospedadas, e preferimos dizer isso a dar a entender que servimos qualquer um dos dois.

Onde isso fica interessante é no experimento. Um modelo agêntico de 2,5 bilhões de parâmetros e um modelo de documentos de 78 bilhões de parâmetros resolvem problemas diferentes, e a única forma de saber de qual a sua carga de trabalho precisa é testar ambos com ela — que é exatamente a situação para a qual uma camada de roteamento foi criada, mesmo quando ela não carrega nenhum dos dois modelos. Aponte um caminho de teste para uma build auto-hospedada do MiniCPM5-2B por meio de um endpoint compatível com OpenAI com failover automático, deixando a produção em um modelo roteado comprovado, e o novo stack pode travar ou produzir bobagem sem derrubar nada. Os preços de tabela dos provedores nos modelos com os quais você compara são repassados sem markup, então o A/B continua barato e reversível. E se o que o experimento realmente revela é que sua carga de trabalho em alemão não precisa de nenhum dos modelos auto-hospedados, a mesma chave alcança uma pequena camada de mistura de especialistas que já é roteada — a variante Gemma 4 26B-A4B a US$ 0,06 por milhão de tokens de entrada e US$ 0,33 por milhão de saída, com uma janela de 262.144 tokens e entrada de texto, imagem e vídeo — que é a maneira mais barata de descobrir antes de comprar duas GPUs.

Qual deles, e o que mudaria a resposta?

Execute o MiniCPM5-2B se a restrição for o dispositivo. Com 2,52 mil milhões de parâmetros, é o único dos dois que cabe num laptop, num cockpit ou numa caixa edge, e se a sua carga de trabalho for um agente interativo de chamada de ferramentas em inglês ou chinês, é esse o modelo a que se destina. Reserve tempo para reproduzir primeiro os seus números — a média de 53,9 e a alegação de 46,4 no SWE-bench são exclusivas da ModelBest, e o facto de os corpora de treino estarem abertos torna essa reprodução genuinamente possível em vez de teórica.

Execute o Kolibri se o corpus for alemão, o hardware existir e os pesos não puderem sair do prédio. Uma janela nativa de 262.144 tokens, um cache KV FP8, quatro níveis de esforço de raciocínio e o tool calling do Hermes são o formato certo para trabalho com documentos regulamentados, e os termos da Apache 2.0 mais o pipeline de dados publicado são a parte que sobrevive a uma revisão de aquisição.

Duas coisas resolveriam isso mais rápido do que qualquer argumento. Uma execução independente do SWE-bench Verified no MiniCPM5-2B confirmaria ou derrubaria a afirmação mais surpreendente que qualquer um dos cartões faz. E uma medição independente de throughput do Kolibri na sua configuração recomendada com dois H100 — ou uma entrada no Artificial Analysis, que não existe hoje — transformaria "78 bilhões de parâmetros" de uma especificação em um custo, que é o número que qualquer pessoa que esteja avaliando esta comparação em relação ao hardware realmente procura. Até então, a diferença de tamanho é real, a diferença de propósito é maior, e a opção que parece barata é a que carrega a afirmação não verificada.

A screenshot of the OrcaRouter model page for google/gemma-4-26b-a4b-it, showing the model header under Google, the 262K-token context badge, the input line reading text plus image plus video, and the community description noting 25.2B total parameters with 3.8B activated per token during inference.

Comparados neste artigo1

Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente