
MiniCPM5-2B vs Gemma 4 12B: O líder do ranking Sub-4B contra o generalista 12B do Google
- orcaNOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens
- deepseekNOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- openaiNOVOOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligência76Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligência69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Inteligência78Código
Os materiais de lançamento do MiniCPM5-2B contêm uma frase que parece encerrar qualquer discussão antes mesmo de começar: na World Artificial Intelligence Conference, em 19 de julho, a ModelBest e a OpenBMB chamaram o modelo de nº 1 entre modelos com menos de 4B de parâmetros no ranking da Artificial Analysis, e seus pesos abertos agora foram publicados silenciosamente no Hugging Face. O Gemma 4 12B é a resposta do Google vinda de uma classe de peso totalmente diferente — um generalista multimodal denso de 11,95B, sem codificador, lançado em 3 de junho, que aceita texto, imagem, áudio e vídeo como entrada e já tem meses de implantação pela comunidade por trás dele. Compará-los não é um exercício de ficha técnica; é uma decisão sobre para qual dispositivo você está lançando o produto, porque um modelo que lidera sua classe de tamanho e um modelo que é simplesmente maior estão respondendo a perguntas diferentes sobre hardware.
O timing é a razão pela qual esse confronto existe em primeiro lugar. O MiniCPM5-2B foi apresentado na WAIC em julho como um produto — uma história de chips tanto quanto de modelos, com nove parceiros de silício day-zero da comunidade FlagOS — e os pesos foram prometidos "em um futuro próximo". Sete semanas depois, o repositório openbmb/MiniCPM5-2B apareceu no Hugging Face (o changelog da OpenBMB registra o lançamento em 7 de setembro), sob Apache-2.0, sem restrições de acesso, com o checkpoint BF16, GGUF, MLX, GPTQ, os checkpoints base e SFT e os datasets de treinamento, tudo na mesma coleção. Sem comunicado à imprensa, sem evento de lançamento. Até o momento em que escrevo, o model card é o anúncio, e nenhuma rodada independente de benchmarks foi publicada ainda — tudo o que há de quantitativo sobre o modelo 2B abaixo vem ou da reprodução da própria ModelBest ou do snapshot da Artificial Analysis que ela cita. O Gemma 4 12B, em contraste, foi lançado pela maquinaria normal do Google e já foi baixado milhões de vezes. Essa lacuna de evidências é parte da comparação, não uma nota de rodapé.
O que acabou de mudar em cada lado
MiniCPM5-2B é o segundo modelo da série MiniCPM5, depois do MiniCPM5-1B que a OpenBMB lançou em código aberto em 19 de maio. A ficha descreve um transformer denso com 2.516.756.480 parâmetros no total (1.981.982.720 excluindo embeddings — o número que justifica o rótulo “classe 2B”), 42 camadas com dimensão oculta 2048, atenção por consultas agrupadas com 16 cabeças de consulta e apenas 2 cabeças KV, e um vocabulário de 130.560. É uma arquitetura LlamaForCausalLM padrão — a ficha deixa explícito que não são necessários kernels personalizados nem fork do código do modelo — e o checkpoint inteiro vem como um único shard safetensors em BF16. A escolha de design interessante é o pós-treinamento: SFT em 400 bilhões de tokens de dados de pensamento profundo e, depois, On-Policy Distillation, que funde dezesseis modelos especialistas de RL, cinco deles agênticos, de volta em uma única pequena rede densa. A ficha atribui à RL + OPD um ganho médio de 10,96 pontos em tarefas de raciocínio e gerais e de 6,96 pontos em tarefas agênticas — deltas internos, mas que explicam o formato deste modelo: um 2B feito para ser um agente on-device, emitindo chamadas de ferramenta em estilo XML nativamente.

O Gemma 4 12B ocupa uma posição diferente no portfólio do Google. É o filho do meio da família Gemma 4 — acima dos modelos E2B e E4B focados em edge, abaixo do MoE de 26B e do modelo de fronteira de 31B — e é o único membro construído com uma arquitetura sem encoder: patches de imagem brutos e formas de onda de áudio são projetados diretamente no espaço de tokens, de modo que um único modelo denso processa entradas de texto, imagem, áudio e vídeo, sem precisar de uma torre de encoder separada. Ele traz janela de contexto de 256K, chamada de ferramentas nativa, passagem de raciocínio opcional e rascunhadores de previsão de múltiplos tokens que aceleram a decodificação de dentro do checkpoint. É Apache-2.0, prático em hardware da classe de 16GB (cerca de 8GB em 4 bits), e sua página no Hugging Face mostra milhões de downloads por mês.

A afirmação sobre o ranking e a classe de tamanho que ela deixa de fora.
A manchete da ModelBest para o MiniCPM5-2B é um Artificial Analysis Intelligence Index de 17, o primeiro entre modelos com menos de 4B de parâmetros no lançamento. Duas ressalvas devem acompanhar esse número. A pontuação reflete o snapshot v4.1 da AA e não é diretamente comparável aos valores de índice de snapshots anteriores; além disso, é um valor de lançamento citado pelo fornecedor antes de qualquer nova execução independente. A leitura honesta é mais restrita e ainda assim impressionante: no lançamento, segundo a metodologia da AA da época, esse modelo de 2,5B liderou toda a sua classe de tamanho. A Gemma 4 12B não aparece nessa classe e, nas próprias páginas da Artificial Analysis hoje, ela apresenta um índice mais alto — cerca de 22 para a variante de raciocínio e 13 para o modelo instruct sem raciocínio, ambos "bem acima da média" para seu grupo de pares. Índices de snapshots diferentes não se alinham perfeitamente, então trate isso como direção, não como precisão: o generalista de 12B se mostra o modelo mais capaz, e o de 2B se mostra o mais capaz de seu tamanho. São afirmações diferentes e ambas podem ser verdadeiras.
O placar, honestamente rotulado
Considering the sourcing, these rows indicate that MiniCPM5-2B's figures are claims from the ModelBest card, released a week ago and not yet independently verified; meanwhile, Gemma 4 12B's figures were reported by Google and have been widely used by the community for a long time.
• Tamanho — MiniCPM5-2B: 2,52B total / 1,98B sem embeddings, denso. Gemma 4 12B: 11,95B, denso.
Modalidade — MiniCPM5-2B: apenas texto. Gemma 4 12B: entrada de texto, imagem, áudio e vídeo, sem encoder.
MiniCPM5-2B: 131.072 tokens na configuração padrão. Gemma 4 12B: 256K de contexto nativo (algumas receitas de inferência fixam em 128K).
• Idiomas — MiniCPM5-2B: ficha e dados centrados em inglês e chinês. Gemma 4 12B: mais de 140 idiomas.
• Lançamento — MiniCPM5-2B: anunciado em 19 de julho de 2026; pesos disponíveis em 6 e 7 de setembro, discretamente. Gemma 4 12B: lançado em 3 de junho de 2026, com avaliações completas de lançamento.
• Evidências — MiniCPM5-2B: ficha do fornecedor além de AA v4.1 (Index 17, #1 sub-4B); ainda sem execução independente. Gemma 4 12B: avaliações de lançamento além de meses de implantação pela comunidade e ~3,3 milhões de downloads mensais.

O quadro acima é o mesmo retrato em seis linhas: os dois modelos discordam em quase todas as dimensões, e as colunas que decidem a escolha — modalidade, idiomas, classe de dispositivo — são as que nenhuma média de benchmark captura.
Onde a 12B vence: as coisas que uma 2B somente de texto não consegue fingir
Comece pela modalidade. O {{1}}Gemma 4 12B{{/1}} processa áudio, imagens e vídeo nativamente; o {{2}}MiniCPM5-2B{{/2}} é somente texto. Qualquer produto que transcreva, observe uma tela ou assista a um vídeo precisa de um segundo pipeline além do 2B — e nesse ponto, a vantagem do "modelo pequeno" se desfaz em parte. Os idiomas são o segundo obstáculo: {{3}}140+{{/3}} contra um lançamento centrado em {{4}}inglês/chinês{{/4}}. Para um produto que atende uma cauda longa de idiomas, o 2B não é candidato algum. E depois há evidências. O {{5}}Gemma 4 12B{{/5}} foi baixado {{6}}milhões de vezes{{/6}}, quantizado, ajustado e servido em produção por três meses; seus modos de falha estão documentados, e seu ecossistema abrange llama.cpp, Ollama, LM Studio, MLX, vLLM e SGLang. O {{7}}MiniCPM5-2B{{/7}} é um repositório de uma semana cujos números de destaque — incluindo um {{8}}46.4{{/8}} obtido pelo fornecedor no {{9}}SWE-bench Verified{{/9}}, o que seria notável para um modelo denso de {{10}}2.5B{{/10}} se sobreviver a testes independentes — não foram tocados por ninguém fora do laboratório. Apenas pela maturidade, a escolha não é nem de perto equilibrada.
Onde a 2B é a única opção
Nada disso importa na classe de dispositivos onde um 12B simplesmente não cabe. Um smartphone, uma placa de cockpit inteligente ou um pequeno dispositivo de borda com alguns gigabytes de DRAM não consegue mover os pesos de um modelo de 11,95B pelo barramento de memória a uma velocidade útil — esse é exatamente o gargalo que o sufocaria. O MiniCPM5-2B foi criado para esse mundo: pesos que cabem na memória do dispositivo, uma janela de 128K para longas sessões de agente, chamada de ferramentas nativa projetada para execução interativa e adaptação desde o dia zero em nove famílias de chips, além de ARM. Se o seu alvo é uma NPU classe smartphone ou uma placa embarcada, o Gemma 4 12B não está competindo com o MiniCPM5-2B; ele simplesmente não é implantável ali. E se o seu alvo suporta 12B, mas apenas por pouco — um laptop de 16GB — o 2B lhe dá folga: latência mais rápida por token, menor consumo de energia e a opção de executar um segundo modelo no mesmo espaço.
Como descobrir quais reivindicações sobrevivem
Como ambos os lados são open-weight e auto-hospedáveis, o próximo passo honesto é medir no seu próprio hardware, em vez de fazer outra leitura das especificações. Se você está comparando um MiniCPM5-2B com um Gemma 4 12B em uma carga de trabalho que já atende, é aqui que uma camada de roteamento também mostra seu valor: apontar o caminho do teste para um novo checkpoint auto-hospedado por meio de uma única API com failover automático significa que uma pilha não comprovada pode travar ou entrar em loop sem derrubar a produção, enquanto os preços de tabela dos provedores em relação ao que você compara passam com margem de 0%. O modelo em si é um repositório de um dia, então o padrão é tratá-lo como um experimento — mas o experimento é barato de executar, e as duas horas necessárias para reproduzir o SWE-bench ou uma fatia do seu próprio conjunto de avaliação no 2B são exatamente a evidência que falta nesse confronto.
O veredito
Escolha o Gemma 4 12B quando seu hardware tiver folga e sua carga de trabalho for além de texto — um produto multimodal, um público multilíngue ou qualquer coisa em que três meses de comportamento comprovado pela comunidade importem mais do que uma coroa de rankings. Escolha o MiniCPM5-2B quando seu dispositivo não suportar um 12B de forma alguma, ou quando um 2.5B capaz de texto e orientado a agentes em um chip classe telefone permitisse lançar um produto que um modelo maior torna impossível. O líder de rankings abaixo de 4B é uma conquista genuína e seu lançamento com pesos abertos o torna testável hoje; só não é, com base nas evidências disponíveis, um substituto para um generalista de 12B em qualquer lugar onde um 12B possa realmente rodar.
