Um cartão de título principal para a comparação 'MiniCPM5-2B-DSpark vs Gemma 4 12B' com o subtítulo 'Duas formas de rascunhar, duas classes de peso de IA local', mostrando à esquerda um pequeno chip rotulado como 'rascunho 324M' que alimenta um bloco rotulado como 'alvo de 2,5B no dispositivo' e, à direita, um painel mais largo rotulado como 'generalista multimodal de 11,95B', com uma linha de fluxo de chips de tokens acima rotulada como 'rascunhar e depois verificar', e o logotipo do OrcaRouter no canto inferior direito.
Guides & Insights

MiniCPM5-2B-DSpark vs Gemma 4 12B: Duas Maneiras de Rascunhar, Duas Classes de Peso de IA Local

Autor

Alistair Wren

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

A maneira mais rápida de ver por que o MiniCPM5-2B-DSpark e o Gemma 4 12B merecem estar na mesma página é ignorar por um momento o tamanho de cada um e observar como cada um escreve uma frase. Ambos contornam o barramento de memória com um modelo de rascunho: um modelo pequeno propõe vários tokens seguintes de uma só vez, e o modelo real verifica o bloco em uma única passada, de modo que o silício paga o custo de carregamento dos pesos uma vez por bloco, em vez de uma vez por token. O MiniCPM5-2B-DSpark é o modelo de rascunho que a OpenBMB publicou discretamente no Hugging Face em 6 de setembro de 2026 — um checkpoint complementar de 323,8 milhões de parâmetros que acelera o MiniCPM5-2B, o modelo on-device denso de 2,52 bilhões de parâmetros que a ModelBest anunciou na WAIC em 19 de julho de 2026. Já o Gemma 4 12B é o generalista multimodal sem encoder de 11,95 bilhões de parâmetros do Google, lançado em 3 de junho de 2026 com seus próprios modelos de rascunho integrados e um contexto de 256 mil tokens. Um apresenta o modelo de rascunho como um checkpoint Apache-2.0 separado que você mesmo carrega; o outro esconde um truque semelhante dentro de um único modelo grande que você simplesmente executa.

A nota de honestidade que define o formato deste artigo: MiniCPM5-2B-DSpark não é um modelo que você possa usar com prompts. Ele não tem tokenizador, nem template de chat, nem saída independente — um cartão que lista apenas um model.safetensors, um config e um README. É um acessório de camada de serviço para um alvo da classe 2B, e a comparação real que o leitor está fazendo é entre duas classes de pesos de IA local: uma stack 2B do tamanho de um celular que gera seus tokens, versus um generalista 12B de 16 gigabytes que gera seus tokens. Todo o resto abaixo é essa decisão tornada concreta.

O que MiniCPM5-2B-DSpark realmente é

O model card é toda a superfície pública do lançamento; portanto, é o que se pode saber a partir dele. O MiniCPM5-2B-DSpark é um checkpoint de rascunho DSpark: cinco camadas de atenção completa, 323.776.001 parâmetros, atenção de consulta agrupada com 16 cabeças de consulta e 2 cabeças KV, e um tamanho de bloco de sete — ele propõe até sete tokens candidatos por forward pass para o alvo MiniCPM5-2B verificar. A configuração declara a arquitetura Qwen3DSparkModel com um auto-mapeamento DSparkDraftModel, e ainda traz habilitadas a cabeça de confiança e a cabeça de Markov do método DSpark (arXiv 2607.05147, o artigo do D​eepSeek de julho de 2026) — o verificador ciente da carga que decide quando um sufixo não vale a pena ser verificado. Ele foi treinado por seis épocas em 7,05 bilhões de tokens de respostas geradas pelo MiniCPM5-2B, abrangendo prompts gerais, de matemática e de código.

A screenshot of the Hugging Face model page for openbmb/MiniCPM5-2B-DSpark (captured September 7, 2026) showing the model title, the description 'a DSpark draft checkpoint trained for exact pairing with MiniCPM5-2B and its tokenizer', and the Model Specification table listing Target model MiniCPM5-2B, five draft layers, 323,776,001 draft parameters, and a block size of seven.

O card acima do openbmb/MiniCPM5-2B-DSpark é toda a extensão do que foi lançado: model card, config, um arquivo Safetensors e nenhum anúncio, nenhuma postagem de blog, nenhum comunicado à imprensa — um lançamento de pesos silencioso, com apenas um dia de existência no momento em que escrevo.

O que o cartão não contém é tão importante quanto o que contém. Ele informa o comprimento de aceitação — na própria avaliação do repositório, uma média agregada de 5,52 tokens aceitos por etapa de verificação em decodificação gulosa, com matemática em 6,05 e código em 6,11 de um teto de sete tokens —, mas não publica nenhuma aceleração em tempo real, nenhuma métrica de tokens por segundo e nenhum benchmark independente. O mecanismo DSPARK do SGLang é o caminho de inferência documentado, com o rascunho carregado ao lado do alvo MiniCPM5-2B. Em outras palavras: a qualidade do rascunho é quantificada, seu benefício prático ainda não é, e qualquer pessoa que o adote deve medir antes de acreditar.

O que o Gemma 4 12B traz para o outro lado

O Gemma 4 12B é o filho do meio da família Gemma 4 do Google e ocupa um ponto totalmente diferente na curva da IA local. É um único modelo denso de 11,95B que recebe texto, imagem, áudio e vídeo como entrada, sem codificadores separados, segue chamadas de ferramentas de fábrica e combina um contexto nativo de 256K com rascunhos de predição multítoken que executam o mesmo truque de barramento de memória internamente — mas de dentro do checkpoint, então não há nada extra para você baixar ou conectar. É Apache 2.0, roda na prática em um laptop de 16 GB e chegou com todo o aparato do Google: avaliações de lançamento, model cards para as variantes base e de instrução, suporte de ecossistema no Model Garden, no LM Studio e no Ollama. Ele tem meses de implantação da comunidade por trás — o que o rascunho MiniCPM de um dia não tem.

A screenshot of the Hugging Face model page for google/gemma-4-12B-it (captured August 31, 2026, reused from a published sibling) showing the model title, the Any-to-Any and image-text-to-text tags, the Transformers and Safetensors libraries, and the Apache 2.0 license.

O model card do Google para o Gemma 4 12B acima mostra o contraste em um único quadro: um generalista multimodal maduro, cujos autores são uma característica do lançamento, e não um repositório separado.

As especificações, rotuladas honestamente

Leia estes com a procedência em mente: os números do MiniCPM5-2B são alegações da ficha técnica da ModelBest, não reproduzidas; os números do Gemma 4 12B são do próprio Google, há muito tempo expostos ao uso da comunidade.

• O que você executa — {{1}}MiniCPM5-2B-DSpark{{/1}}: um modelo de rascunho de 324M que só funciona ao lado do {{2}}MiniCPM5-2B{{/2}} (2,52B denso, 42 camadas). Gemma 4 12B: um modelo denso autônomo de 11,95B.

• Contexto — MiniCPM5-2B alvo: 128K nativo. Gemma 4 12B: 256K nativo.

• Modalidade — Stack MiniCPM5-2B: apenas texto. Gemma 4 12B: entrada de texto, imagem, áudio e vídeo, sem encoder.

Rascunho — MiniCPM5-2B-DSpark: rascunho externo DSpark, sete tokens por passada, mecanismo SGLang DSPARK. Gemma 4 12B: rascunhadores internos de previsão de múltiplos tokens, nada a instalar.

Rodapé — MiniCPM5-2B: cerca de 5GB em BF16, mais um arquivo de rascunho de ~650MB; Gemma 4 12B: cerca de 18GB em BF16, viável na prática em hardware classe 16GB com quantização.

• Evidência — MiniCPM5-2B-DSpark: apenas números de comprimento de aceitação do repositório, de um dia atrás. Gemma 4 12B: avaliações de lançamento e meses de implantação pela comunidade.

A two-column scoreboard for MiniCPM5-2B-DSpark vs Gemma 4 12B: left column MiniCPM5-2B-DSpark with 'What you run: 324M draft for a 2.52B target', text-only modality, 128K target window, external DSpark drafting at 7 tokens per pass, ~5GB target plus 650MB draft footprint, and an unannounced Hugging Face release September 6 2026; right column Gemma 4 12B with a standalone 11.95B model, text/image/audio/video input, 256K native context, internal MTP drafters, ~18GB BF16, and Google's June 3 2026 launch, with a footer reading 'MiniCPM figures from the model card, unreproduced; Gemma specs per Google' and the OrcaRouter logo in the bottom-right corner.

O quadro acima é o mesmo retrato em seis linhas: as duas colunas discordam em quase tudo, exceto na estratégia que ambas usam para escrever rápido.

Qual classe de peso corresponde ao silício que você realmente tem

Como o MiniCPM5-2B-DSpark não é um modelo, a bifurcação significativa está na classe de pesos do modelo-alvo em comparação com a do Gemma 4 12B — e essa bifurcação é, em grande parte, uma questão de hardware. Um telefone, uma placa de smart cockpit ou um pequeno dispositivo de borda com alguns gigabytes de DRAM não conseguem rodar um modelo de 11,95B a uma velocidade útil; o barramento de memória é exatamente o gargalo que o sufocaria. Foi para esse mundo que a stack MiniCPM5-2B foi criada — um modelo denso de 2B cujos pesos cabem na memória do dispositivo, com um modelo de rascunho acoplado para recuperar parte dos tokens por segundo que os modelos densos pequenos perdem. A decodificação especulativa é mais eficaz exatamente nesse regime denso e limitado pela memória, e é por isso que o modelo de rascunho é a parte interessante do lançamento, e não um truque.

Gemma 4 12B é a resposta um peso acima. Se a sua máquina tem 16GB ou mais — um laptop, uma estação de trabalho, um servidor de borda robusto — você pode carregar o generalista multimodal, e ganha três coisas que a pilha de 2B não pode oferecer: entrada de imagem, áudio e vídeo sem codificadores ou um segundo pipeline; uma janela de 256K para trabalho em escala de repositório ou escala de documento; e uma maturidade que um checkpoint de rascunho de um dia simplesmente não tem. Você abre mão da capacidade de rodar nos menores dispositivos e paga aproximadamente três vezes a pegada de memória.

A realidade do roteamento para ambos

Nenhum dos dois lados desta comparação está, hoje, em um catálogo hospedado — nem o OrcaRouter. O MiniCPM5-2B-DSpark é, por definição, um acessório de serving auto-hospedado: você executa a stack SGLang por conta própria, e o rascunho só existe na sua implantação local. O Gemma 4 12B tem pesos abertos, então você pode servi-lo ou usá-lo onde ele já está disponível. É exatamente nesse cenário que uma camada de roteamento mostra seu valor como rede de segurança, e não como mecanismo de entrega: quando você testa um build de rascunho inédito contra uma carga de trabalho que você já atende, direcionar o caminho de teste por uma única API com failover automático significa que uma stack não comprovada pode travar sem derrubar a produção, e os preços de tabela dos provedores envolvidos passam com markup de 0% — então, qualquer mudança de preço em um modelo hospedado que você use como comparação aparece no mesmo dia. Para a comparação em si, porém, o plano honesto para ambos os modelos é o mesmo: você está se auto-hospedando, então o benchmark que importa é o que você roda no seu próprio hardware.

O veredito

MiniCPM5-2B-DSpark e Gemma 4 12B não são concorrentes em nenhum sentido de confronto direto — são duas categorias de peso de IA local que por acaso compartilham um truque. Escolha a stack MiniCPM5-2B com seu draft DSpark quando seu dispositivo não conseguir rodar um modelo de 12B e você quiser um modelo orientado a agentes, com capacidade de texto, sob licença Apache-2.0, que caiba na memória do dispositivo; o draft é uma aceleração gratuita promissora, mas meça-o na sua própria compilação do SGLang antes de confiar nele, porque seu retorno ainda não foi quantificado. Escolha Gemma 4 12B quando seu hardware tiver folga e você quiser um único modelo multimodal com janela de 256K e um ecossistema por trás. A questão não é qual modelo é mais inteligente — é qual deles o seu hardware consegue realmente alimentar.