
MiniCPM5-2B-DSpark: OpenBMB disponibiliza silenciosamente os pesos do MiniCPM5-2B com um modelo de rascunho projetado para velocidade
- deepseekNOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- openaiNOVOOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleNOVOGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenNOVOQwen: Qwen3.8 Max (0902)2026-09-0240Inteligência72Código
- anthropicNOVOAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0340Inteligência72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligência69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Inteligência78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2134Inteligência69Código
Há seis semanas, o MiniCPM5-2B era uma promessa. Apresentado na conferência WAIC em Xangai em 2026-07-19 como o modelo sub-4B no topo do Artificial Analysis Index, ele veio com uma nota de roadmap de que os pesos abertos chegariam "em breve". O "em breve" chegou esta semana, sem nenhum alarde. Em 2026-09-06, a OpenBMB publicou o repositório principal do MiniCPM5-2B no Hugging Face sob licença Apache-2.0 e, vinte e um minutos depois, publicou o MiniCPM5-2B-DSpark — um checkpoint de rascunho de 323,8 milhões de parâmetros cuja única função é fazer o MiniCPM5-2B decodificar mais rápido com o algoritmo de decodificação especulativa DSpark. Uma compilação GPTQ seguiu em 2026-09-07. Até o momento em que escrevo, não há anúncio, post de lançamento ou entrada de changelog que pudéssemos encontrar; o lançamento veio à tona com repositórios sendo discretamente tornados públicos ao longo de uma janela de onze dias.
Este é um texto do tipo "o que sabemos até agora", e o enquadramento importa. O MiniCPM5-2B-DSpark não é um chatbot autônomo nem um novo carro-chefe — é um acelerador: um modelo pequeno e rápido que propõe tokens antes do MiniCPM5-2B, que então os verifica em paralelo. Ele é inútil sem o seu alvo, e o seu alvo é a razão para nos importarmos. O lançamento de pesos abertos do MiniCPM5-2B que a OpenBMB prometeu em julho agora está de fato no Hugging Face, e o modelo de rascunho distribuído junto com ele é o mecanismo que o fornecedor recomenda para executá-lo a uma velocidade útil. Tudo o que não for explicitamente atribuído abaixo é lido diretamente dos dois cartões de modelo e de seus repositórios.
O que foi lançado e quando
A família 2B foi disponibilizada ao público como um lançamento contínuo e não anunciado, começando pelos itens mais recentes:
• 2026-08-27 — MiniCPM5-2B-Base e MiniCPM5-2B-SFT surgem, os checkpoints brutos pré-treinados e ajustados finamente com supervisão.
• 2026-09-01 — MiniCPM5-2B-Midtrain, o estágio de treinamento intermediário agêntico.
• 2026-09-05 — MiniCPM5-2B-MLX e MiniCPM5-2B-GGUF, os formatos Apple-Silicon e llama.cpp.
• 2026-09-06 — o repositório principal MiniCPM5-2B e, vinte e um minutos depois, o MiniCPM5-2B-DSpark.
• 2026-09-07 — MiniCPM5-2B-GPTQ, o formato de serving quantizado.
Todos eles carregam a licença Apache-2.0 que a ModelBest usou para a família MiniCPM5-1B em maio, e os checkpoints anteriores na sequência ainda apresentam praticamente nenhum sinal da comunidade — um pequeno conjunto de downloads e curtidas para cada. Isso é o indicativo de uma liberação de pesos em andamento, e não de um lançamento coordenado: os artefatos aparecem em ordem de dependência (base e SFT primeiro; formatos quantizados e draft por último), sem que haja um único dia servindo como data de lançamento.
O que MiniCPM5-2B-DSpark realmente é
A decodificação especulativa divide a geração em um proponente barato e um verificador caro. Um pequeno modelo de rascunho adivinha os próximos tokens; o modelo grande verifica todos os palpites em uma única passagem direta e aceita aqueles com os quais concorda. Quando o rascunho está bem calibrado, você obtém a saída do modelo grande a uma fração do custo, e quando está errado, você desperdiça apenas uma etapa de verificação. DSpark é uma receita específica para essa ideia, de um artigo publicado em 2026-07-06 (arXiv 2607.05147, "Confidence-Scheduled Speculative Decoding with Semi-Autoregressive Generation"). Duas escolhas de design o distinguem: ele combina uma espinha dorsal paralela de rascunho com um módulo sequencial leve, de modo que os tokens dentro de um bloco proposto dependem uns dos outros, em vez de perderem precisão em direção ao final do bloco, e dimensiona cada execução de verificação por solicitação a partir de estimativas de confiança e do throughput do mecanismo, em vez de sempre verificar um bloco de comprimento fixo.
O rascunho DSpark que a OpenBMB lançou é um Transformer de cinco camadas com 323,8M de parâmetros em BF16 (cerca de 648MB). Ele se baseia na família de arquitetura Qwen3, mas traz adições específicas do DSpark: {{1}}um projetor que lê os estados ocultos do MiniCPM5-2B de cinco das camadas do alvo (1, 10, 20, 30 e 39), uma cabeça de confiança e uma pequena cabeça de Markov que modela a distribuição do próximo token{{/1}}. A configuração dele propõe um bloco de sete tokens por passe direto. Com cerca de um oitavo dos 2,5B de parâmetros do MiniCPM5-2B, {{2}}ele é um dos menores modelos de rascunho já lançados para um checkpoint aberto convencional{{/2}} — {{3}}que é o objetivo em um modelo orientado à borda, onde o rascunho precisa ser barato o bastante para que executar dois modelos em um único dispositivo ainda supere executar apenas um{{/3}}.

O repositório acima é toda a superfície pública do modelo preliminar: um README, uma configuração, um único arquivo safetensors e um cartão do modelo cuja descrição de treinamento mostra 1.959.525 sequências (7,05B tokens) geradas pelo MiniCPM5-2B a partir de prompts gerais, de matemática e de código, com treinamento de seis épocas usando um objetivo combinado de entropia cruzada, L1 e confiança. Não há uso do checkpoint como um modelo generativo por si só.
Os números publicados pela OpenBMB, honestamente rotulados
O cartão do modelo de rascunho relata um número que importa — o comprimento de aceitação, o número médio de tokens propostos que o modelo alvo aceita de cada bloco de sete tokens. A avaliação foi executada nas saídas do MiniCPM5-2B em três domínios, com até 4.096 tokens gerados:
• Matemática — 6.05 tokens aceitos em média greedy (T=0); 4.61 sob amostragem T=1.0.
• Código — 6,11 com busca gulosa; 4,44 com amostragem.
• Geral — 4.16 greedy; 3.10 amostrado.
• Agregado — 5,52 greedy; 4,05 amostrado, de um máximo de sete.
Esses números são fornecidos pelo fornecedor no model card e não foram reproduzidos de forma independente. Eles também descrevem a taxa de acerto do rascunho, não uma aceleração em wall-clock: a velocidade é uma medição de serving que depende do custo da passagem de verificação do alvo em relação à passagem de proposta do rascunho, da ocupação do batch e do fato de o confidence scheduler do DSpark encurtar o comprimento da verificação. A OpenBMB não publicou nenhum número de tokens por segundo para o par. Para ter uma noção de onde fica o teto do método, o artigo do DSpark relata uma geração por usuário 60–85% mais rápida com throughput equivalente em comparação com a linha de base MTP-1 no sistema de serving ao vivo da DeepSeek — um ponto de referência útil para o que o algoritmo já fez em outros contextos, não uma afirmação sobre o MiniCPM5-2B no seu hardware.

The scoreboard above is the release's own spec sheet. Read the acceptance figure as a draft hit-rate; the multiplier on real throughput is what an independent SGLang run still has to measure.
O modelo que o rascunho acelera
O MiniCPM5-2B é um Transformer denso de 2,5 bilhões de parâmetros — 2.516.756.480 no total — com 42 camadas, 16 cabeças de consulta e 2 cabeças KV, um vocabulário de 130.560 tokens e uma janela de contexto de 131.072 tokens, em BF16, com cerca de 5 GB. Arquiteturalmente, é deliberadamente simples: um LlamaForCausalLM padrão, sem kernels customizados e sem fork do código do modelo — exatamente o motivo pelo qual ele pode ser portado para tantos runtimes e alvos de chip. Na suíte de benchmarks interna da própria OpenBMB, a ficha técnica registra uma média de 53,9 nas tarefas de raciocínio, seguimento de instruções, conhecimento, contexto longo, uso de ferramentas, programação e agentes de busca, à frente do Qwen3.5-4B, com 51,1, e do granite-4.2-3B, com 42,7, na mesma tabela; várias células (GPQA-Diamond 70,2, HLE 8,9) e algumas linhas de contexto longo e tarefas de agente estão sinalizadas como provenientes da Artificial Analysis, em vez de terem sido reproduzidas internamente. Os resultados de destaque por tarefa incluem MATH-500 com 94,6, AIME 2025 e 2026 com 86,5, IFEval com 86,7, MMLU-Pro com 70,8 e SWE-bench Verified com 46,4. Esses são os números do fornecedor na suíte do próprio fornecedor, e a ficha técnica é explícita ao afirmar que algumas linhas vêm de fontes de terceiros; leve essa mistura em consideração.

Na apresentação de julho, os materiais de lançamento da ModelBest citaram um Artificial Analysis Index de 17 — o primeiro entre modelos com menos de 4B parâmetros — e a cobertura de julho mencionou uma janela de 512K tokens. Os checkpoints que realmente foram disponibilizados configuram 131.072 tokens de contexto. Quando o número de marketing do dia do lançamento e a configuração realmente disponibilizada divergem, a configuração é o valor que determina o que você pode executar, e vale a pena conhecer essa diferença antes de planejar uma carga de trabalho de contexto longo com base no número de marketing.
Executando o MiniCPM5-2B com seu modelo de rascunho
{{1}}O caminho pretendido é o SGLang, que suporta o algoritmo DSpark upstream desde a v0.5.16 — a versão mínima exigida pelo cartão do modelo. O comando de servidor completo do cartão:{{/1}}
python -m sglang.launch_server --model-path openbmb/MiniCPM5-2B --speculative-algorithm DSPARK --speculative-draft-model-path openbmb/MiniCPM5-2B-DSpark --speculative-dspark-block-size 7
Com decodificação gulosa (T=0), a verificação do DSpark não tem perdas: a saída é idêntica à de servir o MiniCPM5-2B sozinho, o que torna o draft uma jogada puramente de latência. Com a amostragem habilitada, o DSpark do SGLang usa por padrão apenas amostragem do alvo, com amostragem por rejeição opcional. A OpenBMB também documenta o carregamento simples via Transformers (transformers ≥ 5.6) e o serviço do alvo por conta própria via vLLM ≥ 0.21, além de um parser de chamadas de ferramentas minicpm5 para workloads agênticos; o caminho especulativo do DSPARK, especificamente, é do SGLang.
A aritmética de hardware é a verdadeira história para um par de classe de borda: cerca de 5GB para MiniCPM5-2B em BF16, mais aproximadamente 0,65GB para o draft. A combinação draft-mais-alvo cabe confortavelmente em qualquer lugar onde o modelo 2B sozinho já era viável, o que é exatamente a razão para enviar um draft tão pequeno em vez de um segundo modelo maior.
O que não está confirmado
Não há nenhum anúncio que tenhamos encontrado — nenhum blog da OpenBMB ou da ModelBest, nenhuma postagem em redes sociais em inglês ou chinês. A narrativa do "lançamento silencioso" é literal, e a única superfície pública é a coleção do Hugging Face.
• Sem avaliação independente. Os comprimentos de aceitação do rascunho e a média de suíte de 53,9 do MiniCPM5-2B são relatados pelo fornecedor e não foram reproduzidos; as células marcadas com AA provêm de terceiros, porém são valores de snapshot, não execuções com esses pesos exatos.
Não há nenhuma API hospedada que possamos encontrar, então a adoção hoje significa executar os checkpoints você mesmo. Um espelho do ModelScope, prometido na cobertura de julho do lançamento, não estava visível até o momento em que este texto foi escrito.
Não há nenhum número de aceleração wall-clock para o par DSPARK. Um comprimento de aceitação de 5,52 é uma forte taxa de acerto, mas "quantas vezes mais rápido" em uma determinada GPU é exatamente o número que a OpenBMB não publicou.
• A ambiguidade da janela de contexto acima: os materiais de marketing diziam 512K, a configuração distribuída informa 131,072, e nada nos repositórios faz a ponte entre os dois.
Onde um lançamento discreto de modelo open-weight se encaixa numa stack
A leitura honesta do MiniCPM5-2B hoje é que ele é uma aposta: números fortes do fornecedor, zero execuções independentes, nenhum histórico de serving e um modelo rascunho cuja aceleração no mundo real não foi medida. É exatamente para essa situação que existe uma camada de roteamento. Uma equipe que queira testar se a saída de um pequeno modelo aberto pode substituir um modelo hospedado que já utiliza pode rodar essa comparação a partir de uma única API — a OrcaRouter dá acesso a mais de 200 modelos hospedados pelo preço de tabela do provedor, sem markup —, então montar uma semana de avaliação não custa nada, e o failover automático significa que um checkpoint de poucos dias nunca precisa manter um caminho de produção refém enquanto se prova. Nada disso exige que o MiniCPM5-2B esteja hospedado em algum lugar; ele é a rede de segurança em torno dos modelos dos quais você já depende enquanto decide se um 2B auto-hospedado vale a GPU.
Observe, em ordem de importância: uma execução independente do SGLang DSPARK que reporte tokens reais por segundo para o par, já que o comprimento de aceitação é um proxy em vez de um benchmark; um anúncio formal ou um espelho no ModelScope confirmando que o lançamento é definitivo; e um provedor de hospedagem que adote o MiniCPM5-2B — se algum adotar, o preço que você paga do nosso lado é o preço de tabela do próprio provedor, no mesmo dia, porque é isso que significa repasse. Enquanto isso, o modelo de rascunho é o artefato mais interessante dos dois. Um proponente de cinco camadas que o alvo aceita cinco tokens e meio de sete é a diferença entre um pequeno modelo de borda que parece pequeno e um que parece um modelo maior rodando no mesmo dispositivo.
