
MiniCPM5-2B-DSpark vs Qwen3-8B: A nova stack on-device de 2,5B contra o cavalo de batalha de pesos abertos
- OrcaNOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens
- orcaNOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens
- deepseekNOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligência76Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Inteligência69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Toda comparação de modelos esconde uma questão de hardware, e MiniCPM5-2B-DSpark versus Qwen3-8B é essa questão vestida de benchmark. O Qwen3-8B é o cavalo de batalha de pesos abertos da Alibaba de abril de 2025 — cerca de 8,2B de parâmetros densos, 119 idiomas, contexto nativo de 32K extensível a 131K, modos de raciocínio híbridos e dezesseis meses de evidência da comunidade por trás dele. O MiniCPM5-2B-DSpark não é um modelo independente para ser colocado ao lado dele: é o checkpoint de rascunho DSpark de 323,8M de parâmetros que a OpenBMB publicou silenciosamente no Hugging Face em 6 de setembro de 2026 para acelerar o MiniCPM5-2B, o modelo denso de 2,52B para dispositivos que a ModelBest anunciou na WAIC em 19 de julho de 2026. Junte os dois e a verdadeira questão aparece: a carga de trabalho que hoje roda em um 8B deveria estar rodando em hardware que só suporta um 2B — e um 2,5B com um rascunho gratuito é bom o suficiente para justificar a migração?
A resposta curta é: ainda não, para a maioria das cargas de trabalho, mas as razões são mais restritas do que a diferença de tamanho sugere, e há uma classe de implantação em que o 8B não tem resposta alguma. Tudo o que é quantitativo neste artigo é relatado pelos fornecedores — os números do MiniCPM são da própria ModelBest, nunca reproduzidos; os do Qwen3-8B são da Alibaba, há muito tempo em uso pela comunidade — portanto, os rótulos importam mais do que os dígitos.
Dois modelos em pontos diferentes da curva de memória
MiniCPM5-2B é um Transformer causal denso com um terço do tamanho de um modelo 8B — 42 camadas, atenção de consulta agrupada, Apache-2.0 — projetado para a classe de dispositivos que um modelo grande não alcança: telefones, cockpits inteligentes e pequenos dispositivos de borda, onde o barramento de memória engasgaria com oito bilhões de pesos. Seus materiais de lançamento enfatizam o trabalho agêntico e o contexto longo em vez de amplitude bruta: contexto nativo de 128K e a afirmação da ModelBest de que, em sua própria suíte de avaliação, o modelo obtém média de 53,9 — SOTA de código aberto da classe 2B, segundo o fornecedor, incluindo uma pontuação de 46,4 obtida pelo fornecedor no SWE-bench Verified, um resultado que seria notável para um modelo 2B se sobreviver a testes independentes. O modelo de rascunho DSpark é a resposta de throughput à objeção óbvia de que um modelo denso pequeno é rápido de carregar, mas lento para gerar, porque cada token arrasta seus pesos pelo barramento de memória. O rascunho propõe até sete tokens de uma vez para o modelo-alvo verificar, e o repositório relata uma taxa de aceitação gulosa de 5,52 tokens por etapa de verificação no agregado — 6,11 em código. Esse número é a qualidade do rascunho; seu ganho de velocidade ainda não foi medido, e nenhum número de tokens por segundo foi publicado.

O cartão openbmb/MiniCPM5-2B-DSpark acima é toda a superfície pública do silencioso lançamento de 6 de setembro: um acessório de serving que reporta o comprimento de aceitação, sem anúncio e sem aceleração de wall-clock.
Qwen3-8B é da mesma família arquitetônica, três vezes maior e dezesseis meses mais antigo. É um Transformer causal denso com atenção de consulta agrupada, treinado em um corpus multilíngue de 36 trilhões de tokens, Apache-2.0, e um dos modelos de 8B mais amplamente auto-hospedados e servidos no mundo de pesos abertos. Sua assinatura é o modo de raciocínio híbrido Qwen3 — pensamento ativado ou desativado por solicitação — e seu perfil é deliberadamente amplo: MMLU na faixa dos 70 altos, fortes resultados em GSM8K e codificação, 119 idiomas. Ele precisa de uma GPU de verdade ou de um dispositivo de borda potente: com quantização prática, roda em poucos gigabytes, confortavelmente em uma placa de gama média, não em um telefone.

Acima, a ficha do modelo da Alibaba para o Qwen3-8B é a cara da atual líder: dezesseis meses de comportamento documentado e testado pela comunidade em 119 idiomas.
Onde a 8B ainda vence
Desça uma categoria de peso e você abre mão de três coisas concretas. Primeiro, idiomas: o Qwen3-8B cobre 119 idiomas; a ficha técnica e os conjuntos de dados do MiniCPM5-2B centram-se no inglês e no chinês, e nenhuma abrangência multilíngue é alegada. Para um produto que atende a uma longa cauda de idiomas, isso é uma barreira rígida, não flexível. Segundo, evidências: o Qwen3-8B vem sendo sondado, quantizado, ajustado e servido em escala há dezesseis meses; seus modos de falha são conhecidos, suas quantizações existem, seu ecossistema está em toda parte. O MiniCPM5-2B é um lançamento de julho de 2026, com um ranking mantido pelo fornecedor e sem nenhuma reprodução independente; o rascunho tem apenas um dia. Terceiro, a pilha de serving: tudo o que já conversa com o Qwen3-8B — vLLM, SGLang, llama.cpp, mil fine-tunes — conversa com um alvo maduro, enquanto o rascunho do MiniCPM exige a construção de um motor de decodificação especulativa (o algoritmo DSPARK do SGLang) que o repositório documenta, mas que o ecossistema mais amplo ainda não absorveu.
Onde a stack 2B é a única opção.
Nada disso importa na classe de dispositivo em que um 8B simplesmente não cabe. Em um telefone ou em uma placa de borda com alguns gigabytes de DRAM, o Qwen3-8B não compete com o MiniCPM5-2B — ele simplesmente não pode ser implantado a uma velocidade útil. Essa é exatamente a razão pela qual a stack de 2B existe, e é por isso que o rascunho é a parte estrutural desta versão, e não um enfeite. A decodificação especulativa é mais eficaz justamente no regime denso e limitado por memória em que um modelo pequeno em silício pequeno vive: um modelo de rascunho compacto propõe um bloco, que o modelo-alvo verifica em uma única passada, e o custo de carregamento de pesos é pago uma vez por bloco em vez de uma vez por token. O método DSpark, de origem DeepSeek (arXiv 2607.05147), foi projetado para sistemas de serving de alta concorrência, mas sua mecânica — e os números de aceitação neste repositório — são a alavanca relevante para um 2B que precisa parecer interativo em hardware limitado. Apenas tenha em mente a ressalva honesta: OpenBMB mediu a aceitação do rascunho, não sua aceleração; portanto, o ganho real de tokens por segundo no seu dispositivo de destino ainda é algo que cabe a você medir.
O placar, honestamente rotulado
• Lançamento — MiniCPM5-2B: 19 de julho de 2026 (anunciado); MiniCPM5-2B-DSpark: 6 de setembro de 2026, silencioso. Qwen3-8B: abril de 2025, anunciado.
• Tamanho — MiniCPM5-2B: 2,52B densos, mais um draft de 324M. Qwen3-8B: ~8,2B densos.
• Contexto — MiniCPM5-2B: 128K de contexto nativo. Qwen3-8B: 32K de contexto nativo, 131K via YaRN.
• Idiomas — MiniCPM5-2B: centrado em inglês/chinês. Qwen3-8B: 119.
• Raciocínio — MiniCPM5-2B: modos híbridos rápido/deliberado conforme os materiais de lançamento. Qwen3-8B: pensamento ativado ou desativado por solicitação.
• Evidência — Os números do MiniCPM são alegações da ficha do ModelBest (média de 53,9 em sua própria suíte; sem execução independente). Os números do Qwen3-8B são relatados pela Alibaba, expostos à comunidade há dezesseis meses.

O placar acima é a incompatibilidade retratada honestamente: as colunas diferem em quase tudo, exceto pela licença aberta Apache-2.0, e a classe de dispositivo para a qual você está distribuindo determina qual coluna você pode sequer escolher.
A realidade do roteamento
Nenhum dos dois modelos está em um catálogo hospedado no OrcaRouter hoje, portanto esta comparação é inteiramente no mundo auto-hospedado — mas é exatamente aí que uma camada de roteamento ainda se justifica. O Qwen3-8B é servido por seu fornecedor e por várias plataformas terceiras; o MiniCPM5-2B e seu rascunho são algo que você executa. Quando uma equipe quer testar se uma pilha de 2.5B pode assumir parte de uma carga de trabalho de 8B, a jogada reversível é apontar um caminho de teste para uma build SGLang auto-hospedada do MiniCPM5-2B-plus-draft por meio de uma única API com failover automático — a produção permanece no sistema atual, a nova pilha pode travar sem derrubar nada, e os preços de tabela dos provedores em toda a comparação são repassados com margem de 0%, então o teste A/B é barato e reversível, em vez de uma aposta. A camada não hospeda nenhum dos dois modelos; ela torna o experimento seguro de executar.
Quem deve se mover e quem deve esperar
Fique com o Qwen3-8B para qualquer tarefa multilíngue, qualquer coisa que exija dezesseis meses de comportamento conhecido, ou qualquer carga de trabalho já atendida em hardware que suporte um 8B confortavelmente — a diferença de tamanho não é motivo para migrar, e a lacuna de evidências argumenta contra isso. Teste a sério a pilha MiniCPM5-2B com seu rascunho DSpark somente se o seu dispositivo alvo não conseguir suportar o 8B de forma alguma, ou se um 2.5B que acompanhe o ritmo em trabalho agêntico e de contexto longo permitisse reduzir memória e consumo de energia no hardware que você já comercializa. E antes de se comprometer com o rascunho, execute a medição que a OpenBMB não publicou: o comprimento de aceitação não é latência, e o ganho de tokens por segundo no seu dispositivo é o número que realmente decide se o pequeno checkpoint discreto no Hugging Face valeu o download.
