
MiniCPM5-2B-DSpark vs Granite 4.2 3B: Dois lançamentos discretos sob Apache-2.0 para servir modelos pequenos, rápidos e auto-hospedados
- OrcaNOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens
- orcaNOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens
- deepseekNOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligência76Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Inteligência69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Agosto e o início de setembro de 2026 produziram dois lançamentos discretos sob Apache-2.0 com o mesmo objetivo — modelos pequenos que você mesmo hospeda — e eles partiram de extremos opostos. O Granite 4.2 3B é o modelo de raciocínio do IBM do tamanho de um laptop, cujos pesos foram publicados no Hugging Face no início de agosto e cuja ficha do modelo e blog técnico saíram em 25 de agosto de 2026. O MiniCPM5-2B-DSpark não é exatamente um modelo no mesmo sentido: é um checkpoint de rascunho DSpark de 323,8 milhões de parâmetros que a OpenBMB publicou em 6 de setembro de 2026 sem nenhum anúncio, criado para fazer o MiniCPM5-2B — o modelo denso on-device de 2,52 bilhões de parâmetros que a ModelBest anunciou na WAIC em 19 de julho de 2026 — gerar tokens mais rápido por meio de decodificação especulativa. Um lançamento é um modelo de raciocínio pequeno e autônomo; o outro é um acessório de aceleração para um modelo pequeno. Ambos estão sob Apache-2.0, ambos são apenas para auto-hospedagem, e nenhum deles foi avaliado por um benchmark independente até agora.
Tirando a camada de marketing, a questão prática que uma equipe enfrenta é direta: para uma pequena carga de trabalho de inferência auto-hospedada no final de 2026, você quer o especialista em raciocínio de 3B da IBM ou a pilha orientada a agentes de 2B da ModelBest com um rascunho gratuito acoplado? As evidências são mais escassas do que a ficha técnica de qualquer um dos fornecedores sugere, então este artigo percorre os fatos do lançamento, o único conjunto de números da mesma suíte que realmente existe e a diferença de carga de trabalho que deve orientar a escolha.
Os dois lançamentos, o que é possível saber
Granite 4.2 3B é o menor modelo de raciocínio da IBM, pós-treinado a partir do Granite-4.1-3B-Base. Ele é denso e somente texto — 40 camadas, atenção por consulta agrupada, um contexto nativo de 128K que se estende a 512K numa quinta fase de pré-treinamento, e três modos de raciocínio: pensamento completo por padrão, um modo de baixo esforço e um caminho sem pensamento. A ficha da IBM é explícita ao afirmar que o 3B deliberadamente pulou o bloco de aprendizado por reforço agêntico que os irmãos maiores do Granite 4.2 receberam, portanto não lista resultados de SWE-Bench e é um modelo de raciocínio, não um modelo agêntico. Ele é servido via vLLM, SGLang, Transformers, GGUF e Ollama (granite4.2:3b), e não tem API hospedada. Os principais números da ficha — 78,33 no AIME 2025, 54,80 GPQA, 69,71 LiveCodeBench v6 — são relatados pelo fornecedor e não reproduzidos até hoje.

O card ibm-granite/granite-4.2-3b acima é a face pública desse lançamento: um modelo 3B ajustado para raciocínio, com uma narrativa de contexto longo e sem alegações de capacidades de agente.
MiniCPM5-2B-DSpark, por outro lado, existe apenas a serviço do seu alvo. O rascunho tem cinco camadas de atenção completa, com 323.776.001 parâmetros e um bloco de sete tokens candidatos por passagem para frente, treinado por seis épocas em 7,05 bilhões de tokens de respostas geradas pelo MiniCPM5-2B. Seu repositório informa o comprimento de aceitação — 5,52 tokens aceitos por etapa de verificação no agregado em decodificação gulosa, 6,11 em código — mas nenhum número de tokens por segundo. O alvo que ele acelera, o MiniCPM5-2B, é o produto mais interessante: um modelo denso de 2,52B, com 42 camadas e contexto de 128K, cujos materiais de lançamento enfatizam capacidade de agente — treinamento intermediário de agente em escala de 200B, um grande conjunto de SFT de agente e alinhamento RL de agente, de acordo com o anúncio de julho da ModelBest — além de contexto longo nativo e modos híbridos rápido/deliberado. No conjunto de comparação da própria ModelBest, o alvo obtém uma média de 53,9 contra modelos abertos da mesma classe. Cada um desses números é do fornecedor.

O card openbmb/MiniCPM5-2B-DSpark acima é toda a superfície de lançamento: model card, config, um arquivo Safetensors e nenhum anúncio.
A única comparação da mesma suíte que existe.
Comparativos entre fornecedores são quase sempre como comparar maçãs com laranjas, mas há um lugar onde Granite 4.2 3B e MiniCPM5-2B foram medidos juntos: a própria tabela de avaliação da ModelBest para o MiniCPM5-2B, que lista granite-4.2-3B entre seus baselines. Nessa suíte, o MiniCPM5-2B tem média de 53,9 contra 42,7 do Granite 4.2 3B. Leia esse número exatamente pelo que ele é — um único fornecedor executando os dois modelos em uma suíte, sem reprodução, e selecionada para fazer o próprio modelo parecer bom. Não é um veredito. O que isso diz é que a ModelBest teve confiança suficiente para colocar o 3B de um concorrente na ficha, e a diferença que ela alega é maior exatamente onde o próprio treinamento dela investiu: nas linhas de contexto longo e capacidades agênticas. Trate isso como uma afirmação direcional, verifique com seus próprios dados e avalie as alegações separadas da própria IBM nas fichas técnicas antes de decidir qualquer coisa com base nisso.
O placar, honestamente rotulado
• O que é lançado — {{1}}MiniCPM5-2B-DSpark: um rascunho de 324M para o MiniCPM5-2B (modelo alvo denso de 2,52B), não autônomo.{{/1}} {{2}}Granite 4.2 3B: um modelo de raciocínio denso, autônomo, de ~3B.{{/2}}
Papel — stack MiniCPM5-2B: ênfase em agente no dispositivo e uso de ferramentas, segundo a ModelBest. Granite 4.2 3B: especialista em raciocínio, deliberadamente não agêntico.
• Contexto — MiniCPM5-2B alvo: 128K nativo. Granite 4.2 3B: 128K nativo, estendendo-se para 512K.
• Aceleração — MiniCPM5-2B-DSpark: draft externo do DSpark, sete tokens por passada, aceitação gulosa de ~5,5 por etapa (relatado no repositório). Granite 4.2 3B: nenhum incluído nesta versão.
• Licença — ambas Apache-2.0.
• Evidências — Os números do MiniCPM são alegações da ficha técnica da ModelBest (sua suíte: 53,9 vs Granite 42,7); os números do Granite são alegações da ficha técnica da IBM (AIME 2025 78,33, GPQA 54,80). Não existe execução independente de nenhum dos dois.

O placar acima tem as mesmas fontes que o texto: cada número nele é informado pelo fornecedor, e o único número da mesma suíte de benchmarks que qualquer fornecedor publicou é o da própria ModelBest.
A diferença que supera todos os benchmarks.
Antes das pontuações, decida qual tipo de modelo pequeno a sua carga de trabalho precisa, porque os dois lançamentos respondem a perguntas diferentes. O Granite 4.2 3B é feito para raciocínio e contexto longo em hardware limitado: uma janela nativa de 128K que se estende até 512K, três modos de pensamento por consulta, um footprint que roda em um laptop e uma decisão explícita de pular o treinamento agêntico. Se o seu trabalho é análise de documentos longos, contexto em escala de repositório ou raciocínio confiável em uma máquina pequena, essa é uma combinação coerente. O MiniCPM5-2B é feito para a ênfase oposta: comportamento agêntico e uso de ferramentas no dispositivo — o draft existir por si só sinaliza que a ModelBest espera que esse alvo seja servido de forma interativa e quer os tokens por segundo de volta. Se o seu trabalho é um loop de agente no dispositivo que chama ferramentas e mantém conversas longas, essa é a stack feita para você.
O modelo de rascunho altera a economia dessa segunda opção de uma forma que o lançamento da Granite não aborda. O MiniCPM5-2B é denso, e a decodificação especulativa compensa exatamente no regime denso e limitado por memória — um pequeno modelo fixo propondo tokens para um modelo fixo ligeiramente maior. Um modelo de rascunho externo que adiciona aproximadamente 650MB de pesos BF16 a um alvo de ~5GB, com um caminho de serviço SGLang documentado e uma taxa de aceitação gulosa em torno de cinco tokens e meio por etapa de verificação, é uma alavanca de throughput crível para um modelo que você serve com concorrência de solicitação única. Mas a ressalva é inevitável: a OpenBMB não publicou nenhuma aceleração de ponta a ponta; portanto, a alavanca não está calibrada. A IBM não inclui nenhum modelo de rascunho externo equivalente para o Granite 4.2 3B como parte deste lançamento — você o executa denso, e sua história de velocidade é simplesmente que o 3B é pequeno.
Quem deve executar o quê
• Rode o Granite 4.2 3B se sua carga de trabalho envolver raciocínio de contexto longo em uma máquina da classe laptop — documentos, repositórios, análise profunda em thread única — e você quiser três modos de pensamento e um teto de 512K em um modelo Apache-2.0 que você controla totalmente. Tenha em mente que não há treinamento agêntico por trás dele nem API hospedada.
Execute a pilha MiniCPM5-2B com seu rascunho DSpark se sua carga de trabalho for um agente interativo no dispositivo que faz chamadas de ferramentas, em que o alvo caiba no seu orçamento de memória e você queira a taxa de transferência que um rascunho pode recuperar. Reserve tempo para medir o ganho real de velocidade do rascunho na sua própria compilação do SGLang, porque nenhum número para isso foi publicado.
• Execute ambos atrás de uma camada de roteamento se estiver genuinamente em dúvida. Nenhum dos modelos está em um catálogo hospedado hoje, inclusive o OrcaRouter — ambos são opções de auto-hospedagem — mas um roteador que se coloca diante dos seus próprios endpoints com failover automático permite que a nova stack em rascunho fique em uma rota de teste enquanto a produção permanece na stack comprovada, e seu repasse com 0% de markup para os modelos hospedados ao redor deles mantém a comparação A/B barata. O ponto é a reversibilidade: troque o nome de um modelo, meça e volte se o checkpoint de um dia travar.
O que assistir em seguida
Duas coisas resolverão este confronto mais rápido do que qualquer opinião. Primeiro, uma execução independente do MiniCPM5-2B que confirme ou refute a média de 53,9 e as alegações sobre capacidades agênticas — uma pontuação tão alta de um modelo de 2B em tarefas no estilo SWE-Bench seria um ponto de dados genuinamente novo para a classe de modelos on-device. Segundo, os números do modelo de raciocínio da própria IBM sobrevivendo à reprodução pela comunidade; os 78,33 do 3B no AIME 2025 são o tipo de alegação que muda quando outra pessoa tenta reproduzi-la. Até que uma dessas coisas se concretize, a posição honesta é: o Granite 4.2 3B é hoje o modelo pequeno mais seguro e mais bem documentado, e o stack do MiniCPM5-2B é a aposta mais interessante — um agente on-device mais rápido se as alegações se sustentarem, com um draft cujo retorno nem mesmo o próprio fornecedor ainda mediu.
