
MiniCPM5-2B vs Granite 4.2 3B: o Especialista em Raciocínio de 3B vs a Nova Stack de Agentes de 2,5B
- OrcaNOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens
- orcaNOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens
- deepseekNOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligência76Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Inteligência69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
ModelBest colocou o Granite 4.2 3B no próprio placar do MiniCPM5-2B antes que alguém pedisse. O model card do MiniCPM5-2B que a OpenBMB publicou quando os pesos entraram discretamente no ar no Hugging Face lista o menor modelo de raciocínio da IBM entre suas linhas de base de comparação e, nesse conjunto, mostra o MiniCPM5-2B com média de 53,9 contra 42,7 do Granite 4.2 3B. Esse é o único número frente a frente que qualquer um dos fornecedores publicou para esse par, o que o torna o ponto de partida natural — e o lugar natural para ter cautela. Ambos os modelos são pequenos, Apache-2.0, lançamentos de pesos abertos auto-hospedados voltados para a mesma função do final de 2026; eles só seguem caminhos opostos, um treinado para raciocinar e o outro para agir.
Os dois lançamentos têm mais em comum do que o marketing de seus fornecedores sugere. O MiniCPM5-2B foi apresentado na World Artificial Intelligence Conference em 19 de julho como o principal modelo on-device da ModelBest e da OpenBMB — um modelo denso de classe 2B proposto como base de agentes para celulares, PCs e cockpits inteligentes — e seus pesos apareceram em 6 e 7 de setembro sem nenhum evento de lançamento, sob licença Apache-2.0, junto com checkpoints GGUF, MLX, GPTQ, base, SFT e draft e os dados de treinamento por trás deles. O Granite 4.2 3B é o modelo de raciocínio do tamanho de um laptop da IBM, cujos pesos chegaram ao Hugging Face no início de agosto e cuja ficha do modelo e blog técnico foram publicados em 25 de agosto. Nenhum dos dois foi ainda avaliado por um benchmark independente, e é por isso que os rótulos de origem abaixo importam mais do que os números.
Dois lançamentos que rimam
O Granite 4.2 3B é um modelo de raciocínio denso e independente, pós-treinado a partir do Granite-4.1-3B-Base. Ele tem 40 camadas com atenção por consulta agrupada, um contexto nativo de 128K que a IBM estende para 512K em uma quinta fase de pré-treinamento, e três modos de pensamento por consulta — pensamento completo por padrão, um modo de baixo esforço e um caminho sem pensamento. Sua ficha técnica é explícita sobre o que ele não é: ao contrário dos irmãos Granite 4.2 de 8B e 30B, o 3B deliberadamente omitiu o bloco especializado de aprendizado por reforço agêntico treinado nos ambientes SWE-agent, terminal e busca, então a IBM não lista nenhum resultado de SWE-bench e apresenta o modelo como um especialista em raciocínio, em vez de um agente. Ele pode ser servido via vLLM, SGLang, Transformers, GGUF e Ollama (granite4.2:3b), roda em aproximadamente 6-8 GB em bfloat16 ou menos de 2 GB quantizado, e não possui API hospedada. Seus números de destaque — AIME 2025 com 78,33, GPQA com 54,80, LiveCodeBench v6 com 69,71, MMLU-Pro com 67,84 — são informados pela IBM e não foram reproduzidos até hoje.

MiniCPM5-2B é, em vez disso, um modelo final orientado a agentes. A ficha técnica descreve um transformer denso com 2,52B de parâmetros totais (1,98B sem embeddings), 42 camadas com tamanho oculto de 2048, atenção de consulta agrupada com 16 cabeças de consulta e duas cabeças de KV, e uma arquitetura padrão LlamaForCausalLM, sem kernels personalizados. O discurso de lançamento enfatizou a capacidade agêntica — treinamento intermediário de agente em escala de 200B, um grande conjunto de agent-SFT e alinhamento do agente por RL, finalizados com On-Policy Distillation, que comprime dezesseis modelos especialistas em RL em uma única rede densa pequena — além de contexto longo nativo e modos de resposta híbridos, rápidos e deliberados. Sua configuração publicada define uma janela de contexto de 131.072 tokens (os materiais de julho alardeavam 512K; a configuração lançada não contém isso), e a ficha afirma chamadas de ferramenta em estilo XML com um parser SGLang integrado. Em sua própria tabela de avaliação, o modelo reporta uma média interna de 53,9 no conjunto de comparação selecionado pelo fornecedor, um AIME 2025/2026 de 86,5, MATH-500 de 94,6 e uma pontuação de 46,4 obtida pelo fornecedor no SWE-bench Verified — algo que seria notável para um modelo denso de 2,5B se sobreviver a testes independentes.

O confronto direto que alguém já imprimiu
Como os rankings entre fornecedores diferentes são, na maioria das vezes, uma comparação de maçãs com laranjas, o artefato mais útil neste confronto é o que a própria ModelBest publicou: a ficha do MiniCPM5-2B lista o granite-4.2-3B entre seus baselines e reporta uma média de 53,9 para o MiniCPM5-2B contra 42,7 do Granite nessa suíte. Leia isso exatamente pelo que é — um fornecedor executando os dois modelos em uma suíte que ele mesmo selecionou, sem reprodução independente, com todos os incentivos para que o próprio modelo vença. Não é um veredito. O que isso de fato lhe diz é que a ModelBest estava confiante o suficiente para colocar um 3B concorrente em sua ficha, e a diferença que ela alega é maior exatamente onde o próprio treinamento investiu: nas linhas de agente e de contexto longo. Trate isso como uma afirmação direcional e pondere as alegações da ficha separada da própria IBM antes de decidir qualquer coisa com base nisso.
O placar, honestamente rotulado
• Lançamento — MiniCPM5-2B: anunciado em 19 de julho de 2026; pesos disponibilizados em 6 e 7 de setembro, sem alarde. Granite 4.2 3B: pesos no início de agosto; ficha do modelo e blog técnico em 25 de agosto de 2026.
• Papel — MiniCPM5-2B: ênfase em agente no dispositivo e uso de ferramentas, de acordo com a ModelBest. Granite 4.2 3B: especialista em raciocínio, deliberadamente não agêntico, segundo a IBM.
• Tamanho — MiniCPM5-2B: 2,52B total / 1,98B não-embedding, 42 camadas. Granite 4.2 3B: ~3B denso, 40 camadas.
Contexto — MiniCPM5-2B: 131.072 tokens na configuração enviada. Granite 4.2 3B: 128K nativo, com extensão para 512K.
• Pós-treinamento — MiniCPM5-2B: SFT de pensamento profundo, RL especializado, Destilação On-Policy. Granite 4.2 3B: SFT de raciocínio, RL GRPO e RLHF; sem bloco de RL agêntico.
• Evidência — MiniCPM5-2B: alegações da ficha da ModelBest, sem execução independente. Granite 4.2 3B: alegações da ficha da IBM, não reproduzidas: AIME 2025 78,33; GPQA 54,80; LiveCodeBench v6 69,71.

O painel acima traz as mesmas fontes do texto corrido: cada número nele é relatado pelo fornecedor, e a única comparação de mesma suíte que qualquer um dos fornecedores publicou é a que está no próprio cartão da ModelBest.
Especialista em raciocínio vs stack de agentes
Antes das pontuações, decida qual tipo de modelo pequeno a sua carga de trabalho exige, porque esses dois respondem a perguntas diferentes. O Granite 4.2 3B é feito para raciocínio e contexto longo em hardware com recursos limitados: uma janela nativa de 128K que se estende até 512K, três modos de pensamento, uma pegada que cabe em um laptop e uma decisão explícita de pular o treinamento agêntico. Se o seu trabalho é análise de documentos longos, contexto em escala de repositório ou raciocínio confiável de múltiplas etapas em uma máquina pequena, isso é um encaixe coerente, e a decisão da IBM de deixar as afirmações de capacidade agêntica de fora do 3B é uma razão para confiar na ficha dele, e não uma lacuna nela. O MiniCPM5-2B foi construído para o objetivo oposto: comportamento agêntico e uso de ferramentas em um dispositivo — o pipeline de treinamento parece uma lista de coisas que o Granite 4.2 3B deixou deliberadamente de fora. Se o seu trabalho é um loop de agente no dispositivo que faz chamadas de ferramentas, mantém conversas longas e alterna entre respostas rápidas e ponderadas, essa é a stack feita para você, e ela carrega a incerteza extra de um checkpoint lançado há uma semana e com uma ficha não verificada.
Os dados que a OpenBMB abriu, a IBM não.
A diferença menos glamourosa é a que mais importa para equipes que querem fazer fine-tuning. A OpenBMB lançou os corpora de treinamento do MiniCPM5-2B junto com os pesos — a família UltraData, incluindo Ultra-FineWeb, UltraX, UltraData-Code, UltraData-Math e os conjuntos de SFT e RL do agente — tudo sob Apache-2.0. Isso transforma o 2B de uma caixa-preta em uma receita reproduzível: você pode ver sobre o que o pós-treinamento agêntico foi construído e continuá-lo no seu próprio domínio. A IBM abriu o código dos pesos do Granite 4.2 3B e forneceu um relato técnico detalhado de como ele foi construído, mas não os dados de treinamento. Para uma organização que quer ser dona do modelo em vez de alugá-lo, essa assimetria é real. E o MiniCPM5-2B vem com uma história de implantação que o Granite não acompanha nesse tamanho: adaptação no dia zero em nove famílias de chips pela comunidade FlagOS da ModelBest, de Huawei Ascend a NVIDIA, passando por uma variedade de aceleradores domésticos, além de ARM — um sinal de que a ModelBest espera que o 2B rode em algum lugar que não seja uma GPU NVIDIA.
A realidade do roteamento
Nenhum dos dois modelos está em um catálogo hospedado hoje, portanto esta comparação vive no mundo auto-hospedado — mas é exatamente aí que uma camada de roteamento ainda se justifica como rede de segurança, e não como mecanismo de entrega. Quando uma equipe quer testar um modelo agêntico de 2B lançado há uma semana contra um modelo de raciocínio de 3B em uma carga de trabalho que já atende, a jogada reversível é apontar um caminho de teste para uma compilação auto-hospedada do MiniCPM5-2B através de uma única API com failover automático, enquanto a produção permanece no modelo comprovado — a nova pilha pode travar sem derrubar nada, e os preços de tabela dos provedores para os modelos hospedados contra os quais você compara são repassados com 0% de margem, então o teste A/B continua barato. A camada não hospeda nenhum dos dois modelos; ela torna o experimento seguro para executar e fácil de reverter.
Qual modelo pequeno você realmente deveria executar?
Rode o Granite 4.2 3B se sua carga de trabalho for raciocínio de contexto longo em uma máquina do porte de um laptop e você quiser três modos de pensamento, um teto de 512K e uma ficha honesta que diga exatamente o que o 3B não foi treinado para fazer. Rode o MiniCPM5-2B se sua carga de trabalho for um agente interativo no dispositivo, com chamada de ferramentas, em que um 2.5B caiba no seu orçamento de memória — mas reserve tempo para reproduzir os números de destaque antes de confiar nele, porque a média de 53,9 e a alegação de 46,4 no SWE-bench são do fornecedor — e de mais ninguém, até agora. Duas coisas decidirão esse confronto mais rápido do que qualquer opinião: uma execução independente do MiniCPM5-2B que confirme ou refute as alegações de agente, e os números de raciocínio da IBM que sobrevivam à reprodução pela comunidade. Até que uma delas se concretize, o Granite 4.2 3B é o modelo pequeno mais seguro e melhor documentado hoje, e o MiniCPM5-2B é a aposta mais interessante.
