
Pesos do MiniCPM5-2B Estão No Ar: O Pequeno Modelo Que Conquistou a Coroa Sub-4B Agora é Open-Source
- openaiNOVOOpenAI: GPT-6 Astra2026-09-0455Inteligência77Código
- googleNOVOGoogle: Gemini 3.8 Flash2026-09-0247Inteligência76Código
- qwenNOVOQwen: Qwen3.8 Max (0902)2026-09-0247Inteligência72Código
- anthropicNOVOAnthropic: Claude Fable 5.12026-09-0157Inteligência82Código
- AlibabaNOVOQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiNOVOZ.ai: GLM 5.3 Flash2026-08-2646Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1849Inteligência75Código
- obsidianQwen3.8 27B2026-08-1541Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1242Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1251Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0547Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0347Inteligência72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3141Inteligência69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2454Inteligência78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2140Inteligência69Código
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2128Inteligência49Código
O modelo em si tem sete semanas. O MiniCPM5-2B foi apresentado na Conferência Mundial de Inteligência Artificial de 2026, em 19 de julho, onde a ModelBest e a OpenBMB afirmaram que ele era o modelo mais bem classificado com menos de 4B de parâmetros no ranking da Artificial Analysis e prometeram que os pesos seriam disponibilizados "em um futuro próximo". O que aconteceu neste fim de semana foi que o tal futuro próximo chegou sem qualquer alarde de lançamento: o repositório do MiniCPM5-2B entrou no ar no Hugging Face em 6 de setembro, e o changelog da OpenBMB registra o lançamento em 7 de setembro, sob licença Apache-2.0, com o pacote completo — pesos BF16, quantizações GGUF, MLX e GPTQ, checkpoints base e SFT, um modelo de rascunho DSpark para decodificação especulativa e os conjuntos de dados de treinamento que estão por trás deles.
Nenhum comunicado de imprensa o acompanhou e nenhum evento de lançamento. Ele simplesmente apareceu: um repositório na Hugging Face em um dia, uma linha no changelog no outro. Isso faz deste um texto do tipo "o que sabemos até agora" — com uma atualização inicial. O repositório nos diz muita coisa: o modelo é de fato baixável e executável hoje, e a ficha técnica é pública. E uma pontuação externa já chegou: a Artificial Analysis lista o MiniCPM5-2B em seu Intelligence Index v4.2 com 15, o melhor resultado de pesos abertos com menos de 4B de parâmetros totais nesse índice. Assim, o ranking sub-4B não depende mais apenas da palavra do fornecedor. O que ainda não foi confirmado são os números de destaque da ficha do modelo, que a OpenBMB reproduziu em sua própria estrutura de testes e que ninguém fora do laboratório reexecutou. Aqui está o que é possível saber a partir do repositório, o que agora é medido de forma independente e o que ainda precisa de verificação antes de você construir algo com base nisso.
O que acabou de acontecer?
MiniCPM5-2B é o segundo modelo da série MiniCPM5, depois do MiniCPM5-1B, cujo código aberto a OpenBMB lançou em 19 de maio. Quando o 2B chegou ao mercado como produto na WAIC, a história era tanto de chips quanto de modelos — a ModelBest o apresentou como uma base de agentes on-device para celulares, PCs e cockpits inteligentes, e citou nove chips com suporte no lançamento por meio de sua comunidade FlagOS, da Huawei Ascend à NVIDIA, passando por uma variedade de aceleradores domésticos. A abertura do código-fonte foi tratada como iminente. Sete semanas se passaram.
Em 6 de setembro, surgiu o repositório openbmb/MiniCPM5-2B. No momento em que este texto foi escrito, a ficha do modelo é o anúncio de lançamento, e está incomumente completa para um lançamento discreto:
Pesos — o checkpoint final pós-treinado com RL + OPD em BF16, licenciado sob Apache-2.0 e sem restrição de acesso — qualquer pessoa pode baixá-lo.
• Checkpoints complementares — MiniCPM5-2B-SFT, -Midtrain e -Base para quem quer o modelo antes de RL/OPD, além de -GGUF, -MLX, -GPTQ e um modelo draft -DSpark, todos listados na coleção MiniCPM5 no Hugging Face.
• Dados — os corpora de treinamento também são abertos, lançados como parte da família UltraData: Ultra-FineWeb, UltraX, UltraData-Code, UltraData-Math, UltraData-SFT-Agent-2609 e UltraData-RL-2609.
• Espelhos — o README aponta tanto para Hugging Face quanto para ModelScope.
Uma linha no card importa mais do que parece: "sem kernels personalizados, sem fork do código do modelo." O MiniCPM5-2B usa a arquitetura padrão LlamaForCausalLM, então qualquer mecanismo que já sirva modelos da família Llama pode carregá-lo sem esperar por uma implementação sob medida.
Por que um modelo de 2.5B merece uma segunda olhada
A apresentação do WAIC era uma apresentação de rankings. A ModelBest disse que o MiniCPM5-2B obteve um Índice de Inteligência de Análise Artificial de 17, colocando-o em primeiro lugar entre modelos com menos de 4B de parâmetros no leaderboard da AA no lançamento. Duas ressalvas devem acompanhar esse número. Primeiro, as pontuações do índice só são comparáveis dentro de uma versão da metodologia: o 17,9 anterior do MiniCPM5-1B veio de um snapshot antigo da AA, portanto não é evidência de que o modelo menor "pontua mais alto" e, pela mesma regra, uma pontuação mais nova em uma metodologia mais nova não é uma regressão. Segundo, os números da AA alimentam o model card, mas a média de destaque do card é da própria OpenBMB, reproduzida no próprio harness da OpenBMB. Essa distinção importa porque a AA, desde então, mudou para uma metodologia mais nova e publicou uma nova pontuação — a primeira verificação externa da apresentação desde o lançamento dos pesos abertos.
Um número externo chegou na mesma semana em que os pesos. Em 4 de setembro, a Artificial Intelligence enviou o Intelligence Index v4.2, uma revisão metodológica que eleva o peso em testes privados e hold-out para 40% e adiciona dois novos componentes — AA-Briefcase, uma avaliação agêntica, e o GDP.pdf da Surge, uma tarefa de raciocínio documental de contexto longo. A entrada do índice da AA para o MiniCPM5-2B agora carrega uma pontuação v4.2 de 15: o melhor resultado entre modelos de pesos abertos com menos de 4B de parâmetros totais, e o primeiro dos 47 modelos abertos nessa classe de tamanho na listagem da AA. Isso mantém o modelo onde a proposta de julho o colocou, desta vez em uma metodologia mais difícil de enganar e com pesos que qualquer pessoa pode baixar e verificar novamente. O 15 não é comparável ao 17 da era de lançamento, que veio do v4.1 — a metodologia é mais estrita, não o modelo mais fraco — e o composto não reverifica as linhas individuais da ficha, a maioria das quais a OpenBMB reproduziu em seu próprio harness. O que ele faz é aterrissar nos dois eixos para os quais a OpenBMB diz ter otimizado: o v4.2 pesa mais em tarefas agênticas, e o rastreamento de verbosidade da AA mostra o MiniCPM5-2B gerando 57M de tokens de saída nas tarefas do índice, o modelo mais conciso em sua classe contra uma mediana de 72M. A OpenBMB agradeceu à AA pela execução e a enquadrou exatamente nesses termos — desempenho agêntico e eficiência de tokens em 2,6B, disse, são o que o modelo foi otimizado para.
A afirmação substantiva era capacidade agêntica em um pacote pequeno: chamada nativa de ferramentas, pesquisa profunda e geração de código, treinados desde o zero em vez de simplesmente acoplados. O card descreve um pipeline de três estágios — treinamento base, treinamento intermediário e, depois, pós-treinamento com SFT em 400B tokens de dados de pensamento profundo, professores de RL especializados e Destilação On-Policy (OPD), que mescla dezesseis modelos especialistas de RL, cinco deles agênticos, de volta em uma pequena rede densa. A OpenBMB atribui ao estágio de RL + OPD um ganho médio de 10,96 pontos em tarefas de raciocínio e gerais, e de 6,96 pontos em tarefas agênticas — deltas internos, mas que explicam a forma incomum deste modelo: uma rede de 2,5B de parâmetros construída como um modelo de raciocínio e voltada para o uso de ferramentas.

O que o repo realmente contém
A ficha técnica é inequívoca, porque é o arquivo de configuração. O MiniCPM5-2B tem 2.516.756.480 parâmetros, dos quais 1.981.982.720 não são de embedding — os fornecedores usam o valor de não-embedding quando dizem "classe 2B". É um transformer denso com 42 camadas de tamanho oculto 2048, atenção de consulta agrupada com 16 cabeças de consulta e apenas 2 cabeças KV, um vocabulário de 130.560 e tensores BF16. Tudo isso vem como um único shard safetensors, pequeno o suficiente para ser baixado em uma conexão de laptop e executado em uma única GPU de médio porte ou em uma NPU de classe smartphone.
• Parâmetros — 2.516.756.480 no total; 1.981.982.720 não-embedding.
• Arquitetura — LlamaForCausalLM denso, 42 camadas, dimensão oculta 2048, GQA 16 cabeças de query / 2 cabeças KV, vocabulário 130.560.
• Contexto — 131.072 tokens configurados (max_position_embeddings), sem escalonamento RoPE na configuração.
• Licença — Apache-2.0, tanto para o modelo quanto para os dados de treinamento divulgados.
• Formato — BF16; versões GGUF, MLX e GPTQ publicadas separadamente.

Um número da apresentação de julho não aparece no checkpoint. Os materiais da WAIC prometiam uma janela de contexto de 512K tokens; a configuração lançada define max_position_embeddings como 131,072 (128K), sem entrada rope_scaling. É possível que o valor 512K seja alcançado por extensão em tempo de inferência, da mesma forma que vários modelos pequenos ampliam seu contexto — mas, conforme distribuído, o repositório documenta 131,072, e é esse o número para o qual se deve projetar até que a OpenBMB publique uma receita de extensão.
Os números, ordenados por quem os mediu
O model card é cuidadoso quanto à proveniência, e vale a pena ler as notas de rodapé. As pontuações que ele marca com uma adaga "vêm do lançamento oficial da Artificial Analysis" — linhas como GPQA-Diamond 70,2, HLE 8,9, AA-LCR 59,0, Terminal-Bench v2.1 8,6 e GDPval-AA v2 19,6. Todo o resto é descrito como "reproduzido internamente", o que significa que a OpenBMB executou essas avaliações em seu próprio harness. Essa categoria inclui os números que chamam a atenção: uma média interna de 53,9 no conjunto de comparação do card, AIME 2025/2026 com 86,5, MATH-500 com 94,6, LiveCodeBench v6 com 69,1, SWE-bench Verified com 46,4, BFCL v4 com 66,6, τ²-Bench Telecom com 97,1, GAIA (Text-103) com 88,7 e MMLU-Pro com 70,8.
Três fatores garantem que esses números sejam lidos com honestidade. A média de 53,9 é relativa, não absoluta: a ficha técnica normaliza cada eixo do gráfico de radar de modo que o melhor modelo da comparação pontue 100. O conjunto comparado é escolhido pelo fornecedor: outros modelos abertos de 2B a 4B, incluindo Qwen3.5-2B, Qwen3.5-4B, Gemma-4-E2B-it, granite-4.2-3B, LFM2.5-2.6B e LFM2.5-8B-A1B. Nesse conjunto, a ficha mostra o MiniCPM5-2B superando o segundo colocado, o Qwen3.5-4B, que marca 51,1 — um resultado genuinamente impressionante para um modelo com metade do tamanho, e exatamente o tipo de resultado que exige reprodução independente antes que alguém construa sobre ele. Algumas linhas individuais também são difíceis de conciliar com o marketing: um SWE-bench Verified de 46,4 em um modelo denso de 2,5B seria notável se for reproduzido, enquanto um HLE de 8,9 é um lembrete de que “líder sub-4B” e “fronteira” são ligas diferentes. Nada disso é contradito pelo repositório, e o índice composto v4.2 da AA desde então confirmou a colocação geral do modelo no topo da classe de pesos abertos sub-4B — mas essas linhas específicas são do próprio OpenBMB, ainda não verificadas por ninguém de fora do laboratório.
Executando MiniCPM5-2B hoje
Como a arquitetura é Llama puro, os mecanismos convencionais a carregam diretamente. O README da OpenBMB fornece guias de início rápido para vLLM (0.21 ou mais recente), SGLang (0.5.16 ou mais recente) e Transformers (5.6 ou mais recente), com amostragem recomendada em temperatura 1.0 e top-p 0.95, e enable_thinking ativado quando você quiser a passagem de raciocínio. Os complementos GGUF e MLX cobrem llama.cpp, Ollama, LM Studio e Apple Silicon; o card também lista o runtime ArcLight e as pilhas usuais de fine-tuning (TRL + PEFT, LLaMA-Factory, ms-swift, unsloth).
Dois detalhes de implantação valem a pena conhecer antes de começar. Para chamadas de ferramentas e funções, o SGLang é o backend recomendado: o modelo emite chamadas de ferramentas em estilo XML, e o parser minicpm5 embutido do SGLang as converte nativamente em tool_calls compatíveis com OpenAI, o que significa que clientes padrão de chamada de ferramentas funcionam sem um shim personalizado. E o modelo de rascunho DSpark existe para tornar a passagem de raciocínio mais barata: iniciado no SGLang com o algoritmo de decodificação especulativa DSPARK, ele acelera a decodificação sem alterar as saídas do modelo alvo — o tipo de coisa que decide se um loop de agente com contexto de 128K em um laptop é utilizável ou meramente possível.

Se você preferir avaliar um lote de modelos abertos pequenos em vez de ajustar um manualmente, a camada de roteamento mostra o seu valor aqui: quando um provedor lista o MiniCPM5-2B, um roteador é a forma barata de testá-lo em A/B contra o Qwen3.5-2B e os outros checkpoints abertos com menos de 4B de parâmetros na mesma tarefa, sem exigir uma segunda integração. No OrcaRouter, isso significa uma única API cobrindo mais de 200 modelos, preços de tabela dos provedores repassados com markup de 0% e failover automático caso um checkpoint recém-lançado trave ou entre em loop em um caminho de produção. O repositório mal tem dois dias, e nenhuma API hospedada que possamos indicar ainda lista o MiniCPM5-2B — portanto, o padrão honesto hoje é tratá-lo como um experimento de auto-hospedagem, e não como uma dependência.
Quem deve puxar esses pesos?
Baixe-os hoje se o seu trabalho envolve agentes no dispositivo (on-device), tool-calling na borda (edge) ou experimentos de codificação e raciocínio com modelos pequenos, e se você quer a opção da classe 2B mais agressivamente treinada disponível. A licença Apache-2.0 e os dados de treinamento abertos eliminam os dois motivos pelos quais a maioria das equipes hesita em relação a um modelo pequeno de laboratório chinês — sem restrição de uso comercial e sem corpus de caixa-preta. Baixe-os com cautela se você está escolhendo um modelo de produção com base apenas na tabela de benchmarks: as linhas principais da ficha técnica são reproduções do próprio OpenBMB, e o composto v4.2 da AA — a única medição externa até agora — não os respalda. Um modelo de 2,5B que, segundo relatos, supera o Qwen3.5-4B é uma afirmação que merece as duas horas que leva para reproduzir o SWE-bench você mesmo.
O que observar a seguir. O repositório tem apenas dois dias, então os sinais de curto prazo ainda são mecânicos: se o llama.cpp e a biblioteca Ollama adotam o GGUF, se o espelho do ModelScope e as compilações para o chip FlagOS entram no ar sem problemas e se uma API hospedada lista o MiniCPM5-2B — esse é o momento em que ele deixa de ser apenas auto-hospedado. O sinal substantivo que este texto apontou como ausente — uma execução independente pela Artificial Analysis ou por um laboratório universitário — chegou agora na forma da pontuação do índice v4.2, que mantém o MiniCPM5-2B em primeiro lugar entre os modelos de pesos abertos abaixo de 4B. O que ainda está em aberto é a verificação em nível de linha: ninguém fora da OpenBMB reproduziu os números internos da ficha técnica, principalmente o SWE-bench Verified em 46,4 e a média interna de 53,9. Até que essas linhas específicas sejam reexecutadas, trate o MiniCPM5-2B como trataria qualquer modelo lançado sem alarde com uma ficha técnica impressionante: como uma hipótese muito promissora que você pode executar localmente hoje à noite e um modelo cujos números mais marcantes você deve verificar antes de confiar a ele trabalho de verdade.
