Um cartão de título gerado com o texto 'Intern-Decision-2B vs MiniCPM5-2B', com o subtítulo 'Dois orçamentos de 2B, com vinte dias de intervalo', com os selos 'um pontuador de decisões' e 'um generalista denso', com o logotipo da OrcaRouter composto no canto.
Guides & Insights

Intern-Decision-2B vs MiniCPM5-2B: Dois checkpoints de 2B, vinte dias de diferença, formas opostas de gastar os parâmetros

Autor

Alistair Wren

Data de publicação

Modelos mais recentes · 20Ver todos os modelos →
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

internlm/Intern-Decision-2B e openbmb/MiniCPM5-2B têm o mesmo tamanho, foram lançados com vinte dias de diferença, licenciados da mesma forma e construídos para nada que se pareça com a mesma tarefa. O checkpoint da InternLM tem 2.213.241.664 parâmetros de um pontuador de decisões: recebe um estado e perguntas tipadas, executa uma única passagem forward e devolve probabilidades calibradas sem gerar um único token, recusando qualquer entrada acima de 8.192 tokens. O da OpenBMB tem 2.516.756.480 parâmetros de um generalista denso: um Llama de 42 camadas derivado da receita do MiniCPM5, que aceita 131.072 tokens de contexto, escreve código, chama ferramentas e faz matemática, com um Artificial Analysis Intelligence Index de 12,5 e 726.518 downloads no mês passado. Custa o mesmo para baixar e compram coisas completamente diferentes.

A parte interessante desse pareamento não é a lacuna de benchmark — quase não há um benchmark em comum para comparar. É em que se pode gastar um orçamento de 2,2 bilhões e outro de 2,5 bilhões de parâmetros, e o que a escolha lhe diz sobre qual dos dois está pronto. O MiniCPM5-2B é o segundo modelo de sua série, vindo depois do MiniCPM5-1B de maio, e chegou com todo um aparato de lançamento. O Intern-Decision-2B é o intermediário de três tamanhos que a InternLM publicou no Hugging Face às 05:36 UTC de 26 de setembro de 2026, sem anúncio, e seu aparato de lançamento — uma base de código de treinamento, um pacote de avaliação verificado por hash, um benchmark de calibração de 96 casos — só se tornou público esta manhã, às 08:58 UTC.

Para onde foram os dois orçamentos

Ambos os modelos são ajustes finos da arquitetura de outra pessoa, e ambos têm cerca de 2,5 bilhões de parâmetros. É aí que a semelhança termina.

A screenshot of the Hugging Face model card for openbmb/MiniCPM5-2B, showing the OpenBMB organisation, the tags Text Generation, Transformers, Safetensors, English, Chinese, llama, minicpm5, long-context, tool-calling, on-device and edge-ai, an Apache 2.0 licence, the MiniCPM Tech Report, MiniCPM Wiki, GitHub Repo, UltraData and Online Demo links, and the model title.

O MiniCPM5-2B é um Transformer denso com 42 camadas, tamanho oculto de 2.048, 16 cabeças de atenção, tamanho intermediário de 6.144, vocabulário de 130.560 tokens e contexto de 131.072 tokens, treinado em uma mistura de corpora abertos que a OpenBMB publicou junto com ele: UltraX para pré-treinamento na web, UltraData-Code com gerenciamento de código em camadas L0–L3, UltraData-Math, e 500.000 amostras de SFT de agentes com mais de 80.000 amostras de RL em UltraData-RL-2609. Seu pós-treinamento executa SFT, depois professores de RL especializados em matemática, código e tarefas agênticas, e então destilação on-policy de volta para um único modelo. É um modelo de propósito geral cujo orçamento total de parâmetros é exposto como capacidade que você pode acionar por prompt.

Intern-Decision-2B é um Qwen3_5ForConditionalGeneration com 24 camadas — um padrão repetitivo de três camadas de atenção linear para uma camada de atenção completa — tamanho oculto de 2.048, 8 cabeças de consulta contra 2 cabeças chave-valor, dimensão de cabeça 256, uma camada retida de predição multi-token e um teto de embedding de 262.144 posições. Ele vem com uma torre de visão de 612,5 MB e um projetor de 50,3 MB. Quase nada desse orçamento está disponível para você como prompt: o modelo responde a um esquema fixo de perguntas, e sua arquitetura é o mecanismo de entrega de um softmax, não um gerador de texto.

Um detalhe do repositório recém-publicado da InternLM vale a pena destacar, porque ele reformula a tag multimodal no cartão do modelo. O ajuste de decisão "faz fine-tuning do backbone de linguagem do Qwen3.5 enquanto congela a torre de visão e o projetor". Tanto os checkpoints de decisão de 2B quanto os de 4B carregam um shard de visão de exatamente 612.517.440 bytes — o mesmo tamanho em ambos — o que é consistente com esses componentes terem sido herdados da base Qwen em vez de treinados. A via de imagem é real e utilizável, mas não é nela que o ajuste de decisão da InternLM concentrou seus esforços. Se sua carga de trabalho for pontuação de decisão apenas de texto, cerca de 660 MB daquele download de 4,46 GB não estão fazendo nada por você.

Placar

A two-column comparison scoreboard titled 'Intern-Decision-2B vs MiniCPM5-2B'. The left column reads: Parameters 2,213,241,664 plus vision tower; Context 8,192 tokens, refused above; Output calibrated probabilities, no text; Modality text plus up to 8 images; Published evidence vendor table, unreproduced; Adoption one like, zero downloads. The right column reads: Parameters 2,516,756,480 dense; Context 131,072 tokens; Output generated text, token by token; Modality text only; Published evidence OpenBMB card, AA Index 12.5; Adoption 726,518 downloads last month. A footer notes the Intern-Decision-2B figures are vendor-reported and unreproduced while the MiniCPM5-2B figures are OpenBMB's own card plus an independent Artificial Analysis index.

• Parâmetros — Intern-Decision-2B com 2.213.241.664 em BF16, mais cerca de 660 MB de torre de visão e projetor, aproximadamente 4,46 GB de repositório; MiniCPM5-2B com 2.516.756.480 em BF16, um único arquivo safetensors de 5,03 GB.

• Contexto — 8.192 tokens para Intern-Decision-2B, rejeitados sem truncamento acima disso; 131.072 tokens para MiniCPM5-2B.

• Saída — uma distribuição calibrada mais um argmax por campo, nenhum texto; texto gerado, token por token.

• Treinamento — ajuste de decisão de um backbone Qwen3.5-2B com a torre de visão congelada, dados de treinamento não divulgados; uma passagem completa de pré-treinamento, treinamento intermediário e SFT de pensamento profundo com 400 bilhões de tokens, seguida de RL e destilação on-policy, com os corpora publicados em conjunto.

• Evidência publicada — uma tabela do fornecedor com sete suítes, com média de 84,68, Brier 0,437 e ECE 0,100, não reproduzida por nenhum terceiro, uma curtida e zero downloads; um cartão OpenBMB com média de 53,9 dentro de seu próprio conjunto de comparação e um Artificial Analysis Intelligence Index independente de 12,5, com 726.518 downloads no último mês.

• Licença — Apache-2.0 com os termos upstream do Qwen preservados como LICENSE-QWEN, e nenhuma licença declarada no repositório de código; Apache-2.0 em toda parte, incluindo o código.

No que cada um é realmente melhor, e não é nem de perto

A comparação é assimétrica ao ponto de ser um erro de categoria, por isso é mais útil nomear os trabalhos.

MiniCPM5-2B vence tudo o que envolve produzir uma resposta em vez de selecionar uma. Escreve código; o Intern-Decision-2B não tem caminho de código. Lida com um contexto de 131.072 tokens; o Intern-Decision-2B para nas 8.192 e falha de forma ruidosa. Chama ferramentas, com uma pontuação de 66,6 no BFCL v4 na própria tabela da OpenBMB, e faz matemática, com MATH-500 em 94,6 e GPQA-Diamond em 70,2 — valores da ficha do fornecedor, com a linha do GPQA a incluir uma nota de rodapé fornecida pela própria ficha. Suporta 70,8 no MMLU-Pro e 84,7 no MMLU-Redux. É executado em llama.cpp e MLX, é disponibilizado em variantes GGUF, GPTQ e DSpark, e tem um Space de demonstração no Hub que é público, ao contrário do 401 para o qual a ficha do Intern-Decision aponta.

Intern-Decision-2B ganha exatamente duas coisas, e elas são a razão pela qual existe. Primeiro, uma decisão de conjunto fechado com um esquema que você escreve devolve uma probabilidade à qual você pode aplicar um limiar, numa única passagem forward, em cerca de 33 milissegundos, sem parser e sem amostragem — um formato que o MiniCPM5-2B não consegue produzir a não ser gerando texto e esperando que o número dentro dele se comporte bem. Segundo, é um artefacto reproduzível: o repositório agora contém o objetivo de treino, as sete suítes de precisão com hashes SHA-256 e contagens de linhas por suíte, o código de pontuação, os scripts de ajuste de temperatura e de replay, e um benchmark de calibração de distribuição de 96 casos com o seu próprio gerador e pontuador offline. O guia de avaliação da InternLM observa que os presets lançados estão vinculados ao backend XTuner e que os resultados do HF devem ser reportados como uma configuração de execução diferente — o que é exatamente o tipo de ressalva que um kit de reprodução existe para tornar verificável.

A screenshot of the GitHub repository page for InternLM/Intern-Decision, showing the organisation and repository breadcrumb, the description 'Fast multi-modal decision model', 5 stars and 0 forks, the file tree with assets, benchmarks, configs, docs, runtime, scripts, src and tests directories plus a release-manifest.json, and a commit list headed by 'Add demonstration videos and centered README links' roughly an hour old.

Quem deve baixar qual

Se você tem uma tarefa que envolve ler algo longo, escrever algo ou responder a uma pergunta cujas opções você não enumerou de antemão, o MiniCPM5-2B é o modelo e não há decisão a tomar. Ele é um generalista de classe 2B finalizado, com um ecossistema real, dados abertos por trás dele e uma listagem de avaliação independente, e não custa nada experimentar — builds GGUF e MLX já estão no Hub.

Se você tem uma tarefa que é genuinamente uma escolha entre respostas conhecidas — encaminhar um ticket, classificar um e-mail de suporte, rotular um candidato, pontuar uma intenção numa escala ordinal — então um modelo generativo é o instrumento errado, e o Intern-Decision-2B é o mais interessante dos dois, mesmo que quase ninguém o tenha executado. Uma probabilidade à qual você pode aplicar um limiar é mais barata de operar, mais fácil de auditar e impossível de alucinar, e o fato de o checkpoint ter chegado com um kit de reprodução em vez de um post de leaderboard torna-o o mais bem documentado dos dois no eixo que importa quando você precisa defender a escolha.

Nenhum dos dois modelos está no OrcaRouter. Nossa página do modelo para o Intern-Decision-2B retorna 404 e não há rota para o MiniCPM5-2B; nada aqui é uma afirmação de disponibilidade, e ambos significam executar sua própria inferência. Onde a alternativa prática existe é nos modelos de decisão hospedados: TypeSafe's Jev 1.13, o modelo com o qual a InternLM comparou toda a sua família, está no catálogo a US$ 0,042 por milhão de tokens de entrada, com contexto de 65K e um tempo até o primeiro token P50 de 178 ms. E se o que você realmente precisa é de um generalista na mesma classe de tamanho do MiniCPM5-2B sem o trabalho operacional, nossa menor rota Qwen hospedada é várias vezes maior, mas é uma única chave entre mais de 200 modelos, a preço de tabela do provedor repassado sem markup e com failover automático por trás disso.

O único número que decide tudo

Não é 84,68 contra 53,9. Essas duas médias vêm de suítes diferentes, medidas por laboratórios diferentes e, em um caso, por um laboratório que nunca teve seus números verificados. O número que decide isso é 8.192. Se o seu estado couber em oito mil tokens e sua resposta já for uma lista, o Intern-Decision-2B é um instrumento preciso com um kit de reprodução e uma anomalia de calibração da qual você deve estar ciente — seu erro de calibração esperado de 0,100 é o pior dos três tamanhos publicados pela InternLM, contra 0,066 para o modelo com metade do seu tamanho, portanto ajuste sua própria temperatura antes de confiar em um valor de confiança. Se o seu estado não couber, a questão termina antes de os benchmarks começarem, e o MiniCPM5-2B é a resposta.

Comparados neste artigo1

Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente