
Liquid AI d1-3B vs MiniCPM5-2B: Probabilidades ou Prosa, em Escala de Notebook
- openaiNOVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligência
- anthropicNOVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligência
- typesafeNOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 127 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Inteligência
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Inteligência
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Inteligência
- xAIGrok 4.72026-09-2146Inteligência
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 58 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 350 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
Dois modelos de pesos abertos, ambos pequenos o suficiente para rodar na máquina à sua frente, e eles discordam sobre o que um modelo deve retornar. O Liquid AI d1-3B é o modelo de decisão de 3,12B da Liquid AI, com pesos abertos em 7 de outubro de 2026: ele lê um estado e um conjunto de perguntas nomeadas e retorna um rótulo, uma probabilidade por opção e uma confiança, em uma única passagem direta, sem gerar nada. O MiniCPM5-2B é o modelo denso de 2,52B da ModelBest e da OpenBMB, apresentado na Conferência Mundial de Inteligência Artificial em 19 de julho e publicado discretamente no Hugging Face no início de setembro de 2026 sob a Apache-2.0 — um assistente de raciocínio, codificação e chamada de ferramentas que escreve respostas, chama funções em XML e já tem mais de um milhão de downloads. O menor tem quatro vezes a janela de contexto e uma licença muito mais permissiva; o maior não consegue produzir um token nem se você quiser. Qual desses dois formatos deve entrar no seu pipeline depende inteiramente de se aquilo que está a jusante da chamada quer um número ou uma frase.
A reversão que vale a pena notar primeiro
Quase toda expectativa intuitiva sobre este emparelhamento está invertida, então comece por aí.
O MiniCPM5-2B é o modelo menor e tem o contexto mais longo: 131 tokens contra 32.768 do Liquid AI d1-3B. Ele também tem a licença mais liberal dos dois — Apache-2.0, sem restrições de acesso, com os conjuntos de dados de treinamento disponibilizados junto com os pesos como parte da família UltraData. O Liquid AI d1-3B é distribuído sob a licença lfm1.0 da própria Liquid, que pode ser baixada e submetida a fine-tuning, mas é uma licença de fornecedor e não uma licença permissiva padrão.
O Liquid AI d1-3B é o modelo maior — 3,12B contra 2,52B no total, embora a comparação se inverta novamente em parâmetros não-embedding — e é aquele que não consegue escrever. Ele tem visão; o MiniCPM é somente texto. Ele é pós-treinado para exatamente uma coisa; o MiniCPM é pós-treinado para muitas coisas. E enquanto o MiniCPM5-2B chega com um gráfico comparativo que o coloca no topo de sua classe de tamanho, o Liquid AI d1-3B chega com uma única pontuação de índice e um conjunto de tabelas de latência.
Nada disso faz com que um seja melhor que o outro. Significa que os dois se destinam a tarefas diferentes, e o que os denuncia é o formato da resposta que cada um devolve.
O que volta no cabo
MiniCPM5-2B é um modelo de linguagem generativo. Ele raciocina, responde em prosa e emite chamadas de ferramentas em estilo XML que o parser minicpm5 integrado ao SGLang converte em tool_calls compatíveis com OpenAI sem a necessidade de um adaptador personalizado. Seu pós-treinamento é a parte interessante de sua história: 400 bilhões de tokens de ajuste fino supervisionado com pensamento profundo, depois aprendizado por reforço com um algoritmo baseado em crítico emprestado do JustRL II, então destilação em política que dobra dezesseis professores de RL especializados — cinco deles agênticos — de volta em uma única rede densa. O cartão credita ao RL mais a destilação um ganho médio de 10,96 pontos em tarefas de raciocínio e gerais e 6,96 em tarefas agênticas, e relata uma média de 53,9 em seu próprio conjunto de comparação, acima do maior modelo incluído nesse conjunto. Esses são números da ModelBest, produzidos internamente, sem reprodução independente publicada até o momento.
Liquid AI d1-3B retorna estrutura. Uma nova pergunta retorna como P(sim) entre 0 e 1. Uma escolha pergunta retorna como o rótulo, uma confiança e uma probabilidade por opção. Uma pontuação pergunta retorna como um nível esperado numa escala ordenada de dois a dez com a sua distribuição e legenda. O objeto de uso reporta output_tokens: 0, e há um acessador de probabilidades bruto se você quiser os vetores não tratados. O seu pós-treinamento foi o tipo oposto de trabalho: calcular a média de dois checkpoints juntos, ajustar várias sementes em diferentes misturas de dados, fundi-los, depois gastar o esforço em treinamento de entrada longa, embaralhando a ordem das opções de resposta e removendo atalhos dos dados de treinamento — porque um modelo de decisão que aprende "a opção B geralmente está certa" em vez de ler o estado é pior que inútil.
Um pede a um modelo que pense e então diga algo. O outro pergunta a um modelo o que ele já acredita.

Lado a lado, com a proveniência rotulada
Todos os números abaixo são reportados pelos fornecedores. Os números do MiniCPM5-2B vêm da ficha técnica da própria ModelBest e do seu próprio conjunto de comparação; os do Liquid AI d1-3B vêm de a Liquid ter executado ela própria o scorer oficial do Decision Index, em vez de os submeter ao leaderboard público. Nenhum dos modelos foi avaliado independentemente por terceiros até ao lançamento dos pesos abertos.
• Parâmetros — Liquid AI d1-3B 3,12B no total com um codificador de visão SigLIP2 de 400M e vocabulário de 128.000 tokens; MiniCPM5-2B 2.516.756.480 no total, 1.981.982.720 não-embedding, 42 camadas, 16 cabeças de consulta para 2 cabeças KV, vocabulário 130.560.
• Contexto — 32.768 tokens para o Liquid AI d1-3B; 131.072 para o MiniCPM5-2B.
• Modalidades de entrada — texto e imagens para o Liquid AI d1-3B; apenas texto para o MiniCPM5-2B.
• Saída — probabilidades, rótulos, níveis de confiança e pontuações ordenadas, com zero tokens de saída, para Liquid AI d1-3B; texto gerado, raciocínio e chamadas de ferramentas XML para MiniCPM5-2B.
• Pontuação de destaque — Liquid AI d1-3B 48,57 no Decision Index 0.2.1, primeiro entre modelos com menos de 10B na tabela do fornecedor; MiniCPM5-2B tem uma média de 53,9 em seu próprio conjunto de comparação, que é um conjunto diferente que mede coisas diferentes.
• Velocidade — 8 ms por pergunta em uma RTX 4090, 26 ms em um Jetson AGX Orin 64 GB, 50 ms em um Jetson Orin Nano, e 64 estados empacotados por passagem a 475 por segundo para o Liquid AI d1-3B. A velocidade do MiniCPM5-2B é uma função de quantos tokens ele gera, portanto não há um único número para colocar em oposição a ele.
• Licença — Apache-2.0, sem restrições, dados de treinamento divulgados, para o MiniCPM5-2B; lfm1.0 da Liquid para o Liquid AI d1-3B.
• Evidência — mais de um milhão de downloads no Hugging Face e um mês de quantização pela comunidade para o MiniCPM5-2B; dois dias de existência e nenhuma execução por terceiros para o Liquid AI d1-3B.
O trabalho no qual cada um é realmente bom
Existe um fluxo de trabalho que ambos os modelos conseguem executar, e a diferença na forma como o fazem é todo o argumento.
Suponha que você esteja fazendo a triagem de tickets de suporte, ou decidindo se uma passagem recuperada responde a uma pergunta, ou avaliando uma saída de LLM em relação a uma rubrica. O MiniCPM5-2B pode fazer todas as três — é um pequeno raciocinador capaz, com chamada de ferramentas e um contexto longo, e você o executaria como qualquer outro assistente, pedindo um rótulo e então fazendo o parsing do que quer que retorne. Às vezes, ele retorna JSON limpo. Às vezes, retorna JSON com uma explicação em volta. Às vezes, retorna a resposta certa no formato errado, e esse erro é um bug no seu parser, não no modelo.
O Liquid AI d1-3B não consegue fazer mais nada, o que é exatamente o ponto. Nas mesmas três tarefas, ele retorna uma probabilidade e um rótulo e nada para interpretar, três perguntas sobre um estado custam 1,3x o tempo de uma, e o modo de falha muda de "o formato quebrou" para "a confiança estava mal calibrada" — o que é pelo menos mensurável, porque a confiança está ali mesmo na resposta.
Onde o MiniCPM5-2B ganha de forma incontestável é em tudo o que vem depois da decisão. Ele comporta 131 mil tokens, então o estado pode ser a árvore de arquivos de um repositório inteiro ou um documento longo, em vez da primeira página de um. Ele escreve chamadas de ferramentas nativamente. É um modelo sobre o qual você pode construir um pequeno agente, e foi pós-treinado explicitamente para trabalho agêntico. E sua licença Apache-2.0 significa que a costumeira conversa com advogado comercial não acontece.
Onde o Liquid AI d1-3B ganha de forma inequívoca é no piso de latência e na modalidade. Um dispositivo executando uma decisão em 50 ms sem GPU não é um dispositivo executando o MiniCPM5-2B; os dois vivem em faixas de hardware diferentes, apesar das contagens de parâmetros semelhantes. E o 3B enxerga — o fornecedor relata 74,1 em onze benchmarks públicos de imagens lidos como decisões, contra 73,9 do modelo de visão-linguagem a partir do qual foi construído, e relata que remover as imagens faz as mesmas perguntas caírem para 45,1, que é a maneira deles de mostrar que as respostas vêm dos pixels. A inspeção visual de uma linha de produção não é uma tarefa que se possa sequer confiar ao 2B apenas de texto.

Executando-os, e a camada ao redor deles
Ambos são histórias de auto-hospedagem, e ambos já tiveram o trabalho de implantação feito. O Liquid AI d1-3B vem com suporte ao llama.cpp desde o primeiro dia, a pilha completa da NVIDIA, do DGX ao Jetson, quantização NVFP4, uma build de 8 bits de pesos e ativações, e conversões GGUF já publicadas. O MiniCPM5-2B é uma arquitetura LlamaForCausalLM simples, sem necessidade de kernels personalizados, um shard de safetensors BF16, builds GGUF e MLX na família mais ampla, e uma preferência documentada pelo SGLang quando você precisa do parser de chamadas de ferramentas. Nenhum dos dois está no nosso catálogo, e este artigo não é uma afirmação de disponibilidade para nenhum deles.
As alternativas hospedadas são a API própria do fornecedor e plataformas de terceiros. A Liquid oferece o d1 hospedado com preço apenas por tokens de entrada a $0,04 por milhão, com imagens cobradas como entrada a 1,5 tokens por patch de 32×32 pixels e sem nenhuma linha de saída; o MiniCPM5-2B não tem API própria, o que é normal para um lançamento de pesos abertos sob Apache-2.0.
O que ambos alimentam é o mesmo problema de arquitetura. Um 2B ou 3B local que lida com classificação, roteamento ou verificações de guardrail fica na frente das chamadas generativas que você não hospeda, e essa mistura — inferência própria ao lado de inferência alugada — é o que uma camada de roteamento existe para absorver. Um endpoint para mais de 200 modelos, preços de tabela do provedor repassados com 0% de markup para que uma mudança de preço de fornecedor entre em vigor no mesmo dia, failover automático quando um upstream se degrada. Ser dono do modelo pequeno torna a questão de roteamento mais difícil, não mais fácil, porque agora a fronteira entre o seu hardware e o de outra pessoa é uma decisão que você precisa tomar a cada requisição.
Escolha por tipo de resposta
Se o que você precisa é de um rótulo, uma probabilidade ou uma avaliação, e o conjunto de opções é conhecido de antemão, o Liquid AI d1-3B é o instrumento mais honesto — ele foi criado para essa solicitação e a resposta não chegará malformada. Aceite a licença do fornecedor, o contexto de 32K e a trilha de evidências de dois dias como o preço.
Se o que você precisa é de um modelo pequeno capaz de raciocinar, chamar ferramentas, manter um documento longo e responder em palavras, o MiniCPM5-2B é a máquina mais capaz, por uma grande margem, e vem com Apache-2.0 e o respaldo de testes de outras pessoas equivalente a um milhão de downloads.
As equipes que mais vão aproveitar qualquer um dos lançamentos são as que usam os dois: um modelo de decisão na frente, em que a resposta é um número e cada milissegundo conta, e um pequeno modelo generativo por trás dele, para as partes do trabalho que precisam de linguagem. Eles não são concorrentes. São um filtro e um alto-falante.

