
MiniCPM5-2B-DSpark vs LFM2.5-2.6B-Base: Um é um ingrediente para servir, o outro é um ingrediente para treinar
- OrcaNOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens
- orcaNOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens
- deepseekNOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligência76Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Inteligência69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Dois dos lançamentos de modelos pequenos mais interessantes do fim do verão de 2026 têm isto em comum: nenhum deles funciona de imediato, e ambos os fornecedores o afirmam logo nas primeiras frases de suas fichas técnicas. MiniCPM5-2B-DSpark é o checkpoint de rascunho DSpark que a OpenBMB publicou discretamente no Hugging Face em 6 de setembro de 2026 — um companheiro de 323,8 milhões de parâmetros para o MiniCPM5-2B, o modelo denso de 2,52B para dispositivos que a ModelBest anunciou na WAIC em 19 de julho de 2026 — e ele não faz nada até você carregá-lo ao lado desse modelo alvo em um mecanismo de decodificação especulativa. LFM2.5-2.6B-Base é o checkpoint pré-treinado de texto da Liquid AI, disponível no Hugging Face desde 1º de agosto de 2026, que a própria ficha da Liquid descreve como "o checkpoint pré-treinado somente de texto", recomendado apenas para tarefas que exigem fine-tuning intenso. Um é um ingrediente para servir um modelo pronto mais rápido; o outro é um ingrediente para treinar seu próprio modelo em primeiro lugar. Eles ficam em prateleiras diferentes, e o erro de quem está construindo seria pegar a errada.
O que os torna dignos de comparação é que eles visam o mesmo hardware e a mesma ambição para 2026 — IA capaz em celulares, laptops e dispositivos de borda — a partir de extremos opostos do processo de construção. Se você quer um modelo on-device implantável além de um aumento de velocidade gratuito, o pacote da OpenBMB entrega tudo aberto. Se você quer assumir o pós-treinamento você mesmo, a Liquid entrega o substrato e o trabalho. Este artigo é sobre qual camada você está realmente comprando.
Dois cartões que dizem "não para uso direto" em dialetos diferentes
Leia os dois cartões de modelo lado a lado e o indício está na linguagem de pareamento. O cartão do MiniCPM5-2B-DSpark é escrito inteiramente em termos de outro modelo: um alvo, um tokenizador que ele compartilha, camadas de draft, comprimentos de aceitação, um comando de lançamento do SGLang que recebe um caminho de alvo e um caminho de draft. O draft não tem identidade própria — cinco camadas de atenção plena, 323.776.001 parâmetros, um tamanho de bloco de sete, treinado por seis épocas em 7,05 bilhões de tokens de respostas geradas pelo MiniCPM5-2B, e lançado sob a Apache-2.0 com as cabeças de confiança e de Markov do método DSpark (arXiv 2607.05147) habilitadas. Seu propósito é vazão: propor até sete tokens, fazer o alvo de 2,52B verificar o bloco em uma única passagem e manter o que for aceito.

O cartão openbmb/MiniCPM5-2B-DSpark acima é a superfície pública completa do lançamento — um acessório de serviço sem anúncio anexado, relatando comprimento de aceitação, mas nenhuma aceleração de ponta a ponta.
A ficha técnica do LFM2.5-2.6B-Base está escrita para um modelo que ainda não existe: o seu. O híbrido de 2.69B empilha oito camadas de atenção de consulta agrupada sobre vinte e dois blocos de convolução curta de dupla porta — a arquitetura da Liquid para implantação em dispositivo — e foi treinado em cerca de 34 trilhões de tokens, em 16 idiomas, com contexto de 128K. Ele é um modelo apenas de texto, não tem ajuste por instruções e não publica nenhum benchmark próprio, porque um modelo-base pré-treinado não é pontuado; os produtos ajustados que dele surgem é que são. A função dele é passar por pré-treinamento contínuo ou SFT com os seus dados; depois disso, qualquer coisa que você lançar herda os termos da licença dele.

O card LiquidAI/LFM2.5-2.6B-Base acima mostra a tabela da família — base versus o modelo agêntico LFM2.5-2.6B pós-treinado — e a nota "checkpoint pré-treinado somente de texto" que define a base como matéria-prima.
Os repositórios, dimensão por dimensão.
• Papel — MiniCPM5-2B-DSpark: acelera um alvo existente e finalizado. LFM2.5-2.6B-Base: o substrato que você pós-treina até se tornar um modelo finalizado.
• Parâmetros — MiniCPM5-2B-DSpark: rascunho de 324M para um alvo denso de 2.52B. LFM2.5-2.6B-Base: híbrido de 2.69B (atenção + blocos de convolução curta).
• Contexto — MiniCPM5-2B: alvo 128K nativo. LFM2.5-2.6B-Base: 128K nativo.
• O que você deve adicionar — MiniCPM5-2B-DSpark: um mecanismo de serving (SGLang DSPARK) e o modelo-alvo. LFM2.5-2.6B-Base: uma execução de fine-tuning, uma suíte de avaliação e uma stack de inferência.
• Benchmarks — MiniCPM5-2B-DSpark: apenas comprimento de aceitação do repositório (agregado guloso 5,52 por passo), sem figura de aceleração. LFM2.5-2.6B-Base: nenhum publicado para a própria base.
• Licença — MiniCPM5-2B-DSpark: Apache-2.0, sem restrições. LFM2.5-2.6B-Base: LFM Open License v1.0 — uso comercial gratuito até US$ 10 milhões de receita anual, e o teto é repassado a qualquer modelo em que você fizer fine-tuning.

O placar acima é a prateleira de ingredientes desenhada como um cartão: uma coluna é um complemento de serviço para um modelo finalizado, a outra um substrato de treinamento para um modelo que não existe até você construí-lo.
A diferença de $10 milhões.
Para um desenvolvedor, a lacuna de licenciamento é a linha menos glamorosa e mais decisiva dessa lista. ModelBest e OpenBMB disponibilizam o MiniCPM5-2B e seu modelo de rascunho sob a Apache-2.0: você pode servir o modelo-alvo, executar o rascunho e construir um produto comercial em cima disso, sem teto de receita e sem obrigação herdada além da atribuição. A LFM Open License v1.0 da Liquid permite uso comercial, mas o limita — gratuito abaixo de US$ 10 milhões em receita anual, e o limite se propaga ao seu trabalho derivado, de modo que um produto que você ajuste a partir do LFM2.5-2.6B-Base carrega o mesmo teto. Isso não torna a licença da Liquid irracional; torna-a um termo que uma startup que espera escalar além do limite precisa planejar desde o primeiro dia. Se a ambição de receita do seu projeto for pequena ou você estiver avaliando pesquisa, o limite não é um problema. Se você está construindo algo que pretende expandir, a Apache-2.0 é um tipo diferente de matéria-prima.
A bifurcação entre construir e comprar para desenvolvedores
Enquadre isso como uma decisão de construir versus comprar em relação ao próprio modelo, e a escolha deixa de ser confusa. MiniCPM5-2B-DSpark é o caminho de "comprar": o trabalho difícil — pós-treinamento de um modelo on-device para tarefas agênticas e de contexto longo — já está feito no MiniCPM5-2B, e o draft é uma camada de aceleração sem licença adicional sobre o modelo. Você está comprando um modelo pronto e um ganho de velocidade, ambos sob Apache-2.0, e o restante do seu trabalho é servir e avaliar. A questão em aberto é quantitativa: a OpenBMB mediu a aceitação do draft (5,52 tokens por etapa de verificação no modo guloso), mas não o seu retorno em tempo decorrido, então você ainda precisa fazer benchmark da implantação do SGLang no seu próprio hardware para saber o que comprou.
LFM2.5-2.6B-Base é o caminho "build": você está comprando o substrato de pré-treinamento e fazendo o pós-treinamento você mesmo, que é a única razão honesta para escolher uma base em vez do irmão pós-treinado LFM2.5-2.6B que a Liquid já vende. Esse caminho faz sentido quando você tem um domínio, um idioma ou um perfil de comportamento que os modelos prontos para uso não cobrem — você pega a arquitetura da Liquid e a fundação de 34 trilhões de tokens e a torna sua. É estritamente mais trabalho, começa com zero benchmarks publicados e carrega adiante o teto de receita. A recompensa é um modelo que ninguém mais tem.
A realidade do roteamento
Nenhum dos dois checkpoints consta em catálogo hospedado algum hoje, nem no da OrcaRouter — o draft é, por definição, um acessório local de serving, e a base do Liquid é um projeto de fine-tuning auto-hospedado. É aí que uma camada de roteamento continua útil sem fingir hospedar um ou outro: depois de servir ou fazer fine-tuning de qualquer um dos modelos, a camada à frente dos seus próprios endpoints é o que torna reversível o teste deles. Aponte um caminho de teste para uma build SGLang com o MiniCPM5-2B-plus-draft enquanto a produção permanece no que você serve hoje, deixe o failover automático detectar o travamento e mantenha os preços de tabela do provedor repassados com 0% de markup para os modelos hospedados com os quais você compara. O objetivo da camada aqui não é a entrega — é que nenhum dos ingredientes o compromete de forma irreversível.
Em qual prateleira você está comprando?
Escolha o MiniCPM5-2B-DSpark (com seu alvo) quando você quiser, hoje, um modelo on-device finalizado, sob Apache-2.0, e um rascunho que pode torná-lo mais rápido — aceitando que você mesmo precisa medir o ganho de velocidade do rascunho, já que o fornecedor não o fez. Escolha o LFM2.5-2.6B-Base quando você pretender pós-treinar seu próprio modelo e quiser a arquitetura híbrida da Liquid e a base em 16 idiomas como pesos iniciais — aceitando a conta do fine-tuning, os zero benchmarks publicados e o limite de receita de US$ 10 milhões que virá junto com tudo o que você distribuir. Os dois não são concorrentes para a mesma função; são duas funções diferentes no mesmo hardware, e a única escolha errada é comprar um acreditando que estava comprando o outro.
