
Intern-Decision-0.8B vs LFM2.5 2.6B Base: Duas Maneiras de Construir Algo por Conta Própria
- typesafeNOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 592 tok/s
- openaiNOVOOpenAI: GPT-6 Luna2026-09-2237Inteligência
- openaiNOVOOpenAI: GPT-6 Sol2026-09-2248Inteligência
- anthropicNOVOAnthropic: Claude Opus 5.52026-09-2258Inteligência
- grokNOVOGrok 4.72026-09-2146Inteligência
- OrcaNOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens · 187 tok/s
- orcaNOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 113 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligência72Código
Coloque o Intern-Decision-0.8B ao lado do LFM2.5 2.6B Base e a primeira observação honesta é que nenhum dos dois é um produto no sentido que um comprador normalmente dá à palavra. O Intern-Decision-0.8B é o checkpoint que a InternLM enviou ao Hugging Face em 26 de setembro de 2026 sem nenhum anúncio — um ajuste fino de 852.985.920 parâmetros do Qwen3.5-0.8B que responde a perguntas digitadas e não emite texto, distribuído sob Apache 2.0 com um link do GitHub que dá 404. O LFM2.5 2.6B Base é o checkpoint de texto pré-treinado de 2,69 bilhões de parâmetros da Liquid AI, publicado em 1º de agosto de 2026 como a base da família LFM2.5, e a própria ficha dele diz que ele é "recomendado apenas para tarefas que exigem ajuste fino intenso". Um está finalizado e é restrito. O outro está inacabado e é geral. Ambos assumem que você é quem faz o trabalho — e o trabalho não é o mesmo trabalho.
Essa distinção é a comparação inteira, e é a razão pela qual uma tabela de especificações direta induziria ao erro. A pergunta que um leitor realmente tem é “qual destes eu baixo?”, e a resposta depende de se aquilo que você precisa construir é uma camada de decisão ou uma capacidade de linguagem. Esses são projetos diferentes com cronogramas diferentes.
O que cada modelo entrega a você
O Intern-Decision-0.8B chega como um sistema funcional. O repositório traz inference.py, uma classe DecisionEngine, um esquema de requisição documentado e um esquema de resposta, e um exemplo prático que você pode executar depois de instalar quatro dependências Python fixadas. Você fornece um estado, de uma a dezesseis perguntas nomeadas com até 62 opções cada, e, opcionalmente, até oito imagens, e você recebe de volta uma distribuição calibrada e um rótulo argmax por campo. O motor lê logits em posições fixas em um esqueleto pré-renderizado em vez de gerar qualquer coisa, então não há etapa de decodificação, nem tokens de saída, nem JSON para reparar. Ele roda a partir de aproximadamente 1,73 GB de arquivos.
O LFM2.5 2.6B Base oferece o oposto: capacidade bruta sem interface. É um modelo de linguagem causal somente de texto com 30 camadas organizadas como 22 blocos de convolução curta com duplo gate e 8 camadas de atenção com consultas agrupadas, pré-treinado em aproximadamente 34 trilhões de tokens em 16 idiomas, com um vocabulário de 128.000 tokens e uma janela de contexto de 131.072 tokens. Ele não tem ajuste de instrução próprio nem benchmarks de tarefas no card, porque um checkpoint base não é avaliado — os modelos que você treina a partir dele é que são. O próprio pipeline de pós-treinamento da Liquid é o que o transforma no LFM2.5-2.6B agêntico, e esse pipeline é o que se pede que você reproduza, parcial ou totalmente, para o seu próprio domínio.
Então o eixo não é o tamanho. É se a peça que falta é um contrato de decisão ou uma execução de treinamento.
O placar, com as ressalvas anexas
• Tempo até o primeiro resultado — Intern-Decision-0.8B: uma tarde, carregando um checkpoint e chamando predict()/. LFM2.5 2.6B Base: independentemente de quanto tempo leve seu pré-treinamento continuado ou sua execução de SFT, além do trabalho com dados para prepará-lo.
• Parâmetros — Intern-Decision-0.8B: 852.985.920 distribuídos por um fragmento de linguagem de 1,50 GB, um fragmento de visão de 176 MB e um projetor de 25 MB. LFM2.5 2.6B Base: 2,69B, cerca de 2,5 GB de pesos.
• Modalidades de entrada — Intern-Decision-0.8B: texto mais até oito imagens, com pesos de visão presentes no repositório. LFM2.5 2.6B Base: apenas texto, por design — o trabalho multimodal na família LFM2.5 está nas variantes VL.
• Contexto prático — Intern-Decision-0.8B: 8.192 tokens, rejeitados em vez de truncados, apesar de um embedding de posição máximo de 262.144 na configuração. LFM2.5 2.6B Base: 131.072 tokens nativos.
• Saída — Intern-Decision-0.8B: uma distribuição de probabilidade calibrada e um rótulo argmax por campo, de forma determinística. LFM2.5 2.6B Base: texto continuado, amostrado.
• Benchmarks — Intern-Decision-0.8B: uma tabela completa do fornecedor em sete benchmarks, não reproduzida por ninguém. LFM2.5 2.6B Base: nenhum publicado para a própria base, por opção de projeto.
• Licença — Intern-Decision-0.8B: Apache 2.0, com um LICENSE-QWEN/ preservado para os pesos upstream. LFM2.5 2.6B Base: LFM Open License v1.0.

A linha da licença merece uma secção própria
Os dois cards dizem "open", e as duas palavras significam coisas materialmente diferentes. O Intern-Decision-0.8B é Apache 2.0 — sem condição de receita, sem restrição de campo de uso, sem concessão comercial separada a negociar. O segundo arquivo de licença no repositório é a licença Qwen mantida porque o modelo é um derivado do Qwen2.5-0.8B, o que é o correto, e não uma limitação.
O LFM2.5 2.6B Base é distribuído sob a LFM Open License v1.0, e vale a pena ler a secção 5 dessa licença na íntegra antes que qualquer plano comercial dependa dela. Os direitos concedidos para Uso Comercial estão condicionados a que você, ou a sua entidade jurídica, não ultrapasse um limiar definido na licença como uma receita anual de 10 milhões de dólares norte-americanos ou mais. Acima dessa linha, o uso comercial da obra ou de um derivado não é licenciado ao abrigo do acordo. O uso sem fins lucrativos e o uso para investigação estão ressalvados. Trata-se de um limite real e exequível e, como também se aplica a obras derivadas, propaga-se a tudo o que você fizer de fine-tuning a partir da base — que é a totalidade do uso previsto para este checkpoint.
Há uma leitura direta aqui: se você está construindo comercialmente e sua entidade ultrapassa $10M em receita anual, o LFM2.5 2.6B Base não é o mesmo tipo de ativo que o Intern-Decision-0.8B, independentemente de como os dois se desempenham. Se você está abaixo do limite, pesquisando ou fazendo ajuste fino para fins não comerciais, a distinção não se aplica. De qualquer forma, é uma pergunta a ser respondida antes da execução do treinamento, não depois.
Onde cada um é realmente o download certo
LFM2.5 2.6B Base é a escolha certa quando a capacidade de que você precisa ainda não existe em um modelo finalizado. O card da Liquid lista explicitamente os casos pretendidos: assistentes específicos de idioma, como japonês, assistentes específicos de domínio, como médico, treinamento com dados proprietários que você não pode enviar a uma API, ou experimentação com novas abordagens de pós-treinamento. O raciocínio por trás dessa lista é que 34 trilhões de tokens de pré-treinamento multilíngue são caros de reproduzir e quase gratuitos de herdar — você está comprando um ponto de partida que já é competente em 16 idiomas e um contexto de 128K, e gastando sua própria capacidade computacional na parte que é específica para você.
O suporte do ecossistema a esse plano é excepcionalmente completo para um modelo tão novo. A Liquid documenta pré-treinamento de continuação, SFT, DPO e GRPO via Unsloth e TRL, com notebooks para cada um, e o checkpoint é suportado por Transformers, vLLM, SGLang, llama.cpp, MLX e LM Studio. Isso não é texto de marketing — é a diferença entre um modelo base que você consegue ajustar esta semana e um que você passa duas semanas colando em um trainer.
O Intern-Decision-0.8B é a escolha certa quando a capacidade de que você precisa já existe e o problema está na sua forma. Se a sua tarefa é uma decisão delimitada com um conjunto fechado de respostas — encaminhar este ticket, pontuar esta solicitação, classificar este registro segundo uma rubrica —, então um modelo generativo é uma maneira desajeitada de obter um rótulo, e um modelo base não é maneira alguma de obtê-lo. O que você quer é algo que devolva a distribuição, informe a sua confiança e faça isso nos mesmos 34 milissegundos todas as vezes. A latência medida do InternLM em uma única RTX 4090 é de 33,98 ms em média, com p95 de 37,50 ms, e os próprios números da placa mostram o irmão de 2B a 33,28 ms de média — um lembrete de que, nesses comprimentos de prompt, o custo está em ler o esquema, não em executar os pesos.
A troca que você está fazendo é flexibilidade por um contrato. Um modelo base pode se tornar qualquer coisa, eventualmente, se você tiver os dados e o poder computacional. Uma cabeça de decisão já é aquilo, e nunca se tornará outra coisa. Se o seu esquema muda de formato todo mês, isso é um custo real. Se não muda, não é custo algum.
O que ninguém pode te dizer sobre a tabela Intern-Decision
Todos os números de desempenho do Intern-Decision-0.8B são informados pelo fornecedor, e a ressalva aqui é mais pesada que o habitual porque o lançamento tem uma semana e é completamente indocumentado. Não há artigo, nenhuma coleção que reúna os três tamanhos, nenhum repositório GitHub funcional e nenhuma avaliação independente. Uma busca na Artificial Analysis não retorna nada para o modelo.
A InternLM selecionou os benchmarks, selecionou os modelos de comparação — um conjunto dominado por modelos de decisão, incluindo Jev, da TypeSafe, e Laya e Kev, da Convai — e publicou a tabela sem um post de lançamento.

Com esse rótulo anexado, o formato ainda vale a leitura. O Intern-Decision-0.8B registra 97,92 / 80,56 / 52,25 nas três divisões do Jevbench, 77,35 no Typed Decision e 94,52 no ToolACE, com média de 79,38. Seu perfil de calibração é a entrada mais interessante: um Brier de 0,530 e um erro de calibração esperado de 0,066, que é um ECE melhor que o 0,095 do Jev, apesar de um Brier pior. Em termos simples, ele é menos preciso, mas mais honesto sobre quão preciso é, e, para um fluxo de trabalho baseado em limiar, essa ordenação importa mais do que a média. A coluna que deveria impedir uma implantação é WildJailBreak, com 64,48 contra 96,29 do Jev. Um déficit de robustez de recusa tão grande é uma propriedade do fine-tune, e não está documentado em lugar nenhum no card se ele pertence à base Qwen3.5-0.8B, ao objetivo de ajuste de decisão ou ao número de parâmetros.
A comparação com o LFM2.5 2.6B Base neste eixo não é "quem pontua mais", porque a base não tem pontuações. É que os números de um modelo não são auditados e os números do outro modelo não existem, e um leitor que escolhe entre eles está escolhendo com que tipo de incógnita trabalhar.
O pipeline que a maioria das pessoas acaba de fato construindo
Há uma configuração que usa os dois, e vale a pena nomeá-la porque é onde a maioria dos sistemas de produção acaba por parar. A camada de decisão trata das chamadas fechadas — triagem, encaminhamento, pontuação por rubrica — em que o conjunto de respostas é conhecido, a latência se acumula ao longo de um milhão de registros, e os tokens de saída são pura sobrecarga. A camada de linguagem trata de tudo o que precisa de prosa, síntese ou contexto longo: o resumo de escalonamento, a explicação anexada ao rótulo, o rascunho que uma pessoa edita. LFM2.5 2.6B Base é um substrato plausível para a segunda metade se você tiver dados de domínio que valham a pena usar para treinar; uma cabeça de decisão é a forma natural da primeira.
Combinar os dois é a parte complicada, e é justamente a parte que vale a pena não construir à mão. A DSL de roteamento da OrcaRouter expressa o roteamento como código — YAML com condições CEL, implantado sem precisar de um novo deploy — de modo que um pipeline que envia uma classe de requisições para um endpoint de decisão e outra para um modelo de linguagem é uma regra de roteamento, e não um balanceador de carga que você mesmo mantém. O gateway cobre mais de 200 modelos atrás de uma única chave compatível com OpenAI, com o preço de tabela do provedor repassado com markup zero, e não acrescenta markup ao modelo que você escolher. Para ser preciso sobre a fronteira: nem o Intern-Decision-0.8B nem o LFM2.5 2.6B Base é um dos nossos — ambos são checkpoints que você baixa e executa localmente, e nos dois casos é exatamente esse o ponto, porque a razão para escolher um modelo de 2 GB é que ele roda onde seus dados já estão. Para isso serve um gateway: é a metade da pilha para a qual você, de outra forma, estaria fazendo chamadas externas.
Se a camada de decisão é a peça que você quer testar sem dedicar uma execução de treinamento a ela, um modelo de decisão hospedado é o experimento mais barato, e o Jev 1.13 da TypeSafe é aquele contra o qual o InternLM fez benchmark — chamável hoje através de um único endpoint compatível com OpenAI a $0,042 por milhão de tokens de entrada com saída cobrada a zero.

Qual, então?
Escolha o LFM2.5 2.6B Base se a capacidade ainda não existir e tiver tanto os dados de domínio como o apetite para uma execução de fine-tuning, e verifique o limiar de receita de $10M na LFM Open License antes de o usar comercialmente como base. Escolha o Intern-Decision-0.8B se a capacidade existir, as respostas já forem enumeráveis no seu prompt e o que precisa for de uma forma rápida, determinística e com licenciamento limpo de obter o rótulo — aceitando que a sua documentação está em falta, que os seus benchmarks não foram auditados e que o seu comportamento de recusa perante entradas adversariais não foi testado por ninguém fora do laboratório que o afinou. O segundo é o caminho mais curto e a maior incógnita. O primeiro é o caminho mais longo e o mais documentado, e nenhum desses factos é sinónimo de melhor.
