Um cartão de título principal com o texto 'Intern-Decision-0.8B vs LFM2.5 2.6B Base' e o subtítulo 'Duas formas de construir algo por conta própria', exibindo os selos 'um retorna uma distribuição' e 'um retorna uma execução de treinamento', com o logotipo da OrcaRouter composto no canto.
Guides & Insights

Intern-Decision-0.8B vs LFM2.5 2.6B Base: Duas Maneiras de Construir Algo por Conta Própria

Autor

Magnus Corvin

Data de publicação

Modelos mais recentes · 20Ver todos os modelos →
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Coloque o Intern-Decision-0.8B ao lado do LFM2.5 2.6B Base e a primeira observação honesta é que nenhum dos dois é um produto no sentido que um comprador normalmente dá à palavra. O Intern-Decision-0.8B é o checkpoint que a InternLM enviou ao Hugging Face em 26 de setembro de 2026 sem nenhum anúncio — um ajuste fino de 852.985.920 parâmetros do Qwen3.5-0.8B que responde a perguntas digitadas e não emite texto, distribuído sob Apache 2.0 com um link do GitHub que dá 404. O LFM2.5 2.6B Base é o checkpoint de texto pré-treinado de 2,69 bilhões de parâmetros da Liquid AI, publicado em 1º de agosto de 2026 como a base da família LFM2.5, e a própria ficha dele diz que ele é "recomendado apenas para tarefas que exigem ajuste fino intenso". Um está finalizado e é restrito. O outro está inacabado e é geral. Ambos assumem que você é quem faz o trabalho — e o trabalho não é o mesmo trabalho.

Essa distinção é a comparação inteira, e é a razão pela qual uma tabela de especificações direta induziria ao erro. A pergunta que um leitor realmente tem é “qual destes eu baixo?”, e a resposta depende de se aquilo que você precisa construir é uma camada de decisão ou uma capacidade de linguagem. Esses são projetos diferentes com cronogramas diferentes.

O que cada modelo entrega a você

O Intern-Decision-0.8B chega como um sistema funcional. O repositório traz inference.py, uma classe DecisionEngine, um esquema de requisição documentado e um esquema de resposta, e um exemplo prático que você pode executar depois de instalar quatro dependências Python fixadas. Você fornece um estado, de uma a dezesseis perguntas nomeadas com até 62 opções cada, e, opcionalmente, até oito imagens, e você recebe de volta uma distribuição calibrada e um rótulo argmax por campo. O motor lê logits em posições fixas em um esqueleto pré-renderizado em vez de gerar qualquer coisa, então não há etapa de decodificação, nem tokens de saída, nem JSON para reparar. Ele roda a partir de aproximadamente 1,73 GB de arquivos.

O LFM2.5 2.6B Base oferece o oposto: capacidade bruta sem interface. É um modelo de linguagem causal somente de texto com 30 camadas organizadas como 22 blocos de convolução curta com duplo gate e 8 camadas de atenção com consultas agrupadas, pré-treinado em aproximadamente 34 trilhões de tokens em 16 idiomas, com um vocabulário de 128.000 tokens e uma janela de contexto de 131.072 tokens. Ele não tem ajuste de instrução próprio nem benchmarks de tarefas no card, porque um checkpoint base não é avaliado — os modelos que você treina a partir dele é que são. O próprio pipeline de pós-treinamento da Liquid é o que o transforma no LFM2.5-2.6B agêntico, e esse pipeline é o que se pede que você reproduza, parcial ou totalmente, para o seu próprio domínio.

Então o eixo não é o tamanho. É se a peça que falta é um contrato de decisão ou uma execução de treinamento.

O placar, com as ressalvas anexas

• Tempo até o primeiro resultado — Intern-Decision-0.8B: uma tarde, carregando um checkpoint e chamando predict()/. LFM2.5 2.6B Base: independentemente de quanto tempo leve seu pré-treinamento continuado ou sua execução de SFT, além do trabalho com dados para prepará-lo.

• Parâmetros — Intern-Decision-0.8B: 852.985.920 distribuídos por um fragmento de linguagem de 1,50 GB, um fragmento de visão de 176 MB e um projetor de 25 MB. LFM2.5 2.6B Base: 2,69B, cerca de 2,5 GB de pesos.

• Modalidades de entrada — Intern-Decision-0.8B: texto mais até oito imagens, com pesos de visão presentes no repositório. LFM2.5 2.6B Base: apenas texto, por design — o trabalho multimodal na família LFM2.5 está nas variantes VL.

• Contexto prático — Intern-Decision-0.8B: 8.192 tokens, rejeitados em vez de truncados, apesar de um embedding de posição máximo de 262.144 na configuração. LFM2.5 2.6B Base: 131.072 tokens nativos.

• Saída — Intern-Decision-0.8B: uma distribuição de probabilidade calibrada e um rótulo argmax por campo, de forma determinística. LFM2.5 2.6B Base: texto continuado, amostrado.

• Benchmarks — Intern-Decision-0.8B: uma tabela completa do fornecedor em sete benchmarks, não reproduzida por ninguém. LFM2.5 2.6B Base: nenhum publicado para a própria base, por opção de projeto.

• Licença — Intern-Decision-0.8B: Apache 2.0, com um LICENSE-QWEN/ preservado para os pesos upstream. LFM2.5 2.6B Base: LFM Open License v1.0.

A two-column scoreboard comparing Intern-Decision-0.8B with LFM2.5 2.6B Base on six shared rows: parameters 852,985,920 against 2.69B in about 2.5 GB, what you get a working engine and a documented schema against raw pre-trained weights with no interface, time to first result an afternoon against a continued pre-training or SFT run, input text plus up to eight images against text only with a 131,072-token context, benchmarks a vendor table unreproduced against none published for the base, and licence Apache 2.0 plus LICENSE-QWEN against the LFM Open License v1.0 and its $10M threshold.

A linha da licença merece uma secção própria

Os dois cards dizem "open", e as duas palavras significam coisas materialmente diferentes. O Intern-Decision-0.8B é Apache 2.0 — sem condição de receita, sem restrição de campo de uso, sem concessão comercial separada a negociar. O segundo arquivo de licença no repositório é a licença Qwen mantida porque o modelo é um derivado do Qwen2.5-0.8B, o que é o correto, e não uma limitação.

O LFM2.5 2.6B Base é distribuído sob a LFM Open License v1.0, e vale a pena ler a secção 5 dessa licença na íntegra antes que qualquer plano comercial dependa dela. Os direitos concedidos para Uso Comercial estão condicionados a que você, ou a sua entidade jurídica, não ultrapasse um limiar definido na licença como uma receita anual de 10 milhões de dólares norte-americanos ou mais. Acima dessa linha, o uso comercial da obra ou de um derivado não é licenciado ao abrigo do acordo. O uso sem fins lucrativos e o uso para investigação estão ressalvados. Trata-se de um limite real e exequível e, como também se aplica a obras derivadas, propaga-se a tudo o que você fizer de fine-tuning a partir da base — que é a totalidade do uso previsto para este checkpoint.

Há uma leitura direta aqui: se você está construindo comercialmente e sua entidade ultrapassa $10M em receita anual, o LFM2.5 2.6B Base não é o mesmo tipo de ativo que o Intern-Decision-0.8B, independentemente de como os dois se desempenham. Se você está abaixo do limite, pesquisando ou fazendo ajuste fino para fins não comerciais, a distinção não se aplica. De qualquer forma, é uma pergunta a ser respondida antes da execução do treinamento, não depois.

Onde cada um é realmente o download certo

LFM2.5 2.6B Base é a escolha certa quando a capacidade de que você precisa ainda não existe em um modelo finalizado. O card da Liquid lista explicitamente os casos pretendidos: assistentes específicos de idioma, como japonês, assistentes específicos de domínio, como médico, treinamento com dados proprietários que você não pode enviar a uma API, ou experimentação com novas abordagens de pós-treinamento. O raciocínio por trás dessa lista é que 34 trilhões de tokens de pré-treinamento multilíngue são caros de reproduzir e quase gratuitos de herdar — você está comprando um ponto de partida que já é competente em 16 idiomas e um contexto de 128K, e gastando sua própria capacidade computacional na parte que é específica para você.

O suporte do ecossistema a esse plano é excepcionalmente completo para um modelo tão novo. A Liquid documenta pré-treinamento de continuação, SFT, DPO e GRPO via Unsloth e TRL, com notebooks para cada um, e o checkpoint é suportado por Transformers, vLLM, SGLang, llama.cpp, MLX e LM Studio. Isso não é texto de marketing — é a diferença entre um modelo base que você consegue ajustar esta semana e um que você passa duas semanas colando em um trainer.

O Intern-Decision-0.8B é a escolha certa quando a capacidade de que você precisa já existe e o problema está na sua forma. Se a sua tarefa é uma decisão delimitada com um conjunto fechado de respostas — encaminhar este ticket, pontuar esta solicitação, classificar este registro segundo uma rubrica —, então um modelo generativo é uma maneira desajeitada de obter um rótulo, e um modelo base não é maneira alguma de obtê-lo. O que você quer é algo que devolva a distribuição, informe a sua confiança e faça isso nos mesmos 34 milissegundos todas as vezes. A latência medida do InternLM em uma única RTX 4090 é de 33,98 ms em média, com p95 de 37,50 ms, e os próprios números da placa mostram o irmão de 2B a 33,28 ms de média — um lembrete de que, nesses comprimentos de prompt, o custo está em ler o esquema, não em executar os pesos.

A troca que você está fazendo é flexibilidade por um contrato. Um modelo base pode se tornar qualquer coisa, eventualmente, se você tiver os dados e o poder computacional. Uma cabeça de decisão já é aquilo, e nunca se tornará outra coisa. Se o seu esquema muda de formato todo mês, isso é um custo real. Se não muda, não é custo algum.

O que ninguém pode te dizer sobre a tabela Intern-Decision

Todos os números de desempenho do Intern-Decision-0.8B são informados pelo fornecedor, e a ressalva aqui é mais pesada que o habitual porque o lançamento tem uma semana e é completamente indocumentado. Não há artigo, nenhuma coleção que reúna os três tamanhos, nenhum repositório GitHub funcional e nenhuma avaliação independente. Uma busca na Artificial Analysis não retorna nada para o modelo.

A InternLM selecionou os benchmarks, selecionou os modelos de comparação — um conjunto dominado por modelos de decisão, incluindo Jev, da TypeSafe, e Laya e Kev, da Convai — e publicou a tabela sem um post de lançamento.

A screenshot of the Hugging Face model card for internlm/Intern-Decision-0.8B, showing the tags image-text-to-text, Transformers, Safetensors, qwen3_5, decision-making, multimodal and conversational, an Apache-2.0 licence, a model size of 0.9B params in F32-BF16, a seven-file repository, and a model tree naming Qwen/Qwen3.5-0.8B-Base as the base model. The card text reads that Intern-Decision-0.8B is 'a multimodal structured decision model fine-tuned from Qwen3.5-0.8B' which 'accepts a shared state, a schema of named questions, and optional images, and returns an answer distribution for every question in one model forward pass', followed by a three-step 'How inference works' list.

Com esse rótulo anexado, o formato ainda vale a leitura. O Intern-Decision-0.8B registra 97,92 / 80,56 / 52,25 nas três divisões do Jevbench, 77,35 no Typed Decision e 94,52 no ToolACE, com média de 79,38. Seu perfil de calibração é a entrada mais interessante: um Brier de 0,530 e um erro de calibração esperado de 0,066, que é um ECE melhor que o 0,095 do Jev, apesar de um Brier pior. Em termos simples, ele é menos preciso, mas mais honesto sobre quão preciso é, e, para um fluxo de trabalho baseado em limiar, essa ordenação importa mais do que a média. A coluna que deveria impedir uma implantação é WildJailBreak, com 64,48 contra 96,29 do Jev. Um déficit de robustez de recusa tão grande é uma propriedade do fine-tune, e não está documentado em lugar nenhum no card se ele pertence à base Qwen3.5-0.8B, ao objetivo de ajuste de decisão ou ao número de parâmetros.

A comparação com o LFM2.5 2.6B Base neste eixo não é "quem pontua mais", porque a base não tem pontuações. É que os números de um modelo não são auditados e os números do outro modelo não existem, e um leitor que escolhe entre eles está escolhendo com que tipo de incógnita trabalhar.

O pipeline que a maioria das pessoas acaba de fato construindo

Há uma configuração que usa os dois, e vale a pena nomeá-la porque é onde a maioria dos sistemas de produção acaba por parar. A camada de decisão trata das chamadas fechadas — triagem, encaminhamento, pontuação por rubrica — em que o conjunto de respostas é conhecido, a latência se acumula ao longo de um milhão de registros, e os tokens de saída são pura sobrecarga. A camada de linguagem trata de tudo o que precisa de prosa, síntese ou contexto longo: o resumo de escalonamento, a explicação anexada ao rótulo, o rascunho que uma pessoa edita. LFM2.5 2.6B Base é um substrato plausível para a segunda metade se você tiver dados de domínio que valham a pena usar para treinar; uma cabeça de decisão é a forma natural da primeira.

Combinar os dois é a parte complicada, e é justamente a parte que vale a pena não construir à mão. A DSL de roteamento da OrcaRouter expressa o roteamento como código — YAML com condições CEL, implantado sem precisar de um novo deploy — de modo que um pipeline que envia uma classe de requisições para um endpoint de decisão e outra para um modelo de linguagem é uma regra de roteamento, e não um balanceador de carga que você mesmo mantém. O gateway cobre mais de 200 modelos atrás de uma única chave compatível com OpenAI, com o preço de tabela do provedor repassado com markup zero, e não acrescenta markup ao modelo que você escolher. Para ser preciso sobre a fronteira: nem o Intern-Decision-0.8B nem o LFM2.5 2.6B Base é um dos nossos — ambos são checkpoints que você baixa e executa localmente, e nos dois casos é exatamente esse o ponto, porque a razão para escolher um modelo de 2 GB é que ele roda onde seus dados já estão. Para isso serve um gateway: é a metade da pilha para a qual você, de outra forma, estaria fazendo chamadas externas.

Se a camada de decisão é a peça que você quer testar sem dedicar uma execução de treinamento a ela, um modelo de decisão hospedado é o experimento mais barato, e o Jev 1.13 da TypeSafe é aquele contra o qual o InternLM fez benchmark — chamável hoje através de um único endpoint compatível com OpenAI a $0,042 por milhão de tokens de entrada com saída cobrada a zero.

A screenshot of the OrcaRouter model page for typesafe/jev-1.13, dated 2026-09-24, showing a 65K token context, text input and text output, a P95 time to first token of 170 ms, and list pricing of $0.042 per million input tokens with no output rate. The description reads that Jev is TypeSafe's structured decision and evaluation model, taking a state and a set of named questions (noul, choice, score) and returning a structured answer for each, served non-streaming via POST /v1/systemone. A performance panel lower down reports a P50 time to first token of 178 ms and an output speed of 569 tokens per second.

Qual, então?

Escolha o LFM2.5 2.6B Base se a capacidade ainda não existir e tiver tanto os dados de domínio como o apetite para uma execução de fine-tuning, e verifique o limiar de receita de $10M na LFM Open License antes de o usar comercialmente como base. Escolha o Intern-Decision-0.8B se a capacidade existir, as respostas já forem enumeráveis no seu prompt e o que precisa for de uma forma rápida, determinística e com licenciamento limpo de obter o rótulo — aceitando que a sua documentação está em falta, que os seus benchmarks não foram auditados e que o seu comportamento de recusa perante entradas adversariais não foi testado por ninguém fora do laboratório que o afinou. O segundo é o caminho mais curto e a maior incógnita. O primeiro é o caminho mais longo e o mais documentado, e nenhum desses factos é sinónimo de melhor.