Um cartão de título de destaque encabeçado por 'Liquid AI d1-3B vs LFM2.5-2.6B-Base', com o subtítulo 'o modelo de decisão e seu próprio ancestral', desenhado como uma árvore genealógica da esquerda para a direita: um cartão rotulado LFM2.5-2.6B-Base pesos brutos, uma seta rotulada pós-treinamento, e um cartão rotulado d1-3B responde a perguntas, com um chip de manter treinamento sob o cartão esquerdo e chips de sim/não, rótulo e pontuação sob o da direita.
Guides & Insights

Liquid AI d1-3B vs LFM2.5-2.6B-B: O Modelo de Decisão e Seu Próprio Ancestral

Autor

Magnus Corvin

Data de publicação

Modelos mais recentes · 20Ver todos os modelos →
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Este não é um confronto entre dois rivais. O Liquid AI d1-3B, o modelo de decisão de pesos abertos que a Liquid AI publicou em 7 de outubro de 2026, foi construído sobre uma base que o fornecedor criou fazendo a média dos pesos do LFM2.5-2.6B com o backbone de texto do LFM2.5-VL-3B. O LFM2.5-2.6B-Base é esse primeiro pai — o checkpoint bruto pré-treinado que a Liquid disponibilizou em 1º de agosto de 2026, 2,69 bilhões de parâmetros, 34 trilhões de tokens de treinamento, contexto de 131.072 tokens, sem ajuste por instrução e sem template de chat. Portanto, o enquadramento honesto desta comparação é descendente contra ancestral: um modelo que passou por pós-treinamento para uma função muito específica, ao lado do substrato não moldado do qual ele foi moldado. Um deles responde a perguntas esta noite. O outro é por onde você começa se a pergunta que você precisa ver respondida ainda não foi feita por ninguém.

O que cada um realmente é

Os dois cartões de modelo leem-se como documentos de diferentes etapas de uma linha de produção, e as diferenças não são estilísticas.

Liquid AI d1-3B carrega 3,12 bilhões de parâmetros, um codificador de visão SigLIP2 NaFlex de 400M, uma janela de contexto de 32.768 tokens, um vocabulário de 128.000 tokens e dezesseis idiomas documentados. É um modelo de decisão: você fornece a ele um estado e perguntas nomeadas, e ele retorna uma probabilidade sim/não, um rótulo escolhido com confiança e uma distribuição completa de opções, ou uma pontuação ordenada — em uma única passada direta, sem tokens de saída gerados. Ele traz uma chamada system_one para um estado com várias perguntas, uma variante em lote que agrupa muitas solicitações sem preenchimento, e um acessador bruto de probabilities para as distribuições subjacentes. Não é um modelo de chat e não escreve texto, e o cartão diz isso exatamente com essas palavras.

LFM2.5-2.6B-Basepossui 2,69 bilhões de parâmetros em 30 camadas — 22 blocos de convolução curta com duplo gate e 8 blocos de atenção com consultas agrupadas — treinado em 34 trilhões de tokens e estendido para um contexto de 131.072 tokens durante o treinamento intermediário, com o mesmo vocabulário de 128.000 tokens e os mesmos dezesseis idiomas. É um checkpoint pré-treinado somente de texto, sem ajuste por instruções, sem benchmarks em seu card, e com uma recomendação que soa como um aviso: use-o apenas para tarefas que exigem ajuste fino pesado. Ele completa texto. Ele não segue instruções.

Ambos são downloads sem restrições, sob a própria licença aberta da Liquid. Ambos priorizam texto. Nenhum dos dois está em nosso catálogo, e nada aqui constitui uma afirmação de disponibilidade para nenhum deles.

A two-column scoreboard for Liquid AI d1-3B and LFM2.5-2.6B-Base. The d1-3B column reads: role post-trained decision model; 3.12B parameters; 32,768-token context; text and image input; Decision Index 48.57 (vendor); answers a question in 8 ms. The base column reads: role raw pre-trained base; 2.69B parameters; 131,072-token context; text-only input; Decision Index not scoreable; answers a question only after you fine-tune. The footer reads 'd1-3B figures vendor-reported; the base checkpoint publishes no benchmark table.'

A linhagem é a parte interessante

A Liquid não fez ajuste fino de um modelo novo para fazer o lançamento do d1. Fez a média de dois checkpoints — o LFM2.5-2.6B e a torre de texto do LFM2.5-VL-3B — para obter um melhor ponto de partida, depois fez ajuste fino em várias execuções com diferentes sementes aleatórias e misturas de dados e voltou a fundi-las. O relato do fornecedor sobre o que melhorou o resultado está conspicuamente livre de técnicas exóticas: treinar com entradas longas, embaralhar a ordem em que as opções de resposta aparecem e remover atalhos dos dados de treino fizeram mais do que qualquer método avançado que experimentaram.

Esse detalhe de remoção de atalhos merece uma pausa, porque nomeia a falha que esta categoria existe para evitar. Um modelo treinado para responder a perguntas de múltipla escolha vai aprender alegremente que a opção B costuma estar certa, ou que a opção mais longa vence. É o embaralhamento da ordem das opções durante o treinamento que impede isso. Um modelo de decisão que aprendeu um prior de posição em vez de ler o estado é pior do que inútil — ele está errado com confiança em escala — e é exatamente isso que separa um verdadeiro modelo de decisão de um classificador com um prompt.

Há também uma regressão que vale a pena nomear claramente, porque o fornecedor não o faz: o checkpoint base tem uma janela de contexto de 131.072 tokens e o Liquid AI d1-3B tem 32.768. O pós-treinamento para um modelo de decisão custou três quartos do contexto utilizável. Se você imaginava que o descendente domina estritamente seu ancestral em todos os eixos, não domina, e decisões sobre documentos longos são o eixo em que o checkpoint mais antigo tem mais espaço — em princípio, embora não tenha uma cabeça de decisão para usá-lo.

O placar, com a assimetria anexada

Comparar esses dois em benchmarks é um erro de categoria, mas é um erro de categoria com uma forma informativa, então aqui está, com as ressalvas devidamente colocadas. Todos os números do d1-3B são da própria Liquid, avaliados pelo fornecedor com o avaliador oficial em vez de submetidos a um leaderboard público, e não reproduzidos por terceiros. Todos os números do LFM2.5-2.6B-Base estão ausentes porque um modelo base não tem nada a medir.

• Decision Index 0.2.1 — Liquid AI d1-3B 48,57, o primeiro entre tudo abaixo de 10B na tabela do fornecedor e à frente de um modelo de decisão doze vezes maior que ele. LFM2.5-2.6B-Base — não pontuado, não pontuável sem uma cabeça de decisão.

• Benchmarks de texto — o Liquid AI d1-3B tem média de 82,9 em sete benchmarks públicos que abrangem compreensão, toxicidade, intenção, QA médica e compreensão entre idiomas. O LFM2.5-2.6B-Base não publica nenhuma tabela de benchmarks.

• Visão — Liquid AI d1-3B tem média de 74,1 em onze benchmarks de imagens lidos como decisões; remover as imagens derruba as mesmas perguntas para 45,1. O LFM2.5-2.6B-Base é somente texto, sem torre de visão.

• Parâmetros — 3,12B contra 2,69B. O modelo de decisão é o maior dos dois, o que é o oposto da história usual de pós-treinamento.

• Contexto — 32.768 tokens contra 131.072. O ancestral vence esta linha e é a única linha que ele vence.

• Latência — O Liquid AI d1-3B responde a uma única pergunta em 8 ms numa RTX 4090 e 50 ms num Jetson Orin Nano, e executa 64 estados empacotados a 475 por segundo na 4090. O LFM2.5-2.6B-Base não tem latência a citar até que você o ajuste (fine-tune) para algo que responda a uma pergunta, e nesse momento o número é o do seu fine-tune.

A capture of Liquid AI's documentation page for its decision models, showing the left-hand navigation including Decision Models and Liquid Nanos, the 'Open d1' banner announcing that visitors can now run d1-3B and d1-omni-600M locally, and the page's opening description of purpose-built models for structured decisions such as classification, routing and scoring in a single call with zero generation.

Entre o que você está escolhendo, na prática

A regra de decisão aqui é excepcionalmente clara, porque os dois pontos de verificação não estão disputando a mesma rubrica orçamentária.

Escolha o Liquid AI d1-3B quando a pergunta já existe e é uma das três formas que um modelo de decisão trata: um sim ou não, uma escolha num conjunto nomeado, ou uma classificação numa escala ordenada. As aplicações publicadas são todas tarefas de produção reconhecíveis — triagem e encaminhamento, moderação, classificação de intenção e tópico, verificações de extração, reordenação, barreiras de segurança de agentes e inspeção visual. Os números da demonstração que o fornecedor divulgou a 5 de outubro colocaram o d1 contra o GPT-6.1 Sol e o Claude Opus 5.5 em seis dessas tarefas e afirmam que iguala ou supera o GPT-6.1 Sol em quatro, com um custo 19x a 200x menor; a página de metodologia afirma claramente que cada aplicação foi executada uma vez por modelo, por isso trate a forma da alegação como o resultado, não as casas decimais. A verdadeiramente impressionante é a demonstração de inspeção: triagem entre bons e defeituosos em quatro linhas de produção, com 85 a 97% de precisão numa tarefa para a qual o modelo nunca foi treinado, compreendida a partir de uma breve descrição.

Use o LFM2.5-2.6B-Base quando a pergunta ainda não existe. É o ponto de partida mais barato para um fine-tune que você pretende dominar — um cabeçote de decisão de domínio, um classificador sob medida, uma tarefa para a qual ninguém tem um checkpoint. Você herda a arquitetura, o tokenizer e o contexto longo, e paga em poder de processamento, dados e avaliação. Duas das quatro aplicações que o fornecedor construiu em torno do d1 partiram de projetos de código aberto em vez de começarem do zero, o que é um retrato justo do que um checkpoint base mais disciplina realmente produz.

A armadilha prática é tratar o checkpoint base como um substituto direto. Ele não é um assistente, não seguirá um prompt e, como modelo de chat, obtém pontuação perto de zero — o que não é um fato sobre sua qualidade, mas sim um fato sobre o que “base” significa.

Auto-hospedar qualquer um deles, e a camada acima

Ambos chegam como pesos, e o fornecedor fez o trabalho de implantação para o lado d1: suporte ao llama.cpp desde o primeiro dia, a stack completa da NVIDIA, do DGX até o Jetson, quantização NVFP4, uma variante de pesos e ativações de 8 bits e conversões GGUF no Hugging Face. O checkpoint base tem suas próprias variantes GGUF, ONNX e MLX por meio da família LFM2.5 mais ampla. Se você preferir não hospedar nada, a Liquid disponibiliza o serviço hospedado d1 em sua própria API, com cobrança apenas por tokens de entrada, com imagens cobradas a 1,5 token por patch de 32×32 pixels; o acesso somente a texto também está disponível por meio de plataformas de terceiros.

O que nenhum dos dois caminhos muda é o resto da pilha. Um modelo que você hospeda é um modelo que você precisa manter vivo, versionar e fazer failover — e as decisões que ele alimenta ainda caem ao lado das chamadas generativas que você não hospeda. Essa mistura é a camada que um roteador colapsa: um único endpoint para mais de 200 modelos, preços de lista dos provedores repassados com 0% de markup de modo que uma mudança de preço de um fornecedor fique ativa do seu lado no mesmo dia, e failover automático para que uma tarde ruim de um upstream não se torne a sua indisponibilidade. Hospedar por conta própria um modelo de decisão de 3B ao lado disso torna a questão de roteamento mais nítida, e não mais branda, porque agora você é dono de metade do pipeline e aluga a outra metade.

Qual deles, para quem

Se a pergunta que você precisa responder esta semana é uma das três formas que um modelo de decisão assume, e é uma pergunta que alguém já imaginou, o descendente está pronto e é gratuito e roda em 50 ms em um dispositivo sem GPU — use o Liquid AI d1-3B e pronto.

Se você está construindo a coisa que responde a uma pergunta que ninguém ainda fez, e tem os dados e a capacidade computacional para dominar isso, o LFM2.5-2.6B-Base é o ponto de partida honesto, e vale a pena saber que o descendente neste artigo foi feito a partir dele exatamente pelo caminho que você está prestes a seguir.

E se você não tiver certeza de qual dessas duas situações é a sua, a resposta é quase sempre a primeira. Fazer pós-treinamento em uma cabeça de decisão é a jogada cara; rodar a de outra pessoa é grátis.

A capture of our own models catalogue page, showing the filter rail for input modalities, context length, input price, status, series and supported parameters, a header reading '207 models, 16 providers, one API key, one bill', sort control set to Newest, a model listing beginning with openai/gpt-5-search-api-2025-10-14, and a 'How to call any model' panel with the OpenAI-compatible endpoint https://api.orcarouter.ai/v1/chat/completions.

Comparados neste artigo1

Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente