
Liquid AI d1-3B vs LFM2.5-2.6B-B: O Modelo de Decisão e Seu Próprio Ancestral
- openaiNOVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligência
- anthropicNOVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligência
- typesafeNOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Inteligência
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Inteligência
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Inteligência
- xAIGrok 4.72026-09-2146Inteligência
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 62 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 358 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
Este não é um confronto entre dois rivais. O Liquid AI d1-3B, o modelo de decisão de pesos abertos que a Liquid AI publicou em 7 de outubro de 2026, foi construído sobre uma base que o fornecedor criou fazendo a média dos pesos do LFM2.5-2.6B com o backbone de texto do LFM2.5-VL-3B. O LFM2.5-2.6B-Base é esse primeiro pai — o checkpoint bruto pré-treinado que a Liquid disponibilizou em 1º de agosto de 2026, 2,69 bilhões de parâmetros, 34 trilhões de tokens de treinamento, contexto de 131.072 tokens, sem ajuste por instrução e sem template de chat. Portanto, o enquadramento honesto desta comparação é descendente contra ancestral: um modelo que passou por pós-treinamento para uma função muito específica, ao lado do substrato não moldado do qual ele foi moldado. Um deles responde a perguntas esta noite. O outro é por onde você começa se a pergunta que você precisa ver respondida ainda não foi feita por ninguém.
O que cada um realmente é
Os dois cartões de modelo leem-se como documentos de diferentes etapas de uma linha de produção, e as diferenças não são estilísticas.
Liquid AI d1-3B carrega 3,12 bilhões de parâmetros, um codificador de visão SigLIP2 NaFlex de 400M, uma janela de contexto de 32.768 tokens, um vocabulário de 128.000 tokens e dezesseis idiomas documentados. É um modelo de decisão: você fornece a ele um estado e perguntas nomeadas, e ele retorna uma probabilidade sim/não, um rótulo escolhido com confiança e uma distribuição completa de opções, ou uma pontuação ordenada — em uma única passada direta, sem tokens de saída gerados. Ele traz uma chamada system_one para um estado com várias perguntas, uma variante em lote que agrupa muitas solicitações sem preenchimento, e um acessador bruto de probabilities para as distribuições subjacentes. Não é um modelo de chat e não escreve texto, e o cartão diz isso exatamente com essas palavras.
LFM2.5-2.6B-Basepossui 2,69 bilhões de parâmetros em 30 camadas — 22 blocos de convolução curta com duplo gate e 8 blocos de atenção com consultas agrupadas — treinado em 34 trilhões de tokens e estendido para um contexto de 131.072 tokens durante o treinamento intermediário, com o mesmo vocabulário de 128.000 tokens e os mesmos dezesseis idiomas. É um checkpoint pré-treinado somente de texto, sem ajuste por instruções, sem benchmarks em seu card, e com uma recomendação que soa como um aviso: use-o apenas para tarefas que exigem ajuste fino pesado. Ele completa texto. Ele não segue instruções.
Ambos são downloads sem restrições, sob a própria licença aberta da Liquid. Ambos priorizam texto. Nenhum dos dois está em nosso catálogo, e nada aqui constitui uma afirmação de disponibilidade para nenhum deles.

A linhagem é a parte interessante
A Liquid não fez ajuste fino de um modelo novo para fazer o lançamento do d1. Fez a média de dois checkpoints — o LFM2.5-2.6B e a torre de texto do LFM2.5-VL-3B — para obter um melhor ponto de partida, depois fez ajuste fino em várias execuções com diferentes sementes aleatórias e misturas de dados e voltou a fundi-las. O relato do fornecedor sobre o que melhorou o resultado está conspicuamente livre de técnicas exóticas: treinar com entradas longas, embaralhar a ordem em que as opções de resposta aparecem e remover atalhos dos dados de treino fizeram mais do que qualquer método avançado que experimentaram.
Esse detalhe de remoção de atalhos merece uma pausa, porque nomeia a falha que esta categoria existe para evitar. Um modelo treinado para responder a perguntas de múltipla escolha vai aprender alegremente que a opção B costuma estar certa, ou que a opção mais longa vence. É o embaralhamento da ordem das opções durante o treinamento que impede isso. Um modelo de decisão que aprendeu um prior de posição em vez de ler o estado é pior do que inútil — ele está errado com confiança em escala — e é exatamente isso que separa um verdadeiro modelo de decisão de um classificador com um prompt.
Há também uma regressão que vale a pena nomear claramente, porque o fornecedor não o faz: o checkpoint base tem uma janela de contexto de 131.072 tokens e o Liquid AI d1-3B tem 32.768. O pós-treinamento para um modelo de decisão custou três quartos do contexto utilizável. Se você imaginava que o descendente domina estritamente seu ancestral em todos os eixos, não domina, e decisões sobre documentos longos são o eixo em que o checkpoint mais antigo tem mais espaço — em princípio, embora não tenha uma cabeça de decisão para usá-lo.
O placar, com a assimetria anexada
Comparar esses dois em benchmarks é um erro de categoria, mas é um erro de categoria com uma forma informativa, então aqui está, com as ressalvas devidamente colocadas. Todos os números do d1-3B são da própria Liquid, avaliados pelo fornecedor com o avaliador oficial em vez de submetidos a um leaderboard público, e não reproduzidos por terceiros. Todos os números do LFM2.5-2.6B-Base estão ausentes porque um modelo base não tem nada a medir.
• Decision Index 0.2.1 — Liquid AI d1-3B 48,57, o primeiro entre tudo abaixo de 10B na tabela do fornecedor e à frente de um modelo de decisão doze vezes maior que ele. LFM2.5-2.6B-Base — não pontuado, não pontuável sem uma cabeça de decisão.
• Benchmarks de texto — o Liquid AI d1-3B tem média de 82,9 em sete benchmarks públicos que abrangem compreensão, toxicidade, intenção, QA médica e compreensão entre idiomas. O LFM2.5-2.6B-Base não publica nenhuma tabela de benchmarks.
• Visão — Liquid AI d1-3B tem média de 74,1 em onze benchmarks de imagens lidos como decisões; remover as imagens derruba as mesmas perguntas para 45,1. O LFM2.5-2.6B-Base é somente texto, sem torre de visão.
• Parâmetros — 3,12B contra 2,69B. O modelo de decisão é o maior dos dois, o que é o oposto da história usual de pós-treinamento.
• Contexto — 32.768 tokens contra 131.072. O ancestral vence esta linha e é a única linha que ele vence.
• Latência — O Liquid AI d1-3B responde a uma única pergunta em 8 ms numa RTX 4090 e 50 ms num Jetson Orin Nano, e executa 64 estados empacotados a 475 por segundo na 4090. O LFM2.5-2.6B-Base não tem latência a citar até que você o ajuste (fine-tune) para algo que responda a uma pergunta, e nesse momento o número é o do seu fine-tune.

Entre o que você está escolhendo, na prática
A regra de decisão aqui é excepcionalmente clara, porque os dois pontos de verificação não estão disputando a mesma rubrica orçamentária.
Escolha o Liquid AI d1-3B quando a pergunta já existe e é uma das três formas que um modelo de decisão trata: um sim ou não, uma escolha num conjunto nomeado, ou uma classificação numa escala ordenada. As aplicações publicadas são todas tarefas de produção reconhecíveis — triagem e encaminhamento, moderação, classificação de intenção e tópico, verificações de extração, reordenação, barreiras de segurança de agentes e inspeção visual. Os números da demonstração que o fornecedor divulgou a 5 de outubro colocaram o d1 contra o GPT-6.1 Sol e o Claude Opus 5.5 em seis dessas tarefas e afirmam que iguala ou supera o GPT-6.1 Sol em quatro, com um custo 19x a 200x menor; a página de metodologia afirma claramente que cada aplicação foi executada uma vez por modelo, por isso trate a forma da alegação como o resultado, não as casas decimais. A verdadeiramente impressionante é a demonstração de inspeção: triagem entre bons e defeituosos em quatro linhas de produção, com 85 a 97% de precisão numa tarefa para a qual o modelo nunca foi treinado, compreendida a partir de uma breve descrição.
Use o LFM2.5-2.6B-Base quando a pergunta ainda não existe. É o ponto de partida mais barato para um fine-tune que você pretende dominar — um cabeçote de decisão de domínio, um classificador sob medida, uma tarefa para a qual ninguém tem um checkpoint. Você herda a arquitetura, o tokenizer e o contexto longo, e paga em poder de processamento, dados e avaliação. Duas das quatro aplicações que o fornecedor construiu em torno do d1 partiram de projetos de código aberto em vez de começarem do zero, o que é um retrato justo do que um checkpoint base mais disciplina realmente produz.
A armadilha prática é tratar o checkpoint base como um substituto direto. Ele não é um assistente, não seguirá um prompt e, como modelo de chat, obtém pontuação perto de zero — o que não é um fato sobre sua qualidade, mas sim um fato sobre o que “base” significa.
Auto-hospedar qualquer um deles, e a camada acima
Ambos chegam como pesos, e o fornecedor fez o trabalho de implantação para o lado d1: suporte ao llama.cpp desde o primeiro dia, a stack completa da NVIDIA, do DGX até o Jetson, quantização NVFP4, uma variante de pesos e ativações de 8 bits e conversões GGUF no Hugging Face. O checkpoint base tem suas próprias variantes GGUF, ONNX e MLX por meio da família LFM2.5 mais ampla. Se você preferir não hospedar nada, a Liquid disponibiliza o serviço hospedado d1 em sua própria API, com cobrança apenas por tokens de entrada, com imagens cobradas a 1,5 token por patch de 32×32 pixels; o acesso somente a texto também está disponível por meio de plataformas de terceiros.
O que nenhum dos dois caminhos muda é o resto da pilha. Um modelo que você hospeda é um modelo que você precisa manter vivo, versionar e fazer failover — e as decisões que ele alimenta ainda caem ao lado das chamadas generativas que você não hospeda. Essa mistura é a camada que um roteador colapsa: um único endpoint para mais de 200 modelos, preços de lista dos provedores repassados com 0% de markup de modo que uma mudança de preço de um fornecedor fique ativa do seu lado no mesmo dia, e failover automático para que uma tarde ruim de um upstream não se torne a sua indisponibilidade. Hospedar por conta própria um modelo de decisão de 3B ao lado disso torna a questão de roteamento mais nítida, e não mais branda, porque agora você é dono de metade do pipeline e aluga a outra metade.
Qual deles, para quem
Se a pergunta que você precisa responder esta semana é uma das três formas que um modelo de decisão assume, e é uma pergunta que alguém já imaginou, o descendente está pronto e é gratuito e roda em 50 ms em um dispositivo sem GPU — use o Liquid AI d1-3B e pronto.
Se você está construindo a coisa que responde a uma pergunta que ninguém ainda fez, e tem os dados e a capacidade computacional para dominar isso, o LFM2.5-2.6B-Base é o ponto de partida honesto, e vale a pena saber que o descendente neste artigo foi feito a partir dele exatamente pelo caminho que você está prestes a seguir.
E se você não tiver certeza de qual dessas duas situações é a sua, a resposta é quase sempre a primeira. Fazer pós-treinamento em uma cabeça de decisão é a jogada cara; rodar a de outra pessoa é grátis.

Comparados neste artigo1
Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente
