
Liquid AI d1-3B e d1-omni-600M: Pesos abertos para modelos que nunca escrevem uma palavra
- openaiNOVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligência
- anthropicNOVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligência
- typesafeNOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Inteligência
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Inteligência
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Inteligência
- xAIGrok 4.72026-09-2146Inteligência
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 62 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 358 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
O Liquid AI d1-3B e o Liquid AI d1-omni-600M foram publicados no Hugging Face em 7 de outubro de 2026, e os dois checkpoints têm uma propriedade que faz toda tabela de comparação que você leu este ano ter o formato errado. Nenhum dos dois gera texto. Você entrega ao Liquid AI d1-3B um estado — um ticket de suporte, um payload JSON, uma fotografia, ou os três ao mesmo tempo — e um conjunto de perguntas nomeadas, e ele retorna respostas extraídas diretamente da distribuição do modelo sobre as suas opções. Sim/não como uma probabilidade. Uma escolha entre rótulos com uma confiança e um vetor de probabilidade completo. Uma posição em uma escala ordenada. Não há etapa de amostragem, nenhum JSON para analisar, nenhuma geração descontrolada, e o próprio contador de uso do fornecedor relata a coisa de forma clara: output_tokens: 0. O modelo 3B é o destaque — ele registra 48,57 no Decision Index 0.2.1 avaliado pelo fornecedor, à frente de tudo abaixo de 10B e à frente de um modelo de decisão doze vezes maior. O irmão de 600M é o que vale a pena acompanhar: ele lê imagens e até trinta segundos de fala através dos mesmos pesos do tronco, e está rotulado como um lançamento de pesquisa inicial.
O que é um modelo de decisão, em um parágrafo
A categoria vem se formando há um ano sob nomes como modelos de sistema um e classificadores-que-não-são-classificadores, e o par d1 é a declaração mais limpa dela até agora. Faz-se uma pergunta a um modelo generativo e ele escreve uma resposta; a resposta precisa ser interpretada, a interpretação pode falhar, e cada token que ele escreve custa dinheiro e tempo. Faz-se uma pergunta a um modelo de decisão e ele informa o que já acredita. As perguntas do Liquid vêm em três tipos. noul é uma pergunta de sim/não, respondida com P(sim) entre 0 e 1. choice escolhe um rótulo de um conjunto nomeado e retorna o rótulo, uma confiança e a probabilidade de cada opção. score posiciona o estado em uma escala ordenada de dois a dez níveis e retorna o nível esperado com sua distribuição e legenda. Um estado pode carregar várias perguntas ao mesmo tempo, e o estado e suas imagens são lidos uma única vez para todas elas.
Essa última propriedade é o caso de negócio inteiro. Três perguntas sobre um único ticket custam 1,3x o tempo de uma pergunta, e não 3x, porque o modelo faz uma única passagem direta sobre a entrada e extrai várias respostas dela. Não há nada a escrever, então não há nada a escrever mal.
O 3B e o 600M são construídos a partir de direções opostas
É aqui que o lançamento se torna tecnicamente interessante, e é a parte que a cobertura do anúncio em grande parte deixou de lado. Os dois modelos não compartilham uma linhagem.
Liquid AI d1-3B deriva do LFM2.5-VL-3B, o modelo de visão-linguagem apenas decodificador do fornecedor. Ele traz 3,12 bilhões de parâmetros, um codificador de visão SigLIP2 NaFlex de 400M otimizado para formato, uma janela de contexto de 32.768 tokens, um vocabulário de 128.000 tokens e dezesseis idiomas documentados. Para construí-lo, a Liquid calculou a média dos pesos do LFM2.5-2.6B e do backbone de texto do LFM2.5-VL-3B, ajustou checkpoints de várias sementes aleatórias e misturas de dados e, em seguida, mesclou os resultados novamente. O resumo do próprio fornecedor sobre o que importou é refrescantemente sem glamour: treinar com entradas longas, embaralhar a ordem das opções de resposta e caçar atalhos nos dados de treinamento fizeram mais pelo número final do que qualquer técnica avançada.
Liquid AI d1-omni-600M descende do LFM2.5-Encoder-350M, um codificador bidirecional — uma espécie de rede completamente diferente. Totaliza 587M parâmetros divididos em um tronco compartilhado de 381M e cabeça de decisão, um codificador de visão de 94M emprestado do LFM2.5-VL-450M, e um codificador de áudio de 112M construído a partir de um FastConformer de 17 camadas. Cada modalidade passa pelos mesmos pesos do tronco. Seu contexto é de 16.384 tokens cobrindo posições de texto, imagem e áudio juntas, e com imagens anexadas o texto de estado e pergunta é cortado para 896 tokens porque foi para isso que foi treinado. O áudio recebe um aviso que o cartão declara sem rodeios: a capacidade foi treinada em solicitações entre um falante de inglês e um assistente, e os clipes são cortados em trinta segundos.
Então a família não é uma só em dois tamanhos. É um decodificador e um codificador, pós-treinados para fazer o mesmo trabalho com dois mecanismos completamente diferentes, um dos quais vê e o outro ouve.

Os números, e a quem pertencem
Todos os números desta seção são da própria Liquid. As linhas do Decision Index para os modelos d1 foram pontuadas pelo fornecedor usando o avaliador oficial — não foram submetidas ao leaderboard —, enquanto cada linha concorrente vem do leaderboard público na v0.2.1. Nenhum laboratório independente reproduziu qualquer parte disso até agora, e os modelos têm dois dias de vida no momento em que isto é escrito.
• Decision Index 0.2.1 — Liquid AI d1-3B obtém 48,57, com subpontuações de Conhecimento 23,8, Linguagem 56,4, Recuperação 52,8, Ferramentas 74,5 e Artes 36,3. Liquid AI d1-omni-600M obtém 15,95, com Ferramentas em 15,1.
• Onde 48,57 se posiciona — em primeiro entre tudo abaixo de 10B na tabela publicada pelo fornecedor, e à frente do Decider 35B-A3B, com 47,11. No geral, é o segundo, atrás do Winnow-12B, com 50,02, que é quatro vezes maior.
• Benchmarks de texto, reportados pelos fornecedores — o d1-3B tem média de 82,9 em sete benchmarks públicos, à frente do Decider 4B, com 81,1; o d1-omni-600M tem média de 78,4, o que supera o Decider 2B, com 77,1, com aproximadamente um quarto da contagem de parâmetros. O 600M apresenta a melhor pontuação de toxicidade da tabela (Civil Comments 95,8) e sua melhor pontuação de paráfrase (PAWS-X 79,5).
• Visão, segundo o fornecedor — o d1-3B tem média de 74,1 em onze benchmarks públicos de imagens, lidos como decisões sobre as opções de cada benchmark, contra 73,9 de seu backbone LFM2.5-VL-3B. Remover as imagens faz as mesmas perguntas caírem para 45,1, que é como o fornecedor mostra que as respostas vêm dos pixels.
• Latência, medida pelo fabricante — uma pergunta leva 8 ms em uma RTX 4090 e 9 ms em uma AMD MI325X; 16 ms em um Jetson AGX Thor, 26 ms em um Jetson AGX Orin 64 GB, 50 ms no menor Jetson Orin Nano, e 30 ms em um Apple M5 Pro. Sessenta e quatro estados empacotados em uma única passagem executam a 475 por segundo na 4090.
• O que está faltando — o d1-omni-600M não tem nenhuma tabela de inferência. A Liquid diz que ele está em desenvolvimento ativo e simplesmente não informa a latência para ele. Também não há nenhum benchmark de decisão de áudio em nenhum lugar do lançamento, porque, nas palavras do fornecedor, benchmarks dedicados de decisão de áudio são atualmente um problema em aberto.
A alegação que o comunicado está realmente fazendo
Dois dias antes de os pesos serem disponibilizados, a Liquid publicou a versão hospedada deste modelo e o comparou com o GPT-6.1 Sol e o Claude Opus 5.5 em seis aplicações. O resumo: o d1 iguala ou supera o GPT-6.1 Sol em quatro das seis, custa de 19x a 200x menos e responde mais rápido em todas as tarefas. Vale a pena ler a metodologia publicada antes de repetir qualquer um desses pontos — cada aplicação foi executada uma vez por modelo em 5 de outubro de 2026, os modelos de chat responderam em JSON na configuração de raciocínio padrão, e o custo do d1 foi calculado a US$ 0,04 por milhão de tokens de entrada.
As demonstrações são a metade mais persuasiva. Separar peças boas e defeituosas de quatro linhas de produção — placas de circuito, velas, castanhas de caju, chicletes — com 85 a 97% de precisão, em um modelo que nunca foi treinado para a tarefa e a compreendeu a partir de uma breve descrição. Um predicado SQL que responde sim ou não para cada um dos 150 chamados de suporte. Um loop de compactação de contexto que lê cada saída de ferramenta na sessão de um agente de codificação e a mantém, apara ou descarta, removendo 52% dos tokens enquanto preserva todas as saídas de que a tarefa precisa. No Tetris, adicionar a tela a um jogo totalmente descritível por texto elevou a pontuação de 70 linhas completadas para 81 — um resultado de visão que você não consegue obter de um classificador apenas de texto, por melhor que ele seja.
Essas são demonstrações realizadas pelos próprios fornecedores, com tarefas escolhidas por eles, e a seção de metodologia diz isso. Ainda assim, continuam sendo o retrato mais claro que alguém já publicou sobre para que serve um modelo de decisão.

Onde é executado e quanto custa chamar
Os pesos abertos são feitos para execução local e o fornecedor fez o trabalho de integração desde o início: suporte desde o primeiro dia para llama.cpp, toda a stack NVIDIA, do DGX ao Jetson, quantização NVFP4 e uma variante de pesos/ativações de 8 bits publicada junto com o checkpoint base. As conversões GGUF já estão no Hugging Face. Se você preferir não hospedar nada, a Liquid disponibiliza o d1 hospedado em sua própria API — apenas tokens de entrada, sem tokens de saída, com imagens cobradas como entrada a 1,5 tokens por patch de 32×32 pixels, o que faz uma imagem de 1024×1024 corresponder a 1.536 tokens. O acesso somente texto também está disponível por meio de plataformas de terceiros.
A nota honesta de roteamento: nem o Liquid AI d1-3B nem o Liquid AI d1-omni-600M está no nosso catálogo, e este artigo não é uma afirmação de disponibilidade para nenhum dos dois. O que o par d1 muda para um roteador é o formato do pipeline ao redor dele. Um modelo de decisão que responde em milissegundos e não custa nada em tokens de saída é um filtro, não um substituto — a separação entre bons e defeituosos e a triagem de tickets acontecem antes da chamada generativa, e a chamada generativa é onde um único endpoint para mais de 200 modelos, preços de tabela repassados com 0% de markup, e failover automático realmente valem a pena. Camada diferente, mesmo pipeline.
O que resolveria a discussão
Três coisas estão sem solução, e todas as três são do tipo que só o tempo encerra.
A primeira é a reprodução independente. Os números do Decision Index foram produzidos pelo fornecedor com o scorer oficial, e cada linha de concorrente foi extraída de um leaderboard público, o que é um método defensável e não é a mesma coisa que um terceiro executar o seu modelo. A segunda é o áudio. Um checkpoint de 600M que encaminha um comando de voz em um único forward pass é uma capacidade genuinamente nova, e não existe nenhum benchmark que meça se ele está fazendo isso bem. A terceira é a própria categoria: quando a resposta é lida de uma distribuição em vez de ser escrita, os modos de falha habituais de um modelo pequeno — entrar em loop, desviar-se, recusar-se, alucinar um formato — simplesmente não podem ocorrer, e ninguém publicou um bom relato do que os substitui. O erro de calibração é o candidato óbvio, e é exatamente o que o campo de confiança em cada resposta convida você a medir por conta própria.
Dez demos executam o Liquid AI d1-3B em loop sobre a entrada de câmera ao vivo em um espaço público do Hugging Face, que é a maneira mais barata de formar sua própria opinião. Os pesos são gratuitos e as perguntas são específicas. Essa é uma posição de partida melhor do que a maioria dos lançamentos deste ano oferece.

Comparados neste artigo1
Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente
