
Liquid AI d1-omni-600M vs Liquid AI d1-3B: Qual Metade da Família d1 Você Realmente Precisa?
- openaiNOVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligência
- anthropicNOVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligência
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Inteligência
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Inteligência
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Inteligência
- xAIGrok 4.72026-09-2146Inteligência
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 56 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 56 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 346 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
Liquid AI d1-omni-600M e Liquid AI d1-3B foram carregados no Hugging Face com oito horas de diferença entre si, em 5 de outubro de 2026, e lançados juntos no mesmo anúncio de 7 de outubro, o que torna a pergunta habitual — qual deles é mais novo, qual deles é melhor — a pergunta errada. Eles são os dois extremos de uma troca deliberada. O Liquid AI d1-3B é o produto final: 3,12B de parâmetros, 48,57 no Decision Index 0.2.1 pontuado pelo fornecedor, tabelas de benchmark, latência medida até em um Jetson Orin Nano, e um lugar descrito no post de lançamento como a maior qualidade de decisão em seu tamanho. O Liquid AI d1-omni-600M é o experimento: 587M de parâmetros, 15,95 no mesmo índice, entrada de áudio que o 3B não tem, e um model card que afirma categoricamente que é um lançamento de pesquisa em estágio inicial, sem números de inferência porque ainda está em desenvolvimento ativo. Escolher entre eles não é uma decisão de qualidade. É uma decisão sobre se você precisa das modalidades extras na parte inferior da família ou da acurácia extra no topo, e os números reforçam essa divisão em vez de obscurecê-la.
Tudo o que segue vem dos dois cards de modelo e do post de lançamento de 7 de outubro, respeitando a rotulagem do próprio post de lançamento: as linhas d1 no Decision Index foram pontuadas pela Liquid AI com o sistema oficial de pontuação, em vez de submetidas ao leaderboard público, e nada aqui foi reproduzido de forma independente.
Duas espinhas dorsais que nunca iriam convergir
A família d1 não reduziu uma única receita. Os dois checkpoints partem de extremos opostos do catálogo de modelos da Liquid e se encontram no meio.
Liquid AI d1-3B é construído sobre o LFM2.5-VL-3B, o modelo de visão-linguagem somente decodificador do fornecedor, de agosto de 2026. Sua base foi criada pela média dos pesos do LFM2.5-2.6B com o backbone de texto do LFM2.5-VL-3B e, em seguida, pelo ajuste fino de checkpoints sob diferentes sementes aleatórias e misturas de dados, antes de mesclá-los novamente. Ele traz um codificador de visão SigLIP2 NaFlex de 400M otimizado para formato, um contexto de 32.768 tokens, um vocabulário de 128.000 tokens e dezesseis idiomas documentados.
Liquid AI d1-omni-600M vem da outra direção. Seu tronco é o LFM2.5-Encoder-350M, um codificador bidirecional, ajustado primeiro em tarefas de decisão e depois estendido em etapas — um codificador FastConformer de 17 camadas mais adaptador para áudio, com o codificador de áudio posteriormente ajustado em relação a um backbone de texto congelado, depois uma torre SigLIP2 extraída do LFM2.5-VL-450M com um adaptador e atualizações LoRA no backbone para visão. O modelo final foi mesclado a partir das atualizações LoRA e teve a média calculada com o checkpoint anterior. Ele termina com 587M parâmetros no total: um tronco compartilhado e cabeça de decisão de 381M, um codificador de visão de 94M e um codificador de áudio de 112M.
Decoder-only versus bidirecional é a parte a reter. O 3B lê um estado e produz uma decisão como um modelo de linguagem produz uma sequência de tokens, uma direção de cada vez. O 600M lê todo o estado de uma só vez e decide, que é o que se esperaria de um codificador que nunca foi concebido para gerar. Ambos são treinados para reportar respostas a partir da distribuição do modelo com zero tokens de saída, mas a maquinaria subjacente não é da mesma classe de modelo, e a diferença de precisão abaixo é o custo visível do design menor, em forma de codificador.
O spread do Decision Index é grande, e as subpontuações são mais interessantes do que o total.
No Decision Index 0.2.1, a Liquid reporta 48,57 para o Liquid AI d1-3B e 15,95 para o Liquid AI d1-omni-600M, contra 50,02 para o Winnow-12B. São 32 pontos de diferença entre dois checkpoints lançados no mesmo dia pelo mesmo laboratório, e a leitura das cinco subpontuações explica de onde ela vem.
• Conhecimento — 23,8 para o Liquid AI d1-3B contra 8,3 para o Liquid AI d1-omni-600M
• Idioma — 56,4 contra 12,9
• Recuperação — 52.8 contra 35.0
• Ferramentas — 74,5 contra 15,1
• Artes — 36,3 contra 6,8
A recuperação é o único ponto em que o modelo pequeno se mantém firme, perdendo menos de um terço da pontuação do 3B, ao passo que nas outras quatro categorias perde de 60 a 80 por cento. Esse padrão é consistente com o que o 600M é: um codificador treinado com capacidade representacional real para fazer corresponder um estado a um conteúdo, e com muito menos da capacidade em camadas que o 3B herda de um descodificador que foi pré-treinado com muito mais linguagem. Se a sua carga de trabalho for uma decisão em forma de recuperação — este trecho responde a esta pergunta, qual destes documentos é relevante —, o perfil do 600M é menos mau do que o seu total sugere. Se a sua carga de trabalho for uma decisão de encaminhamento de ferramentas, a diferença de 51 pontos nessa coluna é o número em que deve fixar-se.
A tabela de benchmarks de texto conta uma história mais amena do que o índice, o que vale a pena saber antes que qualquer um dos números seja usado para defender uma tese. Em sete benchmarks públicos, o 3B lidera com média de 82,9 e o 600M alcança 78,4. O 600M na verdade perde por pouco em SQuAD 2.0 (74,0 a 85,3), PubMedQA (61,3 a 66,0), BoolQ (77,7 a 86,7) e XNLI (74,7 a 85,0), mas vence em detecção de toxicidade do Civil Comments (95,8 a 93,0) e em identificação de paráfrase do PAWS-X (79,5 a 76,9). A própria formulação da Liquid é que o 600M supera a média de 77,1 do Decider 2B com um quarto dos parâmetros. Duas suítes de benchmarks, dois veredictos aparentes diferentes, ambos relatados pelo fornecedor — é isso que as evidências sustentam, e nada mais.

O que o 600M tem que o 3B não tem
A razão para tolerar uma lacuna de 32 pontos no índice é que o Liquid AI d1-omni-600M faz uma coisa que o Liquid AI d1-3B não consegue, e não se trata de uma diferença de fidelidade.
• Áudio — Liquid AI d1-omni-600M aceita até 30 segundos de fala por requisição por meio de seu codificador FastConformer; Liquid AI d1-3B não aceita nenhum
• Mistura de modalidades — o 600M aceita texto com imagens ou texto com áudio, e lança um ValueError se ambos chegarem juntos; o 3B aceita texto e imagens
Janela de contexto — 16.384 tokens em posições de texto, imagem e áudio para o 600M, com o texto reduzido para 896 tokens quando há imagens; 32.768 tokens para o 3B
• Vocabulário — 65.536 para o 600M, 128.000 para o 3B
• Precisão — o cartão do modelo de 600M recomenda float16 na GPU e alerta que bfloat16 alterou a principal resposta em algumas linhas; o de 3B vem com 15 quantizações, incluindo uma build w8a8
• Idiomas — o 600M lista 16 idiomas, um conjunto diferente dos 16 do 3B, e seu áudio é descrito como treinado em interações entre um falante de inglês e um assistente, o que é uma pequena parcela do que um feed de áudio de produção contém
A nota sobre treino de áudio é fácil de ignorar e não deveria ser. Um modelo treinado em interações locutor-assistente em inglês viu uma única geometria de locutor, uma única estrutura de turnos e uma única distribuição de sotaques. Implantá-lo em áudio de call center ou gravações de campo é esperar um comportamento que o cartão não reivindica, e o post de lançamento é franco ao afirmar que não existe nenhum benchmark de decisão em áudio para o verificar — a Liquid chama a isso "atualmente um problema em aberto" e convida a comunidade a construir um.

Latência: um irmão tem as tabelas, o outro tem uma nota de rodapé.
Para modelos de decisão, o número interessante é a latência ponta a ponta, porque não há decodificação para cronometrar. A Liquid publica um conjunto completo para o 3B e nenhum para o 600M.
• Uma pergunta — 8 ms em uma RTX 4090, 9 ms em um MI325X, 16 ms em um Jetson AGX Thor, 26 ms em um Jetson AGX Orin 64 GB, 50 ms em um Orin Nano, 30 ms em um Apple M5 Pro
• Três perguntas sobre um único estado — 21 ms na RTX 4090 e 20 ms na AGX Thor, aproximadamente 1,3x o custo de uma única pergunta em vez de 3x
• Um estado de 3,4K tokens — 102 ms na 4090, 220 ms no Thor, 1.640 ms no Orin Nano
• Vazão empacotada — 475 decisões por segundo na RTX 4090, 1.106 por segundo na MI325X
• Uma imagem de 384px — 17 ms na 4090, 18 ms no MI325X
Esses números descrevem apenas o Liquid AI d1-3B. Para o Liquid AI d1-omni-600M, a ficha do modelo afirma que números de inferência não são reportados porque o modelo é um lançamento de pesquisa inicial em desenvolvimento ativo. Não é que o modelo pequeno seja mais lento — o oposto é quase certo, já que um quinto dos parâmetros não o torna mais lento na mesma precisão — é que não existe número algum, e citar os milissegundos do 3B para o 600M seria uma fabricação com aparência plausível. O que se pode dizer sem inventar nada é que, na precisão float16 que a ficha recomenda, 587M de parâmetros está na ordem de 1,2 GB de pesos antes das ativações, o que é aritmética sobre uma contagem de parâmetros publicada, e não uma medição.
A cascata é a verdadeira resposta para a maioria das cargas de trabalho
Como os dois checkpoints foram lançados juntos e retornam o mesmo tipo de objeto — uma probabilidade, um rótulo com uma confiança, ou uma pontuação ordenada — eles se compõem de um modo que dois modelos arbitrários não. O 600M pode fazer a triagem e o 3B pode adjudicar. Pontue os itens recebidos com o Liquid AI d1-omni-600M e escale para o Liquid AI d1-3B os que ele posicionar perto do meio da sua escala, para uma avaliação mais precisa. As regras de escalonamento são a confiança e a distribuição que o 600M já retorna, de modo que a lógica de roteamento não precisa de nenhum modelo extra. Em uma carga de trabalho com forte maioria de itens fáceis, a maior parte do tráfego nunca chega ao 3B e a maior parte do dinheiro nunca é gasta.
Esse padrão também é o motivo pelo qual vale a pena executar os dois modelos atrás de um roteador. Por meio do OrcaRouter, ambos ficariam atrás de uma única chave de API a o preço de tabela de cada provedor repassado com 0% de margem, de modo que a cascata é uma regra de roteamento em vez de uma segunda integração, e um escalonamento que falha na camada do provedor é repetido em um fallback em vez de fazer a requisição falhar. O failover automático importa mais aqui do que importa para um modelo consolidado, porque metade desse par é um checkpoint cujo comportamento o próprio fornecedor descreve como em desenvolvimento ativo.
Nada disso é uma afirmação de disponibilidade, e vale a pena deixar a distinção clara: os checkpoints abertos do d1 não estão em nosso catálogo. A rota do fornecedor é baixar os pesos e executá-los localmente — o suporte ao llama.cpp chegou no primeiro dia em hardware Apple, AMD, Qualcomm e NVIDIA — ou acessá-los por meio da própria API do fornecedor e de plataformas de terceiros.
Escolhendo, em uma única passagem
Se você precisa de texto e imagens, e a resposta tem que estar certa, escolha o Liquid AI d1-3B. Ele tem os benchmarks, as tabelas de latência, o contexto mais amplo, o vocabulário maior e as quantizações, e é o membro do par que a Liquid posiciona como líder de qualidade em seu tamanho.
Se você precisa de fala no caminho de decisão, use o Liquid AI d1-omni-600M, porque é a única opção de pesos abertos dessa família que aceita áudio, e aceite que você está adotando-o por intuição e com base em uma demo até que alguém publique um benchmark de decisão com áudio ou a divisão de visão retida.
Se você ainda não sabe qual desses descreve sua carga de trabalho, comece com o 3B e instrumente a confiança que ele retorna. As subpontuações são o indicador: uma tarefa que está nas colunas Tools ou Language será mal atendida pelo 600M, enquanto algo em formato de recuperação é o único ponto em que o checkpoint pequeno fica mais próximo do que seu total sugere. A família existe para que você possa trocar precisão por pegada, e a troca só é segura se você souber qual coluna sua tarefa ocupa.

Por meio do OrcaRouter, ambos os modelos ficam atrás de uma única chave de API com uma regra de roteamento em vez de uma segunda integração, e um escalonamento que falha na camada do provedor é tentado novamente em um fallback em vez de fazer a requisição falhar.
