
Liquid AI d1-omni-600M vs LFM2.5-VL-3B: Um Decide, o Outro Descreve
- openaiNOVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligência
- anthropicNOVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligência
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Inteligência
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Inteligência
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Inteligência
- xAIGrok 4.72026-09-2146Inteligência
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 56 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 56 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 346 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
Liquid AI d1-omni-600M e LFM2.5-VL-3B são ambos pequenos, ambos multimodais, ambos publicados pelo mesmo laboratório no Hugging Face sob a mesma licença lfm1.0 — e emparelhá-los é um erro de categoria que acaba se revelando útil. O LFM2.5-VL-3B chegou em 12 de agosto de 2026 como o modelo de visão-linguagem de borda da Liquid AI: 3,1B de parâmetros, uma janela de 32.768 tokens e uma saída que é prosa. Entregue a ele uma página digitalizada e ele retorna a transcrição, com layout, como texto. O Liquid AI d1-omni-600M foi disponibilizado em 7 de outubro de 2026 com o restante da família d1 aberta, e faz o oposto com as mesmas entradas. É um modelo de decisão de 587M de parâmetros: você associa perguntas nomeadas a um estado e ele relata o que já acredita — P(sim), um rótulo escolhido com uma confiança, uma posição em uma escala ordenada de dois a dez — em uma única passagem direta, com zero tokens de saída e nada a jusante para analisar. Se você pesquisou por "o pequeno modelo multimodal da Liquid", agora há duas formas diante de você, e a forma é a decisão.
Esta página é o que os dois model cards, o post de lançamento de 7 de outubro e os próprios repositórios realmente estabelecem. Também é explícita sobre onde eles param. Nada nesta comparação foi reproduzido fora da Liquid AI e, para um dos dois modelos, o fornecedor não publicou, de forma alguma, qualquer benchmark de precisão específico para a sua própria capacidade de destaque.
Os dois checkpoints, lado a lado
As fichas técnicas divergem em quase todos os aspectos, o que é de esperar de dois modelos que nunca foram feitos para competir pelo mesmo lugar.
• O que é — LFM2.5-VL-3B é um modelo generativo de visão-linguagem que escreve texto; Liquid AI d1-omni-600M é um modelo de decisão que retorna respostas estruturadas e não emite tokens
• Parâmetros — 3,1B em BF16 para o LFM2.5-VL-3B versus 587M para o Liquid AI d1-omni-600M, ele próprio um tronco compartilhado e cabeça de decisão de 381M, mais um codificador de visão de 94M e um codificador de áudio de 112M
• Backbone — O LFM2.5-VL-3B combina um modelo de linguagem LFM2.5-2.6B com um codificador de visão SigLIP2 NaFlex de 400M otimizado para formas; o Liquid AI d1-omni-600M é treinado a partir do LFM2.5-Encoder-350M, um codificador bidirecional, com uma torre SigLIP2 retirada do LFM2.5-VL-450M e um FastConformer de 17 camadas para áudio
• Entradas — texto e imagens para LFM2.5-VL-3B; texto mais imagens ou texto mais até 30 segundos de fala para Liquid AI d1-omni-600M, que gera um ValueError se imagens e áudio chegarem na mesma solicitação
• Contexto — 32.768 tokens para LFM2.5-VL-3B versus 16.384 posições combinadas de texto, imagem e áudio para Liquid AI d1-omni-600M, cuja ficha acrescenta que, com imagens presentes, o estado e o texto da pergunta são reduzidos para 896 tokens para corresponder ao treinamento
• Vocabulário — 128.000 tokens para LFM2.5-VL-3B, 65.536 para Liquid AI d1-omni-600M
• Runtime — o LFM2.5-VL-3B roda em transformers e vLLM e tem um modelo draft DSpark separado para decodificação especulativa; o Liquid AI d1-omni-600M vem com código personalizado, exige trust_remote_code=True, e seu card recomenda float16 na GPU, enquanto alerta que bfloat16 alterou a resposta principal em algumas linhas
• Licença — lfm1.0 para ambos, que permite ajuste fino e implantação
Uma linha dessa lista está fazendo mais trabalho do que o resto. O Liquid AI d1-omni-600M é construído sobre um codificador bidirecional, e não sobre um decodificador. Isso não é uma redução de tamanho do LFM2.5-VL-3B; é uma ancestralidade diferente, e é a razão arquitetural pela qual os dois modelos não podem ser trocados um pelo outro, não importa como as tabelas de benchmark sejam lidas.
O contrato de saída decide mais do que os benchmarks.
Faça uma pergunta ao LFM2.5-VL-3B sobre uma imagem e você recebe linguagem de volta. Isso vale dinheiro quando a resposta precisa ser lida por uma pessoa, registrada como string ou alimentar uma etapa que espera prosa. Também é uma responsabilidade que você precisa contornar com engenharia: a saída gerada pode divagar, uma solicitação feita pode voltar com formato diferente do que você pediu, e cada token é cobrado e gera espera. O modelo é explicitamente destinado a trabalho de visão de turno único, de alta taxa de transferência e baixa latência — OCR em lote de documentos digitalizados, detecção em tempo real em um veículo, tradução de sinalização no dispositivo — e explicitamente afastado de perguntas de contexto longo e com muito raciocínio, como "o que há de errado com esta planta baixa?".
O Liquid AI d1-omni-600M responde a uma pergunta estritamente mais restrita num envelope estritamente mais confiável. A sua interface é um estado — texto, JSON, uma ou mais imagens, ou até 30 segundos de fala — além de um conjunto de perguntas nomeadas, cada uma declarando o seu próprio tipo. Uma pergunta noul é uma resposta sim/não e retorna P(sim) entre 0 e 1. Uma pergunta de escolha escolhe um rótulo de um conjunto que você nomeia e retorna o rótulo, uma confiança e a probabilidade de cada opção. Uma pergunta de pontuação coloca o estado numa escala ordenada de dois a dez níveis e retorna o nível esperado com a sua distribuição. Várias perguntas podem estar associadas a um estado e são lidas numa única passagem, pelo que o contador de utilização do cartão do modelo reporta output_tokens: 0. Não existe uma etapa de geração, o que significa que não existe saída que falhe ao ser analisada.
O que você abre mão é de tudo o que uma resposta gerada carrega e um rótulo não: o raciocínio, a hesitação, a frase que você pode colar em um ticket, a capacidade de fazer uma pergunta de acompanhamento na mesma conversa. A Liquid afirma isso claramente — o modelo não é um modelo de chat e não escreve texto. Se seu pipeline precisa de uma explicação ao lado do veredito, o Liquid AI d1-omni-600M é a metade errada do par, e a resposta honesta é executar os dois: o LFM2.5-VL-3B para produzir a leitura da imagem, o Liquid AI d1-omni-600M para produzir a decisão sobre ela.

Não há um número de visão em comparação direta, e esse é o achado.
O próximo movimento instintivo é colocar lado a lado os benchmarks de visão. Você não consegue. No LFM2.5-VL-3B, o fornecedor publica um conjunto completo — RefCOCO Macro Precision@1 em 87,9, ScreenSpot-v2 em 80,7, ChartQA em 81,3, POPE em 88,7, MMStar em 63,3, BLINK em 61,5, MuirBench em 58,3, ToolSandBox em 59,5, OCRBench v2 English em 47,5, e um RealWorldQA de 73,1 que supera por pouco o 71,1 do LFM2-VL-3B anterior. Todos esses são reportados pelo fornecedor, nenhum foi reexecutado de forma independente, e ainda assim são alegações específicas sobre capacidades específicas pelas quais um leitor pode cobrar o laboratório.
Para o Liquid AI d1-omni-600M, o post de lançamento diz que o Decision Index v0.3 inclui um split privado de visão "sobre o qual não relatamos nesta versão", e que, em vez disso, a Liquid validou que o checkpoint de 600M "lida com todas as três modalidades", com as evidências colocadas em demos do playground. Esse é todo o registro publicado de visão. Não há número de benchmark de imagem para esse checkpoint, nem em seu model card nem no post de lançamento. O mesmo post confirma o que falta no lado do áudio de forma ainda mais direta: benchmarks dedicados de decisão para áudio são, nas próprias palavras do fornecedor, "atualmente um problema em aberto".
Portanto, a leitura correta da comparação é assimétrica e deve ser declarada como tal. O LFM2.5-VL-3B demonstrou capacidade visual com números que a respaldam. O Liquid AI d1-omni-600M tem um codificador de visão emprestado de um modelo irmão, um adaptador treinado sobre um backbone congelado, uma demo e uma promessa. Se a sua implantação precisa que o modelo acerte em relação a imagens neste mês, o 3B é o único dos dois com algo em que se apoiar.
Velocidade: apenas uma destas foi medida
Como um modelo de decisão não gera nada, a latência é o número que importa e, mais uma vez, apenas um lado está documentado. O LFM2.5-VL-3B é citado com 228 tokens por segundo em um Apple M5 Max e 116 tokens por segundo em um AMD Ryzen AI Max+ 395, ambos dentro de 3,3 GB de memória, com cerca de 20 tokens por segundo em um Galaxy S26 Ultra e aproximadamente 11.000 tokens por segundo em uma única H100 sob vLLM. Esses números descrevem a taxa de transferência de decodificação, que é a medida correta para um modelo que escreve.
Para o Liquid AI d1-omni-600M, o cartão afirma que os números de inferência não são reportados porque o modelo é um lançamento de pesquisa inicial e está em desenvolvimento ativo. O irmão d1-3B na mesma família tem tabelas de latência — 8 ms para uma pergunta em uma RTX 4090, 16 ms em um Jetson AGX Thor, 26 ms em um Jetson AGX Orin 64 GB, 50 ms em um Orin Nano, com três perguntas em um estado custando cerca de 1,3x o tempo de uma. Esses números pertencem ao modelo de decisão 3B e não devem ser transferidos para o 600M. Para o Liquid AI d1-omni-600M, a posição honesta é que a arquitetura implica um modelo pequeno e rápido e ninguém fora do laboratório publicou um valor em milissegundos.
A pegada de peso pode pelo menos ser estimada. Na precisão float16 que a ficha do modelo recomenda, 587M de parâmetros equivalem a aproximadamente 1,2 GB de pesos antes das ativações — aritmética sobre a contagem publicada de parâmetros, não uma medição do fornecedor — contra os menos de 3,3 GB que a Liquid relata para o LFM2.5-VL-3B. Num dispositivo em que os megabytes são a restrição, essa diferença é o argumento a favor do 600M.

Como escolher entre eles
A escolha se resolve de forma limpa quando o contrato de saída é tratado como fixo, e não como negociável.
Recorra ao LFM2.5-VL-3B quando o resultado a obter for texto: OCR de página inteira com anotação de layout, grounding e deteção a partir de consultas em linguagem natural, tradução de sinalética no dispositivo, qualquer passo em que um humano ou um modelo de linguagem a jusante consuma a resposta. Além disso, tem o contexto mais amplo, de 32 768 tokens, e a cobertura linguística mais profunda na prática, porque as suas respostas são linguagem e não etiquetas.
Recorra ao Liquid AI d1-omni-600M quando o entregável for uma decisão: rotear um tíquete, fazer a triagem de um quadro, moderar um clipe, acionar uma barreira de proteção, pontuar uma resposta em uma escala de dois a dez — e, de modo exclusivo entre esses dois, quando a entrada for fala. É o único do par que aceita áudio, até 30 segundos por requisição, embora seu card observe que o áudio foi treinado em trocas entre um falante de inglês e um assistente, o que é uma descrição restrita do mundo de onde virão suas chamadas.
Não opte por nenhum dos dois e fique com um modelo geral de visão e linguagem se a tarefa exigir raciocínio sobre a imagem, em vez de uma leitura ou um veredito sobre ela. As fichas técnicas de ambos os modelos desaconselham esse caso de uso, e o Liquid AI d1-omni-600M não tem mecanismo para tentar fazê-lo.
Testando um checkpoint experimental sem apostar todo o pipeline nele
O Liquid AI d1-omni-600M é, pelo próprio rótulo do fornecedor, um lançamento de pesquisa em estágio inicial, e seu comportamento de visão e áudio não tem benchmarks. Esse é exatamente o perfil de um modelo que você quer avaliar atrás de um fallback, e não na frente dos clientes. O OrcaRouter roteia mais de 200 modelos por meio de uma única chave de API com failover automático entre provedores, o que é a forma barata de colocar um checkpoint como esse em um caminho ativo: se a rota experimental degradar ou um provedor cair, a requisição vai para o fallback sem nenhuma alteração de código. A mesma chave carrega todos os modelos para os quais o pipeline faz handoff, pelo preço de tabela de cada provedor repassado com 0% de margem, então um corte de preço do fornecedor é o seu preço no mesmo dia.
Uma ressalva, mencionada porque é determinante: os modelos abertos d1 e a família LFM2.5-VL não estão em nosso catálogo hoje. A auto-hospedagem dos pesos é o caminho recomendado pelo fornecedor para ambos, com suporte ao llama.cpp desde o primeiro dia em hardware Apple, AMD, Qualcomm e NVIDIA, e executá-los em um endpoint hospedado significa usar a API própria do fornecedor ou plataformas de terceiros. Interpretar esta página como uma afirmação de disponibilidade seria um erro.

O que assistir
A questão interessante não é se o 600M acaba superando o 3B em alguma coisa — não vai, e não foi construído para isso. É se a Liquid AI publica o split de visão privado que reteve, e se alguém constrói o benchmark de decisão em áudio que o laboratório diz que ainda não existe. Até que um desses aconteça, uma comparação entre o Liquid AI d1-omni-600M e o LFM2.5-VL-3B é uma comparação entre um modelo medido e um modelo plausível. Para trabalho não medido — fala na entrada, veredito na saída, pequeno o bastante para caber no dispositivo — o 600M é o único checkpoint de pesos abertos desta família a tentar isso, e ser o primeiro sem placar ainda é ser o primeiro.
O OrcaRouter roteia mais de 200 modelos por meio de uma única chave de API, com o preço de tabela de cada provedor repassado com 0% de acréscimo assim, um corte de preço do fornecedor é o seu preço no mesmo dia.
