
Liquid AI d1-3B vs Gemma 4 12B: Um Modelo de Decisão Contra um Generalista
- openaiNOVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligência
- anthropicNOVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligência
- typesafeNOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Inteligência
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Inteligência
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Inteligência
- xAIGrok 4.72026-09-2146Inteligência
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 62 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 358 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
A forma mais rápida de errar esta comparação é colocar o Liquid AI d1-3B e o Gemma 4 12B no mesmo benchmark e esperar por um vencedor. Eles não respondem à mesma pergunta. O Liquid AI d1-3B é um modelo de decisão de 3,12B publicado como pesos abertos em 7 de outubro de 2026: você fornece a ele um estado e um conjunto de perguntas nomeadas e ele retorna probabilidades, um rótulo escolhido e uma confiança, com zero tokens de saída e nenhuma etapa de geração. O Gemma 4 12B é o generalista any-to-any sem encoder do Google, um checkpoint de 11,96B que recebe texto, imagem, áudio e vídeo e escreve uma resposta em uma janela de 256.000 tokens em mais de 140 idiomas. Um deles diz qual de quatro coisas uma placa de circuito é. O outro diz por quê. Compare-os apenas pela qualidade e você não aprende nada, porque as saídas não são comensuráveis — e os fornecedores nunca os compararam entre si em benchmarks. Compare-os pelo que uma chamada realmente retorna, quanto custa e onde cada um chega ao seu limite, e o par se torna um teste de fronteira genuinamente útil.
Dois contratos de saída diferentes
A distinção que faz todo o trabalho aqui é o que volta pelo fio.
Liquid AI d1-3B retorna um objeto de resposta estruturado. Cada pergunta em uma requisição declara um tipo — noul para sim/não com P(sim), choice para uma de um conjunto de opções nomeado com uma confiança e uma probabilidade por opção, ou score para uma posição em uma escala ordenada de dois a dez níveis com o nível esperado e sua distribuição. O modelo relata output_tokens: 0 porque nada é escrito. Várias perguntas sobre um estado são lidas em uma única passagem direta, e o estado e suas imagens são codificados uma vez para todas elas.
Gemma 4 12B retorna prosa. Às vezes, retorna o JSON que você pediu; às vezes, retorna um JSON que você não pediu exatamente, e consegue raciocinar antes de responder. É, antes de tudo, um modelo de linguagem: tudo o que sabe classificar, ele expressa como texto. Isso é uma vantagem quando a resposta precisa ser explicada a um humano ou alimentar uma etapa posterior que espera linguagem, e um custo quando a única coisa de que você precisava era uma probabilidade.
Tudo o que vem a jusante decorre disso. Uma resposta do d1-3B não pode falhar no parsing. Também não consegue explicar-se a si mesma, e o cartão do modelo diz isso diretamente: não é um modelo de chat e não escreve texto.
Onde estão as trilhas de evidências
A proveniência dos dois conjuntos de números não é equivalente, e isso importa mais aqui do que os próprios números.
• Decision Index 0.2.1 — Liquid AI d1-3B obtém 48,57, pontuado pelo fornecedor com o avaliador oficial, o primeiro entre os modelos com menos de 10B e à frente do Decider 35B-A3B, com 47,11. O Gemma 4 12B não é pontuado no Decision Index de forma alguma, por isso esta linha não tem correspondente.
• Benchmarks de raciocínio — Gemma 4 12B registra 77,5 no AIME 2026, 78,8 no GPQA Diamond e 1.659 de ELO no Codeforces, e carrega um Artificial Analysis Intelligence Index de 22 no modo de raciocínio e 13 com o raciocínio desativado. O Liquid AI d1-3B não tem benchmark de raciocínio, porque um modelo de decisão não produz um traço de raciocínio para ser pontuado.
• Contexto longo — o Gemma 4 12B aceita 256.000 tokens e obtém 43,4% no MRCR v2 eight-needle em 128k no próprio cartão do Google. O Liquid AI d1-3B aceita 32.768 tokens. Se o seu "estado" for um documento de quarenta páginas mais digitalizações, essa diferença é a decisão toda e não é nem de perto.
• Visão — o Liquid AI d1-3B tem média de 74,1 em onze benchmarks públicos de imagem lidos como decisões sobre o conjunto de opções de cada benchmark, contra 73,9 do backbone LFM2.5-VL-3B a partir do qual foi construído, e o fornecedor relata que remover as imagens faz as mesmas perguntas caírem para 45,1. A visão do Gemma 4 12B é mais forte e mais ampla, mas é relatada como qualidade de geração, não como precisão de decisão sobre opções nomeadas.
• Idiomas — dezesseis documentados para o Liquid AI d1-3B; mais de 140 para o Gemma 4 12B.
• Velocidade — O Liquid AI d1-3B responde a uma pergunta em 8 ms numa RTX 4090, 16 ms num Jetson AGX Thor, 26 ms num Jetson AGX Orin 64 GB e 50 ms num Jetson Orin Nano, e empacota 64 estados numa única passagem a 475 por segundo na 4090. O Gemma 4 12B gera, portanto a sua latência é uma função de quantos tokens ele escreve.
• Qualidade das evidências — os resultados do Gemma 4 12B são do Google, publicados em junho de 2026 e, desde então, mexidos, quantizados e reexecutados por uma grande comunidade. Os do Liquid AI d1-3B são da Liquid, publicados há dois dias, reproduzidos por ninguém fora do laboratório. Leia a segunda coluna com isso em mente.

O único lugar onde eles realmente competem
Existe uma sobreposição real, e ela não está num placar. É a avaliação LLM-as-a-judge.
Muitos pipelines de produção já usam um generalista de médio porte como camada de avaliação: pontuar a urgência deste ticket, decidir se esta saída passa em uma rubrica, escolher qual ferramenta o agente deve chamar em seguida, verificar se uma passagem recuperada responde à pergunta. Hoje, a maioria dessas chamadas vai para um modelo generativo que é solicitado a emitir um número ou um rótulo como texto, e o número que ele emite é o que o amostrador produziu, em vez de um softmax sobre o seu conjunto de opções. Esse é o fluxo de trabalho que o Liquid AI d1-3B foi pós-treinado para substituir, e as demos publicadas são todas versões disso — um predicado SQL que responde sim ou não para 150 tickets de suporte, um loop de compactação de contexto do agente que mantém, apara ou descarta cada saída de ferramenta e remove 52% dos tokens, um aplicativo de inspeção visual que classificou peças boas e defeituosas de quatro linhas de produção com 85 a 97% de precisão em uma tarefa para a qual nunca foi treinado.
Gemma 4 12B realiza todos esses trabalhos, e faz mais do que esses trabalhos. Ele também pode escrever o resumo, manter um documento de 256K em visualização, receber uma chamada telefônica gravada como entrada e responder em um dos mais de 140 idiomas. Se o seu pipeline precisa de uma avaliação e uma narração, o 12B está fazendo dois trabalhos com uma chamada e o modelo de decisão 3B está fazendo um deles.
A fronteira é o comprimento do contexto e o formato da saída. Estado longo, entrada falada, muitos idiomas, ou uma explicação que o leitor espera — Gemma 4 12B, sem competição. Estado curto, um conjunto fixo de opções, um orçamento de latência por requisição em milissegundos de um único dígito, ou uma garantia absoluta de que a resposta será parseável — essa é a coluna do d1-3B, e o generalista está pagando por capacidade que você não vai usar.
Quanto custa ligar para cada um
Nenhum dos modelos está no nosso catálogo, portanto não há preço de roteamento a cotar para nenhum dos dois — o Gemma 4 12B não está entre os tamanhos de Gemma que atendemos, e o Liquid AI d1-3B é de pesos abertos que você mesmo hospeda ou acessa pela própria API do fornecedor e por plataformas de terceiros. Para dar contexto sobre o lado adjacente ao Gemini dessa família, os dois tamanhos de Gemma 4 que roteamos estão listados a US$ 0,06 por milhão de tokens de entrada e US$ 0,33 por milhão de tokens de saída para o Gemma 4 26B A4B, e US$ 0,13 e US$ 0,38 para o Gemma 4 31B, ambos com contextos de 262.144 tokens e entrada de texto, imagem e vídeo. O preço mediano de fornecedores cotado para o Gemma 4 12B em outros lugares fica em torno de US$ 0,10 e US$ 0,30.
O serviço hospedado da Liquidd1, cobra apenas tokens de entrada, a US$ 0,04 por milhão, com imagens contadas como entrada a 1,5 tokens por patch de 32×32 pixels. Uma requisição de decisão, portanto, não tem nenhuma linha de tokens de saída, o que é a razão estrutural pela qual a própria comparação de custos do fornecedor com modelos muito maiores termina onde termina. Os pesos abertos não têm preço por chamada; você paga em hardware. Ambos precisam ficar no mesmo pipeline que tudo o mais que você chama, que é a camada para a qual um roteador foi projetado — uma API para mais de 200 modelos, preços de lista dos provedores repassados com 0% de markup, e failover automático para que uma única oscilação no upstream não se torne sua indisponibilidade. Essa é a infraestrutura em torno da comparação, não a comparação.

Como decidir, honestamente
Comece pelo formato da resposta, e não pelo modelo. Se o sistema downstream puder consumir uma probabilidade, um rótulo e uma confiança, e o conjunto de respostas for pequeno e conhecido, o Liquid AI d1-3B não é um downgrade de um 12B — é um instrumento diferente, e os números de latência o tornam uma implantação categoricamente diferente: 50 ms em um Jetson Orin Nano é um dispositivo que não tem por que executar um 12B.
Se a resposta tiver de ser uma frase, ou o estado tiver mais de trinta e dois mil tokens, ou alguém for falar isso, ou o idioma de saída for bengali, então Gemma 4 12B é o único dos dois capaz de fazer o trabalho, e a comparação termina antes mesmo de começar.
O posicionamento genuinamente útil para a maioria das equipes é ambos, em lugares diferentes. Um modelo de decisão à frente da chamada cara, fazendo a triagem, o roteamento e as barreiras de proteção que não precisam de linguagem; um generalista atrás dele para o trabalho que precisa. Esses são o mesmo pipeline, um é um filtro e o outro é a carga útil — e as equipes que mais aproveitarão o lançamento d1 são aquelas que já estão pagando um 12B para responder sim ou não.

