Um cartão de título de destaque intitulado 'Liquid AI d1-3B vs Gemma 4 12B' com o subtítulo 'um modelo de decisão contra um generalista', mostrando um pequeno cartão de lista de verificação de 3,12B com um chip de probabilidade ao lado de um cartão maior de 11,96B que traz ícones de documento, forma de onda e quadro de filme, e um chip de resposta escrita.
Guides & Insights

Liquid AI d1-3B vs Gemma 4 12B: Um Modelo de Decisão Contra um Generalista

Autor

Magnus Corvin

Data de publicação

Modelos mais recentes · 20Ver todos os modelos →
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

A forma mais rápida de errar esta comparação é colocar o Liquid AI d1-3B e o Gemma 4 12B no mesmo benchmark e esperar por um vencedor. Eles não respondem à mesma pergunta. O Liquid AI d1-3B é um modelo de decisão de 3,12B publicado como pesos abertos em 7 de outubro de 2026: você fornece a ele um estado e um conjunto de perguntas nomeadas e ele retorna probabilidades, um rótulo escolhido e uma confiança, com zero tokens de saída e nenhuma etapa de geração. O Gemma 4 12B é o generalista any-to-any sem encoder do Google, um checkpoint de 11,96B que recebe texto, imagem, áudio e vídeo e escreve uma resposta em uma janela de 256.000 tokens em mais de 140 idiomas. Um deles diz qual de quatro coisas uma placa de circuito é. O outro diz por quê. Compare-os apenas pela qualidade e você não aprende nada, porque as saídas não são comensuráveis — e os fornecedores nunca os compararam entre si em benchmarks. Compare-os pelo que uma chamada realmente retorna, quanto custa e onde cada um chega ao seu limite, e o par se torna um teste de fronteira genuinamente útil.

Dois contratos de saída diferentes

A distinção que faz todo o trabalho aqui é o que volta pelo fio.

Liquid AI d1-3B retorna um objeto de resposta estruturado. Cada pergunta em uma requisição declara um tipo — noul para sim/não com P(sim), choice para uma de um conjunto de opções nomeado com uma confiança e uma probabilidade por opção, ou score para uma posição em uma escala ordenada de dois a dez níveis com o nível esperado e sua distribuição. O modelo relata output_tokens: 0 porque nada é escrito. Várias perguntas sobre um estado são lidas em uma única passagem direta, e o estado e suas imagens são codificados uma vez para todas elas.

Ge​mma 4 12B retorna prosa. Às vezes, retorna o JSON que você pediu; às vezes, retorna um JSON que você não pediu exatamente, e consegue raciocinar antes de responder. É, antes de tudo, um modelo de linguagem: tudo o que sabe classificar, ele expressa como texto. Isso é uma vantagem quando a resposta precisa ser explicada a um humano ou alimentar uma etapa posterior que espera linguagem, e um custo quando a única coisa de que você precisava era uma probabilidade.

Tudo o que vem a jusante decorre disso. Uma resposta do d1-3B não pode falhar no parsing. Também não consegue explicar-se a si mesma, e o cartão do modelo diz isso diretamente: não é um modelo de chat e não escreve texto.

Onde estão as trilhas de evidências

A proveniência dos dois conjuntos de números não é equivalente, e isso importa mais aqui do que os próprios números.

• Decision Index 0.2.1 — Liquid AI d1-3B obtém 48,57, pontuado pelo fornecedor com o avaliador oficial, o primeiro entre os modelos com menos de 10B e à frente do Decider 35B-A3B, com 47,11. O Ge​mma 4 12B não é pontuado no Decision Index de forma alguma, por isso esta linha não tem correspondente.

• Benchmarks de raciocínio — Ge​mma 4 12B registra 77,5 no AIME 2026, 78,8 no GPQA Diamond e 1.659 de ELO no Codeforces, e carrega um Artificial Analysis Intelligence Index de 22 no modo de raciocínio e 13 com o raciocínio desativado. O Liquid AI d1-3B não tem benchmark de raciocínio, porque um modelo de decisão não produz um traço de raciocínio para ser pontuado.

• Contexto longo — o Ge​mma 4 12B aceita 256.000 tokens e obtém 43,4% no MRCR v2 eight-needle em 128k no próprio cartão do Goo​gle. O Liquid AI d1-3B aceita 32.768 tokens. Se o seu "estado" for um documento de quarenta páginas mais digitalizações, essa diferença é a decisão toda e não é nem de perto.

• Visão — o Liquid AI d1-3B tem média de 74,1 em onze benchmarks públicos de imagem lidos como decisões sobre o conjunto de opções de cada benchmark, contra 73,9 do backbone LFM2.5-VL-3B a partir do qual foi construído, e o fornecedor relata que remover as imagens faz as mesmas perguntas caírem para 45,1. A visão do Gemma 4 12B é mais forte e mais ampla, mas é relatada como qualidade de geração, não como precisão de decisão sobre opções nomeadas.

• Idiomas — dezesseis documentados para o Liquid AI d1-3B; mais de 140 para o Ge​mma 4 12B.

• Velocidade — O Liquid AI d1-3B responde a uma pergunta em 8 ms numa RTX 4090, 16 ms num Jetson AGX Thor, 26 ms num Jetson AGX Orin 64 GB e 50 ms num Jetson Orin Nano, e empacota 64 estados numa única passagem a 475 por segundo na 4090. O Ge​mma 4 12B gera, portanto a sua latência é uma função de quantos tokens ele escreve.

• Qualidade das evidências — os resultados do Gemma 4 12B são do Google, publicados em junho de 2026 e, desde então, mexidos, quantizados e reexecutados por uma grande comunidade. Os do Liquid AI d1-3B são da Liquid, publicados há dois dias, reproduzidos por ninguém fora do laboratório. Leia a segunda coluna com isso em mente.

A two-column scoreboard for Liquid AI d1-3B and Gemma 4 12B. The d1-3B column reads: output a label, a confidence, zero tokens; 3.12B parameters; 32,768-token context; text and image input; 8 ms per question; Decision Index 48.57 (vendor). The Gemma 4 12B column reads: output generated text; 11.96B parameters; 256,000-token context; text, image, audio and video input; latency that scales with output length; Decision Index not scored. The footer reads 'd1-3B figures vendor-reported and unreproduced; Gemma 4 12B figures per Google, June 2026.'

O único lugar onde eles realmente competem

Existe uma sobreposição real, e ela não está num placar. É a avaliação LLM-as-a-judge.

Muitos pipelines de produção já usam um generalista de médio porte como camada de avaliação: pontuar a urgência deste ticket, decidir se esta saída passa em uma rubrica, escolher qual ferramenta o agente deve chamar em seguida, verificar se uma passagem recuperada responde à pergunta. Hoje, a maioria dessas chamadas vai para um modelo generativo que é solicitado a emitir um número ou um rótulo como texto, e o número que ele emite é o que o amostrador produziu, em vez de um softmax sobre o seu conjunto de opções. Esse é o fluxo de trabalho que o Liquid AI d1-3B foi pós-treinado para substituir, e as demos publicadas são todas versões disso — um predicado SQL que responde sim ou não para 150 tickets de suporte, um loop de compactação de contexto do agente que mantém, apara ou descarta cada saída de ferramenta e remove 52% dos tokens, um aplicativo de inspeção visual que classificou peças boas e defeituosas de quatro linhas de produção com 85 a 97% de precisão em uma tarefa para a qual nunca foi treinado.

Gemma 4 12B realiza todos esses trabalhos, e faz mais do que esses trabalhos. Ele também pode escrever o resumo, manter um documento de 256K em visualização, receber uma chamada telefônica gravada como entrada e responder em um dos mais de 140 idiomas. Se o seu pipeline precisa de uma avaliação e uma narração, o 12B está fazendo dois trabalhos com uma chamada e o modelo de decisão 3B está fazendo um deles.

A fronteira é o comprimento do contexto e o formato da saída. Estado longo, entrada falada, muitos idiomas, ou uma explicação que o leitor espera — Ge​mma 4 12B, sem competição. Estado curto, um conjunto fixo de opções, um orçamento de latência por requisição em milissegundos de um único dígito, ou uma garantia absoluta de que a resposta será parseável — essa é a coluna do d1-3B, e o generalista está pagando por capacidade que você não vai usar.

Quanto custa ligar para cada um

Nenhum dos modelos está no nosso catálogo, portanto não há preço de roteamento a cotar para nenhum dos dois — o Ge​mma 4 12B não está entre os tamanhos de Ge​mma que atendemos, e o Liquid AI d1-3B é de pesos abertos que você mesmo hospeda ou acessa pela própria API do fornecedor e por plataformas de terceiros. Para dar contexto sobre o lado adjacente ao Gemini dessa família, os dois tamanhos de Ge​mma 4 que roteamos estão listados a US$ 0,06 por milhão de tokens de entrada e US$ 0,33 por milhão de tokens de saída para o Ge​mma 4 26B A4B, e US$ 0,13 e US$ 0,38 para o Ge​mma 4 31B, ambos com contextos de 262.144 tokens e entrada de texto, imagem e vídeo. O preço mediano de fornecedores cotado para o Ge​mma 4 12B em outros lugares fica em torno de US$ 0,10 e US$ 0,30.

O serviço hospedado da Liquidd1, cobra apenas tokens de entrada, a US$ 0,04 por milhão, com imagens contadas como entrada a 1,5 tokens por patch de 32×32 pixels. Uma requisição de decisão, portanto, não tem nenhuma linha de tokens de saída, o que é a razão estrutural pela qual a própria comparação de custos do fornecedor com modelos muito maiores termina onde termina. Os pesos abertos não têm preço por chamada; você paga em hardware. Ambos precisam ficar no mesmo pipeline que tudo o mais que você chama, que é a camada para a qual um roteador foi projetado — uma API para mais de 200 modelos, preços de lista dos provedores repassados com 0% de markup, e failover automático para que uma única oscilação no upstream não se torne sua indisponibilidade. Essa é a infraestrutura em torno da comparação, não a comparação.

A capture of Liquid AI's blog post 'Open d1: Edge decision models for text, vision, and audio' dated Oct 7, 2026, showing the opening paragraph announcing d1-3B and d1-omni-600M as open-weight models, the d1-3B Decision Index score of 48.57, and the latency figures of 8 ms on an RTX 4090, 16 ms on a Jetson AGX Thor and 26 ms on a Jetson AGX Orin.

Como decidir, honestamente

Comece pelo formato da resposta, e não pelo modelo. Se o sistema downstream puder consumir uma probabilidade, um rótulo e uma confiança, e o conjunto de respostas for pequeno e conhecido, o Liquid AI d1-3B não é um downgrade de um 12B — é um instrumento diferente, e os números de latência o tornam uma implantação categoricamente diferente: 50 ms em um Jetson Orin Nano é um dispositivo que não tem por que executar um 12B.

Se a resposta tiver de ser uma frase, ou o estado tiver mais de trinta e dois mil tokens, ou alguém for falar isso, ou o idioma de saída for bengali, então Ge​mma 4 12B é o único dos dois capaz de fazer o trabalho, e a comparação termina antes mesmo de começar.

O posicionamento genuinamente útil para a maioria das equipes é ambos, em lugares diferentes. Um modelo de decisão à frente da chamada cara, fazendo a triagem, o roteamento e as barreiras de proteção que não precisam de linguagem; um generalista atrás dele para o trabalho que precisa. Esses são o mesmo pipeline, um é um filtro e o outro é a carga útil — e as equipes que mais aproveitarão o lançamento d1 são aquelas que já estão pagando um 12B para responder sim ou não.

A capture of our own catalogue page for Google Gemma 4 31B, showing the model id google/gemma-4-31b-it, a release date of 2026-04-02, a 30.7B dense multimodal description with a 256K token context window, and headline pricing of $0.13 per million input tokens and $0.38 per million output tokens.