Um cartão de título principal com o título 'Liquid AI d1-3B vs Granite 4.2 3B' e o subtítulo 'um decide, um escreve', mostrando à esquerda um cartão rotulado d1-3B com um ícone de lista de verificação, a legenda '3,12B - 32.768 tokens' e chips com os dizeres probabilidade, rótulo e pontuação, e à direita um cartão rotulado Granite 4.2 3B com um ícone de balão de fala, a legenda '3B - 128K tokens' e um chip com os dizeres 'uma resposta escrita'.
Guides & Insights

Liquid AI d1-3B vs Granite 4.2 3B: Dois modelos 3B que nunca fazem o mesmo trabalho

Autor

Gideon Frost

Data de publicação

Modelos mais recentes · 20Ver todos os modelos →
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Coloque o Liquid AI d1-3B e o Granite 4.2 3B na mesma GPU única e ambos caberão confortavelmente — 3,12B de parâmetros de um lado, 3B do outro. Eles também se comportarão como se viessem de disciplinas diferentes. O Granite 4.2 3B, que a IBM data de 25 de agosto de 2025, é um modelo de raciocínio: três modos, um bloco {{2}}<think>{{/2}}, e uma entrada que você Liquid AI d1-3B, enviado ao Hugging Face em 2 de outubro e ... {{3}}output_tokens: 0{{/3}} {{4}}porque nunca escreve nada.{{/4}} {{5}}A pergunta útil não é qual dos dois é melhor. É qual das suas chamadas é de fato uma decisão, porque os dois repositórios foram construídos para metades opostas dessa divisão.{{/5}}<think>output_tokens: 0porque nunca escreve nada.A pergunta útil não é qual dos dois é melhor. É qual das suas chamadas é de fato uma decisão, porque os dois repositórios foram construídos para metades opostas dessa divisão.

O que realmente há em cada repositório

Tudo abaixo vem dos dois cartões de modelo e do post de anúncio da Liquid. Nada aqui foi reproduzido de forma independente, nenhum terceiro pontuou qualquer um dos modelos no mesmo harness, e os números nos cartões são dos próprios fornecedores.

• Tamanho — Liquid AI d1-3B, 3,12B no total, construído sobre o LFM2.5-VL-3B da Liquid; Granite 4.2 3B, um transformer denso de 3B apenas com decodificador, construído sobre granite-4.1-3b-base

• Saída — d1-3B retorna probabilidades, rótulos e confianças e não escreve texto algum; Granite 4.2 3B gera tokens, incluindo uma cadeia de pensamento opcional dentro de <think> tags

• Contexto — d1-3B 32.768 tokens; Granite 4.2 3B 128K nativamente, com uma extensão de contexto longo para 512K no cartão

• Entrada — texto, JSON, imagens ou uma mistura, via um codificador de visão SigLIP NaFlex 400M; Granite 4.2 3B somente texto

• Licença — d1-3B sob a LFM Open License v1.0 da Liquid; Granite 4.2 3B sob Apache 2.0

• Idiomas — d1-3B lista 16; Granite 4.2 3B lista doze testados, com o cartão indicando que os demais não foram testados

• Serviço — o d1-3B traz código personalizado (trust_remote_code=True, transformers>=5.14), com repositórios GGUF e w8a8 na mesma família e cards documentados para llama.cpp, Ollama e LM Studio; o Granite 4.2 3B roda em vLLM 0.20+ ou SGLang 0.5.18+ com um analisador de pensamento personalizado

Duas dessas linhas fazem mais do que as outras. A linha de saída é todo o argumento deste artigo, e a linha da licença é aquela que ninguém coloca na tabela de comparação.

A two-column scoreboard for Liquid AI d1-3B and Granite 4.2 3B. The d1-3B column reads: job answers a typed question; parameters 3.12B; output tokens billed 0; context 32,768 tokens; image input yes; one question 8 ms on an RTX 4090. The Granite 4.2 3B column reads: job writes a reasoned answer; parameters 3B; output tokens billed every token it writes; context 128K, to 512K extended; image input no; one question a full thinking pass. The footer reads 'Both columns vendor-reported, neither independently scored.'

Um escreve uma cadeia de pensamento, o outro se recusa a escrever.

O Granite 4.2 3B se paga pensando em voz alta. Seu card documenta três modos: pensamento ativado por padrão, sem pensamento, e um modo de baixo esforço que mantém o traço de raciocínio, mas o encurta. As stacks de serving separam o traço da resposta final, de modo que sua aplicação recebe conteúdo limpo mais um campo de raciocínio separado. Esse é um bom design para uma pergunta que precisa ser trabalhada — um problema de matemática, um ramo da lógica, um trecho de código que precisa ser escrito antes de poder ser avaliado.

d1-3B não tem esse modo, e seu card diz isso sem rodeios: "Ele não é um modelo de chat e não escreve texto." Uma chamada declara perguntas com um tipo. noul é um sim/não que retorna P(sim) entre 0 e 1. choice escolhe um rótulo de um conjunto de opções nomeado e retorna o rótulo, uma confiança e uma probabilidade por opção. score posiciona o estado em uma escala ordenada de dois a dez e retorna o nível esperado com sua distribuição e legenda. O sinal é lido dos logits em uma posição de espaço reservado em uma única passagem, não amostrado token a token, e é por isso que o bloco de uso pode reportar zero tokens de saída sem mentir.

Essa diferença muda sua fatura antes de mudar sua precisão. Uma chamada de classificação do Granite que "pensa" por 400 tokens é uma chamada pela qual você paga 400 tokens de saída, e o rótulo que você queria fica enterrado em prosa que um parser então precisa recuperar. Uma chamada do d1-3B cobra apenas a entrada. Se a maior parte do seu tráfego é um rótulo com uma regra associada, você vem pagando pelo raciocínio, quer ele tenha mudado o rótulo ou não.

Onde o Granite 4.2 3B é claramente a melhor escolha

Tome os benchmarks de raciocínio pelo valor nominal — são da própria IBM, executados por um pipeline interno do NeMo Evaluator, e nenhuma entidade externa os reproduziu — e o 3B é incomumente forte para o seu tamanho: AIME25 78,33, HMMT February 2025 66,67, GPQA 54,80, LiveCodeBench v6 69,71, MMLU-Pro 67,84, IFBench 74,33, BFCL v4 52,41, tau3-bench 45,78, e RULER 64K 67,52 caindo para 55,30 em 128K.

Quatro tarefas decorrem dessa lista, e d1-3B não está em nenhuma delas.

• Um contexto nativo de 128K, extensível a 512K, contra 32.768 tokens no d1-3B — se o seu estado for um documento longo, a escolha está feita para você

• Chamada de ferramentas agêntica com um parser documentado e integrações de harness para OpenCode, Pi e OpenHands, para a qual um modelo de decisão não tem equivalente.

• Qualquer tarefa cuja resposta seja um parágrafo: sumarização, redação, extração para estrutura livre, geração de código

• Ajuste fino e redistribuição sem teto de receita, porque a Apache 2.0 não tem cláusula de limiar

Observe o que não está na ficha do Granite: as linhas de SWE-Bench e Terminal-Bench estão marcadas para o 3B. A etapa de aprendizado por reforço agêntico da IBM foi aplicada apenas aos membros de 8B e 30B da família, então o menor modelo não carrega as pontuações agênticas que seus irmãos maiores carregam. Uma equipe que lê "Granite 4" e assume que o 3B herda o perfil agêntico da família vai se surpreender.

A capture of Liquid AI's own blog post 'Open d1: Edge decision models for text, vision, and audio' dated Oct 7, 2026, showing the opening paragraph that releases d1-3B and d1-omni-600M as open-weight models, d1-3B's Decision Index score of 48.57 and the claim that it is ahead of every model under 10B, and its latency of 8 ms on an NVIDIA GeForce RTX 4090, 16 ms on a Jetson AGX Thor and 26 ms on a Jetson AGX Orin.

Onde o d1-3B vence antes que o Granite termine de pensar

A própria tabela de latência da Liquid, medida a quente, uma requisição por vez, é a parte mais forte de seu argumento: uma única pergunta em 8 ms em uma RTX 4090 e 9 ms em uma AMD MI325X, 16 ms em um Jetson AGX Thor e 26 ms em um Jetson AGX Orin 64GB, com 64 estados processados em uma única passagem a 475/s na 4090 e 1.106/s na MI325X. Para se ter uma ideia da escala, esse é aproximadamente o tempo que o Granite 4.2 3B precisa para emitir alguns tokens de seu traço de raciocínio.

Três tipos de pergunta sobre um único estado custam ao d1-3B 21 ms na 4090 em vez de três chamadas separadas, porque o estado e suas imagens são lidos uma vez para todas as perguntas. Em um stack de moderação ou roteamento que costumava disparar uma requisição HTTP por regra, essa é a diferença entre uma fila de chamadas e uma só.

Ele também enxerga. O d1-3B obtém uma média de 74,1 em onze benchmarks públicos de imagem, contra 73,9 do seu modelo base, e o card observa que, com as imagens removidas, as mesmas perguntas obtêm 45,1 — as respostas vêm da imagem, não do prompt de texto. As linhas individuais variam nos dois sentidos (CV-Bench 82,1 contra 87,6 do modelo base, POPE 88,5 contra 90,1), então a afirmação sobre visão é "no mesmo nível do modelo base", não "melhor do que ele".

O contrapeso honesto: o 48,57 do d1-3B no Decision Index 0.2.1 foi produzido pela própria Liquid executando o scorer oficial, em vez de por uma submissão à tabela de classificação, e as linhas concorrentes vêm da tabela de classificação pública. Sua média de 77,1 em oito tarefas de benchmark como decisão e seu 71,8 no DecisionBench também são de primeira parte. Tudo do lado d1 desta comparação não está verificado.

A capture of the Hugging Face model card for ibm-granite/granite-4.2-3b, showing the Apache 2.0 licence, the 3B parameter count, the decoder-only dense architecture built on Granite-4.1-3B-Base, the 128K native context with long-context extension to 512K, bfloat16 precision, the tested-language list and the built-in chain-of-thought reasoning mode.

Por que um modelo de raciocínio de 3B não é um modelo de decisão de 3B

O movimento tentador é tratar o Granite 4.2 3B como um substituto mais barato do d1-3B, ou o inverso. Ambos falham, e a falha é estrutural, não uma questão de qualidade.

Peça ao Granite para decidir e você obtém uma geração que precisa ser analisada, uma conta que cresce conforme a dificuldade que o modelo encontrou na pergunta, e uma latência que depende do modo de pensamento que você selecionou. Peça ao d1-3B para raciocinar e você não obtém absolutamente nada — ele não tem um fluxo de tokens no qual raciocinar. Os dois modelos estão em lados opostos de uma linha que a maioria dos pipelines cruza várias vezes por requisição: algo precisa decidir, e algo precisa falar. O d1-3B pertence à frente, onde uma regra de triagem escolhe uma rota e retorna uma confiança calibrada. O Granite 4.2 3B pertence atrás dele, no ramo que precisa de uma resposta escrita.

Há uma segunda armadilha, mais silenciosa. O valor de um modelo de decisão é a calibração — uma confiança de 0,9 que acerta nove vezes em dez. O card do Granite 4.2 3B não publica métricas de calibração nem probabilidades; publica pontuações de acurácia e raciocínio. Comparar os dois em um ranking de benchmark não diz nada sobre em qual deles você deveria confiar para definir um limiar.

A linha da licença que ninguém coloca na tabela

O Granite 4.2 3B é distribuído sob a Apache 2.0. O d1-3B é distribuído sob a LFM Open License v1.0, que parece permissiva até a Seção 5: o uso comercial é concedido sob a condição de que você ou sua pessoa jurídica permaneça abaixo de um limite definido no mesmo documento como receita anual de dez milhões de dólares americanos ou mais, e qualquer uso comercial acima dessa linha simplesmente não é licenciado. Organizações sem fins lucrativos e usuários de pesquisa ficam de fora.

Para um entusiasta ou um particular, isto não é problema. Para uma empresa que ultrapassa essa marca a meio do ano — ou que possa vir a ser adquirida por uma empresa desse tipo —, os dois repositórios não são artefactos equivalentes, por mais semelhantes que pareçam ser os seus números de parâmetros, e a revisão da licença acontece muito depois de alguém já ter lançado o protótipo. É a coisa mais barata de se verificar cedo nesta página.

Executando o par como um único pipeline

Nenhum dos dois modelos está hoje no nosso catálogo, por isso isto não é uma afirmação de disponibilidade: ambos são artefactos auto-alojados, e o Granite 4.2 3B em particular não tem quaisquer fornecedores de inferência listados na sua ficha. Mas o padrão com que uma equipa acaba por ficar é uma chamada que decide e outra que fala, e é nesse padrão que uma camada de encaminhamento ganha o seu lugar. O OrcaRouter coloca mais de 200 modelos atrás de uma única chave de API com preços de tabela dos fornecedores repassados com 0% de margem, para que um corte de preço de um fornecedor chegue à sua fatura no mesmo dia, em vez de na próxima renovação de contrato, e failover automático entre fornecedores significa que o componente partilhado no meio de um pipeline não se torna um ponto único de falha enquanto ainda o está a avaliar. Se quiser fazer A/B do d1-3B contra um generalista alojado, com o seu próprio tráfego, antes de se comprometer com uma implementação auto-alojada, o vizinho encaminhado mais próximo da linhagem do Granite é o Gemma 4 31B, a $0,13 por milhão de tokens de entrada e $0,38 por milhão de saída — um modelo muito maior, mas com o mesmo papel de "generalista que escreve" no pipeline.

O veredito, enunciado como regra

Se o que você precisa é de um julgamento — spam ou não, qual fila, quão urgente, se esta imagem corresponde àquela descrição — d1-3B é o único dos dois que faz o trabalho em uma passada, e o faz em milissegundos de um único dígito. Se o que você precisa é de uma resposta escrita, uma leitura de documento longo, uma chamada de ferramenta ou um trecho de código, Granite 4.2 3B é o que tem um fluxo de tokens, e as pontuações de raciocínio do 3B são genuinamente impressionantes para o seu tamanho — nas próprias avaliações da IBM, sem que ninguém as tenha verificado ainda.

O que mudaria o cenário não é uma nova linha de benchmark. É um terceiro pontuando os dois modelos no mesmo arcabouço de calibração, porque a propriedade que determina se você pode definir um limiar para um modelo é justamente a que nenhuma das fichas permite comparar hoje.