
Liquid AI d1-3B vs Qwen 3 8B: Uma carga de trabalho de classificação de 8B deve migrar para um modelo de decisão?
- openaiNOVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligência
- anthropicNOVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligência
- typesafeNOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Inteligência
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Inteligência
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Inteligência
- xAIGrok 4.72026-09-2146Inteligência
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 60 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 356 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
Somewhere in most production stacks there is a Qwen 3 8B being paid to answer yes or no. It moderates a comment, tags a support ticket, decides whether a retrieved passage is relevant, or scores another model's output against a rubric — and it does that by generating text which something downstream then parses. Liquid AI d1-3B, the 3.12B decision model Liquid AI open-weighted on October 7, 2026, exists to do exactly that job without generating anything: a state in, a set of named questions in, and probabilities, labels and confidences out in a single forward pass with zero output tokens. Qwen 3 8B is the vendor's April 2025 open-weights workhorse — roughly 8.2B dense parameters, 119 languages, thinking on or off per request, and sixteen months of community deployment behind it. The question this pairing actually asks is narrow and practical: for the slice of your traffic that is a classification, is an 8B generalist the cheapest way to get a label in 2026, or has the shape of that job changed underneath it?
O que você está realmente pagando um 8B para fazer
Coloque os dois contratos de saída lado a lado e a ineficiência é estrutural, e não incremental.
Uma chamada de classificação do Qwen 3 8B é uma geração. Você escreve um prompt que descreve os rótulos, o modelo opcionalmente raciocina sobre a entrada — e, neste modelo, você pode ativar ou desativar esse raciocínio por requisição, o que é o controle mais útil que ele tem para esse tipo de trabalho — e então ele retorna uma resposta. Essa resposta é texto. Se você pediu JSON, geralmente receberá JSON e, ocasionalmente, receberá JSON dentro de uma frase, ou um preâmbulo, ou uma explicação final que você não queria. O rótulo que lhe interessa está em algum lugar no fluxo de tokens, e um parser o recupera. Você é cobrado por cada token que o modelo escreve, incluindo os que você descarta.
O Liquid AI d1-3B não tem fluxo de tokens. As perguntas são declaradas com um tipo: noul para sim/não, respondidas como P(sim) entre 0 e 1; choice para um rótulo de um conjunto nomeado de opções, respondidas como o rótulo mais uma confiança mais uma probabilidade por opção; score para uma posição numa escala ordenada de dois a dez, respondidas como o nível esperado com sua distribuição e legenda. A resposta carrega um total acumulado que mostra output_tokens: 0. Não há nada para analisar porque nada foi escrito, e há um acessador bruto de probabilities quando você quer a distribuição não arredondada em vez do argmax.
A parte que muda a sua fatura é o que acontece com várias perguntas. Um estado pode carregar várias: isto é um pedido de reembolso, qual equipe deve ficar responsável por ele, qual é a urgência. O estado e as suas imagens são lidos uma vez, e o Liquid relata que três perguntas sobre um estado custam 1,3x o tempo de uma, em vez de 3x. O que ele não reduz é a cobrança de entrada — a nota de cobrança do fornecedor deixa explícito que cada pergunta é cobrada como um prompt próprio, incluindo o seu texto e todas as suas imagens. Menos latência, mesmos tokens de entrada. Isso é um asterisco honesto na manchete, e é o tipo de coisa que você só encontra lendo o parágrafo de preços em vez do benchmark.

O que dezesseis meses de Qwen 3 8B lhe rendem
Antes de considerar o modelo menor uma melhoria, seja preciso quanto ao que o modelo atual traz, porque é mais do que a contagem de parâmetros.
• Contexto — O Qwen 3 8B executa 32.768 tokens nativamente e se estende até 131.072, validado por meio do YaRN. O Liquid AI d1-3B executa 32.768 tokens de forma fixa, sem caminho de extensão documentado. Para um estado que é um documento longo, o 8B é o único dos dois que consegue comportá-lo.
• Idiomas — 119 idiomas e dialetos para o Qwen 3 8B, frente a dezesseis documentados para o Liquid AI d1-3B.
• Controle de raciocínio — Qwen 3 8B permite ativar ou desativar o pensamento por solicitação. O Liquid AI d1-3B não tem modo de raciocínio para controlar, o que é ou uma simplificação ou uma limitação, dependendo do que você estava usando o pensamento para fazer.
• Abrangência — o 8B escreve, explica, resume, traduz e programa. O Liquid AI d1-3B não faz nenhuma dessas coisas. A ficha técnica dele afirma isso claramente: não é um modelo de chat e não escreve texto.
• Evidência — Qwen 3 8B tem dezesseis meses de benchmarking público, quantização, ajuste fino e uso em produção. A pontuação de 48,57 no Decision Index do Liquid AI d1-3B foi produzida pela Liquid usando o pontuador oficial, em vez de ser submetida ao ranking público, e tem apenas alguns dias, sem reprodução por terceiros.
• Visão — esta linha segue o caminho oposto. O Liquid AI d1-3B recebe imagens, com o fornecedor relatando 74,1 em onze benchmarks públicos de imagens interpretados como decisões sobre o conjunto de opções de cada benchmark, e relatando que retirar as imagens faz as mesmas perguntas caírem para 45,1. O Qwen 3 8B somente texto precisa de um modelo de visão separado à sua frente para qualquer uma dessas tarefas.
• Velocidade — uma pergunta em 8 ms numa RTX 4090, 16 ms num Jetson AGX Thor, 50 ms num Jetson Orin Nano, e 64 estados empacotados por passagem a 475 por segundo na 4090. Um classificador baseado em geração não tem um número comparável, porque sua latência depende do comprimento da resposta.
O resumo honesto é que o 8B é o melhor instrumento geral e o modelo de decisão 3B é o melhor especializado, e a única questão que importa é quanto do seu tráfego é o caso especializado.
A aritmética dos custos, feita com cuidado
É aqui que a comparação se paga ou não, por isso vale a pena fazê-la com estrutura real em vez de um slogan.
A alegação que a Liquid publicou dois dias antes do lançamento de pesos abertos é que seu modelo de decisão hospedado iguala ou supera o GPT-6.1 Sol em quatro de seis aplicações reais, com custo de 19x a 200x menor, e responde mais rápido em todas as tarefas. Leia a metodologia antes de repeti-la: cada aplicação foi executada uma vez por modelo em 5 de outubro de 2026, os modelos de chat responderam em JSON na configuração de raciocínio padrão, e o custo do d1 foi calculado a US$ 0,04 por milhão de tokens de entrada. Esse valor de US$ 0,04 é a tarifa de entrada do d1 hospedado, e é a única tarifa que existe — não há linha de saída a adicionar.
Agora, monte a mesma estrutura de estimativa para um classificador Qwen 3 8B, e a assimetria fica visível sem citar o preço do provedor de ninguém. O 8B tem duas linhas cobráveis onde o modelo de decisão tem uma, e a segunda linha é a que cresce: uma classificação que raciocina primeiro paga pelo raciocínio, e uma classificação que faz padding no seu JSON paga pelo padding. A cobrança de entrada do modelo de decisão é fixada pelo estado e pelas perguntas. A do 8B não é fixada por nada que você possa prever apenas a partir do estado.
Dois contrapesos impedem que isto se torne uma derrota esmagadora. Primeiro, o modelo de decisão cobra cada pergunta como um prompt próprio, por isso fazer cinco perguntas sobre um único documento longo quintuplica a entrada — o 8B faz as cinco numa só chamada e paga pelo documento uma única vez. Segundo, e mais importante, um modelo de decisão só consegue responder a perguntas para as quais foi pós-treinado a responder dessa forma. Tudo o que exija uma explicação, um resumo ou um juízo expresso por palavras fá-lo voltar ao generalista e, na prática, voltar a pagar pelos dois.

No que os dois são genuinamente bons
Retire o benchmarking e a separação fica mais limpa do que as contagens de parâmetros sugerem.
Liquid AI d1-3B destina-se ao sim/não, à escolha a partir de uma lista e à avaliação, com um piso de latência que nenhum modelo generativo alcança, em hardware que inclui um Jetson Orin Nano a 50 ms e um laptop. As aplicações que a Liquid demonstrou em outubro eram todas versões dessa forma — um predicado SQL que responde sim ou não a 150 pedidos de suporte, um ciclo de compactação de contexto de agente que mantém, apara ou descarta a saída de cada ferramenta e remove 52% dos tokens, uma aplicação de inspeção que separa peças boas e defeituosas de quatro linhas de produção com 85 a 97% de precisão numa tarefa para a qual nunca tinha sido treinada e que compreendeu a partir de uma breve descrição. Essa última demo é a declaração mais clara daquilo para que esta categoria serve: uma tarefa em que a resposta é uma de entre poucas coisas, o estado é uma imagem e nunca foi pedida qualquer explicação.
Qwen 3 8B serve para o trabalho que precisa retornar como linguagem, ou abranger 119 idiomas, ou comportar um documento com mais de trinta e dois mil tokens, ou raciocinar em voz alta antes de se comprometer. Também é a resposta certa quando a classificação não é uma das três formas acima — quando o conjunto de rótulos é aberto, quando os critérios têm nuances suficientes para que você quisesse o raciocínio, quando a mesma chamada precisa lidar com o caso fácil e o difícil sem que você precise alternar entre dois modelos. E é a escolha segura quando um revisor pergunta quais benchmarks independentes existem, porque a resposta é: muitos, que remontam a um ano e meio.
As equipes que acertam isso não escolhem. Elas colocam o modelo de decisão na frente do generalista, na parcela do tráfego em que a resposta é um número, e deixam o 8B cuidar de tudo que precisa de uma frase. O filtro é 3B e 8 ms; o 8B fica para o payload.
Implantando o par
O Liquid AI d1-3B chega como pesos com o trabalho de implantação já feito: suporte ao llama.cpp desde o primeiro dia, a pilha completa da NVIDIA, desde o DGX até o Jetson, quantização NVFP4, uma variante de pesos e ativações de 8 bits e conversões GGUF no Hugging Face. O Qwen 3 8B tem o ecossistema de auto-hospedagem mais profundo de qualquer modelo nesta classe de peso. Nenhum dos dois está no nosso catálogo, e nada aqui é uma afirmação de disponibilidade para qualquer um deles — a via hospedada para o Liquid AI d1-3B é a API do próprio fornecedor e plataformas de terceiros, onde o hospedado d1 é precificado apenas por tokens de entrada a $0,04 por milhão, com imagens cobradas a 1,5 tokens por patch de 32×32 pixels.
Assim que ambos estiverem no mesmo pipeline, o problema de roteamento deixa de ser teórico. Você tem um modelo pequeno próprio, um 8B que pode hospedar ou alugar, e as chamadas generativas que certamente aluga — e decidir, a cada requisição, qual deles uma determinada entrada deve acionar é exatamente a decisão que uma camada de roteamento existe para tomar. Um único endpoint para mais de 200 modelos, preços de tabela dos provedores repassados com 0% de markup para que uma mudança de preço de um fornecedor esteja ativa do seu lado no mesmo dia, failover automático para que uma tarde ruim de um upstream não se torne a sua indisponibilidade. Quando seu tráfego de classificação é medido em bilhões de chamadas por ano, é nessa camada que a economia de um modelo de decisão de 3B realmente se concretiza.
O veredito
Se o seu 8B está recebendo perguntas fechadas — isto é tóxico, isto é relevante, a qual fila isto pertence, qual é a urgência —, você está pagando a conta de duas linhas de um generalista e a latência de uma geração por um rótulo, e o Liquid AI d1-3B é um substituto direto, com uma trilha de evidências mais fraca e uma diferença real de licença a ponderar. Aceite o teto de contexto de 32K, os dezesseis idiomas e o fato de que ninguém fora da Liquid ainda o avaliou.
Se o seu 8B estiver sendo solicitado a explicar, resumir, traduzir, manter um documento longo ou raciocinar antes de decidir, esta comparação não se aplica a você. Mantenha o 8B e considere o modelo de decisão apenas como um pré-filtro para o tráfego que você consegue identificar de antemão como sendo do tipo fácil.
O número interessante a observar não é a pontuação de benchmark de nenhum dos dois modelos. É a rapidez com que chega a primeira reprodução independente do d1 Decision Index, porque esse é o momento em que a comparação deixa de ser uma alegação de fornecedor e passa a ser um fato no qual você pode basear seu planejamento.

