
Liquid AI d1-3B vs Intern-Decision-4B: Qual Decisor Calibrado Você Realmente Precisa?
- openaiNOVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligência
- anthropicNOVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligência
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Inteligência
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Inteligência
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Inteligência
- xAIGrok 4.72026-09-2146Inteligência
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 56 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 56 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 346 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
Dois modelos de pesos abertos agora respondem a perguntas sem escrever nada, e, até você colocar seus esquemas de E/S lado a lado, eles parecem a mesma ideia duas vezes. O Liquid AI d1-3B, publicado no Hugging Face em 5 de outubro de 2026 e anunciado pela Liquid dois dias depois, é um modelo de decisão multimodal de 3,12B cujo card diz categoricamente que ele "não é um modelo de chat e não escreve texto". O Intern-Decision-4B, da InternLM, publicado discretamente na organização InternLM em 26 de setembro de 2026, sem post de blog, sem tweet e sem página de lançamento por trás, é um modelo de decisão de 4B com fine-tuning a partir do Qwen3.5-4B que, da mesma forma, retorna uma distribuição de resposta para cada pergunta em uma única passagem direta. O mesmo contrato na superfície. As diferenças por baixo — uma licença que vai complicar você, um contrato que pode escrever texto por acidente e máquinas que ninguém comparou — são o que decide qual deles pertence à sua stack.
Quão próximos os dois realmente estão
A primeira coisa a esclarecer é quanto desta comparação é um empate. Ambos os modelos recebem um estado e um esquema de perguntas nomeadas, ambos leem o sinal dos logits em uma posição de placeholder em vez de fazer amostragem, ambos são multimodais, e ambos relatam que não escreveram nada. Na forma da chamada, são quase idênticos, e as diferenças interessantes estão nos detalhes periféricos.
• Tamanho — Liquid AI d1-3B, 3,12B no total, construído sobre o LFM2.5-VL-3B da Liquid; Intern-Decision-4B 4B (cerca de 4,54B pela contagem de tensores indicada no cartão), ajustado a partir do Qwen3.5-4B
• Tipos de pergunta — d1-3B e Intern-Decision-4B usam os mesmos três: sim/não para sim/não, escolha para um de um conjunto nomeado, pontuação para um ponto numa escala
• Campos de resposta — d1-3B retorna a resposta, além de confiança e probabilidades; o esquema do InternLM retorna distribuições, além de um valor de confiança que o cartão do modelo adverte não ser uma probabilidade calibrada
• Limite de entrada — d1-3B 32.768 tokens de contexto; Intern-Decision-4B um teto de 8.192 tokens que recusa solicitações mais longas de imediato em vez de truncá-las, com as imagens contadas nesse limite
Licença — d1-3B sob a LFM Open License v1.0 da Liquid, Apache 2.0 do lado do InternLM
• Idiomas — o d1-3B lista 16; o cartão do Intern-Decision-4B não informa nenhum
• Interface — o d1-3B é fornecido como um modelo que você carrega e chama com trust_remote_code=True; o Intern-Decision-4B é fornecido como uma biblioteca Python que você pip install, com um backend implementado e o campo model da própria requisição explicitamente incapaz de alternar checkpoints
• Pontuação própria dos fornecedores — d1-3B 48,57 na divisão pública do Decision Index 0.2.1; Intern-Decision-4B 90,02 em média em sua própria tabela de sete conjuntos, com pontuação de Brier de 0,347 e erro de calibração esperado de 0,065
Esses dois últimos números não são comparáveis, e tratá-los como um placar seria o erro mais fácil de cometer nesta página. Eles vêm de ferramentas de avaliação diferentes, conjuntos de perguntas diferentes e avaliadores diferentes.

A calibração é o produto inteiro, e apenas um deles a respalda por escrito.
Um modelo de decisão só justifica a sua latência se o número que ele devolve ao lado da resposta significar algo. É isto que é a calibração: uma confiança declarada de 0,9 deveria estar certa cerca de nove vezes em cada dez, e um modelo que está confiante e erra é pior do que um que diz que não sabe.
O InternLM é o que aborda isso. Seu cartão documenta uma temperatura ajustada de 1,99241824, derivada por minimização da log-verossimilhança negativa em 1.728 casos de calibração designados, com 1.693 reservados para validação, e impressa com oito casas decimais para que possa ser reproduzida. Ele também publica um estudo-piloto de antes e depois com 96 casos que mostra o mecanismo funcionando, em vez de apenas afirmá-lo: Brier 0,628 e ECE 0,213 antes da calibração contra 0,550 e 0,089 depois. Brier e ECE são as duas medidas padrão de se as probabilidades declaradas são honestas, e a direção da mudança é grande.
A Liquid não publica nenhum equivalente. A própria ficha do d1-3B traz benchmarks no estilo de acurácia — SQuAD 2.0 85,3, Civil Comments 93,0, intenção MASSIVE 87,3, PubMedQA 66,0, BoolQ 86,7, XNLI 85,0, PAWS-X 76,9, uma média de 77,1 — ao lado de seus 48,57 no Decision Index, e o argumento de venda declarado do modelo são respostas tipadas calibradas. Mas não há linha de ECE, nem linha de Brier, nem temperatura ajustada publicada.
Essa assimetria não significa que o descendente do Qwen3.5-4B seja melhor calibrado do que um 3B construído sobre o LFM2.5-VL-3B; significa que, entre esses dois cards, um deles lhe dá a aritmética para reproduzir a afirmação e o outro lhe dá a afirmação. Se o seu pipeline aplica um limiar a uma confiança — roteie acima de 0,8, escale abaixo de 0,4 —, você pode validar o lado do InternLM hoje à noite e só pode fazer uma verificação pontual do lado do Liquid.
A ressalva vale para os dois lados. Ambos os conjuntos de números são de origem própria. Nenhum dos modelos foi avaliado por uma entidade independente, e as alegações de calibração do InternLM baseiam-se no próprio piloto de 96 casos do InternLM em comparação com o próprio ajuste do InternLM.
A licença que lhe pede um número
O Intern-Decision-4B é Apache 2.0, herdado do Qwen3.5-4B, com os avisos upstream mantidos — uso comercial, redistribuição, ajuste fino, nenhuma questão de receita em nenhuma parte dele.
d1-3B está sob a Liquid's LFM Open License v1.0, e a Seção 5 é a parte que ninguém lê até que o setor de compras o faça. O uso comercial só é concedido sob a condição de que você ou sua pessoa jurídica permaneçam abaixo de um Limite, definido nesse mesmo documento como receita anual de dez milhões de dólares norte-americanos ou mais; o uso acima dele simplesmente não é licenciado. Organizações sem fins lucrativos e usuários de pesquisa são exceções.
Para um indivíduo ou uma equipe pequena, ambos são gratuitos. Para qualquer coisa com um departamento financeiro, os dois repositórios são produtos diferentes, e a diferença é um número acima do qual você está ou não está.
A parte final da tabela de benchmark do d1-3B é a sua verdadeira afirmação.
O número de destaque no cartão do Liquid é 48,57 no Decision Index 0.2.1, à frente das outras linhas abaixo de 10B numa tabela que vai do Winnow-12B em 50,02 até o Decider 2B em 28,97. O que torna esse número digno de citação é o índice de discriminação que está por baixo dele. Nas próprias subpontuações do Decision Index, o d1-3B obtém 74,5 em Tools e 36,3 em Arts, enquanto consegue apenas 23,8 em Knowledge — contra o Decider 35B-A3B, um modelo de mistura de especialistas de 36B, 12x seu tamanho, que obtém 56,5 em Tools, 32,6 em Arts e 31,8 em Knowledge.

Em outras palavras, o 3B não é um modelo pequeno que é uniformemente um pouco pior. É um modelo pequeno que é incomumente forte em decisões estruturadas no estilo de ferramentas e incomumente fraco em perguntas que exigem conhecimento de mundo, e supera o 36B nas duas categorias que mais se parecem com a tarefa para a qual foi criado. Se suas decisões são "qual destas cinco ações nomeadas" e "isto está fundamentado na passagem recuperada", a diferença de tamanho importa menos do que você esperaria. Se suas decisões dependem de fatos que o modelo já precisa dominar, espere que o 23.8 apareça.
Há uma segunda versão desse argumento no lado da visão. O d1-3B tem média de 74,1 em onze benchmarks públicos de imagem, contra 73,9 do seu próprio modelo base, e, com as imagens removidas, as mesmas perguntas pontuam 45,1 — portanto, em perguntas de imagem, as respostas vêm genuinamente da imagem. Ele está no mesmo nível do seu modelo base, em vez de ser melhor que ele, e as linhas por benchmark vão nos dois sentidos: CV-Bench 82,1 contra 87,6, POPE 88,5 contra 90,1, BLINK 59,2 contra 58,7.
Vale notar também a pausa no card do InternLM: sua alta pontuação agregada vem de tarefas orientadas por perguntas, como Typed Decision 80,55 e ToolACE 96,45, enquanto Jevbench-Hard fica em 73,87. Onde o esquema fica difícil, a pontuação cai.
Velocidade: a lacuna não está onde você espera
O d1-3B anuncia 8 ms para uma única pergunta em uma RTX 4090 e 9 ms em uma MI325X, 21 ms para três perguntas compartilhando um estado, 16 ms em um Jetson AGX Thor, e throughput empacotado de 475 decisões por segundo na 4090 e 1.106 na MI325X.
O cartão do Intern-Decision-4B mede 44,16 ms de média ponta a ponta na mesma RTX 4090, com uma mediana de 44,03 ms e 44,60 ms no P95.
Isso parece uma vitória de 5x, e não é, porque os dois estão medindo coisas diferentes. Os números do Liquid são chamadas de modelo com cache aquecido, uma requisição por vez, com seleção e compilação de kernel pagas antecipadamente — o cartão diz explicitamente que uma única pergunta custa 16 ms na 4090 sem compilação de CUDA graph, e que a primeira chamada com um novo shape paga o custo da compilação. Os 44 ms do InternLM são por consulta, de ponta a ponta, através de uma biblioteca Python cujo único backend implementado é a inferência local do Hugging Face, então ele carrega a parafernália ao redor. Nenhum dos números está errado. Coloque ambos sob um mesmo harness, em uma mesma máquina, no mesmo shape de requisição, e a diferença encolhe para algo que você gostaria de medir em vez de presumir.
O que não está em questão é o teto. 8.192 tokens é uma recusa categórica do lado do InternLM, e tokens de imagem consomem do mesmo orçamento, então um documento longo mais uma captura de tela é uma requisição que volta rejeitada em vez de truncada. O d1-3B oferece 32.768 tokens para você trabalhar. Se seus estados forem tickets e trocas curtas, essa diferença nunca chega a incomodar. Se eles tiverem o tamanho de uma página, ela decide a questão antes de qualquer benchmark.
Execute-os como um painel, não uma troca.
Responder a um sim/não específico e responder "qual de seis coisas nomeadas é esta, e quão certo você está" são pedidos diferentes, e os dois cards são moldados de forma suficientemente diferente — um com um teto de entrada rígido e um ajuste de calibração publicado, o outro com 32K de contexto e uma cauda de pontuação melhor — que a implantação útil para uma equipe avaliando ambos é frequentemente não uma substituição, mas um painel: o mesmo estado apresentado a ambos os modelos, com discordâncias encaminhadas para um humano ou para um modelo maior.
Nenhum dos dois modelos está no nosso catálogo, e isto não é uma alegação de disponibilidade; ambos são artefatos auto-hospedados. Mas um painel é exatamente o formato em que uma camada de roteamento faz o trabalho, e não a papelada. O OrcaRouter expõe mais de 200 modelos por trás de uma única chave de API com preços de lista dos provedores repassados com 0% de margem — então, quando um fornecedor que você roteia por meio de nós corta o preço, sua fatura muda no mesmo dia — e failover automático entre provedores impede que um painel de dois modelos se torne dois pontos únicos de falha. Os modelos que você roteia hoje não são estes dois; são os generalistas hospedados que você estaria substituindo, como o Qwen3.5-27B a US$ 0,086 por milhão de tokens de entrada e US$ 0,688 por milhão de saída, que é o número que um 3B auto-hospedado precisa superar depois de contabilizar a GPU.
O que fazer esta semana
Se suas decisões são estados curtos, a licença precisa sobreviver à revisão da sua empresa, e você quer a mais ampla variedade de alvos de compilação — llama.cpp, Ollama, LM Studio, um caminho de lote empacotado que executa 64 estados em uma única passagem — d1-3B é o mais productizado dos dois e sua discriminação de ferramentas e artes é o ponto mais forte que qualquer um dos dois cartões demonstra. Se suas decisões se estendem por estados longos, ou você precisa de uma licença sem receita, ou você quer um ajuste de calibração que você possa reproduzir e um harness onde o custo ao redor já está contabilizado, Intern-Decision-4B é aquele cuja documentação você pode realmente conferir.

A parte desconfortável é a mesma para ambos: nenhuma parte independente executou qualquer um dos modelos, e não existe comparação de calibração que não tenha sido encomendada pelo fornecedor que escreveu o cartão. Para uma classe de modelos cujo valor inteiro é o significado de um número ao lado de uma resposta, essa é a lacuna que vale a pena fechar antes de você colocar um limiar em qualquer coisa.
