
Microsoft-Decision-1 vs Liquid AI d1-3B: Mesma Janela de 32K, Dois Sentidos Diferentes
- OrcaNOVOOrca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 por 1M de tokens
- openaiNOVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligência
- anthropicNOVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligência
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 113 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Inteligência
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Inteligência
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Inteligência
- xAIGrok 4.72026-09-2146Inteligência
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 52 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 423 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 62 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 399 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
Pela primeira vez, a especificação está alinhada. Microsoft-Decision-1, disponível geralmente no Microsoft Foundry desde 8 de outubro de 2026, aceita 32.768 tokens de contexto. O mesmo vale para Liquid AI d1-3B, enviado ao Hugging Face em 5 de outubro de 2026 e anunciado pela Liquid AI dois dias depois. Ambos aceitam um estado mais um conjunto de perguntas tipadas — sim/não, escolha entre opções nomeadas, uma posição numa escala ordenada — e ambos respondem numa única passagem direta com uma distribuição de probabilidade em vez de texto gerado; Laya, Intern-Decision-4B, Kev e o resto deste nicho discordam entre si sobre o comprimento do contexto, então este é o único par em que essa dimensão fica de fora e a comparação tem de ser argumentada com base em outra coisa.
O algo mais acaba sendo o canal de entrada. O modelo da Microsoft é exclusivamente de texto, explicitamente: ele "não aceita nem produz conteúdo de imagem, áudio ou vídeo". O da Liquid AI carrega um codificador de visão SigLIP2 NaFlex de 400 milhões de parâmetros sobre um backbone de linguagem de 2,6 bilhões de parâmetros e chega a 3,12 bilhões de parâmetros no total, e foi construído exatamente para aquilo que a Microsoft descartou — avaliar uma captura de tela, um formulário digitalizado ou um quadro de câmera em relação a uma pergunta fixa. Essa divisão, somada a uma diferença de licença que não tem nada a ver com capacidade, é todo o confronto.
Onde os dois concordam, o que é mais do que você esperaria
• Janela de contexto — 32.768 tokens para Microsoft-Decision-1 e 32.768 tokens para Liquid AI d1-3B.
• Formato de saída — probabilidades calibradas sobre as opções fornecidas; nenhum dos dois gera texto, e o contador de uso da Liquid AI reporta esse fato como output_tokens: 0.
• Tipos de pergunta — tanto escolha de documento, pontuação ordenada e sim/não binário, e ambos permitem definir o conjunto de opções por solicitação em vez de retreinar uma cabeça de vocabulário.
• Abstenção — A Microsoft documenta opções explícitas de abstenção, como "cannot tell"; o esquema Decision Index da Liquid AI oferece o mesmo suporte por meio de seu conjunto de opções.
• Inferência de passagem única — uma chamada por decisão de ambos os lados, o que é o que torna qualquer uma delas viável em escala de pipeline.
Dois modelos concordarem sobre as duas restrições mais difíceis deste nicho é algo que merece uma pausa. Uma janela de 32K é o que torna um scorer de decisão utilizável num contrato completo, numa política de várias páginas ou numa longa thread de suporte; o checkpoint Laya em inglês de 512 tokens e os limites de perguntas por chamada do Intern-Decision-4B não. Se a sua entrada for curta, a maior parte deste campo é intercambiável e a decisão prende-se com a hospedagem. Se a sua entrada for longa, o campo reduz-se a estes dois.
A sensação de que apenas um deles tem
O Liquid AI d1-3B é multimodal, e a árvore de modelos deixa a linhagem evidente: LFM2.5-2.6B-Base, depois LFM2.5-VL-3B, e então d1-3B pós-treinado para decisões calibradas em uma única passagem. As imagens entram pelo codificador SigLIP2 NaFlex, e o card informa uma média de 74,1 em onze benchmarks públicos de imagem, contra 73,9 do modelo de visão base — portanto, o ajuste de decisão não lhe custou qualidade de visão. Ele também informa o experimento inverso: remova as imagens e as mesmas perguntas caem para 45,1, que é a evidência mais clara que você obterá de que o canal de percepção tem função estrutural, e não decorativa.
Microsoft-Decision-1 não tem equivalente, e a omissão é deliberada, e não algo inacabado. O cartão da Microsoft lista os usos fora do escopo como geração de texto, respostas a perguntas abertas, conversa, tradução e sumarização, e afirma separadamente que o modelo é somente texto. Para um pipeline que precisa pontuar uma captura de tela de um formulário em relação a uma rubrica, ou decidir se um quadro de câmera contém um evento de segurança, isso é um bloqueio absoluto — nenhuma engenharia de prompt recupera uma modalidade que o modelo nunca recebeu.
A contagem de idiomas segue o caminho inverso, e esta é a segunda verdadeira divisão. O Microsoft-Decision-1 lista 25 idiomas suportados, e a empresa é franca ao dizer que cobertura, qualidade e calibração "podem variar conforme o idioma", apontando idiomas que não são inglês e, especialmente, idiomas de baixos recursos como uma área de baixo desempenho. O Liquid AI d1-3B declara 16 idiomas. Em amplitude, a Microsoft está à frente no papel; quanto à honestidade sobre o que a amplitude significa, ambos os fornecedores dizem algo semelhante, e nenhum publicou calibração por idioma.

A aba de benchmark, de novo
A página do Microsoft-Decision-1 no Foundry tem uma aba Benchmarks com uma seção de metodologia e nenhuma figura: benchmarks de decisão públicos e da comunidade, além de conjuntos internos reservados, métricas que abrangem acurácia e erro de calibração, ordem das opções variada, testes estatísticos pareados, e a afirmação de que o modelo "tem desempenho equivalente ao de modelos de decisão líderes e superior ao de outros modelos de decisão abertos avaliados com a mesma metodologia." Nada a verificar, nada a reproduzir.
A Liquid AI d1-3B publica 48,57 no Decision Index 0.2.1 — e o qualificador importa mais do que o número, porque o Decision Index é o índice da própria Liquid AI e a d1-3B é o modelo da própria Liquid AI. É um resultado pontuado pelo fornecedor num benchmark de autoria do fornecedor, posicionado pela empresa como o melhor entre os modelos de decisão com menos de 10B e à frente de um modelo de 35B na mesma escala. Trate 48,57 como uma alegação direcional, não como um número auditado. Ao lado disso, o cartão lista avaliações internas de formato de decisão com uma média de 77,1, SQuAD 2.0 com 85,3, PAWS-X com 76,9 e DecisionBench 71,8 — todas autorrelatadas, e o enquadramento "abaixo de 10B" é um qualificador genuíno, e não uma evasiva, já que o modelo tem 3,12B.
Então, a questão da calibração se resolve da mesma forma que em todo esse campo: a Liquid AI fornece um número produzido em sua própria escala, a Microsoft fornece uma metodologia e nenhum número, e nenhuma das duas fornece uma medição independente de terceiros. O único valor de calibração que importará para sua implantação é aquele que você calcular com seus próprios dados rotulados.

Serviço, licenças e o que você está realmente comprando
A latência do d1-3B é publicada e é a razão pela qual o modelo existe. Oito milissegundos por decisão em uma RTX 4090, nove em uma AMD MI325X, com throughput empacotado de 475 e 1.106 por segundo em 64 estados. Em hardware de borda: 30 ms em um Apple M5 Pro, 16 ms em um Jetson AGX Thor, 26 ms em um Jetson AGX Orin 64 GB, 50 ms em um Orin Nano. O Microsoft-Decision-1 não publica nenhum número de latência, e suas opções integradas — uma API Foundry hospedada em pay-as-you-go ou throughput provisionado reservado, com inferência em lote desabilitada — significam que você a mede por meio da sua própria implantação. Essa não é uma lacuna pequena para um modelo cujo propósito inteiro é ser chamado uma vez por documento recuperado ou ação proposta.
A licença é onde os dois divergem de uma forma que surpreende as pessoas. O Liquid AI d1-3B está marcado como lfm1.0, não Apache 2.0 — a mesma licença de família que o resto da linha LFM da Liquid, que impõe condições de uso que uma licença permissiva não impõe. Se a sua análise jurídica o lê como compatível com a OpenAI e sem amarras, não é esse o caso, e vale a pena lê-la antes de o modelo ser lançado, e não depois. O Microsoft-Decision-1 não tem nenhum peso: é um endpoint hospedado no âmbito do portfólio Direct from Azure, com autenticação Azure, faturamento unificado, sem download, e a questão da licença substituída por um contrato de serviço. Não se pode fazer fine-tuning de nenhum dos modelos pelos caminhos documentados pelos fornecedores, o que é a limitação mais severa para um modelo de decisão — um pontuador que você não consegue adaptar aos seus próprios rótulos é um pontuador cujos modos de erro você não consegue corrigir, apenas contornar.
O roteamento em torno deles é onde o OrcaRouter se encaixa nesse padrão, e apenas em um dos seus lados. Não hospedamos nem o Microsoft-Decision-1 nem o Liquid AI d1-3B: nenhum deles retorna texto, nenhum deles está no nosso catálogo, e um endpoint de pontuação de probabilidade não é um alvo de chat-completions. O que oferecemos é a metade geradora do loop — o modelo que redige a resposta que seu pontuador vai avaliar, extrai os campos que seu pontuador vai julgar ou propõe a ação que seu pontuador vai aprovar. Isso é mais de 200 modelos por trás de uma única chave compatível com OpenAI ao preço de tabela do provedor repassado com 0% de margem, então uma mudança de preço do fornecedor entra em vigor do nosso lado no mesmo dia, e o failover automático cobre a chamada de geração em um loop que não tem latência sobressalente para repetir uma.

Duas escolhas certeiras, e uma que não chega nem perto.
Escolha Liquid AI d1-3B se qualquer coisa no seu pipeline for uma imagem. Triagem de capturas de tela, extração de formulários, roteamento de QA visual, um moderador pontuando quadros de câmera — não é possível fazer com que o Microsoft-Decision-1 faça isso, e o d1-3B foi criado para isso, com benchmarks de visão publicados para respaldar a afirmação. Escolha-o também se você precisa de inferência na borda medida em dezenas de milissegundos em um Jetson ou laptop, se você quer o modelo no seu próprio hardware, ou se uma licença que você consegue ler basta para o seu departamento jurídico.
Escolha Microsoft-Decision-1 se a sua entrada for texto, os seus documentos forem longos, o seu gate for o de procurement — autenticação Azure, faturação unificada, uma avaliação de IA Responsável, um fornecedor a quem escalar — ou se o seu tráfego abranger mais do que os 16 idiomas que o d1-3B lista. Aceite que a métrica de latência em falta e a tabela de benchmarks em falta significam que as suas primeiras duas semanas com ele serão de medição, não de integração.
O único caso que não é uma decisão difícil é o trabalho multimodal: nele, a escolha foi feita quando a Microsoft escreveu "text-only" na ficha do modelo.
