Um cartão de título gerado para Microsoft-Decision-1 vs. Liquid AI d1-3B, com o subtítulo "os únicos dois modelos de decisão que concordam quanto à janela de contexto", com chips exibindo 32.768 tokens em ambos, somente texto vs. texto, imagens e áudio, 25 idiomas vs. 16, API hospedada vs. pesos do lfm1.0, e um rodapé observando que os números de ambos os fornecedores são autodeclarados e não verificados.
Guides & Insights

Microsoft-Decision-1 vs Liquid AI d1-3B: Mesma Janela de 32K, Dois Sentidos Diferentes

Autor

Alistair Wren

Data de publicação

Modelos mais recentes · 20Ver todos os modelos →
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Pela primeira vez, a especificação está alinhada. Microsoft-Decision-1, disponível geralmente no Microsoft Foundry desde 8 de outubro de 2026, aceita 32.768 tokens de contexto. O mesmo vale para Liquid AI d1-3B, enviado ao Hugging Face em 5 de outubro de 2026 e anunciado pela Liquid AI dois dias depois. Ambos aceitam um estado mais um conjunto de perguntas tipadas — sim/não, escolha entre opções nomeadas, uma posição numa escala ordenada — e ambos respondem numa única passagem direta com uma distribuição de probabilidade em vez de texto gerado; Laya, Intern-Decision-4B, Kev e o resto deste nicho discordam entre si sobre o comprimento do contexto, então este é o único par em que essa dimensão fica de fora e a comparação tem de ser argumentada com base em outra coisa.

O algo mais acaba sendo o canal de entrada. O modelo da Microsoft é exclusivamente de texto, explicitamente: ele "não aceita nem produz conteúdo de imagem, áudio ou vídeo". O da Liquid AI carrega um codificador de visão SigLIP2 NaFlex de 400 milhões de parâmetros sobre um backbone de linguagem de 2,6 bilhões de parâmetros e chega a 3,12 bilhões de parâmetros no total, e foi construído exatamente para aquilo que a Microsoft descartou — avaliar uma captura de tela, um formulário digitalizado ou um quadro de câmera em relação a uma pergunta fixa. Essa divisão, somada a uma diferença de licença que não tem nada a ver com capacidade, é todo o confronto.

Onde os dois concordam, o que é mais do que você esperaria

• Janela de contexto — 32.768 tokens para Microsoft-Decision-1 e 32.768 tokens para Liquid AI d1-3B.

• Formato de saída — probabilidades calibradas sobre as opções fornecidas; nenhum dos dois gera texto, e o contador de uso da Liquid AI reporta esse fato como output_tokens: 0.

• Tipos de pergunta — tanto escolha de documento, pontuação ordenada e sim/não binário, e ambos permitem definir o conjunto de opções por solicitação em vez de retreinar uma cabeça de vocabulário.

• Abstenção — A Microsoft documenta opções explícitas de abstenção, como "cannot tell"; o esquema Decision Index da Liquid AI oferece o mesmo suporte por meio de seu conjunto de opções.

• Inferência de passagem única — uma chamada por decisão de ambos os lados, o que é o que torna qualquer uma delas viável em escala de pipeline.

Dois modelos concordarem sobre as duas restrições mais difíceis deste nicho é algo que merece uma pausa. Uma janela de 32K é o que torna um scorer de decisão utilizável num contrato completo, numa política de várias páginas ou numa longa thread de suporte; o checkpoint Laya em inglês de 512 tokens e os limites de perguntas por chamada do Intern-Decision-4B não. Se a sua entrada for curta, a maior parte deste campo é intercambiável e a decisão prende-se com a hospedagem. Se a sua entrada for longa, o campo reduz-se a estes dois.

A sensação de que apenas um deles tem

O Liquid AI d1-3B é multimodal, e a árvore de modelos deixa a linhagem evidente: LFM2.5-2.6B-Base, depois LFM2.5-VL-3B, e então d1-3B pós-treinado para decisões calibradas em uma única passagem. As imagens entram pelo codificador SigLIP2 NaFlex, e o card informa uma média de 74,1 em onze benchmarks públicos de imagem, contra 73,9 do modelo de visão base — portanto, o ajuste de decisão não lhe custou qualidade de visão. Ele também informa o experimento inverso: remova as imagens e as mesmas perguntas caem para 45,1, que é a evidência mais clara que você obterá de que o canal de percepção tem função estrutural, e não decorativa.

Microsoft-Decision-1 não tem equivalente, e a omissão é deliberada, e não algo inacabado. O cartão da Microsoft lista os usos fora do escopo como geração de texto, respostas a perguntas abertas, conversa, tradução e sumarização, e afirma separadamente que o modelo é somente texto. Para um pipeline que precisa pontuar uma captura de tela de um formulário em relação a uma rubrica, ou decidir se um quadro de câmera contém um evento de segurança, isso é um bloqueio absoluto — nenhuma engenharia de prompt recupera uma modalidade que o modelo nunca recebeu.

A contagem de idiomas segue o caminho inverso, e esta é a segunda verdadeira divisão. O Microsoft-Decision-1 lista 25 idiomas suportados, e a empresa é franca ao dizer que cobertura, qualidade e calibração "podem variar conforme o idioma", apontando idiomas que não são inglês e, especialmente, idiomas de baixos recursos como uma área de baixo desempenho. O Liquid AI d1-3B declara 16 idiomas. Em amplitude, a Microsoft está à frente no papel; quanto à honestidade sobre o que a amplitude significa, ambos os fornecedores dizem algo semelhante, e nenhum publicou calibração por idioma.

A generated two-column scoreboard for Microsoft-Decision-1 and Liquid AI d1-3B across six shared dimensions: context window 32,768 tokens for both; modality text-only versus text, images and audio through a 400M SigLIP2 NaFlex encoder on a 3.12B model; languages 25 versus 16; published scores none versus a vendor-scored value of 48.57 on Liquid AI's own Decision Index; weights not distributed versus lfm1.0 weights on Hugging Face; and latency not published versus 8 ms per decision on an RTX 4090 and 30 ms on an Apple M5 Pro. A footer notes both vendors' figures are self-reported and unreproduced.

A aba de benchmark, de novo

A página do Microsoft-Decision-1 no Foundry tem uma aba Benchmarks com uma seção de metodologia e nenhuma figura: benchmarks de decisão públicos e da comunidade, além de conjuntos internos reservados, métricas que abrangem acurácia e erro de calibração, ordem das opções variada, testes estatísticos pareados, e a afirmação de que o modelo "tem desempenho equivalente ao de modelos de decisão líderes e superior ao de outros modelos de decisão abertos avaliados com a mesma metodologia." Nada a verificar, nada a reproduzir.

A Liquid AI d1-3B publica 48,57 no Decision Index 0.2.1 — e o qualificador importa mais do que o número, porque o Decision Index é o índice da própria Liquid AI e a d1-3B é o modelo da própria Liquid AI. É um resultado pontuado pelo fornecedor num benchmark de autoria do fornecedor, posicionado pela empresa como o melhor entre os modelos de decisão com menos de 10B e à frente de um modelo de 35B na mesma escala. Trate 48,57 como uma alegação direcional, não como um número auditado. Ao lado disso, o cartão lista avaliações internas de formato de decisão com uma média de 77,1, SQuAD 2.0 com 85,3, PAWS-X com 76,9 e DecisionBench 71,8 — todas autorrelatadas, e o enquadramento "abaixo de 10B" é um qualificador genuíno, e não uma evasiva, já que o modelo tem 3,12B.

Então, a questão da calibração se resolve da mesma forma que em todo esse campo: a Liquid AI fornece um número produzido em sua própria escala, a Microsoft fornece uma metodologia e nenhum número, e nenhuma das duas fornece uma medição independente de terceiros. O único valor de calibração que importará para sua implantação é aquele que você calcular com seus próprios dados rotulados.

A screenshot of the Microsoft-Decision-1 model catalogue page on Microsoft Foundry, read 10 October 2026, headed Catalog / Models / Microsoft-Decision-1 with Details, Benchmarks, Responsible AI and License tabs. The visible text describes a decision-scoring model returning calibrated probability scores for fixed answer options instead of generated text, built on Alibaba's open-weight Qwen3.5-9B and post-trained by Microsoft, with quick facts listing publisher Microsoft, lifecycle Generally available (GA), context window 32768 and a Pricing field that links out rather than printing a rate.

Serviço, licenças e o que você está realmente comprando

A latência do d1-3B é publicada e é a razão pela qual o modelo existe. Oito milissegundos por decisão em uma RTX 4090, nove em uma AMD MI325X, com throughput empacotado de 475 e 1.106 por segundo em 64 estados. Em hardware de borda: 30 ms em um Apple M5 Pro, 16 ms em um Jetson AGX Thor, 26 ms em um Jetson AGX Orin 64 GB, 50 ms em um Orin Nano. O Microsoft-Decision-1 não publica nenhum número de latência, e suas opções integradas — uma API Foundry hospedada em pay-as-you-go ou throughput provisionado reservado, com inferência em lote desabilitada — significam que você a mede por meio da sua própria implantação. Essa não é uma lacuna pequena para um modelo cujo propósito inteiro é ser chamado uma vez por documento recuperado ou ação proposta.

A licença é onde os dois divergem de uma forma que surpreende as pessoas. O Liquid AI d1-3B está marcado como lfm1.0, não Apache 2.0 — a mesma licença de família que o resto da linha LFM da Liquid, que impõe condições de uso que uma licença permissiva não impõe. Se a sua análise jurídica o lê como compatível com a OpenAI e sem amarras, não é esse o caso, e vale a pena lê-la antes de o modelo ser lançado, e não depois. O Microsoft-Decision-1 não tem nenhum peso: é um endpoint hospedado no âmbito do portfólio Direct from Azure, com autenticação Azure, faturamento unificado, sem download, e a questão da licença substituída por um contrato de serviço. Não se pode fazer fine-tuning de nenhum dos modelos pelos caminhos documentados pelos fornecedores, o que é a limitação mais severa para um modelo de decisão — um pontuador que você não consegue adaptar aos seus próprios rótulos é um pontuador cujos modos de erro você não consegue corrigir, apenas contornar.

O roteamento em torno deles é onde o OrcaRouter se encaixa nesse padrão, e apenas em um dos seus lados. Não hospedamos nem o Microsoft-Decision-1 nem o Liquid AI d1-3B: nenhum deles retorna texto, nenhum deles está no nosso catálogo, e um endpoint de pontuação de probabilidade não é um alvo de chat-completions. O que oferecemos é a metade geradora do loop — o modelo que redige a resposta que seu pontuador vai avaliar, extrai os campos que seu pontuador vai julgar ou propõe a ação que seu pontuador vai aprovar. Isso é mais de 200 modelos por trás de uma única chave compatível com OpenAI ao preço de tabela do provedor repassado com 0% de margem, então uma mudança de preço do fornecedor entra em vigor do nosso lado no mesmo dia, e o failover automático cobre a chamada de geração em um loop que não tem latência sobressalente para repetir uma.

A screenshot of the OrcaRouter models catalogue page headed 207 models from 16 providers behind one API key and one bill, with filters for input modalities, context length, input price, status, series and supported parameters. Neither decision model appears in the catalogue.

Duas escolhas certeiras, e uma que não chega nem perto.

Escolha Liquid AI d1-3B se qualquer coisa no seu pipeline for uma imagem. Triagem de capturas de tela, extração de formulários, roteamento de QA visual, um moderador pontuando quadros de câmera — não é possível fazer com que o Microsoft-Decision-1 faça isso, e o d1-3B foi criado para isso, com benchmarks de visão publicados para respaldar a afirmação. Escolha-o também se você precisa de inferência na borda medida em dezenas de milissegundos em um Jetson ou laptop, se você quer o modelo no seu próprio hardware, ou se uma licença que você consegue ler basta para o seu departamento jurídico.

Escolha Microsoft-Decision-1 se a sua entrada for texto, os seus documentos forem longos, o seu gate for o de procurement — autenticação Azure, faturação unificada, uma avaliação de IA Responsável, um fornecedor a quem escalar — ou se o seu tráfego abranger mais do que os 16 idiomas que o d1-3B lista. Aceite que a métrica de latência em falta e a tabela de benchmarks em falta significam que as suas primeiras duas semanas com ele serão de medição, não de integração.

O único caso que não é uma decisão difícil é o trabalho multimodal: nele, a escolha foi feita quando a Microsoft escreveu "text-only" na ficha do modelo.