
Microsoft-Decision-1: O modelo da Microsoft que responde com um número em vez de uma frase
- OrcaNOVOOrca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 por 1M de tokens · 79 tok/s
- openaiNOVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligência
- anthropicNOVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligência
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 122 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Inteligência
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Inteligência
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Inteligência
- xAIGrok 4.72026-09-2146Inteligência
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 53 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 423 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 60 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 355 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
O Microsoft-Decision-1 tem uma linha em sua ficha de modelo que nenhum outro modelo da Microsoft jamais teve: não projetado para geração de texto. O modelo entrou em disponibilidade geral no Microsoft Foundry em 8 de outubro de 2026, e é um estreitamento deliberado do propósito de um modelo de linguagem. Você fornece a ele uma situação e uma pergunta com uma lista fixa de respostas — sim/não, um conjunto de múltipla escolha, uma escala de classificação, uma rubrica — e ele retorna uma probabilidade calibrada para cada opção. Sem prosa. Sem explicação. Sem campo de justificativa. A saída são números JSON e nada mais. Ele é construído sobre o modelo de pesos abertos Qwen3.5-9B, pós-treinado pela Microsoft, e a Microsoft afirma que rebaseará o modelo em outros backbones posteriormente, citando MAI e outros modelos parceiros.
Isso é um produto mais estranho do que parece à primeira vista. A posição competitiva da Microsoft em 2026 assenta em modelos de chat de fronteira e no Copilot, e o Microsoft-Decision-1 é o oposto de ambos: um pontuador de porte médio e propósito único cujo trabalho inteiro é dizer a uma aplicação qual das suas próprias opções tem maior probabilidade de estar correta, e quão confiante ele está. A questão interessante não é se ele é bom em escrever — ele é explicitamente ruim nisso e não tenta — mas se uma distribuição de probabilidade sobre opções é uma primitiva mais útil para as cargas de trabalho que as empresas realmente executam do que outro modelo de propósito geral com um modo JSON.
O que faz, precisamente
O contrato é uma chamada de entrada, uma distribuição de saída. A Microsoft lista os formatos de pergunta com suporte como sim/não, múltipla escolha, avaliação, classificação e baseado em rubrica. Cada opção recebe uma pontuação. O modelo é executado em uma única invocação sobre entradas de até 32K tokens — 32.768 é a janela de contexto declarada — e o teto prático é a entrada mais o conjunto de opções, não um orçamento de geração, porque não há geração.
Os casos de uso publicados são aqueles que uma equipe de plataforma reconheceria imediatamente:
• Avaliação de saídas de IA — avaliar uma resposta gerada com base em uma rubrica fornecida, ou decidir se ela está fundamentada nas evidências que lhe foram fornecidas.
• Classificação e roteamento — classificar uma solicitação, avaliar a relevância, fazer a triagem de uma fila, escolher um ramo do fluxo de trabalho.
• Guardrails do agente — pontue uma chamada de ferramenta ou ação de agente proposta antes que a aplicação de integração permita que ela seja executada.
• Triagem de segurança de conteúdo — sinalizar conteúdo de acordo com limites definidos pela aplicação, em vez de uma política fixa do fornecedor.
• Relevância da busca e do documento — avaliar se um documento recuperado responde a uma pergunta fornecida.
• Automação baseada em confiança — aceita automaticamente resultados de alta confiança e encaminha o restante para um humano.
A opção de abstenção é o detalhe que vale a pena notar. A Microsoft apoia explicitamente opções como "não é possível dizer" quando as evidências fornecidas são insuficientes, o que é a diferença entre um avaliador calibrado e um que é apenas confiante. E, como as pontuações retornam como números, o limiar de escalonamento é uma decisão sua — você define onde 0,7 envia algo para uma pessoa e 0,95 não.
O que ele não fará
A Microsoft é excepcionalmente explícita quanto às exclusões, e elas importam mais do que a lista de recursos para quem está dimensionando isto para um pipeline real. O Microsoft-Decision-1 não foi projetado para geração de texto, resposta a perguntas abertas, conversação, tradução ou sumarização. Não se destina a tarefas sem uma pergunta fechada e um conjunto definido de opções de resposta, nem a tarefas que exijam conhecimento ausente na entrada. É somente texto: sem imagens, áudio ou vídeo na entrada, e nada na saída. Não fornece explicações nem justificativas.
Leia esses elementos em conjunto e surge um limite no qual é fácil tropeçar. Este não é um chatbot ao qual você pode pedir que também classifique coisas, e não é um sumarizador no qual se pode acoplar uma pontuação. É uma função de pontuação com um orçamento de tokens. O próprio enquadramento da equipe — de que não deve ser o único tomador de decisão automatizado em decisões de grande impacto sobre pessoas, e não deve ser a única base para decisões envolvendo crédito, emprego, moradia, seguro, educação, saúde, direitos legais "ou domínios de impacto semelhante" — aponta na mesma direção. Ela foi projetada para ficar ao lado de uma decisão, não para sê-la.

A situação dos benchmarks é a história que ninguém quer publicar
Não há números. A página do catálogo do Microsoft Foundry para o Microsoft-Decision-1 tem uma aba Benchmarks, e está vazia de números. O que contém, em vez disso, é um parágrafo de metodologia e uma afirmação qualitativa: o modelo foi "avaliado em benchmarks de decisão públicos e comunitários e em conjuntos de testes internos reservados não utilizados no treino", a Microsoft relata que "tem um desempenho ao nível dos principais modelos de decisão e à frente de outros modelos de decisão abertos avaliados com a mesma metodologia", e as métricas utilizadas foram acurácia, erro de calibração, recall de segurança, taxas de falsos positivos e consistência de justiça, com a ordem das opções variada e testes estatísticos emparelhados aplicados.

Essa é uma descrição de metodologia séria associada a zero resultados publicados. Isso significa que toda alegação de desempenho sobre o Microsoft-Decision-1 hoje é relatada pelo fornecedor e não reproduzida, e a posição honesta para qualquer pessoa que o avalie é que a calibração — a única propriedade que torna uma probabilidade útil — não foi verificada fora da Microsoft. A empresa de fato nomeia onde acredita que o modelo é mais forte e mais fraco, o que é mais útil do que uma pontuação de manchete: mais forte em raciocínio, aplicação de regras e robustez à formatação de prompts; competitivo em classificação, recuperação, justiça, uso de ferramentas e na maioria das tarefas multilíngues; mais fraco em tarefas de conhecimento especializado de domínio.
Vale a pena ler as limitações autorrelatadas antes da lista de recursos. As pontuações podem variar com a formulação e a ordem das opções, e uma pergunta mal formulada ainda retorna uma pontuação. A calibração é mais forte em tipos de tarefa familiares. Pode se basear em conhecimento desatualizado e não fornece explicações. Quanto à cobertura multilíngue: 25 idiomas são listados como suportados, incluindo japonês, coreano, árabe, vietnamita, tailandês, turco, hindi, bengali, suaíli, hebraico, persa e ucraniano, mas a Microsoft afirma que a cobertura, a qualidade e a calibração "podem variar conforme o idioma", e lista os idiomas diferentes do inglês — especialmente os com menos recursos — como uma área de baixo desempenho. O Qwen3.5-9B subjacente suporta mais de 200 idiomas; o modelo pós-treinado suporta um quarto disso.
Como você o obtém, e quanto custa.
O Microsoft-Decision-1 é distribuído como uma API hospedada no Microsoft Foundry, no portfólio "Direct from Azure". Os pesos do modelo não são distribuídos — este não é um lançamento com pesos abertos, e não há repositório no Hugging Face para baixá-lo. Qualquer aplicação que consiga fazer solicitações HTTPS pode se integrar usando os endpoints do Foundry e a autenticação padrão do Azure. A listagem de implantação mostra opções serverless e de endpoint unificado em pagamento conforme o uso ou throughput provisionado reservado, SKU padrão, com inferência em lote desativada, e a divulgação de treinamento informa que o conjunto de dados de treinamento foi usado pela primeira vez em setembro de 2026, com coleta em andamento.
O preço não é publicado na página do modelo. O campo de preços do catálogo aponta para a página de preços de modelos da Microsoft, em vez de apresentar uma tarifa de entrada e saída, de modo que o custo por token de uma chamada ao Decision-1 é algo que você precisa procurar na área de preços do Azure ou ler numa fatura. Essa é uma lacuna real para qualquer pessoa que tente modelar o custo por decisão em escala, e vale a pena dizer isso claramente, em vez de estimar. Duas coisas são importantes saber quando você calcula o preço: 0% do custo corresponde a tokens de saída, porque não há nenhum, e a inferência em lote está desativada, portanto você não pode amortizar uma execução de pontuação em massa pelo canal de lote como faria com um modelo generativo.
Onde o OrcaRouter se encaixa nisso é do outro lado da chamada. Não hospedamos o Microsoft-Decision-1, e ele não está no nosso catálogo — um modelo que retorna probabilidades em vez de texto não é um modelo para o qual você roteia chat completions. O que nós oferecemos é a metade do padrão que de fato gera: os modelos que escrevem a rubrica, redigem as respostas candidatas ou produzem a chamada de ferramenta que o Decision-1 então pontua. Esses ficam atrás de uma única chave compatível com OpenAI, com mais de 200 modelos nela, a preço de tabela do provedor repassado com 0% de margem, então um corte de preço de um fornecedor em um modelo juiz entra em vigor do nosso lado no mesmo dia. Se você está construindo um ciclo de avaliação em que um modelo escreve e outro pontua, a chamada de pontuação vai para a Microsoft e a chamada de geração pode ir para qualquer lugar — inclusive através do DSL de roteamento, que compõe vários modelos em uma única chamada quando você quer um painel em vez de um único juiz.

Por que um scorer é uma aposta diferente de um chatbot melhor
O padrão que a Microsoft está vendendo aqui já existe em código aberto. O Intern-Decision-4B da InternLM, o d1-3B da Liquid AI, o Laya da Convai Innovations e a família Kev de Jared Palmer todos retornam distribuições calibradas sobre as opções fornecidas sem gerar texto, e a maioria deles são pesos Apache-2.0 que você pode executar no seu próprio hardware de graça. A entrada da Microsoft difere em três aspectos que não dependem de benchmarks: é uma API gerenciada com autenticação, faturamento e governança do Azure acoplados, de modo que se encaixa em um caminho de aquisição empresarial que um download do Hugging Face não; sua base é um modelo 9B, maior que a maioria daquele campo; e vem com uma avaliação de IA Responsável e uma metodologia de avaliação documentada, que muitas vezes é o requisito real de aprovação para uma implantação regulamentada.
O que ele não traz é um número. Em comparação com concorrentes abertos que publicam pontuações de Brier e erro de calibração esperado — os dois valores que dizem se um 0,8 significa 0,8 —, a Microsoft publicou uma metodologia e nenhum resultado. Enquanto não existirem testes independentes de calibração, a forma defensável de usar o Microsoft-Decision-1 é a que a própria documentação dele recomenda: valide com dados representativos do seu caso de uso, defina limiares com base no custo dos seus erros, sempre inclua uma opção de abstenção, aleatorize a ordem das opções quando a ordenação puder enviesar a resposta e mantenha uma pessoa no circuito para qualquer coisa que tenha consequências. Esse é um bom conselho para qualquer sistema de pontuação. É um conselho especialmente bom para um cuja calibração ninguém fora da empresa mediu.
