Um cartão de título gerado para a comparação entre o Decision 3.0 e o Microsoft-Decision-1, com o subtítulo 'mesmo backbone Qwen3.5-9B, formas opostas de adquiri-lo', com chips que dizem 'pesos Apache-2.0 vs. apenas hospedado', 'imagens e vídeo vs. apenas texto', 'publicado em 10 de out. vs. GA em 8 de out.', e um rodapé que diz 'Os números do Decision 3.0 são do próprio vLLM-SR; os números do Microsoft-Decision-1 são da própria Microsoft; nenhum dos dois é reproduzido de forma independente.' O logotipo do OrcaRouter está composto no canto inferior direito.
Engineering & Research

Decision 3.0 vs Microsoft-Decision-1: Um É um Download, o Outro É um SKU

Autor

Gideon Frost

Data de publicação

Modelos mais recentes · 20Ver todos os modelos →
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

O nível 9B do Decision 3.0 e do Microsoft-Decision-1são, no papel, o mesmo produto. Ambos fazem pós-treino do Qwen3.5-9B para o transformar num classificador que responde a um conjunto fixo de respostas candidatas com uma probabilidade calibrada para cada uma, sem nunca gerar um token. Ambos visam os mesmos trabalhos — encaminhar um pedido, avaliar uma saída segundo uma rubrica, validar a ação de um agente, triar uma fila. Ambos foram lançados com uma semana de diferença: o Microsoft-Decision-1 entrou em disponibilidade geral no Microsoft Foundry a 8 de outubro de 2026 e foi anunciado no dia seguinte, e o d3-flash foi enviado para o Hugging Face às 17:23 UTC de 10 de outubro de 2026.

A diferença não está no modelo. Está no que você tem permissão para fazer com ele. d3-flash é um checkpoint Apache-2.0 de 8,39 bilhões de parâmetros que você baixa e executa, ocupando a terceira posição em uma família que começa em 0,59B e chega a 26,09B. Microsoft-Decision-1 é um endpoint hospedado no Foundry, com pesos que não são distribuídos de forma alguma, em uma linha que a Microsoft diz que irá rebasear sobre seus próprios modelos MAI mais tarde. Um desses é um artefato; o outro é um serviço. Quase todas as perguntas práticas sobre o par decorrem desse único fato, incluindo as que parecem ser sobre benchmarks.

Duas decisões sobre para que serve um modelo de decisão

A publicação da Microsoft é explícita sobre o escopo de uma maneira que os cartões de modelo raramente são. Os formatos de pergunta suportados são sim/não, múltipla escolha, avaliação por nota, classificação e correção baseada em rubrica. As exclusões são listadas com a mesma clareza: não foi projetado para geração de texto, resposta a perguntas abertas, conversação, tradução ou sumarização, e não se destina a tarefas que exijam conhecimento ausente na entrada. Ele executa uma passagem por até 32.768 tokens e emite zero tokens de saída porque não há ciclo de decodificação. A Microsoft também oferece uma opção de abstenção, como "não é possível dizer", quando as evidências fornecidas são insuficientes, que é o detalhe que faz com que a aplicação de limiares à saída tenha algum sentido.

d3-flash fica dentro da mesma caixa conceitual — perguntas de Escolha, Noul (sim/não) e Pontuação, uma passagem direta por pergunta, uma probabilidade por opção, sem geração — e então amplia o lado da entrada. Enquanto o Microsoft-Decision-1 é apenas texto por design, o d3-flash aceita texto ou JSON, várias imagens por solicitação, com até 1,6 megapixels cada, e vários vídeos lidos a 2 quadros por segundo. Cada pergunta em uma solicitação vê todas as imagens e vídeos anexados a ela. É um modelo menor que faz mais com a entrada que recebe.

Essa é a primeira divisão real, e não é uma questão de gosto. Se a decisão que você precisa tomar é sobre uma captura de tela, um recibo, um gráfico ou um clipe de câmera, o Microsoft-Decision-1 não consegue tomá-la. Isso é um limite de capacidade, não uma lacuna de qualidade, e nenhuma quantidade de trabalho de precisão consegue fechá-lo.

O que cada um publica, e como

Aqui, os dois lançamentos fazem tipos genuinamente diferentes de prova, e vale a pena separá-los em vez de alinhar números.

A Microsoft realizou uma comparação de 36 benchmarks abrangendo quase 150.000 perguntas mantidas ocultas do treinamento, cobrindo roteamento, ranking, contexto longo, tarefas multilíngues e fora da distribuição, raciocínio e segurança, e afirma que seu modelo se saiu melhor em todos esses conjuntos. Ela relata a latência como uma proporção, e não como um número — p50 cerca de 35 vezes mais rápida que o GPT-6 Sol, e 2,5 vezes mais rápida que o H2O-Lightning-4B v1.1, que ela indica como o segundo colocado. Documenta a robustez como um procedimento: a mesma solicitação perturbada de oito maneiras, uma taxa média de inversão de decisão de 1,3%, e zero inversões quando as descrições das opções são parafraseadas ou as opções são invertidas ou embaralhadas. Testou a segurança em 5.250 solicitações, em 11 benchmarks que abrangem conteúdo prejudicial, jailbreak e injeção de prompt. Declara o padrão de calibração ao qual se submete — uma previsão de 90% deve estar correta cerca de nove vezes em cada dez em casos representativos.

A vLLM-SR publicou um índice. O Jev Decision Index 0.3.1 coloca o d3 em 64,7, com o d3-flash em 57,79 no public-suite, um ganho alegado de 11,0 sobre o modelo 9B do Decision 2.0, que fica em 46,76. Ele também alega que todas as 140.178 solicitações públicas foram respondidas, sem nenhuma sem suporte, o que é uma declaração de cobertura, e não de precisão. O card revela que a própria linha do d3 é uma avaliação interna, enquanto as linhas de comparação ao lado dela — Perplexity Decider v1.1, Fastino GLiDE, Jev, Torchcast Decision 27B — são dados do quadro ao vivo. E, no lado multimodal, os modelos da família d3 reportam pontuações do Perception Test em todas as 19.140 questões de validação, com o d3-flash em 73,3 contra um piso de acaso de três opções de 33,3.

Então: a Microsoft publica uma alegação de abrangência com um método documentado e um número de robustez, e nenhum valor de calibração por checkpoint. O vLLM-SR publica uma posição em leaderboard com uma lacuna de proveniência declarada entre sua própria linha e as demais, além de um resultado em vídeo, e tampouco um valor de calibração. Nenhum dos cards traz uma pontuação de Brier ou um número de erro de calibração esperado para o modelo que descreve. Para dois produtos cuja proposta de valor inteira é que o número retornado significa algo, essa é a lacuna compartilhada, e é a coisa mais útil que qualquer um dos fornecedores poderia lançar a seguir.

A generated two-column scoreboard headed 'Decision 3.0 d3-flash vs Microsoft-Decision-1 - the scoreboard'. The left column for d3-flash reads: base model Qwen3.5-9B fine-tuned, 8.39B parameters; distribution Apache-2.0 weights on Hugging Face from 10 October 2026; input text, images and video; context budget not stated on the card; reported accuracy Jev Decision Index 0.3 public suite 57.79, an internal evaluation; latency median 19.1 ms text, 149.4 ms image and 407.6 ms video. The right column for Microsoft-Decision-1 reads: base model Qwen3.5-9B post-trained, weights not distributed; distribution hosted on Microsoft Foundry, generally available 8 October 2026; input text only; context budget 32,768 tokens; reported accuracy best of 36 benchmarks covering nearly 150,000 blind questions; latency p50 around 35 times faster than GPT-6 Sol. A footer reads 'd3-flash figures are vLLM-SR's own internal evaluation; Microsoft-Decision-1 figures are Microsoft's own; neither is independently reproduced.'

A distribuição decide mais do que a ficha técnica.

É aqui que a comparação deixa de ser sobre modelos.

Com o d3-flash, você obtém os pesos, um decision_config.json que fixa a revisão base, um manifesto SHA-256 por arquivo, código de modelagem personalizado, uma cabeça de leitura e um conjunto de dependências documentado que inclui transformers==5.17.0 e um pacote opcional de kernel CUDA para as camadas de atenção linear. Você pode executá-lo no seu próprio hardware, ajustá-lo finamente, quantizá-lo, isolá-lo em rede. Você também assume o trabalho operacional: uma classe Python não é um endpoint, e o cartão não declara um orçamento de tokens para estado mais perguntas mais descrições de candidatos — max_length é null na configuração fornecida, então esse teto é seu para descobrir.

Com o Microsoft-Decision-1 você obtém um endpoint dentro de uma conta de nuvem já existente, com a autenticação, a disponibilidade regional e os controles de provisionamento que vêm com ela, e não tem nenhum trabalho operacional. Também não tem nenhum controle. Não há repositório para baixar, nenhum caminho de ajuste fino e nenhuma opção de auto-hospedagem; o ciclo de vida do modelo é da Microsoft, não seu, e um aviso de descontinuação ou um rebase sobre um backbone diferente é uma mudança que você absorve, em vez de uma que você agenda. A Microsoft declarou que um rebase sobre seus próprios modelos MAI está por vir, o que é um roteiro razoável para um modelo cujo objetivo central é a pontuação rápida em passagem única, e também significa que o checkpoint específico que você avaliou não é necessariamente aquele que você estará chamando daqui a um ano.

A história da latência também precisa ser lida com cuidado. O número de destaque da Microsoft é uma razão em relação a um modelo de propósito geral muito maior, que é a comparação correta para o seu argumento — a função de um modelo de decisão é substituir uma chamada generativa cara por uma pontuação barata, e 35x contra o GPT-6 Sol em p50 é a cara que esse argumento tem quando dá certo. Os números do vLLM-SR são absolutos, de requisição única e GPU única, e mostram o imposto da modalidade de forma clara: em uma única AMD Instinct MI325X, uma requisição de texto ao d3-flash leva uma mediana de 19,1 ms, a mesma requisição com uma imagem leva 149,4 ms, e com um vídeo de dez segundos, 407,6 ms. Ambos os conjuntos são reportados pelo fornecedor, em hardware diferente, e nenhum foi reproduzido fora do laboratório que os produziu.

A screenshot of the vllm-sr/d3 model card on Hugging Face, the flagship checkpoint of the Decision 3.0 family that d3-flash belongs to. The header shows 18 likes, the vLLM Semantic Router organisation, and tags for Transformers, Safetensors, qwen3_5, feature-extraction, decision-model, classification, system-one, multimodal, vision, video, custom_code and an Apache-2.0 licence, with the model size listed as 26B parameters in BF16. The card graphic reads 'Decision 3.0 / d3 27B'. A specification panel gives Parameters as 26.09B including the 0.46B vision encoder, Inputs as 'Text or JSON, plus images and videos (several per request)', Decision types as 'Choice - Yes / No - Score' and License as Apache-2.0. The sidebar shows 130 downloads last month, the model tree pinned to Qwen/Qwen3.8-27B, and a collection entry listing 6 items.

Como escolher

A regra de decisão é curta, o que é um bom sinal de que os dois produtos não estão realmente competindo pelo mesmo.

Escolha Microsoft-Decision-1 se a decisão for apenas de texto, se já executa no Foundry e se ser uma chamada em vez de uma implantação é o ponto central — sem GPU para comprar, sem contêiner para operar, sem ciclo de vida de modelo para gerenciar. O material de apoio da Microsoft também é o mais utilizável dos dois para uma equipe de plataforma: as perturbações, as contagens de testes de segurança e a declaração de que uma opção de abstenção é suportada são as coisas de que você precisa para escrever uma política de limiar, e o limite de 32.768 tokens é declarado em vez de deixado em branco.

Escolha Decision 3.0 — realisticamente d3-flash ou d3-mini — se qualquer parte da decisão depender de uma imagem ou de um clipe, se precisar de o executar num local a que uma API alojada não consiga chegar, ou se quiser afinar o scorer nos seus próprios casos rotulados. A licença Apache-2.0 e o manifesto de hash ao nível do ficheiro tornam isso uma opção genuína, e não teórica. O que aceita em troca é um orçamento de entrada não declarado, nenhuma calibração publicada e o facto de a família ter apenas alguns dias e praticamente nenhuma utilização externa por trás.

Se você precisar dos dois — um sistema de pontuação hospedado para o caminho de texto comum e um auto-hospedado para os casos multimodais ou de rede isolada, chamados pela mesma interface —, então a posição honesta é que nenhum fornecedor oferece isso atualmente, e os dois formatos de requisição são próximos o suficiente para serem unificados, mas não idênticos.

Onde o OrcaRouter se situa, e onde não

typesafe/jev-1.13 é o modelo de decisão do nosso catálogo, servido via POST /v1/systemone com o mesmo contrato de estado e perguntas nomeadas que ambos os modelos acima implementam: texto na entrada, JSON estruturado na saída, até aproximadamente 64K tokens de entrada, sem streaming, $0,042 por milhão de tokens de entrada, sem cobrança de conclusão porque nunca produz uma. Notavelmente, a questão do orçamento de tokens ao estilo Android, que nenhum dos cartões acima responde integralmente, é respondida aqui.

Não disponibilizamos nenhum dos dois modelos nesta comparação. Os checkpoints do Decision 3.0 são disponibilizados como um caminho de inferência local em um repositório do Hugging Face, em vez de um endpoint roteável, e o Microsoft-Decision-1 é distribuído pela própria plataforma da Microsoft e por várias plataformas de terceiros — não por nós. Nada aqui deve ser interpretado como uma alegação de disponibilidade para qualquer um deles.

O que a camada de encaminhamento realmente vale neste ciclo está na outra metade do circuito. Um scorer é barato por construção; o modelo que atua com base no seu resultado não é, e emparelhar um modelo de decisão com um generativo significa normalmente duas integrações, duas relações de faturação e dois modos de falha. Chamar ambos através de uma única chave em mais de 200 modelos — com failover automático quando um provedor oscila, e o preço de tabela do provedor repassado com 0% de margem, para que uma alteração de preço do fornecedor fique ativa no mesmo dia — significa que pode trocar o scorer sem tocar no local da chamada. Isso importa mais do que o habitual aqui, porque ambos estes modelos são suficientemente recentes para que a decisão que toma esta semana seja uma que deve conseguir reverter no próximo mês.

A screenshot of the OrcaRouter models catalogue, headed 'Models - 207 models - 16 providers - one API key, one bill'. Filter tabs read All 207, Text 172, Image 10, Embeddings 5, Video 10 and TTS 10. A panel titled 'How to call any model' lists three steps - copy the model ID from any card, paste it into the model field, POST to our OpenAI-compatible endpoint - beside a code block showing POST https://api.orcarouter.ai/v1/chat/completions. Model cards below include OpenAI: GPT-6.1 Sol and Anthropic: Claude Sonnet 5.5 at $2.00 per million input tokens and $10.00 output, and TypeSafe: Jev 1.13 at 65K context with $0.042 per million input tokens and $0.042 per million output tokens. A credit panel above shows monthly plans from $50 to $1,000.

A pergunta que decide isto daqui a seis meses

Duas equipes aplicaram pós-treinamento ao mesmo checkpoint base para chegar ao mesmo formato de produto na mesma semana e tiraram conclusões opostas sobre como ele deveria chegar a um cliente. Isso não é tanto uma coincidência de timing quanto uma bifurcação na forma como a categoria está sendo vendida: como pesos ou como serviço, como algo que você possui ou algo que você chama.

Observe três sinais. Se a mudança de base da Microsoft para a MAI ou para os seus próprios modelos altera o comportamento de precisão e latência que atualmente vende — e quanta antecedência os clientes recebem. Se a vLLM-SR publica um orçamento de entrada e um valor de calibração para o Decision 3.0, fechando a lacuna que impede que seu índice seja acionável. E se alguém fora de qualquer um dos laboratórios executa a suíte pública sobre os pesos d3 lançados, porque, neste momento, o único número que resolveria esta comparação é um que nenhum dos fornecedores produziu.