
Microsoft-Decision-1 vs Intern-Decision-4B: Um Publica Sua Calibração, o Outro Publica Sua Metodologia
- OrcaNOVOOrca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 por 1M de tokens
- openaiNOVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligência
- anthropicNOVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligência
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 113 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Inteligência
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Inteligência
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Inteligência
- xAIGrok 4.72026-09-2146Inteligência
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 52 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 423 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 61 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 399 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
Coloque Microsoft-Decision-1 ao lado de Intern-Decision-4B e você obtém uma comparação que é decidida menos pela capacidade do que por aquilo que cada fornecedor estava disposto a publicar. O modelo da Microsoft chegou à disponibilidade geral no Microsoft Foundry em 8 de outubro de 2026: uma base Qwen3.5-9B, pós-treinada pela Microsoft, somente texto, contexto de 32.768 tokens, pesos não distribuídos, uma metodologia de avaliação que descreve acurácia, erro de calibração e testes estatísticos pareados — e nenhum resultado. O Intern-Decision-4B da InternLM foi publicado no Hugging Face em 26 de setembro de 2026 às 05:36:37 UTC sem qualquer anúncio por trás, é ajustado por fine-tuning a partir do Qwen3.5-4B, aceita imagens além de texto, executa em 44 milissegundos em uma única RTX 4090 e imprime uma tabela completa de valores de Brier e de erro de calibração esperado. Ambos retornam uma distribuição de probabilidade sobre as opções que você fornece. Apenas um deles informa o quão bem ele faz isso.
Essa inversão — o modelo maior e mais bem financiado sendo o opaco — é a forma inteira deste confronto, e decide a escolha para a maioria das equipas mais depressa do que qualquer linha de especificações.
O único número que os separa
A InternLM reporta Brier 0,347 e ECE 0,065 para o Intern-Decision-4B em toda a sua suíte de benchmarks, com uma pontuação média de 90,02 em Jevbench-Easy (100,00), Jevbench-Original (98,61), Jevbench-Hard (73,87), Typed Decision (80,55), ToolACE (96,45), AG News (90,82) e WildJailBreak (89,86). Esses são números relatados pelo fornecedor, no próprio harness do fornecedor, e as linhas do Jevbench em particular pertencem à própria família de benchmarks do projeto — leia-as como autoavaliação, não como verificação independente. Mas são números com uma escala declarada, e o ECE, em particular, é o valor que lhe diz se um 0,8 retornado vale a pena ser usado como base para agir.
A Microsoft não publica nada equivalente. A aba Benchmarks na página de catálogo do Microsoft-Decision-1 descreve o que foi medido e afirma que o modelo "tem desempenho equivalente ao de modelos de decisão líderes e superior ao de outros modelos de decisão abertos avaliados com a mesma metodologia", com as áreas mais fortes indicadas como raciocínio, aplicação de regras e robustez ao formato de prompt, e a mais fraca como conhecimento de domínio especializado. Sem Brier, sem ECE, sem tabela de acurácia. Se sua decisão de adoção precisa de um valor de calibração antes que você possa dimensionar um limiar de escalonamento, um desses dois modelos o entrega a você e o outro pede que você mesmo o meça.

Onde os dois contratos realmente diferem
Na superfície, esses modelos recebem a mesma chamada. Você fornece um estado, um esquema de perguntas nomeadas e um conjunto fixo de opções; em troca, recebe uma probabilidade por opção, sem um único token de texto gerado. As diferenças aparecem nas bordas desse contrato.
• Modalidade — O Microsoft-Decision-1 é explicitamente somente texto e não aceita nem produz conteúdo de imagem, áudio ou vídeo. O Intern-Decision-4B aceita imagens opcionais junto ao estado, até oito delas por chamada, o que faz dele um candidato para triagem de capturas de tela, verificações de layout de documentos e roteamento de QA visual.
• Cardinalidade de perguntas — O InternLM documenta de 1 a 16 perguntas por chamada, até 62 opções cada, em três tipos de campo (escolha, pontuação, noul). A Microsoft documenta os formatos — sim/não, múltipla escolha, avaliação, classificação, rubrica — e uma única invocação com até 32K tokens, mas não um limite de perguntas por chamada.
• Contexto — A Microsoft afirma 32.768 tokens. O cartão do Intern-Decision-4B indica os seus limites em perguntas, opções e imagens, em vez de um único número de contexto, por isso não é possível comparar os dois com base em um único número.
• Distribuição — Microsoft-Decision-1 é uma API Foundry hospedada; os pesos do modelo não são distribuídos e não há download. Intern-Decision-4B é Apache-2.0 no Hugging Face, com a licença Qwen upstream preservada como LICENSE-QWEN, o que significa manter essa licença e os avisos upstream se você redistribuir.
• Formato de custo — Os pesos do InternLM não custam nada para executar e são cotados em 44,16 ms de média, 44,60 ms de P95, em uma RTX 4090. O preço por token da Microsoft não está impresso na página do modelo de forma alguma.
• Governança — A Microsoft disponibiliza uma avaliação de IA Responsável, práticas de implantação documentadas e exclusões explícitas (não para geração de texto, perguntas e respostas abertas, conversação, tradução ou sumarização; nem para ser o único decisor automatizado em decisões consequenciais sobre pessoas). A InternLM disponibiliza um cartão de modelo que é franco quanto à proveniência — pesos "modificados por ajuste de decisão" — e nada que se assemelhe a um pacote de conformidade.

Duas razões muito diferentes pelas quais os números de latência são difíceis de comparar
A Microsoft-Decision-1 não publica um valor de latência, então não há nada para colocar ao lado da média de 44,16 ms do InternLM. Isso não é uma omissão pequena para esta carga de trabalho. Esses modelos existem para serem chamados muitas vezes dentro de um pipeline — uma vez por documento recuperado, uma vez por chamada de ferramenta proposta, uma vez por resposta sendo avaliada — e a diferença entre quatro decisões por segundo e quarenta é a diferença entre pontuar uma amostra e pontuar tudo. O número do InternLM é alcançável hoje em hardware que você pode alugar por hora; o da Microsoft tem de ser medido por meio da sua própria implantação do Foundry, e o formato de implantação que você escolher (serverless pay-as-you-go versus throughput provisionado) vai alterá-lo mais do que o próprio modelo.
É também aqui que a metade do padrão que cabe ao OrcaRouter se torna relevante, e é apenas a metade generativa. Não hospedamos o Microsoft-Decision-1 nem o Intern-Decision-4B — um modelo que devolve probabilidades em vez de texto não é algo para onde se encaminhem chat completions, e nenhum dos dois aparece no nosso catálogo. O que está por trás da nossa única chave compatível com a OpenAI é o conjunto de mais de 200 modelos que faz a escrita: o prompt de juiz elaborado por um modelo, as respostas candidatas produzidas por dois outros, a chamada de ferramenta que é pontuada antes de ser executada. O preço de tabela do provedor é repassado com 0% de margem, portanto um corte de preço num gerador entra em vigor do nosso lado no mesmo dia, e o failover automático mantém vivo o lado da geração de um ciclo de pontuação quando um único provedor se degrada — o que importa mais do que o habitual aqui, porque um pipeline que pontua tudo o que vê não tem folga para repetir uma chamada travada.

Quem deve levar qual
Escolha o Intern-Decision-4B se qualquer uma destas condições for verdadeira: você precisa pontuar imagens além de texto, precisa de um número de calibração antes de poder lançar, quer a opção de executar o modelo no seu próprio hardware dentro de um limite que você controla, ou quer fazer fine-tuning nele. O último ponto merece ênfase — um modelo de pontuação de pesos abertos de 4B com um wrapper documentado é um modelo que você pode adaptar aos seus próprios rótulos, e o Microsoft-Decision-1 é uma API hospedada sem caminho de fine-tuning e sem pesos para adaptar.
Opte pela Microsoft-Decision-1 se o obstáculo for o processo de compras, e não o desempenho: você precisa de autenticação do Azure, faturamento unificado, governança e uma avaliação de IA Responsável do fornecedor antes que qualquer coisa chegue à produção, e você precisa de um contexto de 32K para documentos longos, que os limites por chamada do 4B complicam. A falta de benchmarks publicados é um custo real, mas é um custo que você pode eliminar em uma tarde executando seu próprio conjunto rotulado nos dois modelos e comparando a ECE — o que você faria de qualquer forma antes de confiar na tabela de qualquer um dos fornecedores.
A resposta desconfortável é que ambos são baratos o suficiente para testar, de modo que a discussão quase não vale a pena. O Intern-Decision-4B precisa de uma GPU que você provavelmente já tem. O Microsoft-Decision-1 precisa de uma implantação no Foundry e de uma amostra das suas próprias decisões rotuladas. Passe seus dados pelos dois, calcule a calibração no subconjunto que importa para você e deixe os números decidirem — o que, como não poderia deixar de ser, é exatamente para isso que esses modelos servem.
