Um card de título gerado para Microsoft-Decision-1 vs Intern-Decision-4B, com o subtítulo 'dois avaliadores, um com números e outro sem', com chips exibindo 9B vs 4B, API hospedada vs pesos abertos, sem benchmarks publicados vs Brier 0,347 e ECE 0,065, e um rodapé de fontes observando que os números da Microsoft não foram reproduzidos e os números da InternLM são informados pelo fornecedor.
Guides & Insights

Microsoft-Decision-1 vs Intern-Decision-4B: Um Publica Sua Calibração, o Outro Publica Sua Metodologia

Autor

Alistair Wren

Data de publicação

Modelos mais recentes · 20Ver todos os modelos →
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Coloque Microsoft-Decision-1 ao lado de Intern-Decision-4B e você obtém uma comparação que é decidida menos pela capacidade do que por aquilo que cada fornecedor estava disposto a publicar. O modelo da Microsoft chegou à disponibilidade geral no Microsoft Foundry em 8 de outubro de 2026: uma base Qwen3.5-9B, pós-treinada pela Microsoft, somente texto, contexto de 32.768 tokens, pesos não distribuídos, uma metodologia de avaliação que descreve acurácia, erro de calibração e testes estatísticos pareados — e nenhum resultado. O Intern-Decision-4B da InternLM foi publicado no Hugging Face em 26 de setembro de 2026 às 05:36:37 UTC sem qualquer anúncio por trás, é ajustado por fine-tuning a partir do Qwen3.5-4B, aceita imagens além de texto, executa em 44 milissegundos em uma única RTX 4090 e imprime uma tabela completa de valores de Brier e de erro de calibração esperado. Ambos retornam uma distribuição de probabilidade sobre as opções que você fornece. Apenas um deles informa o quão bem ele faz isso.

Essa inversão — o modelo maior e mais bem financiado sendo o opaco — é a forma inteira deste confronto, e decide a escolha para a maioria das equipas mais depressa do que qualquer linha de especificações.

O único número que os separa

A InternLM reporta Brier 0,347 e ECE 0,065 para o Intern-Decision-4B em toda a sua suíte de benchmarks, com uma pontuação média de 90,02 em Jevbench-Easy (100,00), Jevbench-Original (98,61), Jevbench-Hard (73,87), Typed Decision (80,55), ToolACE (96,45), AG News (90,82) e WildJailBreak (89,86). Esses são números relatados pelo fornecedor, no próprio harness do fornecedor, e as linhas do Jevbench em particular pertencem à própria família de benchmarks do projeto — leia-as como autoavaliação, não como verificação independente. Mas são números com uma escala declarada, e o ECE, em particular, é o valor que lhe diz se um 0,8 retornado vale a pena ser usado como base para agir.

A Microsoft não publica nada equivalente. A aba Benchmarks na página de catálogo do Microsoft-Decision-1 descreve o que foi medido e afirma que o modelo "tem desempenho equivalente ao de modelos de decisão líderes e superior ao de outros modelos de decisão abertos avaliados com a mesma metodologia", com as áreas mais fortes indicadas como raciocínio, aplicação de regras e robustez ao formato de prompt, e a mais fraca como conhecimento de domínio especializado. Sem Brier, sem ECE, sem tabela de acurácia. Se sua decisão de adoção precisa de um valor de calibração antes que você possa dimensionar um limiar de escalonamento, um desses dois modelos o entrega a você e o outro pede que você mesmo o meça.

A generated two-column scoreboard for Microsoft-Decision-1 and Intern-Decision-4B across six shared dimensions: base model Qwen3.5-9B post-trained by Microsoft versus Qwen3.5-4B fine-tuned by InternLM; weights hosted API only versus Apache-2.0 download; modality text only versus text plus up to eight images; context 32,768 tokens versus per-call limits of one to sixteen questions and up to 62 options each; published scores none versus a vendor-reported average of 90.02 with Brier 0.347 and ECE 0.065; and latency not published versus 44.16 ms mean on an RTX 4090. A footer notes Microsoft figures are unreproduced and InternLM figures vendor-reported.

Onde os dois contratos realmente diferem

Na superfície, esses modelos recebem a mesma chamada. Você fornece um estado, um esquema de perguntas nomeadas e um conjunto fixo de opções; em troca, recebe uma probabilidade por opção, sem um único token de texto gerado. As diferenças aparecem nas bordas desse contrato.

• Modalidade — O Microsoft-Decision-1 é explicitamente somente texto e não aceita nem produz conteúdo de imagem, áudio ou vídeo. O Intern-Decision-4B aceita imagens opcionais junto ao estado, até oito delas por chamada, o que faz dele um candidato para triagem de capturas de tela, verificações de layout de documentos e roteamento de QA visual.

• Cardinalidade de perguntas — O InternLM documenta de 1 a 16 perguntas por chamada, até 62 opções cada, em três tipos de campo (escolha, pontuação, noul). A Microsoft documenta os formatos — sim/não, múltipla escolha, avaliação, classificação, rubrica — e uma única invocação com até 32K tokens, mas não um limite de perguntas por chamada.

• Contexto — A Microsoft afirma 32.768 tokens. O cartão do Intern-Decision-4B indica os seus limites em perguntas, opções e imagens, em vez de um único número de contexto, por isso não é possível comparar os dois com base em um único número.

• Distribuição — Microsoft-Decision-1 é uma API Foundry hospedada; os pesos do modelo não são distribuídos e não há download. Intern-Decision-4B é Apache-2.0 no Hugging Face, com a licença Qwen upstream preservada como LICENSE-QWEN, o que significa manter essa licença e os avisos upstream se você redistribuir.

• Formato de custo — Os pesos do InternLM não custam nada para executar e são cotados em 44,16 ms de média, 44,60 ms de P95, em uma RTX 4090. O preço por token da Microsoft não está impresso na página do modelo de forma alguma.

• Governança — A Microsoft disponibiliza uma avaliação de IA Responsável, práticas de implantação documentadas e exclusões explícitas (não para geração de texto, perguntas e respostas abertas, conversação, tradução ou sumarização; nem para ser o único decisor automatizado em decisões consequenciais sobre pessoas). A InternLM disponibiliza um cartão de modelo que é franco quanto à proveniência — pesos "modificados por ajuste de decisão" — e nada que se assemelhe a um pacote de conformidade.

A screenshot of the Intern-Decision-4B model card on Hugging Face, read 10 October 2026, showing the internlm organisation, 83 likes, the Image-Text-to-Text pipeline tag, Transformers and Safetensors badges, and qwen3_5 and decision-making as the listed tags alongside the model card heading.

Duas razões muito diferentes pelas quais os números de latência são difíceis de comparar

A Microsoft-Decision-1 não publica um valor de latência, então não há nada para colocar ao lado da média de 44,16 ms do InternLM. Isso não é uma omissão pequena para esta carga de trabalho. Esses modelos existem para serem chamados muitas vezes dentro de um pipeline — uma vez por documento recuperado, uma vez por chamada de ferramenta proposta, uma vez por resposta sendo avaliada — e a diferença entre quatro decisões por segundo e quarenta é a diferença entre pontuar uma amostra e pontuar tudo. O número do InternLM é alcançável hoje em hardware que você pode alugar por hora; o da Microsoft tem de ser medido por meio da sua própria implantação do Foundry, e o formato de implantação que você escolher (serverless pay-as-you-go versus throughput provisionado) vai alterá-lo mais do que o próprio modelo.

É também aqui que a metade do padrão que cabe ao OrcaRouter se torna relevante, e é apenas a metade generativa. Não hospedamos o Microsoft-Decision-1 nem o Intern-Decision-4B — um modelo que devolve probabilidades em vez de texto não é algo para onde se encaminhem chat completions, e nenhum dos dois aparece no nosso catálogo. O que está por trás da nossa única chave compatível com a OpenAI é o conjunto de mais de 200 modelos que faz a escrita: o prompt de juiz elaborado por um modelo, as respostas candidatas produzidas por dois outros, a chamada de ferramenta que é pontuada antes de ser executada. O preço de tabela do provedor é repassado com 0% de margem, portanto um corte de preço num gerador entra em vigor do nosso lado no mesmo dia, e o failover automático mantém vivo o lado da geração de um ciclo de pontuação quando um único provedor se degrada — o que importa mais do que o habitual aqui, porque um pipeline que pontua tudo o que vê não tem folga para repetir uma chamada travada.

A screenshot of the OrcaRouter models catalogue page headed 207 models from 16 providers behind one API key and one bill, with filters for input modalities, context length, input price, status, series and supported parameters. Neither decision model appears in the catalogue.

Quem deve levar qual

Escolha o Intern-Decision-4B se qualquer uma destas condições for verdadeira: você precisa pontuar imagens além de texto, precisa de um número de calibração antes de poder lançar, quer a opção de executar o modelo no seu próprio hardware dentro de um limite que você controla, ou quer fazer fine-tuning nele. O último ponto merece ênfase — um modelo de pontuação de pesos abertos de 4B com um wrapper documentado é um modelo que você pode adaptar aos seus próprios rótulos, e o Microsoft-Decision-1 é uma API hospedada sem caminho de fine-tuning e sem pesos para adaptar.

Opte pela Microsoft-Decision-1 se o obstáculo for o processo de compras, e não o desempenho: você precisa de autenticação do Azure, faturamento unificado, governança e uma avaliação de IA Responsável do fornecedor antes que qualquer coisa chegue à produção, e você precisa de um contexto de 32K para documentos longos, que os limites por chamada do 4B complicam. A falta de benchmarks publicados é um custo real, mas é um custo que você pode eliminar em uma tarde executando seu próprio conjunto rotulado nos dois modelos e comparando a ECE — o que você faria de qualquer forma antes de confiar na tabela de qualquer um dos fornecedores.

A resposta desconfortável é que ambos são baratos o suficiente para testar, de modo que a discussão quase não vale a pena. O Intern-Decision-4B precisa de uma GPU que você provavelmente já tem. O Microsoft-Decision-1 precisa de uma implantação no Foundry e de uma amostra das suas próprias decisões rotuladas. Passe seus dados pelos dois, calcule a calibração no subconjunto que importa para você e deixe os números decidirem — o que, como não poderia deixar de ser, é exatamente para isso que esses modelos servem.