Um cartão de título gerado para Microsoft-Decision-1 vs Intern-Decision-0.8B, com o subtítulo 'um scorer hospedado sem números contra um checkpoint de 1,73 GB com um número nada lisonjeiro', com chips exibindo um endpoint Foundry contra 852.985.920 parâmetros, um parágrafo de metodologia versus uma pontuação de 64,48 no WildJailBreak, e 32.768 tokens contra um teto de 8.192.
Guides & Insights

Microsoft-Decision-1 vs Intern-Decision-0.8B: Meia Onça de Problemas de Jailbreak Contra um Blank Hospedado

Autor

Rowan Sterling

Data de publicação

Modelos mais recentes · 20Ver todos os modelos →
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Comece pela coluna que um post de lançamento teria deixado de fora. Intern-Decision-0.8B — o modelo de decisão de 852.985.920 parâmetros da InternLM, ajustado a partir do Qwen3.5-0.8B e enviado ao Hugging Face em 26 de setembro de 2026 sem anúncio, sem paper e com um link do GitHub que ainda dá 404 — é medido em 64,48 no WildJailBreak contra uma referência de 96,29 para o Jev 1.13 da TypeSafe. Isso não é uma diferença de arredondamento. É um colapso da robustez de recusa em um modelo cujo trabalho inteiro é julgar entradas, publicado no próprio card do fornecedor, em uma tabela cujo benchmark pertence a um concorrente. Coloque isso ao lado do Microsoft-Decision-1, que ficou disponível em geral no Microsoft Foundry em 8 de outubro de 2026 como um scorer somente de texto pós-treinado no Qwen3.5-9B, com uma metodologia de avaliação documentada e nem um único resultado impresso abaixo dela, e você tem a verdadeira forma deste confronto. Um desses modelos vai lhe dizer um número que o faz parecer ruim. O outro lhe diz quais métricas ele teria usado.

Essa inversão vale mais do que a ficha técnica. Ambos os modelos recebem um estado e um conjunto delimitado de perguntas e retornam probabilidades sobre as suas opções — nenhum dos dois gera texto e, nesse eixo, são o mesmo tipo de instrumento. As diferenças que importam são quem o opera, qual é o seu tamanho, o quanto você consegue verificar e uma coluna de segurança que o modelo menor, mais discreto e totalmente baixável decidiu publicar mesmo assim.

O que cada um realmente devolve

O Microsoft-Decision-1 é uma API hospedada, e essa é a primeira diferença estrutural. Os pesos não são distribuídos — não há download, nem repositório, nem caminho de ajuste fino — e a integração significa uma implantação no Foundry com autenticação, faturamento e governança do Azure associados. Ele executa uma única passagem sobre até 32.768 tokens, oferece suporte a perguntas de sim/não, múltipla escolha, avaliação, classificação e no formato de rubrica, e funciona apenas com texto na entrada e números na saída. Ele oferece suporte explícito a uma opção de abstenção, como "não é possível dizer", quando as evidências são insuficientes, e é isso que torna um limite significativo.

O Intern-Decision-0.8B é o arranjo oposto. São pesos Apache 2.0 com a licença Qwen upstream preservada ao lado deles como LICENSE-QWEN, cerca de 1,73 GB de repositório em três shards — um shard de linguagem de 1,50 GB, um shard de visão de 176 MB e um projetor de 25 MB — que cabe numa única GPU de consumidor ou num laptop bem equipado. Aceita um estado, um esquema de uma a dezesseis perguntas nomeadas com até 62 opções cada, e, opcionalmente, até oito imagens, e o seu inference.py incluído documenta o contrato com mais detalhes do que a maioria dos modelos lançados se dá ao trabalho: as opções são mapeadas para símbolos de token único A–Z, depois a–z, depois 0–9; os logits são lidos na posição imediatamente antes de cada marcador <decision> num esqueleto pré-renderizado; é aplicado um softmax apenas sobre os candidatos válidos desse campo; é aplicada uma temperatura ajustada.

As duas licenças não são a mesma compra. Microsoft-Decision-1 oferece a você um endpoint gerenciado e nenhum artefato que você possui. Intern-Decision-0.8B oferece a você um artefato que você possui, sem endpoint, sem contrato de suporte e sem documentação além do próprio repositório.

A screenshot of the Hugging Face model card for internlm/Intern-Decision-0.8B, showing the tags image-text-to-text, Transformers, Safetensors, qwen3_5, decision-making, multimodal and conversational, an Apache-2.0 licence, a model size of 0.9B params in F32-BF16, a seven-file repository, and a model tree naming Qwen/Qwen3.5-0.8B-Base as the base model. The card text reads that Intern-Decision-0.8B is 'a multimodal structured decision model fine-tuned from Qwen3.5-0.8B' which 'accepts a shared state, a schema of named questions, and optional images, and returns an answer distribution for every question in one model forward pass', followed by a three-step 'How inference works' list.

O teto, e a calibração que você pode auditar

Dois números decidem a maioria das integrações reais, e ambos pertencem ao modelo pequeno.

O primeiro é 8.192 tokens. O motor de inferência do Intern-Decision-0.8B recusa entradas acima do tamanho em vez de truncá-las, o que é o comportamento correto para um pontuador e também um limite intransponível: não há estratégia de chunking que preserve o contrato, porque o estado, o esquema e o esqueleto precisam estar todos em uma única passagem. O teto do Microsoft-Decision-1 é quatro vezes maior, em 32.768, e é um limite de serviço hospedado que você pode aumentar provisionando de forma diferente, em vez de uma constante em um arquivo Python.

A segunda é a calibração, e aqui a direção inverte-se. A InternLM publica uma temperatura ajustada de 2.747760550703 para o modelo de 0,8B, selecionada por minimização da NLL sobre 1.728 casos de calibração designados, com 1.693 mantidos para validação, e o cartão é explícito ao afirmar que os rótulos do conjunto de testes não foram usados para a selecionar. A transformação aplicada é um softmax sobre os logits candidatos do campo, seguido de um segundo softmax sobre o logaritmo dessa distribuição dividido pela temperatura. Como a transformação é executada após o primeiro softmax e preserva a ordenação, não pode alterar o argmax de forma alguma — altera a confiança, a probabilidade de "sim" e o valor esperado de uma pergunta de pontuação, e deixa o rótulo idêntico. Se o seu pipeline lê o rótulo, a temperatura não tem efeito. Se lê a probabilidade, aplica-lhe um limiar ou a introduz num cálculo de valor esperado, a temperatura é a diferença entre um número que significa algo e um que não significa nada. Passar temperature=1 devolve a distribuição não calibrada, se preferir ajustar a sua própria.

Microsoft-Decision-1 não tem artefato equivalente. Sua aba Benchmarks afirma que acurácia, erro de calibração, recall de segurança, taxas de falsos positivos e consistência de equidade foram medidos em benchmarks de decisão públicos e comunitários, além de conjuntos de teste internos reservados, que a ordem das opções foi variada, que testes estatísticos pareados foram aplicados, e que o modelo "tem desempenho equivalente ao de modelos de decisão líderes e superior ao de outros modelos de decisão abertos avaliados com a mesma metodologia." Não há erro de calibração exibido, nem temperatura para inspecionar, nem divisão de validação descrita. A única propriedade que torna uma probabilidade útil — se 0,8 significa 0,8 — é afirmada e não quantificada.

Leia esses dois parágrafos em contraste um com o outro e a comparação deixa de ser sobre tamanho. Um checkpoint de 0,8 bilhão de parâmetros cuja calibração você pode inspecionar e cujo software você pode executar é, para uma equipe de avaliação, um objeto mais tratável do que uma API hospedada cuja calibração é uma frase. O modelo pequeno também tem um número de latência registrado — 33,98 ms de média, 33,44 ms de mediana, 37,50 ms de p95 por consulta em uma única RTX 4090 pelo caminho local do Hugging Face, na própria medição da InternLM —, enquanto a da Microsoft é algo que você mede por meio da sua própria implantação, na qual a escolha entre throughput sem servidor e provisionado alterará o número mais do que o próprio modelo.

A two-column generated scoreboard titled Microsoft-Decision-1 vs Intern-Decision-0.8B. Left column Microsoft-Decision-1 rows read: availability Foundry GA, October 8, 2026; parameters 9B Qwen3.5 base post-trained; context 32,768 tokens; weights not distributed; calibration error not published; latency not published. Right column Intern-Decision-0.8B rows read: availability uploaded September 26, 2026; parameters 852,985,920 in 1.73 GB; input ceiling 8,192 tokens with oversize input rejected; weights Apache 2.0 and self-serve; Brier 0.530 and ECE 0.066; 33.98 ms mean on a single RTX 4090. A footer line reads that the InternLM figures are vendor-reported on InternLM's own harness with no independent reproduction.

Onde o modelo pequeno perde

Nada do que foi dito acima torna o Intern-Decision-0.8B a escolha segura, e a mesma tabela publicada explica por quê. WildJailBreak em 64,48 contra os 96,29 de Jev é uma lacuna de trinta pontos em robustez de recusa, exatamente na categoria em que um avaliador encontra entrada não confiável. Um modelo de decisão costuma ser o componente que decide se uma ação proposta é permitida; um que é fácil de contornar com conversa é um risco nessa função. Se o déficit vem da base Qwen3.5-0.8B, do objetivo de ajuste de decisão ou do pequeno número de parâmetros, isso não é algo que o repositório informa, e não há artigo, receita de treinamento nem divulgação de dados que o fariam.

O restante da própria tabela da InternLM é mais lisonjeiro do que aquela coluna e ainda assim modesto. A média em sete suítes é 79,38 para o 0,8B, contra 84,68 para seu próprio irmão 2B e 90,02 para o 4B — a família sobe acentuadamente com o tamanho, o que é um leve indício de que a tabela não foi elaborada de trás para frente para favorecer o carro-chefe. O AG News fica em 88,61, contra 89,57 do Jev, efetivamente empatados na classificação de tópicos em quatro classes. Em calibração, o 0,8B reporta um Brier de 0,530 e um erro de calibração esperado de 0,066, contra 0,358 e 0,095 do Jev — ECE melhor, precisão significativamente pior. Esse é um perfil plausível para um modelo pequeno com uma temperatura deliberadamente ajustada, e não é uma combinação que uma equipe de marketing escolheria publicar por acidente.

Também não há data de lançamento, nem anúncio, nem uma coleção que reúna os três checkpoints, nem endpoint hospedado em lugar algum, e nenhum tipo de avaliação independente. O Space de demonstração responde 401. A descrição correta do Intern-Decision-0.8B é a de um checkpoint lançado com alegações não auditadas — o que é uma situação melhor do que uma API com lista de espera, porque você pode medi-lo em uma tarde, mas significa que o ônus da validação é inteiramente seu.

Escolhendo, e onde o OrcaRouter se posiciona

Escolha o Microsoft-Decision-1 se o bloqueador for o processo de compras ou a escala: você precisa de autenticação do Azure, cobrança unificada e uma avaliação de IA Responsável antes que qualquer coisa chegue à produção; você precisa de um contexto de 32K; você precisa de um endpoint que você não opera; ou precisa que o caminho de abstenção seja projetado desde o início, em vez de implementado manualmente. Aceite em troca que você não pode executá-lo, não pode fazer fine-tuning nele, não pode inspecionar sua calibração e estará medindo por conta própria a alegação central dele.

Escolha o Intern-Decision-0.8B se o obstáculo for custo, memória ou controle: você quer um scorer Apache-2.0 que caiba em 1,73 GB, rode no hardware que você já tem, produza o mesmo rótulo todas as vezes e possa ser substituído pela sua versão irmã de 2B ou 4B alterando o caminho de um checkpoint. Em troca, aceite o limite de 8.192 tokens, a coluna WildJailBreak e o fato de que ninguém fora da InternLM reproduziu nada no card.

A recomendação honesta é fazer as duas coisas, porque são baratas o suficiente para que a discussão quase não valha a pena. A chamada de pontuação em si não é algo que roteamos — um modelo que retorna probabilidades em vez de texto não é um chat completion, e nem um nem outro está no nosso catálogo. O que a OrcaRouter oferece é a outra metade do ciclo: mais de 200 modelos por trás de uma única chave compatível com OpenAI que elaboram a rubrica, geram as respostas candidatas ou emitem a chamada de ferramenta que seu avaliador está prestes a pontuar, ao preço de tabela do provedor repassado com 0% de markup, então um corte de preço do fornecedor em um gerador entra em vigor do nosso lado no mesmo dia. O failover automático importa mais do que o normal aqui, porque um pipeline que pontua tudo o que vê não tem folga para tentar novamente uma chamada travada, e a DSL de roteamento permite enviar um prompt de juiz para vários escritores e fundir a concordância deles em vez de confiar em apenas um.

A screenshot of the OrcaRouter models catalogue page headed 207 models from 16 providers behind one API key and one bill, with filter controls for input modalities, context length, input price, status, series and supported parameters, and a search field. No decision-scoring model appears in the listing.

Conclusão

Microsoft-Decision-1 atingiu disponibilidade geral no Microsoft Foundry em 8 de outubro de 2026: hospedado, somente texto, 32.768 tokens, construído sobre o Qwen3.5-9B, com um parágrafo de metodologia no lugar de uma tabela de benchmarks. Intern-Decision-0.8B é um checkpoint Apache-2.0 de 1,73 GB carregado em 26 de setembro de 2026 que publica um Brier de 0,530, um ECE de 0,066, uma temperatura ajustada de 2,747760550703, 33,98 ms em uma 4090 — e uma pontuação WildJailBreak de 64,48 que ninguém pediu para ele imprimir. Se você só puder validar uma coisa antes de adotar qualquer um dos dois, valide a calibração nos seus próprios casos rotulados; esse é o número que ambos os fornecedores deixaram para você encontrar.