Uma cartela de título gerada para Microsoft-Decision-1 vs Gemma 4 12B, com o subtítulo 'um pontuador sem tokens de saída contra um escritor sem conjunto fechado', com chips exibindo probabilidades versus prosa, contexto de 32.768 tokens versus 256.000, somente texto versus texto, imagem, áudio e vídeo, e API hospedada versus pesos abertos.
Guides & Insights

Microsoft-Decision-1 vs Gemma 4 12B: Um Escolhe da Sua Lista, Outro Escreve uma Nova para Você

Autor

Gideon Frost

Data de publicação

Modelos mais recentes · 20Ver todos os modelos →
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Coloque Microsoft-Decision-1 e Gemma 4 12B lado a lado e a diferença que decide tudo não é tamanho, precisão ou licença — é o que acontece depois que o modelo leu sua entrada. O Gemma 4 12B, modelo multimodal sem encoder de 11,96 bilhões de parâmetros da DeepMind, lançado em 3 de junho de 2026 sob a Apache 2.0, lê texto, imagens, áudio ou vídeo e então escreve para você uma resposta, token a token, em uma janela de 256.000 tokens e mais de 140 idiomas. O Microsoft-Decision-1 foi disponibilizado em geral no Microsoft Foundry em 8 de outubro de 2026 como um pontuador apenas de texto pós-treinado no Qwen3.5-9B: você entrega a ele um estado e uma pergunta cujas respostas você já enumerou, e ele retorna uma probabilidade calibrada para cada opção em uma única passagem de até 32.768 tokens, sem gerar nada. Um modelo diz qual das suas opções está certa. O outro diz quais deveriam ter sido as opções — e cobra você por cada palavra disso.

Enquadrar isto como uma competição seria um erro de categoria, e vale a pena dizê-lo antes das linhas da especificação, e não depois delas. Estes dois não são substitutos; encontram-se em extremos opostos de um fluxo de trabalho. A pergunta útil é qual extremo você está realmente construindo, porque a resposta determina se você está comprando um juiz ou um escritor.

A conta é onde a diferença deixa de ser filosófica.

O Gemma 4 12B é cobrado como todo modelo generativo: tokens de entrada e tokens de saída, ambos. Quando você pede a ele JSON estruturado, cada caractere desse JSON é gerado, amostrado e cobrado — e quanto mais aninhado for o seu esquema, mais longa será a resposta e maior será esse item de custo. Isso não é um defeito do modelo. É o que um decodificador faz, e é precisamente o item de custo que as cabeças de decisão existem para eliminar.

O Microsoft-Decision-1 não tem lado de saída a ser cobrado. Ele executa uma única passagem direta sobre seu estado, sua pergunta e seu conjunto de opções, lê uma pontuação para cada candidato e retorna. A consequência se acumula com o volume, e não com o tamanho do prompt: um pipeline que rotula dez mil registros com o Gemma 4 12B produz dez mil documentos JSON, e o mesmo pipeline em um scorer de decisão produz dez mil prompts e nada mais. Se a economia absoluta é grande depende inteiramente do seu volume e da gordura do seu esquema, e qualquer pessoa com um orçamento por token pode resolver isso numa planilha. A direção não está em disputa.

Há uma segunda assimetria, menor: a Microsoft não publica uma tarifa na página do modelo Microsoft-Decision-1. Os links de preços direcionam para a própria área de preços da Microsoft, então o custo por decisão é algo que se lê no Azure, e não no cartão. O que a página estabelece é que 0% da chamada corresponde a tokens de saída e que a inferência em lote está desativada — não é possível amortizar uma execução de pontuação em massa por meio de um canal de lote como se faria com um modelo generativo.

A two-column generated scoreboard titled Microsoft-Decision-1 vs Gemma 4 12B. Left column Microsoft-Decision-1 rows read: parameters 9B Qwen3.5 base post-trained; context 32,768 tokens; output probabilities with zero output tokens; modalities in text only; weights hosted, not distributed. Right column Gemma 4 12B rows read: parameters 11.96B encoder-free multimodal; context 256,000 tokens; output generated text billed per token; modalities in text, image, audio, video; weights Apache 2.0 and self-serve. A footer line reads that the Gemma 4 12B figures are Google-reported and Microsoft-Decision-1 has published no benchmark figures.

Mesma entrada, duas respostas diferentes

Dê a ambos os modelos um ticket de suporte ao cliente e uma pergunta. O Microsoft-Decision-1 retorna algo como 0,83 para "billing", 0,11 para "technical", 0,04 para "cancellation", 0,02 para "cannot tell". Você tem um rótulo nomeável, um número em relação ao qual pode definir um limiar e um caminho de abstenção — a Microsoft documenta que uma opção no estilo "cannot tell" é suportada quando as evidências fornecidas são insuficientes, o que é o que faz a lógica de escalonamento funcionar. O que você não recebe é um motivo.

Entregue o chamado ao Gemma 4 12B e você recebe um parágrafo. Ele consegue raciocinar sobre a solicitação com pensamento configurável, chamar funções, ler uma fatura digitalizada anexada ao chamado, transcrever a mensagem de voz anexada a ele e responder no idioma do próprio cliente. Cada uma dessas coisas é algo que o Decision-1 não consegue fazer com nenhum grau de precisão: sua superfície de entrada é texto e nada mais, e ele explicitamente não foi projetado para resposta a perguntas abertas, conversação, tradução ou sumarização.

Nenhuma parte da saída do Gemma 4 12B é uma probabilidade. Peça a ele uma decisão de roteamento com confiança e você obterá um texto contendo um número, e esse número é o que quer que o amostrador tenha produzido, em vez de um softmax sobre o conjunto de opções que você forneceu. Se um limiar a jusante depender de que esse número signifique algo, você tem um projeto de calibração nas mãos, não um pontuador.

Se a sua questão tem um conjunto fechado é toda a decisão

Este é o teste a aplicar antes de qualquer outra coisa e leva cerca de dez minutos com um quadro branco.

• Se a sua resposta vem de uma lista que você consegue enumerar de antemão — um rótulo, uma classificação, um sim/não, uma pontuação de rubrica, uma rota —, o Microsoft-Decision-1 é o instrumento correto, e o Gemma 4 12B é uma forma desperdiçadora e menos confiável de escolher a partir dessa lista. Você estaria pagando a um decodificador para adivinhar um número que você já delimitou.

• Se a sua resposta não for um conjunto fechado — resuma isto, explique aquilo, escreva a resposta, descreva o gráfico — o Microsoft-Decision-1 não pode ajudar de forma alguma. Ele não tem caminho para prosa, nenhum campo de justificativa e nenhum mecanismo para produzir qualquer coisa que você não tenha enumerado como opção.

• Se for ambos, você tem um pipeline de dois modelos em vez de uma escolha, e a questão de design interessante passa a ser qual deles controla o limiar de escalonamento. É o pontuador que o define; o redator preenche o que acontece acima e abaixo dele.

Onde o Gemma 4 12B é simplesmente um esporte diferente

Fora do enquadramento da decisão, o Gemma 4 12B não está à frente em uma linha — ele está jogando um jogo diferente, e fingir o contrário seria desonesto.

A screenshot of the google/gemma-4-12B-it model card on Hugging Face, showing the Gemma 4 banner, the Hugging Face, GitHub, launch blog, documentation and technical report links, an Apache 2.0 licence, the note that the card covers the Gemma 4 12B Unified model, and the opening paragraphs describing a multimodal family handling text, image, video and audio with a context window of up to 256K tokens and multilingual support in over 140 languages.

• Modalidades — O Microsoft-Decision-1 tem entrada apenas de texto e saída numérica. O Gemma 4 12B recebe texto, imagem, áudio e vídeo nativamente por meio de um design sem encoder que projeta patches e formas de onda brutos diretamente no espaço de embeddings, com entrada intercalada em qualquer ordem.

• Contexto — 32.768 tokens para o Microsoft-Decision-1 em comparação com 256.000 para o Gemma 4 12B, que obtém 43,4% no MRCR v2 eight-needle a 128k na própria ficha do modelo da Google.

• Idioma — 25 idiomas suportados para o Microsoft-Decision-1, com a Microsoft alertando que cobertura, qualidade e calibração "podem variar por idioma" e citando idiomas não ingleses de baixos recursos como um ponto fraco; mais de 140 para o Gemma 4 12B, com um valor avaliado de MMMLU de 83,4 para esse tamanho.

• Desempenho publicado — a aba Benchmarks do Microsoft-Decision-1 apresenta uma metodologia e nenhum número; o Google publica 77,2% no MMLU Pro, 77,5% no AIME 2026 sem ferramentas, 72,0% no LiveCodeBench v6, 78,8% no GPQA Diamond, 69,1% no MMMU Pro e 79,7% no MATH-Vision para o Gemma 4 12B.

• Distribuição — Microsoft-Decision-1 é uma API hospedada exclusiva do Foundry, sem pesos, sem download e sem caminho de ajuste fino. Gemma 4 12B são pesos Apache 2.0 que chegaram a um ecossistema desde o primeiro dia com LM Studio, Ollama, llama.cpp, MLX, vLLM, SGLang e Unsloth.

• Runtime — a pontuação de decisão é uma única passagem, sem loop de decodificação, portanto a latência escala com o prompt, e não com o comprimento da resposta; o Gemma 4 12B gera token a token, e os materiais de lançamento do Google o situam em 16 GB de VRAM ou memória unificada.

A linha do benchmark é a que merece uma pausa, na direção que menos favorece a Microsoft. Os números do Gemma 4 12B também são divulgados pelo fornecedor — mas têm meses de uso por terceiros por trás deles, em harnesses públicos, em hardware que pertence a outras pessoas. A entrada da Microsoft nessa categoria é a mais recente e a menos verificável das duas, apesar de vir da empresa maior.

Quanto cada um custa para você realmente chamar

O Gemma 4 12B na sua forma de 12B não está no nosso catálogo — se é esse o tamanho que você quer, você baixa 11,96 bilhões de parâmetros em BF16 e o serve por conta própria. O que o nosso catálogo tem é o resto da linha Gemma 4, e é barato: Gemma 4 26B A4B a $0,06 por milhão de tokens de entrada e $0,33 por milhão de saída, e Gemma 4 31B a $0,13 e $0,38, ambos listados com contextos de 262.144 tokens. Esses são preços de tabela dos fornecedores repassados sem nenhuma margem adicionada do nosso lado, atrás de uma única chave compatível com OpenAI, ao lado de mais de 200 outros modelos. Se o seu problema for, na verdade, raciocínio geral em vez de uma decisão de conjunto fechado, um desses dois tamanhos é a coisa barata de medir contra um scorer operado por você mesmo — e, se você preferir não se comprometer com um único gerador, o failover automático mantém a etapa de geração de um loop de pontuação ativa quando um provedor degrada.

A screenshot of OrcaRouter's own model page for google/gemma-4-31b-it, showing the Google breadcrumb, the model name Gemma 4 31B, a release date of 2026-04-02, the description of it as a 30.78B dense multimodal model with text and image input, a 256K token context window and configurable thinking mode, list pricing of $0.13 per million input tokens and $0.38 per million output tokens, and a P50 time to first token figure.

O Microsoft-Decision-1 é uma implantação do Foundry que você mesmo provisiona, e não está disponível por nosso intermédio. Nada neste artigo é uma declaração de disponibilidade para ele, em nenhum dos lados da chamada.

Conclusão

O Microsoft-Decision-1 passou a estar disponível para o público geral no Microsoft Foundry em 8 de outubro de 2026: um scorer somente de texto, com 32.768 tokens, sobre uma base Qwen3.5-9B, que retorna probabilidades calibradas sobre as opções que você enumera, com zero tokens de saída, sem pesos e sem números de benchmark publicados. O Gemma 4 12B é um generalista multimodal sem encoder de 11,96B, lançado em 3 de junho de 2026 sob a licença Apache 2.0, que raciocina, lê imagens e áudio e escreve respostas ao longo de 256.000 tokens. Escolha pelo formato da sua resposta, não pela contagem de parâmetros: um conjunto fechado pertence ao scorer, um aberto pertence ao escritor, e pagar por um decoder para selecionar a partir de uma lista que você já escreveu é a forma mais comum de as equipes gastarem dez vezes o que custa uma decisão.

O que o nosso catálogo traz é o resto da linha Gemma 4, e é barato: Gemma 4 26B A4B a $0.06 por milhão de tokens de entrada e $0.33 por milhão de saída , e Gemma 4 31B a $0.13 e $0.38.