Um cartão de título gerado com os dizeres 'Intern-Decision-2B vs Gemma 4 12B', com o subtítulo '8.192 tokens contra 256.000', com os selos 'um pontuador que se recusa' e 'um generalista que escreve', com o logotipo do OrcaRouter composto no canto.
Guides & Insights

Intern-Decision-2B vs Gemma 4 12B: Um teto de 8.192 tokens contra uma janela de 256K

Autor

Gideon Frost

Data de publicação

Modelos mais recentes · 20Ver todos os modelos →
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Suponha que aquilo que você precisa julgar seja um arquivo de sinistro de seguro de quarenta páginas. internlm/Intern-Decision-2B vai recusá-lo. Não truncá-lo, não resumi-lo — recusá-lo, porque o motor de inferência incluído declara DecisionEngine(max_length=8192) e o cartão do modelo diz em linguagem simples que entradas de tamanho excessivo são "rejeitadas sem truncamento." google/gemma-4-12B-it — Gemma 4 12B Unified — vai pegar o mesmo documento, mais as fotografias digitalizadas grampeadas a ele, mais a chamada telefônica gravada, e escrever uma resposta para você. Esse contraste é a comparação inteira, e quase não tem nada a ver com as contagens de parâmetros — 2.213.241.664 contra 11.959.730.224 — que uma leitura de ficha técnica colocaria em primeiro lugar.

Intern-Decision-2B é o do meio de três checkpoints de decisão que a InternLM enviou ao Hugging Face em 26 de setembro de 2026 sem anúncio, com ajuste fino a partir de Qwen/Qwen3.5-2B e licenciado sob Apache-2.0, com os termos da Qwen preservados em conjunto. Gemma 4 12B Unified é o modelo multimodal sem encoder do Google DeepMind de maio de 2026, um sistema de qualquer para qualquer que aceita texto, imagem, áudio e vídeo e gera texto em uma janela de 256.000 tokens, em mais de 140 idiomas. Um deles é um pontuador. O outro é um generalista que, por acaso, consegue pontuar mal se você o instruir com cuidado. Decidir entre eles é menos uma questão de benchmark do que uma questão sobre qual é a forma que sua resposta já tem.

Onde os dois não são realmente comparáveis

Vale a pena ser direto sobre isso antes dos números, porque o confronto convida a uma falsa simetria.

Intern-Decision-2B não produz tokens. Ele recebe um estado, de uma a dezesseis perguntas nomeadas com até 62 opções cada e, opcionalmente, até oito imagens; renderiza um esqueleto JSON de assistente com um placeholder <decision> por campo; executa uma única passagem forward causal; lê os logits na posição imediatamente antes de cada placeholder; aplica softmax apenas sobre os símbolos válidos desse campo; e aplica uma temperatura ajustada de 2.100509348278. A saída é uma distribuição calibrada e um argmax por campo. O card declara a negativa de forma explícita: "Esta API realiza pontuação estruturada de candidatos. Ela não chama generate() nem amostra texto de forma livre."

O Gemma 4 12B gera. Tudo o que ele faz — raciocínio com pensamento configurável, chamada de funções, OCR, compreensão de gráficos, reconhecimento de fala, cobertura de 140 idiomas — passa por um loop de decodificação sobre um vocabulário de 262.144 entradas. Peça a ele uma decisão de roteamento com probabilidades e você obterá um texto contendo um número, e o número será o que o amostrador produziu, não um softmax sobre o seu conjunto de opções.

Então, a questão prática não é "qual é mais preciso". É "minha resposta já é um conjunto fechado?". Se for, o 12B é uma forma desperdiçadora de escolher de uma lista. Se não for, o Intern-Decision-2B não consegue te ajudar com precisão alguma.

O teto de entrada é a linha mais nítida entre eles.

Eis a dimensão a ponderar acima de todas as outras, porque produz falhas totais em vez de falhas degradadas.

• Comprimento de entrada — o Intern-Decision-2B aceita 8.192 tokens e rejeita de forma ruidosa qualquer coisa mais longa; o Gemma 4 12B aceita 256.000 tokens e, na própria ficha do Google, obtém 43,4% no MRCR v2 eight-needle a 128k.

• Imagens — até oito para Intern-Decision-2B, e elas contam para o mesmo orçamento de 8.192 tokens; proporção de aspecto e resolução variáveis para Gemma 4 12B, com entrada de texto e imagem intercalados em qualquer ordem.

• Modalidades de entrada — texto e imagem para um; texto, imagem, áudio e vídeo para o outro.

• Idioma — nenhuma alegação multilíngue é feita em qualquer lugar da documentação do Intern-Decision; o Gemma 4 abrange mais de 140 idiomas pré-treinados, com uma pontuação multilíngue avaliada de 83,4 no MMMLU para o de 12B.

• Saída — uma distribuição de respostas JSON tipada para um; texto gerado para o outro.

O limite de 8.192 não é arbitrário, e é isso que o torna difícil de contornar. O objetivo de decisão lê um logit em uma posição fixa por campo, então o prompt precisa conter o estado, o esquema e o esqueleto completo em uma única passada; não há estratégia de chunking que preserve o contrato. Um ticket, um e-mail, um estado JSON curto, uma captura de tela ou duas — esse é o centro do design. Um documento que precisa de recuperação é um documento para o qual este modelo não serve.

O que cada um lhe custa, contado honestamente

Intern-Decision-2B não tem endpoint hospedado nem provedor. A página do modelo do OrcaRouter para ele retorna um 404, e nada neste artigo é uma alegação de disponibilidade. Chamá-lo significa baixar aproximadamente 4,46 GB de repositório — um shard de linguagem de 3,76 GB, uma torre de visão de 612,5 MB, um projetor de 50,3 MB — e executar inference.py ao lado dos pesos em um ambiente Python 3.12 com torch 2.9.1 e transformers 5.14.1, em uma GPU pela qual você está pagando, quer ela esteja ou não pontuando decisões.

Isso não é uma desvantagem em todos os casos, e vale a pena fazer a aritmética em vez de supor. A 33,28 ms de média por requisição em uma única RTX 4090, na própria medição da InternLM, um Intern-Decision-2B hospedado localmente não cobra nada por decisão. Um generalista hospedado cobra por token, inclusive pelos tokens que gasta pensando antes de responder. Em volume, um scorer que você já tem é o instrumento mais barato — o custo é a GPU e a engenharia, não a chamada.

O Gemma 4 12B Unified também não está no nosso catálogo; se você o quiser, vai precisar baixar 11,96 bilhões de parâmetros em BF16 e servi-lo por conta própria. Onde o nosso catálogo realmente tem rotas reais do Gemma 4 é nos outros dois tamanhos, e eles são baratos: Gemma 4 26B A4B a US$ 0,06 por milhão de tokens de entrada e US$ 0,33 por milhão de saída, e Gemma 4 31B a US$ 0,13 e US$ 0,38, ambos listados com contextos de 262.144 tokens e um tempo P50 até o primeiro token que o catálogo mostra em 1,73 segundo. Se o seu problema for, na verdade, raciocínio geral em vez de uma decisão de conjunto fechado, é isso que deve ser comparado com um scorer operado localmente — mais dois modelos em uma única chave, preço de tabela do provedor repassado sem margem, e failover automático para que um modelo que você ainda está avaliando nunca se torne um ponto único de falha em um caminho de produção.

A screenshot of the OrcaRouter model page for google/gemma-4-31b-it, showing the Google breadcrumb, the model name Gemma 4 31B, a release date of 2026-04-02, the description of it as a 30.78B dense multimodal model with text and image input, a 256K token context window and configurable thinking mode, list pricing of $0.13 input and $0.38 output per million tokens, and a P50 time to first token of 1.73 seconds.

Placar, com as ressalvas anexadas

• Parâmetros — Intern-Decision-2B 2.213.241.664 em BF16, além de uma torre de visão e um projetor; Gemma 4 12B Unified 11.959.730.224 em BF16.

• Contexto — 8.192 tokens, rejeitado acima, versus 256.000 tokens.

• Saída — probabilidades calibradas e um argmax, sem texto; texto gerado, um token por vez.

• Modalidade — texto mais até oito imagens versus texto, imagem, áudio e vídeo na entrada, texto na saída.

• Evidência publicada — uma tabela de fornecedor de sete suítes com média de 84,68, uma pontuação de Brier de 0,437 e ECE de 0,100, não reproduzida por ninguém fora do laboratório; um cartão de avaliação do Google com MMLU Pro 77,2%, GPQA Diamond 78,8%, AIME 2026 sem ferramentas 77,5% e LiveCodeBench v6 72,0, além de uma listagem independente no Artificial Analysis Intelligence Index de 14,2.

• Adoção — um like e zero downloads no checkpoint de 2B, em comparação com uma família que está em circulação desde maio, com quantizações, ajustes finos e derivados que contam às centenas.

Leia as linhas de evidência de forma assimétrica, porque é exatamente isso que elas são. Os números do Google foram indexados e reproduzidos de forma independente por terceiros; os do InternLM não foram executados por ninguém fora do laboratório, e o valor de calibração, em particular, deve ser tratado como uma intenção bem documentada até ser submetido a um conjunto de testes externo. O resumo honesto não é que a tabela do fornecedor esteja errada. É que as duas colunas não têm o mesmo peso probatório, e uma comparação que exibe 84,68 ao lado de 77,2 sem dizer isso está enganando o leitor.

A two-column comparison scoreboard titled 'Intern-Decision-2B vs Gemma 4 12B'. The left column reads: Parameters 2.21B BF16 plus vision tower; Context 8,192 tokens, refused above; Output probabilities and an argmax, no text; Input text plus up to 8 images; Published evidence vendor table, unreproduced; Licence Apache 2.0 plus LICENSE-QWEN. The right column reads: Parameters 11.96B BF16; Context 256,000 tokens; Output generated text, token by token; Input text, image, audio and video; Published evidence Google card, AA Index 14.2; Licence Apache 2.0, Gemma 4 terms. A footer notes the Intern-Decision-2B figures are vendor-reported and unreproduced while the Gemma 4 12B figures come from Google's own card plus an independent Artificial Analysis index.

O que fazer com isto

Escolha o Intern-Decision-2B quando a decisão estiver genuinamente encerrada, o estado couber confortavelmente em oito mil tokens, você quiser uma probabilidade à qual possa aplicar um limiar em vez de um parágrafo que precise analisar, e você tiver o hardware e a disposição para operar um checkpoint que ninguém suporta ainda. O tamanho intermediário especificamente carrega a calibração publicada mais fraca dos três que a InternLM lançou — ECE 0,100 contra 0,066 para o modelo com metade do seu tamanho e 0,065 para o que tem quase o dobro — então, se você estiver escolhendo dentro dessa família, o 2B é aquele no qual ajustar sua própria temperatura, não aquele em que confiar pronto para uso.

Escolha o Gemma 4 12B — ou, mais praticamente, um dos dois tamanhos do Gemma 4 que realmente roteamos — quando a entrada for maior que uma página, quando houver áudio ou vídeo ou um idioma diferente do inglês envolvido, quando a resposta precisar ser explicada em vez de apenas selecionada, ou quando você não quiser possuir a pilha de inferência. O 12B é o menor dos modelos Gemma 4 com áudio nativo; o 26B A4B ativa cerca de quatro bilhões de parâmetros por token e é a maneira mais barata de entrar na família.

E se o que você realmente tem é um problema de pontuação com um documento longo anexado, nenhum destes é o instrumento certo: isso é um problema de recuperação vestido com as roupas de um artigo de comparação.

A screenshot of the google/gemma-4-12B-it model card on Hugging Face, showing the Gemma 4 banner, the Hugging Face, GitHub, launch blog, documentation and technical report links, an Apache 2.0 licence, the note that the card covers the Gemma 4 12B Unified model, and the opening paragraphs describing a multimodal family handling text, image, video and audio with a context window of up to 256K tokens and multilingual support in over 140 languages.