
Intern-Decision-2B vs Gemma 4 12B: Um teto de 8.192 tokens contra uma janela de 256K
- typesafeNOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 584 tok/s
- openaiNOVOOpenAI: GPT-6 Luna2026-09-2237Inteligência
- openaiNOVOOpenAI: GPT-6 Sol2026-09-2248Inteligência
- anthropicNOVOAnthropic: Claude Opus 5.52026-09-2258Inteligência
- grokNOVOGrok 4.72026-09-2146Inteligência
- OrcaNOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens · 187 tok/s
- orcaNOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 113 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligência72Código
Suponha que aquilo que você precisa julgar seja um arquivo de sinistro de seguro de quarenta páginas. internlm/Intern-Decision-2B vai recusá-lo. Não truncá-lo, não resumi-lo — recusá-lo, porque o motor de inferência incluído declara DecisionEngine(max_length=8192) e o cartão do modelo diz em linguagem simples que entradas de tamanho excessivo são "rejeitadas sem truncamento." google/gemma-4-12B-it — Gemma 4 12B Unified — vai pegar o mesmo documento, mais as fotografias digitalizadas grampeadas a ele, mais a chamada telefônica gravada, e escrever uma resposta para você. Esse contraste é a comparação inteira, e quase não tem nada a ver com as contagens de parâmetros — 2.213.241.664 contra 11.959.730.224 — que uma leitura de ficha técnica colocaria em primeiro lugar.
Intern-Decision-2B é o do meio de três checkpoints de decisão que a InternLM enviou ao Hugging Face em 26 de setembro de 2026 sem anúncio, com ajuste fino a partir de Qwen/Qwen3.5-2B e licenciado sob Apache-2.0, com os termos da Qwen preservados em conjunto. Gemma 4 12B Unified é o modelo multimodal sem encoder do Google DeepMind de maio de 2026, um sistema de qualquer para qualquer que aceita texto, imagem, áudio e vídeo e gera texto em uma janela de 256.000 tokens, em mais de 140 idiomas. Um deles é um pontuador. O outro é um generalista que, por acaso, consegue pontuar mal se você o instruir com cuidado. Decidir entre eles é menos uma questão de benchmark do que uma questão sobre qual é a forma que sua resposta já tem.
Onde os dois não são realmente comparáveis
Vale a pena ser direto sobre isso antes dos números, porque o confronto convida a uma falsa simetria.
Intern-Decision-2B não produz tokens. Ele recebe um estado, de uma a dezesseis perguntas nomeadas com até 62 opções cada e, opcionalmente, até oito imagens; renderiza um esqueleto JSON de assistente com um placeholder <decision> por campo; executa uma única passagem forward causal; lê os logits na posição imediatamente antes de cada placeholder; aplica softmax apenas sobre os símbolos válidos desse campo; e aplica uma temperatura ajustada de 2.100509348278. A saída é uma distribuição calibrada e um argmax por campo. O card declara a negativa de forma explícita: "Esta API realiza pontuação estruturada de candidatos. Ela não chama generate() nem amostra texto de forma livre."
O Gemma 4 12B gera. Tudo o que ele faz — raciocínio com pensamento configurável, chamada de funções, OCR, compreensão de gráficos, reconhecimento de fala, cobertura de 140 idiomas — passa por um loop de decodificação sobre um vocabulário de 262.144 entradas. Peça a ele uma decisão de roteamento com probabilidades e você obterá um texto contendo um número, e o número será o que o amostrador produziu, não um softmax sobre o seu conjunto de opções.
Então, a questão prática não é "qual é mais preciso". É "minha resposta já é um conjunto fechado?". Se for, o 12B é uma forma desperdiçadora de escolher de uma lista. Se não for, o Intern-Decision-2B não consegue te ajudar com precisão alguma.
O teto de entrada é a linha mais nítida entre eles.
Eis a dimensão a ponderar acima de todas as outras, porque produz falhas totais em vez de falhas degradadas.
• Comprimento de entrada — o Intern-Decision-2B aceita 8.192 tokens e rejeita de forma ruidosa qualquer coisa mais longa; o Gemma 4 12B aceita 256.000 tokens e, na própria ficha do Google, obtém 43,4% no MRCR v2 eight-needle a 128k.
• Imagens — até oito para Intern-Decision-2B, e elas contam para o mesmo orçamento de 8.192 tokens; proporção de aspecto e resolução variáveis para Gemma 4 12B, com entrada de texto e imagem intercalados em qualquer ordem.
• Modalidades de entrada — texto e imagem para um; texto, imagem, áudio e vídeo para o outro.
• Idioma — nenhuma alegação multilíngue é feita em qualquer lugar da documentação do Intern-Decision; o Gemma 4 abrange mais de 140 idiomas pré-treinados, com uma pontuação multilíngue avaliada de 83,4 no MMMLU para o de 12B.
• Saída — uma distribuição de respostas JSON tipada para um; texto gerado para o outro.
O limite de 8.192 não é arbitrário, e é isso que o torna difícil de contornar. O objetivo de decisão lê um logit em uma posição fixa por campo, então o prompt precisa conter o estado, o esquema e o esqueleto completo em uma única passada; não há estratégia de chunking que preserve o contrato. Um ticket, um e-mail, um estado JSON curto, uma captura de tela ou duas — esse é o centro do design. Um documento que precisa de recuperação é um documento para o qual este modelo não serve.
O que cada um lhe custa, contado honestamente
Intern-Decision-2B não tem endpoint hospedado nem provedor. A página do modelo do OrcaRouter para ele retorna um 404, e nada neste artigo é uma alegação de disponibilidade. Chamá-lo significa baixar aproximadamente 4,46 GB de repositório — um shard de linguagem de 3,76 GB, uma torre de visão de 612,5 MB, um projetor de 50,3 MB — e executar inference.py ao lado dos pesos em um ambiente Python 3.12 com torch 2.9.1 e transformers 5.14.1, em uma GPU pela qual você está pagando, quer ela esteja ou não pontuando decisões.
Isso não é uma desvantagem em todos os casos, e vale a pena fazer a aritmética em vez de supor. A 33,28 ms de média por requisição em uma única RTX 4090, na própria medição da InternLM, um Intern-Decision-2B hospedado localmente não cobra nada por decisão. Um generalista hospedado cobra por token, inclusive pelos tokens que gasta pensando antes de responder. Em volume, um scorer que você já tem é o instrumento mais barato — o custo é a GPU e a engenharia, não a chamada.
O Gemma 4 12B Unified também não está no nosso catálogo; se você o quiser, vai precisar baixar 11,96 bilhões de parâmetros em BF16 e servi-lo por conta própria. Onde o nosso catálogo realmente tem rotas reais do Gemma 4 é nos outros dois tamanhos, e eles são baratos: Gemma 4 26B A4B a US$ 0,06 por milhão de tokens de entrada e US$ 0,33 por milhão de saída, e Gemma 4 31B a US$ 0,13 e US$ 0,38, ambos listados com contextos de 262.144 tokens e um tempo P50 até o primeiro token que o catálogo mostra em 1,73 segundo. Se o seu problema for, na verdade, raciocínio geral em vez de uma decisão de conjunto fechado, é isso que deve ser comparado com um scorer operado localmente — mais dois modelos em uma única chave, preço de tabela do provedor repassado sem margem, e failover automático para que um modelo que você ainda está avaliando nunca se torne um ponto único de falha em um caminho de produção.

Placar, com as ressalvas anexadas
• Parâmetros — Intern-Decision-2B 2.213.241.664 em BF16, além de uma torre de visão e um projetor; Gemma 4 12B Unified 11.959.730.224 em BF16.
• Contexto — 8.192 tokens, rejeitado acima, versus 256.000 tokens.
• Saída — probabilidades calibradas e um argmax, sem texto; texto gerado, um token por vez.
• Modalidade — texto mais até oito imagens versus texto, imagem, áudio e vídeo na entrada, texto na saída.
• Evidência publicada — uma tabela de fornecedor de sete suítes com média de 84,68, uma pontuação de Brier de 0,437 e ECE de 0,100, não reproduzida por ninguém fora do laboratório; um cartão de avaliação do Google com MMLU Pro 77,2%, GPQA Diamond 78,8%, AIME 2026 sem ferramentas 77,5% e LiveCodeBench v6 72,0, além de uma listagem independente no Artificial Analysis Intelligence Index de 14,2.
• Adoção — um like e zero downloads no checkpoint de 2B, em comparação com uma família que está em circulação desde maio, com quantizações, ajustes finos e derivados que contam às centenas.
Leia as linhas de evidência de forma assimétrica, porque é exatamente isso que elas são. Os números do Google foram indexados e reproduzidos de forma independente por terceiros; os do InternLM não foram executados por ninguém fora do laboratório, e o valor de calibração, em particular, deve ser tratado como uma intenção bem documentada até ser submetido a um conjunto de testes externo. O resumo honesto não é que a tabela do fornecedor esteja errada. É que as duas colunas não têm o mesmo peso probatório, e uma comparação que exibe 84,68 ao lado de 77,2 sem dizer isso está enganando o leitor.

O que fazer com isto
Escolha o Intern-Decision-2B quando a decisão estiver genuinamente encerrada, o estado couber confortavelmente em oito mil tokens, você quiser uma probabilidade à qual possa aplicar um limiar em vez de um parágrafo que precise analisar, e você tiver o hardware e a disposição para operar um checkpoint que ninguém suporta ainda. O tamanho intermediário especificamente carrega a calibração publicada mais fraca dos três que a InternLM lançou — ECE 0,100 contra 0,066 para o modelo com metade do seu tamanho e 0,065 para o que tem quase o dobro — então, se você estiver escolhendo dentro dessa família, o 2B é aquele no qual ajustar sua própria temperatura, não aquele em que confiar pronto para uso.
Escolha o Gemma 4 12B — ou, mais praticamente, um dos dois tamanhos do Gemma 4 que realmente roteamos — quando a entrada for maior que uma página, quando houver áudio ou vídeo ou um idioma diferente do inglês envolvido, quando a resposta precisar ser explicada em vez de apenas selecionada, ou quando você não quiser possuir a pilha de inferência. O 12B é o menor dos modelos Gemma 4 com áudio nativo; o 26B A4B ativa cerca de quatro bilhões de parâmetros por token e é a maneira mais barata de entrar na família.
E se o que você realmente tem é um problema de pontuação com um documento longo anexado, nenhum destes é o instrumento certo: isso é um problema de recuperação vestido com as roupas de um artigo de comparação.

