Um cartão de título principal com o texto 'Intern-Decision-0.8B vs Gemma 4 12B' e o subtítulo 'Um escreve uma resposta, o outro a pontua', exibindo os selos 'cabeça de pontuação de 0,8B, sem tokens de saída' e 'generalista multimodal de 11,95B', com o logotipo da OrcaRouter composto no canto.
Guides & Insights

Intern-Decision-0.8B vs Gemma 4 12B: uma cabeça de pontuação contra um generalista multimodal

Autor

Gideon Frost

Data de publicação

Modelos mais recentes · 20Ver todos os modelos →
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

A maneira mais barata de ver o que Intern-Decision-0.8B é — e o que não é — é colocá-lo ao lado de Gemma 4 12B, e então perceber que a comparação é quase inteiramente sobre o que cada modelo faz com sua camada de saída. Gemma 4 12B, o modelo multimodal sem encoder de 11,95 bilhões de parâmetros do DeepMind, lançado em 3 de junho de 2026 sob a licença Apache 2.0, é um generalista generativo: você fornece texto, imagens, áudio ou vídeo, e ele escreve uma resposta. Intern-Decision-0.8B, enviado discretamente pela InternLM ao Hugging Face em 26 de setembro de 2026 sem nenhum anúncio, é um ajuste fino do muito menor Qwen3.5-0.8B que não produz texto nenhum — ele recebe um estado, um esquema de perguntas nomeadas e até oito imagens, e retorna uma distribuição de probabilidade calibrada para cada pergunta após uma única passagem direta. Um escreve. O outro pontua. Tudo o que vem abaixo decorre disso.

Isso faz com que este seja um confronto estranho de enquadrar como uma disputa, e vale dizer claramente antes das linhas de especificação: esses dois não são substitutos, e quem escolhe entre eles já formulou mal o problema. O Gemma 4 12B responde à pergunta "qual deve ser a resposta". O Intern-Decision-0.8B responde à pergunta "qual destas dezesseis opções é, e quão confiante você está" — e responde sem um loop de decodificador, que é de onde vêm as diferenças de latência e custo. A comparação útil, portanto, é sobre como você conectaria cada um a um fluxo de trabalho, não sobre qual vence.

A maior diferença isolada está no lado de saída da fatura.

O Gemma 4 12B é cobrado como qualquer modelo generativo: tokens de entrada e tokens de saída, ambos. Quando lhe pede JSON estruturado, cada um desses tokens é gerado, amostrado e cobrado, e quanto mais longo e mais aninhado for o seu esquema, mais deles haverá. Isto não é uma crítica ao modelo — é o que um decodificador faz — mas é o item de linha que as cabeças de decisão existem para remover. O Intern-Decision-0.8B não tem tokens de saída. A sua ficha é explícita sobre o motivo: o caminho de inferência nunca chama generate()/, lendo logits nas posições imediatamente antes de cada <decision>/ placeholder num esqueleto pré-renderizado e aplicando um softmax apenas sobre os símbolos candidatos permitidos para esse campo. O contador de uso chamado output_tokens/ conta campos pontuados, não texto.

A consequência se intensifica em escala. Um pipeline que rotula dez mil registros com o Gemma 4 12B paga por dez mil documentos JSON; o mesmo pipeline no Intern-Decision-0.8B paga pelos prompts e nada mais. Se o número absoluto é grande depende inteiramente do seu volume e esquema, e qualquer pessoa com um orçamento por token pode calculá-lo numa planilha em dez minutos. Mas a direção não está em disputa, e é a razão pela qual uma categoria de pequenos modelos de decisão surgiu.

Latência, e por que a lacuna de parâmetros é enganosa

• Modelo de throughput — Intern-Decision-0.8B: uma única passagem direta, sem loop de decodificação. Gemma 4 12B: geração autorregressiva, um token por vez.

• Latência medida — Intern-Decision-0.8B: 33,98 ms de média / 37,50 ms p95 em uma única RTX 4090 via o caminho local do Hugging Face, segundo a própria medição do InternLM. Gemma 4 12B: não existe um valor comparável de passagem única, porque não há uma única passagem para medir.

• Pegada — Intern-Decision-0.8B: cerca de 1,73 GB de armazenamento de repositório, 852.985.920 parâmetros distribuídos entre um fragmento de linguagem de 1,50 GB, um fragmento de visão de 176 MB e um projetor de 25 MB. Gemma 4 12B: os materiais de lançamento do Google indicam 16 GB de VRAM ou memória unificada.

• Determinismo da saída — Intern-Decision-0.8B: argmax sobre os logits dos candidatos, então a mesma entrada gera o mesmo rótulo todas as vezes. Gemma 4 12B: amostragem, a menos que você fixe a temperatura em zero e, mesmo assim, o rótulo chega como texto que você precisa interpretar.

A diferença de 14x em parâmetros entre esses dois modelos não se traduz em nada parecido com uma diferença de 14x no tempo de execução em uma tarefa de decisão, porque o trabalho é de natureza diferente. O Intern-Decision-0.8B gasta sua única passada lendo o prompt — o estado, o esquema, as descrições das opções — e então para. O Gemma 4 12B gasta essa mesma leitura do prompt e então acrescenta cada token da resposta por cima. Para um esquema de dezesseis campos com rótulos descritivos de opções, a etapa de geração não é um erro de arredondamento; é a maior parte do tempo de relógio. A própria tabela da InternLM comprova o ponto acidentalmente: seu irmão de 2B registra uma média de 33,28 ms, marginalmente mais rápido que os 33,98 ms do 0.8B. Quando o processamento do prompt domina, a contagem de parâmetros deixa de ser a alavanca. img src="2.png">

A two-column scoreboard comparing Intern-Decision-0.8B with Gemma 4 12B on six shared rows: parameters 852,985,920 against 11.95B, output tokens none because logits are read rather than generated against every token generated and billed, latency 33.98 ms mean and 37.50 ms p95 against no comparable single-pass figure, input surface text plus up to eight images under an 8,192-token ceiling against text, image, audio and video with a 256K context, published evidence a vendor table unreproduced against Google's own evaluation card, and licence Apache 2.0 plus LICENSE-QWEN against Apache 2.0 under Gemma 4 terms.

Onde {{1}}Gemma 4 12B{{/1}} está simplesmente em uma categoria diferente

Seria desonesto deixar a ficha técnica no enquadramento de tarefas de decisão, porque fora desse enquadramento o Gemma 4 12B não está apenas à frente — está jogando outro esporte.

O Intern-Decision-0.8B aceita texto mais até oito imagens, e essa é toda a sua superfície de entrada. Seu teto de entrada padrão é de 8.192 tokens, rejeitados em vez de truncados, o que está bem abaixo do máximo de 262.144 de incorporação de posição que sua configuração anuncia — o teto, não a arquitetura, é a janela prática. O Gemma 4 12B recebe texto, imagem, áudio e vídeo nativamente por meio de um design sem encoder que projeta patches e formas de onda brutos diretamente no espaço de incorporação, mantém uma janela de contexto de 256K e retorna texto. O cartão publicado do Google o pontua em 77,2% no MMLU Pro, 77,5% no AIME 2026 sem ferramentas, 72,0% no LiveCodeBench v6, 78,8% no GPQA Diamond, 69,1% no MMMU Pro e 79,7% no MATH-Vision. Esses são números do fornecedor, do próprio cartão de avaliação do Google, e, ao contrário da tabela do Intern-Decision-0.8B, eles tiveram um ano de uso por terceiros por trás deles, porque o Gemma 4 foi lançado em um ecossistema — LM Studio, Ollama, llama.cpp, MLX, vLLM, SGLang, Unsloth — no primeiro dia.

Os lançamentos também não se parecem em nada, e o contraste é instrutivo. O Gemma 4 12B tinha um blog de lançamento, um relatório técnico no arXiv, uma página da família de cinco modelos, um card de avaliação e um link para download no dia em que apareceu. O Intern-Decision-0.8B tinha um model card com uma URL do GitHub que retorna 404 e um Space de demonstração que retorna 401, e apareceu menos de quarenta segundos depois de dois irmãos maiores igualmente sem documentação. Um deles é um produto. O outro é um checkpoint que alguém decidiu colocar na internet.

Ambos são Apache 2.0, e isso não é uma linha compartilhada trivial.

A única dimensão em que os dois realmente se encontram é o licenciamento, e vale um parágrafo porque é aí que a decisão muda para usuários comerciais. Ambos são Apache 2.0. O Gemma 4 12B é distribuído sob os termos de licença do Gemma 4 hospedados no Google, que o cartão do modelo identifica como Apache 2.0; o Intern-Decision-0.8B traz Apache-2.0 junto com um segundo LICENSE-QWEN/ arquivo, que é o tratamento correto para um modelo derivado de pesos do Qwen e um sinal de que a InternLM cuidou da papelada mesmo para um lançamento que não anunciou.

Isso distingue ambos da família LFM2.5 da Liquid AI, cuja LFM Open License v1.0 condiciona os direitos comerciais à permanência da sua entidade legal abaixo de um limite de receita anual de US$ 10 milhões — uma restrição real que um comprador de modelos de decisão que compara opções deve ler antes de assumir que "open weights" significa a mesma coisa em todo lugar. Se o seu caso de uso for comercial e a sua receita ultrapassar essa linha, o Apache 2.0 e a licença LFM não são intercambiáveis, e nem o Gemma 4 12B nem o Intern-Decision-0.8B têm essa restrição.

O balanço honesto sobre os números do Intern-Decision-0.8B

Todos os números de desempenho do Intern-Decision-0.8B são reportados pelo fornecedor e não foram reproduzidos. Isso não é uma formalidade — é o estado atual das evidências, e deve determinar o peso que a tabela merece. A InternLM escolheu os benchmarks, escolheu os concorrentes, executou as avaliações e publicou os resultados, e não existe nenhuma execução independente em qualquer leaderboard público. Uma consulta do modelo no Artificial Analysis não retorna absolutamente nada. img src="3.png">

A screenshot of the Hugging Face model card for internlm/Intern-Decision-0.8B, showing the tags image-text-to-text, Transformers, Safetensors, qwen3_5, decision-making, multimodal and conversational, an Apache-2.0 licence, a model size of 0.9B params in F32-BF16, a seven-file repository, and a model tree naming Qwen/Qwen3.5-0.8B-Base as the base model. The card text reads that Intern-Decision-0.8B is 'a multimodal structured decision model fine-tuned from Qwen3.5-0.8B' which 'accepts a shared state, a schema of named questions, and optional images, and returns an answer distribution for every question in one model forward pass', followed by a three-step 'How inference works' list.

Com esse rótulo aplicado, a forma do resultado ainda é informativa. O 0.8B marca 77.35 no benchmark Typed Decision da TypeSafe, contra 73.35 do Jev 1.13 — o modelo que dá nome ao benchmark — e 94.52 no ToolACE, contra 91.29. Ele tem uma média de 79.38 em toda a suíte, com seus irmãos de 2B e 4B em 84.68 e 90.02. A coluna que deveria fazer um comprador hesitar é WildJailBreak, onde ele pontua 64.48 contra 96.29 do Jev: uma lacuna de robustez de recusa desse tamanho é uma propriedade do fine-tune, e se ela vem da base Qwen3.5-0.8B, do objetivo de ajuste de decisão ou da contagem de parâmetros não está documentado em lugar nenhum. Seu perfil de calibração é a leitura mais interessante — um Brier de 0.530 e um erro de calibração esperado de 0.066, contra 0.358 e 0.095 do Jev — o que significa que ele é menos preciso no geral, mas suas confianças declaradas acompanham sua precisão mais de perto. Para um fluxo de trabalho baseado em limiares, essa distinção importa mais do que a precisão bruta, e é o tipo de coisa que a InternLM não tinha incentivo para publicar.

Em contrapartida, a ficha de avaliação do Gemma 4 12B também é um relatório do fornecedor — o Google também executou esses benchmarks —, mas ela existe no mundo desde junho, foi implantada em todos os principais runtimes locais, e qualquer discrepância teria vindo à tona. A lacuna probatória entre "não reproduzido por uma semana" e "não reproduzido por quatro meses e ninguém o contradisse" é a verdadeira diferença entre estas duas colunas.

Como você realmente os combinaria

O padrão que faz sentido não é uma escolha. Um head de decisão dá conta das chamadas estruturadas — roteamento, triagem, classificação, pontuação segundo uma rubrica — em que o conjunto de respostas é fechado, a latência importa e os tokens de saída são puro overhead. Um generalista dá conta de tudo o que exige prosa, código, síntese ou contexto longo: o resumo de escalonamento, a explicação de por que o chamado foi para cobrança, o rascunho que um humano edita.

Se você está tentando descobrir onde fica a fronteira, o experimento mais barato é colocar as duas metades atrás de um único endpoint. O OrcaRouter roteia mais de 200 modelos por meio de uma única API compatível com a OpenAI, com failover automático e preço de tabela do provedor repassado sem markup, o que significa que testar um modelo de decisão hospedado e um generalista hospedado no mesmo script custa uma chave e uma tarde. Vale a pena ser preciso sobre uma fronteira aqui: o Intern-Decision-0.8B não é um dos nossos — é um checkpoint Apache-2.0 que você baixa e executa por conta própria, e o grande motivo de escolher um modelo de 1,73 GB é que ele fica onde seus dados já estão. A metade generativa do padrão é a parte que está a uma linha de distância. Quanto ao Gemma 4 12B especificamente, ele também não está no nosso catálogo; os tamanhos do Gemma 4 que roteamos são 31B e 26B A4B, e o 12B é um download local. img src="4.png">

A screenshot of the OrcaRouter model page for typesafe/jev-1.13, dated 2026-09-24, showing a 65K token context, text input and text output, a P95 time to first token of 170 ms, and list pricing of $0.042 per million input tokens with no output rate. The description reads that Jev is TypeSafe's structured decision and evaluation model, taking a state and a set of named questions (noul, choice, score) and returning a structured answer for each, served non-streaming via POST /v1/systemone. A performance panel lower down reports a P50 time to first token of 178 ms and an output speed of 569 tokens per second.

O veredito, então, não é um vencedor. O Intern-Decision-0.8B é uma cabeça de pontuação barata, rápida e determinística, vinda de um laboratório que ainda não a explicou, com uma tabela de benchmark que ninguém reproduziu e uma coluna de robustez a recusas que deveria ser testada antes que ele chegue perto de entradas não confiáveis. O Gemma 4 12B é um generalista multimodal maduro de pesos abertos, com um cartão publicado, um relatório técnico e catorze vezes mais parâmetros, e é a ferramenta errada para uma chamada de classificação de dezesseis campos — não porque seja pior, mas porque gerar uma resposta para uma pergunta cujo conjunto de respostas você já escreveu é uma maneira cara de obter um rótulo.

Comparados neste artigo1

Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente