
Intern-Decision-0.8B vs Gemma 4 12B: uma cabeça de pontuação contra um generalista multimodal
- typesafeNOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 592 tok/s
- openaiNOVOOpenAI: GPT-6 Luna2026-09-2237Inteligência
- openaiNOVOOpenAI: GPT-6 Sol2026-09-2248Inteligência
- anthropicNOVOAnthropic: Claude Opus 5.52026-09-2258Inteligência
- grokNOVOGrok 4.72026-09-2146Inteligência
- OrcaNOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens · 187 tok/s
- orcaNOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 113 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligência72Código
A maneira mais barata de ver o que Intern-Decision-0.8B é — e o que não é — é colocá-lo ao lado de Gemma 4 12B, e então perceber que a comparação é quase inteiramente sobre o que cada modelo faz com sua camada de saída. Gemma 4 12B, o modelo multimodal sem encoder de 11,95 bilhões de parâmetros do DeepMind, lançado em 3 de junho de 2026 sob a licença Apache 2.0, é um generalista generativo: você fornece texto, imagens, áudio ou vídeo, e ele escreve uma resposta. Intern-Decision-0.8B, enviado discretamente pela InternLM ao Hugging Face em 26 de setembro de 2026 sem nenhum anúncio, é um ajuste fino do muito menor Qwen3.5-0.8B que não produz texto nenhum — ele recebe um estado, um esquema de perguntas nomeadas e até oito imagens, e retorna uma distribuição de probabilidade calibrada para cada pergunta após uma única passagem direta. Um escreve. O outro pontua. Tudo o que vem abaixo decorre disso.
Isso faz com que este seja um confronto estranho de enquadrar como uma disputa, e vale dizer claramente antes das linhas de especificação: esses dois não são substitutos, e quem escolhe entre eles já formulou mal o problema. O Gemma 4 12B responde à pergunta "qual deve ser a resposta". O Intern-Decision-0.8B responde à pergunta "qual destas dezesseis opções é, e quão confiante você está" — e responde sem um loop de decodificador, que é de onde vêm as diferenças de latência e custo. A comparação útil, portanto, é sobre como você conectaria cada um a um fluxo de trabalho, não sobre qual vence.
A maior diferença isolada está no lado de saída da fatura.
O Gemma 4 12B é cobrado como qualquer modelo generativo: tokens de entrada e tokens de saída, ambos. Quando lhe pede JSON estruturado, cada um desses tokens é gerado, amostrado e cobrado, e quanto mais longo e mais aninhado for o seu esquema, mais deles haverá. Isto não é uma crítica ao modelo — é o que um decodificador faz — mas é o item de linha que as cabeças de decisão existem para remover. O Intern-Decision-0.8B não tem tokens de saída. A sua ficha é explícita sobre o motivo: o caminho de inferência nunca chama generate()/, lendo logits nas posições imediatamente antes de cada <decision>/ placeholder num esqueleto pré-renderizado e aplicando um softmax apenas sobre os símbolos candidatos permitidos para esse campo. O contador de uso chamado output_tokens/ conta campos pontuados, não texto.
A consequência se intensifica em escala. Um pipeline que rotula dez mil registros com o Gemma 4 12B paga por dez mil documentos JSON; o mesmo pipeline no Intern-Decision-0.8B paga pelos prompts e nada mais. Se o número absoluto é grande depende inteiramente do seu volume e esquema, e qualquer pessoa com um orçamento por token pode calculá-lo numa planilha em dez minutos. Mas a direção não está em disputa, e é a razão pela qual uma categoria de pequenos modelos de decisão surgiu.
Latência, e por que a lacuna de parâmetros é enganosa
• Modelo de throughput — Intern-Decision-0.8B: uma única passagem direta, sem loop de decodificação. Gemma 4 12B: geração autorregressiva, um token por vez.
• Latência medida — Intern-Decision-0.8B: 33,98 ms de média / 37,50 ms p95 em uma única RTX 4090 via o caminho local do Hugging Face, segundo a própria medição do InternLM. Gemma 4 12B: não existe um valor comparável de passagem única, porque não há uma única passagem para medir.
• Pegada — Intern-Decision-0.8B: cerca de 1,73 GB de armazenamento de repositório, 852.985.920 parâmetros distribuídos entre um fragmento de linguagem de 1,50 GB, um fragmento de visão de 176 MB e um projetor de 25 MB. Gemma 4 12B: os materiais de lançamento do Google indicam 16 GB de VRAM ou memória unificada.
• Determinismo da saída — Intern-Decision-0.8B: argmax sobre os logits dos candidatos, então a mesma entrada gera o mesmo rótulo todas as vezes. Gemma 4 12B: amostragem, a menos que você fixe a temperatura em zero e, mesmo assim, o rótulo chega como texto que você precisa interpretar.
A diferença de 14x em parâmetros entre esses dois modelos não se traduz em nada parecido com uma diferença de 14x no tempo de execução em uma tarefa de decisão, porque o trabalho é de natureza diferente. O Intern-Decision-0.8B gasta sua única passada lendo o prompt — o estado, o esquema, as descrições das opções — e então para. O Gemma 4 12B gasta essa mesma leitura do prompt e então acrescenta cada token da resposta por cima. Para um esquema de dezesseis campos com rótulos descritivos de opções, a etapa de geração não é um erro de arredondamento; é a maior parte do tempo de relógio. A própria tabela da InternLM comprova o ponto acidentalmente: seu irmão de 2B registra uma média de 33,28 ms, marginalmente mais rápido que os 33,98 ms do 0.8B. Quando o processamento do prompt domina, a contagem de parâmetros deixa de ser a alavanca. img src="2.png">

Onde {{1}}Gemma 4 12B{{/1}} está simplesmente em uma categoria diferente
Seria desonesto deixar a ficha técnica no enquadramento de tarefas de decisão, porque fora desse enquadramento o Gemma 4 12B não está apenas à frente — está jogando outro esporte.
O Intern-Decision-0.8B aceita texto mais até oito imagens, e essa é toda a sua superfície de entrada. Seu teto de entrada padrão é de 8.192 tokens, rejeitados em vez de truncados, o que está bem abaixo do máximo de 262.144 de incorporação de posição que sua configuração anuncia — o teto, não a arquitetura, é a janela prática. O Gemma 4 12B recebe texto, imagem, áudio e vídeo nativamente por meio de um design sem encoder que projeta patches e formas de onda brutos diretamente no espaço de incorporação, mantém uma janela de contexto de 256K e retorna texto. O cartão publicado do Google o pontua em 77,2% no MMLU Pro, 77,5% no AIME 2026 sem ferramentas, 72,0% no LiveCodeBench v6, 78,8% no GPQA Diamond, 69,1% no MMMU Pro e 79,7% no MATH-Vision. Esses são números do fornecedor, do próprio cartão de avaliação do Google, e, ao contrário da tabela do Intern-Decision-0.8B, eles tiveram um ano de uso por terceiros por trás deles, porque o Gemma 4 foi lançado em um ecossistema — LM Studio, Ollama, llama.cpp, MLX, vLLM, SGLang, Unsloth — no primeiro dia.
Os lançamentos também não se parecem em nada, e o contraste é instrutivo. O Gemma 4 12B tinha um blog de lançamento, um relatório técnico no arXiv, uma página da família de cinco modelos, um card de avaliação e um link para download no dia em que apareceu. O Intern-Decision-0.8B tinha um model card com uma URL do GitHub que retorna 404 e um Space de demonstração que retorna 401, e apareceu menos de quarenta segundos depois de dois irmãos maiores igualmente sem documentação. Um deles é um produto. O outro é um checkpoint que alguém decidiu colocar na internet.
Ambos são Apache 2.0, e isso não é uma linha compartilhada trivial.
A única dimensão em que os dois realmente se encontram é o licenciamento, e vale um parágrafo porque é aí que a decisão muda para usuários comerciais. Ambos são Apache 2.0. O Gemma 4 12B é distribuído sob os termos de licença do Gemma 4 hospedados no Google, que o cartão do modelo identifica como Apache 2.0; o Intern-Decision-0.8B traz Apache-2.0 junto com um segundo LICENSE-QWEN/ arquivo, que é o tratamento correto para um modelo derivado de pesos do Qwen e um sinal de que a InternLM cuidou da papelada mesmo para um lançamento que não anunciou.
Isso distingue ambos da família LFM2.5 da Liquid AI, cuja LFM Open License v1.0 condiciona os direitos comerciais à permanência da sua entidade legal abaixo de um limite de receita anual de US$ 10 milhões — uma restrição real que um comprador de modelos de decisão que compara opções deve ler antes de assumir que "open weights" significa a mesma coisa em todo lugar. Se o seu caso de uso for comercial e a sua receita ultrapassar essa linha, o Apache 2.0 e a licença LFM não são intercambiáveis, e nem o Gemma 4 12B nem o Intern-Decision-0.8B têm essa restrição.
O balanço honesto sobre os números do Intern-Decision-0.8B
Todos os números de desempenho do Intern-Decision-0.8B são reportados pelo fornecedor e não foram reproduzidos. Isso não é uma formalidade — é o estado atual das evidências, e deve determinar o peso que a tabela merece. A InternLM escolheu os benchmarks, escolheu os concorrentes, executou as avaliações e publicou os resultados, e não existe nenhuma execução independente em qualquer leaderboard público. Uma consulta do modelo no Artificial Analysis não retorna absolutamente nada. img src="3.png">

Com esse rótulo aplicado, a forma do resultado ainda é informativa. O 0.8B marca 77.35 no benchmark Typed Decision da TypeSafe, contra 73.35 do Jev 1.13 — o modelo que dá nome ao benchmark — e 94.52 no ToolACE, contra 91.29. Ele tem uma média de 79.38 em toda a suíte, com seus irmãos de 2B e 4B em 84.68 e 90.02. A coluna que deveria fazer um comprador hesitar é WildJailBreak, onde ele pontua 64.48 contra 96.29 do Jev: uma lacuna de robustez de recusa desse tamanho é uma propriedade do fine-tune, e se ela vem da base Qwen3.5-0.8B, do objetivo de ajuste de decisão ou da contagem de parâmetros não está documentado em lugar nenhum. Seu perfil de calibração é a leitura mais interessante — um Brier de 0.530 e um erro de calibração esperado de 0.066, contra 0.358 e 0.095 do Jev — o que significa que ele é menos preciso no geral, mas suas confianças declaradas acompanham sua precisão mais de perto. Para um fluxo de trabalho baseado em limiares, essa distinção importa mais do que a precisão bruta, e é o tipo de coisa que a InternLM não tinha incentivo para publicar.
Em contrapartida, a ficha de avaliação do Gemma 4 12B também é um relatório do fornecedor — o Google também executou esses benchmarks —, mas ela existe no mundo desde junho, foi implantada em todos os principais runtimes locais, e qualquer discrepância teria vindo à tona. A lacuna probatória entre "não reproduzido por uma semana" e "não reproduzido por quatro meses e ninguém o contradisse" é a verdadeira diferença entre estas duas colunas.
Como você realmente os combinaria
O padrão que faz sentido não é uma escolha. Um head de decisão dá conta das chamadas estruturadas — roteamento, triagem, classificação, pontuação segundo uma rubrica — em que o conjunto de respostas é fechado, a latência importa e os tokens de saída são puro overhead. Um generalista dá conta de tudo o que exige prosa, código, síntese ou contexto longo: o resumo de escalonamento, a explicação de por que o chamado foi para cobrança, o rascunho que um humano edita.
Se você está tentando descobrir onde fica a fronteira, o experimento mais barato é colocar as duas metades atrás de um único endpoint. O OrcaRouter roteia mais de 200 modelos por meio de uma única API compatível com a OpenAI, com failover automático e preço de tabela do provedor repassado sem markup, o que significa que testar um modelo de decisão hospedado e um generalista hospedado no mesmo script custa uma chave e uma tarde. Vale a pena ser preciso sobre uma fronteira aqui: o Intern-Decision-0.8B não é um dos nossos — é um checkpoint Apache-2.0 que você baixa e executa por conta própria, e o grande motivo de escolher um modelo de 1,73 GB é que ele fica onde seus dados já estão. A metade generativa do padrão é a parte que está a uma linha de distância. Quanto ao Gemma 4 12B especificamente, ele também não está no nosso catálogo; os tamanhos do Gemma 4 que roteamos são 31B e 26B A4B, e o 12B é um download local. img src="4.png">

O veredito, então, não é um vencedor. O Intern-Decision-0.8B é uma cabeça de pontuação barata, rápida e determinística, vinda de um laboratório que ainda não a explicou, com uma tabela de benchmark que ninguém reproduziu e uma coluna de robustez a recusas que deveria ser testada antes que ele chegue perto de entradas não confiáveis. O Gemma 4 12B é um generalista multimodal maduro de pesos abertos, com um cartão publicado, um relatório técnico e catorze vezes mais parâmetros, e é a ferramenta errada para uma chamada de classificação de dezesseis campos — não porque seja pior, mas porque gerar uma resposta para uma pergunta cujo conjunto de respostas você já escreveu é uma maneira cara de obter um rótulo.
Comparados neste artigo1
Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente
