Um cartão de destaque gerado comparando Intern-S2 e Gemini 3.1 Pro, mostrando uma página de figura científica e um gráfico alimentando um modelo multimodal à esquerda, e quatro ícones de entrada para imagem, áudio, vídeo e texto ao redor de um cartão de API fechada à direita, rotulado com o contraste entre a multimodalidade científica Apache-2.0 e um modelo principal multimodal geral fechado com contexto de 1M, com o logotipo do OrcaRouter no canto inferior direito.
Guides & Insights

Intern-S2 vs Gemini 3.1 Pro: O Confronto Multimodal que a InternLM Realmente Mediu

Autor

Rowan Sterling

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

A maioria dos confrontos desta série exige juntar as alegações de dois fornecedores. Este não. O Intern-S2, o modelo multimodal de 397 bilhões de parâmetros sob licença Apache-2.0 que a InternLM lançou hoje, e o Gemini 3.1 Pro, o modelo de raciocínio carro-chefe do Google, aparecem ambos como colunas medidas na mesma tabela de benchmark — o que faz deste o confronto direto mais justo do conjunto e, não por coincidência, aquele em que o modelo aberto tem mais a explicar. O Gemini 3.1 Pro lê texto, imagens, áudio e vídeo, mantém um contexto de 1M de tokens e vem sendo dissecado por laboratórios independentes e por tráfego de produção desde que entrou em prévia em 19 de fevereiro de 2026. O Intern-S2 lê texto, imagens e séries temporais, foi enviado ao Hugging Face esta manhã e não tem nenhuma pontuação de terceiros de qualquer tipo. Nas linhas em que ambos foram medidos, o modelo do Google vence a maioria delas.

Ambos leem imagens. É aí que a semelhança termina.

A palavra "multimodal" faz esses modelos parecerem equivalentes. Eles não são equivalentes, e a diferença está naquilo que cada um foi construído para olhar.

O caminho de visão do Intern-S2 foi treinado para consumir páginas brutas de literatura científica — figuras, equações, diagramas estruturais, layout — como uma única representação compartilhada, em vez de extrair o texto primeiro. Seus benchmarks multimodais são científicos: VQA de microscopia biológica, sensoriamento remoto, resposta a perguntas sobre gráficos científicos. Ele também aceita dados de séries temporais e pode produzir previsões, um tipo de entrada que quase nenhum modelo principal de uso geral consegue processar.

A multimodalidade do Gemini 3.1 Pro é de propósito geral e mais ampla em tipo: texto, imagem, áudio e vídeo, em um único modelo, voltada para toda a gama de tarefas de produção em que você aponta um modelo para um arquivo e faz uma pergunta. Uma gravação de reunião, uma captura de tela de UI, um gráfico em um PDF, um clipe de vídeo — tudo é válido, tudo com seis meses de avaliação pública por trás.

Se sua entrada for uma figura científica, o Intern-S2 foi criado especificamente para isso e tem os números do fornecedor para defender seu caso. Se sua entrada for qualquer outra coisa, o Gemini 3.1 Pro aceita áudio e vídeo, e o Intern-S2 não aceita nenhum dos dois. Isso resolve uma grande parte das perguntas de "qual devo usar" antes que preço ou benchmarks entrem em cena, e qualquer pessoa que lhe diga que os dois são intercambiáveis não leu a lista de entradas.

O que a tabela compartilhada mostra, lido honestamente.

Como a InternLM avaliou ambos, este é um dos poucos casos em que uma comparação direta é legítima, em vez de montada. A ressalva continua a mesma e vale a pena declará-la uma vez: todos os números do Intern-S2 são informados pelo fornecedor, executados pela InternLM em seu próprio harness por meio do OpenCompass, VLMEvalKit e AgentCompass, sem reprodução independente. Os números do Gemin​i nessa tabela também vêm da execução da comparação feita pela InternLM, embora o Gemin​i tenha um extenso histórico independente fora dela.

• Conhecimento multimodal — Gemini 3.1 Pro 83,99 no MMMU Pro vs Intern-S2 81,68.

• QA de gráficos científicos — Gemini 3.1 Pro 71,18 no ChartQAPro vs Intern-S2 71,12. Um empate técnico até duas casas decimais.

• Sensoriamento remoto — Gemini 3.1 Pro 54,27 no XLRS-Bench vs Intern-S2 51,38.

• VQA de Microscopia — Gemini 3.1 Pro 71,02 no MicroVQA vs Intern-S2 69,67.

• Tarefas multimodais científicas — Intern-S2 60.74 no SFE vs Gemini 3.1 Pro 59.57. A única vitória multimodal do Intern-S2.

• Conhecimento geral — Gemini 3.1 Pro 91,00 no MMLU Pro vs. Intern-S2 89,77.

• Matemática de nível secundário — Gemini 3.1 Pro 94,70 no HMMT-2026 vs. Intern-S2 93,56.

• Raciocínio em literatura científica — Intern-S2 55,71 em Biology-Instructions vs Gemini 3.1 Pro 13,87, e 53,95 vs 38,84 em Mol-Instructions.

• Problemas de olimpíada de ciências — Intern-S2 87,00 no FrontierScience-Olympiad vs. Gemini 3.1 Pro 79,00.

• Domínio de terminal — Gemini 3.1 Pro 73,80 no TerminalBench 2.1 vs Intern-S2 64,04.

A leitura honesta: o Gemini 3.1 Pro vence as linhas multimodais amplas por margens estreitas, o Intern-S2 vence as linhas de literatura científica aprofundada por margens enormes, e nenhum dos resultados é surpreendente considerando aquilo com que cada um foi treinado. A estreiteza das perdas multimodais é, possivelmente, o achado mais interessante — um checkpoint aberto lançado no mesmo dia ficar a dois pontos de um modelo fechado de ponta com seis meses de idade no MMMU Pro e no ChartQAPro é um resultado mais forte para o InternLM do que qualquer um de seus números arrasadores em ciência.

Contexto, saída e a pergunta de pré-visualização

A história de entradas longas se divide de forma clara. O Gemini 3.1 Pro mantém uma janela de contexto de 1M de tokens com um teto de saída de 64K — o suficiente para um conjunto extenso de documentos e uma resposta substancial. O Intern-S2 é avaliado em até 256K tokens para raciocínio em texto e 64K para multimodal, e não divulga um teto de saída; trate sua janela utilizável como menor que a do Gemini até que alguém a meça de forma independente.

Há uma ressalva operacional do lado do Google que deve constar em qualquer comparação honesta. O Gemini 3.1 Pro ainda é um modelo de pré-visualização, não uma versão GA. Modelos de pré-visualização carregam expectativas de confiabilidade mais baixas, e um painel de taxa de erro de 7 dias na página de um modelo é um lembrete constante para contornar a instabilidade em vez de construir um caminho crítico sobre ela. O Intern-S2 é um lançamento completo sob Apache-2.0, com pesos que você pode fixar — o que, contraintuitivamente, torna o novíssimo modelo aberto o mais operacionalmente estável dos dois no sentido que mais importa: ninguém pode alterá-lo debaixo de você.

• Contexto — Intern-S2 256K de texto / 64K multimodal avaliado em comparação com Gemini 3.1 Pro 1M de tokens.

• Entradas — Intern-S2 texto, imagem, séries temporais vs. Gemini 3.1 Pro texto, imagem, áudio, vídeo.

• Pesos — Intern-S2 Apache-2.0, disponíveis para download vs Gemini 3.1 Pro fechado.

• Maturidade — Intern-S2 com apenas algumas horas de existência, sem pontuação independente vs. Gemini 3.1 Pro preview desde fevereiro de 2026, amplamente e independentemente testado.

• Preço — Intern-S2 sem tabela de preços pública; auto-hospedagem ou API oficial do Intern vs Gemini 3.1 Pro US$ 2,00 de entrada / US$ 12,00 de saída por milhão, subindo para US$ 4,00/US$ 18,00 acima de 200 mil tokens de entrada.

A generated two-column scoreboard titled 'Intern-S2 vs Gemini 3.1 Pro — the scoreboard.' Left column Intern-S2-397B lists Weights Apache-2.0, Context 256K text / 64K multimodal, Inputs text image time series, Independent score none yet, Price self-host or Intern API, MMMU Pro 81.68. Right column Gemini 3.1 Pro lists Weights closed, Context 1M in / 64K out, Inputs text image audio video, Independent score 57 at launch on the then-current scale, Price $2.00 / $12.00 per 1M, MMMU Pro 83.99. Footer reads 'Intern-S2 figures are InternLM's own, unreproduced; both MMMU Pro rows as measured in InternLM's comparison table. Gemini 3.1 Pro figures per Google and independent trackers.'

Preço e onde cada um fica

O Gemini 3.1 Pro cobra US$ 2,00 por milhão de tokens de entrada e US$ 12,00 por milhão de tokens de saída no nível padrão, passando para US$ 4,00/US$ 18,00 assim que uma requisição ultrapassa 200 mil tokens de entrada — uma sobretaxa de contexto longo que pesa exatamente quando você usa a janela de 1M que justifica escolhê-lo. Ele é roteável no OrcaRouter pelo mesmo preço de tabela, repassado com 0% de markup, em uma chave que também carrega mais de 200 outros modelos; o repasse importa aqui porque uma mudança de preço do Google chega ao nosso lado no mesmo dia, em vez de depois de um ciclo de reprecificação. A DSL de roteamento é a parte útil para esta comparação específica: você pode enviar tarefas de imagem e vídeo para o Gemini 3.1 Pro e lotes de documentos científicos para um Intern-S2 auto-hospedado, e manter ambos atrás de um único endpoint sem um segundo contrato ou alteração de código.

O Intern-S2 não tem preço de API publicado. A auto-hospedagem dos pesos Apache-2.0 é o caminho que a maioria das equipes de fato seguirá, e com 403 bilhões de parâmetros isso é um verdadeiro compromisso de hardware. A API oficial do Intern existe para equipes que preferem não rodar GPUs, mas, sem uma tabela de preços pública, a comparação de custos com os US$ 2/US$ 12 do Gemini não é algo que dá para fazer no papel — você precisa solicitar cota e fazer as contas sozinho.

A screenshot of the Hugging Face model card for internlm/Intern-S2, captured September 13, 2026, showing the Apache-2.0 licence badge, the tags image-text-to-text and qwen3_5_moe, the model size of 403B parameters in BF16/F32, the Intern-S2-397B heading, an inference providers panel reading 'This model isn't deployed by any Inference Provider,' and the collection listing nine items.

A chamada

Escolha o Gemini 3.1 Pro se precisar de um modelo multimodal geral que aceita áudio e vídeo, suporta um milhão de tokens, tem meses de validação independente e pode ser alugado por token hoje. É o modelo com mais evidências e capacidade mais ampla, e o selo de pré-visualização é uma ressalva de confiabilidade, não de capacidade.

Escolha o Intern-S2 se sua entrada multimodal for científica e seus dados não puderem sair da sua infraestrutura. É o único dos dois que lê páginas de literatura bruta nativamente, faz previsões a partir de sinais de séries temporais e pode ser ajustado com fine-tuning em dados experimentais proprietários sob uma licença permissiva. Aceite que você é a primeira pessoa a executá-lo, e que a tabela de benchmark que argumenta em favor dele foi escrita pelas pessoas que o criaram.

A screenshot of the OrcaRouter model page for Gemini 3.1 Pro at orcarouter.ai/models/google/gemini-3.1-pro-preview, captured September 13, 2026, showing the model tagged FLAGSHIP and FEATURED by Google dated 2026-02-19 with Vision, Audio, Tools, JSON and Reasoning tags, a 1M-token context window and 65K max output, and pricing tiles reading input $2.00 and output $12.00 per 1M tokens.

Nenhum dos modelos vence isso de forma absoluta, e a tabela prova melhor do que um veredito poderia. Um é um generalista que por acaso é bom em ciência; o outro é um instrumento científico que por acaso é competitivo em trabalho multimodal geral — e, em um lançamento aberto no mesmo dia, "competitivo" é o resultado mais surpreendente.

Para abranger as duas metades desta comparação sem um segundo contrato: uma única chave de API que cobre mais de 200 modelos coloca o principal modelo multimodal fechado e todas as alternativas por trás de um único endpoint, para que você possa encaminhar o trabalho de imagem e vídeo de uma forma e os lotes de documentos de outra.