
Intern-S2 vs Gemini 3.1 Pro: O Confronto Multimodal que a InternLM Realmente Mediu
- deepseekNOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- openaiNOVOOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleNOVOGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenNOVOQwen: Qwen3.8 Max (0902)2026-09-0240Inteligência72Código
- anthropicNOVOAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0340Inteligência72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligência69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Inteligência78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2134Inteligência69Código
A maioria dos confrontos desta série exige juntar as alegações de dois fornecedores. Este não. O Intern-S2, o modelo multimodal de 397 bilhões de parâmetros sob licença Apache-2.0 que a InternLM lançou hoje, e o Gemini 3.1 Pro, o modelo de raciocínio carro-chefe do Google, aparecem ambos como colunas medidas na mesma tabela de benchmark — o que faz deste o confronto direto mais justo do conjunto e, não por coincidência, aquele em que o modelo aberto tem mais a explicar. O Gemini 3.1 Pro lê texto, imagens, áudio e vídeo, mantém um contexto de 1M de tokens e vem sendo dissecado por laboratórios independentes e por tráfego de produção desde que entrou em prévia em 19 de fevereiro de 2026. O Intern-S2 lê texto, imagens e séries temporais, foi enviado ao Hugging Face esta manhã e não tem nenhuma pontuação de terceiros de qualquer tipo. Nas linhas em que ambos foram medidos, o modelo do Google vence a maioria delas.
Ambos leem imagens. É aí que a semelhança termina.
A palavra "multimodal" faz esses modelos parecerem equivalentes. Eles não são equivalentes, e a diferença está naquilo que cada um foi construído para olhar.
O caminho de visão do Intern-S2 foi treinado para consumir páginas brutas de literatura científica — figuras, equações, diagramas estruturais, layout — como uma única representação compartilhada, em vez de extrair o texto primeiro. Seus benchmarks multimodais são científicos: VQA de microscopia biológica, sensoriamento remoto, resposta a perguntas sobre gráficos científicos. Ele também aceita dados de séries temporais e pode produzir previsões, um tipo de entrada que quase nenhum modelo principal de uso geral consegue processar.
A multimodalidade do Gemini 3.1 Pro é de propósito geral e mais ampla em tipo: texto, imagem, áudio e vídeo, em um único modelo, voltada para toda a gama de tarefas de produção em que você aponta um modelo para um arquivo e faz uma pergunta. Uma gravação de reunião, uma captura de tela de UI, um gráfico em um PDF, um clipe de vídeo — tudo é válido, tudo com seis meses de avaliação pública por trás.
Se sua entrada for uma figura científica, o Intern-S2 foi criado especificamente para isso e tem os números do fornecedor para defender seu caso. Se sua entrada for qualquer outra coisa, o Gemini 3.1 Pro aceita áudio e vídeo, e o Intern-S2 não aceita nenhum dos dois. Isso resolve uma grande parte das perguntas de "qual devo usar" antes que preço ou benchmarks entrem em cena, e qualquer pessoa que lhe diga que os dois são intercambiáveis não leu a lista de entradas.
O que a tabela compartilhada mostra, lido honestamente.
Como a InternLM avaliou ambos, este é um dos poucos casos em que uma comparação direta é legítima, em vez de montada. A ressalva continua a mesma e vale a pena declará-la uma vez: todos os números do Intern-S2 são informados pelo fornecedor, executados pela InternLM em seu próprio harness por meio do OpenCompass, VLMEvalKit e AgentCompass, sem reprodução independente. Os números do Gemini nessa tabela também vêm da execução da comparação feita pela InternLM, embora o Gemini tenha um extenso histórico independente fora dela.
• Conhecimento multimodal — Gemini 3.1 Pro 83,99 no MMMU Pro vs Intern-S2 81,68.
• QA de gráficos científicos — Gemini 3.1 Pro 71,18 no ChartQAPro vs Intern-S2 71,12. Um empate técnico até duas casas decimais.
• Sensoriamento remoto — Gemini 3.1 Pro 54,27 no XLRS-Bench vs Intern-S2 51,38.
• VQA de Microscopia — Gemini 3.1 Pro 71,02 no MicroVQA vs Intern-S2 69,67.
• Tarefas multimodais científicas — Intern-S2 60.74 no SFE vs Gemini 3.1 Pro 59.57. A única vitória multimodal do Intern-S2.
• Conhecimento geral — Gemini 3.1 Pro 91,00 no MMLU Pro vs. Intern-S2 89,77.
• Matemática de nível secundário — Gemini 3.1 Pro 94,70 no HMMT-2026 vs. Intern-S2 93,56.
• Raciocínio em literatura científica — Intern-S2 55,71 em Biology-Instructions vs Gemini 3.1 Pro 13,87, e 53,95 vs 38,84 em Mol-Instructions.
• Problemas de olimpíada de ciências — Intern-S2 87,00 no FrontierScience-Olympiad vs. Gemini 3.1 Pro 79,00.
• Domínio de terminal — Gemini 3.1 Pro 73,80 no TerminalBench 2.1 vs Intern-S2 64,04.
A leitura honesta: o Gemini 3.1 Pro vence as linhas multimodais amplas por margens estreitas, o Intern-S2 vence as linhas de literatura científica aprofundada por margens enormes, e nenhum dos resultados é surpreendente considerando aquilo com que cada um foi treinado. A estreiteza das perdas multimodais é, possivelmente, o achado mais interessante — um checkpoint aberto lançado no mesmo dia ficar a dois pontos de um modelo fechado de ponta com seis meses de idade no MMMU Pro e no ChartQAPro é um resultado mais forte para o InternLM do que qualquer um de seus números arrasadores em ciência.
Contexto, saída e a pergunta de pré-visualização
A história de entradas longas se divide de forma clara. O Gemini 3.1 Pro mantém uma janela de contexto de 1M de tokens com um teto de saída de 64K — o suficiente para um conjunto extenso de documentos e uma resposta substancial. O Intern-S2 é avaliado em até 256K tokens para raciocínio em texto e 64K para multimodal, e não divulga um teto de saída; trate sua janela utilizável como menor que a do Gemini até que alguém a meça de forma independente.
Há uma ressalva operacional do lado do Google que deve constar em qualquer comparação honesta. O Gemini 3.1 Pro ainda é um modelo de pré-visualização, não uma versão GA. Modelos de pré-visualização carregam expectativas de confiabilidade mais baixas, e um painel de taxa de erro de 7 dias na página de um modelo é um lembrete constante para contornar a instabilidade em vez de construir um caminho crítico sobre ela. O Intern-S2 é um lançamento completo sob Apache-2.0, com pesos que você pode fixar — o que, contraintuitivamente, torna o novíssimo modelo aberto o mais operacionalmente estável dos dois no sentido que mais importa: ninguém pode alterá-lo debaixo de você.
• Contexto — Intern-S2 256K de texto / 64K multimodal avaliado em comparação com Gemini 3.1 Pro 1M de tokens.
• Entradas — Intern-S2 texto, imagem, séries temporais vs. Gemini 3.1 Pro texto, imagem, áudio, vídeo.
• Pesos — Intern-S2 Apache-2.0, disponíveis para download vs Gemini 3.1 Pro fechado.
• Maturidade — Intern-S2 com apenas algumas horas de existência, sem pontuação independente vs. Gemini 3.1 Pro preview desde fevereiro de 2026, amplamente e independentemente testado.
• Preço — Intern-S2 sem tabela de preços pública; auto-hospedagem ou API oficial do Intern vs Gemini 3.1 Pro US$ 2,00 de entrada / US$ 12,00 de saída por milhão, subindo para US$ 4,00/US$ 18,00 acima de 200 mil tokens de entrada.

Preço e onde cada um fica
O Gemini 3.1 Pro cobra US$ 2,00 por milhão de tokens de entrada e US$ 12,00 por milhão de tokens de saída no nível padrão, passando para US$ 4,00/US$ 18,00 assim que uma requisição ultrapassa 200 mil tokens de entrada — uma sobretaxa de contexto longo que pesa exatamente quando você usa a janela de 1M que justifica escolhê-lo. Ele é roteável no OrcaRouter pelo mesmo preço de tabela, repassado com 0% de markup, em uma chave que também carrega mais de 200 outros modelos; o repasse importa aqui porque uma mudança de preço do Google chega ao nosso lado no mesmo dia, em vez de depois de um ciclo de reprecificação. A DSL de roteamento é a parte útil para esta comparação específica: você pode enviar tarefas de imagem e vídeo para o Gemini 3.1 Pro e lotes de documentos científicos para um Intern-S2 auto-hospedado, e manter ambos atrás de um único endpoint sem um segundo contrato ou alteração de código.
O Intern-S2 não tem preço de API publicado. A auto-hospedagem dos pesos Apache-2.0 é o caminho que a maioria das equipes de fato seguirá, e com 403 bilhões de parâmetros isso é um verdadeiro compromisso de hardware. A API oficial do Intern existe para equipes que preferem não rodar GPUs, mas, sem uma tabela de preços pública, a comparação de custos com os US$ 2/US$ 12 do Gemini não é algo que dá para fazer no papel — você precisa solicitar cota e fazer as contas sozinho.

A chamada
Escolha o Gemini 3.1 Pro se precisar de um modelo multimodal geral que aceita áudio e vídeo, suporta um milhão de tokens, tem meses de validação independente e pode ser alugado por token hoje. É o modelo com mais evidências e capacidade mais ampla, e o selo de pré-visualização é uma ressalva de confiabilidade, não de capacidade.
Escolha o Intern-S2 se sua entrada multimodal for científica e seus dados não puderem sair da sua infraestrutura. É o único dos dois que lê páginas de literatura bruta nativamente, faz previsões a partir de sinais de séries temporais e pode ser ajustado com fine-tuning em dados experimentais proprietários sob uma licença permissiva. Aceite que você é a primeira pessoa a executá-lo, e que a tabela de benchmark que argumenta em favor dele foi escrita pelas pessoas que o criaram.

Nenhum dos modelos vence isso de forma absoluta, e a tabela prova melhor do que um veredito poderia. Um é um generalista que por acaso é bom em ciência; o outro é um instrumento científico que por acaso é competitivo em trabalho multimodal geral — e, em um lançamento aberto no mesmo dia, "competitivo" é o resultado mais surpreendente.
Para abranger as duas metades desta comparação sem um segundo contrato: uma única chave de API que cobre mais de 200 modelos coloca o principal modelo multimodal fechado e todas as alternativas por trás de um único endpoint, para que você possa encaminhar o trabalho de imagem e vídeo de uma forma e os lotes de documentos de outra.
