Um cartão de título gerado para o artigo 'Mistral Large 4 vs Gemini 3.1 Pro', mostrando o título em sans-serif geométrica em negrito, o subtítulo 'Oito meses, duas direções' abaixo dele e uma fileira de três ícones de linha planos acima — uma página de calendário, uma janela de terminal e uma moldura de imagem — sobre um fundo branco com acentos de gradiente azul e ciano e o logotipo OrcaRouter no canto inferior direito.
Guides & Insights

Mistral Large 4 vs Gemini 3.1 Pro: Oito meses, duas direções

Autor

Gideon Frost

Data de publicação

Modelos mais recentes · 20Ver todos os modelos →
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Gemini 3.1 Pro está no mercado desde 19 de fevereiro de 2026 e ainda ocupa uma das primeiras posições em todas as tabelas amplas de capacidade, incluindo aquelas em que é comparado a modelos lançados neste outono. Mistral Large 4 tem no máximo três semanas — uma pré-visualização anunciada em 6 de outubro de 2026, com seus pesos prometidos para o fim de outubro e nenhuma licença indicada. No Intelligence Index da Artificial Analysis, consultado em 6 de outubro, o Gemini 3.1 Pro, de oito meses, marca 29,7 contra os 38,4 do recém-chegado. Esse é o ponto de partida honesto para esta comparação, e é o oposto do que as datas de lançamento sugerem.

A explicação não é misteriosa. Gemini 3.1 Pro é um modelo principal da linha de pré-visualização que o Google nunca promoveu a uma versão estável, e a página do Artificial Analysis para ele é rotulada como "Gemini 3.1 Pro Preview" — a mesma página onde um índice inferior fica ao lado de um GPQA Diamond de alto nível. É um modelo construído para a amplitude: uma janela de contexto muito grande, um amplo conjunto de modalidades e um raciocínio forte em perguntas de conhecimento. Mistral Large 4 é construído para um mapa do mundo completamente diferente, e seu preço é condizente.

O que cada um é

O Gemini 3.1 Pro é o modelo de raciocínio multimodal de fronteira do Google, com ID de API gemini-3.1-pro-preview, janela de contexto de 1.048.576 tokens e teto de saída de 65.536 tokens. Ele aceita texto, imagens, vídeo, áudio e arquivos. É servido pelo catálogo da OrcaRouter aos preços do próprio Google. A documentação do Google não lista nenhum Gemini 3.1 Pro que não seja preview; o nome preview é o produto.

O Mistral Large 4 é um modelo esparso de mistura de especialistas com 1,05 trilhão de parâmetros, 49 bilhões de parâmetros ativos e um codificador de visão dedicado de 1,6 bilhão de parâmetros, oferecido como "Mistral Large 4 Preview" sob o id de API mistral-large-4-0. A documentação da Mistral afirma uma janela de contexto de 1M tokens; a Artificial Analysis lê 524.288 na configuração que está testando. A saída máxima não é publicada. A Mistral o descreve como seu modelo maior e mais capaz até o momento e diz que os pesos chegam no final de outubro.

Os números, com a sua proveniência anexada

Ambos os modelos têm páginas independentes, portanto a comparação abaixo é no mesmo harness, e não fornecedor contra fornecedor:

• Índice de Inteligência v4.3 — Mistral Large 4 Preview 38,4 vs. Gemini 3.1 Pro 29,7

• Custo por tarefa de indexação — $1,13 vs $1,30

• Raciocínio de contexto longo — 81,3% vs 82,0%

• GPQA Diamond — não publicado para a prévia vs 94,1%

• O Último Exame da Humanidade — 35,0% vs 47,0%

• Terminal-Bench 4.0 — 26,8% vs 4,0%

• SciCode — 54,2% vs 58,7%

• AutomationBench, fluxos de trabalho de negócios — 59,9% vs 35,4%

• MMMU-Pro, raciocínio multimodal — 76,4% vs 82,4%

• Janela de contexto — 1M declarado / 524.288 testados vs 1.048.576 servidos

• Limite máximo de saída — não publicado vs 65.536 tokens

• Preço por milhão, entrada / saída — US$ 1,36 / US$ 4,18 de tabela, US$ 0,68 / US$ 2,09 promocional, vs. US$ 2,00 / US$ 12,00 abaixo de 200 mil tokens e US$ 4,00 / US$ 18,00 acima

• Pesos — prometidos, licença não nomeada, vs. proprietário

A generated two-column scoreboard titled 'Mistral Large 4 vs Gemini 3.1 Pro — the scoreboard'. Left column 'Mistral Large 4 Preview': Intelligence Index v4.3 38.4; cost per index task $1.13; Terminal-Bench 4.0 26.8%; GPQA Diamond not published; MMMU-Pro 76.4%; AutomationBench 59.9%. Right column 'Gemini 3.1 Pro': Intelligence Index v4.3 29.7; cost per index task $1.30; Terminal-Bench 4.0 4.0%; GPQA Diamond 94.1%; MMMU-Pro 82.4%; AutomationBench 35.4%.

A linha mais impressionante é o Terminal-Bench 4.0. O Gemini 3.1 Pro obtém 4,0% — não é um erro de digitação, nem uma alucinação na tabela: reflete um modelo de fevereiro sendo executado em um harness de agente de terminal que é posterior a ele. Os 26,8% do Mistral Large 4 são seis vezes maiores no mesmo teste. Qualquer pessoa que tenha descartado o Gemini com base em um número antigo de codificação agêntica deveria reconsiderá-lo com base no seu GPQA Diamond, e qualquer pessoa que tenha descartado o Mistral com base na posição no índice deveria olhar primeiro para a linha do terminal.

Onde o Gemini 3.1 Pro {{1}}ainda leva a melhor{{/1}}

Conhecimento e amplitude. Um GPQA Diamond de 94,1% é o maior número em qualquer lugar deste artigo, de ambos os lados, e é um benchmark de ciência de nível de pós-graduação — não um número que um modelo alcança apenas com conversa. Humanity's Last Exam com 47,0% contra 35,0%, e uma pontuação no SciCode que fica ligeiramente à frente do recém-chegado, contam a mesma história. Se sua carga de trabalho é responder a perguntas difíceis com precisão a partir de um corpus de conhecimento, o Gemini 3.1 Pro continua sendo o modelo mais forte oito meses após o lançamento.

A amplitude de modalidades é a segunda vantagem. O Gemini 3.1 Pro aceita vídeo e áudio, bem como texto e imagens. O Mistral Large 4 aceita texto e imagens. Se o seu pipeline ingere reuniões gravadas, gravações de tela ou áudio de sensores, apenas um modelo aqui pode ver a entrada inteira.

O teto de saída é o terceiro. 65.536 tokens é um teto publicado e garantido; a Mistral não publicou nenhum para a prévia. Nada em um post de lançamento tem mais chance de te causar problemas em produção do que um limite de saída não declarado.

E a janela de contexto do Gemini é realmente entregue com 1.048.576 tokens, enquanto o 1M da Mistral é o número do fornecedor, contra 524.288 medidos de forma independente. Para uma carga de trabalho que opera no limite extremo da janela, a diferença entre um número declarado e um número medido é uma reescrita.

Onde o Mistral Large 4 muda a decisão

O trabalho agêntico, e especificamente tudo o que envolve um terminal, é onde os dois modelos deixam de ser comparáveis. O próprio post de lançamento da Mistral agrega 61,7% no DeepSWE v1.1, 59,4% no SWE-Atlas-QnA e 28,3% no Terminal-Bench 4.0 num Coding Agent Index de 49,8%, e afirma claramente que ficou à frente do DeepSeek V4 Pro 0813 e do Qwen3.8 Max nessa medida combinada. Esses três valores são, nas palavras da Mistral, números que a Artificial Analysis avaliou em privado antes de o seu harness se tornar público; ainda não constam do índice público e devem ser etiquetados como publicados pelo fabricante enquanto não constarem.

Evidências independentes apontam na mesma direção. No AutomationBench — 657 fluxos de trabalho empresariais abrangendo Gmail, Sheets, Slack e Salesforce — o Mistral Large 4 marca 59,9%, à frente de Kimi K3, MiMo-V2.6-Pro e DeepSeek V4 Pro, e, no mesmo ambiente de avaliação, o Gemini 3.1 Pro não aparece de forma alguma porque o benchmark é posterior a ele. Um estudo humano cego conduzido pela Surge AI classificou o Mistral Large 4 Preview em segundo lugar entre cinco modelos em qualidade de codificação, com 3,74, à frente de GLM-5.3 e Kimi K3 e atrás apenas do Claude Opus 5.

A alegação sobre cibersegurança é a mais incisiva no post da Mistral e vale enunciá-la com exatidão: 82% no teste do Artificial Analysis Cyber Index, que pede a um modelo que reproduza uma vulnerabilidade real e depois a corrija, descrito como o mais alto de qualquer modelo, com 93% nos 40 exercícios de competição do Cybench, e a afirmação da Mistral de que ele figura no top cinco global do Cyber Index no geral, ao mesmo tempo que lidera modelos de pesos abertos desenvolvidos fora da China. Esses são números citados pelo fornecedor em um índice independente. Sua vantagem prática é que a Mistral construiu o modelo para fazer o trabalho, em vez de se recusar a fazê-lo.

A linha mais barata da tabela também pertence à Mistral, mas por pouco: US$ 1,13 por tarefa contra US$ 1,30, uma vantagem de 13% que a tarifa promocional proporciona e que o tarifário eliminaria. O Gemini 3.1 Pro é um modelo de 2026 com preços de 2026, e não é caro executar uma tarefa de indexação nele.

O critério de desempate que ninguém avalia

Há duas coisas em jogo que as tabelas não conseguem mostrar. A primeira é o licenciamento. O Gemini 3.1 Pro é proprietário e continuará a sê-lo; o Mistral Large 4 é uma pré-visualização cuja proposta assenta inteiramente em tornar-se um artefacto descarregável que pode executar de acordo com a sua própria política, no seu próprio hardware, ao abrigo da legislação europeia — a Mistral treinou-o em 3.800 GPUs Grace Blackwell nos seus próprios centros de dados e disponibiliza aí a pré-visualização. Esse argumento não vale nada até o repositório aparecer e a licença ter um nome. Vale muito no dia em que isso acontecer.

A screenshot of Mistral's own documentation, the Models Overview page at docs.mistral.ai, showing the GENERALIST MODELS card grid with 'Mistral Large 4' listed at v26.10 as 'A state-of-the-art, open-weight, general-purpose multimodal model' and no licence badge, beside a Mistral Large 3 card at v25.12 carrying an APACHE 2.0 badge. Mistral Small 4, Mistral Medium 3.5, Z.ai GLM 5.3 and the Ministral 3 sizes are also visible.

O segundo é o risco operacional. Uma prévia que ainda está sendo refinada vai mudar debaixo de você. Na OrcaRouter, ambos os lados desta comparação são acessíveis por meio de um único endpoint compatível com OpenAI, aos preços de tabela dos provedores com 0% de margem — o Gemini 3.1 Pro está disponível no catálogo às tarifas do Google, enquanto o Mistral Large 4 precisa ser acessado pela própria API da Mistral e por várias plataformas de terceiros, já que não é uma rota que oferecemos. O DSL de roteamento é a peça útil aqui: envie classificação e extração para o modelo que estiver mais barato naquela semana, escale o resíduo difícil e deixe o failover automático absorver os dias ruins da prévia, em vez de sua escala de plantão absorvê-los.

A screenshot of the OrcaRouter model page for google/gemini-3.1-pro-preview, showing the preview model identity, a 1M-token context window, a 65K maximum output, inputs of audio, file, image, text and video with text output, the 2026-02-19 release date, a p-50 time-to-first-token figure of 10.00 seconds, pricing of $2.00 per million input and $12.00 per million output, and a code sample against the api.orcarouter.ai base URL.

O veredito

Pergunte qual é a carga de trabalho, não qual modelo é melhor. Para trabalho de conhecimento, entrada de áudio e vídeo, um teto de saída garantido e uma janela de um milhão de tokens servida, o Gemini 3.1 Pro ainda é o modelo mais forte, e sua idade não é um defeito — são oito meses de outras pessoas descobrindo seus limites. Para codificação agêntica, trabalho em terminal e operações de segurança, o Mistral Large 4 está à frente por uma margem ampla o suficiente para que a posição no índice seja enganosa, e é o único dos dois que pode acabar sendo auto-hospedável.

O desempate a acompanhar é o fim de outubro. Se os pesos chegarem sob uma licença permissiva, o Mistral Large 4 deixa de competir com o Gemini 3.1 Pro em preço e passa a competir com ele em controle, e essa é uma disputa diferente. Se chegarem sob uma restritiva, a resposta deste artigo não muda muito — mas o motivo, sim.

Comparados neste artigo1

Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente