
Mistral Large 4 vs Gemini 3.1 Pro: Oito meses, duas direções
- openaiNOVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligência
- anthropicNOVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligência
- typesafeNOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 151 tok/s
- OpenAINOVOOpenAI: GPT-6 Luna2026-09-2238Inteligência
- OpenAINOVOOpenAI: GPT-6 Sol2026-09-2248Inteligência
- AnthropicNOVOAnthropic: Claude Opus 5.52026-09-2258Inteligência
- xAIGrok 4.72026-09-2146Inteligência
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 120 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1202 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 250 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
Gemini 3.1 Pro está no mercado desde 19 de fevereiro de 2026 e ainda ocupa uma das primeiras posições em todas as tabelas amplas de capacidade, incluindo aquelas em que é comparado a modelos lançados neste outono. Mistral Large 4 tem no máximo três semanas — uma pré-visualização anunciada em 6 de outubro de 2026, com seus pesos prometidos para o fim de outubro e nenhuma licença indicada. No Intelligence Index da Artificial Analysis, consultado em 6 de outubro, o Gemini 3.1 Pro, de oito meses, marca 29,7 contra os 38,4 do recém-chegado. Esse é o ponto de partida honesto para esta comparação, e é o oposto do que as datas de lançamento sugerem.
A explicação não é misteriosa. Gemini 3.1 Pro é um modelo principal da linha de pré-visualização que o Google nunca promoveu a uma versão estável, e a página do Artificial Analysis para ele é rotulada como "Gemini 3.1 Pro Preview" — a mesma página onde um índice inferior fica ao lado de um GPQA Diamond de alto nível. É um modelo construído para a amplitude: uma janela de contexto muito grande, um amplo conjunto de modalidades e um raciocínio forte em perguntas de conhecimento. Mistral Large 4 é construído para um mapa do mundo completamente diferente, e seu preço é condizente.
O que cada um é
O Gemini 3.1 Pro é o modelo de raciocínio multimodal de fronteira do Google, com ID de API gemini-3.1-pro-preview, janela de contexto de 1.048.576 tokens e teto de saída de 65.536 tokens. Ele aceita texto, imagens, vídeo, áudio e arquivos. É servido pelo catálogo da OrcaRouter aos preços do próprio Google. A documentação do Google não lista nenhum Gemini 3.1 Pro que não seja preview; o nome preview é o produto.
O Mistral Large 4 é um modelo esparso de mistura de especialistas com 1,05 trilhão de parâmetros, 49 bilhões de parâmetros ativos e um codificador de visão dedicado de 1,6 bilhão de parâmetros, oferecido como "Mistral Large 4 Preview" sob o id de API mistral-large-4-0. A documentação da Mistral afirma uma janela de contexto de 1M tokens; a Artificial Analysis lê 524.288 na configuração que está testando. A saída máxima não é publicada. A Mistral o descreve como seu modelo maior e mais capaz até o momento e diz que os pesos chegam no final de outubro.
Os números, com a sua proveniência anexada
Ambos os modelos têm páginas independentes, portanto a comparação abaixo é no mesmo harness, e não fornecedor contra fornecedor:
• Índice de Inteligência v4.3 — Mistral Large 4 Preview 38,4 vs. Gemini 3.1 Pro 29,7
• Custo por tarefa de indexação — $1,13 vs $1,30
• Raciocínio de contexto longo — 81,3% vs 82,0%
• GPQA Diamond — não publicado para a prévia vs 94,1%
• O Último Exame da Humanidade — 35,0% vs 47,0%
• Terminal-Bench 4.0 — 26,8% vs 4,0%
• SciCode — 54,2% vs 58,7%
• AutomationBench, fluxos de trabalho de negócios — 59,9% vs 35,4%
• MMMU-Pro, raciocínio multimodal — 76,4% vs 82,4%
• Janela de contexto — 1M declarado / 524.288 testados vs 1.048.576 servidos
• Limite máximo de saída — não publicado vs 65.536 tokens
• Preço por milhão, entrada / saída — US$ 1,36 / US$ 4,18 de tabela, US$ 0,68 / US$ 2,09 promocional, vs. US$ 2,00 / US$ 12,00 abaixo de 200 mil tokens e US$ 4,00 / US$ 18,00 acima
• Pesos — prometidos, licença não nomeada, vs. proprietário

A linha mais impressionante é o Terminal-Bench 4.0. O Gemini 3.1 Pro obtém 4,0% — não é um erro de digitação, nem uma alucinação na tabela: reflete um modelo de fevereiro sendo executado em um harness de agente de terminal que é posterior a ele. Os 26,8% do Mistral Large 4 são seis vezes maiores no mesmo teste. Qualquer pessoa que tenha descartado o Gemini com base em um número antigo de codificação agêntica deveria reconsiderá-lo com base no seu GPQA Diamond, e qualquer pessoa que tenha descartado o Mistral com base na posição no índice deveria olhar primeiro para a linha do terminal.
Onde o Gemini 3.1 Pro {{1}}ainda leva a melhor{{/1}}
Conhecimento e amplitude. Um GPQA Diamond de 94,1% é o maior número em qualquer lugar deste artigo, de ambos os lados, e é um benchmark de ciência de nível de pós-graduação — não um número que um modelo alcança apenas com conversa. Humanity's Last Exam com 47,0% contra 35,0%, e uma pontuação no SciCode que fica ligeiramente à frente do recém-chegado, contam a mesma história. Se sua carga de trabalho é responder a perguntas difíceis com precisão a partir de um corpus de conhecimento, o Gemini 3.1 Pro continua sendo o modelo mais forte oito meses após o lançamento.
A amplitude de modalidades é a segunda vantagem. O Gemini 3.1 Pro aceita vídeo e áudio, bem como texto e imagens. O Mistral Large 4 aceita texto e imagens. Se o seu pipeline ingere reuniões gravadas, gravações de tela ou áudio de sensores, apenas um modelo aqui pode ver a entrada inteira.
O teto de saída é o terceiro. 65.536 tokens é um teto publicado e garantido; a Mistral não publicou nenhum para a prévia. Nada em um post de lançamento tem mais chance de te causar problemas em produção do que um limite de saída não declarado.
E a janela de contexto do Gemini é realmente entregue com 1.048.576 tokens, enquanto o 1M da Mistral é o número do fornecedor, contra 524.288 medidos de forma independente. Para uma carga de trabalho que opera no limite extremo da janela, a diferença entre um número declarado e um número medido é uma reescrita.
Onde o Mistral Large 4 muda a decisão
O trabalho agêntico, e especificamente tudo o que envolve um terminal, é onde os dois modelos deixam de ser comparáveis. O próprio post de lançamento da Mistral agrega 61,7% no DeepSWE v1.1, 59,4% no SWE-Atlas-QnA e 28,3% no Terminal-Bench 4.0 num Coding Agent Index de 49,8%, e afirma claramente que ficou à frente do DeepSeek V4 Pro 0813 e do Qwen3.8 Max nessa medida combinada. Esses três valores são, nas palavras da Mistral, números que a Artificial Analysis avaliou em privado antes de o seu harness se tornar público; ainda não constam do índice público e devem ser etiquetados como publicados pelo fabricante enquanto não constarem.
Evidências independentes apontam na mesma direção. No AutomationBench — 657 fluxos de trabalho empresariais abrangendo Gmail, Sheets, Slack e Salesforce — o Mistral Large 4 marca 59,9%, à frente de Kimi K3, MiMo-V2.6-Pro e DeepSeek V4 Pro, e, no mesmo ambiente de avaliação, o Gemini 3.1 Pro não aparece de forma alguma porque o benchmark é posterior a ele. Um estudo humano cego conduzido pela Surge AI classificou o Mistral Large 4 Preview em segundo lugar entre cinco modelos em qualidade de codificação, com 3,74, à frente de GLM-5.3 e Kimi K3 e atrás apenas do Claude Opus 5.
A alegação sobre cibersegurança é a mais incisiva no post da Mistral e vale enunciá-la com exatidão: 82% no teste do Artificial Analysis Cyber Index, que pede a um modelo que reproduza uma vulnerabilidade real e depois a corrija, descrito como o mais alto de qualquer modelo, com 93% nos 40 exercícios de competição do Cybench, e a afirmação da Mistral de que ele figura no top cinco global do Cyber Index no geral, ao mesmo tempo que lidera modelos de pesos abertos desenvolvidos fora da China. Esses são números citados pelo fornecedor em um índice independente. Sua vantagem prática é que a Mistral construiu o modelo para fazer o trabalho, em vez de se recusar a fazê-lo.
A linha mais barata da tabela também pertence à Mistral, mas por pouco: US$ 1,13 por tarefa contra US$ 1,30, uma vantagem de 13% que a tarifa promocional proporciona e que o tarifário eliminaria. O Gemini 3.1 Pro é um modelo de 2026 com preços de 2026, e não é caro executar uma tarefa de indexação nele.
O critério de desempate que ninguém avalia
Há duas coisas em jogo que as tabelas não conseguem mostrar. A primeira é o licenciamento. O Gemini 3.1 Pro é proprietário e continuará a sê-lo; o Mistral Large 4 é uma pré-visualização cuja proposta assenta inteiramente em tornar-se um artefacto descarregável que pode executar de acordo com a sua própria política, no seu próprio hardware, ao abrigo da legislação europeia — a Mistral treinou-o em 3.800 GPUs Grace Blackwell nos seus próprios centros de dados e disponibiliza aí a pré-visualização. Esse argumento não vale nada até o repositório aparecer e a licença ter um nome. Vale muito no dia em que isso acontecer.

O segundo é o risco operacional. Uma prévia que ainda está sendo refinada vai mudar debaixo de você. Na OrcaRouter, ambos os lados desta comparação são acessíveis por meio de um único endpoint compatível com OpenAI, aos preços de tabela dos provedores com 0% de margem — o Gemini 3.1 Pro está disponível no catálogo às tarifas do Google, enquanto o Mistral Large 4 precisa ser acessado pela própria API da Mistral e por várias plataformas de terceiros, já que não é uma rota que oferecemos. O DSL de roteamento é a peça útil aqui: envie classificação e extração para o modelo que estiver mais barato naquela semana, escale o resíduo difícil e deixe o failover automático absorver os dias ruins da prévia, em vez de sua escala de plantão absorvê-los.

O veredito
Pergunte qual é a carga de trabalho, não qual modelo é melhor. Para trabalho de conhecimento, entrada de áudio e vídeo, um teto de saída garantido e uma janela de um milhão de tokens servida, o Gemini 3.1 Pro ainda é o modelo mais forte, e sua idade não é um defeito — são oito meses de outras pessoas descobrindo seus limites. Para codificação agêntica, trabalho em terminal e operações de segurança, o Mistral Large 4 está à frente por uma margem ampla o suficiente para que a posição no índice seja enganosa, e é o único dos dois que pode acabar sendo auto-hospedável.
O desempate a acompanhar é o fim de outubro. Se os pesos chegarem sob uma licença permissiva, o Mistral Large 4 deixa de competir com o Gemini 3.1 Pro em preço e passa a competir com ele em controle, e essa é uma disputa diferente. Se chegarem sob uma restritiva, a resposta deste artigo não muda muito — mas o motivo, sim.
Comparados neste artigo1
Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente
