Um cartão de título gerado para o artigo 'Mistral Large 4 vs Claude Opus 5', exibindo o título em fonte sans-serif geométrica em negrito, o subtítulo 'A lacuna é menor que a diferença de preço' abaixo dele, e uma fileira de três ícones de linha planos acima — duas barras de alturas desiguais, uma etiqueta de preço e uma escala de avaliação humana — sobre um fundo branco com detalhes em gradiente azul e ciano e o logotipo da OrcaRouter no canto inferior direito.
Guides & Insights

Mistral Large 4 vs Claude Opus 5: A diferença é menor que a diferença de preço

Autor

Magnus Corvin

Data de publicação

Modelos mais recentes · 20Ver todos os modelos →
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

O único número de comparação direta que alguém já publicou para Mistral Large 4 contra Claude Opus 5 vem de uma avaliação humana cega, e é mais próximo do que as tabelas de benchmark sugerem. A Surge AI ocultou as identidades dos modelos e pediu a anotadores profissionais que avaliassem a saída de código numa escala de 1–5; o Claude Opus 5 terminou em primeiro, com 4,22, e o Mistral Large 4 Preview terminou em segundo, com 3,74, à frente do Kimi K3, do GLM-5.3 e do GLM-5.2. No agregado independente, os dois não são vizinhos de forma alguma — 50,8 contra 38,4 no Índice de Inteligência da Artificial Analysis, lido em 6 de outubro. O que torna este par digno de uma tarde é que o modelo que pontua 12 pontos menos custa aproximadamente um quinto para executar uma tarefa.

É preciso anexar a procedência de ambos os números, porque eles não são o mesmo tipo de número. A avaliação da Surge AI é um estudo humano de terceiros que a Mistral encomendou e publicou — uma forma de evidência mais forte do que um benchmark executado pela própria empresa, e ainda assim um estudo cuja publicação a Mistral controlou. As pontuações do índice são execuções do próprio Artificial Analysis, comparáveis entre si e, portanto, o par certo a partir do qual raciocinar. Nenhum dos dois diz sobre qual modelo construir; juntos, eles delimitam a questão.

Dois produtos, não duas gerações de um

O Claude Opus 5 é um modelo carro-chefe de pesos fechados do fornecedor, lançado em 24 de julho de 2026, disponibilizado com uma janela de contexto de 1M de tokens e até 128K tokens de saída, a $5 por milhão de tokens de entrada e $25 por milhão de tokens de saída, com leituras em cache a $0,50. É o modelo mais capaz do fornecedor na linha Opus e está posicionado diretamente para trabalho agêntico de horizonte longo — mantendo-se coerente ao longo de sessões de múltiplas etapas com uso intenso de ferramentas.

Mistral Large 4 é uma pré-visualização, anunciada em 6 de outubro de 2026, que a Mistral descreve como uma mistura esparsa de especialistas de 1,05 trilhão de parâmetros, com 49 bilhões de parâmetros ativos e um codificador de visão de 1,6 bilhão de parâmetros. Seu ID de API é mistral-large-4-0, ele é nativamente multimodal, e a documentação da Mistral informa uma janela de contexto de 1 milhão de tokens, enquanto a Artificial Analysis lê 524.288 na configuração que está testando. Os pesos estão prometidos para o final de outubro e a licença ainda não foi nomeada.

Portanto, não se trata de um modelo mais recente contra um mais antigo. Trata-se de um modelo de fronteira proprietário contra um concorrente que se pretende de pesos abertos, e os dois estão a ser precificados em conformidade.

A screenshot of Mistral's own documentation, the Models Overview page at docs.mistral.ai, showing the GENERALIST MODELS card grid in which 'Mistral Large 4' is listed at version v26.10 with the description 'A state-of-the-art, open-weight, general-purpose multimodal model' and no licence badge, beside a Mistral Large 3 card at v25.12 that does carry an APACHE 2.0 badge. Mistral Small 4, Mistral Medium 3.5, Z.ai GLM 5.3 and the Ministral 3 sizes are also visible, with the OCR MODELS section starting below.

O mesmo índice, ambos os modelos

Lido em 6 de outubro das suas páginas do Artificial Analysis, no Intelligence Index v4.3:

• Índice de Inteligência — Mistral Large 4 Preview 38,4 vs Claude Opus 5 50,8

• Custo por tarefa de índice — $1,13 para o Mistral Large 4 Preview vs $5,86 para o Claude Opus 5

• Terminal-Bench 4.0 — 26,8% vs 49,0%, a maior diferença individual entre eles

• Humanity's Last Exam — 35,0% vs 54,9%

• MMMU-Pro, raciocínio multimodal — 76,4% vs 84,7%

• AutomationBench, fluxos de trabalho empresariais — 59,9% vs 56,6%, a única linha em que o Mistral Large 4 lidera

• Janela de contexto — 1M declarado pela Mistral e 524.288 na configuração testada, vs 1M entregue

• Limite de saída — não divulgado para a prévia vs 128K tokens

• Preço por milhão, entrada / saída — US$ 1,36 / US$ 4,18 de tabela, atualmente US$ 0,68 / US$ 2,09 em promoção, vs US$ 5,00 / US$ 25,00

A generated two-column scoreboard titled 'Mistral Large 4 vs Claude Opus 5 — the scoreboard'. Left column 'Mistral Large 4 Preview': Intelligence Index v4.3 38.4; cost per index task $1.13; Terminal-Bench 4.0 26.8%; Humanity's Last Exam 35.0%; MMMU-Pro 76.4%; AutomationBench 59.9%. Right column 'Claude Opus 5': Intelligence Index v4.3 50.8; cost per index task $5.86; Terminal-Bench 4.0 49.0%; Humanity's Last Exam 54.9%; MMMU-Pro 84.7%; AutomationBench 56.6%.

O padrão é legível. O Opus 5 está à frente nas duas linhas mais difíceis e intensivas em raciocínio — trabalho em terminal e conhecimento aberto — e está à frente na compreensão multimodal, apesar de o Mistral Large 4 ser o modelo vendido com base em sua visão. O Mistral Large 4 lidera a linha de automação de fluxo de trabalho, que é a linha mais próxima do que uma unidade de negócios realmente pede que um modelo faça, e o faz a um quinto do preço por tarefa.

Onde o Mistral Large 4 realmente vence

A afirmação mais interessante na publicação de lançamento da Mistral não é uma pontuação de benchmark. É que, em um dos testes do Artificial Analysis Cyber Index — reproduzir uma vulnerabilidade real em software de código aberto e depois corrigi-la —, o Mistral Large 4 obtém 82%, considerada a maior pontuação de qualquer modelo, e que vários modelos fechados líderes pontuam perto de zero no mesmo teste porque se recusam a realizar a tarefa. A Mistral cita Claude Opus 5.5 e GPT-6 Astra como exemplos dessa recusa.

Essa é uma interpretação de fornecedor de um número citado pelo fornecedor, e deve ser lida dessa forma. Também é uma diferença operacional real, se se confirmar: um modelo que não reproduz uma vulnerabilidade não pode ser usado para provar que ela é real, o que é o primeiro passo da maioria das respostas a incidentes. A Mistral combina os 82% com uma pontuação de 93% nos 40 exercícios de competição do Cybench e com uma contra-alegação de que sua taxa de recusa em prompts cibernéticos extraídos do JailbreakBench, do StrongRE e do AgentBench é maior do que a de outros modelos de pesos abertos — o argumento é que você quer a capacidade e a disciplina no mesmo modelo, em vez de trocar uma pela outra.

Além da cibersegurança, o argumento a favor do Mistral Large 4 assenta em três coisas que o Opus 5 não oferece. É treinado e servido em infraestrutura europeia ao abrigo da legislação europeia, o que importa aos compradores com obrigações de residência de dados. Será, promete a Mistral, descarregável — o ponto central de todo o exercício, uma vez que é a auto-implementação que elimina o risco de acesso em pleno incidente que a Mistral se esforça por descrever. E é suficientemente barato por tarefa para que utilizá-lo como primeira passagem e escalar o resíduo difícil para um modelo de fronteira seja economicamente sensato, em vez de um erro de arredondamento.

Onde o Claude Opus 5 ainda justifica seu preço

A diferença de 12 pontos no índice não é pequena, e o quadro linha a linha diz onde ela está. O Terminal-Bench 4.0 é quase o dobro — 49,0% contra 26,8% — e o trabalho de terminal é o proxy público mais próximo da codificação agêntica, que é a maior parte do motivo pelo qual as equipes estão comprando modelos de fronteira este ano. O Humanity's Last Exam os separa por 20 pontos. Em autonomia de longo horizonte, o design de raciocínio adaptativo do Opus 5, seu teto de saída de 128K e um contexto servido de 1M são a configuração que você quer se sua carga de trabalho for uma sessão de agente de várias horas em vez de uma única pergunta difícil.

O teto de saída é a diferença mais silenciosa. A Mistral não publicou um comprimento máximo de saída para a prévia, e os 128K do Opus 5 são um verdadeiro removedor de restrições para geração de código e documentos estruturados longos. Se o seu pipeline emite arquivos em vez de respostas, verifique esse número antes de trocar, porque é o tipo de lacuna que só aparece em produção.

O custo por tarefa é o número a que se deve agarrar

Os preços por token favorecem modelos baratos e induzem ao erro em relação aos caros. O custo por tarefa do próprio índice — gasto total para concluir uma tarefa de avaliação, com cache e tudo — é o número que sobrevive ao contato com um orçamento: US$ 1,13 contra US$ 5,86.

Isso não é uma licença para transferir tudo para o modelo mais barato, porque uma tarefa em que o modelo barato falha é uma tarefa pela qual você paga duas vezes. É uma licença para parar de tratar um único modelo de fronteira como a única opção. Na OrcaRouter, o Claude Opus 5 está no catálogo pelo preço de tabela do fornecedor, com 0% de margem, no mesmo endpoint compatível com OpenAI que mais de 200 outros modelos, e é isso que faz de um pipeline de dois modelos o trabalho de uma tarde em vez de um segundo contrato com fornecedor. O Mistral Large 4 não está no catálogo hoje — a pré-visualização é acessada pela própria API da Mistral e por várias plataformas de terceiros. Quando os seus pesos forem disponibilizados e um fornecedor o hospedar, aplica-se a mesma regra de repasse: o que o fornecedor cobra é o que você paga, e um corte de preço do fornecedor aparece na sua fatura no mesmo dia.

A screenshot of the OrcaRouter model page for anthropic/claude-opus-5, showing the model identity, a 1M-token context window, a 128K maximum output, input modalities of text, image and file with text output, the pre-October-2026 release date, a p-50 time-to-first-token figure of 4.82 seconds, pricing of $5.00 per million input and $25.00 per million output, and an OpenAI-compatible code sample pointing at the api.orcarouter.ai base URL.

Para uma prévia não comprovada, o recurso de roteamento que mais importa é o failover. Enviar uma fração do tráfego de produção para o Mistral Large 4 enquanto o Opus 5 mantém o restante significa que uma regressão vira um redirecionamento em vez de uma interrupção, e você aprende os modos de falha reais do modelo nos seus próprios dados, em vez de num ranking.

O que resolve isto em três semanas

Três fatos ainda estão em aberto, e cada um deles muda a resposta. Se os pesos chegarem sob uma licença permissiva, o Mistral Large 4 se torna o único modelo deste par que você pode auto-hospedar, e o cálculo para compradores regulados pende fortemente. Se o preço promocional de $0.68 / $2.09 voltar para $1.36 / $4.18 da tabela de preços, a diferença por tarefa diminui, mas continua decisiva. E se a Artificial Analysis transferir os números de codificação avaliados em privado para o seu índice público sem alterações, a narrativa de codificação passa a ser verificada por terceiros, em vez de publicada pelo fornecedor em nome de um terceiro.

Até então: o Opus 5 é o padrão de produção seguro e vale o seu múltiplo para trabalho agêntico e intensivo em terminal. O Mistral Large 4 é a aposta interessante — barato o suficiente por tarefa para rodar ao lado dele, capaz o bastante em automação e cibersegurança para conquistar tráfego hoje, e mantendo a promessa de autodeploy que nenhum modelo fechado nesta comparação consegue igualar.

Comparados neste artigo1

Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente