
Mistral Large 4 vs Claude Opus 5: A diferença é menor que a diferença de preço
- openaiNOVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligência
- anthropicNOVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligência
- typesafeNOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 151 tok/s
- OpenAINOVOOpenAI: GPT-6 Luna2026-09-2238Inteligência
- OpenAINOVOOpenAI: GPT-6 Sol2026-09-2248Inteligência
- AnthropicNOVOAnthropic: Claude Opus 5.52026-09-2258Inteligência
- xAIGrok 4.72026-09-2146Inteligência
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 120 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1202 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 250 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
O único número de comparação direta que alguém já publicou para Mistral Large 4 contra Claude Opus 5 vem de uma avaliação humana cega, e é mais próximo do que as tabelas de benchmark sugerem. A Surge AI ocultou as identidades dos modelos e pediu a anotadores profissionais que avaliassem a saída de código numa escala de 1–5; o Claude Opus 5 terminou em primeiro, com 4,22, e o Mistral Large 4 Preview terminou em segundo, com 3,74, à frente do Kimi K3, do GLM-5.3 e do GLM-5.2. No agregado independente, os dois não são vizinhos de forma alguma — 50,8 contra 38,4 no Índice de Inteligência da Artificial Analysis, lido em 6 de outubro. O que torna este par digno de uma tarde é que o modelo que pontua 12 pontos menos custa aproximadamente um quinto para executar uma tarefa.
É preciso anexar a procedência de ambos os números, porque eles não são o mesmo tipo de número. A avaliação da Surge AI é um estudo humano de terceiros que a Mistral encomendou e publicou — uma forma de evidência mais forte do que um benchmark executado pela própria empresa, e ainda assim um estudo cuja publicação a Mistral controlou. As pontuações do índice são execuções do próprio Artificial Analysis, comparáveis entre si e, portanto, o par certo a partir do qual raciocinar. Nenhum dos dois diz sobre qual modelo construir; juntos, eles delimitam a questão.
Dois produtos, não duas gerações de um
O Claude Opus 5 é um modelo carro-chefe de pesos fechados do fornecedor, lançado em 24 de julho de 2026, disponibilizado com uma janela de contexto de 1M de tokens e até 128K tokens de saída, a $5 por milhão de tokens de entrada e $25 por milhão de tokens de saída, com leituras em cache a $0,50. É o modelo mais capaz do fornecedor na linha Opus e está posicionado diretamente para trabalho agêntico de horizonte longo — mantendo-se coerente ao longo de sessões de múltiplas etapas com uso intenso de ferramentas.
Mistral Large 4 é uma pré-visualização, anunciada em 6 de outubro de 2026, que a Mistral descreve como uma mistura esparsa de especialistas de 1,05 trilhão de parâmetros, com 49 bilhões de parâmetros ativos e um codificador de visão de 1,6 bilhão de parâmetros. Seu ID de API é mistral-large-4-0, ele é nativamente multimodal, e a documentação da Mistral informa uma janela de contexto de 1 milhão de tokens, enquanto a Artificial Analysis lê 524.288 na configuração que está testando. Os pesos estão prometidos para o final de outubro e a licença ainda não foi nomeada.
Portanto, não se trata de um modelo mais recente contra um mais antigo. Trata-se de um modelo de fronteira proprietário contra um concorrente que se pretende de pesos abertos, e os dois estão a ser precificados em conformidade.

O mesmo índice, ambos os modelos
Lido em 6 de outubro das suas páginas do Artificial Analysis, no Intelligence Index v4.3:
• Índice de Inteligência — Mistral Large 4 Preview 38,4 vs Claude Opus 5 50,8
• Custo por tarefa de índice — $1,13 para o Mistral Large 4 Preview vs $5,86 para o Claude Opus 5
• Terminal-Bench 4.0 — 26,8% vs 49,0%, a maior diferença individual entre eles
• Humanity's Last Exam — 35,0% vs 54,9%
• MMMU-Pro, raciocínio multimodal — 76,4% vs 84,7%
• AutomationBench, fluxos de trabalho empresariais — 59,9% vs 56,6%, a única linha em que o Mistral Large 4 lidera
• Janela de contexto — 1M declarado pela Mistral e 524.288 na configuração testada, vs 1M entregue
• Limite de saída — não divulgado para a prévia vs 128K tokens
• Preço por milhão, entrada / saída — US$ 1,36 / US$ 4,18 de tabela, atualmente US$ 0,68 / US$ 2,09 em promoção, vs US$ 5,00 / US$ 25,00

O padrão é legível. O Opus 5 está à frente nas duas linhas mais difíceis e intensivas em raciocínio — trabalho em terminal e conhecimento aberto — e está à frente na compreensão multimodal, apesar de o Mistral Large 4 ser o modelo vendido com base em sua visão. O Mistral Large 4 lidera a linha de automação de fluxo de trabalho, que é a linha mais próxima do que uma unidade de negócios realmente pede que um modelo faça, e o faz a um quinto do preço por tarefa.
Onde o Mistral Large 4 realmente vence
A afirmação mais interessante na publicação de lançamento da Mistral não é uma pontuação de benchmark. É que, em um dos testes do Artificial Analysis Cyber Index — reproduzir uma vulnerabilidade real em software de código aberto e depois corrigi-la —, o Mistral Large 4 obtém 82%, considerada a maior pontuação de qualquer modelo, e que vários modelos fechados líderes pontuam perto de zero no mesmo teste porque se recusam a realizar a tarefa. A Mistral cita Claude Opus 5.5 e GPT-6 Astra como exemplos dessa recusa.
Essa é uma interpretação de fornecedor de um número citado pelo fornecedor, e deve ser lida dessa forma. Também é uma diferença operacional real, se se confirmar: um modelo que não reproduz uma vulnerabilidade não pode ser usado para provar que ela é real, o que é o primeiro passo da maioria das respostas a incidentes. A Mistral combina os 82% com uma pontuação de 93% nos 40 exercícios de competição do Cybench e com uma contra-alegação de que sua taxa de recusa em prompts cibernéticos extraídos do JailbreakBench, do StrongRE e do AgentBench é maior do que a de outros modelos de pesos abertos — o argumento é que você quer a capacidade e a disciplina no mesmo modelo, em vez de trocar uma pela outra.
Além da cibersegurança, o argumento a favor do Mistral Large 4 assenta em três coisas que o Opus 5 não oferece. É treinado e servido em infraestrutura europeia ao abrigo da legislação europeia, o que importa aos compradores com obrigações de residência de dados. Será, promete a Mistral, descarregável — o ponto central de todo o exercício, uma vez que é a auto-implementação que elimina o risco de acesso em pleno incidente que a Mistral se esforça por descrever. E é suficientemente barato por tarefa para que utilizá-lo como primeira passagem e escalar o resíduo difícil para um modelo de fronteira seja economicamente sensato, em vez de um erro de arredondamento.
Onde o Claude Opus 5 ainda justifica seu preço
A diferença de 12 pontos no índice não é pequena, e o quadro linha a linha diz onde ela está. O Terminal-Bench 4.0 é quase o dobro — 49,0% contra 26,8% — e o trabalho de terminal é o proxy público mais próximo da codificação agêntica, que é a maior parte do motivo pelo qual as equipes estão comprando modelos de fronteira este ano. O Humanity's Last Exam os separa por 20 pontos. Em autonomia de longo horizonte, o design de raciocínio adaptativo do Opus 5, seu teto de saída de 128K e um contexto servido de 1M são a configuração que você quer se sua carga de trabalho for uma sessão de agente de várias horas em vez de uma única pergunta difícil.
O teto de saída é a diferença mais silenciosa. A Mistral não publicou um comprimento máximo de saída para a prévia, e os 128K do Opus 5 são um verdadeiro removedor de restrições para geração de código e documentos estruturados longos. Se o seu pipeline emite arquivos em vez de respostas, verifique esse número antes de trocar, porque é o tipo de lacuna que só aparece em produção.
O custo por tarefa é o número a que se deve agarrar
Os preços por token favorecem modelos baratos e induzem ao erro em relação aos caros. O custo por tarefa do próprio índice — gasto total para concluir uma tarefa de avaliação, com cache e tudo — é o número que sobrevive ao contato com um orçamento: US$ 1,13 contra US$ 5,86.
Isso não é uma licença para transferir tudo para o modelo mais barato, porque uma tarefa em que o modelo barato falha é uma tarefa pela qual você paga duas vezes. É uma licença para parar de tratar um único modelo de fronteira como a única opção. Na OrcaRouter, o Claude Opus 5 está no catálogo pelo preço de tabela do fornecedor, com 0% de margem, no mesmo endpoint compatível com OpenAI que mais de 200 outros modelos, e é isso que faz de um pipeline de dois modelos o trabalho de uma tarde em vez de um segundo contrato com fornecedor. O Mistral Large 4 não está no catálogo hoje — a pré-visualização é acessada pela própria API da Mistral e por várias plataformas de terceiros. Quando os seus pesos forem disponibilizados e um fornecedor o hospedar, aplica-se a mesma regra de repasse: o que o fornecedor cobra é o que você paga, e um corte de preço do fornecedor aparece na sua fatura no mesmo dia.

Para uma prévia não comprovada, o recurso de roteamento que mais importa é o failover. Enviar uma fração do tráfego de produção para o Mistral Large 4 enquanto o Opus 5 mantém o restante significa que uma regressão vira um redirecionamento em vez de uma interrupção, e você aprende os modos de falha reais do modelo nos seus próprios dados, em vez de num ranking.
O que resolve isto em três semanas
Três fatos ainda estão em aberto, e cada um deles muda a resposta. Se os pesos chegarem sob uma licença permissiva, o Mistral Large 4 se torna o único modelo deste par que você pode auto-hospedar, e o cálculo para compradores regulados pende fortemente. Se o preço promocional de $0.68 / $2.09 voltar para $1.36 / $4.18 da tabela de preços, a diferença por tarefa diminui, mas continua decisiva. E se a Artificial Analysis transferir os números de codificação avaliados em privado para o seu índice público sem alterações, a narrativa de codificação passa a ser verificada por terceiros, em vez de publicada pelo fornecedor em nome de um terceiro.
Até então: o Opus 5 é o padrão de produção seguro e vale o seu múltiplo para trabalho agêntico e intensivo em terminal. O Mistral Large 4 é a aposta interessante — barato o suficiente por tarefa para rodar ao lado dele, capaz o bastante em automação e cibersegurança para conquistar tráfego hoje, e mantendo a promessa de autodeploy que nenhum modelo fechado nesta comparação consegue igualar.
Comparados neste artigo1
Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente
