
OpenAI o3 vs DeepSeek V4 Pro: A Era do Raciocínio Premium Termina Onde se Abre a Lacuna de Preços
- DeepSeekNOVODeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 por 1M de tokens
- z-aiNOVOZ.ai: GLM 5.32026-08-1860Inteligência75Código
- obsidianNOVOQwen3.8 27B2026-08-1552Inteligência68Código
- qwenNOVOQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekNOVODeepSeek: DeepSeek V4 Pro 08132026-08-1253Inteligência69Código
- grokNOVOSpaceXAI: Grok 4.62026-08-1261Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0557Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0358Inteligência72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Inteligência69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Inteligência78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2152Inteligência69Código
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Inteligência49Código
- metaMeta: Muse Spark 1.12026-07-1653Inteligência71Código
- kimiMoonshotAI: Kimi K32026-07-1560Inteligência76Código
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Inteligência71Código
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Inteligência77Código
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Inteligência77Código
O confronto entre OpenAI o3 e DeepSeek V4 Pro é realmente uma colisão de dois números. OpenAI o3, lançado em 16 de abril de 2025, era o ponto de referência para raciocínio premium — o modelo pelo qual você pagava mais quando o custo de uma resposta errada era maior que o custo dos tokens. DeepSeek V4 Pro, que se tornou GA na build 0813 em 13 de agosto de 2026, após um lançamento silencioso à noite e um rollout que incluiu um anúncio retirado e pesos reenviados, é o modelo que fez esse premium parecer um erro de categoria: um índice independente superior ao do o3, a cerca de um quinto do preço, com pesos abertos de quebra. E a colisão tem data e hora marcadas, porque OpenAI o3 sai do ChatGPT em 26 de agosto de 2026, seus snapshots da API seguem em 11 de dezembro, e cada semana da comparação favorece o modelo que não vai a lugar nenhum.
Dois modelos que foram lançados com um ano de diferença em filosofia
o3 é o carro-chefe de raciocínio puro: um modelo fechado treinado para pensar por muito tempo antes de responder, com janela de contexto de 200K, até 100K de saída, e entrada de imagens integrada à sua cadeia de pensamento. Segundo os próprios números da OpenAI, ele estabeleceu a referência de 2025 — 96.7% no AIME 2024, 87.7% no GPQA Diamond, 69.1% no SWE-bench Verified sem andaimes, um Elo de 2727 no Codeforces — e a OpenAI depois reduziu seu preço de US$ 10/US$ 40 para US$ 2/US$ 8 por milhão de tokens, patamar em que permanece. O DeepSeek V4 Pro é uma economia totalmente diferente: um modelo de mistura de especialistas com 1,6 trilhão de parâmetros, com cerca de 49 bilhões ativos por token, janela de contexto de 1 milhão de tokens, saída máxima de 384K, entrada somente de texto e — novo com a build GA 0813 — uma pilha de pós-treinamento reconstruída, além de integração nativa com a API Responses e o Codex, o que fez suas pontuações de agente saltarem de 12.8 na prévia para 62.7 no DeepSWE. Também tem pesos abertos: o checkpoint DeepSeek-V4-Pro-0813 pode ser baixado no Hugging Face sob a licença MIT, após um caótico primeiro dia em que o banner de lançamento foi retirado e os pesos ficaram brevemente com erro 404 antes de uma re-listagem com configuração corrigida.
A diferença de custo em números reais
As tabelas de preços fazem a maior parte da argumentação por si mesmas:
• OpenAI o3 — US$ 2,00 por milhão de entrada, US$ 8,00 por milhão de saída, US$ 0,50 por entrada em cache. Tokens de raciocínio são cobrados como saída, então uma pergunta difícil consome tokens de pensamento antes da resposta.
DeepSeek V4 Pro — US$ 0,435 por milhão de tokens de entrada (cache miss), US$ 0,003625 por cache hit, US$ 0,87 por milhão de tokens de saída hoje. A saída é aproximadamente 4,6× mais barata que a o3, e a entrada com cache hit é praticamente gratuita.
• A ressalva datada — o aumento de preço da DeepSeek programado para 17 de agosto move a saída do V4 Pro de 6 yuan para 27 yuan por milhão em horários de pico (13,5 fora de pico) e o input com cache miss de 3 para 9 yuan. Mesmo na nova taxa de pico, a saída representa uma pequena fração dos US$ 8 do o3. A janela para desenvolver com base na tarifa atual é medida em dias, o que por si só faz parte do cálculo da migração.
A economia por resposta correta reforça o ponto. Os tokens de raciocínio ocultos do o3 significam que o custo real por resposta difícil é várias vezes a sua taxa de saída. O DeepSeek V4 Pro também raciocina, e o seu raciocínio também é cobrado como saída, mas a $0.87 o gasto absoluto é um erro de arredondamento perto de uma sessão do o3 que pensa por um minuto e meio. O enquadramento de custo por agente que a DeepSeek usou no lançamento — aproximadamente uma diferença de 45× no preço por tarefa em relação à fronteira fechada — superestima especificamente o caso do o3, mas a direção não é contestada: trata-se de uma diferença de 4–10× no custo efetivo, dependendo da carga de trabalho.
Onde realmente está a lacuna de qualidade
A pontuação que mais importa é a independente. No Intelligence Index da Artificial Analysis, o DeepSeek V4 Pro marca 53 e fica em #2 entre os 104 modelos que o índice lista atualmente; o3 fica em torno de 30 — uma diferença de mais de 20 pontos no mesmo harness. Esse é o resumo mais claro de onde dois anos de progresso deixaram o carro-chefe de raciocínio premium: ele não é mais apenas subcotado no preço; ele é derrotado no agregado independente.
O panorama por benchmark é mais confuso e precisa de rótulos honestos. Os números de destaque de agente do DeepSeek V4 Pro — Terminal-Bench 2.1 com 87,9, CyberGym com 83,3, DeepSWE com 62,7, AutomationBench à frente da fronteira fechada — são alegações da própria DeepSeek do lançamento de 0813, não reproduzidas de forma independente até o momento em que este texto foi escrito, e o episódio de configuração incorreta no rollout significa que ninguém pode ter certeza de que a API estava servindo os pesos finais corrigidos quando os primeiros números de terceiros foram coletados. Os benchmarks de lançamento do o3 são igualmente relatados pelo fornecedor, mas foram parcialmente validados por re-testes independentes ainda em 2025, quando ele genuinamente liderava os rankings de raciocínio. Em matemática e raciocínio puro, o histórico publicado do o3 ainda parece melhor do que o do DeepSeek V4 Pro — os pontos fortes do DeepSeek são uso de ferramentas de agente, codificação e tarefas de horizonte longo, o que constitui uma suíte de testes diferente das olimpíadas de matemática que o o3 dominou.

O que o o3 ainda faz melhor
Duas coisas sobrevivem intactas à comparação. Primeiro, matemática e raciocínio cuidadoso: os 96,7% do o3 no AIME e os 87,7% no GPQA permanecem acima de qualquer coisa que o DeepSeek V4 Pro publicou, e se a sua carga de trabalho é uma prova difícil ou um problema de competição, o o3 — enquanto ainda está em execução — é a resposta mais segura. Segundo, raciocínio de imagem: o o3 consegue pensar sobre uma captura de tela ou diagrama dentro da sua cadeia de pensamento, e o DeepSeek V4 Pro é somente texto; a build 0813 não adicionou codificador de visão, e se a sua tarefa precisa que o modelo leia uma imagem, o DeepSeek V4 Pro não é um substituto para o o3 nesse aspecto. Nenhuma vantagem é motivo para permanecer em um modelo em aposentadoria, mas ambas são motivos para ser honesto de que a migração não é uma melhoria pura.
Outra coisa que vale notar é a diferença de pesos abertos, que não é um benchmark de forma alguma. o3 era fechado e agora está sendo consolidado até deixar de existir; você não pode mantê-lo rodando em seu próprio hardware. O checkpoint 0813 do DeepSeek V4 Pro é seu, permanentemente, licenciado sob MIT — os mesmos pesos, o mesmo modelo de 1,6 trilhão de parâmetros, auto-hospedado se você tiver os ~1,5 terabytes de hardware para isso. Para equipes que se queimaram ao depender de um modelo fechado que um fornecedor poderia descontinuar, essa é uma resposta estrutural para exatamente o problema que a aposentadoria do o3 apresenta.
Migrando a carga de trabalho
Para a equipe de API que está saindo do o3, o DeepSeek V4 Pro é o destino mais barato e, no trabalho com agentes e de codificação que a maior parte do uso de API de fato é, raramente é um downgrade. As verdadeiras pegadinhas são operacionais, não de qualidade: o V4 Pro está limitado a 500 requisições simultâneas na API oficial — um teto que você vai atingir com uma frota de agentes — e seus preços mudam em 17 de agosto. Esses dois pontos são exatamente o que uma camada de roteamento resolve.
No OrcaRouter, o DeepSeek V4 Pro é oferecido ao preço de tabela do provedor, repassado com margem de 0% — então os US$ 0,44/US$ 0,87 de hoje entram no ar aqui no mesmo dia em que entram no ar na DeepSeek, e quando a programação de pico/fora de pico de 17 de agosto entrar em vigor, ela também se reflete aqui no mesmo dia. Uma única chave também dá acesso ao restante dessa coorte substituta do o3, e o failover automático é a resposta limpa para o limite de 500 conexões simultâneas: aponte uma rota de produção para o V4 Pro e um segundo modelo na mesma chave e deixe o roteador absorver o teto. O próprio OpenAI o3 não está nessa chave — ele permanece disponível pela API da própria OpenAI e em diversas plataformas de terceiros até o corte do snapshot de 11 de dezembro.

Quem a matemática favorece
Para qualquer pessoa cuja carga de trabalho com o3 seja codificação, loops de agente ou processamento de contexto longo, a matemática não é nem de perto equilibrada: o DeepSeek V4 Pro supera o o3 no índice independente, custa uma fração do preço, e seus pesos abertos significam que essa dependência específica não pode ser retirada de você por terceiros. As equipes com motivo genuíno para manter o o3 vivo por enquanto são as de nicho — raciocínio puro de matemática difícil, e qualquer coisa construída sobre o pensamento de imagem do o3 — e mesmo essas devem testar substitutos em cargas de trabalho reais antes de dezembro, porque o prazo não se importa com o seu caso específico. A era do raciocínio premium que o o3 definiu terminou com o anúncio de sua aposentadoria; o DeepSeek V4 Pro simplesmente é onde está o assento mais barato da próxima era.

Comparados neste artigo2
Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente
