
GPT-6 vs DeepSeek V4 Pro: Um que você pode alugar de qualquer um, outro que você pode levar para casa
- openaiNOVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligência
- anthropicNOVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligência
- typesafeNOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Inteligência
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Inteligência
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Inteligência
- xAIGrok 4.72026-09-2146Inteligência
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 67 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 360 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
Há exatamente uma coisa que você pode fazer com o DeepSeek V4 Pro que não pode fazer com o GPT-6 Sol: levá-lo para casa. O DeepSeek V4 Pro é um modelo carro-chefe de mistura de especialistas com licença MIT — 1,6 trilhão de parâmetros totais, 49 bilhões ativos por token — lançado em 13 de agosto de 2026, e o checkpoint pode ser baixado. O GPT-6 Sol tem pesos fechados, foi lançado pela OpenAI em 22 de setembro de 2026 e, em 7 de outubro de 2026, também é o modelo que sustenta os níveis pagos do lançamento global do ChatGPT para mais de 1,2 bilhão de usuários semanais.
Todo o resto nesta comparação depende de qual métrica você lê. Na tabela de preços, os dois diferem por um fator de quatro. Quanto ao que realmente custou produzir uma resposta finalizada na suíte independente, eles estão separados por 1,55×. No Intelligence Index, as linhas parecem separadas por dezesseis pontos e, segundo a metodologia documentada do próprio avaliador, não são subtraíveis de forma alguma. Decifrar qual desses três números deve orientar uma decisão é todo o trabalho, e a resposta é diferente dependendo de você estar escolhendo um fornecedor ou um arquivo.
O que cada modelo é, em um parágrafo cada
GPT-6 Sol é o nível intermediário da linha GPT-6 da OpenAI — abaixo do carro-chefe GPT-6 Astra e acima do econômico GPT-6 Luna — com uma janela de contexto de 1.050.000 tokens, um teto de saída de 128.000 tokens, entrada de texto, imagem e arquivo, chamada nativa de ferramentas, saídas estruturadas e esforço de raciocínio selecionável em cinco níveis, de baixo a máximo. É o nível para o qual a OpenAI direciona o ChatGPT Plus, Pro, Business e Enterprise, e tem o preço de US$ 2,00 por milhão de tokens de entrada e US$ 10,00 por milhão de saída, com um nível de contexto longo que reprecifica toda a solicitação para US$ 4,00 e US$ 15,00 quando o prompt ultrapassa 272.000 tokens de entrada.
DeepSeek V4 Pro é um modelo carro-chefe apenas de texto, com uma janela de 1.048.576 tokens e saída máxima de 384.000 tokens — três vezes o teto do GPT-6 Sol — e sem visão a preço algum. A documentação da própria API da DeepSeek informa o preço de US$ 0,66 por milhão de tokens de entrada e US$ 1,98 por milhão de saída em horários de pico, reduzidos pela metade para US$ 0,33 e US$ 0,99 fora de pico, com acertos de cache a US$ 0,022 fora de pico. Os horários de pico são 01:00–04:00 e 06:00–10:00 UTC em dias úteis; todo o restante, incluindo fins de semana e feriados públicos chineses, fica fora de pico.
Os três medidores
Comece pelo que é mais citado, porque é o que costuma ser citado com mais frequência sem o seu contexto. O Artificial Analysis atribui DeepSeek V4 Pro 36,0 e GPT-6 Sol 47,6 no Intelligence Index v4.3.2. Onze pontos e meio é o tipo de diferença que põe fim a uma comparação.
Não deveria, e o próprio avaliador diz isso. O Artificial Analysis compara modelos de pesos abertos apenas com outros modelos de pesos abertos na mesma classe de tamanho, com o limite em 150 bilhões de parâmetros, e modelos proprietários ao longo de uma faixa de preço, com uma proporção combinada de 3:1 entre entrada e saída. Esses são dois grupos de pares diferentes que produzem duas escalas diferentes. Um 36 e um 47,6 em linhas adjacentes da mesma tabela não são uma comparação direta, e a atitude honesta é dizer isso, em vez de subtrair um do outro e chamar o resultado de capacidade.

Os dois medidores que são comparáveis dizem algo mais útil:
• Preço combinado na proporção 3:1 — GPT-6 Sol US$ 4,00 por 1M vs. DeepSeek V4 Pro US$ 0,99 nas tarifas de pico, ou US$ 0,50 fora de pico; uma variação de 4× a 8× dependendo de quando você executa
• Custo por tarefa de indexação concluída — GPT-6 Sol US$ 1,04 vs. DeepSeek V4 Pro US$ 0,67; uma diferença de 1,55×
• Tokens de saída gerados em toda a suíte — GPT-6 Sol 76,8M vs. DeepSeek V4 Pro 162,9M, então o modelo barato escreve 2,1× mais para concluir o mesmo trabalho
• Saída máxima — DeepSeek V4 Pro 384.000 tokens vs. GPT-6 Sol 128.000; um teto de 3×
• Entrada multimodal — GPT-6 Sol aceita texto, imagens e arquivos vs. DeepSeek V4 Pro apenas texto
• Pesos — DeepSeek V4 Pro licenciado sob MIT e baixável vs. GPT-6 Sol fechado

A quarta e a quinta linha explicam a segunda. Uma diferença de 4× anunciada que cai para 1,55× em trabalho real é o que acontece quando o modelo mais barato também é o mais verboso: o DeepSeek V4 Pro emitiu 2,1× os tokens de saída que o GPT-6 Sol emitiu no mesmo conjunto de avaliação. A verbosidade é um multiplicador de custo que nunca aparece em uma página de preços, e é o número mais negligenciado neste confronto.
Onde o modelo aberto realmente vence
Dois lugares, e ambos são estruturais, não marginais.
O teto de saída é o primeiro. 384.000 tokens contra 128.000 é uma diferença de três vezes, e isso decide categorias inteiras de trabalho: gerar um grande artefato estruturado em uma única chamada, escrever um documento longo sem encadear, produzir uma grande refatoração como uma única resposta. O GPT-6 Sol não consegue fazer isso a preço algum, porque o limite não é um nível de cobrança — é o máximo do modelo.
O uso de ferramentas agênticas é o segundo, em uma medição específica. O DeepSeek V4 Pro obtém 96,2% no τ²-Bench, a avaliação de uso de ferramentas agênticas, e é com essa cifra que o DeepSeek encabeça seu próprio card. É também o número que a entrada do modelo no catálogo OrcaRouter repete, que é a versão da afirmação que nossos próprios leitores encontrariam. A cifra comparável do GPT-6 Sol no τ²-Bench não é publicada no mesmo quadro, então trate a comparação como direcional: no único benchmark que o DeepSeek escolheu destacar, o modelo aberto está no topo da área, e o modelo fechado não colocou um número na mesma coluna.
E a questão da propriedade, que não é um benchmark de forma alguma. Um checkpoint MIT disponível para download significa que você pode executar o modelo no seu próprio hardware, manter uma solicitação fora da rede de qualquer um, fazer ajuste fino nele, fixar uma versão e saber que ela ainda estará lá em três anos. Nenhum fornecedor pode descontinuá-lo, alterar seu preço ou retirá-lo de uma tabela de preços. Para uma classe de compradores — setores regulados, qualquer pessoa com uma restrição de residência de dados, qualquer pessoa que já foi prejudicada pela descontinuação de um modelo — isso vale mais do que onze pontos de índice.
Onde o GPT-6 Sol vence, e não é apenas o índice
O Terminal-Bench 4.0 é a linha menos lisonjeira no cartão do DeepSeek V4 Pro: 14,1% contra 43,9% do GPT-6 Sol. Isso não é uma diferença de arredondamento e aponta para um perfil real — o modelo aberto é forte em orquestração de ferramentas em múltiplos turnos e fraco no trabalho de terminal de longo horizonte do qual os agentes de codificação modernos são feitos. Se a sua carga de trabalho for um agente que precisa manter uma sessão de shell funcionando por vinte minutos, esta única avaliação é mais preditiva da sua experiência do que o composto do índice.
A multimodalidade é a segunda. O DeepSeek V4 Pro é entrada de texto, saída de texto. O GPT-6 Sol aceita imagens e arquivos, e isso não é um mero item de lista de recursos — trabalho profissional com grande volume de documentos significa capturas de tela, páginas digitalizadas, diagramas e PDFs, e um modelo apenas de texto não consegue entrar nessa categoria de forma alguma.
O terceiro é o que aconteceu esta semana. O GPT-6 chegou à aba Chat do ChatGPT para Plus, Pro, Business e Enterprise em 7 de outubro, com Free e Go a seguir a partir de 8 de outubro, trazendo uma capacidade que a OpenAI chama de Intelligent UI — respostas que compõem texto, elementos gráficos, gráficos, formulários e controles de toque por pergunta, em vez de recorrer à prosa por padrão. Isso é uma superfície, não um recurso de API, e não altera uma linha do seu código de integração. O que isso muda é o padrão ambiente: o modelo que a sua equipe já tem aberto numa aba do navegador agora é o GPT-6, e o trabalho de prototipagem tende a migrar para o modelo que consegue alcançar sem uma chave. Relatado pelo fornecedor e não reproduzido, a OpenAI também afirma que o GPT-6 em Extra High começa a responder tão rápido quanto o GPT-5.6 em Medium, e que o GPT-6 Instant começa a responder 44% mais cedo em perguntas com suporte de busca.
Executando um, ou executando ambos
A razão pela qual este emparelhamento é mais fácil de fazer hedge do que a maioria é que ambos os modelos estão no mesmo catálogo. O OrcaRouter encaminha o GPT-6 Sol e o DeepSeek V4 Pro — juntamente com outros 200 modelos — através de um único endpoint compatível com OpenAI numa única chave, com 0% de acréscimo sobre o preço de tabela do provedor. É esse repasse que torna a estrutura de pico/fora de pico legível em vez de misteriosa: a redução para metade fora de pico da DeepSeek é do fornecedor, não mexemos nisso, e quando um fornecedor altera os preços, a alteração fica ativa aqui no mesmo dia.
É também aí que a decisão da janela de pico se torna uma decisão de encaminhamento. A tarifa fora de pico do DeepSeek V4 Pro é metade da sua tarifa de pico, e as janelas de pico são horas UTC fixas. Uma tarefa em lote que pode ser deslocada vale a pena ser agendada em torno delas, e um caminho sensível à latência vale a pena manter fora delas. Com ambos os modelos atrás de uma única chave, a divisão é uma configuração, e não um segundo contrato com fornecedor: encaminhe o trabalho em volume e de saída longa para o DeepSeek V4 Pro fora de pico, encaminhe o tráfego multimodal e com uso intenso de raciocínio para o GPT-6 Sol, e deixe o failover automático cobrir um limite de taxa de qualquer um dos lados, em vez de descobri-lo em produção.

O que eu realmente faria
Se precisar de imagens, ficheiros ou de uma pontuação de raciocínio de fronteira e estiver a comprar uma API, o GPT-6 Sol é a resposta e os onze pontos de índice são, em grande parte, irrelevantes — o critério multimodal decide a questão antes de os benchmarks votarem. Se precisar de uma saída de 384 000 tokens, de uma licença que possa manter, de uma implementação no local (on-premise) ou do custo mais baixo por tarefa concluída no ranking, o DeepSeek V4 Pro vence e a diferença no índice diz respeito ao grupo de pares de outra pessoa.
O que eu não faria é ler 36 contra 47,6 como uma lacuna de capacidade e comprar com base nisso. Os medidores comparáveis — US$ 0,67 contra US$ 1,04 por tarefa, e uma diferença de verbosidade de 2,1× escondida dentro de uma diferença de manchete de 4× — contam uma história muito mais próxima da realidade do que as linhas do índice, e são eles que aparecem numa fatura.
O próximo ponto a observar é se a DeepSeek fecha a lacuna no Terminal-Bench em uma atualização do V4 Pro, já que essa é a única medição em que o modelo aberto parece genuinamente atrás, e não apenas pontuado de forma diferente. O GPT-6, por sua vez, simplesmente deixou de ser uma escolha e passou a ser o padrão, e é difícil discordar de padrões mesmo quando o benchmark diz o contrário.
Comparados neste artigo1
Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente
