Cartão de título principal com o texto "GPT-6 vs DeepSeek V4 Pro", com um chip com o texto "GPT-6 no ChatGPT para todos 2026-10-07", duas linhas de preço com o texto "GPT-6 Sol $2 / $10" e "DeepSeek V4 Pro $0,66 / $1,98 pico", um chip com o texto "DeepSeek: pesos MIT, saída máxima de 384K", e um rodapé com o texto "Itens reportados pelo fornecedor rotulados no texto; valores de índice conforme a Artificial Analysis." O logotipo da OrcaRouter é composto no canto inferior direito.
Guides & Insights

GPT-6 vs DeepSeek V4 Pro: Um que você pode alugar de qualquer um, outro que você pode levar para casa

Autor

Magnus Corvin

Data de publicação

Modelos mais recentes · 20Ver todos os modelos →
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Há exatamente uma coisa que você pode fazer com o DeepSeek V4 Pro que não pode fazer com o GPT-6 Sol: levá-lo para casa. O DeepSeek V4 Pro é um modelo carro-chefe de mistura de especialistas com licença MIT — 1,6 trilhão de parâmetros totais, 49 bilhões ativos por token — lançado em 13 de agosto de 2026, e o checkpoint pode ser baixado. O GPT-6 Sol tem pesos fechados, foi lançado pela Ope​nAI em 22 de setembro de 2026 e, em 7 de outubro de 2026, também é o modelo que sustenta os níveis pagos do lançamento global do ChatGPT para mais de 1,2 bilhão de usuários semanais.

Todo o resto nesta comparação depende de qual métrica você lê. Na tabela de preços, os dois diferem por um fator de quatro. Quanto ao que realmente custou produzir uma resposta finalizada na suíte independente, eles estão separados por 1,55×. No Intelligence Index, as linhas parecem separadas por dezesseis pontos e, segundo a metodologia documentada do próprio avaliador, não são subtraíveis de forma alguma. Decifrar qual desses três números deve orientar uma decisão é todo o trabalho, e a resposta é diferente dependendo de você estar escolhendo um fornecedor ou um arquivo.

O que cada modelo é, em um parágrafo cada

GPT-6 Sol é o nível intermediário da linha GPT-6 da OpenAI — abaixo do carro-chefe GPT-6 Astra e acima do econômico GPT-6 Luna — com uma janela de contexto de 1.050.000 tokens, um teto de saída de 128.000 tokens, entrada de texto, imagem e arquivo, chamada nativa de ferramentas, saídas estruturadas e esforço de raciocínio selecionável em cinco níveis, de baixo a máximo. É o nível para o qual a OpenAI direciona o ChatGPT Plus, Pro, Business e Enterprise, e tem o preço de US$ 2,00 por milhão de tokens de entrada e US$ 10,00 por milhão de saída, com um nível de contexto longo que reprecifica toda a solicitação para US$ 4,00 e US$ 15,00 quando o prompt ultrapassa 272.000 tokens de entrada.

DeepSeek V4 Pro é um modelo carro-chefe apenas de texto, com uma janela de 1.048.576 tokens e saída máxima de 384.000 tokens — três vezes o teto do GPT-6 Sol — e sem visão a preço algum. A documentação da própria API da DeepSeek informa o preço de US$ 0,66 por milhão de tokens de entrada e US$ 1,98 por milhão de saída em horários de pico, reduzidos pela metade para US$ 0,33 e US$ 0,99 fora de pico, com acertos de cache a US$ 0,022 fora de pico. Os horários de pico são 01:00–04:00 e 06:00–10:00 UTC em dias úteis; todo o restante, incluindo fins de semana e feriados públicos chineses, fica fora de pico.

Os três medidores

Comece pelo que é mais citado, porque é o que costuma ser citado com mais frequência sem o seu contexto. O Artificial Analysis atribui DeepSeek V4 Pro 36,0 e GPT-6 Sol 47,6 no Intelligence Index v4.3.2. Onze pontos e meio é o tipo de diferença que põe fim a uma comparação.

Não deveria, e o próprio avaliador diz isso. O Artificial Analysis compara modelos de pesos abertos apenas com outros modelos de pesos abertos na mesma classe de tamanho, com o limite em 150 bilhões de parâmetros, e modelos proprietários ao longo de uma faixa de preço, com uma proporção combinada de 3:1 entre entrada e saída. Esses são dois grupos de pares diferentes que produzem duas escalas diferentes. Um 36 e um 47,6 em linhas adjacentes da mesma tabela não são uma comparação direta, e a atitude honesta é dizer isso, em vez de subtrair um do outro e chamar o resultado de capacidade.

A screenshot of the Artificial Analysis leaderboard showing the rows around DeepSeek V4 Pro, with MiMo-V2.6-Flash at 38 and $0.06 per index task, Claude Haiku 5.5 (high) at 38 and $0.08, and DeepSeek V4 Pro 0813 (max) at 36 and $0.67, each row carrying its creator, index, cost per task, output speed and latency columns.

Os dois medidores que são comparáveis dizem algo mais útil:

• Preço combinado na proporção 3:1 — GPT-6 Sol US$ 4,00 por 1M vs. DeepSeek V4 Pro US$ 0,99 nas tarifas de pico, ou US$ 0,50 fora de pico; uma variação de 4× a 8× dependendo de quando você executa
• Custo por tarefa de indexação concluída — GPT-6 Sol US$ 1,04 vs. DeepSeek V4 Pro US$ 0,67; uma diferença de 1,55×
• Tokens de saída gerados em toda a suíte — GPT-6 Sol 76,8M vs. DeepSeek V4 Pro 162,9M, então o modelo barato escreve 2,1× mais para concluir o mesmo trabalho
• Saída máxima — DeepSeek V4 Pro 384.000 tokens vs. GPT-6 Sol 128.000; um teto de 3×
• Entrada multimodal — GPT-6 Sol aceita texto, imagens e arquivos vs. DeepSeek V4 Pro apenas texto
• Pesos — DeepSeek V4 Pro licenciado sob MIT e baixável vs. GPT-6 Sol fechado

A two-column comparison scoreboard for GPT-6 Sol and DeepSeek V4 Pro, showing GPT-6 Sol at an Intelligence Index of 47.6, $1.04 per index task and a 128,000-token output ceiling, against DeepSeek V4 Pro at 36.0, $0.67 and 384,000 tokens, with input and output prices of $2.00/$10.00 against $0.66/$1.98 and an MIT-weights row. A footer reads "Index figures per Artificial Analysis v4.3.2; row scored in different peer groups, not subtractable."

A quarta e a quinta linha explicam a segunda. Uma diferença de 4× anunciada que cai para 1,55× em trabalho real é o que acontece quando o modelo mais barato também é o mais verboso: o DeepSeek V4 Pro emitiu 2,1× os tokens de saída que o GPT-6 Sol emitiu no mesmo conjunto de avaliação. A verbosidade é um multiplicador de custo que nunca aparece em uma página de preços, e é o número mais negligenciado neste confronto.

Onde o modelo aberto realmente vence

Dois lugares, e ambos são estruturais, não marginais.

O teto de saída é o primeiro. 384.000 tokens contra 128.000 é uma diferença de três vezes, e isso decide categorias inteiras de trabalho: gerar um grande artefato estruturado em uma única chamada, escrever um documento longo sem encadear, produzir uma grande refatoração como uma única resposta. O GPT-6 Sol não consegue fazer isso a preço algum, porque o limite não é um nível de cobrança — é o máximo do modelo.

O uso de ferramentas agênticas é o segundo, em uma medição específica. O DeepSeek V4 Pro obtém 96,2% no τ²-Bench, a avaliação de uso de ferramentas agênticas, e é com essa cifra que o DeepSeek encabeça seu próprio card. É também o número que a entrada do modelo no catálogo OrcaRouter repete, que é a versão da afirmação que nossos próprios leitores encontrariam. A cifra comparável do GPT-6 Sol no τ²-Bench não é publicada no mesmo quadro, então trate a comparação como direcional: no único benchmark que o DeepSeek escolheu destacar, o modelo aberto está no topo da área, e o modelo fechado não colocou um número na mesma coluna.

E a questão da propriedade, que não é um benchmark de forma alguma. Um checkpoint MIT disponível para download significa que você pode executar o modelo no seu próprio hardware, manter uma solicitação fora da rede de qualquer um, fazer ajuste fino nele, fixar uma versão e saber que ela ainda estará lá em três anos. Nenhum fornecedor pode descontinuá-lo, alterar seu preço ou retirá-lo de uma tabela de preços. Para uma classe de compradores — setores regulados, qualquer pessoa com uma restrição de residência de dados, qualquer pessoa que já foi prejudicada pela descontinuação de um modelo — isso vale mais do que onze pontos de índice.

Onde o GPT-6 Sol vence, e não é apenas o índice

O Terminal-Bench 4.0 é a linha menos lisonjeira no cartão do DeepSeek V4 Pro: 14,1% contra 43,9% do GPT-6 Sol. Isso não é uma diferença de arredondamento e aponta para um perfil real — o modelo aberto é forte em orquestração de ferramentas em múltiplos turnos e fraco no trabalho de terminal de longo horizonte do qual os agentes de codificação modernos são feitos. Se a sua carga de trabalho for um agente que precisa manter uma sessão de shell funcionando por vinte minutos, esta única avaliação é mais preditiva da sua experiência do que o composto do índice.

A multimodalidade é a segunda. O DeepSeek V4 Pro é entrada de texto, saída de texto. O GPT-6 Sol aceita imagens e arquivos, e isso não é um mero item de lista de recursos — trabalho profissional com grande volume de documentos significa capturas de tela, páginas digitalizadas, diagramas e PDFs, e um modelo apenas de texto não consegue entrar nessa categoria de forma alguma.

O terceiro é o que aconteceu esta semana. O GPT-6 chegou à aba Chat do ChatGPT para Plus, Pro, Business e Enterprise em 7 de outubro, com Free e Go a seguir a partir de 8 de outubro, trazendo uma capacidade que a Ope​nAI chama de Intelligent UI — respostas que compõem texto, elementos gráficos, gráficos, formulários e controles de toque por pergunta, em vez de recorrer à prosa por padrão. Isso é uma superfície, não um recurso de API, e não altera uma linha do seu código de integração. O que isso muda é o padrão ambiente: o modelo que a sua equipe já tem aberto numa aba do navegador agora é o GPT-6, e o trabalho de prototipagem tende a migrar para o modelo que consegue alcançar sem uma chave. Relatado pelo fornecedor e não reproduzido, a Ope​nAI também afirma que o GPT-6 em Extra High começa a responder tão rápido quanto o GPT-5.6 em Medium, e que o GPT-6 Instant começa a responder 44% mais cedo em perguntas com suporte de busca.

Executando um, ou executando ambos

A razão pela qual este emparelhamento é mais fácil de fazer hedge do que a maioria é que ambos os modelos estão no mesmo catálogo. O OrcaRouter encaminha o GPT-6 Sol e o DeepSeek V4 Pro — juntamente com outros 200 modelos — através de um único endpoint compatível com Ope​nAI numa única chave, com 0% de acréscimo sobre o preço de tabela do provedor. É esse repasse que torna a estrutura de pico/fora de pico legível em vez de misteriosa: a redução para metade fora de pico da Dee​pSeek é do fornecedor, não mexemos nisso, e quando um fornecedor altera os preços, a alteração fica ativa aqui no mesmo dia.

É também aí que a decisão da janela de pico se torna uma decisão de encaminhamento. A tarifa fora de pico do DeepSeek V4 Pro é metade da sua tarifa de pico, e as janelas de pico são horas UTC fixas. Uma tarefa em lote que pode ser deslocada vale a pena ser agendada em torno delas, e um caminho sensível à latência vale a pena manter fora delas. Com ambos os modelos atrás de uma única chave, a divisão é uma configuração, e não um segundo contrato com fornecedor: encaminhe o trabalho em volume e de saída longa para o DeepSeek V4 Pro fora de pico, encaminhe o tráfego multimodal e com uso intenso de raciocínio para o GPT-6 Sol, e deixe o failover automático cobrir um limite de taxa de qualquer um dos lados, em vez de descobri-lo em produção.

A screenshot of the OrcaRouter model page for openai/gpt-6-sol, showing the OpenAI vendor label, a 2026-09-22 release date, a 1.05M-token context window, a 128K-token maximum output, text, image and file input and tool calling, and pricing of $2.00 per million input tokens and $10.00 per million output tokens.

O que eu realmente faria

Se precisar de imagens, ficheiros ou de uma pontuação de raciocínio de fronteira e estiver a comprar uma API, o GPT-6 Sol é a resposta e os onze pontos de índice são, em grande parte, irrelevantes — o critério multimodal decide a questão antes de os benchmarks votarem. Se precisar de uma saída de 384 000 tokens, de uma licença que possa manter, de uma implementação no local (on-premise) ou do custo mais baixo por tarefa concluída no ranking, o DeepSeek V4 Pro vence e a diferença no índice diz respeito ao grupo de pares de outra pessoa.

O que eu não faria é ler 36 contra 47,6 como uma lacuna de capacidade e comprar com base nisso. Os medidores comparáveis — US$ 0,67 contra US$ 1,04 por tarefa, e uma diferença de verbosidade de 2,1× escondida dentro de uma diferença de manchete de 4× — contam uma história muito mais próxima da realidade do que as linhas do índice, e são eles que aparecem numa fatura.

O próximo ponto a observar é se a DeepSeek fecha a lacuna no Terminal-Bench em uma atualização do V4 Pro, já que essa é a única medição em que o modelo aberto parece genuinamente atrás, e não apenas pontuado de forma diferente. O GPT-6, por sua vez, simplesmente deixou de ser uma escolha e passou a ser o padrão, e é difícil discordar de padrões mesmo quando o benchmark diz o contrário.

Comparados neste artigo1

Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente