Um cartão de destaque gerado para GPT-6.1 Sol vs DeepSeek V4 Pro intitulado 'Três metros, três respostas diferentes', com três cartões de métricas com os dizeres 'Preço combinado 4x', 'Custo por tarefa de índice 1,07x' e 'Índice de Inteligência 16 pontos', uma linha com os dizeres 'Um é proprietário e vê imagens. Um é de pesos abertos licenciado pelo MIT e somente texto.', um rodapé com os dizeres 'Preços conforme OpenAI e DeepSeek; índices e custo por tarefa conforme a Artificial Analysis, que compara modelos de pesos abertos e proprietários em diferentes grupos de pares.', e o logotipo da OrcaRouter no canto inferior direito.
Guides & Insights

GPT-6.1 Sol vs DeepSeek V4 Pro: Três Medidores, Três Respostas Diferentes

Autor

Elias Hawthorne

Data de publicação

Modelos mais recentes · 20Ver todos os modelos →
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Pergunte qual é a distância entre GPT-6.1 Sol e DeepSeek V4 Pro e a resposta honesta é que depende de qual medidor você lê, e os três medidores discordam mais do que a maioria das comparações de modelos discorda sobre tudo. Em preço por milhão de tokens, combinado numa proporção de 3:1 de entrada para saída, são US$ 4,00 contra US$ 0,99 — um fator de quatro. Quanto ao que de fato custou rodar a mesma suíte de avaliação, são US$ 0,72 contra US$ 0,67 por tarefa — sete por cento. No Índice de Inteligência da Artificial Analysis, são 51,8 contra 36 — dezesseis pontos, o que soa decisivo até você olhar contra quem cada número foi comparado, porque a própria metodologia desse avaliador coloca os dois modelos em ligas diferentes. O GPT-6.1 Sol foi lançado em 29 de setembro de 2026 a US$ 2,00 de entrada e US$ 10,00 de saída com uma janela de 1.050.000 tokens. O DeepSeek V4 Pro é um carro-chefe de mistura de especialistas licenciado pelo MIT, 1,6 trilhão de parâmetros com 49 bilhões ativos, lançado em 13 de agosto de 2026 a US$ 0,66 e US$ 1,98 com uma janela de 1.048.576 tokens. Um é um modelo de texto que você pode baixar. O outro vê imagens. Descobrir por qual dos três medidores você deve realmente se guiar é o trabalho inteiro.

A linha de índice não é a comparação que parece ser.

Comece pelo número que é mais citado, porque é o que mais frequentemente é citado de forma errada.

A Artificial Analysis publica sua metodologia junto com seu leaderboard, e duas frases dela importam aqui. Modelos de pesos abertos, diz ela, são comparados apenas com outros modelos de pesos abertos da mesma classe de tamanho — minúscula, pequena, média, grande, com o limite em 150 bilhões de parâmetros. Modelos proprietários, em vez disso, são comparados dentro de uma faixa de preço, em uma proporção combinada de 3:1 entre entrada e saída. Esses são dois grupos de referência diferentes. O DeepSeek V4 Pro 0813 tem pesos abertos — a própria FAQ do avaliador confirma isso e aponta para os pesos publicados — e, com 1,6 trilhão de parâmetros totais, ele se enquadra na classe grande de pesos abertos. O GPT-6.1 Sol é proprietário e é pontuado em comparação com modelos de sua própria faixa de preço.

Um 51,8 e um 36 que aparecem em linhas adjacentes da mesma tabela, portanto, não são uma comparação direta. Eles são uma pontuação em relação a um conjunto de pares e uma pontuação em relação a outro, e é exatamente por isso que os números de custo por tarefa são comparáveis e os números brutos do índice não são. Se você quer saber se o DeepSeek V4 Pro é bom para um modelo baixável, 36 é o número que responde a isso. Se você quer saber como ele se sai contra um modelo de fronteira hospedado, a coluna do índice não lhe dirá, e este é um caso em que a atitude honesta é dizer isso em vez de subtrair 36 de 51,8 e chamar isso de lacuna.

O que pode ser comparado de forma justa: os cartões de preços, os limites de contexto e de saída, as listas de modalidades e o custo de executar a mesma suíte de avaliação — porque esse último número é uma contabilização de trabalho idêntico, não uma pontuação.

O que os medidores brutos dizem

A screenshot of the OrcaRouter model page for deepseek/deepseek-v4-pro, credited to DeepSeek and dated 2026-04-24, showing the model identifier, text-only input with tools, JSON and reasoning, a 1M-token context window with a 384K maximum output, and a rate row reading $0.66 input and $1.98 output per million tokens alongside a 1.92-second median latency and a 1030.7M seven-day traffic figure.

• Preço de entrada — GPT-6.1 Sol $2,00 vs DeepSeek V4 Pro $0,66 por milhão de tokens

• Preço de saída — GPT-6.1 Sol $10,00 vs DeepSeek V4 Pro $1,98, passando para $1,32 e $3,96 dentro de duas janelas UTC de quatro horas nos dias da semana

• Leitura de cache — GPT-6.1 Sol $0,10 vs DeepSeek V4 Pro $0,022 por milhão de tokens; ambos têm cache, e o lado mais barato é ainda 4,5× mais barato

• Custo por tarefa de indexação — GPT-6.1 Sol US$ 0,72 vs. DeepSeek V4 Pro US$ 0,67

• Tokens de saída emitidos na suíte de índices — GPT-6.1 Sol 67M vs DeepSeek V4 Pro 160M

• Saída máxima — DeepSeek V4 Pro 384.000 tokens vs GPT-6.1 Sol 128.000 tokens

• Modalidades — GPT-6.1 Sol aceita texto, imagens e arquivos; DeepSeek V4 Pro aceita apenas texto

A quarta e a quinta linhas são o par interessante. O DeepSeek V4 Pro emite 2,4 vezes mais tokens na mesma suíte e ainda termina 7% mais barato por tarefa, porque sua taxa de saída é um quinto da do GPT-6.1 Sol. É assim que um modelo orientado por preço se parece quando você mede a saída em vez da taxa: a verbosidade é real, e não apaga a vantagem. A janela de tempo é o asterisco. Dois blocos de quatro horas em dias úteis — 40 das 168 horas de uma semana — dobram a taxa listada para $1,32 e $3,96, e essa sobretaxa se aplica aos mesmos tokens que, de outra forma, seriam os mais baratos em qualquer um dos cartões.

O que o modelo mais barato não faz

Três coisas, e cada uma é um limite rígido, não uma concessão.

Ele não vê. O DeepSeek V4 Pro é entrada de texto, saída de texto. Sem capturas de tela, sem PDFs digitalizados, sem leitura de gráficos, sem diagramas em um ticket. Fluxos de trabalho de uso de computador e com grande volume de documentos — exatamente as cargas de trabalho para as quais o GPT-6.1 Sol está posicionado — estão fora de questão a qualquer preço. Se o seu pipeline já encaminha imagens para um modelo de visão, isso não é problema; se não encaminha, é a restrição decisiva.

Não tem uma cadência de lançamento com que você possa planejar. O nome "deepseek-v4-pro" tem sido resolvido para a build 0813 desde agosto, e o caminho até lá não foi silencioso: o fornecedor anunciou a descontinuação da build para 14 de setembro, retirou o anúncio dois dias antes da data, e continuou a servir a API com cobrança inalterada. Nosso próprio catálogo ainda o lista como o carro-chefe com o mesmo contexto, teto de saída e limite de concorrência. Um fornecedor que consegue retirar uma depreciação em dois dias também pode se recusar a fazê-lo; a conclusão operacional não é que o modelo seja instável, mas que o nome é um ponteiro, e fixar o comportamento a um identificador de build em vez de um nome de rota é o seguro barato.

Não traz consigo o conhecimento circundante. O GPT-6.1 Sol tem oito dias e já tem uma configuração independente publicada; o DeepSeek V4 Pro tem um histórico de avaliação mais longo e uma base de profissionais muito maior, incluindo uma stack de serving publicada e trabalho de throughput de terceiros. Para uma implantação auto-hospedada, esse conjunto de material vale mais do que a linha do índice, porque é o que você consulta quando o modelo se comporta de forma estranha no seu hardware, e não num benchmark.

Quando o medidor quatro vezes mais barato é o medidor errado

Se o modelo barato fosse simplesmente pior em tudo, este seria um artigo curto. O fato incômodo é que os dois estão a 7% de distância por tarefa em trabalho idêntico, e a 2,4× de distância em quanto escrevem para chegar lá. Isso significa que o medidor de tokens combinados — aquele que diz 4× — está medindo uma diferença que, na maioria das vezes, você não paga, porque precifica uma mistura de tokens que talvez você nunca envie. E o medidor de índice, aquele que diz 16 pontos, está medindo entre dois grupos de pares e não pode ser subtraído.

Então, a divisão prática não é "modelo de fronteira para trabalho difícil, modelo barato para trabalho fácil". É uma divisão por modalidade e uma divisão por volume. Qualquer coisa com uma imagem vai para o GPT-6.1 Sol, e também qualquer coisa em que a resposta é curta e o raciocínio é a parte cara — seus cinco níveis de esforço, de baixo a máximo, com médio como padrão, permitem comprar raciocínio sem comprar prosa, e sua entrada em cache a $0,10 torna barato um prompt longo e repetido. Qualquer coisa apenas de texto, de alto volume e tolerante a uma resposta mais longa — classificação, extração, sumarização, geração em massa com um orçamento de saída de 384.000 tokens — vai para o DeepSeek V4 Pro, idealmente fora das duas janelas UTC.

Ambos na mesma tecla, e a divisão é uma linha de configuração

Ambos os modelos estão no OrcaRouter com as tarifas publicadas pelos próprios provedores, sem acréscimos: GPT-6.1 Sol a $2,00 / $10,00, passando para $4,00 / $15,00 acima de 272.000 tokens de prompt, e DeepSeek V4 Pro a $0,66 / $1,98, com as duas janelas de tempo mantidas conforme listadas. Uma única chave, uma única fatura, um único endpoint compatível com OpenAI para ambos.

É por isso que a divisão acima vale a pena registrar em vez de discutir. Uma divisão por modalidade é expressável como uma regra de roteamento, de modo que as solicitações com imagens vão para o modelo de visão e o grosso do texto vai para o mais barato sem alteração na aplicação; se uma rota degradar, o failover move a chamada em vez de falhá-la. E, como ambos estão no mesmo endpoint, a comparação de preços que realmente importa — a sua, com o seu tráfego, na sua combinação de tokens — pode ser gerada a partir das suas próprias faturas em vez da média de uma suíte de benchmarks.

A screenshot of OpenAI's developer model page for GPT-6.1 Sol, headed 'GPT-6.1 Sol' with the tagline 'Near-Astra performance for complex work at a lower cost', showing a 1,050,000-token context window, 128,000 max output tokens, an Apr 30, 2026 knowledge cutoff, a price row reading $2 input and $10 output per million tokens, and the note that reasoning.effort supports low, medium (default), high, xhigh and max while none and minimal are not supported.A generated scoreboard titled 'GPT-6.1 Sol vs DeepSeek V4 Pro — the scoreboard' showing two columns on six shared rows: input price $2.00 against $0.66 per million tokens; output price $10.00 against $1.98; cache read $0.10 against $0.022; cost per index task $0.72 against $0.67; maximum output 128,000 against 384,000 tokens; modalities text, image and file against text only. A footer reads 'Prices per OpenAI and DeepSeek as listed on OrcaRouter; cost-per-task figures per Artificial Analysis, whose index compares open-weights and proprietary models in different peer groups.'

O veredito, em uma linha, é que a leitura quatro vezes mais barata é a que se deve desconfiar, e a leitura de sete por cento é a que se deve conferir. Quatro vezes é o que o medidor combinado diz sobre uma mistura de tokens que talvez você não envie. Sete por cento é o custo da mesma avaliação em ambos, e vem com uma diferença de verbosidade de 2,4× já embutida. Os dezesseis pontos são reais, também estão distribuídos entre dois grupos de pares, e a restrição que de fato decide a maioria das implantações desse par não é um número, de modo algum: um desses modelos consegue ler uma captura de tela e o outro não.

Comparados neste artigo2

Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente