
GPT-6.1 Sol vs DeepSeek V4 Pro: Três Medidores, Três Respostas Diferentes
- openaiNOVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligência
- anthropicNOVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligência
- typesafeNOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 161 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Inteligência
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Inteligência
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Inteligência
- xAIGrok 4.72026-09-2146Inteligência
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 79 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 53 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 301 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
Pergunte qual é a distância entre GPT-6.1 Sol e DeepSeek V4 Pro e a resposta honesta é que depende de qual medidor você lê, e os três medidores discordam mais do que a maioria das comparações de modelos discorda sobre tudo. Em preço por milhão de tokens, combinado numa proporção de 3:1 de entrada para saída, são US$ 4,00 contra US$ 0,99 — um fator de quatro. Quanto ao que de fato custou rodar a mesma suíte de avaliação, são US$ 0,72 contra US$ 0,67 por tarefa — sete por cento. No Índice de Inteligência da Artificial Analysis, são 51,8 contra 36 — dezesseis pontos, o que soa decisivo até você olhar contra quem cada número foi comparado, porque a própria metodologia desse avaliador coloca os dois modelos em ligas diferentes. O GPT-6.1 Sol foi lançado em 29 de setembro de 2026 a US$ 2,00 de entrada e US$ 10,00 de saída com uma janela de 1.050.000 tokens. O DeepSeek V4 Pro é um carro-chefe de mistura de especialistas licenciado pelo MIT, 1,6 trilhão de parâmetros com 49 bilhões ativos, lançado em 13 de agosto de 2026 a US$ 0,66 e US$ 1,98 com uma janela de 1.048.576 tokens. Um é um modelo de texto que você pode baixar. O outro vê imagens. Descobrir por qual dos três medidores você deve realmente se guiar é o trabalho inteiro.
A linha de índice não é a comparação que parece ser.
Comece pelo número que é mais citado, porque é o que mais frequentemente é citado de forma errada.
A Artificial Analysis publica sua metodologia junto com seu leaderboard, e duas frases dela importam aqui. Modelos de pesos abertos, diz ela, são comparados apenas com outros modelos de pesos abertos da mesma classe de tamanho — minúscula, pequena, média, grande, com o limite em 150 bilhões de parâmetros. Modelos proprietários, em vez disso, são comparados dentro de uma faixa de preço, em uma proporção combinada de 3:1 entre entrada e saída. Esses são dois grupos de referência diferentes. O DeepSeek V4 Pro 0813 tem pesos abertos — a própria FAQ do avaliador confirma isso e aponta para os pesos publicados — e, com 1,6 trilhão de parâmetros totais, ele se enquadra na classe grande de pesos abertos. O GPT-6.1 Sol é proprietário e é pontuado em comparação com modelos de sua própria faixa de preço.
Um 51,8 e um 36 que aparecem em linhas adjacentes da mesma tabela, portanto, não são uma comparação direta. Eles são uma pontuação em relação a um conjunto de pares e uma pontuação em relação a outro, e é exatamente por isso que os números de custo por tarefa são comparáveis e os números brutos do índice não são. Se você quer saber se o DeepSeek V4 Pro é bom para um modelo baixável, 36 é o número que responde a isso. Se você quer saber como ele se sai contra um modelo de fronteira hospedado, a coluna do índice não lhe dirá, e este é um caso em que a atitude honesta é dizer isso em vez de subtrair 36 de 51,8 e chamar isso de lacuna.
O que pode ser comparado de forma justa: os cartões de preços, os limites de contexto e de saída, as listas de modalidades e o custo de executar a mesma suíte de avaliação — porque esse último número é uma contabilização de trabalho idêntico, não uma pontuação.
O que os medidores brutos dizem

• Preço de entrada — GPT-6.1 Sol $2,00 vs DeepSeek V4 Pro $0,66 por milhão de tokens
• Preço de saída — GPT-6.1 Sol $10,00 vs DeepSeek V4 Pro $1,98, passando para $1,32 e $3,96 dentro de duas janelas UTC de quatro horas nos dias da semana
• Leitura de cache — GPT-6.1 Sol $0,10 vs DeepSeek V4 Pro $0,022 por milhão de tokens; ambos têm cache, e o lado mais barato é ainda 4,5× mais barato
• Custo por tarefa de indexação — GPT-6.1 Sol US$ 0,72 vs. DeepSeek V4 Pro US$ 0,67
• Tokens de saída emitidos na suíte de índices — GPT-6.1 Sol 67M vs DeepSeek V4 Pro 160M
• Saída máxima — DeepSeek V4 Pro 384.000 tokens vs GPT-6.1 Sol 128.000 tokens
• Modalidades — GPT-6.1 Sol aceita texto, imagens e arquivos; DeepSeek V4 Pro aceita apenas texto
A quarta e a quinta linhas são o par interessante. O DeepSeek V4 Pro emite 2,4 vezes mais tokens na mesma suíte e ainda termina 7% mais barato por tarefa, porque sua taxa de saída é um quinto da do GPT-6.1 Sol. É assim que um modelo orientado por preço se parece quando você mede a saída em vez da taxa: a verbosidade é real, e não apaga a vantagem. A janela de tempo é o asterisco. Dois blocos de quatro horas em dias úteis — 40 das 168 horas de uma semana — dobram a taxa listada para $1,32 e $3,96, e essa sobretaxa se aplica aos mesmos tokens que, de outra forma, seriam os mais baratos em qualquer um dos cartões.
O que o modelo mais barato não faz
Três coisas, e cada uma é um limite rígido, não uma concessão.
Ele não vê. O DeepSeek V4 Pro é entrada de texto, saída de texto. Sem capturas de tela, sem PDFs digitalizados, sem leitura de gráficos, sem diagramas em um ticket. Fluxos de trabalho de uso de computador e com grande volume de documentos — exatamente as cargas de trabalho para as quais o GPT-6.1 Sol está posicionado — estão fora de questão a qualquer preço. Se o seu pipeline já encaminha imagens para um modelo de visão, isso não é problema; se não encaminha, é a restrição decisiva.
Não tem uma cadência de lançamento com que você possa planejar. O nome "deepseek-v4-pro" tem sido resolvido para a build 0813 desde agosto, e o caminho até lá não foi silencioso: o fornecedor anunciou a descontinuação da build para 14 de setembro, retirou o anúncio dois dias antes da data, e continuou a servir a API com cobrança inalterada. Nosso próprio catálogo ainda o lista como o carro-chefe com o mesmo contexto, teto de saída e limite de concorrência. Um fornecedor que consegue retirar uma depreciação em dois dias também pode se recusar a fazê-lo; a conclusão operacional não é que o modelo seja instável, mas que o nome é um ponteiro, e fixar o comportamento a um identificador de build em vez de um nome de rota é o seguro barato.
Não traz consigo o conhecimento circundante. O GPT-6.1 Sol tem oito dias e já tem uma configuração independente publicada; o DeepSeek V4 Pro tem um histórico de avaliação mais longo e uma base de profissionais muito maior, incluindo uma stack de serving publicada e trabalho de throughput de terceiros. Para uma implantação auto-hospedada, esse conjunto de material vale mais do que a linha do índice, porque é o que você consulta quando o modelo se comporta de forma estranha no seu hardware, e não num benchmark.
Quando o medidor quatro vezes mais barato é o medidor errado
Se o modelo barato fosse simplesmente pior em tudo, este seria um artigo curto. O fato incômodo é que os dois estão a 7% de distância por tarefa em trabalho idêntico, e a 2,4× de distância em quanto escrevem para chegar lá. Isso significa que o medidor de tokens combinados — aquele que diz 4× — está medindo uma diferença que, na maioria das vezes, você não paga, porque precifica uma mistura de tokens que talvez você nunca envie. E o medidor de índice, aquele que diz 16 pontos, está medindo entre dois grupos de pares e não pode ser subtraído.
Então, a divisão prática não é "modelo de fronteira para trabalho difícil, modelo barato para trabalho fácil". É uma divisão por modalidade e uma divisão por volume. Qualquer coisa com uma imagem vai para o GPT-6.1 Sol, e também qualquer coisa em que a resposta é curta e o raciocínio é a parte cara — seus cinco níveis de esforço, de baixo a máximo, com médio como padrão, permitem comprar raciocínio sem comprar prosa, e sua entrada em cache a $0,10 torna barato um prompt longo e repetido. Qualquer coisa apenas de texto, de alto volume e tolerante a uma resposta mais longa — classificação, extração, sumarização, geração em massa com um orçamento de saída de 384.000 tokens — vai para o DeepSeek V4 Pro, idealmente fora das duas janelas UTC.
Ambos na mesma tecla, e a divisão é uma linha de configuração
Ambos os modelos estão no OrcaRouter com as tarifas publicadas pelos próprios provedores, sem acréscimos: GPT-6.1 Sol a $2,00 / $10,00, passando para $4,00 / $15,00 acima de 272.000 tokens de prompt, e DeepSeek V4 Pro a $0,66 / $1,98, com as duas janelas de tempo mantidas conforme listadas. Uma única chave, uma única fatura, um único endpoint compatível com OpenAI para ambos.
É por isso que a divisão acima vale a pena registrar em vez de discutir. Uma divisão por modalidade é expressável como uma regra de roteamento, de modo que as solicitações com imagens vão para o modelo de visão e o grosso do texto vai para o mais barato sem alteração na aplicação; se uma rota degradar, o failover move a chamada em vez de falhá-la. E, como ambos estão no mesmo endpoint, a comparação de preços que realmente importa — a sua, com o seu tráfego, na sua combinação de tokens — pode ser gerada a partir das suas próprias faturas em vez da média de uma suíte de benchmarks.


O veredito, em uma linha, é que a leitura quatro vezes mais barata é a que se deve desconfiar, e a leitura de sete por cento é a que se deve conferir. Quatro vezes é o que o medidor combinado diz sobre uma mistura de tokens que talvez você não envie. Sete por cento é o custo da mesma avaliação em ambos, e vem com uma diferença de verbosidade de 2,4× já embutida. Os dezesseis pontos são reais, também estão distribuídos entre dois grupos de pares, e a restrição que de fato decide a maioria das implantações desse par não é um número, de modo algum: um desses modelos consegue ler uma captura de tela e o outro não.
Comparados neste artigo2
Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente
