DeepSeek V4 Pro Data de Lançamento: Já 14x Mais Barato que Kimi K3, Ainda Não Tão Inteligente
Guides & Insights

DeepSeek V4 Pro Data de Lançamento: Já 14x Mais Barato que Kimi K3, Ainda Não Tão Inteligente

Autor

Jim Song

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Em 31 de julho de 2026, a empresa publicou uma entrada de changelog anunciando que seu modelo barato havia superado o caro. A entrada era sobre DeepSeek V4 Flash, o nível de eficiência de 284B, e a alegação principal era "capacidades de agente significativamente aprimoradas, com resultados de benchmark superando em muito o V4-Pro-Preview." V4-Pro-Preview é o DeepSeek V4 Pro — o carro-chefe de 1,6 trilhão de parâmetros, aquele que custa três vezes mais por token. A mesma entrada terminava com uma única frase sobre ele: "O lançamento oficial do DeepSeek-V4-Pro virá em breve." Esse é o contexto para a previsão que circula atualmente, de que quando o V4 Pro real chegar, ele será de nível Kimi K3, mas dez vezes mais barato. Metade disso já é mensurável, e está errada na direção que quase ninguém espera.

Uma nota sobre o que este artigo é e não é. Não há system card vazado aqui, nem benchmark interno, nem data. A previsão em circulação vem de @scaling01 no X — "DeepSeek-V4 Pro será um sucesso, provavelmente também no nível do Kimi-K3, mas 10x mais barato" — e é uma previsão de um profissional muito seguido, não uma divulgação de alguém com acesso. Tratar isso como vazamento é como se escrevem más coberturas de data de lançamento. O que podemos fazer em vez disso é pegar as duas metades testáveis da afirmação e verificá-las com números que já existem, porque o build de pré-visualização está disponível para chamadas há três meses e tanto ele quanto o Kimi K3 foram executados por um laboratório independente. Tudo abaixo está rotulado por fonte: a documentação da própria empresa, as medições da Artificial Analysis ou aritmética que fizemos nós mesmos e mostramos.

O que a DeepSeek realmente disse, e o que não disse

A superfície confirmada é maior do que o enquadramento de "modelo não lançado" sugere. O V4 Pro não é vapor — você pode chamá-lo agora mesmo. O que não aconteceu é o lançamento que a própria empresa considera oficial.

Arquitetura — um modelo de mistura de especialistas com 1.6T de parâmetros totais e 49B ativos por token, confirmado pela empresa e listado de forma idêntica no Artificial Analysis como 1600B/49B.

Contexto e saída — uma janela de entrada de 1M de tokens (1.048.576) com até 384K tokens de saída. Texto entra, texto sai; sem entrada de imagem, áudio ou vídeo.

Licença e pesos — MIT, com pesos publicados no Hugging Face. Este é um carro-chefe de pesos abertos, que é exatamente o motivo pelo qual a comparação com o Kimi K3 é interessante.

Preço de lista — $0.435 por milhão de tokens de entrada em caso de cache miss, $0.003625 em caso de cache hit e $0.87 por milhão de tokens de saída, conforme a própria página de preços da empresa.

Interfaces — ChatCompletions no estilo OpenAI e endpoints no formato Anthropic, além de níveis de esforço de raciocínio, chamada de ferramentas e saída estruturada.

Cronologia até agora — a família V4 chegou como prévia em 24 de abril de 2026; os antigos deepseek-chat e deepseek-reasoner, nomes de modelos, foram aposentados em 24 de julho de 2026; Flash recebeu sua versão oficial em 31 de julho de 2026; Pro não.

6 de agosto de 2026 — A DeepSeek disse aos desenvolvedores que planeja aumentar o preço geral dos serviços da API DeepSeek "em um futuro próximo, com um aumento significativo esperado", e reiterou que o lançamento oficial do V4 Pro virá em seguida. Nenhuma nova tarifa e nenhuma data efetiva foram publicadas.

E as partes que permanecem genuinamente desconhecidas, que é a maior parte do que as pessoas procuram:

A data de GA — ainda não anunciada. "Será divulgada em breve" continua sendo a totalidade do compromisso formal da empresa. Relatos não confirmados da imprensa apontam para uma janela em meados de agosto — um veículo mencionou 10–20 de agosto, e a página de preços de um revendedor alterou os preços de cache do V4 Pro em 3 de agosto, em um padrão que historicamente precede um lançamento — mas nada disso é a empresa falando. Nenhuma data foi confirmada.

O que a build GA mudará — não foi informado. A empresa não disse se o V4 Pro oficial é um novo pós-treinamento dos mesmos pesos, um novo pré-treinamento ou um reajuste de preço.

Se o preço sobrevive a isso — permanece sem resposta, e há uma razão específica para nos preocuparmos com isso, que abordaremos abaixo.

Uma correção que vale a pena ser feita explicitamente, porque os resultados de busca para essa pergunta estão contaminados: você encontrará páginas afirmando que a família V4 atingiu disponibilidade geral em 20 de julho de 2026. O changelog da própria empresa, onze dias após essa data, diz que o lançamento oficial do V4 Pro ainda está pendente e acrescenta que a atualização de 31 de julho "apenas atualiza a API DeepSeek-V4-Flash. A API DeepSeek-V4-Pro e os modelos APP/WEB permanecem inalterados." Quando um resumo de terceiros e o changelog primário do fornecedor discordam, o changelog vence.

A afirmação de preço: "10x mais barato" é a leitura conservadora.

Kimi K3 é listado a US$ 3,00 por milhão de tokens de entrada e US$ 15,00 por milhão de saída, com acertos de cache a US$ 0,30. O V4 Pro é listado a US$ 0,435 e US$ 0,87, com acertos de cache a US$ 0,003625. Coloque-os frente a frente e "10x" acaba sendo o limite inferior de uma faixa, não o destaque:

Tokens de entrada — $3,00 contra $0,435, então o V4 Pro é 6,9x mais barato. Esta é a única dimensão em que a afirmação exagera.

Tokens de saída — $15,00 contra $0,87, ou 17,2x mais barato. A saída é onde os modelos de raciocínio gastam, o que faz deste o número que mais importa.

Uma combinação entrada-saída 70/30 — $6,60 por milhão contra $0,5655, ou 11,7x.

A combinação 7:2:1 de cache-hit/input/output da Artificial Analysis — $2,31 contra $0,18, ou 12,8x.

Entrada em cache — $0,30 contra $0,003625, aproximadamente 83x. O preço de leitura de cache da empresa ocupa o 4º lugar entre 101 modelos que a Artificial Analysis monitora, com um desconto de 99% em relação à sua própria taxa de cache miss.

Combinações hipotéticas são discutíveis, então aqui está uma medida. A Artificial Analysis publica o que realmente gastou executando seu Índice de Inteligência completo em cada modelo — a mesma suíte de avaliação, o mesmo arcabouço, contagens reais de tokens em vez de uma proporção assumida. Kimi K3 custou $2.437,41 para avaliar. V4 Pro custou $176,34. Isso é 13.8x, em uma carga de trabalho idêntica, em dólares que alguém realmente pagou.

Vale a pena entender o que torna esse número inferior à relação de preço de saída de 17,2x, porque é o único ponto em que a barateza do V4 Pro é em parte autoinfligida. O V4 Pro é verboso: consumiu 180 milhões de tokens de saída para percorrer o índice, contra 130 milhões do Kimi K3 e contra uma mediana de 100 milhões para a sua categoria. Ou seja, ele gasta cerca de 38% mais tokens para dizer o que tem a dizer, o que reduz a vantagem por token. O número de 13,8x já incorpora isso; o de 17,2x, não. Se você estiver fazendo um orçamento, use o número medido.

Esta é também a parte da história que é fácil verificar por conta própria, em vez de aceitar por fé. Como o OrcaRouter repassa os preços de tabela dos provedores diretamente, com margem de 0%, os valores por token nas nossas páginas dos modelos deepseek/deepseek-v4-pro e kimi/kimi-k3 são os dos próprios fornecedores — a K3 mostra $3.00/$15.00 na nossa página e $3.00/$15.00 na da Moonshot — não uma taxa revendida com uma margem escondida — o que significa que a aritmética acima se reproduz em uma única fatura, e se algum dos fornecedores alterar um preço, a mudança chega ao nosso lado no mesmo dia, em vez de após um ciclo de contrato.

A alegação de inteligência: 13 pontos, não paridade

"Kimi K3 level" é a metade da previsão que não sobrevive ao contato com os números atuais. No Índice de Inteligência da Artificial Analysis, em 5 de agosto de 2026, Kimi K3 pontua 57 e DeepSeek V4 Pro (raciocínio, esforço máximo) pontua 44 — classificado em #6 de 101 modelos, o que é uma colocação genuinamente forte, e ainda 13 pontos aquém. Ambos são medidos pelo mesmo laboratório no mesmo composto, ambos com esforço máximo de raciocínio, ambos com contexto de 1M de tokens.

Os benchmarks dos fornecedores contam uma história diferente e mais lisonjeira, o que é exatamente o motivo pelo qual precisam de rotulagem. A empresa reporta V4 Pro-Preview com 80,6% no SWE-bench Verified e 90,1% no GPQA Diamond. A Moonshot reporta Kimi K3 com 76,8% no SWE-bench Verified e 93,5% no GPQA Diamond. Tomando os resultados pelo valor de face, o V4 Pro vence o benchmark de codificação de forma inequívoca. Nenhum dos dois conjuntos foi reproduzido de forma independente; eles foram produzidos em plataformas de avaliação diferentes por equipes com interesse no resultado, e no único agregado em que um terceiro executou ambos os modelos, a ordem se inverte. Esse é todo o argumento para desconfiar de comparações de benchmark único entre fornecedores.

Duas coisas sobre o número do índice merecem ressalvas próprias. Primeiro, se você encontrar publicações mais antigas citando o V4 Pro em 52 em vez de 44, elas não estão erradas — o artigo de lançamento de abril da própria Artificial Analysis colocou o V4 Pro (Max) em 52 e o chamou de modelo de raciocínio de pesos abertos nº 2. O índice é revisado, e as revisões alteram a pontuação de todos os modelos. A regra prática é que apenas comparações do mesmo snapshot significam algo; um 52 de abril e um 57 de agosto não devem aparecer na mesma frase. Segundo, a página da Artificial Analysis está datada como "Released April 2026" e não distingue a versão de pré-visualização de uma futura versão oficial, então seu 44 é uma medição do que o endpoint serviu, independentemente de quando foi testado.

Onde o V4 Pro claramente supera o Kimi K3 é nos eixos que não são de inteligência. Ele gera 66,5 tokens por segundo contra 37,6 do K3, em uma classe cuja mediana é 65,9 — então o V4 Pro está em torno da média para sua classe e o Kimi K3 é incomumente lento. O tempo para o primeiro token é de 1,61 segundos contra 2,85. Para um loop de agente interativo, essa diferença é sentida a cada turno, e é o argumento mais forte para a versão de prévia como está hoje.

O que a build oficial do Flash nos diz sobre o Pro

Aqui está o mais próximo de evidência real sobre o modelo não lançado, e isso vem do irmão que já passou pelo processo.

{{1}}O changelog de 31 de julho da empresa afirma que{{/1}} {{2}}"DeepSeek-V4-Flash-0731 mantém a mesma arquitetura e o mesmo tamanho de modelo do DeepSeek-V4-Flash-Preview, tendo passado apenas por um novo pós-treinamento."{{/2}} {{3}}Mesma contagem de pesos, mesma arquitetura, mesmo preço — apenas pós-treinamento.{{/3}} {{4}}A Artificial Analysis avaliou o resultado em 50, contra 40 da versão Flash anterior.{{/4}} {{5}}Dez pontos no índice composto, vindos só do pós-treinamento, sem custo adicional por token.{{/5}} {{6}}O consumo de tokens de saída no índice também caiu 12%, de ~234M para ~206M, então ficou mais barato de operar pelo mesmo preço de tabela.{{/6}}

Aplique esse precedente ao Pro e a aritmética é inevitável: 44 mais 10 é 54. O Kimi K3 está em 57. Mesmo que o V4 Pro oficial repita o upgrade pós-treinamento mais bem-sucedido que a empresa já demonstrou publicamente, ele fica cerca de três pontos abaixo do "nível Kimi K3" — custando cerca de um catorze avos do custo de execução. Esse é um resultado notável e não é o resultado que a previsão prevê.

As ressalvas honestas sobre essa extrapolação, que é aritmética e não uma previsão: um ganho de +10 em um modelo de 284B diz pouco sobre o que está disponível em um modelo de 1.6T, e a margem pode ser maior ou muito menor. A empresa não disse que a versão Pro será apenas pós-treinamento. E o índice é um composto, então três pontos podem ser um único benchmark. A razão para calcular o número mesmo assim é que esse é o único precedente quantificado e confirmado pelo fornecedor que existe, e isso é muito mais do que aquilo em que a previsão se baseia.

Mais um detalhe desse changelog merece ser destacado em vez de repetido: as pontuações agentivas do Flash foram produzidas usando "o modo mínimo Harness da empresa (a ser lançado em breve)" com esforço máximo, topp=0.95, temperature=1.0. O harness que gerou os números não foi lançado publicamente — entrou em beta fechado no início de agosto — então esses números ainda não podem ser reproduzidos por ninguém fora da empresa, mesmo em princípio, não porque estão errados, mas porque o instrumento está indisponível. Espere que o lançamento do Pro chegue com o mesmo asterisco.

As cláusulas que poderiam desfazer a tese do modelo barato

Enterrada na documentação de preços da empresa está uma política que quase não tem cobertura dos preços da linha V4. Nas palavras da empresa, a API "adotará em breve" um cronograma segundo o qual "durante horários de pico, os preços serão 2x os preços normais, aplicável a todos os itens de faturamento." Os horários de pico são definidos como 09:00–12:00 e 14:00–18:00, horário de Pequim, diariamente — sete horas por dia, todos os dias. A data efetiva está "sujeita ao anúncio oficial" e, até o momento em que este texto foi escrito, a sobretaxa não está ativa.

Observe a direção. A empresa historicamente oferecia, fora do horário de pico, descontos na V3 e na R1; isto é uma sobretaxa de pico sobre a tarifa padrão. Se for ativada no multiplicador indicado, o preço diurno do V4 Pro passa a ser $0,87 na entrada e $1,74 na saída, e a comparação muda de forma: a vantagem combinada de 11,7x sobre o Kimi K3 cai para 5,8x, e os 13,8x medidos caem para 6,9x. Ainda é barato. Não é mais "10x mais barato" e não é mais barato nos horários em que uma equipe europeia ou asiática está de fato trabalhando.

No dia 6 de agosto, o sapato maior caiu. A DeepSeek anunciou em sua plataforma de desenvolvedores que planeja aumentar o preço geral dos serviços da API DeepSeek "em um futuro próximo, com um aumento significativo esperado". Nenhum novo valor e nenhuma data de vigência foram publicados, e a empresa não informou se o aumento é separado da tabela de horário de pico ou se será aplicado em conjunto com ela. A imprensa que cobre a empresa interpretou o anúncio como um sinal de que o lançamento oficial do V4 Pro é iminente — um carro-chefe ainda não lançado não é algo que se precifique de forma agressiva em um regime de descontos que se está prestes a abandonar. Quem estiver construindo um modelo de custos baseado no V4 Pro hoje deve modelar os dois cenários, e quem ler uma manchete como "a empresa é 14x mais barata" — inclusive esta — deve saber que ela descreve uma lista de preços à qual está vinculada uma condição de expiração anunciada. Esta é a forma mais provável de a metade da previsão referente ao preço deixar de ser verdadeira, e isso não tem nada a ver com o modelo.

Como você saberá que o build oficial foi lançado

Há um detalhe na forma como a empresa faz remessas que importa mais do que a data, e é um risco operacional genuíno.

O ID do modelo na API é deepseek-v4-pro. Não deepseek-v4-pro-preview, nem uma string de build com data — embora o changelog da própria empresa se refira ao build atual como V4-Pro-Preview e ao build Flash lançado como V4-Flash-0731. Quando o Flash se tornou oficial, a instrução foi: "O método de chamada da API permanece inalterado — basta definir o nome do modelo como deepseek-v4-flash para usar a versão mais recente." Em outras palavras, fixar o ID do modelo não fixa o build. A mesma string silenciosamente começou a servir um conjunto diferente de pesos, com comportamento materialmente diferente e dez pontos de índice a mais.

Então a resposta prática para "quando o V4 Pro é lançado" é que, se você está chamando deepseek-v4-pro em produção, você pode descobrir observando suas próprias saídas mudarem. Concretamente, as coisas a observar são: uma nova entrada datada no changelog da API da empresa, que foi onde o lançamento do Flash apareceu primeiro; um sufixo de build como V4-Pro-0731 na prosa dessa entrada, mesmo com o ID chamável permanecendo puro; uma reavaliação na página do V4 Pro da Artificial Analysis, que é a primeira confirmação independente que você receberá; o aumento de preço anunciado se resolvendo em tarifas reais, já que a GA é o momento natural tanto para isso quanto para o cronograma de horário de pico; e a Responses API da empresa, cuja documentação diz que o suporte a deepseek-v4-pro está planejado para o início de agosto — o modelo desaparecendo da lista "planejado" e aparecendo na lista de suportados é o mais próximo de um sinal oficial de lançamento que a empresa publica. Dois sinais que não podemos confirmar valem a pena conhecer mesmo assim: uma página de preços de um revendedor moveu os preços de cache do V4 Pro em 3 de agosto em um padrão que historicamente precede um lançamento, e o harness de avaliação interno da empresa está em beta fechado, o que significa que seus benchmarks de fornecedor podem finalmente se tornar verificáveis quando ele for lançado. Uma string semelhante a deepseek-v4-pro-202606 também circulou como um identificador de build vazado; não conseguimos verificá-la contra nenhuma propriedade da empresa, e ela não deve ter peso até que alguém consiga.

Você deve criar com a prévia hoje?

Para a maioria das pessoas que avaliam este modelo, a data de lançamento é a pergunta errada. A prévia é chamável, tem preço definido, é licenciada sob MIT e foi avaliada de forma independente como #6 de 101 em inteligência. A verdadeira questão é o que o GA pendente faz com o trabalho que você desenvolve agora, e há duas respostas distintas.

Se você está escolhendo entre V4 Pro e Kimi K3 em termos de capacidade, as evidências atuais indicam que o Kimi K3 vence no composto por 13 pontos, enquanto o V4 Pro vence em velocidade, latência e custo por amplas margens — e que uma atualização pendente de pós-treinamento pode reduzir a lacuna de inteligência sem fechá-la. Se o seu trabalho está na fronteira do raciocínio complexo, esses 13 pontos são tudo o que importa e o preço é uma distração. Se o seu trabalho é de alto volume e meramente difícil, pagar 14x por isso é difícil de justificar.

Se você já escolheu o V4 Pro, o risco a gerenciar não é a data de lançamento, mas a troca silenciosa: o build por trás desse ID de modelo vai mudar sob você, exatamente como aconteceu com o Flash, e seus evals devem ser capazes de detectar isso. Mantenha um conjunto de regressão que você possa reexecutar sob demanda e mantenha um segundo modelo acessível sem alteração de código. Esta é a razão mundana pela qual construímos o failover do jeito que fizemos — V4 Pro, V4 Flash e Kimi K3 ficam todos atrás de uma única chave OrcaRouter em um endpoint compatível com OpenAI, então "reexecutar o eval nos três e depois mudar o tráfego" é uma edição de configuração, não um exercício de procurement, e um build GA ruim é uma decisão de roteamento, não um incidente. Testar um flagship não comprovado é muito mais fácil quando reverter essa escolha não custa nada.

Perguntas que as pessoas estão realmente fazendo

O DeepSeek V4 Pro foi lançado ou não?

Ambos, dependendo do que você quer dizer — é por isso que os resultados de busca se contradizem. O modelo está publicamente acessível desde o lançamento da prévia do V4 em 24 de abril de 2026, com preços publicados, pesos abertos sob licença MIT e cobertura independente de benchmarks. Mas o log de alterações da própria empresa, de 31 de julho de 2026, afirma explicitamente que a API do V4 Pro está "inalterada" e que seu lançamento oficial "acontecerá em breve", e em 6 de agosto a DeepSeek voltou a dizer que a versão oficial seria lançada o mais rápido possível, ao mesmo tempo em que anunciava um grande aumento nos preços da API. Ou seja: disponível, mas ainda não oficial. Nenhuma data foi confirmada; relatos não confirmados apontam para meados de agosto, o que tornaria a espera curta.

O build oficial vai deixá-lo tão bom quanto o Kimi K3?

No único precedente quantificado disponível, provavelmente não exatamente. A compilação oficial do Flash ganhou 10 pontos no Índice de Inteligência da Artificial Analysis apenas com pós-treinamento; o V4 Pro está em 44 e o Kimi K3 em 57, então um ganho idêntico chegaria a 54. Essa extrapolação pode estar errada em qualquer direção — um modelo de 1.6T pode ter margem de melhoria diferente de um de 284B, e a empresa não disse que o lançamento do Pro será apenas pós-treinamento. Mas qualquer um que afirme paridade hoje está afirmando algo que nenhuma medição publicada sustenta.

Por que o modelo barato da DeepSeek atualmente pontua mais alto que seu carro-chefe?

Por causa da sequência de lançamentos, não porque Flash seja o melhor modelo. Flash recebeu uma atualização pós-treinamento em 31 de julho que o elevou de 40 para 50 no índice; Pro não recebeu o equivalente, então ainda está sendo medido com o pós-treinamento de abril. A própria empresa admite isso, descrevendo os resultados agentivos do Flash-0731 como "superando em muito o V4-Pro-Preview". A inversão é um retrato de um lançamento inacabado, e o lançamento pendente do Pro é precisamente o que a encerraria.

É seguro basear um modelo de custos no preço de $0,435 / $0,87?

Condicionalmente, e menos seguro do que era há uma semana. É o preço de tabela atualmente publicado pela empresa e já reflete uma grande redução permanente em relação aos preços de lançamento do V4. Mas em 6 de agosto, a DeepSeek anunciou que planeja aumentar os preços da API de modo geral, "com um aumento significativo esperado", e ainda não foram publicadas novas tarifas nem uma data — além da política de horário de pico anunciada, mas inativa, que duplicaria todos os itens de cobrança por sete horas por dia. Modele ambos os cenários e observe que mesmo o caso duplicado ainda é cerca de 6x mais barato que o Kimi K3.

A leitura honesta

A previsão que deu início a isto acertou metade, e a metade que acertou é a que as pessoas acharão mais difícil de acreditar. "{{1}}10x mais barato{{/1}}" fica aquém: na mesma carga de trabalho de avaliação medida, a build de pré-visualização do DeepSeek V4 Pro custou US$ 176,34 contra US$ 2.437,41 do Kimi K3, e em entrada em cache a diferença não é de dez vezes, mas de aproximadamente oitenta vezes. "{{2}}Nível Kimi K3{{/2}}" é a parte que ainda não existe — 44 contra 57 no único compósito que um laboratório independente executou em ambos, com uma extrapolação otimista do melhor precedente da própria empresa chegando a 54.

O que mudaria esta leitura é específico e vale a pena acompanhar. Se a versão oficial do V4 Pro chegar como um upgrade pós-treinamento e a Artificial Analysis o reavaliar com pontuação acima de 57, a previsão se confirma plenamente e o número central deste artigo fica defasado. Se ela chegar junto com a sobretaxa de horário de pico ou o aumento de preço anunciado em 6 de agosto, o argumento de preço cai pela metade e a questão interessante passa a ser se um desconto de 6x compensa um déficit de 13 pontos. E se a empresa lançar seu harness de avaliação — já em beta fechado — os benchmarks do fornecedor que hoje favorecem o V4 Pro em codificação se tornam verificáveis pela primeira vez. Até que uma dessas coisas aconteça, o resumo preciso do DeepSeek V4 Pro é que ele é o modelo de raciocínio sério com o melhor custo-benefício e pesos que você pode baixar, que não é o mais inteligente e que seu fornecedor nos disse que ele ainda não está pronto.

Comparados neste artigo4

Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente

© 2026 OrcaRouter

Para provedores

Opera uma plataforma de inferência? Traga seus modelos para o OrcaRouter.

Fale conosco

Junte-se à comunidade

DiscordEmailXGitHubYouTube