Cartão de título que diz "Modelo 3T da DeepSeek", com o subtítulo "Uma alegação de 3 trilhões de parâmetros, uma tabela de memória Engram de 1T e um cluster que só chega em 2027", acima de três blocos de ícones que dizem "3T — parâmetros: não verificados", "~1T — Engram: suposição do próprio autor" e "Cluster — final de 2027 no mínimo", com uma linha de rodapé que diz "Vazamento de fonte única; não existe repositório, model card ou linha de preço."
Guides & Insights

Modelo 3T da DeepSeek: A Expansão que Precisa Esperar pelos Clusters

Autor

Alistair Wren

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Em 14 de setembro, a Deep​Seek descontinuará DeepSeek V4 Pro — o carro-chefe de 1,6 trilhão de parâmetros que ela colocou em disponibilidade geral em 13 de agosto — e atenderá a todas as chamadas para deepseek-v4-pro com DeepSeek V4.1 Flash, o modelo de 552 bilhões de parâmetros que ela lançou em 10 de setembro. Quatro dias antes do anúncio dessa mudança, um observador pseudônimo da Deep​Seek publicou algo que apontava na direção oposta: que o laboratório vinha trabalhando em um modelo de 3 trilhões de parâmetros, "provavelmente outro Engram de 1 T de parâmetros", e que o motivo de não ter sido lançado são questões econômicas, e não de capacidade.

Nada sobre esse modelo está confirmado. Não há nome, repositório, arquivo de configuração, benchmark ou janela de lançamento — um post no X, atribuído a "boa autoridade", com seu detalhe mais interessante explicitamente marcado pelo próprio autor como especulação. Trate isso como um sinal, não como um fato. Ainda assim vale a pena ler, porque as duas metades da afirmação puxam em direções opostas e apenas uma delas provavelmente sobreviverá ao contato com o roadmap da própria Deep​Seek.

O que o vazamento realmente diz, e o que ele não diz.

A publicação vem da conta teortaxesTex, um observador de longa data da Deep​Seek que se descreve como fã do laboratório desde 2023. Ela diz na íntegra: "Na verdade, tenho boas informações de que a Deep​Seek estava trabalhando em um modelo de 3T (backbone, provavelmente outro Engram de 1T de parâmetros, mas isso é especulação minha). Eles só não tinham certeza se seria econômico fazer o pós-treinamento e servir. Quando os clusters crescerem, veremos alguns..."

Quatro coisas nessas duas frases têm peso, e uma delas não é um fato de forma alguma. "Boa autoridade" não tem nome. A contagem de parâmetros chega como um único número, sem divisão entre total e ativos. A observação sobre Engram é rotulada como especulação pela própria pessoa que especula. E "quando seus clusters crescem" é uma condicional sem data associada.

• O que está sendo afirmado — que um modelo Deep​Seek de 3 trilhões de parâmetros existe em algum estágio de desenvolvimento.

• O que é explicitamente o palpite do próprio autor — que aproximadamente 1T disso é memória Engram.

• O que é desconhecido — seu nome, arquitetura, contagem de parâmetros ativos, janela de contexto, status de treinamento e se chega a ser comercializado como produto.

• O que é verificável agora — nada. Nenhum repositório do Deep​Seek, ficha do modelo, linha de preços ou entrada de documentação menciona isso.

Mesmo a aritmética é ambígua. "Modelo 3T (backbone, provavelmente outro 1T de parâmetros Engram)" suporta duas leituras: um modelo de 3T do qual cerca de 1T é Engram, ou um backbone de 3T com outro 1T de Engram ao lado, totalizando aproximadamente 4T. Essa diferença tem um trilhão de parâmetros de largura, e muda a conta de inferência mais do que a maioria dos laboratórios gasta em um treinamento.

{{1}}Vale lembrar também que o histórico desta conta é misto, e não de nível oracular.{{/1}} {{2}}Ele interpretou o aviso de 9 de setembro da Deep​Seek sobre o redirecionamento do tráfego do V4 Pro como evidência de que o laboratório havia "resolvido problemas arquiteturais da família V4" — uma inferência razoável, mas ainda assim uma inferência.{{/2}} {{3}}No início de setembro, ele também levantou a hipótese de que um modelo oculto anônimo em uma plataforma de codificação de terceiros fosse o MiMo-V3-Flash da Xiaomi, o que ninguém confirmou.{{/3}} Sinal precoce útil; não é uma fonte de registro.

A metade interessante é a tabela de memória, não a contagem de parâmetros.

Engram é real, e é a razão pela qual uma afirmação de 3T é mais plausível do que parece à primeira vista. A Deep​Seek publicou a arquitetura de memória condicional em janeiro de 2026 com código-fonte aberto anexado, e ela faz algo incomum: separa a recuperação de conhecimento estático do raciocínio dinâmico. Em vez de gastar computação de GPU para recuperar fatos, o modelo faz o hash do seu contexto em tabelas de embeddings mantidas em DRAM e recupera em tempo constante, sem trabalho de GPU no caminho de consulta, além de um mecanismo de gating que suprime uma memória recuperada quando ela entra em conflito com o contexto ao redor.

Os números que a Deep​Seek reportou para sua própria configuração de teste são os que devemos considerar: uma tabela de embeddings de 100 bilhões de parâmetros descarregada para DRAM com penalidade de throughput inferior a 3%, e precisão de 97% em agulha-no-palheiro com 1 milhão de tokens, contra 84,2% da atenção padrão. Esses são os números do próprio laboratório, não reproduzidos por nós. Avaliações independentes iniciais teriam ficado na faixa de 93–96% no mesmo comprimento de contexto — acima da linha de base, abaixo do valor declarado.

Amplie essa ideia por dez e a forma do vazamento muda. Se a maioria dos parâmetros extras de um modelo de 3T é memória de tabela hash em DRAM, em vez de especialistas disputando HBM, então "3T" deixa de ser um proxy para "inviável". O número total de parâmetros e o custo de servir se separam. Essa é a ideia genuinamente nova neste vazamento, e é a parte que a pesquisa publicada de fato sustenta.

A ressalva é que o artigo da Engram, segundo relatos, não aborda o overhead em tempo de inferência — latência e throughput — que é exatamente onde uma tabela de consulta residente em DRAM apareceria, se é que apareceria em algum lugar. Memória que você precisa buscar não é memória que você ganha de graça.

A single-column scoreboard titled "DeepSeek's scale ladder — the scoreboard" with six rows: DeepSeek-V4-Flash-0731 at 284B total / 13B active; DeepSeek-V4-Pro-0813 at 1.6T total / 49B active; DeepSeek V4.1 Flash at 552B backbone / 8B prefill, 16B decode; Leaked successor at ~3T, unverified; Engram memory table at ~1T claimed, unverified; and Serving status reading "V4 Pro retired Sept 14; 3T has no cluster date". Footer reads "V4 figures per DeepSeek model cards; 3T and Engram figures unverified, single-source."

Por que o próprio setembro da Deep​Seek argumenta o contrário

O argumento contra o lançamento em breve de um produto de 3T é que a Deep​Seek acabou de executar o experimento em 1.6T e respondeu à sua própria pergunta com algo menor. A escada V4 tal como está hoje:

DeepSeek-V4-Flash-0731 — 284B parâmetros totais, 13B ativos por token.

DeepSeek-V4-Pro-0813 — 1.6T total, 49B ativos, pesos abertos sob licença MIT.

DeepSeek V4.1 Flash — backbone de 552B em um design Codificador-Decodificador Causal que ativa 8B parâmetros por token durante o prefill e 16B durante o decode.

Em 14 de setembro, ao meio-dia no horário de Pequim, o degrau do meio sai. A DeepSeek retira o V4 Pro do ar e encaminha as solicitações do deepseek-v4-pro para o V4.1 Flash, cobrado pelas tarifas do Flash, até que exista um V4.1 Pro. A página oficial de preços hoje traz duas linhas, e nenhuma é a sucessora do modelo aposentado em tamanho: deepseek-flash a US$ 0,30 por milhão de tokens de entrada e US$ 1,20 por milhão de saída no horário de pico, deepseek-v4-pro a US$ 1,32 e US$ 3,96, com tarifas fora do horário de pico pela metade desses valores. Ambos listam uma janela de contexto de 1M de tokens e um teto de saída de 384.000 tokens.

A direção do movimento não é sutil. Um laboratório que descontinua seu maior modelo em favor de um que ativa um décimo dos parâmetros por token já concluiu que a unidade econômica da capacidade de fronteira não é o maior checkpoint que pode treinar. Um modelo de 3T cujo criador não tem certeza de que pode ser "pós-treinado e servido economicamente" não é um rumor sobre hesitação; descreve um laboratório que agora tem dados medidos sobre a alternativa.

O pós-treinamento é a metade mais afiada desse problema. O pós-treinamento de parâmetros completos da linha DeepSeek-V4-Pro no SuperPOD CloudMatrix384 da Huawei foi relatado pelo projeto de terceiros SLAI T-Rex em 34,22% de MFU, cerca de 2,93x a receita de linha de base aberta. Esse é um número encorajador — um número de terceiros, em um modelo de 1,6T. Dobrar o backbone aproximadamente dobra a conta antes de um único token ser servido.

Screenshot of DeepSeek's official API documentation "Models & Pricing" page, captured September 10 2026, in English, showing two model columns: deepseek-flash (model version DeepSeek-V4.1-Flash) and deepseek-v4-pro (model version DeepSeek-V4-Pro-0813), both listing a 1M context length and a 384K maximum output, a features block where Vision is supported on flash and marked "Not supported" on v4-pro, and a pricing block with peak and off-peak rates including input cache-miss at $0.3 / $1.32 per million tokens and output at $1.2 / $3.96 per million tokens.

Quando seus aglomerados crescem

A cláusula fulcral na fuga de informação é a última, porque é a única parte com um rasto documental público. A Deep​Seek, segundo os relatos, está a planear pelo menos 160.000 aceleradores Ascend 950DT da Huawei num novo centro de dados em Ulanqab, na Mongólia Interior, numa encomenda avaliada em cerca de 2,56 mil milhões de dólares — um dos maiores clusters de silício de IA de fabrico chinês que alguém alguma vez tentou.

As ressalvas ligadas a esse plano importam mais do que a manchete. Os chips são planejados para inferência, não para treinamento: Deep​Seek já tentou treinar em silício da Huawei antes e ainda treina em aceleradores Nvidia, que é a etapa da qual um modelo de 3T realmente precisaria. A entrega pode levar mais de um ano. Espera-se que parte da capacidade entre em operação no final de 2027 e início de 2028. E espera-se que o fornecimento de memória de alta largura de banda, e não a lógica, limite quantas unidades 950DT a Huawei pode construir este ano.

Portanto, a leitura otimista de "quando seus clusters crescem" coloca um modelo de 3T em um cronograma de 2027–2028 no mínimo, e a leitura pessimista — de que permanece um artefato de pesquisa e nunca se torna um produto — é consistente com tudo o que a Deep​Seek lançou em 2026. O ambiente computacional ao redor do laboratório também é uma questão de política contestada, em vez de uma questão puramente de oferta: em 8–9 de setembro, NSA, FBI e CISA alegaram conjuntamente que seis laboratórios chineses, incluindo a Deep​Seek, destilaram modelos de fronteira dos EUA em "escala industrial", uma acusação rejeitada pelo ministério do comércio da China. Independentemente do que se pense sobre a alegação, um lançamento que depende do crescimento dos clusters depende de decisões que ninguém dentro da Deep​Seek controla.

O que transformaria isso de um vazamento em um lançamento?

A lista de verificação é curta e específica, e nenhum de seus itens foi acionado ainda:

• Um repositório da organização deepseek-ai no Hugging Face, com um nome de checkpoint versionado em vez de um slug de família.

• Uma nova linha na página Models & Pricing do DeepSeek.

• Uma entrada datada no feed de notícias da documentação da API, no formato usual newsYYMMDD do laboratório.

• Um identificador de modelo, não um nome de família — as versões do Deep​Seek são checkpoints, e um slug de família puro tem significado uma prévia até agora.

O marco mais próximo é o V4.1 Pro, que um membro da equipe DeepSeek mencionou em 9 de setembro como o ponto final da janela de roteamento. Ele não tem especificações publicadas, nem contagem de parâmetros, nem preço e também não tem data. Em certo sentido, o V4.1 Pro é o teste desse vazamento: se o próximo carro-chefe chegar a aproximadamente 1,6T do V4 Pro ou abaixo, a alegação de 3T ficou para trás pelo menos uma geração.

O que tudo isso significa se você está escolhendo um modelo esta semana

Um modelo 3T não é uma decisão de compra em 2026, e a lição prática do setembro da DeepSeek não tem nada a ver com escala. É que o modelo por trás de um endpoint pode mudar enquanto o nome do endpoint permanece exatamente o mesmo. Qualquer pessoa que chame deepseek-v4-pro por meio de uma camada de abstração recebe um modelo diferente, menor e mais barato em 14 de setembro, sem tocar no código. Quem está conectado diretamente à implementação de um único provedor desse ID recebe o que esse provedor decidir fazer.

Tanto o DeepSeek V4.1 Flash quanto o DeepSeek V4 Pro estão no OrcaRouter sob uma única chave com margem de 0% — o preço de tabela do provedor é repassado, o que significa que a mudança de preços da Deep​Seek em 10 de setembro entra em vigor aqui no mesmo dia pelo valor de tabela, e não por alguma versão com margem adicional. A página do modelo mostra US$ 0,15 por milhão de tokens de entrada e US$ 0,60 por milhão de tokens de saída na faixa fora de pico, que é o próprio número fora de pico da Deep​Seek, sem nenhum acréscimo. O failover automático entre provedores é o recurso sem glamour que mais importa em uma semana como esta: quando um fornecedor troca o modelo de um endpoint, a camada de roteamento é onde isso se torna uma mudança de configuração em vez de uma migração.

Se um modelo Deep​Seek de 3T algum dia for lançado, ele será servido por quem tiver os clusters para comportá-lo, a um preço que o poder computacional determina. A mesma camada de roteamento é onde você o encontraria — sem um segundo contrato e sem reconstruir nada.

Screenshot of the OrcaRouter model page for deepseek/deepseek-v4.1-flash, captured September 10 2026, in English, showing a p50 time-to-first-token of 287 milliseconds, an OpenAI-compatible base URL of api.orcarouter.ai/v1, a Python code sample calling the model by that ID, and an off-peak price block reading input $0.150 per million tokens, output $0.600 per million tokens and cache read $0.0030 per million tokens.

A questão em aberto não é se a Deep​Seek consegue construir um modelo de 3 trilhões de parâmetros. Três artigos publicados sobre arquitetura, um design de memória de trabalho e um modelo de 552B que seu criador diz superar seu predecessor de 1.6T sugerem que o laboratório sabe como. A questão é se alguém vai pagar para servi-lo — e, pelas evidências das últimas duas semanas, a própria Deep​Seek não tem certeza. Observe o cluster, não a contagem de parâmetros. A página de preços lhe dirá o que a Deep​Seek realmente lança mais rápido do que qualquer vazamento.

Comparados neste artigo1

Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente