
Modelo 3T da DeepSeek: A Expansão que Precisa Esperar pelos Clusters
- deepseekNOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- openaiNOVOOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleNOVOGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenNOVOQwen: Qwen3.8 Max (0902)2026-09-0240Inteligência72Código
- anthropicNOVOAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0340Inteligência72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligência69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Inteligência78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2134Inteligência69Código
Em 14 de setembro, a DeepSeek descontinuará DeepSeek V4 Pro — o carro-chefe de 1,6 trilhão de parâmetros que ela colocou em disponibilidade geral em 13 de agosto — e atenderá a todas as chamadas para deepseek-v4-pro com DeepSeek V4.1 Flash, o modelo de 552 bilhões de parâmetros que ela lançou em 10 de setembro. Quatro dias antes do anúncio dessa mudança, um observador pseudônimo da DeepSeek publicou algo que apontava na direção oposta: que o laboratório vinha trabalhando em um modelo de 3 trilhões de parâmetros, "provavelmente outro Engram de 1 T de parâmetros", e que o motivo de não ter sido lançado são questões econômicas, e não de capacidade.
Nada sobre esse modelo está confirmado. Não há nome, repositório, arquivo de configuração, benchmark ou janela de lançamento — um post no X, atribuído a "boa autoridade", com seu detalhe mais interessante explicitamente marcado pelo próprio autor como especulação. Trate isso como um sinal, não como um fato. Ainda assim vale a pena ler, porque as duas metades da afirmação puxam em direções opostas e apenas uma delas provavelmente sobreviverá ao contato com o roadmap da própria DeepSeek.
O que o vazamento realmente diz, e o que ele não diz.
A publicação vem da conta teortaxesTex, um observador de longa data da DeepSeek que se descreve como fã do laboratório desde 2023. Ela diz na íntegra: "Na verdade, tenho boas informações de que a DeepSeek estava trabalhando em um modelo de 3T (backbone, provavelmente outro Engram de 1T de parâmetros, mas isso é especulação minha). Eles só não tinham certeza se seria econômico fazer o pós-treinamento e servir. Quando os clusters crescerem, veremos alguns..."
Quatro coisas nessas duas frases têm peso, e uma delas não é um fato de forma alguma. "Boa autoridade" não tem nome. A contagem de parâmetros chega como um único número, sem divisão entre total e ativos. A observação sobre Engram é rotulada como especulação pela própria pessoa que especula. E "quando seus clusters crescem" é uma condicional sem data associada.
• O que está sendo afirmado — que um modelo DeepSeek de 3 trilhões de parâmetros existe em algum estágio de desenvolvimento.
• O que é explicitamente o palpite do próprio autor — que aproximadamente 1T disso é memória Engram.
• O que é desconhecido — seu nome, arquitetura, contagem de parâmetros ativos, janela de contexto, status de treinamento e se chega a ser comercializado como produto.
• O que é verificável agora — nada. Nenhum repositório do DeepSeek, ficha do modelo, linha de preços ou entrada de documentação menciona isso.
Mesmo a aritmética é ambígua. "Modelo 3T (backbone, provavelmente outro 1T de parâmetros Engram)" suporta duas leituras: um modelo de 3T do qual cerca de 1T é Engram, ou um backbone de 3T com outro 1T de Engram ao lado, totalizando aproximadamente 4T. Essa diferença tem um trilhão de parâmetros de largura, e muda a conta de inferência mais do que a maioria dos laboratórios gasta em um treinamento.
{{1}}Vale lembrar também que o histórico desta conta é misto, e não de nível oracular.{{/1}} {{2}}Ele interpretou o aviso de 9 de setembro da DeepSeek sobre o redirecionamento do tráfego do V4 Pro como evidência de que o laboratório havia "resolvido problemas arquiteturais da família V4" — uma inferência razoável, mas ainda assim uma inferência.{{/2}} {{3}}No início de setembro, ele também levantou a hipótese de que um modelo oculto anônimo em uma plataforma de codificação de terceiros fosse o MiMo-V3-Flash da Xiaomi, o que ninguém confirmou.{{/3}} Sinal precoce útil; não é uma fonte de registro.
A metade interessante é a tabela de memória, não a contagem de parâmetros.
Engram é real, e é a razão pela qual uma afirmação de 3T é mais plausível do que parece à primeira vista. A DeepSeek publicou a arquitetura de memória condicional em janeiro de 2026 com código-fonte aberto anexado, e ela faz algo incomum: separa a recuperação de conhecimento estático do raciocínio dinâmico. Em vez de gastar computação de GPU para recuperar fatos, o modelo faz o hash do seu contexto em tabelas de embeddings mantidas em DRAM e recupera em tempo constante, sem trabalho de GPU no caminho de consulta, além de um mecanismo de gating que suprime uma memória recuperada quando ela entra em conflito com o contexto ao redor.
Os números que a DeepSeek reportou para sua própria configuração de teste são os que devemos considerar: uma tabela de embeddings de 100 bilhões de parâmetros descarregada para DRAM com penalidade de throughput inferior a 3%, e precisão de 97% em agulha-no-palheiro com 1 milhão de tokens, contra 84,2% da atenção padrão. Esses são os números do próprio laboratório, não reproduzidos por nós. Avaliações independentes iniciais teriam ficado na faixa de 93–96% no mesmo comprimento de contexto — acima da linha de base, abaixo do valor declarado.
Amplie essa ideia por dez e a forma do vazamento muda. Se a maioria dos parâmetros extras de um modelo de 3T é memória de tabela hash em DRAM, em vez de especialistas disputando HBM, então "3T" deixa de ser um proxy para "inviável". O número total de parâmetros e o custo de servir se separam. Essa é a ideia genuinamente nova neste vazamento, e é a parte que a pesquisa publicada de fato sustenta.
A ressalva é que o artigo da Engram, segundo relatos, não aborda o overhead em tempo de inferência — latência e throughput — que é exatamente onde uma tabela de consulta residente em DRAM apareceria, se é que apareceria em algum lugar. Memória que você precisa buscar não é memória que você ganha de graça.

Por que o próprio setembro da DeepSeek argumenta o contrário
O argumento contra o lançamento em breve de um produto de 3T é que a DeepSeek acabou de executar o experimento em 1.6T e respondeu à sua própria pergunta com algo menor. A escada V4 tal como está hoje:
• DeepSeek-V4-Flash-0731 — 284B parâmetros totais, 13B ativos por token.
• DeepSeek-V4-Pro-0813 — 1.6T total, 49B ativos, pesos abertos sob licença MIT.
• DeepSeek V4.1 Flash — backbone de 552B em um design Codificador-Decodificador Causal que ativa 8B parâmetros por token durante o prefill e 16B durante o decode.
Em 14 de setembro, ao meio-dia no horário de Pequim, o degrau do meio sai. A DeepSeek retira o V4 Pro do ar e encaminha as solicitações do deepseek-v4-pro para o V4.1 Flash, cobrado pelas tarifas do Flash, até que exista um V4.1 Pro. A página oficial de preços hoje traz duas linhas, e nenhuma é a sucessora do modelo aposentado em tamanho: deepseek-flash a US$ 0,30 por milhão de tokens de entrada e US$ 1,20 por milhão de saída no horário de pico, deepseek-v4-pro a US$ 1,32 e US$ 3,96, com tarifas fora do horário de pico pela metade desses valores. Ambos listam uma janela de contexto de 1M de tokens e um teto de saída de 384.000 tokens.
A direção do movimento não é sutil. Um laboratório que descontinua seu maior modelo em favor de um que ativa um décimo dos parâmetros por token já concluiu que a unidade econômica da capacidade de fronteira não é o maior checkpoint que pode treinar. Um modelo de 3T cujo criador não tem certeza de que pode ser "pós-treinado e servido economicamente" não é um rumor sobre hesitação; descreve um laboratório que agora tem dados medidos sobre a alternativa.
O pós-treinamento é a metade mais afiada desse problema. O pós-treinamento de parâmetros completos da linha DeepSeek-V4-Pro no SuperPOD CloudMatrix384 da Huawei foi relatado pelo projeto de terceiros SLAI T-Rex em 34,22% de MFU, cerca de 2,93x a receita de linha de base aberta. Esse é um número encorajador — um número de terceiros, em um modelo de 1,6T. Dobrar o backbone aproximadamente dobra a conta antes de um único token ser servido.

Quando seus aglomerados crescem
A cláusula fulcral na fuga de informação é a última, porque é a única parte com um rasto documental público. A DeepSeek, segundo os relatos, está a planear pelo menos 160.000 aceleradores Ascend 950DT da Huawei num novo centro de dados em Ulanqab, na Mongólia Interior, numa encomenda avaliada em cerca de 2,56 mil milhões de dólares — um dos maiores clusters de silício de IA de fabrico chinês que alguém alguma vez tentou.
As ressalvas ligadas a esse plano importam mais do que a manchete. Os chips são planejados para inferência, não para treinamento: DeepSeek já tentou treinar em silício da Huawei antes e ainda treina em aceleradores Nvidia, que é a etapa da qual um modelo de 3T realmente precisaria. A entrega pode levar mais de um ano. Espera-se que parte da capacidade entre em operação no final de 2027 e início de 2028. E espera-se que o fornecimento de memória de alta largura de banda, e não a lógica, limite quantas unidades 950DT a Huawei pode construir este ano.
Portanto, a leitura otimista de "quando seus clusters crescem" coloca um modelo de 3T em um cronograma de 2027–2028 no mínimo, e a leitura pessimista — de que permanece um artefato de pesquisa e nunca se torna um produto — é consistente com tudo o que a DeepSeek lançou em 2026. O ambiente computacional ao redor do laboratório também é uma questão de política contestada, em vez de uma questão puramente de oferta: em 8–9 de setembro, NSA, FBI e CISA alegaram conjuntamente que seis laboratórios chineses, incluindo a DeepSeek, destilaram modelos de fronteira dos EUA em "escala industrial", uma acusação rejeitada pelo ministério do comércio da China. Independentemente do que se pense sobre a alegação, um lançamento que depende do crescimento dos clusters depende de decisões que ninguém dentro da DeepSeek controla.
O que transformaria isso de um vazamento em um lançamento?
A lista de verificação é curta e específica, e nenhum de seus itens foi acionado ainda:
• Um repositório da organização deepseek-ai no Hugging Face, com um nome de checkpoint versionado em vez de um slug de família.
• Uma nova linha na página Models & Pricing do DeepSeek.
• Uma entrada datada no feed de notícias da documentação da API, no formato usual newsYYMMDD do laboratório.
• Um identificador de modelo, não um nome de família — as versões do DeepSeek são checkpoints, e um slug de família puro tem significado uma prévia até agora.
O marco mais próximo é o V4.1 Pro, que um membro da equipe DeepSeek mencionou em 9 de setembro como o ponto final da janela de roteamento. Ele não tem especificações publicadas, nem contagem de parâmetros, nem preço e também não tem data. Em certo sentido, o V4.1 Pro é o teste desse vazamento: se o próximo carro-chefe chegar a aproximadamente 1,6T do V4 Pro ou abaixo, a alegação de 3T ficou para trás pelo menos uma geração.
O que tudo isso significa se você está escolhendo um modelo esta semana
Um modelo 3T não é uma decisão de compra em 2026, e a lição prática do setembro da DeepSeek não tem nada a ver com escala. É que o modelo por trás de um endpoint pode mudar enquanto o nome do endpoint permanece exatamente o mesmo. Qualquer pessoa que chame deepseek-v4-pro por meio de uma camada de abstração recebe um modelo diferente, menor e mais barato em 14 de setembro, sem tocar no código. Quem está conectado diretamente à implementação de um único provedor desse ID recebe o que esse provedor decidir fazer.
Tanto o DeepSeek V4.1 Flash quanto o DeepSeek V4 Pro estão no OrcaRouter sob uma única chave com margem de 0% — o preço de tabela do provedor é repassado, o que significa que a mudança de preços da DeepSeek em 10 de setembro entra em vigor aqui no mesmo dia pelo valor de tabela, e não por alguma versão com margem adicional. A página do modelo mostra US$ 0,15 por milhão de tokens de entrada e US$ 0,60 por milhão de tokens de saída na faixa fora de pico, que é o próprio número fora de pico da DeepSeek, sem nenhum acréscimo. O failover automático entre provedores é o recurso sem glamour que mais importa em uma semana como esta: quando um fornecedor troca o modelo de um endpoint, a camada de roteamento é onde isso se torna uma mudança de configuração em vez de uma migração.
Se um modelo DeepSeek de 3T algum dia for lançado, ele será servido por quem tiver os clusters para comportá-lo, a um preço que o poder computacional determina. A mesma camada de roteamento é onde você o encontraria — sem um segundo contrato e sem reconstruir nada.

A questão em aberto não é se a DeepSeek consegue construir um modelo de 3 trilhões de parâmetros. Três artigos publicados sobre arquitetura, um design de memória de trabalho e um modelo de 552B que seu criador diz superar seu predecessor de 1.6T sugerem que o laboratório sabe como. A questão é se alguém vai pagar para servi-lo — e, pelas evidências das últimas duas semanas, a própria DeepSeek não tem certeza. Observe o cluster, não a contagem de parâmetros. A página de preços lhe dirá o que a DeepSeek realmente lança mais rápido do que qualquer vazamento.
Comparados neste artigo1
Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente
