
El modelo 3T de DeepSeek: el escalamiento que tiene que esperar por los clústeres
- deepseekNUEVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- openaiNUEVOOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- googleNUEVOGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- qwenNUEVOQwen: Qwen3.8 Max (0902)2026-09-0240Inteligencia72Código
- anthropicNUEVOAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligencia72Código
- qwenQwen: Qwen3.8 Max2026-08-0340Inteligencia72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligencia69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Inteligencia78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2134Inteligencia69Código
El 14 de septiembre, DeepSeek retirará DeepSeek V4 Pro — el buque insignia de 1,6 billones de parámetros que puso a disponibilidad general el 13 de agosto — y responderá a cada llamada a deepseek-v4-pro con DeepSeek V4.1 Flash, el modelo de 552 mil millones de parámetros que lanzó el 10 de septiembre. Cuatro días antes de que se anunciara ese cambio, un observador anónimo de DeepSeek publicó algo punzante en la dirección opuesta: que el laboratorio había estado trabajando en un modelo de 3 billones de parámetros, "probablemente otro Engram de 1T de parámetros", y que la razón por la que no ha salido es la economía y no la capacidad.
Nada de ese modelo está confirmado. No hay nombre, ni repositorio, ni archivo de configuración, ni benchmark, ni ventana de lanzamiento — una sola publicación en X, atribuida a una "buena autoridad", con su detalle más interesante señalado explícitamente por su propio autor como especulación. Considéralo una señal, no un hecho. Aun así, vale la pena leerlo, porque las dos mitades de la afirmación tiran en direcciones opuestas y es probable que solo una de ellas sobreviva al contacto con la propia hoja de ruta de DeepSeek.
Lo que la filtración realmente dice, y lo que no
La publicación proviene de la cuenta teortaxesTex, un observador de DeepSeek desde hace mucho tiempo que se describe a sí mismo como fan del laboratorio desde 2023. Su texto completo dice: "En realidad, tengo información de buena fuente de que DeepSeek estaba trabajando en un modelo de 3T (backbone, probablemente otro Engram de 1T de parámetros, pero eso es especulación mía). Simplemente no estaban seguros de que fuera rentable postentrenarlo y servirlo. Cuando sus clústeres crezcan, veremos algo..."
Cuatro cosas de esas dos oraciones tienen peso, y una de ellas no es un hecho en absoluto. «Good authority» no tiene nombre. El número de parámetros llega como una sola cifra, sin distinción entre totales y activos. El aparte sobre Engram está etiquetado como especulación por quien especula. Y «when their clusters grow» es un condicional sin ninguna fecha asociada.
• ¿Qué se afirma — que existe un modelo DeepSeek de 3 billones de parámetros en alguna etapa de desarrollo.
• ¿Qué es explícitamente la propia conjetura del autor — que aproximadamente 1T de ello es memoria Engram?
• Lo que se desconoce — su nombre, arquitectura, número de parámetros activos, ventana de contexto, estado de entrenamiento y si llegará a lanzarse como producto.
• Lo que es verificable ahora mismo — nada. Ningún repositorio, ficha de modelo, fila de precios ni entrada de documentación de DeepSeek lo menciona.
Incluso la aritmética es ambigua. «Modelo de 3T (backbone, probablemente otros 1T de parámetros Engram)» admite dos lecturas: un modelo de 3T del cual alrededor de 1T es Engram, o un backbone de 3T con otro 1T de Engram junto a él, para aproximadamente 4T en total. Esa brecha es de un billón de parámetros de ancho, y cambia la factura de servicio en más de lo que la mayoría de los laboratorios gasta en una ejecución de entrenamiento.
También conviene recordar que el historial de esta cuenta es mixto, no de nivel oráculo. Interpretó el aviso de DeepSeek del 9 de septiembre sobre la redirección del tráfico de V4 Pro como evidencia de que el laboratorio había «resuelto los problemas arquitectónicos de la familia V4»: una inferencia razonable, y aun así una inferencia. A principios de septiembre también planteó la idea de que un modelo sigiloso anónimo en una plataforma de programación de terceros era el MiMo-V3-Flash de Xiaomi, algo que nadie ha confirmado. Una señal temprana útil; no una fuente de referencia.
La mitad interesante es la tabla de memoria, no el recuento de parámetros.
Engram es real, y es la razón por la que una afirmación de 3T es más plausible de lo que suena en un principio. DeepSeek publicó la arquitectura de memoria condicional en enero de 2026 con código de código abierto adjunto, y hace algo inusual: separa la recuperación de conocimiento estático del razonamiento dinámico. En lugar de gastar cómputo de GPU recordando hechos, el modelo aplica hash a su contexto en tablas de embeddings almacenadas en DRAM y recupera en tiempo constante, sin trabajo de GPU en la ruta de búsqueda, además de un mecanismo de compuerta que suprime una memoria recuperada cuando entra en conflicto con el contexto circundante.
Las cifras que DeepSeek reportó para su propia configuración de prueba son las que hay que retener: una tabla de embeddings de 100.000 millones de parámetros descargada a DRAM con una penalización de rendimiento inferior al 3 %, y una precisión del 97 % en aguja en el pajar con 1 M de tokens, frente al 84,2 % de la atención estándar. Esas son las cifras del propio laboratorio, no reproducidas por nosotros. Según se informa, evaluaciones independientes tempranas han quedado en el rango del 93–96 % con la misma longitud de contexto —por encima de la línea base, por debajo de la afirmación.
Multiplica esa idea por diez y la forma de la filtración cambia. Si la mayor parte de los parámetros adicionales de un modelo de 3T son memoria de tabla hash que reside en DRAM en lugar de expertos que compiten por HBM, entonces "3T" deja de ser un indicador de "no servible". El recuento total de parámetros y el coste de servicio se desacoplan. Esa es la idea genuinamente nueva de esta filtración, y es la parte que la investigación publicada respalda de verdad.
La salvedad es que, según se informa, el artículo de Engram no aborda la sobrecarga en el momento de la inferencia —latencia y rendimiento—, que es precisamente donde una tabla de búsqueda residente en DRAM aparecería si es que apareciera en algún sitio. La memoria que uno tiene que ir a buscar no es memoria que se obtenga gratis.

Por qué el propio septiembre de DeepSeek argumenta lo contrario
El argumento en contra de que un producto de 3T se lance pronto es que DeepSeek acaba de realizar el experimento con 1.6T y respondió a su propia pregunta con algo más pequeño. La escalera V4 tal como está hoy:
• {{1}}DeepSeek-V4-Flash-0731{{/1}} — 284B parámetros totales, 13B activos por token.
• DeepSeek-V4-Pro-0813 — 1,6T en total, 49B activos, pesos abiertos bajo una licencia MIT.
• DeepSeek V4.1 Flash — backbone de 552B en un diseño de codificador-decodificador causal que activa 8B parámetros por token durante el prellenado y 16B durante la decodificación.
El 14 de septiembre a mediodía, hora de Pekín, sale el nivel intermedio. DeepSeek retira V4 Pro y enruta las solicitudes de deepseek-v4-pro a V4.1 Flash, facturadas a tarifas de Flash, hasta que exista un V4.1 Pro. La página oficial de precios hoy tiene dos filas, y ninguna es el sucesor del modelo retirado en cuanto a tamaño: deepseek-flash a $0.30 por millón de tokens de entrada y $1.20 por millón de salida en horas punta, deepseek-v4-pro a $1.32 y $3.96, con tarifas fuera de horas punta a la mitad de esas cifras. Ambas indican una ventana de contexto de 1M de tokens y un límite de salida de 384,000 tokens.
La dirección del rumbo no es sutil. Un laboratorio que retira su modelo más grande en favor de uno que activa una décima parte de parámetros por token ya ha concluido que la unidad económica de capacidad de frontera no es el checkpoint más grande que puede entrenar. Un modelo de 3T cuyo constructor no está seguro de que pueda ser "post-entrenado y servido de forma económica" no es un rumor sobre vacilación; describe a un laboratorio que ahora tiene datos medidos sobre la alternativa.
El post-entrenamiento es la mitad más difícil de ese problema. El post-entrenamiento de parámetros completos de la línea DeepSeek-V4-Pro en el SuperPOD CloudMatrix384 de Huawei ha sido reportado por el proyecto de terceros SLAI T-Rex con un 34,22 % de MFU, aproximadamente 2,93 veces la receta base abierta. Esa es una cifra alentadora —una cifra de terceros, en un modelo de 1,6 T—. Duplicar el backbone duplica aproximadamente la factura antes de que se sirva un solo token.

Cuando crecen sus clústeres
La cláusula fundamental de la filtración es la última, porque es la única parte con un rastro documental público. Se informa que DeepSeek planea al menos 160.000 aceleradores Ascend 950DT de Huawei en un nuevo centro de datos en Ulanqab, Mongolia Interior, en un pedido valorado en aproximadamente 2.560 millones de dólares — uno de los mayores clústeres de silicio para IA de fabricación china que se hayan intentado.
Las salvedades asociadas a ese plan importan más que el titular. Los chips están previstos para inferencia, no para entrenamiento: DeepSeek ya ha intentado entrenar con silicio de Huawei y sigue entrenando con aceleradores de Nvidia, que es el paso que un modelo de 3T realmente necesitaría. La entrega podría tardar más de un año. Se espera que parte de la capacidad esté operativa entre finales de 2027 y principios de 2028. Y se espera que sea el suministro de memoria de alto ancho de banda, y no la lógica, lo que limite cuántas unidades 950DT pueda fabricar Huawei este año.
Así que la lectura optimista de «cuando sus clústeres crezcan» sitúa un modelo de 3T en un calendario de 2027–2028 como muy pronto, y la lectura pesimista —que siga siendo un artefacto de investigación y nunca llegue a ser un producto— es coherente con todo lo que DeepSeek ha lanzado en 2026. El entorno de cómputo en torno al laboratorio también es una política en disputa, más que una mera cuestión de suministro: el 8 y 9 de septiembre, la NSA, el FBI y la CISA alegaron conjuntamente que seis laboratorios chinos, incluido DeepSeek, destilaron modelos de frontera estadounidenses a «escala industrial», una acusación que el Ministerio de Comercio de China rechazó. Sea cual sea la interpretación que se haga de la acusación, un lanzamiento que dependa del crecimiento de los clústeres depende de decisiones que nadie dentro de DeepSeek controla.
¿Qué haría falta para convertir esto de una filtración en un lanzamiento?
La lista de verificación es breve y específica, y aún no se ha activado ninguno de sus puntos:
• Un repositorio de la organización deepseek-ai en Hugging Face, con un nombre de checkpoint versionado en lugar de un slug de familia.
• Una nueva fila en la página de Modelos y precios de DeepSeek.
• Una entrada con fecha en el canal de noticias de la documentación de la API, con el formato newsYYMMDD habitual del laboratorio.
• Un identificador de modelo, no un nombre de familia — DeepSeek versiona checkpoints, y un slug de familia simple hasta ahora ha significado una vista previa.
El hito más cercano es V4.1 Pro, al que un miembro del equipo de DeepSeek se refirió el 9 de septiembre como el punto final de la ventana de enrutamiento. Tampoco tiene especificaciones publicadas, ni número de parámetros, ni precio, ni fecha. En cierto sentido, V4.1 Pro es la prueba de esta filtración: si el próximo modelo insignia se sitúa en aproximadamente 1,6T, el nivel del V4 Pro, o por debajo, la afirmación de los 3T se ha retrasado al menos una generación.
Qué significa todo esto si vas a elegir un modelo esta semana
Un modelo 3T no es una decisión de compra en 2026, y la lección práctica del septiembre de DeepSeek no tiene nada que ver con la escala. Es que el modelo detrás de un endpoint puede cambiar mientras que el nombre del endpoint permanece exactamente igual. Cualquiera que llame a deepseek-v4-pro a través de una capa de abstracción obtiene un modelo diferente, más pequeño y más barato el 14 de septiembre sin tocar su código. Cualquiera que esté conectado directamente a la implementación de ese ID de un único proveedor obtiene lo que ese proveedor decida hacer.
DeepSeek V4.1 Flash y DeepSeek V4 Pro están en OrcaRouter bajo una sola clave con un 0 % de recargo: el precio de lista del proveedor se traslada tal cual, lo que significa que el cambio de precios de DeepSeek del 10 de septiembre está activo aquí el mismo día a precio de lista, y no en alguna versión con recargo del mismo. La página del modelo indica $0,15 por millón de tokens de entrada y $0,60 por millón de tokens de salida en la franja valle, que es la propia cifra valle de DeepSeek y sin nada añadido. La conmutación automática por error entre proveedores es la característica poco glamurosa que más importa en una semana como esta: cuando un proveedor sustituye el modelo por debajo de un endpoint, la capa de enrutamiento es donde eso se convierte en un cambio de configuración en lugar de una migración.
Si algún día llega a lanzarse un modelo DeepSeek de 3T, lo servirá quien tenga los clústeres para alojarlo, a un precio que dicten los recursos de cómputo. Esa misma capa de enrutamiento es donde te lo encontrarías: sin un segundo contrato y sin rehacer nada.

La pregunta abierta no es si DeepSeek puede construir un modelo de 3 billones de parámetros. Tres artículos de arquitectura publicados, un diseño de memoria de trabajo y un modelo de 552B que, según su creador, supera a su propio predecesor de 1,6 T: todos ellos sugieren que el laboratorio sabe cómo hacerlo. La pregunta es si alguien pagará por servirlo —y, a juzgar por la evidencia de las últimas dos semanas, el propio DeepSeek no está seguro. Fíjate en el clúster, no en el número de parámetros. La página de precios te dirá lo que DeepSeek lanza en realidad, más rápido que cualquier filtración.
Comparados en este artículo1
Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario
