
GPT-6 vs DeepSeek V4 Pro: uno que puedes alquilar con cualquiera, otro que puedes llevarte a casa
- openaiNUEVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligencia
- anthropicNUEVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligencia
- typesafeNUEVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Inteligencia
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Inteligencia
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Inteligencia
- xAIGrok 4.72026-09-2146Inteligencia
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 67 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 360 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
Hay exactamente una cosa que puedes hacer con DeepSeek V4 Pro que no puedes hacer con GPT-6 Sol: llevártelo a casa. DeepSeek V4 Pro es un buque insignia de mezcla de expertos con licencia MIT —1,6 billones de parámetros totales, 49 mil millones activos por token—, publicado el 13 de agosto de 2026, y su checkpoint es descargable. GPT-6 Sol es de pesos cerrados, lanzado por OpenAI el 22 de septiembre de 2026 y, a 7 de octubre de 2026, es también el modelo que sustenta los niveles de pago del despliegue global de ChatGPT a más de 1200 millones de usuarios semanales.
Todo lo demás en esta comparación depende de qué medidor leas. En la tarjeta de tarifas, los dos están separados por un factor de cuatro. En lo que realmente costó producir una respuesta terminada en la suite independiente, están separados por 1,55×. En el Intelligence Index, las filas parecen estar a dieciséis puntos de distancia y, según la metodología documentada del propio evaluador, no se pueden restar en absoluto. Determinar cuál de esos tres números debería guiar una decisión es todo el trabajo, y la respuesta cambia según si estás eligiendo un proveedor o eligiendo un archivo.
Qué es cada modelo, en un párrafo cada uno
GPT-6 Sol es el nivel intermedio de la línea GPT-6 de OpenAI —por debajo del buque insignia GPT-6 Astra y por encima del económico GPT-6 Luna—, con una ventana de contexto de 1.050.000 tokens, un límite de salida de 128.000 tokens, entrada de texto, imagen y archivos, llamada a herramientas nativa, salidas estructuradas y esfuerzo de razonamiento seleccionable en cinco niveles, de bajo a máximo. Es el nivel al que OpenAI dirige ChatGPT Plus, Pro, Business y Enterprise, y su precio es de 2,00 $ por millón de tokens de entrada y 10,00 $ por millón de tokens de salida, con un nivel de contexto largo que reajusta el precio de toda la solicitud a 4,00 $ y 15,00 $ una vez que el prompt supera los 272.000 tokens de entrada.
DeepSeek V4 Pro es un modelo insignia solo de texto con una ventana de 1.048.576 tokens y una salida máxima de 384.000 tokens —el triple del límite de GPT-6 Sol— y sin visión a ningún precio. La propia documentación de la API de DeepSeek lo lista a $0,66 por millón de tokens de entrada y $1,98 por millón de salida durante las horas pico, reducido a la mitad, a $0,33 y $0,99 fuera de horas pico, con aciertos de caché a $0,022 fuera de horas pico. Las horas pico son de 01:00 a 04:00 y de 06:00 a 10:00 UTC de lunes a viernes; todo lo demás, incluidos los fines de semana y los días festivos públicos de China, queda fuera de horas pico.
Los tres metros
Empieza por el que más se cita, porque es el que más se cita sin su contexto. Artificial Analysis puntúa DeepSeek V4 Pro con 36.0 y GPT-6 Sol con 47.6 en Intelligence Index v4.3.2. Once puntos y medio es el tipo de diferencia que zanja una comparación.
No debería, y el propio evaluador lo dice. Artificial Analysis compara los modelos de pesos abiertos únicamente con otros modelos de pesos abiertos de la misma clase de tamaño, con el límite en 150.000 millones de parámetros, y los modelos propietarios dentro de una franja de precios con una proporción combinada de 3:1 entre entrada y salida. Son dos grupos de comparación distintos que producen dos escalas distintas. Un 36 y un 47,6 en filas contiguas de la misma tabla no son una comparación cara a cara, y lo honesto es decir eso en lugar de restar uno del otro y llamarlo capacidad.

Los dos medidores que son comparables dicen algo más útil:
• Precio combinado a 3:1 — GPT-6 Sol $4.00 por 1M frente a DeepSeek V4 Pro $0.99 en tarifas pico, o $0.50 fuera de pico; una diferencia de 4× a 8× según cuándo lo ejecutes
• Costo por tarea de indexación completada — GPT-6 Sol $1.04 frente a DeepSeek V4 Pro $0.67; una diferencia de 1.55×
• Tokens de salida generados en toda la suite — GPT-6 Sol 76.8M frente a DeepSeek V4 Pro 162.9M, así que el modelo barato escribe 2.1× más para terminar el mismo trabajo
• Salida máxima — DeepSeek V4 Pro 384,000 tokens frente a GPT-6 Sol 128,000; un techo de 3×
• Entrada multimodal — GPT-6 Sol acepta texto, imágenes y archivos frente a DeepSeek V4 Pro, que solo acepta texto
• Pesos — DeepSeek V4 Pro con licencia MIT y descargable frente a GPT-6 Sol cerrado

La cuarta y la quinta líneas explican la segunda. Un diferencial de 4× como titular que se reduce a 1,55× en trabajo real es lo que ocurre cuando el modelo más barato es también el más verboso: DeepSeek V4 Pro emitió 2,1× los tokens de salida que emitió GPT-6 Sol en el mismo conjunto de evaluación. La verbosidad es un multiplicador de costes que nunca aparece en una página de precios, y es la cifra más ignorada de este enfrentamiento.
Donde el modelo abierto realmente gana
Dos lugares, y ambos son estructurales más que marginales.
El límite de salida es el primero. 384.000 tokens frente a 128.000 es una diferencia de tres veces, y decide categorías enteras de trabajo: generar un gran artefacto estructurado en una sola llamada, escribir un documento largo sin encadenar, producir una gran refactorización como una sola respuesta. GPT-6 Sol no puede hacer eso a ningún precio, porque el límite no es un nivel de facturación — es el máximo del modelo.
El uso de herramientas agénticas es el segundo, en una medición concreta. DeepSeek V4 Pro obtiene un 96,2 % en τ²-Bench, la evaluación de uso de herramientas agénticas, y esa es la cifra con la que DeepSeek encabeza su propia ficha. También es el número que repite la entrada del modelo en el catálogo de OrcaRouter, que es la versión de la afirmación que encontrarían nuestros propios lectores. La cifra comparable de GPT-6 Sol en τ²-Bench no está publicada en la misma tabla, así que considera la comparación como direccional: en el único benchmark que DeepSeek eligió destacar, el modelo abierto está en la cima del campo, y el modelo cerrado no ha puesto un número en la misma columna.
Y la de la propiedad, que no es en absoluto un benchmark. Un checkpoint MIT descargable significa que puedes ejecutar el modelo en tu propio hardware, mantener una petición fuera de la red de cualquier proveedor, ajustarlo, fijar una versión y saber que seguirá ahí dentro de tres años. Ningún proveedor puede declararlo obsoleto, cambiarle el precio ni sacarlo de una lista de precios. Para un tipo de comprador —industrias reguladas, cualquiera con una restricción de residencia de datos, cualquiera que haya sufrido en sus carnes la retirada de un modelo—, eso vale más que once puntos de índice.
Donde GPT-6 Sol gana, y no es solo el índice
Terminal-Bench 4.0 es el dato menos halagüeño de la ficha de DeepSeek V4 Pro: 14,1 % frente al 43,9 % de GPT-6 Sol. Eso no es una diferencia de redondeo y apunta a un perfil real: el modelo abierto es fuerte en la orquestación de herramientas multiturno y débil en el trabajo de terminal de largo horizonte del que están hechos los agentes de programación modernos. Si tu carga de trabajo es un agente que tiene que mantener en pie una sesión de shell durante veinte minutos, esta única evaluación predice mejor tu experiencia que el compuesto del índice.
La multimodalidad es lo segundo. DeepSeek V4 Pro es texto de entrada, texto de salida. GPT-6 Sol acepta imágenes y archivos, y eso no es una casilla de funciones que marcar: el trabajo profesional con gran cantidad de documentos implica capturas de pantalla, páginas escaneadas, diagramas y PDF, y un modelo solo de texto no puede entrar en esa categoría en absoluto.
El tercero es lo que ocurrió esta semana. GPT-6 llegó a la pestaña Chat de ChatGPT para Plus, Pro, Business y Enterprise el 7 de octubre, y Free y Go lo hicieron a partir del 8 de octubre, con una capacidad que OpenAI denomina Intelligent UI: respuestas que componen texto, elementos gráficos, gráficos, formularios y controles que se pueden tocar según cada pregunta, en lugar de recurrir por defecto a la prosa. Eso es una superficie de la interfaz, no una función de la API, y no cambia ni una línea del código de tu integración. Lo que sí cambia es el valor predeterminado del entorno: el modelo que tu equipo ya tiene abierto en una pestaña del navegador ahora es GPT-6, y el trabajo de prototipado se desplaza hacia el modelo al que puede acceder sin una clave. Según lo reportado por el proveedor y sin haberse reproducido, OpenAI también afirma que GPT-6 en Extra High empieza a responder tan rápido como GPT-5.6 en Medium, y que GPT-6 Instant empieza a responder un 44 % antes en preguntas respaldadas por búsqueda.
Ejecutar uno, o ejecutar ambos
La razón por la que este emparejamiento concreto es más fácil de cubrir que la mayoría es que ambos modelos están en el mismo catálogo. OrcaRouter enruta GPT-6 Sol y DeepSeek V4 Pro — junto con más de 200 modelos adicionales — a través de un único endpoint compatible con OpenAI y una sola clave, con un 0% de margen sobre el precio de lista del proveedor. Ese traspaso directo es lo que hace que la estructura de horas punta/valle sea legible en lugar de misteriosa: la reducción a la mitad de DeepSeek en horas valle es del proveedor, nosotros no la tocamos, y cuando un proveedor cambia sus precios, el cambio está activo aquí el mismo día.
También es donde la decisión de la ventana de máxima demanda se convierte en una decisión de enrutamiento. La tarifa fuera de horas punta de DeepSeek V4 Pro es la mitad de su tarifa en horas punta, y las ventanas de máxima demanda son horas UTC fijas. Un trabajo por lotes que se puede desplazar merece programarse en torno a ellas, y una ruta sensible a la latencia merece mantenerse al margen de ellas. Con ambos modelos detrás de una sola clave, la división es una configuración en lugar de un segundo contrato con un proveedor: enruta el trabajo masivo y de salida extensa a DeepSeek V4 Pro fuera de horas punta, enruta el tráfico multimodal y de razonamiento intensivo a GPT-6 Sol, y deja que la conmutación por error automática cubra un límite de velocidad en cualquiera de los dos lados en lugar de descubrirlo en producción.

Lo que realmente haría
Si necesitas imágenes, archivos o una puntuación de razonamiento de frontera y estás comprando una API, GPT-6 Sol es la respuesta, y los once puntos del índice son en gran medida irrelevantes: la puerta multimodal lo decide antes de que los benchmarks tengan voto. Si necesitas una salida de 384.000 tokens, una licencia que puedas conservar, un despliegue en instalaciones propias o el coste por tarea finalizada más bajo de la tabla, DeepSeek V4 Pro gana, y la brecha del índice corresponde al grupo de pares de otro.
Lo que no haría es interpretar 36 frente a 47,6 como una brecha de capacidad y comprar basándome en ello. Las métricas comparables —0,67 $ frente a 1,04 $ por tarea, y una diferencia de verbosidad de 2,1× escondida dentro de una diferencia de 4× en el titular— cuentan una historia mucho más cercana que la que cuentan las filas del índice, y son las que aparecen en una factura.
Lo próximo que hay que observar es si DeepSeek cierra la brecha de Terminal-Bench en un V4 Pro, ya que esa es la única medición en la que el modelo abierto parece estar genuinamente por detrás en lugar de puntuar de forma distinta. GPT-6, por su parte, acaba de dejar de ser una opción para convertirse en un valor por defecto, y es difícil discutir con los valores por defecto incluso cuando el benchmark dice lo contrario.
Comparados en este artículo1
Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario
