
OpenAI o3 vs DeepSeek V4 Pro: La era del razonamiento premium termina donde se abre la brecha de precios
- DeepSeekNUEVODeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 por 1M de tokens
- z-aiNUEVOZ.ai: GLM 5.32026-08-1860Inteligencia75Código
- obsidianNUEVOQwen3.8 27B2026-08-1552Inteligencia68Código
- qwenNUEVOQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekNUEVODeepSeek: DeepSeek V4 Pro 08132026-08-1253Inteligencia69Código
- grokNUEVOSpaceXAI: Grok 4.62026-08-1261Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0557Inteligencia72Código
- qwenQwen: Qwen3.8 Max2026-08-0358Inteligencia72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Inteligencia69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Inteligencia78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2152Inteligencia69Código
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Inteligencia49Código
- metaMeta: Muse Spark 1.12026-07-1653Inteligencia71Código
- kimiMoonshotAI: Kimi K32026-07-1560Inteligencia76Código
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Inteligencia71Código
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Inteligencia77Código
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Inteligencia77Código
El enfrentamiento entre OpenAI o3 y DeepSeek V4 Pro es realmente una colisión de dos números. OpenAI o3, lanzado el 16 de abril de 2025, fue el punto de referencia para el razonamiento premium: el modelo por el que pagabas más cuando el costo de una respuesta incorrecta era mayor que el costo de los tokens. DeepSeek V4 Pro, que pasó a disponibilidad general como build 0813 el 13 de agosto de 2026, después de un lanzamiento silencioso en la noche y un despliegue que incluyó un anuncio retirado y pesos re-subidos, es el modelo que hizo que ese premium pareciera un error de categoría: un índice independiente que se sitúa por encima del de o3, a aproximadamente una quinta parte del precio, y además con pesos abiertos. Y la colisión tiene marca de tiempo, porque OpenAI o3 deja ChatGPT el 26 de agosto de 2026, sus instantáneas de API siguen el 11 de diciembre, y cada semana de la comparación favorece al modelo que no va a desaparecer.
Dos modelos que se lanzaron con un año de diferencia en filosofía
o3 es el buque insignia de razonamiento puro: un modelo cerrado entrenado para pensar durante mucho tiempo antes de responder, con una ventana de contexto de 200K, hasta 100K de salida y entrada de imágenes integrada en su cadena de pensamiento. Según las propias cifras de OpenAI, estableció el listón de 2025: 96,7% en AIME 2024, 87,7% en GPQA Diamond, 69,1% en SWE-bench Verified sin andamiaje, un Elo de 2727 en Codeforces — y luego OpenAI redujo su precio de $10/$40 a $2/$8 por millón de tokens, donde sigue actualmente. DeepSeek V4 Pro es una economía completamente distinta: un modelo de mezcla de expertos con 1,6 billones de parámetros y aproximadamente 49 mil millones de parámetros activos por token, una ventana de contexto de 1 millón de tokens, salida máxima de 384K, entrada solo de texto y —nuevo en la compilación GA 0813— una pila de post-entrenamiento reconstruida más integración nativa con Responses-API y Codex, que hizo que sus puntuaciones de agente saltaran de 12,8 en la vista previa a 62,7 en DeepSWE. También tiene pesos abiertos: el checkpoint DeepSeek-V4-Pro-0813 es descargable en Hugging Face bajo la licencia MIT, después de unas caóticas primeras 24 horas en las que se retiró el banner de lanzamiento y los pesos estuvieron brevemente en 404 antes de una nueva publicación con configuración corregida.
La brecha de costos en números reales
Las tarifas hacen la mayor parte de la discusión por sí solas:
• OpenAI o3 — $2.00 por millón de entrada, $8.00 por millón de salida, $0.50 de entrada en caché. Los tokens de razonamiento se facturan como salida, por lo que una pregunta difícil quema tokens de pensamiento antes de la respuesta.
• DeepSeek V4 Pro — $0.435 por millón de entrada (fallo de caché), $0.003625 acierto de caché, $0.87 por millón de salida hoy. La salida es aproximadamente 4.6× más barata que o3, y la entrada con acierto de caché es efectivamente gratuita.
• La advertencia con una fecha — el aumento de precio programado por DeepSeek para el 17 de agosto mueve la salida de V4 Pro de 6 yuanes a 27 yuanes por millón en horas pico (13.5 fuera de pico) y la entrada con fallo de caché de 3 a 9 yuanes. Incluso con la nueva tarifa máxima, la salida representa una pequeña fracción de los $8 de o3. La ventana para construir con la tarifa actual se mide en días, lo cual es en sí mismo parte del cálculo de migración.
La economía por respuesta correcta agudiza el punto. Los tokens de razonamiento ocultos de o3 significan que su costo real por respuesta difícil es varios múltiplos de su tarifa de salida. DeepSeek V4 Pro también razona, y su pensamiento se factura como salida igualmente, pero a $0.87 el gasto absoluto es un error de redondeo al lado de una sesión de o3 que piensa durante un minuto y medio. El marco de costo de agente que DeepSeek usó en su lanzamiento — aproximadamente una brecha de 45× en precio por tarea frente a la frontera cerrada — exagera contra o3 específicamente, pero la dirección no está en disputa: esto es una brecha de 4–10× en costo efectivo dependiendo de la carga de trabajo.
Dónde se encuentra realmente la brecha de calidad
La puntuación que más importa es la independiente. En el Intelligence Index de Artificial Analysis, DeepSeek V4 Pro registra 53 y ocupa el puesto #2 de los 104 modelos que el índice enumera actualmente; o3 se sitúa alrededor de 30, una diferencia de más de 20 puntos en la misma prueba. Ese es el resumen más claro de dónde dos años de progreso dejaron al buque insignia de razonamiento premium: ya no solo se le rebaja el precio; se le supera en el agregado independiente.
El panorama por punto de referencia es más confuso y necesita etiquetas honestas. Las cifras principales de agente de DeepSeek V4 Pro — Terminal-Bench 2.1 con 87.9, CyberGym con 83.3, DeepSWE con 62.7, AutomationBench por delante de la frontera cerrada — son afirmaciones propias de DeepSeek del lanzamiento del 0813, no reproducidas de forma independiente al momento de escribir esto, y el episodio de configuración incorrecta del despliegue significa que nadie puede estar seguro de que la API estuviera sirviendo los pesos finales corregidos cuando se recopilaron los primeros números de terceros. Los puntos de referencia de lanzamiento de o3 también son reportados por el proveedor, pero fueron parcialmente validados por pruebas independientes en 2025, cuando realmente lideraba las tablas de razonamiento. En matemáticas y razonamiento puro, el historial publicado de o3 sigue pareciendo mejor que el de DeepSeek V4 Pro — las fortalezas de DeepSeek son el uso de herramientas agénticas, la programación y las tareas de horizonte largo, que son un conjunto de pruebas diferente al de las olimpiadas de matemáticas que o3 dominó.

Lo que o3 todavía hace mejor
Dos cosas sobreviven intactas a la comparación. Primero, matemáticas y razonamiento cuidadoso: el 96.7% en AIME y el 87.7% en GPQA de o3 siguen por encima de cualquier cifra publicada por DeepSeek V4 Pro, y si tu carga de trabajo es una demostración difícil o un problema de competición, o3 — mientras siga funcionando — es la respuesta más segura. Segundo, razonamiento con imágenes: o3 puede pensar sobre una captura de pantalla o un diagrama dentro de su cadena de pensamiento, y DeepSeek V4 Pro es solo de texto; la compilación 0813 no añadió ningún codificador de visión, y si tu tarea requiere que el modelo lea una imagen, DeepSeek V4 Pro no es un sustituto de o3 en ese aspecto. Ninguna de las dos ventajas es una razón para quedarse en un modelo que se retira, pero ambas son razones para ser honestos: la migración no es una mejora pura.
Otra cosa que vale la pena señalar es la diferencia de pesos abiertos, que no es en absoluto un benchmark. o3 fue cerrado y ahora se está consolidando hasta desaparecer; no puedes mantenerlo funcionando en tu propio hardware. El checkpoint 0813 de DeepSeek V4 Pro es tuyo, permanentemente, con licencia MIT: los mismos pesos, el mismo modelo de 1,6 billones de parámetros, autoalojado si tienes el hardware de aproximadamente 1,5 terabytes para ello. Para los equipos que fueron perjudicados por depender de un modelo cerrado que un proveedor podía retirar, esa es una respuesta estructural al problema exacto que plantea la retirada de o3.
Migrando la carga de trabajo
Para el equipo de API que viene de o3, DeepSeek V4 Pro es la opción más económica y, en el trabajo de agentes y codificación que en realidad constituye la mayor parte del uso de API, rara vez es una degradación. Los verdaderos inconvenientes son operativos, no de calidad: V4 Pro está limitado a 500 solicitudes concurrentes en la API oficial, un techo que alcanzarás con una flota de agentes, y su precio cambia el 17 de agosto. Ambas cosas son exactamente para lo que sirve una capa de enrutamiento.
En OrcaRouter, DeepSeek V4 Pro se sirve al precio de lista del proveedor sin margen — así que los $0.44/$0.87 actuales están disponibles aquí el mismo día que en DeepSeek, y cuando llegue el horario punta/valle del 17 de agosto, también se reflejará aquí el mismo día. Una sola clave también sirve para el resto de esta cohorte de reemplazo de o3, y la conmutación automática por error es la respuesta limpia al límite de 500 concurrencias: apunta una ruta de producción a V4 Pro más un segundo modelo con la misma clave y deja que el router absorba el techo. El propio OpenAI o3 no está en esa clave — sigue disponible a través de la API de OpenAI y de varias plataformas de terceros hasta el corte de la instantánea del 11 de diciembre.

A quién favorecen las matemáticas
Para cualquiera cuya carga de trabajo con {{1}}o3{{/1}} sea codificación, bucles de agentes o procesamiento de contexto largo, las cuentas no cierran: DeepSeek V4 Pro supera a {{1}}o3{{/1}} en el índice independiente, cuesta una fracción de su precio, y sus pesos abiertos significan que esta dependencia concreta no puede retirarse sin avisar. Los equipos con una razón genuina para mantener a {{1}}o3{{/1}} vivo por ahora son los nichos — {{2}}razonamiento complejo de matemáticas puras{{/2}}, y cualquier cosa construida sobre el pensamiento visual de {{1}}o3{{/1}} — e incluso esos deberían estar probando reemplazos con cargas de trabajo reales antes de diciembre, porque a la fecha límite no le importa tu caso particular. La era del razonamiento premium que definió {{1}}o3{{/1}} terminó con el anuncio de su retiro; resulta que DeepSeek V4 Pro es donde está el asiento más barato de la próxima era.

Comparados en este artículo2
Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario
