
GPT-5 Codex vs GPT-5.6 Sol: El especialista en código frente al buque insignia que se lo tragó
- googleNUEVOGoogle: Gemini 3.8 Flash2026-09-0259Inteligencia76Código
- qwenNUEVOQwen: Qwen3.8 Max (0902)2026-09-0258Inteligencia72Código
- anthropicNUEVOAnthropic: Claude Fable 5.12026-09-0166Inteligencia82Código
- AlibabaNUEVOQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiNUEVOZ.ai: GLM 5.3 Flash2026-08-2658Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1860Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1552Inteligencia68Código
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1261Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0557Inteligencia72Código
- qwenQwen: Qwen3.8 Max2026-08-0358Inteligencia72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Inteligencia69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Inteligencia78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2152Inteligencia69Código
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Inteligencia49Código
Cuando OpenAI lanzó la familia GPT-5.6 el 9 de julio de 2026, retiró silenciosamente la aplicación independiente Codex e integró el modo agente de codificación en ChatGPT. La página del modelo que OpenAI escribió para GPT-5.6 Sol luego sonaba como una descripción de puesto sacada de un especialista en codificación: "razonamiento profundo en múltiples pasos, ingeniería de software a gran escala y flujos de trabajo agénticos de largo alcance". Así que el enfrentamiento entre GPT-5 Codex y GPT-5.6 Sol no es una simple batalla de especificaciones. Es el especialista preguntándose si el buque insignia que acaba de absorber su categoría de producto también la ha vuelto redundante.
La respuesta corta es no — pero la razón es más interesante que «Codex sigue siendo bueno». GPT-5 Codex sigue activo en la API a $1.25 por millón de tokens de entrada y $10 por millón de salida: un agente de ingeniería de software creado con un propósito específico, ajustado para automatización de CLI, IDE y GitHub, con puntuaciones medidas de forma independiente. GPT-5.6 Sol cuesta cuatro veces más en entrada y tres veces más en salida ($5 / $30) y es el nuevo buque insignia general, con cifras de codificación más altas — aunque en su mayoría reportadas por el proveedor. Lo que realmente define este emparejamiento es el precio, el contexto y la diferencia entre un especialista y un generalista que codifica bien. Todo lo que sigue está etiquetado por fuente.
Qué es cada modelo
GPT-5 Codex es exactamente lo que dice su página de modelo: "una versión especializada de GPT-5 optimizada para flujos de trabajo de ingeniería de software y codificación". Lanzado en septiembre de 2025, es el modelo de API detrás del agente de codificación de OpenAI: el que construye proyectos desde cero, realiza trabajo de funcionalidades, refactoriza a gran escala, revisa código y planifica cambios en múltiples archivos con un control ajustable de esfuerzo de razonamiento. Acepta entrada de texto e imagen (capturas de pantalla para trabajo de interfaz de usuario), tiene un contexto de 400K tokens, un límite de salida de 128K, y está explícitamente orientado a aplicaciones de codificación agénticas: CLI, extensiones de IDE, GitHub y tareas en la nube.
GPT-5.6 Sol es el nivel insignia de la serie GPT-5.6, lanzado el 9 de julio de 2026 con un corte de conocimiento de febrero de 2026. Es el modelo al que OpenAI asigna el trabajo general más difícil: razonamiento profundo de múltiples pasos, ingeniería de software a gran escala, agentes de largo horizonte, uso de computadora y un modo de razonamiento "ultra" multiagente. Su contexto es de 1,05 millones de tokens — 2,6 veces el de GPT-5 Codex — con el mismo límite de salida de 128K, y acepta entrada de texto, imagen y archivos. Sol también se ejecuta dentro de ChatGPT, por lo que cuando OpenAI habla de "Codex" en el sentido de producto hoy en día, normalmente se refiere a Sol realizando trabajo de codificación agéntico.
Precio: una brecha de 4x / 3x que se estrecha pero nunca se cierra.
Las cifras principales, ambas pasadas al precio de lista del proveedor: GPT-5 Codex a $1.25 / $10 por millón de tokens (lectura de caché $0.125); GPT-5.6 Sol a $5 / $30 (lectura de caché $0.50). Eso es cuatro veces el precio de entrada y tres veces el precio de salida. En un día de codificación habitual de diez millones de tokens con una división de entrada/salida de 75/25, GPT-5 Codex factura aproximadamente $34; GPT-5.6 Sol factura aproximadamente $112. La brecha no es teórica.
Dos cosas lo reducen. Primero, el caché: ambos modelos fijan el precio de la entrada almacenada en caché muy por debajo del de la entrada nueva, y los bucles de agente releen constantemente el mismo contexto del repositorio, por lo que una gran parte de los tokens puede aprovechar el nivel barato. Segundo, la eficiencia: OpenAI afirma que la generación 5.6 completa tareas agénticas con aproximadamente un 54% menos de tokens de salida que la generación anterior. Si Sol necesita solo la mitad de los tokens de salida para la misma tarea, la brecha por tarea se reduce de aproximadamente 3.3x a aproximadamente 2x — un ahorro real, pero que no elimina una diferencia de 4x en el precio de entrada, y una afirmación de eficiencia reportada por OpenAI, no medida de forma independiente.
Sol también tiene un precio de entrada escalonado: en la página del modelo de OrcaRouter, su tarifa base de $5 / $30 se aplica a solicitudes de hasta 32K tokens de entrada, y las solicitudes más grandes se facturan al nivel superior de $10 / $45. Ese es el impuesto por contexto largo — exactamente las solicitudes que hace un agente de grandes repositorios. Por lo tanto, la comparación de precios práctica depende aún más de la carga de trabajo de lo que sugiere el titular de 3-4x.

Contexto y cómo se llaman
La brecha de contexto es el segundo verdadero divisor. 400K tokens cubren una base de código sustancial, y Codex, al ser un especialista, fue construido para ser eficiente dentro de esa ventana. Pero un contexto Sol de 1.05M tokens cambia lo que puedes entregar a un modelo: un monorepo completo, trazados de agente largos, una wiki de incorporación más el código. Para los equipos que alimentan repositorios enteros en una sola solicitud, la ventana más grande es la diferencia entre "el modelo puede ver los archivos relevantes" y "el modelo puede ver los archivos relevantes más todo lo que los importa". También es la diferencia entre un token de entrada de $1.25 y uno de $5, por lo que la decisión de contexto es una decisión de costo.
Ambos modelos hablan las mismas dos formas de API — OpenAI Chat Completions y la API Responses — y ambos admiten llamadas a herramientas/funciones y salidas estructuradas. En OrcaRouter, ambos se encuentran detrás de un único endpoint compatible con OpenAI, por lo que cambiar entre ellos es un cambio de nombre de modelo, no un cambio de integración.
Dónde divergen los benchmarks — y la nota de honestidad
El dato interesante es que los dos modelos apenas comparten un benchmark. GPT-5 Codex tiene puntuaciones genuinamente independientes: Artificial Analysis lo mide con un Intelligence Index de 36,1 y un Coding index de 38,9, con un Math Index de 98,7, LiveCodeBench en 84,0 y SWE-Bench Verified en 74,5 por ciento. Las cifras insignia de GPT-5.6 Sol — Terminal-Bench 2.1 en 88,8, un Artificial Analysis Coding Agent Index de 80 en razonamiento máximo, Agents' Last Exam en 53,6 — son las que OpenAI publicó en el lanzamiento y no han sido reproducidas por un evaluador independiente. «88,8 frente a 84,0» no es una lucha justa, porque una de esas cifras está auditada y la otra es una afirmación del proveedor. El resumen honesto: Sol es una generación más nueva y su techo es claramente más alto, pero la única puntuación de codificación que cualquiera de los dos modelos tiene y que un laboratorio independiente verificó pertenece al especialista más antiguo y barato.

También hay un benchmark que la propia OpenAI cuestiona. En SWE-Bench Pro, GPT-5.6 Sol obtiene un 64,6 por ciento mientras que Claude Fable 5 lidera con un 80 — y OpenAI ha puesto públicamente en duda la validez del benchmark. En ese caso, la señal interesante no es la puntuación, sino el hecho de que un proveedor insignia ahora argumenta que su propia baja calificación es culpa del benchmark. Para un equipo de desarrollo, esto es un recordatorio de probar el modelo en tu propio repositorio antes de confiar en cualquier marcador, incluido el nuestro.
Velocidad: la advertencia de tráfico
En la telemetría de siete días de OrcaRouter, GPT-5.6 Sol muestra una mediana de tiempo hasta el primer token de 3.82 segundos y aproximadamente 465 tokens de salida por segundo, sobre 39 millones de tokens de tráfico. La página de GPT-5 Codex todavía está "recopilando" telemetría: su tráfico a través del router es lo suficientemente escaso como para que aún no haya nada que promediar. Ese tráfico escaso es en sí mismo información: a los ojos del mercado, el trabajo de la API del agente de codificación ya se ha trasladado a modelos más nuevos. Eso no significa que GPT-5 Codex sea lento o esté roto; significa que "cuál es más rápido" no se puede responder con los datos del router hasta que alguien ejecute un volumen real a través de él.
¿Cuál deberías elegir?
Elige GPT-5 Codex si…
Tu carga de trabajo está genuinamente centrada en el código: ejecutas un agente que edita código, revisa pull requests, refactoriza, escribe pruebas y trabaja dentro de un IDE o un entorno de línea de comandos. Quieres el enfoque del especialista, la entrada cuatro veces más barata y la única puntuación de codificación verificada de forma independiente en este enfrentamiento. GPT-5 Codex también es la decisión acertada si quieres la semántica de agente-codificador de OpenAI — la perilla de esfuerzo de razonamiento, el bucle de uso de herramientas — sin pagar precios de gama alta por una capacidad general que no vas a utilizar.
Elige GPT-5.6 Sol si…
Tu trabajo combina codificación con razonamiento general difícil, agentes de largo horizonte, uso de computadora o entrada con muchos archivos — o simplemente quieres un buque insignia para todo. El contexto de 1.05M, el modo ultra multiagente, el entrenamiento más nuevo y la integración de productos ChatGPT y Codex favorecen a Sol. Sus números de codificación son más altos sobre el papel, y en un benchmark en el que el proveedor cree, es el mejor agente de codificación que OpenAI ha lanzado. Estás pagando de tres a cuatro veces más por token por esa amplitud; la historia de eficiencia de tokens reduce la brecha en las tareas que Sol realmente gana.
La respuesta suele ser ambas cosas: enrutar según la tarea
Debido a que ambos están activos en OrcaRouter con un margen del 0%, la configuración más potente no es una elección en absoluto. Apunta el volumen de codificación hacia GPT-5 Codex — el especialista de $1.25 / $10 — y escala únicamente las tareas que necesitan la amplitud de un modelo insignia a GPT-5.6 Sol a $5 / $30. Una clave de API, un endpoint compatible con OpenAI, un cambio de nombre del modelo al enrutar y conmutación por error automática si un proveedor atraviesa una mala hora. El traspaso importa de manera específica aquí: los $1.25 / $10 y $5 / $30 que presupuestas son los precios de lista de los proveedores, de modo que una futura bajada de precios de OpenAI se activa en nuestro endpoint el mismo día en que se anuncia, y tu lógica de enrutamiento no necesita cambiar.

Preguntas que esto plantea
¿Reemplazó GPT-5.6 Sol a GPT-5 Codex?
En el producto, sí: la aplicación independiente de Codex se fusionó con ChatGPT en el lanzamiento de la versión 5.6, y Sol es el motor que ejecuta el modo agente de codificación allí. En la API, no: GPT-5 Codex sigue siendo un modelo activo y servido con su propio precio, y muchos pipelines de agentes todavía lo ejecutan porque está diseñado para un propósito específico y es económico.
¿Es el código de Sol realmente mejor que el de Codex?
En cuanto a los números que publicó OpenAI, sí: Terminal-Bench 2.1 con 88.8 frente a LiveCodeBench de Codex con 84.0, pero son benchmarks diferentes, y las cifras de Sol son reportadas por el proveedor mientras que las de Codex se miden de forma independiente. Prueba en tu propio repositorio; esa es la única puntuación que cuenta.
¿Por qué alguien seguiría usando GPT-5 Codex?
Precio y adecuación. A una cuarta parte del precio de entrada de Sol, un pipeline dedicado de agente de codificación que nunca necesita la amplitud del modelo insignia general ahorra dinero de verdad por millón de tokens, y el enfoque del especialista significa menos ajuste de prompts para mantenerlo enfocado en la codificación.
La razón por la que vale la pena pensar en este enfrentamiento es que OpenAI integró la respuesta en su propio producto. La empresa pasó un año vendiendo un especialista en codificación, y luego lo absorbió en un buque insignia generalista que codifica lo suficientemente bien como para reclamar la corona del especialista, mientras dejaba al especialista en la API a una fracción del precio. Eso no es un truco; es el precio mínimo para «queremos el agente de codificación sin pagar por el buque insignia». GPT-5 Codex es el especialista barato, enfocado y medido de forma independiente. GPT-5.6 Sol es el buque insignia más nuevo, más amplio y más caro cuyas afirmaciones sobre codificación deberías verificar en tu propio trabajo. La mayoría de los equipos de producción descubrirán que la respuesta honesta es ambas cosas, y con ambas en un único endpoint de paso, el enrutamiento entre ellas es una configuración, no una migración.
Comparados en este artículo2
Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario
