
GPT-6 vs Claude Opus 5.5: el modelo que todo el mundo acaba de recibir, frente al que sigue liderando
- openaiNUEVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligencia
- anthropicNUEVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligencia
- typesafeNUEVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Inteligencia
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Inteligencia
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Inteligencia
- xAIGrok 4.72026-09-2146Inteligencia
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 65 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 360 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
El 7 de octubre de 2026, GPT-6 se convirtió en el modelo con el que conversan más de 1200 millones de usuarios semanales de ChatGPT, y aun así no es el modelo con la puntuación más alta en la tabla independiente. GPT-6 Sol —el nivel que OpenAI habilitó para ChatGPT Plus, Pro, Business y Enterprise— obtiene 47,6 en el Intelligence Index v4.3.2 de Artificial Analysis. Claude Opus 5.5, que Anthropic lanzó el 22 de septiembre de 2026 a 4,00 USD por millón de tokens de entrada y 20,00 USD por millón de salida, obtiene 57,6 en la misma revisión. Diez puntos, en la única medición en la que los equipos de marketing de ambos proveedores aceptan ser puntuados.
Esa brecha es real y no voy a minimizarla. Pero también es el dato menos interesante de este emparejamiento en octubre, porque lo que cambió esta semana no es un benchmark. GPT-6 llegó a ChatGPT para todos con una capacidad que OpenAI llama Intelligent UI, y el modelo que impulsa los niveles de pago de ese despliegue es GPT-6 Sol. Así que la comparación útil ya no es «qué API es mejor» — es «qué obtuvieron realmente los 1.200 millones de personas que acaban de recibir GPT-6, y es suficiente para que un creador o un equipo deje de pagar por Claude Opus 5.5». Las dos respuestas difieren, y la diferencia no son los diez puntos.
¿Qué cambió realmente el 7 de octubre?
Para ser precisos con la fecha, porque esto no es un lanzamiento: GPT-6 Sol y GPT-6 Luna se lanzaron el 22 de septiembre de 2026 como modelos de API. GPT-6 Astra, el buque insignia, es anterior a ellos: OpenAI lo lanzó el 3 de septiembre de 2026. Lo que ocurrió el 7 de octubre es que GPT-6 llegó a la pestaña Chat de ChatGPT a nivel global para Plus, Pro, Business y Enterprise, y los niveles Free y Go llegaron a partir del 8 de octubre; el acceso empresarial aún depende de la configuración de un administrador del lugar de trabajo. Es un evento de distribución, no un lanzamiento, y la distinción importa para cualquiera que lea la cobertura anterior.
La capacidad que lleva asociada es la parte genuinamente nueva. Intelligent UI permite a GPT-6 componer una respuesta a partir de texto, elementos gráficos, botones pulsables, formularios y gráficos, elegidos según la pregunta, y emitir la interfaz conforme el modelo la genera. El propio planteamiento de OpenAI es que una comparación puede llegar en paralelo, una explicación como diagrama interactivo y una respuesta en texto plano cuando el texto es la respuesta adecuada. La acompañan dos resultados internos reportados por el proveedor: en tareas agénticas cotidianas de alto valor, GPT-6 con esfuerzo Extra High empieza a responder en el mismo tiempo que GPT-5.6 en Medium, a la vez que obtiene una puntuación global mejor que GPT-5.6 en Extra High, y en preguntas que requieren búsqueda web, GPT-6 Instant empieza a responder un 44 % antes de media que GPT-5.6 Instant. Ambas son cifras de OpenAI, reproducidas de su propio anuncio, y ninguna cuenta todavía con una reproducción independiente.
Dos tarjetas de tarifas, y dónde se compran los diez puntos
Ninguno de los dos modelos cambió su precio esta semana. Claude Opus 5.5 cuesta $4.00 de entrada y $20.00 de salida desde el 22 de septiembre. GPT-6 Sol cuesta $2.00 y $10.00 desde el mismo día. Una línea por dimensión, ambos lados en cada una:
• Entrada principal — GPT-6 Sol $2,00 por 1M frente a Claude Opus 5.5 $4,00; Sol cuesta la mitad
• Salida principal — GPT-6 Sol $10,00 por 1M frente a Claude Opus 5.5 $20,00; de nuevo, la mitad
• Cláusula de contexto largo — GPT-6 Sol vuelve a tarificar toda la solicitud a $4,00 de entrada y $15,00 de salida por encima de 272.000 tokens de entrada; Claude Opus 5.5 no tiene un tramo comparable en su ventana de 1M
• Entrada en caché — GPT-6 Sol $0,20 por 1M frente a Claude Opus 5.5 $0,20; igual
• Coste de ejecutar la suite completa de Intelligence Index — Claude Opus 5.5 $5,98 por tarea frente a GPT-6 Sol $1,04, una diferencia de 5,7× a cambio de esos diez puntos
• Ventana de contexto — GPT-6 Sol 1.050.000 tokens frente a Claude Opus 5.5 1.000.000, con un límite de salida de 128.000 tokens en ambos

La cuarta línea es la que decide la mayoría de los despliegues reales, y no es la que aparece en la página de marketing. El recargo por contexto largo de GPT-6 Sol es agresivo en relación con su propio precio destacado: si una solicitud supera los 272.000 tokens de entrada, toda la solicitud se factura a $4,00 y $15,00, no solo el exceso. Para un agente que mantiene una sesión larga con un documento grande en el contexto, eso elimina silenciosamente la mayor parte de la ventaja de mitad de precio. Claude Opus 5.5 no tiene un tramo equivalente, así que una solicitud de 400.000 tokens le cuesta la misma tarifa por token que una de 4.000.
Dónde se ubican los diez puntos, porque no están distribuidos uniformemente
Un compuesto de índice oculta sus propios componentes, y este oculta un perfil inusualmente irregular. Extrae las evaluaciones individuales con las que se puedan contrastar los números de ambos proveedores:
• Humanity's Last Exam — Claude Opus 5.5 61,4% frente a GPT-6 Sol 47,9%, una diferencia de 13,5 puntos en razonamiento abstracto
• SciCode — Claude Opus 5.5 66,9% frente a GPT-6 Sol 57,6%, una diferencia de 9,3 puntos en código de nivel de investigación
• Terminal-Bench 4.0 — Claude Opus 5.5 59,6% frente a GPT-6 Sol 43,9%
• Recuperación de contexto largo — Claude Opus 5.5 84,7% frente a GPT-6 Sol 83,7%, una diferencia de 1,0 puntos, la más estrecha de esta página
• Uso de herramientas agénticas multiturno — los dos modelos se sitúan a unos pocos puntos en la familia τ²-Bench, donde ambos son fuertes

La distribución lo es todo. En cuanto al razonamiento en abstracto —una pregunta difícil de examen, un problema de investigación sin una respuesta existente que copiar—, Claude Opus 5.5 va decisivamente por delante, y la diferencia es demasiado amplia para ser ruido. En cuanto a extraer un dato de una entrada muy larga, los dos están prácticamente a la par, y GPT-6 Sol tiene la ventana marginalmente mayor. Si tu carga de trabajo consiste en recuperación de documentos largos y trabajo de agentes con sesiones largas, los diez puntos son en gran medida un problema de otros. Si es razonamiento novedoso, son tu problema, y evitarlos te cuesta 5.7× por tarea.
Lo que el despliegue de ChatGPT te dice y lo que no te dice
Existe la tentación de leer «1.200 millones de usuarios semanales ahora tienen GPT-6» como evidencia sobre capacidad. No lo es. Es evidencia sobre distribución, y OpenAI dice explícitamente que el despliegue de ChatGPT está impulsado por GPT-6 Sol para los planes de pago y GPT-6 Luna para Free y Go, ambos «ajustados para la conversación cotidiana» —un objetivo de optimización distinto del producto de API. Los modelos detrás de Work y Codex no cambian con este lanzamiento, lo cual es la señal más clara e inequívoca del anuncio de que se trata de un evento de la superficie de consumo y no de un lanzamiento de capacidades. Cualquiera que haga benchmarking del «GPT-6 que usan 1.200 millones de personas» debería saber que está midiendo un despliegue ajustado para chat, no el endpoint de la API.
Lo que sí cambia el despliegue es la opción predeterminada. Un modelo que simplemente está disponible para todos acaba en muchos más prototipos, herramientas internas y proyectos secundarios a medio terminar que un modelo que hay que elegir deliberadamente. Si eliges una API para algo duradero, esa familiaridad ambiental vale algo, pero no vale diez puntos de índice, y no vale 5,7× el coste por tarea en un pipeline con gran carga de razonamiento.
Ejecutar ambos sin elegir
La respuesta honesta a «¿debería cambiarme?» aquí es que los dos modelos quieren trabajos diferentes, y la pregunta de cambiarse es sobre todo una pregunta de enrutamiento. Ambos están en el catálogo de OrcaRouter — GPT-6 Sol al precio del proveedor de $2.00/$10.00, con el nivel de contexto largo de $4.00/$15.00 transferido sin cambios, y Claude Opus 5.5 a $4.00/$20.00 — detrás de una clave y un endpoint compatible con OpenAI, con 0% de recargo sobre el precio de lista del proveedor. Eso importa más de lo habitual en una semana en la que un proveedor cambia un despliegue para consumidores, porque nuestra línea de precios es la del proveedor, no la nuestra.
El patrón que encaja con este emparejamiento es una división: envía el tráfico de documentos largos y sesiones largas al que sea más barato de los dos en ese recuento de tokens —que, pasados los 272.000 tokens, ya no es GPT-6 Sol—, y envía el tráfico de razonamiento novedoso a Claude Opus 5.5, con GPT-6 Sol retenido como una conmutación automática por error para que un límite de velocidad en una ruta no se convierta en una interrupción del servicio de tu lado. No tienes que resolver el argumento de diez puntos para lanzar; tienes que saber cuáles de tus solicitudes están en la parte de la distribución donde se aplica.

El veredicto, tal como es
Claude Opus 5.5 es el mejor modelo según la medición con la que ambos laboratorios se comparan al publicar, y no hay comparación en las dos evaluaciones que más importan para el razonamiento difícil. GPT-6 Sol cuesta la mitad al precio anunciado, una quinta parte del coste por tarea en la suite independiente, y ahora es el modelo predeterminado en la aplicación que la mayoría de tus colegas ya tiene abierta. Ninguno de esos hechos ha cambiado esta semana; lo que cambió es que GPT-6 dejó de ser algo que tenías que elegir y se convirtió en algo que ya tienes.
Lo que hay que vigilar es si el próximo movimiento de OpenAI es un paso en capacidad o otro paso en distribución. Su propio anuncio establece esa expectativa de forma explícita —la compañía dice que quiere que ChatGPT construya más de las interfaces que la gente necesita con el tiempo— y eso es una hoja de ruta sobre superficies, no sobre puntos de índice. Si tu decisión depende del índice, Claude Opus 5.5 sigue ganándolo. Si depende del costo a volumen y de que el modelo sea uno que todos ya conocen, GPT-6 Sol es la opción predeterminada más segura hoy, con la cláusula de contexto largo como la única línea de su lista de precios que tienes que presupuestar.
Comparados en este artículo2
Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario
