
GPT-6 vs Claude Opus 5: Ambos lados de esta comparación ya han sido reemplazados
- openaiNUEVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligencia
- anthropicNUEVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligencia
- typesafeNUEVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Inteligencia
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Inteligencia
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Inteligencia
- xAIGrok 4.72026-09-2146Inteligencia
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 60 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 356 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
The most useful thing to know about GPT-6 versus Claude Opus 5 is that both halves of the matchup are one generation behind their own vendors. Claude Opus 5 shipped on 24 July 2026 and was replaced by Claude Opus 5.5 on 22 September. GPT-6 Sol shipped on 22 September and was replaced by GPT-6.1 Sol on 29 September. If you searched for this comparison because you are choosing between them for new work, you are choosing between two models that each vendor has already moved past — and the honest version of this article is about when the older pair is still the right call, not about who wins.
Qué son en realidad los dos modelos
Claude Opus 5 era el modelo insignia de Anthropic: una ventana de contexto de 1.000.000 de tokens, 128.000 tokens de salida máxima, entrada de texto, imágenes y archivos, con un precio de 5,00 USD por millón de tokens de entrada y 25,00 USD por millón de tokens de salida, con una tarifa de 0,50 USD para entrada en caché y una tarifa de 10,00 USD para escritura en caché. Es un único modelo con un único id, anthropic/claude-opus-5.
GPT-6 Sol es el nivel intermedio de una generación de tres modelos — GPT-6 Astra por encima y GPT-6 Luna por debajo — con el mismo contexto de más de 1,000,000 tokens (el catálogo indica 1,050,000 para el lado de OpenAI frente a los 1,000,000 de Opus 5), el mismo límite de salida de 128,000 tokens y la misma entrada de texto/imagen/archivo. Su precio de lista es de $2.00 / $10.00, con una tarifa de entrada en caché de $0.20 y una tarifa de escritura en caché de $2.50. Su tarjeta de tarifas incluye un paso que la tarjeta de Anthropic no tiene: cualquier solicitud por encima de 272,000 tokens de entrada recalcula el precio de toda la solicitud a $4.00 / $15.00.
Eso es una diferencia de precio de 2,5x por token a favor de Sol en el extremo corto, y la diferencia también se mantiene en la caché: un descuento del 90 % en la entrada en caché para Sol frente a un descuento del 98 % en Opus 5, lo que reduce la diferencia a $0,20 frente a $0,50 por millón en lugar de eliminarla. En una carga de trabajo de contexto largo, la diferencia se reduce a la mitad en lugar de cerrarse.
• Entrada — GPT-6 Sol $2.00 por millón frente a Claude Opus 5 $5.00
• Salida — GPT-6 Sol $10.00 por millón frente a Claude Opus 5 $25.00
• Entrada en caché — GPT-6 Sol $0.20 por millón frente a Claude Opus 5 $0.50
• Escrituras en caché — GPT-6 Sol $2.50 por millón frente a Claude Opus 5 $10.00
• Por encima de 272K de entrada — GPT-6 Sol reajusta el precio de toda la solicitud a $4.00 / $15.00; no hay un tramo equivalente en la tarjeta de Opus 5
• Contexto y salida — 1,050,000 de entrada y 128,000 de salida frente a 1,000,000 de entrada y 128,000 de salida
El panel independiente, donde la brecha es mayor que el precio.
El precio favorece a GPT-6 Sol por 2,5x. El ranking favorece a Claude Opus 5 más de lo que sugeriría la diferencia de precio, lo cual es lo opuesto a la historia habitual del modelo barato.
• AA Intelligence Index — Claude Opus 5 50.8, ranked 11th; GPT-6 Sol 47.6, ranked 14th
• AA Coding Index — Claude Opus 5 78.0, ranked 2nd on that board; GPT-6 Sol 60.0
• GPQA Diamond — Claude Opus 5 93.2
• Humanity's Last Exam — Claude Opus 5 54.9 vs GPT-6 Sol 47.9
• Terminal-Bench 2.1 — Claude Opus 5 89.1
• Terminal-Bench 4.0 — Claude Opus 5 49.0 vs GPT-6 Sol 43.9
• τ-bench banking — Claude Opus 5 42.1
• SciCode — Claude Opus 5 56.4 vs GPT-6 Sol 57.6
• Long-context recall — Claude Opus 5 79.3 vs GPT-6 Sol 83.7
Dos filas van en sentido contrario y merecen mención, porque el agregado las oculta. GPT-6 Sol supera a Opus 5 en recuperación de contexto largo por 4,4 puntos y le saca una ligera ventaja en SciCode por 1,2. Así que la forma honesta no es «Opus 5 es mejor en todo» — es que Opus 5 está decisivamente por delante en los paneles de codificación y agénticos (una ventaja de 24 puntos en el Coding Index es una clase de resultado distinta), mientras que Sol mantiene la fila de recuperación sobre ventanas largas y empata en una de las dos medidas de código científico.
Una salvedad metodológica antes de que cualquiera de las dos cifras se cite en cualquier otro lugar: Artificial Analysis no garantiza que dos páginas de modelos se generen con la misma revisión del índice el mismo día, y divide sus grupos de pares: los modelos de pesos abiertos se clasifican frente a otros modelos de pesos abiertos de la misma clase de tamaño, y los modelos propietarios se clasifican dentro de una banda de precios propietaria. Ambos modelos aquí son propietarios, así que las dos cifras provienen del mismo lado de esa línea, pero trata las diferencias de menos de un punto como una orientación, no como una medición controlada. Cada cifra de proveedor que aparece aquí corresponde al propio proveedor evaluando su modelo frente a su predecesor y se etiqueta como tal.
Qué cambiaron los dos reemplazos
Claude Opus 5.5llegó el 22 de septiembre a $4.00 / $20.00 —más barato que Opus 5 en ambas tarifas, con una tarifa de entrada en caché de $0.20 que coincide con la de Sol— y obtiene 57.6 en el mismo Intelligence Index. Eso son 6.8 puntos por encima de Opus 5 por un 20% menos de dinero. Cualquier argumento para mantener Opus 5 en un nuevo desarrollo tiene que explicar por qué merece la pena quedarse en el checkpoint anterior a costa de 6.8 puntos de índice y $1.00/$5.00 por millón.
GPT-6.1 Sol llegó el 29 de septiembre al mismo $2.00 / $10.00 que GPT-6 Sol, con una puntuación de 51.8 en el índice frente a 47.6 de Sol, y con una tarifa de $0.10 por entrada en caché que reduce a la mitad la lectura en caché. Es el mismo precio con una mejor puntuación y mejores economías de caché. El único argumento a favor de GPT-6 Sol en concreto es el mismo que se aplica a Opus 5: una suite de regresión cuya línea base se estableció contra él, donde cambiar el modelo invalida las comparaciones en las que ya confías.
Hay una segunda razón, más discreta, por la que un equipo se queda con el par más antiguo, y no se trata de benchmarks. Ambos son los checkpoints con el historial de producción más largo a sus espaldas. Opus 5 se puede invocar desde el 24 de julio, y GPT-6 Sol desde el 22 de septiembre, y las mediciones del evaluador independiente sobre ambos llevan suficiente tiempo en marcha como para mostrar una forma en lugar de una sola lectura. Los últimos siete días de tráfico de Sol en nuestros propios datos de enrutamiento suman unos 2,1 millones de tokens; los de Opus 5 suman unos 23,0 millones. Es una ventana móvil, no un total histórico, y varían entre lecturas — pero son un recordatorio de que Opus 5 sigue haciendo trabajo real en producción incluso después de que se lanzara su reemplazo.
El perfil de latencia y coste, que es donde Sol se gana su lugar
• Tiempo medio hasta el primer token — GPT-6 Sol 6.785 ms frente a Claude Opus 5 4.652 ms
• Velocidad media de salida — GPT-6 Sol 179,6 tokens/s frente a Claude Opus 5 82,2 tokens/s
• Tráfico observado durante siete días por nuestra parte — GPT-6 Sol ~2,1M tokens, Claude Opus 5 ~23,0M tokens
Sol responde con su primer token aproximadamente 2,1 segundos después, pero luego transmite a más del doble de la velocidad de Opus 5. En una generación larga —del tipo de ejecución en que la salida es de miles de tokens en lugar de docenas—, ese segundo número domina, y un modelo barato que termina antes vale más de lo que sugiere su tarifa. En una llamada corta y sensible a la latencia, la cifra del primer token es la que percibe el usuario.
Ambas son mediciones de servicio de nuestro propio enrutamiento, tomadas durante una ventana móvil de siete días, y varían entre lecturas. Son útiles para comparar la forma de los dos modelos y no para citarlas como una expectativa de nivel de servicio.

Ejecutando el par mientras la migración sigue sin decidirse
La razón por la que vale la pena responder a esta comparación es que ninguna de las dos sustituciones es una decisión que se pueda adoptar sin más. Si tus evaluaciones se construyeron con Claude Opus 5, pasar a Opus 5.5 es volver a establecer la línea base, no una actualización; lo mismo ocurre con GPT-6 Sol frente a GPT-6.1 Sol. Lo útil que se puede hacer en ese lapso es ejecutar ambas generaciones en paralelo con tu propio tráfico en lugar de elegir a partir del tablero de otra persona.
Los cuatro modelos están en el mismo catálogo de OrcaRouter — Claude Opus 5, Claude Opus 5.5, GPT-6 Sol y GPT-6.1 Sol, a los que se accede mediante una única API que da servicio a más de 200 modelos, con el precio de lista del proveedor transferido sin margen (0 %), de modo que una bajada de precio del proveedor llega aquí el mismo día en lugar de en tu siguiente conciliación, lo que convierte la comparación en una cuestión de enrutamiento y no de compras. El DSL de enrutamiento te permite dividir por tamaño de solicitud o por porcentaje: envía una porción del tráfico de producción al checkpoint más reciente, compáralo con la línea base usando tus propias evaluaciones, amplía la porción cuando los números se mantengan y conserva el modelo anterior como respaldo hasta que lo hagan. Conmutación por error automática entre proveedores cubre el caso en el que una ruta se degrada a mitad de una migración, que es el modo de fallo que lleva a la gente a abandonar una migración a medio camino.


¿Quién debería elegir cuál, dado que ambos han sido reemplazados?
Si vas a empezar algo nuevo: ninguno de los dos. Claude Opus 5.5 es más barato que Claude Opus 5 y obtiene 6,8 puntos más, y GPT-6.1 Sol cuesta lo mismo que GPT-6 Sol con un mejor índice y una lectura en caché reducida a la mitad. La única razón para empezar con el par más antiguo es una dependencia estricta de un checkpoint que no puedes cambiar.
Si ya estás ejecutando uno de ellos: la decisión tiene que ver con tu suite de regresión, no con las placas. Claude Opus 5 sigue siendo el modelo de programación y agéntico más potente de los dos por un margen amplio, así que un pipeline de programación que sea estable con él debería compararse con Opus 5.5 en lugar de migrar lateralmente a un nivel de GPT-6. Un pipeline de gran volumen y sensible al costo sobre GPT-6 Sol tiene la actualización más fácil —mismo precio, mejor puntuación, mejor caché— y la razón honesta para retrasarlo es solo que aún no has vuelto a ejecutar tus evaluaciones.
Y si la respuesta que querías era simplemente cuál de los dos gana: Claude Opus 5 lo hace, en casi todas las tablas, por 2,5 veces el dinero. El argumento de GPT-6 Sol nunca fue que fuera mejor. Era que era lo bastante barato como para valer la pena la diferencia, y ese argumento ahora pertenece a GPT-6.1 Sol al mismo precio y con una mejor puntuación.
Comparados en este artículo3
Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario
