
GPT-6 Sol Pro vs. Claude Opus 5: la escala de esfuerzo que nadie pone en la tabla
- openaiNUEVOOpenAI: GPT-6 Luna2026-09-2237Inteligencia
- openaiNUEVOOpenAI: GPT-6 Sol2026-09-2248Inteligencia
- anthropicNUEVOAnthropic: Claude Opus 5.52026-09-2258Inteligencia
- grokNUEVOGrok 4.72026-09-2146Inteligencia
- OrcaNUEVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens
- orcaNUEVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens
- deepseekNUEVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligencia72Código
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligencia76Código
GPT-6 Sol Pro y Claude Opus 5 se comparan constantemente entre sí, y casi siempre con la configuración equivocada. La comparación que circula es Claude Opus 5 en su máximo esfuerzo de razonamiento frente a GPT-6 Sol Pro en su máximo esfuerzo de razonamiento, lo que produce una brecha de tres puntos en el índice neutral y una diferencia de costos de cinco veces. Configura ambos modelos con la configuración que sus propios proveedores distribuyen como predeterminada —y recuerda que “Pro” en el primer nombre es una configuración de razonamiento, no un modelo aparte— y la brecha de tres puntos desaparece por completo. Lo que queda es la diferencia de costos, y es la única parte de la historia que sobrevive al contacto con una factura de producción.
Esto no es un truco de presentación. Es la consecuencia directa de dos escalas de esfuerzo que no están calibradas entre sí, publicadas por dos proveedores que se comparan con los modelos más antiguos del otro.
Qué son realmente los dos modelos, antes de cualquier comparación
GPT-6 Sol es el modelo de razonamiento de gama media de OpenAI, disponible de forma general desde el 22 de septiembre de 2026, a 2,00 $ por millón de tokens de entrada y 10,00 $ por millón de tokens de salida. No existe ningún identificador de modelo gpt-6-sol-pro en la documentación para desarrolladores de OpenAI: la página incluye una única entrada de Sol, una ventana de contexto de 1.050.000 tokens, una entrada máxima de 922.000 tokens, un límite de salida de 128.000 tokens, una fecha de corte de conocimiento del 20 de abril de 2026 y una escala de esfuerzo de razonamiento que abarca none, low, medium, high, xhigh y max, con medium como valor predeterminado. «Pro» es un valor del modo de razonamiento, el mismo patrón de alias que estableció la generación GPT-5.6 y que esta heredó. Sí existe una entrada de catálogo de terceros llamada GPT-5.6 Sol Pro, y ahora indica 2,00 $ y 10,00 $ —las cifras de GPT-6 Sol—, lo que constituye un artefacto de nomenclatura, no un producto.
Claude Opus 5 es un modelo real de Anthropic con precio independiente, disponible de forma general desde el 24 de julio de 2026 a $5.00 de entrada y $25.00 de salida por millón de tokens. Su ventana de contexto es de 1,000,000 de tokens, su límite de salida síncrona es de 128,000, y su propia escala de esfuerzo —output_config.effort— abarca low, medium, high, xhigh y max, con high como valor predeterminado. El pensamiento es adaptativo y está activado de forma predeterminada, algo inédito en la familia Opus.
Un dato más que condiciona todo lo que sigue, y que ninguna página de comparación existente recoge: la propia tabla de ciclo de vida de Anthropic incluye Claude Opus 5 como Activo (heredado), con un aviso de migración que apunta a Claude Opus 5.5, que alcanzó la disponibilidad general el 22 de septiembre de 2026 a $4.00 y $20.00. Los gráficos de lanzamiento de OpenAI siguen tomando como referencia Opus 5, no 5.5. El modelo que aparece en la comparación es el Opus de la generación anterior.
Las dos líneas de precio, línea por línea
Ambas son listas de proveedores: las cifras publicadas por OpenAI y Anthropic, transmitidas sin cambios por las plataformas que las alojan.
• Entrada: GPT-6 Sol $2.00 por millón de tokens frente a Claude Opus 5 $5.00 por millón de tokens
• Salida — GPT-6 Sol $10.00 por millón de tokens vs Claude Opus 5 $25.00 por millón de tokens
• Lectura de caché — GPT-6 Sol $0.20 por millón de tokens frente a Claude Opus 5 $0.50 por millón de tokens; en ambos casos, un 10 % fijo de la tarifa de entrada sin caché
• Escritura de caché — GPT-6 Sol $2.50 por millón de tokens con un único TTL frente a Claude Opus 5 $6.25 con un TTL de cinco minutos y $10.00 con un TTL de una hora; el TTL más largo es una opción que OpenAI no ofrece, y es el nivel que la mayoría de las tablas comparativas cita por error, porque es el que aparece en las tarjetas del catálogo alojado
• Manejo de contexto largo — GPT-6 Sol vuelve a tarificar una solicitud por encima de su umbral de entrada a una tarifa más alta para toda la solicitud; Claude Opus 5 no aplica ningún recargo por contexto largo, por lo que una solicitud de 900.000 tokens se factura a la misma tarifa por token que una de 9.000 tokens
• Por lotes — GPT-6 Sol tiene un endpoint por lotes con descuento estándar, frente a la API Message Batches de Claude Opus 5, que ofrece un 50 % de descuento en ambas direcciones, y el descuento por lotes de Anthropic se acumula con el almacenamiento en caché de prompts
• Ventana de contexto — GPT-6 Sol 1.050.000 tokens vs Claude Opus 5 1.000.000 tokens
• Salida máxima — 128.000 tokens para ambos, y Claude Opus 5 la eleva a 300.000 en la API de Message Batches con el encabezado beta output-300k-2026-03-24
El conjunto de procesamiento por lotes más almacenamiento en caché es la partida menos comentada de esta lista y la que más cambia los cálculos. Un descuento por lotes del 50 % que se combina con una lectura de caché a una décima parte de la tarifa de entrada es una oferta distinta de un descuento por lotes del 50 % por sí solo, y en el caso de trabajos de síntesis largos —donde también se aplica el límite de salida por lotes de 300.000 tokens de Anthropic— cierra una parte significativa de una brecha que a precio de tarifa parece insalvable.

La escalera del esfuerzo es la verdadera comparación
Este es el número que debería aparecer en cada uno de estos artículos. En Artificial Analysis, cuyo arnés de evaluación es el único neutral que publica una escala completa de niveles de esfuerzo para ambos modelos, Claude Opus 5 obtiene 51 con esfuerzo máximo y cuesta $5.86 por tarea de índice. En su ajuste alto predeterminado obtiene 48 y cuesta $3.61. GPT-6 Sol obtiene 48 con esfuerzo máximo y cuesta $1.06 — y 43 con esfuerzo alto por $0.37.
Lee esas dos líneas juntas. Claude Opus 5 ejecutándose en el nivel de esfuerzo que Anthropic distribuye como predeterminado alcanza exactamente la misma puntuación de índice que GPT-6 Sol ejecutándose a máxima potencia. La brecha que reportó la cobertura del lanzamiento —tres puntos— solo existe si comparas cada modelo en el tope de su propia escala, y el tope de la escala no es donde se ejecuta ninguno de los dos modelos de forma predeterminada. La ventaja de Opus 5 a máximo esfuerzo es real y cuesta aproximadamente cinco veces y media más por tarea completada obtenerla.
Dos advertencias de honestidad deberían acompañar a esas cifras, y ambas faltan en las páginas que las citan.
La versión del índice cambia. La puntuación de Opus 5 se ha publicado como 61, 63, 54 y 51 a lo largo de sucesivas revisiones del índice de Artificial Analysis desde julio. Ninguna de esas cifras es incorrecta; todas son incorrectas sin su etiqueta de versión. El 51 de arriba es la clasificación actual, y no es comparable con un 61 citado de un artículo del día del lanzamiento.
• Las escalas de esfuerzo no están calibradas entre proveedores. Un «high» en un modelo no implica la misma cantidad de pensamiento que un «high» en el otro. Que las puntuaciones coincidan en configuraciones nominalmente diferentes es evidencia sobre el costo, no sobre una equivalencia de capacidades.
Donde el registro independiente es más endeble de lo que parece
Claude Opus 5 tiene ocho semanas de medición de terceros a sus espaldas y un conjunto de cifras de lanzamiento reportadas por el proveedor que están claramente etiquetadas como tales: Frontier-Bench v0.1 con 43,3 %, ARC-AGI-3 con 30,2 %, GDPval-AA v2 con 1.861 Elo. Todas y cada una de ellas se midieron contra GPT-5.6 Sol o Claude Fable 5, no contra GPT-6 Sol. No hay ningún resultado de arnés compartido que ponga a Opus 5 y GPT-6 Sol cara a cara en los propios benchmarks de Anthropic, y la tarjeta de sistema de Anthropic admite que el modelo no es más capaz en general que Claude Fable 5.
El historial independiente también conlleva una advertencia en la dirección opuesta. En la evaluación AA-Omniscience de Artificial Analysis, la tasa de alucinación de Opus 5 es del 50%, catorce puntos más que la de Opus 4.8 —siendo la causa documentada que las negativas cayeron de aproximadamente el 23% al 7%, de modo que el modelo responde más preguntas y se equivoca en más de ellas—. Vals AI reveló por separado que Opus 5 y Fable 5 utilizaron Opus 4.8 como respaldo de negativas durante las ejecuciones de Terminal-Bench; reclasificar los nueve casos aprobados afectados como fallos desplaza a Opus 5 del 84,64% al 81,27%. Estos hallazgos no son descalificantes, pero un artículo que sostenga que Opus 5 es la opción más fiable necesita incluirlos.

El historial independiente de GPT-6 Sol es, esta semana, tan solo un número: la puntuación del índice anterior, medida con el máximo esfuerzo, con dieciocho meses de lanzamientos de modelos a sus espaldas en pruebas acumuladas de terceros. Esa asimetría —ocho semanas de escrutinio frente a un día— es la razón honesta por la que un comprador todavía podría pagar la prima quíntuple, y es una razón mejor que el titular de tres puntos.
Donde una capa de enrutamiento cambia la decisión
Claude Opus 5 está en OrcaRouter, cuyo catálogo tiene $5.00 de entrada, $25.00 de salida, una lectura de caché de $0.50 y una escritura de caché de $10.00 por millón de tokens, con una ventana de 1,000,000 de tokens, un límite de salida de 128,000 tokens y ambos endpoints /v1/chat/completions y /v1/messages — precios de lista del proveedor pasados directamente sin ningún recargo adicional, por lo que un cambio de precio de Anthropic está vigente en nuestro lado el mismo día que en el suyo. La cifra de escritura de caché de la ficha del modelo es la tarifa de TTL de una hora; el nivel de cinco minutos de Anthropic es $6.25, y citar uno sin decir cuál es como los dos números terminan pareciendo una contradicción.
GPT-6 Sol no es una de nuestras rutas, así que nada de lo que aparece aquí constituye una afirmación sobre su precio a través de nosotros.

Lo que un único endpoint realmente aporta en esta comparación es la capacidad de sostener ambas respuestas a la vez. El argumento a favor de Opus 5 y el argumento a favor de Sol dependen ambos del esfuerzo, y el esfuerzo es un parámetro por solicitud, no un contrato. Un equipo que enruta ambos modelos detrás de una sola clave con conmutación automática por error puede enviar el trabajo que necesita el techo de máximo esfuerzo de Opus 5 a Opus 5 y el nivel de volumen a Sol con esfuerzo medio, sin una segunda integración ni un segundo conjunto de límites de velocidad. El DSL de enrutamiento integra esa decisión en la llamada en lugar de en un proyecto de migración, lo cual importa aquí específicamente, porque la respuesta correcta para este par cambia con la solicitud, no con el trimestre.
La regla de decisión
• Trabajo en volumen con un estándar de calidad conocido — GPT-6 Sol con esfuerzo medio o alto. Cuarenta puntos de índice a $0,25 por tarea es la línea creíble más barata de este tablero, y el dial de esfuerzo es un parámetro documentado, no una conjetura.
• Trabajo que necesita lo más alto del rango de capacidades y puede pagarlo — Claude Opus 5 en xhigh o max. Tres puntos de índice por encima del techo de Sol, a $4,88–$5,86 por tarea, y el único de los dos con un límite de salida por lote de 300.000 tokens.
• Trabajos por lotes de gran corpus: Claude Opus 5, por el argumento estructural más que por el de costo por token. Sin recargo por contexto largo, un descuento por lotes que se acumula con el almacenamiento en caché, y un TTL de caché de una hora para prefijos que superan una ventana de cinco minutos.
• Cualquier cosa donde una respuesta incorrecta salga cara — ninguno de los dos, según los datos actuales. La tasa de alucinación de Opus 5 subió catorce puntos en esta versión, y el historial de terceros de Sol se reduce a un único dato.
• Si la comparación que te mostraron fue «Opus 5 max frente a Sol max», vuelve a ejecutarla con el esfuerzo predeterminado antes de decidir. Ahí es donde se toma realmente la decisión, y es la única configuración que la cobertura existente nunca te muestra.
Comparados en este artículo2
Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario
