Tarjeta de título principal para Claude Opus 5.5 vs GPT-5.6 Sol, con el encabezado «Dos tablas de lanzamiento que apenas se superponen», con insignias que dicen $4.00 vs $5.00, 66.4% vs 37.3%, y fecha de corte jun vs feb, y el logotipo de OrcaRouter en la esquina inferior derecha.
Guides & Insights

Claude Opus 5.5 vs GPT-5.6 Sol: dos tablas de lanzamiento que apenas se solapan

Autor

Rowan Sterling

Fecha de publicación

Últimos modelos · 20Ver todos los modelos
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

Pon Claude Opus 5.5 y GPT-5.6 Soluno al lado del otro esta semana y lo primero que notas no es un ganador. Es que los dos proveedores publicaron tablas de referencia que apenas comparten una fila. El material de lanzamiento de Claude Opus 5.5, publicado el 22 de septiembre de 2026, lo sitúa 29 puntos por delante de GPT-5.6 Sol en Terminal-Bench 4.0. El material de lanzamiento de Sol, disponible de forma general desde el 9 de julio de 2026, lidera en cambio con Terminal-Bench 2.1, donde Sol Ultra obtuvo un 91,9 %, y el Artificial Analysis Coding Agent Index, donde alcanzó el primer puesto con 80. Ambas tablas son reales. Ambas fueron ejecutadas por el proveedor que gana en ellas. La pregunta útil no es qué modelo es mejor en abstracto — es qué benchmark, ejecutado bajo el arnés de quién, te dice algo sobre tu carga de trabajo. Esa es una pregunta más difícil de la que cualquiera de las publicaciones de lanzamiento quiere que hagas, y es aquella en torno a la cual se construye esta comparación.

Los dos modelos, uno al lado del otro

A two-column scoreboard for Claude Opus 5.5 and GPT-5.6 Sol. Left column: price $4.00 / $20.00, 1M-token context, knowledge cutoff June 2026, Terminal-Bench 4.0 66.4%, FrontierCode v1.1 54.4%, GDPval-AA 1846 Elo. Right column: price $5.00 / $30.00, 1M-token context, knowledge cutoff February 16 2026, Terminal-Bench 2.1 91.9% Ultra, FrontierCode v1.1 47.5%, GDPval-AA 1588 Elo. A sourcing footer notes the Opus rows are vendor-reported by Anthropic and the Sol rows come from OpenAI's launch material.

• Proveedor — Anthropic vs OpenAI

• Publicado — Claude Opus 5.5 el 22 de septiembre de 2026 vs. GPT-5.6 Sol el 9 de julio de 2026

• Precio por millón de tokens — $4.00 de entrada / $20.00 de salida vs $5.00 de entrada / $30.00 de salida

• Lectura de caché — $0.20 por millón en Opus 5.5; la tarifa de caché de Sol se establece por plataforma y no se publica en una única cifra comparable

• Ventana de contexto — 1M tokens en ambos

• Salida máxima — 128K tokens en ambos, con 300K en la API Batch de Anthropic detrás de un encabezado beta

• Fecha límite de conocimiento — junio de 2026 para Opus 5.5 vs 16 de febrero de 2026 para Sol

• Control de razonamiento — pensamiento adaptativo siempre activo, por defecto medio de esfuerzo; la escala va de bajo a máximo frente a un ajuste de esfuerzo de razonamiento máximo, además de un modo Ultra que coordina subagentes paralelos

• Gama — Opus 5.5 es el primero de una familia 5.5, con Sonnet 5.5 y Haiku 5.5 prometidos para las próximas semanas, frente a Sol como el buque insignia de una familia de tres niveles junto con Terra y Luna

Dos de esas filas hacen más trabajo que el resto. La brecha de la fecha de corte de conocimiento es de cuatro meses, lo que importa si tus prompts tocan algo que ocurrió esta primavera. Y Opus 5.5 ahora tiene precios inferiores a Sol tanto en el precio de entrada como en el de salida — un giro respecto a hace tres meses, cuando Sol era la forma más económica de alcanzar resultados de nivel frontera y Claude Opus 5 estaba en $5/$25.

Las únicas filas donde ambos modelos aparecen realmente

Existe exactamente una tabla publicada que contiene ambos modelos, y es la de Anthropic. Todas las cifras que figuran en ella están reportadas por el proveedor, es decir, producidas por la empresa que vende uno de los dos modelos:

• Terminal-Bench 4.0 — Claude Opus 5.5 66,4 % frente a GPT-5.6 Sol 37,3 %

• Terminal-Bench-Science 0.1 — 58,7 % frente a 22,4 %

• FrontierCode v1.1 (Principal) — 54,4 % vs 47,5 %

• CursorBench 4.0 — 57,8 % frente a 41,7 %

• AutomationBench — 40,0 % vs 28,8 %

• GDPval-AA v2.1 — 1846 Elo vs 1588

Eso es una barrida completa, y los márgenes de las dos filas de Terminal-Bench son lo bastante amplios como para merecer escrutinio en lugar de aceptación. La propia nota al pie de Anthropic hace parte de ese trabajo por ti: la ejecución de Terminal-Bench con Opus 5.5 usó el nivel de esfuerzo xhigh en lugar del predeterminado, y con el nivel de esfuerzo medium predeterminado la ventaja de FrontierCode se reduce a 54,6 % frente a 47,5 %, una diferencia de siete puntos en lugar de las cifras destacadas. Anthropic también añade una advertencia general a toda la tabla, diciendo que, en este nivel de capacidad, los márgenes de los benchmarks son «una guía menos fiable de las diferencias del mundo real» y que su brecha interna con Claude Fable 5.1 es más estrecha de lo que sugieren las puntuaciones. Que un proveedor reste importancia a su propia tabla es la frase más digna de confianza que contiene.

Observa también lo que falta en esa tabla: cualquier benchmark en el que gane el modelo de OpenAI. Una tabla de un proveedor que solo contiene filas favorables no es prueba de una barrida; es prueba de selección de filas.

Lo que dicen los propios números de OpenAI

El material de lanzamiento de Sol cuenta otra historia, con otros benchmarks, en otro arnés de pruebas. Lo reportado en su lanzamiento de julio:

• Terminal-Bench 2.1 — 91.9% para Sol Ultra y 88.8% para Sol estándar, frente a Claude Mythos 5 con 88.0% y Claude Fable 5 con 84.3%

• Artificial Analysis Coding Agent Index — 80, descrito en su momento como un estado del arte 2,8 puntos por encima de Claude Fable 5

• Agents' Last Exam, flujos de trabajo profesionales de larga duración — 53,6, que OpenAI reportó como 13,1 puntos por delante de Claude Fable 5

• BrowseComp — 92,2 %; OSWorld 2.0 — 62,6 %; SWE-Bench Pro — 64,6 %

Ninguna de esas filas incluye Claude Opus 5.5, porque no existía en julio. La tabla de Sol se construyó para vencer a Fable 5 y Mythos 5, y lo logra. Que supere o no a Opus 5.5 simplemente no lo responde el material de ninguno de los dos proveedores: las dos tablas se armaron con dos meses de diferencia y contra oponentes distintos.

La fila de SWE-Bench Pro merece una nota específica, porque es el único punto en el que el material de lanzamiento de OpenAI muestra a su modelo perdiendo: 64,6 % para Sol frente al 80 % de Claude Fable 5. OpenAI respondió cuestionando la validez del benchmark, estimando que alrededor del 30 % de sus tareas están defectuosas. Bien puede ser cierto. También es un recordatorio útil de que «este benchmark es defectuoso» es una afirmación que ambos laboratorios hacen, y siempre sobre el benchmark en el que pierden.

El problema del arnés, que la tabla de nadie resuelve.

Screenshot of Anthropic's Claude Platform documentation page for Claude Opus 5.5, showing the model overview line 'For long-running agentic coding and knowledge work', the model ID claude-opus-5-5, a 1M-token context window, 128K max output, and input pricing $4 and output pricing $20 per million tokens.

La razón por la que las dos tablas no concuerdan no es que un proveedor esté mintiendo. Es que los benchmarks de codificación agéntica miden un modelo más un andamiaje, y los andamiajes difieren. Terminal-Bench 4.0 y Terminal-Bench 2.1 son revisiones diferentes de la misma idea, ejecutadas por personas diferentes, con presupuestos de herramientas diferentes y reglas de reintento diferentes. Los números de Opus 5.5 de Anthropic se produjeron en el arnés de Anthropic; los números de Sol de OpenAI, en herramientas de estilo Codex. Mueve cualquiera de los dos modelos al arnés del otro y las puntuaciones cambian.

Datos independientes, allí donde existen, describen una contienda más reñida que cualquiera de las dos tablas. Una evaluación de referencia de un tercero de agosto de 2026, ejecutada con varios modelos en trabajo de aplicaciones reales, nombró a GPT-5.6 Sol la mejor combinación de precisión, costo y velocidad —unos $0.52 y cinco minutos por ejecución—, mientras que Claude Opus 5, no 5.5, fue el más preciso, con un 92% de las ejecuciones. Una clasificación aparte centrada en tareas de código empresarial situó a Claude Opus 5 en primer lugar con un 96.4% y a GPT-5.6 Sol en tercero con un 86.5%, comparando de nuevo a Sol con el Opus anterior en lugar del nuevo. Ninguna es una comparación directa con Opus 5.5, y ninguna resuelve nada. Lo que sí establecen es que, cuando alguien distinto de un proveedor realiza la comparación, los márgenes se vuelven pequeños.

La conclusión práctica es dejar de leer las tablas como una clasificación y empezar a leerlas como una lista de hipótesis. Si tu trabajo es automatización de terminal de horizonte largo, la brecha de Anthropic en Terminal-Bench es una hipótesis que vale la pena probar en tus propias tareas. Si se trata de investigación profesional de varios pasos, el resultado de Agents' Last Exam de Sol es el mismo tipo de hipótesis. Ninguno de los dos números se traslada a tu carga de trabajo sin una ejecución.

Coste por tarea finalizada, que es el único coste que importa

En la lista de precios, Claude Opus 5.5 ahora es más barato en ambos sentidos: $4.00 frente a $5.00 en entrada, $20.00 frente a $30.00 en salida, y una tarifa de lectura de caché de $0.20 que es un 60 % inferior a lo que cobraba Claude Opus 5. Para un agente que reenvía un prompt de sistema largo en cada turno, esa línea de caché es el costo dominante y la razón por la que una sesión de larga duración puede resultar sustancialmente más barata sin ningún cambio en el prompt.

Pero el precio por token nunca ha decidido la factura de un agente. El argumento de OpenAI a favor de Sol en su lanzamiento se basó en la eficiencia de tokens más que en el precio de lista: informó una mejora del 54 % en la eficiencia de tokens para programación, con tokens de salida y tiempo transcurrido por debajo de la mitad de los de Claude Fable 5, a un costo aproximadamente un tercio menor. Anthropic presenta el argumento especular para Opus 5.5: un costo de ejecución alrededor de un 40 % menor en cargas de trabajo típicas que Claude Opus 5, con una tarifa que solo bajó un 20 %, y con declaraciones de clientes de Box, Kiro, Factory y GitHub que citan grandes reducciones en tokens o pasos. Ambas afirmaciones apuntan en la misma dirección —el modelo que termina en menos turnos gana— y ninguna ha sido auditada de forma independiente.

Donde existen cálculos independientes de coste por tarea, actualmente favorecen a Sol: un análisis publicado en septiembre situó a GPT-5.6 Sol en 1,56 $ por problema resuelto en SWE-bench Verified, con un 96,2 % de éxito, frente a Claude Opus 4.8, con un 88,6 %. Eso es Sol medido frente a un modelo de Anthropic más antiguo, no frente a Opus 5.5, así que es un punto de partida más que un veredicto, pero es un recordatorio de que un modelo que resuelve el problema al primer intento es más barato que un modelo más barato que necesita tres pasadas. La única medición que zanja esto para ti es tu propia tarea, ejecutada de ambas formas, con los recuentos de tokens delante de ti.

Eso es más un problema de enrutamiento que de compras, y vale la pena ser precisos sobre qué parte de él ya tiene solución. GPT-5.6 Sol ya está en OrcaRouter al precio de lista del propio OpenAI con un 0 % de recargo —el precio de lista del proveedor se transfiere tal cual, así que un cambio de tarifa del proveedor se aplica en nuestro lado el mismo día en lugar de después de una sincronización. Claude Opus 5.5 todavía no es una de nuestras rutas; está disponible a través de la propia API de Anthropic y de las principales nubes. Cuando llegue, la misma clave sirve para ambos, y eso es lo que convierte el experimento en una regla de enrutamiento en lugar de un segundo contrato y un segundo SDK: envía la carga de trabajo al modelo que favorezcan tus propios números, mantén la conmutación por error automática apuntando al otro, y deja que una línea del DSL de enrutamiento decida por solicitud en lugar de por trimestre. Una bajada de precios en cualquiera de los dos lados es un cambio de configuración, no una migración.

Screenshot of the OrcaRouter model page for GPT-5.6 Sol (openai/gpt-5.6-sol), showing the model header, the Vision, Tools, JSON and Reasoning capability tags, and the attribution 'by OpenAI - 2026-07-09'.

Donde los dos realmente difieren

Elimina los benchmarks y quedan cuatro diferencias, todas verificables:

• Fecha de corte de conocimiento. Junio de 2026 para Opus 5.5 frente al 16 de febrero de 2026 para Sol. Cuatro meses son una diferencia real para cualquier cosa que tenga que ver con bibliotecas recientes, eventos recientes o API modificadas recientemente, y ningún benchmark lo captura.

• Enrutamiento de salvaguardas. Opus 5.5 llega con salvaguardas de la clase de Fable 5.1: la mayoría de las solicitudes de ciberseguridad se redirigen a Claude Opus 4.8 y el trabajo de biología recurre a Claude Opus 5 a menos que la cuenta esté verificada. Si tu producto se encuentra en cualquiera de esos dos ámbitos, parte de tu tráfico está siendo respondido por un modelo más pequeño. Sol no cuenta con un enrutamiento documentado equivalente, aunque OpenAI sí menciona sus propias evaluaciones de seguridad relacionadas con la ciberseguridad.

• Orquestación. Sol ofrece un modo Ultra que coordina varios subagentes en paralelo, cuatro por defecto, y un ajuste de esfuerzo de razonamiento máximo. Opus 5.5 no tiene ninguna de las dos cosas como función de plataforma; su palanca es el parámetro de esfuerzo, y la composición multimodelo es algo que uno mismo construye o enruta, en lugar de algo que el proveedor te entregue.

• Economía de la familia. Sol es uno de los tres niveles, con Terra y Luna por debajo — y el precio de Luna se redujo un 80 % y el de Terra, un 20 % en una actualización del 30 de julio. Los hermanos más baratos de Anthropic, Sonnet 5.5 y Haiku 5.5, están anunciados pero no se han lanzado. Si tu carga de trabajo es mixta, OpenAI actualmente ofrece los niveles más baratos hoy.

Elegir entre ellos

Elige Claude Opus 5.5 si tu trabajo es de larga duración, ya sea codificación agéntica o trabajo de conocimiento, si el precio por token importa, si tus prompts abordan algo de los últimos cuatro meses, o si un contexto de 1M de tokens a $0.20 por millón en caché es lo que hace que tu arquitectura sea asequible. Empieza con esfuerzo medio, no con la configuración alta heredada, y mide si el nivel bajo está a la altura.

Elige GPT-5.6 Sol si quieres un modo de orquestación incluido por el proveedor, si necesitas hoy un nivel más económico por debajo del buque insignia en lugar de dentro de unas semanas, o si tu carga de trabajo es del tipo que la propia evidencia de lanzamiento de Sol cubre mejor: flujos de trabajo profesionales de largo horizonte y uso de ordenador, donde reportó sus resultados más sólidos.

Si ya usas Claude Opus 5, ten en cuenta que Opus 5.5 no es una sustitución directa: el pensamiento ya no se puede desactivar, el uso forzado de herramientas devuelve un error, los bloques de pensamiento están vinculados al modelo y a la conversación, y la antigua computer_20251124herramienta de uso de computadora no se acepta en la API de Claude ni en Google Cloud. Las tres primeras también se aplican a Claude Fable 5.1. Cambiar a Sol es una integración completamente distinta.

Lo que realmente resolvería esta comparación es una única ejecución independiente de ambos modelos con el mismo esfuerzo, en un entorno de pruebas equivalente, sobre el mismo conjunto de tareas. A fecha de esta semana, nadie ha publicado ninguna. Hasta que alguien lo haga, la postura honesta es la que respaldan las pruebas: la tabla de Anthropic favorece a Opus 5.5 y fue producida por Anthropic; la tabla de OpenAI favorece a Sol y fue producida por OpenAI; los resultados independientes que existen comparan a Sol con el Opus anterior y describen una contienda mucho más reñida; y las dos filas que decidirán tu factura —tokens por tarea finalizada y volumen de lectura de caché— son las dos filas que ningún proveedor publica.

Comparados en este artículo4

Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario