Tarjeta destacada titulada Claude Sonnet 5.5 vs GPT-6 Sol, con el subtítulo de que el nivel de $2 ahora tiene dos buques insignia, con píldoras que dicen mismo precio: $2 / $10, Índice 56 vs 47, y contexto de 1M vs 1.05M, y un pie de página que cita Artificial Analysis v4.3.2 y precios de proveedores.
Guides & Insights

Claude Sonnet 5.5 vs GPT-6 Sol: el nivel de $2 ahora tiene dos modelos insignia

Autor

Magnus Corvin

Fecha de publicación

Últimos modelos · 20Ver todos los modelos →
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

Claude Sonnet 5.5 y GPT-6 Sol tienen el mismo precio —2 dólares por millón de tokens de entrada y 10 dólares por millón de tokens de salida— y llegaron con seis días de diferencia a finales de septiembre de 2026. Esa coincidencia no es lo interesante. Lo interesante es que, cuando Artificial Analysis midió ambos con su Intelligence Index v4.3.2, el modelo de gama media de Anthropic quedó por delante del modelo que OpenAI ha vendido como su buque insignia: 56 para Claude Sonnet 5.5 frente a 47 para GPT-6 Sol. En esa misma revisión, Claude Sonnet 5 —el modelo al que reemplaza Sonnet 5.5— se sitúa en 38.

Así que esto ya no es una comparación de un nivel barato contra uno caro. Es una comparación de dos modelos al mismo precio, de dos laboratorios, con una diferencia de 18 puntos entre el de Anthro​pic y su propio predecesor, y una diferencia de nueve puntos a favor de Anthro​pic frente al lanzamiento de gama alta de Open​AI. Todo lo que sigue es un intento de determinar cuáles de esas brechas sobreviven al contacto con una carga de trabajo real, y cuáles son un artefacto de los benchmarks.

Lo que cada modelo realmente es

Claude Sonnet 5.5 es el segundo modelo de la generación 5.5 de Anthropic, lanzado el 28 de septiembre de 2026, cinco días después del lanzamiento de Claude Opus 5.5 que lo prometió. Lleva el id claude-sonnet-5-5 en la API de Claude, Amazon Bedrock, Google Cloud y Microsoft Foundry, conserva la ventana de contexto de 1M de tokens y el límite de salida de 128K de esta gama, y mantiene exactamente los precios de Claude Sonnet 5: $2 de entrada, $10 de salida, $0.20 por millón para lecturas de caché, $2.50 por una escritura de caché de cinco minutos. Está disponible con retención de datos cero desde el primer día, y el compromiso de retirada de Anthropic llega hasta el 28 de septiembre de 2027.

Two-column scoreboard for Claude Sonnet 5.5 and GPT-6 Sol across six rows. Left column Claude Sonnet 5.5: input $2.00 per million, output $10.00 per million, 1M-token context, AA Intelligence Index 56, cost per Index task $7.60, released September 28 2026. Right column GPT-6 Sol: input $2.00 per million, output $10.00 per million up to 272K then $4 / $15, 1,050,000-token context, AA Intelligence Index 47, cost per task not published, released September 22 2026. A footer line reads Index and cost per task per Artificial Analysis v4.3.2; prices per the vendors.

GPT-6 Sol es el sucesor del modelo confusamente llamado GPT-5.6 Sol — el que OrcaRouter todavía lista como accesible a $4 de entrada y $20 de salida, y que Artificial Analysis ha marcado desde entonces como obsoleto con una referencia a GPT-6 Sol. El nuevo modelo llegó el 22 de septiembre de 2026 a $2 / $10 con una ventana de contexto de 1,050,000 tokens, un límite de salida de 128K y una tarifa escalonada: la tarifa principal de $2 / $10 se aplica hasta 272,000 tokens de entrada, y todo lo que supere eso se factura a $4 / $15.

Ese último detalle es el primer punto en el que se rompe el planteamiento de «precios idénticos».

El empate de precios solo se cumple para prompts cortos

Ambas listas de tarifas indican $2 y $10, y casi todas las comparaciones del día del lanzamiento se detuvieron ahí. Compare las dos según los términos que deciden una factura:

• Tarifa principal — Claude Sonnet 5.5 $2 / $10 vs GPT-6 Sol $2 / $10

• Tarifa de contexto largo — Sonnet 5.5 cobra la ventana completa de 1M a la tarifa estándar; GPT-6 Sol se duplica a $4 / $15 por encima de 272,000 tokens de entrada

• Ventana de contexto — 1,000,000 tokens vs 1,050,000 tokens

• Salida máxima — 128K tokens en la API síncrona para ambas; Sonnet 5.5 alcanza 300K en la API de Message Batches tras la output-300k-2026-03-24cabecera

• Descuento por lote — 50 % de descuento en entrada y salida para Sonnet 5.5; consulta los términos actuales de OpenAI para Sol en lugar de asumir equivalencia

• Lecturas de caché — $0.20 por millón en ambos

Un barrido de repositorio de 800.000 tokens cuesta el doble por token en GPT-6 Sol que en Claude Sonnet 5.5, y esa es precisamente la carga de trabajo para la que se comercializan ambos modelos. Si tus prompts son cortos, las tarifas realmente son un empate y el precio no debería decidir nada. Si son largos, ya lo ha hecho.

El propio marcador de Anthropic, leído con atención

Anthropic publicó una comparación de cuatro columnas frente a Claude Sonnet 5, Claude Opus 5.5 y GPT-6 Sol. Las cifras reportadas por el proveedor, que ningún tercero ha reproducido aún:

Artificial Analysis model page for Claude Sonnet 5.5 (Adaptive Reasoning, Max Effort, Default Fallback), released September 2026, showing an Intelligence Index of 56, a price of $2.00 per million input tokens and $10.00 per million output tokens, a cost of $7.60 per Intelligence Index task, a verbosity of 410M output tokens against a median of 88M, and a 1M-token context window.

• Terminal-Bench 4.0 — Sonnet 5.5 70,6 % vs Sonnet 5 10,3 %

• FrontierCode 1.1, Principal — Sonnet 5.5 46,2 % con esfuerzo máximo, Sonnet 5 42,4 %, Opus 5.5 54,4 %, GPT-6 Sol 49,3 % Wait — decimal separator. Spanish uses comma. But the user said preserve? Not specified. Percentages with decimal: Spanish convention uses comma. However altering numbers could be risky. Localization engine typically localizes number formatting. Hmm, but "46.2%" is a data figure; converting to comma is standard Spanish localization. I'll go with comma. Actually maybe safer to keep exactly? The instruction says preserve URLs and brand/product names, no mention of numbers. Spanish localization would use comma. I'll keep comma version. But "Max effort" - "esfuerzo máximo" good. Also "at Max effort" -> "con esfuerzo máximo" good.

• CursorBench 4.0 — Sonnet 5.5 55,5 % frente a Sonnet 5 34,1 % frente a Opus 5.5 57,8 %

• GDPval-AA v2.1 — Sonnet 5.5 1844 vs Sonnet 5 1449 vs Opus 5.5 1846 vs GPT-6 Sol 1487

• AA-Briefcase v1.1 — Sonnet 5.5 1811 vs Sonnet 5 1359 vs Opus 5.5 1822 vs GPT-6 Sol 1483

• Humanity's Last Exam, con herramientas — Sonnet 5.5 64.5% vs Sonnet 5 54.9% vs Opus 5.5 67.7%

• OSWorld 2.1, parcial — Sonnet 5.5 80,1% vs Sonnet 5 57,0% vs Opus 5.5 81,8%

• Chartography, sin herramientas — Sonnet 5.5 61,6 % vs Sonnet 5 15,6 % vs Opus 5.5 64,4 % vs GPT-6 Sol 53,6 %

Dos de esas filas llevan notas al pie y ambas importan. Las cifras de GDPval-AA, AA-Briefcase y Chartography para GPT-6 Sol están señaladas por Anthropic como medidas después de una corrección de comprensión de imágenes por parte de OpenAI, y el número de FrontierCode para Sonnet 5.5 es su resultado de Max-effort, que, según señala Anthropic, quedó por debajo de su propio resultado Xhigh en la misma evaluación. Que un proveedor se compare con un rival en un benchmark que él mismo ejecuta, con notas al pie que matizan a ambas partes, no es evidencia neutral. Es la mejor evidencia disponible el día del lanzamiento, y no es lo mismo que una medición.

Lo que dicen los números independientes, y lo que no

Artificial Analysis ha publicado una primera ejecución independiente: Index 56 en v4.3.2, un costo de $7.60 por tarea de Index y una cifra de verbosidad de 410M tokens de salida frente a una mediana de 88M. Esa cifra de verbosidad merece más atención de la que está recibiendo. Significa que el modelo tiende a gastar una gran cantidad de tokens en el camino hacia una respuesta, y es el mecanismo detrás de la única afirmación de eficiencia que no proviene de la propia tabla de Anthropic.

Anthropic dice que Claude Sonnet 5.5 genera resultados un 30% más rápido que Claude Sonnet 5 y cuesta “hasta un 30% menos por tarea” a la misma tarifa por token. Esas dos afirmaciones juntas describen un modelo que hace el mismo trabajo con menos tokens, no una tarifa más barata. Que eso se sostenga es exactamente para lo que sirve una medición de verbosidad de 410 millones de tokens, y una sola ejecución independiente no basta para zanjarlo — pero sí basta para decir que la frase de marketing y el recuento de tokens medido apuntan en direcciones opuestas, y el medido es el que aparece en una factura.

Fíjate también en lo que el índice independiente aún no contiene. No existe ninguna replicación publicada de OSWorld, Terminal-Bench o CursorBench por parte de nadie que no sea Anthropic. Y el 56 es un compuesto: no dice nada sobre cuál de las diez evaluaciones que contiene impulsó la diferencia con el 47 de Sol. Una ventaja compuesta de nueve puntos puede ocultar una pérdida de quince puntos en la única evaluación de la que depende tu carga de trabajo.

Donde divergen de maneras que una tarjeta de tarifas no puede mostrar

El precio y la puntuación del índice son los dos ejes fáciles. Los que deciden una migración son los de comportamiento, y aquí los dos modelos no están ni cerca.

OrcaRouter model page for openai/gpt-5.6-sol, attributed to OpenAI and dated 2026-07-09, showing a 1M-token context window, 128K maximum output, text, image and file input, an input price of $4.00 and output price of $20.00 per million tokens, a p50 time to first token of 10.00 seconds, and OpenAI-compatible base URL https://api.orcarouter.ai/v1

Claude Sonnet 5.5 activa el pensamiento adaptativo de forma predeterminada con high como nivel de esfuerzo predeterminado, y elimina tres cosas que permitía la generación anterior: enviar thinking: {"type": "disabled"} ahora devuelve un 400 y debe reemplazarse por between_tools; el uso forzado de herramientas — tool_choice establecido en "any" o una herramienta con nombre — devuelve un 400 directamente; y la antigua computer_20251124 herramienta de uso de computadora se rechaza en la API de Claude y en Google Cloud en favor de un conjunto de herramientas. Los bloques de pensamiento también están ahora vinculados al modelo que los produjo, por lo que una conversación puede pasar de Claude Sonnet 5 a Claude Sonnet 5.5 y conservar su razonamiento, pero no puede volver a moverse hacia atrás con él.

Si tu bucle de agente establece tool_choice: "any" para forzar una llamada válida según el esquema, Claude Sonnet 5.5 rechazará la solicitud hasta que cambies a auto con uso estricto de herramientas o salidas estructuradas. Esa es una tarea de migración real, y es el tipo de cosa que convierte un simple cambio de ID de modelo en una tarde entera.

El costo de un cambio a GPT-6 Sol es de naturaleza distinta, porque el modelo al que reemplaza sigue en el catálogo y todavía se sigue invocando. GPT-5.6 Sol no se ha retirado; está obsoleto en Artificial Analysis, tiene el doble de precio que el nuevo modelo y sigue recibiendo tráfico. Las propias mediciones de OrcaRouter muestran que mueve aproximadamente 95 millones de tokens por semana, lo que es un indicador razonable de cuántas integraciones aún no han migrado. Pasarse a GPT-6 Sol es una decisión de precios que puedes tomar más adelante; no tienes que tomarla ahora.

Ejecutando la comparación en una clave

El problema práctico de una comparación entre dos proveedores es que normalmente cuesta dos cuentas, dos rutas de SDK y dos conjuntos de límites de frecuencia antes de aprender algo. OrcaRouter existe para reducir eso: un endpoint compatible con OpenAI, más de 200 modelos, precio de lista del proveedor traspasado sin margen de beneficio, y conmutación por error automática entre proveedores.

Ambos modelos que importan aquí se pueden enrutar en él hoy mismo. GPT-6 Sol está en el catálogo a $2 / $10 con el nivel de contexto largo intacto, y Claude Sonnet 5 —el modelo en el que todavía se ejecuta la mayor parte del tráfico de la API de Claude, con 150 tokens de salida por segundo medidos y un tiempo p50 hasta el primer token de unos cinco segundos— lleva en la plataforma desde el 30 de junio a los $2 / $10 propios de Anthropic.

Claude Sonnet 5.5 como tal todavía no está en nuestro catálogo. Si bien eso es cierto, la vía honesta para llegar a él es la propia API del proveedor y las tres nubes que Anthropic enumera, y la forma honesta de evaluarlo es dirigirlo hacia una porción de tráfico que puedas permitirte perder. Para eso está la capa de enrutamiento: promueve un porcentaje, observa la tasa de fallos y mantén el modelo anterior como respaldo en lugar de como plan de reversión.

¿Cuál pasa a producción?

Elige por la forma de la carga de trabajo en lugar de por una puntuación compuesta.

Claude Sonnet 5.5 es la mejor compra para el trabajo con contextos largos, para cualquier cosa ya escrita contra la superficie de uso de herramientas y uso de computadora de Anthropic, y para equipos cuyos prompts superan habitualmente un cuarto de millón de tokens: la ventana de tarifa fija vale más ahí que cualquier delta de índice. Acepta que la migración trae consigo una lista de verificación: uso forzado de herramientas, el interruptor de pensamiento, los emparejamientos con la herramienta advisor y un cambio en la herramienta de uso de computadora.

GPT-6 Sol es la opción de continuidad más segura para un stack con la forma de OpenAI, y la más económica si tus prompts son cortos y tus integraciones ya están construidas. Su ventaja no es la capacidad —en la métrica compuesta queda por detrás—, sino que su predecesor sigue prestando servicio y la migración no tiene fecha límite.

Con los números disponibles hoy, Claude Sonnet 5.5 gana el cara a cara en el índice independiente y en la economía de contexto largo, y no pierde en nada que cualquier medición publicada sea aún capaz de detectar más allá de la confianza de la propia tabla del proveedor. Esa es una afirmación más limitada que la que hace el material de lanzamiento, y es la que vale la pena tomar en cuenta.

Lo que cambiaría la respuesta es una segunda ejecución independiente en las evaluaciones agénticas, y una cifra publicada de tokens por tarea para ambos modelos en las mismas tareas. Hasta que ambas existan, el índice compuesto es una ventaja de nueve puntos para el modelo más económico de ejecutar, y una ventaja compuesta de nueve puntos no es lo mismo que una ventaja de nueve puntos en tu carga de trabajo.

Comparados en este artículo3

Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario