
GPT-6.1 Sol vs Claude Opus 5.5: Una brecha real, distribuida de forma desigual
- openaiNUEVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligencia
- anthropicNUEVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligencia
- typesafeNUEVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 143 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Inteligencia
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Inteligencia
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Inteligencia
- xAIGrok 4.72026-09-2146Inteligencia
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 79 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 293 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
La brecha de 5,8 puntos entre Claude Opus 5.5 y GPT-6.1 Sol en el Artificial Analysis Intelligence Index es la mayor de cualquier pareja de este conjunto y, a diferencia de la mayoría de ellas, no se cerrará con un cambio de configuración. Claude Opus 5.5, lanzado el 22 de septiembre de 2026 y con un precio de 4,00 $ por millón de tokens de entrada y 20,00 $ por millón de tokens de salida, obtiene 57,6. GPT-6.1 Sol, lanzado el 29 de septiembre de 2026 a 2,00 $ y 10,00 $, obtiene 51,8. Claude Opus 5.5 es el modelo con mayor puntuación por un margen mayor que el que separa a la mayoría de los modelos de frontera entre sí, y cuesta 8,3 veces más por tarea llegar hasta ahí: 5,98 $ frente a 0,72 $. Hasta ahora, el modelo caro simplemente gana, que es la versión menos interesante de esta comparación. Lo que hace que valga la pena leerla es que los 5,8 puntos no se reparten de manera uniforme por el conjunto de pruebas: en el único eje que decide la mayor parte del trabajo con documentos largos y sesiones largas, los dos modelos están a menos de dos puntos de distancia entre sí.
Ambos son modelos insignia en el mismo nicho de mercado: ventanas de contexto de clase 1M, techos de salida de 128K, entrada de texto, imágenes y archivos, pensamiento extendido en un lado y una escala de esfuerzo de cinco niveles en el otro. Claude Opus 5.5 sucede a Claude Opus 5 y está posicionado para razonamiento exigente, programación y trabajo agéntico de horizonte largo; GPT-6.1 Sol se sitúa un nivel por debajo de GPT-6 Astra y está posicionado para programación agéntica, uso de computadoras y trabajo profesional con gran carga documental. Están orientados a los mismos trabajos. La medición dice que no son igual de buenos en todos ellos.
Dónde se encuentran realmente los 5.8 puntos
Un índice compuesto oculta sus componentes. Extrae las evaluaciones individuales y la brecha deja de parecer una brecha y empieza a parecer un perfil.
• Humanity's Last Exam — Claude Opus 5.5 61,4% frente a GPT-6.1 Sol 52,9%, una diferencia de 8,5 puntos en razonamiento abstracto
• SciCode — Claude Opus 5.5 66,9 % frente a GPT-6.1 Sol 54,2 %, una diferencia de 12,7 puntos en código de nivel investigación
• Recuperación de contexto largo — Claude Opus 5.5 84,7 % frente a GPT-6.1 Sol 83,0 %, una diferencia de 1,7 puntos al recuperar hechos de una entrada larga
• Terminal-Bench 4.0 — Claude Opus 5.5 59,6 % frente a una cifra de Sol no publicada en la misma revisión
• Ventana de contexto — GPT-6.1 Sol 1.050.000 tokens frente a Claude Opus 5.5 1.000.000 tokens, con un techo de salida de 128.000 tokens en ambos
• Costo por tarea de índice — Claude Opus 5.5 $5.98 vs GPT-6.1 Sol $0.72
La distribución es lo que cuenta. Cuando la tarea consiste en razonar en abstracto —una pregunta difícil de examen, un problema de programación de nivel investigador sin una respuesta existente que copiar—, Claude Opus 5.5 está decididamente por delante, y una diferencia de 12,7 puntos en SciCode no es ruido. Cuando la tarea consiste en encontrar el pasaje correcto en una entrada muy larga y usarlo, los dos modelos están efectivamente a la par, y GPT-6.1 Sol mantiene esa posición con 50.000 tokens más de capacidad. Una gran parte del trabajo de producción con LLM es del segundo tipo: respuestas aumentadas por recuperación, revisión de contratos y expedientes, análisis de registros y transcripciones, revisión de código en un repositorio grande. Ese trabajo se mide con la tercera viñeta, no con las dos primeras, y en esa viñeta el sobreprecio compra 1,7 puntos.
Leyendo honestamente las filas del índice
Dos advertencias deben ir junto a esas cifras en lugar de al pie de la página.
Las configuraciones difieren. Artificial Analysis sitúa a Claude Opus 5.5 en una configuración "Max, Default Fallback" y a GPT-6.1 Sol con el esfuerzo máximo. Ambas son los ajustes más potentes con los que se publica cada modelo, lo que hace que la comparación sea justa, pero es una comparación entre dos techos, no entre dos valores predeterminados de lanzamiento. Los propios valores predeterminados de Claude Opus 5.5 en una API alojada pueden diferir de la ejecución reflejada en el gráfico, y el esfuerzo predeterminado de GPT-6.1 Sol es medio.
La fila de Terminal-Bench está deliberadamente en blanco en un lado. El 59,6 % de Claude Opus 5.5 proviene de la revisión de Artificial Analysis en la que se publicó; la cifra equivalente de GPT-6.1 Sol no está disponible en una revisión que coincida. Citar un número de una ejecución diferente del mismo benchmark sería una comparación falsa, y lo honesto es dejar la celda vacía en lugar de rellenarla con algo aproximadamente correcto.
La verbosidad juega en la misma dirección aquí que lo hizo frente a los hermanos más baratos: Claude Opus 5.5 emite 260M tokens de salida en la suite de índices frente a los 67M de GPT-6.1 Sol, una diferencia de 3,9× a una tarifa que ya es el doble de alta. De ahí viene una ratio de 8,3× por tarea cuando la lista de precios muestra 2× en entrada y 2× en salida. El sobreprecio no es 8,3× porque el modelo cueste 8,3× — es 8,3× porque cuesta 2× y piensa 3,9× más tiempo.
El argumento a favor de pagarlo
Si su trabajo se parece a los dos primeros puntos, el cálculo es sencillo y favorece a Claude Opus 5.5. Una diferencia de 12,7 puntos en código científico de nivel investigación, u 8,5 puntos en razonamiento abstracto difícil, es la diferencia entre un agente que cierra un ticket sin supervisión y uno que necesita a un humano cada tres pasos. La codificación agéntica sobre una base de código grande es la carga de trabajo que ambos proveedores mencionan en primer lugar, y es la carga de trabajo donde la diferencia es más amplia. Pagar 5,98 $ en lugar de 0,72 $ por tarea para evitar una ejecución fallida que le cuesta veinte minutos a un ingeniero no admite dudas.
Hay un segundo argumento que no tiene nada que ver con las puntuaciones. Claude Opus 5.5 tiene quince días de antigüedad y ha generado un conjunto de evaluaciones, reseñas y experiencia de despliegue de terceros que un modelo de ocho días no tiene. Para una ruta de producción, la madurez del conocimiento que lo rodea vale algo que el índice no valora.
El caso en contra, y el número que lo decide
El contraargumento es la fila de contexto largo. Si la forma dominante de tu tráfico es «entrada grande, respuesta corta» —y para muchísimos equipos lo es—, entonces el eje por el que se te cobra no es el eje que consumes. En la recuperación de contexto largo, los dos modelos están a 1,7 puntos de distancia con una relación de precios de 8,3×, y el modelo más barato tiene la ventana más grande. Ese es el caso en el que el sobreprecio es real, está medido y se destina a capacidad que la carga de trabajo nunca ejercita.
El número decisivo, entonces, no es el índice. Es la proporción de tus tareas que se parecen a SciCode y no al recuerdo. Los equipos que pueden responder esa pregunta a partir de sus propios registros deberían responderla a partir de sus propios registros; una suite de benchmarks es un proxy para una mezcla de trabajos, y la mezcla es la variable.
Ambos en una misma clave, que es lo que hace que la pregunta se pueda responder


Claude Opus 5.5 está en OrcaRouter a su propio precio de $4.00 / $20.00 con lecturas de caché a $0.20. GPT-6.1 Sol está en OrcaRouter a $2.00 / $10.00, y pasa a $4.00 / $15.00 por encima de 272,000 tokens de prompt, con lecturas de caché a $0.10. Ambos al precio de lista del proveedor, sin nada adicional, con una sola clave y una sola factura.
Eso importa más de lo habitual para esta combinación, porque los dos modelos no son sustitutos — son una decisión de enrutamiento. Envía el trabajo de documentos largos y de gran volumen a GPT-6.1 Sol, mantén el trabajo de razonamiento complejo y modificación de código en Claude Opus 5.5, y ambos se encuentran detrás del mismo endpoint con las mismas credenciales. Si una ruta se degrada, la conmutación automática por error redirige la llamada en lugar de hacerla fallar, y como el enrutamiento es declarativo, puede expresarse por clase de tarea en lugar de por aplicación. Probar la división es un cambio de configuración, no una migración.
Lo último que vale la pena decir es sobre la vigencia de esta comparación. Ambos modelos tienen días o semanas de antigüedad. De GPT-6.1 Sol se ha publicado una configuración independiente; de Claude Opus 5.5, una. Una sola ejecución por modelo es una instantánea, y el modo de fallo interesante no es que uno de estos números esté equivocado, sino que una configuración de esfuerzo medio, o un segundo evaluador, redibuje el perfil. Hasta entonces, la lectura defendible es la que dan los componentes: una brecha decisiva en razonamiento difícil y código de investigación, una pequeña en trabajo de contexto largo, y una factura de 8.3× que tiene que justificarse por la parte de tu carga de trabajo que se parece a lo primero.

Comparados en este artículo1
Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario
