Tarjeta de título principal generada para Claude Opus 5.5 vs Grok 4.6, dividida por un separador vertical: 'Claude Opus 5.5' con '$4.00 / $20.00' a la izquierda, 'Grok 4.6' con '$2.00 / $6.00' a la derecha, y el eslogan 'UN MODELO LEE, EL OTRO ACTÚA' en la parte inferior, con el logotipo de OrcaRouter en la esquina inferior derecha.
Guides & Insights

Claude Opus 5.5 vs Grok 4.6: un modelo lee, el otro actúa

Autor

Alistair Wren

Fecha de publicación

Últimos modelos · 20Ver todos los modelos →
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

Claude Opus 5.5 y Grok 4.6 son las dos formas más baratas de comprar un modelo de nivel frontera que mantendrá medio millón de tokens de contexto — y no son el mismo producto. En una medición, Grok 4.6 está a tres puntos del techo absoluto: 94.9 en GPQA Diamond, un conjunto de preguntas de ciencia de nivel de posgrado en el que el modelo insignia de Anthropic se sitúa en la misma banda. En la siguiente, está treinta y ocho puntos por detrás. En Terminal-Bench 4.0, el benchmark de terminal agéntico que pide a un modelo completar trabajo real en un shell, Artificial Analysis calificó a Grok 4.6 con 21.21% y a Claude Opus 5.5 con 59.60%. Eso no es una errata en ninguna de las dos direcciones, y la esencia de este emparejamiento está en explicar por qué ambos números son verdaderos a la vez.

Dos lanzamientos, una misma franja de precio, con cuatro meses de diferencia

SpaceXAI lanzó Grok 4.6 el 12 de agosto de 2026 como el actual buque insignia de la línea Grok, a $2.00 por millón de tokens de entrada y $6.00 de salida, con una ventana de contexto de 500.000 tokens y una superficie de entrada de texto, imágenes y archivos. Anthropic lanzó Claude Opus 5.5 el 22 de septiembre de 2026, unas seis semanas después, a $4.00/$20.00 con una ventana de contexto de 1.000.000 de tokens y 128.000 tokens de salida. Ambos admiten esfuerzo de razonamiento configurable, llamada a herramientas y salidas estructuradas; ambos ofrecen una superficie de chat compatible con OpenAI, así como el formato propio de su proveedor.

Así que la lectura ingenua es un intercambio limpio: Grok 4.6 cuesta la mitad en entrada y aproximadamente un tercio en salida, y Claude Opus 5.5 responde con el doble de ventana de contexto. Ese intercambio es real, y en el trabajo con documentos largos puede ser lo único que importe. Tampoco es donde está la divergencia interesante, porque los dos modelos se han medido en el mismo arnés independiente y no acabaron en el mismo punto en los ejes que importan para el trabajo agéntico.

Lo que dice el catálogo sobre los ejes en los que ambos fueron medidos

El catálogo de OrcaRouter incluye la procedencia de los benchmarks en cada fila —cada cifra nombra al evaluador del que proviene—, por lo que los pares que aparecen a continuación proceden de una sola fuente en ambos modelos, Artificial Analysis, en lugar de una cifra de un proveedor por un lado y la de un tercero por el otro:

• GPQA Diamond — Claude Opus 5.5 no figura en este eje de nuestro catálogo; Grok 4.6 obtiene un 94,9 %

• Humanity's Last Exam — 61,4% para Claude Opus 5.5 frente a 42,9% para Grok 4.6

• SciCode — 66,9 % frente a 56,5 %

• Recuperación de Contexto Largo — 84,7% frente a 80,3%

• Terminal-Bench 4.0 — 59,60 % frente a 21,21 %

• AA Intelligence Index — 57,6 frente a 44,3

La fila de GPQA se deja deliberadamente en blanco del lado de Anthropic en lugar de rellenarse a partir de una presentación de un proveedor. El 94,9 de Grok 4.6 ahí es el número más fuerte de su ficha y es genuino —una medición independiente, no una afirmación de SpaceXAI—, y dice algo real sobre el modelo: cuando la tarea es una pregunta bien formulada con una única respuesta defendible, Grok 4.6 rinde en la frontera. Léalo junto al 21,21 % de Terminal-Bench 4.0 y la forma se vuelve legible. Producir una respuesta correcta sobre ciencia y ejecutar una tarea de cinco pasos en un shell contra un sistema de archivos real son competencias distintas, y Grok 4.6 está mucho más avanzado en la primera que en la segunda.

Una advertencia sobre ese emparejamiento antes de que se use como veredicto: las cifras de Artificial Analysis de los dos modelos se registraron en fechas de evaluación distintas, y las de Grok 4.6 son el conjunto más antiguo. La comparación es entre un modelo evaluado en agosto y otro evaluado en septiembre en un harness que a su vez se ha revisado a lo largo de ese periodo. La dirección de la brecha es consistente en cinco ejes separados, por lo que la tratamos como señal, pero los valores exactos de los puntos deberían leerse como una comparación de agosto frente a septiembre, no como una del mismo día.

Un índice construido por alguien que tampoco vende.

Existe una segunda medida independiente, y coincide en la dirección aunque es mucho menos dispuesta a establecer distinciones sutiles. El Epoch Capabilities Index, construido por Epoch AI como un compuesto de más de cincuenta benchmarks y reescalado de modo que Claude 3.5 Sonnet se sitúa en 130 y GPT-5 en 150, coloca a Claude Opus 5.5 en 167,35 en el archivo que consultamos el 2 de octubre de 2026. Grok 4.6 está en 156,61, según una evaluación del 12 de agosto. Eso supone una diferencia de 10,74 puntos en una escala en la que se observó que aproximadamente cinco puntos correspondían a una duplicación de la medida de horizonte temporal de METR en el lanzamiento del índice —amplia, y cómodamente fuera de los intervalos publicados de los dos modelos, de 164,0 a 172,0 y de 154,66 a 158,93, que no se solapan en absoluto.

Cabe señalar lo que este índice no resuelve. Coloca a Claude Sonnet 5.5 en 165,2 y a Claude Fable 5.1 en 164,82, ambos por encima de Grok 4.6, y ambos son más económicos por millón de tokens de salida que la tarifa de segundo nivel de Grok 4.6. Quien elija únicamente por capacidad por dólar tiene una tercera y una cuarta opción dentro de la misma familia de proveedores, y la comparación de este artículo trata de otra cosa: de en qué destaca cada uno de los dos modelos.

Las tarjetas de tarifas, y la fila que solo aparece en una de ellas

A two-column scoreboard comparing Claude Opus 5.5 and Grok 4.6 across six rows. Left column Claude Opus 5.5: input $4.00, output $20.00, cache read $0.20, context 1M tokens with 128K max output, AA Intelligence Index 57.6, Epoch Capabilities Index 167.35. Right column Grok 4.6: input $2.00 doubling to $4.00 above 200K tokens, output $6.00 doubling to $12.00, cache read $0.50, context 500K tokens, AA Intelligence Index 44.3, Epoch Capabilities Index 156.61. A footer line reads 'Prices and catalogue figures per the OrcaRouter catalogue; Index figures per Artificial Analysis and the Epoch Capabilities Index.'

La tarifa de Grok 4.6 tiene un escalón que la de Claude Opus 5.5 no: las solicitudes de más de 200.000 tokens de prompt se facturan al doble de la tarifa base, así que la entrada pasa de $2.00 a $4.00 y la salida, de $6.00 a $12.00, con la lectura de caché pasando de $0.50 a $1.00. Claude Opus 5.5 cobra $4.00/$20.00 con lecturas de caché de $0.20 fijas durante toda la ventana de 1.000.000 de tokens. Esa inversión es la consecuencia práctica de comprar contexto largo a cualquiera de los dos modelos, y da la vuelta a la comparación de precios de etiqueta en cuanto una carga de trabajo realmente crece:

• Precio con 30.000 tokens de entrada: Claude Opus 5.5 es el caro, con aproximadamente 28 centavos por 30.000 de entrada y 8.000 de salida, frente a unos 11 centavos de Grok 4.6

• Precio con 250.000 tokens de entrada — el orden se invierte, porque Grok 4.6 ha pasado a su nivel duplicado mientras que Claude Opus 5.5 no.

• Lecturas de caché — $0.20 por millón para Claude Opus 5.5 frente a $0.50, subiendo a $1.00 por encima del escalón, para Grok 4.6

• Salida máxima — 128.000 tokens para Claude Opus 5.5; el límite de salida de Grok 4.6 no se publica en el registro del catálogo

Grok 4.6 también arrastra una laguna que conviene señalar sin rodeos en lugar de dejarla para que se descubra más tarde. Su registro no incluye ninguna cifra de salida máxima en absoluto —el campo no está medido, no es cero—, por lo que una carga de trabajo que dependa de respuestas individuales muy largas no tiene ninguna cifra publicada con la que planificar en ese lado de la comparación.

La columna de rendimiento que no se debe leer

Nuestro catálogo también incluye un panel de rendimiento de servicio por modelo, y en Grok 4.6 es lo más engañoso de la página. La tarjeta indica una latencia p50 de 10.000 milisegundos y una tasa de error del 97,58 % en una ventana de siete días, con 26.184 tokens servidos en ese período. Esos campos no describen un modelo lento. Describen un modelo que apenas fue llamado: a ese nivel de tráfico, la muestra es demasiado escasa para que una distribución de latencia signifique algo, y la tasa de error refleja un puñado de intentos en lugar de una calidad de servicio. Tratar ese bloque como evidencia de que Grok 4.6 es lento sería leer un artefacto de medición como una medición.

El panel de Claude Opus 5.5, en cambio, tiene una población detrás: una p50 en el rango de 4,4 segundos a lo largo de una ventana de siete días con muestras diarias, y 156 millones de tokens servidos en el mismo periodo. Incluso eso debería leerse como lo que es: nuestro propio tráfico del playground, que es una muestra de nuestros usuarios y no una propiedad del modelo.

Cuál enrutar y cómo descubrirlo por tu cuenta en tu propio trabajo

La división que describen los números es lo suficientemente estable como para actuar en consecuencia. Claude Opus 5.5 es la opción para el trabajo agéntico y de horizonte largo —la diferencia de Terminal-Bench 4.0, de 59.60% frente a 21.21%, es la mayor separación en cualquiera de los ejes en los que se midió a ambos modelos, y es el eje que predice si a un modelo se le puede encomendar una tarea en lugar de una pregunta. También es la opción cuando el prompt es realmente largo, porque la tarifa no aumenta por tramos y la ventana es el doble de grande. Grok 4.6 es la opción para el trabajo en forma de preguntas a gran volumen: una puntuación de 94.9% en GPQA Diamond a $2.00/$6.00 dentro de los primeros 200,000 tokens es una muy buena oferta para cargas de trabajo de recuperación y respuesta que nunca llegan al tramo duplicado.

Ambos están en OrcaRouter al precio de lista del proveedor con 0% de recargo — Claude Opus 5.5 a $4.00/$20.00 con lecturas de caché de $0.20, Grok 4.6 a $2.00/$6.00 con el nivel de más de 200K aplicado exactamente como lo establece SpaceXAI — detrás de una sola clave, para que la división anterior se pueda probar con tu propio conjunto de prompts en lugar de discutir sobre ella. Cuando ambos se enrutan, conmutación por error automática está por debajo, lo cual vale la pena tener cuando el modelo más barato es el que sostiene la ruta agéntica.

El veredicto que se lleva este emparejamiento: Grok 4.6 es el mejor lector y Claude Opus 5.5 es el mejor trabajador. El 94.9 en GPQA Diamond y el 21.21 en Terminal-Bench son el mismo modelo medido dos veces, y saber a cuál de esos dos números se parece tu carga de trabajo es toda la decisión.

Screenshot of the OrcaRouter model page for Claude Opus 5.5 (anthropic/claude-opus-5.5), showing the model header, a 1M-token context window with up to 128K output, the Vision, Tools, JSON and Reasoning capability tags, and the input and output price figures per million tokens.Screenshot of the OrcaRouter model page for Grok 4.6 (grok/grok-4.6), showing the model header, the context window of 500,000 tokens, the text, image and file input surface, the capability tags, and the input and output price figures per million tokens.

Comparados en este artículo1

Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario