
Grok 4.7 vs Claude Opus 5: La brecha de precios es real, la paridad no
- OrcaNUEVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens
- orcaNUEVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens
- deepseekNUEVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligencia72Código
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligencia76Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Inteligencia69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Puedes llamar a Grok 4.7 por $2.00 por millón de tokens de entrada y $6.00 por millón de tokens de salida. Puedes llamar a Claude Opus 5 por $5.00 y $25.00. Eso es una diferencia de 4,2x en la salida — el tipo de brecha que normalmente resuelve una comparación antes de que siquiera se abran los benchmarks. No resuelve esta. En la versión del Artificial Analysis Intelligence Index contra la que ambos modelos están puntuados actualmente — v4.3.2, la revisión publicada el 19 de septiembre de 2026 — Claude Opus 5 se sitúa en 51 y Grok 4.7, lanzado por el proveedor el 21 de septiembre de 2026, se sitúa en 46. Cinco puntos no son una paliza, pero la forma de los cinco puntos es: Opus 5 gana ocho de las diez evaluaciones de ese índice. El argumento del modelo más barato es el precio, el contexto está igualado, y el único lugar donde la ventaja de precio de Grok 4.7 debía importar más es exactamente donde desaparece.
Dos buques insignia, dos listas de precios muy diferentes
Claude Opus 5 está en el mercado desde el 24 de julio de 2026 y es el modelo insignia de Anthropic dentro del nivel Opus, por debajo de Claude Fable 5.1 en la propia gama de la compañía. Cuenta con una ventana de contexto de 1M de tokens a tarifa plana —Anthropic afirma sin ambages que una solicitud de 900k tokens se factura a la misma tarifa por token que una de 9k, sin ningún recargo por contexto largo— y una salida máxima de 128K, ampliable a 300K en la Message Batches API. El razonamiento es adaptativo y está activado por defecto, con una escala de esfuerzo que va de low, medium, high, xhigh y max, con high como valor predeterminado. Los pesos son cerrados.
Grok 4.7 tiene un día de vida. Mantiene un contexto de 500k tokens, acepta texto e imágenes y devuelve texto, y cuenta con un ajuste de esfuerzo de razonamiento propio. Su precio de lista es de $2.00 por entrada y $6.00 por salida por millón de tokens por debajo de los 200k tokens de prompt, y sube a $4.00 y $12.00 al alcanzar o superar ese umbral; las lecturas en caché cuestan $0.50 y $1.00 en esas mismas dos franjas. xAI también incluye una variante más rápida que funciona a aproximadamente el doble de velocidad de salida por aproximadamente el doble de precio, aunque esa configuración se lanzó sin una medición de velocidad publicada adjunta. Aquí los pesos también son cerrados, lo que elimina la vía de escape de "ejecútalo tú mismo" en ambos lados de esta comparación.
El consejo independiente no está cerca, y no es halagador
Ambos modelos se puntúan según el índice v4.3.2 de Artificial Analysis, que incorpora diez evaluaciones que abarcan agentes, programación, conocimiento general y razonamiento científico. Poner las dos columnas una al lado de la otra hace que la diferencia de cinco puntos del titular parezca generosa con el modelo más barato: una única brecha de cinco puntos en un compuesto puede ocultar mucho, y aquí oculta una victoria casi total.
• Inteligencia compuesta — Grok 4.7 (xhigh): 46 en el Artificial Analysis Intelligence Index v4.3.2. Claude Opus 5 (razonamiento adaptativo, esfuerzo máximo): 51 en la misma revisión.
• Razonamiento difícil — Grok 4.7: Humanity's Last Exam 43, CritPt 18. Claude Opus 5: HLE 55, CritPt 29. Una diferencia de doce puntos y de once puntos, respectivamente, ambas a favor de Opus 5.
• Terminales agénticos — Grok 4.7: Terminal-Bench 4.0 26. Claude Opus 5: 49. Esta es la mayor diferencia individual del tablero, y se da en el benchmark más cercano al trabajo autónomo real.
• Automatización del entorno laboral — Grok 4.7: AutomationBench-AA 66%. Claude Opus 5: 57%. La única victoria clara de Grok 4.7, y una victoria real: nueve puntos en la evaluación que mide si un agente completa un flujo de trabajo sin activar una barrera de seguridad.
• Conocimiento y honestidad — Grok 4.7: AA-Omniscience 32. Claude Opus 5: 37. Ambos modelos alucinan; Opus 5 lo hace menos según esta medida.
• Contexto largo — Grok 4.7: AA-LCR v1.1 77 %, ventana de 500k tokens. Claude Opus 5: 79 %, ventana de 1M tokens.
• Coste de ejecutar el índice — Grok 4.7: 240 M de tokens de salida a lo largo de la evaluación, señalado por Artificial Analysis como inusualmente verboso. Claude Opus 5: 140 M. Grok 4.7 gasta 1,7 veces los tokens para alcanzar una puntuación más baja.

Donde la ventaja de precio de Grok 4.7 va a morir
Aquí está la aritmética que oculta la hoja de tarifas. Tomemos una solicitud agéntica realista: 30k tokens de entrada, 8k de salida. Grok 4.7 cobra $0.06 por entrada y $0.048 por salida — unos once centavos. Claude Opus 5 cobra $0.15 por entrada y $0.20 por salida — unos treinta y cinco centavos. Eso es un verdadero 3x, y a este tamaño Grok 4.7 es la elección obvia solo por costo.
Ahora toma la solicitud en torno a la cual se ha construido el marketing propio de Grok 4.7: una sesión agéntica de contexto largo. Empuja el prompt más allá de los 200k tokens y las tarifas de Grok 4.7 se duplican a $4.00 de entrada y $12.00 de salida. Claude Opus 5 no se mueve — su ventana de 1M se factura a $5.00 y $25.00 fijos. Con 250k de entrada y 8k de salida, Grok 4.7 cuesta $1.00 de entrada y $0.096 de salida, alrededor de $1.10. Opus 5 cuesta $1.25 de entrada y $0.20 de salida, alrededor de $1.45. La brecha se ha reducido de 3x a aproximadamente 1.3x. Empuja más — 400k, 500k, el tope de la ventana de Grok 4.7 — y la tarifa fija de Opus 5 sigue cerrando la brecha mientras su ventana sigue llegando hasta un millón de tokens. Grok 4.7 es el modelo barato con prompts cortos y casi a la par en precio con los largos, lo que invierte la intuición que la página de precios está diseñada para crear.
Dos salvedades mantienen esto honesto. Primero, el nivel de contexto largo es una estructura documentada de precios de lista de la propia documentación de modelos de xAI, no una medición; las facturas reales dependen del almacenamiento en caché, y la tarifa de lectura en caché de $0.50 de Grok 4.7 es realmente barata. Segundo, Artificial Analysis aún no ha publicado una medición de velocidad para Grok 4.7, por lo que la mitad de “es más rápido” del argumento de barato y rápido actualmente no está verificada. Lo que sí está medido es Opus 5 a 59 tokens por segundo con un tiempo hasta el primer token de 49 segundos: lento, caro y por delante en casi todos los ejes de calidad.
Lo que realmente enrutarías
Esta es una comparación en la que la respuesta honesta varía según la carga de trabajo, y un router es la forma más barata de actuar en consecuencia. Claude Opus 5 está disponible en OrcaRouter, listado en su propia página de modelo con el precio del proveedor transferido con un 0 % de margen — por lo que los $5.00 y $25.00 de Opus 5 en nuestro catálogo son el precio de lista de Anthropic, no una copia con recargo, y si Anthropic lo cambia, el número cambia en la misma clave ese mismo día. Grok 4.7 no está en el catálogo de OrcaRouter a la fecha de esta redacción; para usarlo hoy hay que recurrir a la API propia de xAI y a las plataformas de terceros que lo ofrecen. Vale la pena conocer esa asimetría antes de diseñar tu arquitectura en torno a ella.

El patrón de enrutamiento que se desprende de los números es sencillo. Envíe el trabajo de contexto largo, con mucho razonamiento y de agente de terminal a Opus 5 — gana Terminal-Bench 4.0 por 23 puntos y ofrece el doble de ventana a precio fijo, que es exactamente el perfil de un trabajo difícil y largo. Envíe las tareas de automatización y flujo de trabajo de gran volumen a Grok 4.7: gana AutomationBench-AA por nueve puntos y cuesta un tercio en prompts cortos. Debido a que se accede a ambos a través de un único endpoint cuando están en el catálogo, esa división es una regla de enrutamiento en lugar de un segundo contrato con un proveedor, y la conmutación por error automática significa que un límite de velocidad en una ruta se convierte en un evento de enrutamiento en lugar de una interrupción. Cuando una carga de trabajo realmente necesita ambos — una primera pasada económica y una pasada de verificación costosa — el DSL de enrutamiento los compone en una sola llamada en lugar de dos integraciones.
El veredicto
Si eliges con base en la evidencia, Claude Opus 5 gana esta comparativa y no por poco: ocho de diez evaluaciones, las dos brechas más amplias, el doble de contexto a un precio fijo y un presupuesto de tokens muy por debajo de dos tercios del tamaño para obtener una puntuación más alta. La puntuación compuesta de cinco puntos minimiza lo ampliamente que lidera. El caso de Grok 4.7 es más limitado de lo que sugiere su lista de precios, pero no está vacío: es genuinamente más barato en los tamaños de prompt que la mayoría de las aplicaciones realmente usa, es el mejor modelo de automatización y tiene solo un día de vida, con una suite de benchmarks del proveedor que aún se está reproduciendo de forma independiente. Cómpralo para automatización sensible a los costos, vigila sus cifras de velocidad cuando Artificial Analysis las publique y considera el nivel de precios de contexto largo como lo que decide si el modelo barato sigue siendo barato.

Comparados en este artículo1
Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario
