
Grok 4.7 vs Qwen 3.8 Max: precio idéntico, a un punto de diferencia, formas opuestas
- OrcaNUEVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens
- orcaNUEVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens
- deepseekNUEVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligencia72Código
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligencia76Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Inteligencia69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Dos modelos insignia de código cerrado, ambos a $2 por millón de tokens de entrada y $6 por millón de salida, ambos con puntuaciones dentro de un solo punto entre sí en el mismo benchmark independiente, lanzados con diecinueve días de diferencia. Grok 4.7 llegó el 21 de septiembre de 2026 de la mano de SpaceXAI; Qwen 3.8 Max fue lanzado por el proveedor el 3 de agosto de 2026 y actualizado el 2 de septiembre de 2026. En el actual Artificial Analysis Intelligence Index, versión v4.3.2, Grok 4.7 obtiene 46 y Qwen 3.8 Max obtiene 45. En precio y en capacidad medida, estos dos modelos son la misma compra. En todo lo demás —contexto, modalidad, velocidad de servicio, apertura y qué eligió optimizar cada proveedor— no podrían ser más diferentes, y eso es lo que hace que valga la pena hacer esta comparación en lugar de omitirla.
Primero, la cronología, porque Qwen 3.8 Max tiene dos fechas
Esto genera confusión en mucha cobertura, así que vale la pena aclararlo desde el principio. Qwen 3.8 Max se lanzó el 3 de agosto de 2026 como el modelo más grande y más capaz de Alibaba, construido a partir de la arquitectura de visión-lenguaje de Qwen 3.5 sobre un diseño de mezcla dispersa de expertos reportado en 2,4 billones de parámetros totales con 95.000 millones activos por token. El 2 de septiembre de 2026, Alibaba lanzó una compilación renovada —la revisión 0902—, que es la versión que lleva los ID de modelo actuales y la versión a la que Artificial Analysis fecha su página. Si has visto tanto una fecha de agosto como una de septiembre para Qwen 3.8 Max, esa es la razón: una es el lanzamiento, la otra es la revisión a la que la mayoría de la gente se refiere en realidad hoy.
Grok 4.7 tiene un historial más limpio y otro más desordenado a sus espaldas. SpaceXAI lo lanzó el 21 de septiembre de 2026 tras un lanzamiento que se retrasó en repetidas ocasiones — Musk había apuntado a ventanas de lanzamiento a finales de agosto, principios de septiembre y mediados de septiembre antes de que el modelo se lanzara realmente. El lanzamiento en sí fue limitado: un modelo base más grande que Grok 4.6, una ejecución más larga de aprendizaje por refuerzo orientada a tareas de varias horas, y ningún cambio en la tarifa de $2/$6 que Grok 4.6 había mantenido desde el 12 de agosto.
Para qué optimizó cada proveedor
Lea los dos anuncios de lanzamiento en conjunto y las apuestas de diseño son casi perfectamente opuestas.
SpaceXAI está optimizado para la ejecución agéntica. Las cifras de Grok 4.7 reportadas por el proveedor se concentran en el trabajo de terminal y repositorios: Terminal-Bench 4.0 con 38.0% frente al 20.3% de Grok 4.6, CursorBench 4.0 con 46.3%, DeepSWE v1.1 con 71.0% en esfuerzo de razonamiento alto, EEBench con 64.0%. La propia descripción del lanzamiento por parte de la compañía señala la autoverificación y el manejo de contexto largo dentro del entorno Grok Bot como los objetivos. Grok 4.7 ofrece una ventana de 500,000 tokens, acepta texto e imágenes, devuelve texto y expone el esfuerzo de razonamiento desde low hasta xhigh. Es un modelo construido para terminar trabajos.
Alibaba optimizó para el alcance. Qwen 3.8 Max ofrece una ventana de contexto de aproximadamente 984,000 tokens —efectivamente un millón— y sus fortalezas publicadas son la amplitud más que la profundidad en un solo ámbito: una puntuación de 86.6 en Terminal Bench 2.1, 67.7 en SWE-bench Pro, 93.0 en PaperBench, 92.6 en GPQA Diamond, 82.3 en MMMU-Pro, 86.1 en OSWorld-Verified. Acepta entrada de texto, imagen y video y devuelve texto, admite niveles de esfuerzo de razonamiento con xhigh como predeterminado, y su punto más débil publicado es Humanity's Last Exam con 43.6. Es un modelo construido para manejar cualquier cosa que le entregues.
Cada cifra en ese párrafo es reportada por el proveedor. Ninguno de los conjuntos ha sido reproducido de forma independiente, y los dos conjuntos no son directamente comparables de todos modos — Terminal-Bench 2.1 y Terminal-Bench 4.0 son evaluaciones comparativas diferentes, por lo que el 86.6 de Qwen y el 38.0 de Grok nunca deben colocarse uno al lado del otro.
• Compuesto independiente — Grok 4.7 46 en el AA Intelligence Index v4.3.2 frente a Qwen 3.8 Max 45 en la misma versión. Un empate estadístico.
• Precio por millón de tokens — $2.00 de entrada / $6.00 de salida en ambos. El descuento de caché de Qwen se indica en 88 %, lo que da una tarifa combinada de $1.18 por millón; los términos de caché de Grok 4.7 no se publican sobre la misma base.
Ventana de contexto — Grok 4.7: 500.000 tokens frente a Qwen 3.8 Max: aproximadamente 984.000. Qwen gana por casi el doble, y esta es la mayor diferencia de especificaciones entre ambos.
• Modalidades de entrada — texto e imagen de Grok 4.7 frente a texto, imagen y video de Qwen 3.8 Max.
• Pesos — ambos propietarios. Ninguno de los dos modelos se puede descargar, lo que elimina por completo de esta comparación el habitual argumento de los pesos abiertos.
• Parámetros — Grok 4.7 no divulgado en ninguna hoja de especificaciones de SpaceXAI (la cifra de ~2,1T es una afirmación de Musk) frente a Qwen 3.8 Max, reportado con 2,4T en total y 95B activos, lo cual Alibaba tampoco ha confirmado en una hoja de especificaciones.
• Velocidad de servicio — Qwen 3.8 Max a 38,8 tokens de salida por segundo con 3,08 segundos hasta el primer token, según Artificial Analysis; Grok 4.7 posicionado por SpaceXAI como aproximadamente el doble de rápido que modelos comparables, según lo reportado por el proveedor, sin una cifra de rendimiento independiente publicada aún.

La diferencia de contexto es la verdadera decisión.
Cuando el precio y la capacidad son idénticos, la decisión recae en cualquier otra cosa que difiera, y aquí se trata del contexto. Duplicar la ventana de 500.000 a aproximadamente 984.000 tokens no es un mero detalle de ficha técnica: es la diferencia entre fragmentar un repositorio y mantenerlo entero.
La ventana más larga de Qwen 3.8 Max viene con una advertencia documentada que es importante para los compradores: la versión de pesos abiertos que Alibaba anunció para la semana del 10 de agosto de 2026 era solo de texto y no incluía el contexto completo de un millón de tokens. Eso no afecta al endpoint alojado del que trata esta comparación, pero vale la pena saberlo si estabas planeando en torno al lanzamiento abierto.
Hay una segunda consideración en el lado de Grok. La línea Grok ha aplicado históricamente un acantilado de precios en los 200.000 tokens de entrada, donde una solicitud que cruza el umbral vuelve a tarificar toda la solicitud al doble de la tarifa: $4 de entrada y $12 de salida. Con una ventana de 500.000 tokens, ese umbral queda muy dentro del rango de trabajo del modelo. Antes de enrutar trabajo de contexto largo a Grok 4.7, confirma el tarifario vigente del modelo desplegado, porque la interacción entre una ventana grande y un acantilado de reajuste de precios es donde suelen descuadrarse las facturas de contexto largo.
Lo que cuesta un mes de trabajo en cada uno
Dado que las tarifas destacadas son idénticas, la comparación de costos debe construirse a partir del comportamiento de los tokens y no de la tarifa publicada, y ahí los dos modelos divergen de una manera que es medible.
Artificial Analysis midió a Grok 4.7 generando 240 millones de tokens de salida mientras ejecutaba su Intelligence Index, frente a una mediana de 92 millones entre los modelos del tablero — es un razonador verboso. Qwen 3.8 Max generó 190 millones de tokens de salida en el mismo índice, con un costo total de evaluación de $4,934.79 y una velocidad medida de 38.8 tokens por segundo. Ambos están muy por encima de la mediana de verbosidad, y Grok 4.7 es el más verboso de los dos.
Así que, con un precio idéntico de $6 por millón de tokens de salida, el modelo que emite más tokens por tarea cuesta más por tarea. Las cifras de verbosidad publicadas sugieren que Grok 4.7 consumirá más tokens de salida para un trabajo de indexación equivalente, lo que significa que el empate en precio es en realidad una pequeña victoria para Qwen 3.8 Max en costo por tarea — compensada por la supuesta ventaja de velocidad de Grok 4.7, que acorta el tiempo de reloj y, por lo tanto, el costo humano de esperar la ejecución de un agente. Ninguna de esas compensaciones es visible en una lista de precios, y vale la pena medir ambas en tu propio tráfico en lugar de darlas por sentadas.
La única asimetría que no está en disputa es el almacenamiento en caché. Qwen 3.8 Max publica un descuento de caché del 88% y una tarifa combinada de $1.18 con una proporción 7:2:1 de aciertos de caché/entrada/salida. Para cargas de trabajo con un prefijo grande y estable —un prompt de sistema, un encabezado de base de código, un conjunto de documentos—, ese descuento es donde están los ahorros reales, y vale la pena comprobar cómo se comparan las condiciones de caché de Grok 4.7 antes de comprometer volumen.

Elegir, cuando los números se niegan a elegir por ti
Un 46 y un 45 en el mismo índice, al mismo precio, es lo más cerca de un empate genuino que este blog probablemente publique. Eso significa que la decisión debería tomarse en los ejes en los que los dos modelos realmente difieren, y hay cuatro de ellos.
Elige Grok 4.7 si tu trabajo es la codificación agéntica y la ejecución en terminal, si la velocidad en tiempo real en ejecuciones largas importa más que el margen de contexto, y si quieres un control de razonamiento por solicitud para mantener barato el tráfico sencillo. Elige Qwen 3.8 Max si manejas habitualmente entradas de más de medio millón de tokens, si la entrada de video está en tu hoja de ruta, si quieres el descuento de caché del 88 % para cargas de trabajo con muchos prefijos, o si quieres un modelo cuyo proveedor publique una matriz de evaluación amplia en lugar de una concentrada en un solo ámbito.
Si la respuesta honesta es «un poco de ambos», esa es la respuesta normal, y es el caso para el que está hecha esta pareja. Qwen 3.8 Max está en OrcaRouter al precio de lista de Alibaba, y OrcaRouter transfiere el precio de lista del proveedor con un 0 % de margen, así que los $2/$6 de arriba son lo que realmente pagas, y un cambio de tarifa del proveedor se refleja aquí el mismo día en lugar de en la renovación. Una sola clave de API cubre Qwen 3.8 Max más más de 200 modelos, lo que significa que la decisión de contexto pasa a ser una regla de enrutamiento por solicitud en lugar de un compromiso de plataforma: envía las entradas de tamaño excesivo a la ventana de 984k y mantén todo lo demás en el endpoint que sea más rápido y barato para esa tarea, con conmutación por error automática si un proveedor se degrada. Cuando una tarea realmente necesita ambas formas —una lectura de contexto largo seguida de una pasada de ejecución agéntica—, el DSL de enrutamiento compone modelos en una sola llamada en lugar de obligarte a elegir un bando.
Una aclaración que vale la pena señalar, dado que ninguno de los dos modelos es abierto: nada en esta comparación implica pesos descargables. Ambos son endpoints alojados, y el autoalojamiento no es una opción para ninguno de los dos.
El único número que hay que mantener
Cuarenta y seis contra cuarenta y cinco no es una razón para elegir un modelo, y no debería serlo. Lo que decide esta comparación es la ventana de contexto —500.000 tokens frente a aproximadamente 984.000— y la forma que eligió cada proveedor: Grok 4.7, optimizado para terminar rápido tareas agénticas difíciles; Qwen 3.8 Max, optimizado para manejar lo que le entregues. Mismo precio, misma capacidad medida, tareas distintas. Es una decisión de enrutamiento, y es el tipo de decisión que debería requerir una tarde de pruebas en lugar de un trimestre de adquisición.

Comparados en este artículo3
Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario
