
GPT-6 Luna vs Grok 4.6: La brecha de precio es veinte veces y la ventana es la verdadera diferencia
- OrcaNUEVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens
- orcaNUEVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens
- deepseekNUEVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligencia72Código
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligencia76Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Inteligencia69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Pon GPT-6 Luna y Grok 4.6 en la misma página y la primera comparación se escribe sola. Luna cotiza a $0.10 por millón de tokens de entrada y $0.50 por millón de salida. Grok 4.6 cotiza a $2.00 y $6.00 con una lectura en caché de $0.50. Veinte veces en la entrada, doce veces en la salida, y una tarifa de entrada en caché que es cincuenta veces más alta en el modelo del proveedor. Ese es el precio de etiqueta, y según la etiqueta, la respuesta no está ni cerca.
La razón por la que vale la pena escribir el resto de este artículo es que los dos modelos discrepan sobre algo más estructural que el precio. Grok 4.6 tiene una ventana de contexto de 500.000 tokens y vuelve a fijar el precio de toda la solicitud en cuanto el prompt supera los 200.000 tokens. GPT-6 Luna tiene 1.050.000 tokens y cambia de precio a los 272.000. Ambos umbrales son precipicios, no tarifas marginales: si cruzas uno, toda la solicitud se factura al número más alto, no solo la parte que queda por encima de la línea. Dónde se sitúan esos dos precipicios, y qué le ocurre a una carga de trabajo de contexto largo en el lado equivocado de cada uno, decide más de esta comparación que el titular de veinte veces.
Dos modelos, dos posturas muy diferentes
Grok 4.6 es el modelo de xAI del 12 de agosto de 2026, y es un lanzamiento de frontera de propósito general: texto de entrada, texto de salida, una ventana de 500.000 tokens, un coste publicado por tarea de $1,86 en el tablero independiente con esfuerzo alto, y una velocidad medida de 57,7 tokens de salida por segundo. Es el tipo de modelo que un equipo adopta porque es bueno en muchas cosas y el proveedor avanza rápido.
GPT-6 Luna es la postura opuesta. OpenAI lo lanzó el 22 de septiembre de 2026 como el nivel de volumen de la familia GPT-6, por debajo de GPT-6 Sol a $2,00/$10,00 y del buque insignia GPT-6 Astra a $10,00/$50,00. Entrada de texto e imagen, salida de texto, una ventana de 1.050.000 tokens con una entrada máxima de 922.000 tokens, un límite de salida de 128.000 tokens, y una escala de razonamiento que va desde none pasando por low, medium, high, xhigh y max, con medium como valor predeterminado. No es un modelo que alguien adopte por su amplitud. Es un modelo que se coloca por debajo de una carga de trabajo.
Así que el planteamiento honesto no es «cuál de estos es mejor». Es «cuál de estos tiene un precio acorde con la forma de trabajo que tienes», y esas dos formas son genuinamente distintas.
Las tarjetas, línea por línea
Una línea por dimensión, ambos lados en cada una:
Entrada por 1 M — GPT-6 Luna $0.10 vs Grok 4.6 $2.00
• Salida por 1M — GPT-6 Luna $0.50 vs Grok 4.6 $6.00
• Entrada en caché por 1M — GPT-6 Luna $0.01 vs Grok 4.6 $0.50, un décimo de su propia tarifa de entrada frente a un cuarto de la de xAI
• Umbral de contexto largo — GPT-6 Luna 272.000 tokens de entrada frente a Grok 4.6 200.000 tokens de prompt
• Tarifas de contexto largo — GPT-6 Luna reajusta el precio de toda la solicitud a $0.20 de entrada, $0.75 de salida, $0.02 en caché frente a Grok 4.6, que reajusta el precio de toda la solicitud a $4.00 de entrada, $12.00 de salida, $1.00 en caché
• Ventana de contexto — GPT-6 Luna 1.050.000 tokens vs Grok 4.6 500.000 tokens
• Salida máxima — GPT-6 Luna 128.000 tokens frente a Grok 4.6, cuyo máximo no se publica como un límite aparte en la tarjeta
• Intelligence Index, independiente — GPT-6 Luna 37 con esfuerzo máximo frente a Grok 4.6 44 con esfuerzo alto en la revisión v4.3.2 del índice
• Puntuación de esfuerzo predeterminado — GPT-6 Luna 29 en su nivel medio predeterminado frente a Grok 4.6 43 en medio, donde el tablero también lo mide
• Coste por tarea de Index, independiente — GPT-6 Luna alrededor de $0.07 vs Grok 4.6 $1.86 con esfuerzo alto
• Tokens de salida en la ejecución del índice — GPT-6 Luna 150M vs Grok 4.6 94M, frente a una mediana del tablero de 88M
• Velocidad de salida, independiente — GPT-6 Luna 153.9 tokens/seg vs Grok 4.6 57.7 tokens/seg en alto
• Tiempo hasta el primer token, independiente — Grok 4.6 38,63 s, de extremo a extremo 47,31 s; GPT-6 Luna devuelve un primer token en un tiempo que permite que un usuario esté esperando
• Capacidad cibernética, independiente — Grok 4.6 obtiene 57 en la evaluación de ciberseguridad del panel; no se publica una cifra comparable de GPT-6 Luna
• En OrcaRouter — GPT-6 Luna no está en nuestro catálogo, mientras que Grok 4.6 es enrutable al precio de lista de xAI

200.000 frente a 272.000 es todo el argumento.
Lee los dos umbrales junto a las dos ventanas y la comparación se reorganiza por sí sola.
El umbral crítico de Grok 4.6 se sitúa en 200.000 tokens dentro de una ventana de 500.000 tokens — al 40 % del camino. El de GPT-6 Luna se sitúa en 272.000 dentro de 1.050.000 — al 26 % del camino. Así que el modelo más barato no solo empieza a reajustar precios más tarde, sino que tiene más del doble de margen después del umbral antes de que se le agote por completo la ventana.
En concreto: una solicitud de 450.000 tokens cabe dentro de ambos modelos. En GPT-6 Luna se factura según el nivel de contexto largo de $0.20 y $0.75. En Grok 4.6 se factura a $4.00 y $12.00. Eso es veinte veces en la entrada y dieciséis veces en la salida para el mismo prompt, y es una solicitud que Grok 4.6 puede atender, así que la elección es real y no teórica.
El caso inverso es el que pilla por sorpresa a la gente. Una solicitud de 190,000 tokens queda por debajo de ambos umbrales y se factura a las tarifas estándar en ambos: $0.10/$0.50 frente a $2.00/$6.00, un factor exacto de veinte y de doce. Una solicitud de 210,000 tokens queda por encima del umbral de Grok 4.6 y por debajo del de GPT-6 Luna. Se factura a $4.00/$12.00 en Grok 4.6 y a $0.10/$0.50 en Luna —una brecha de cuarenta veces y de veinticuatro veces producida enteramente por una diferencia de 20,000 tokens en la longitud del prompt, sin ningún cambio en ninguno de los dos modelos.
Eso no es una razón para evitar Grok 4.6. Es una razón para saber dónde acaban realmente tus prompts, porque una carga de trabajo que promedia 180.000 tokens y alcanza picos de 220.000 está pagando dos tarifas distintas y parecerá un error de facturación el primer mes que ocurra.
Lo que compra la diferencia de precio en el consejo independiente
Grok 4.6 obtiene 44 en el Artificial Analysis Intelligence Index en esfuerzo alto. GPT-6 Luna obtiene 37 en esfuerzo máximo. Siete puntos, en una puntuación compuesta en la que un solo punto queda dentro del ruido de una repetición — y los dos modelos están separados por aproximadamente veintiséis veces en coste por tarea completada, $1.86 frente a unos $0.07.
Hay dos cosas sobre ese par de números que vale la pena separar.
El primero es el valor predeterminado de esfuerzo. El 37 de GPT-6 Luna es una cifra de esfuerzo máximo y su valor predeterminado es medio, donde obtiene 29. El 44 de Grok 4.6 es una cifra de esfuerzo alto, y el tablero también lo mide en medio, donde obtiene 43. Así que la comparación en igualdad de condiciones con la configuración predeterminada es 29 contra 43 — catorce puntos, no siete, y la versión de catorce puntos es la que realmente experimentará un equipo que despliegue ambos y no cambie nada. Grok 4.6 pierde un punto al pasar de alto a medio. GPT-6 Luna pierde ocho. El ajuste de esfuerzo le cuesta mucho más al modelo barato que al caro, y esa asimetría es invisible en las cifras principales del índice.
El segundo es la verbosidad, y aquí la dirección es la opuesta a lo que sugiere la relación de precios. GPT-6 Luna generó 150 millones de tokens de salida al completar el índice; Grok 4.6 generó 94 millones. El modelo que cuesta una doceava parte por token de salida gastó un 60% más de tokens para obtener una puntuación más baja. En una tarjeta con precios por salida, esa es la diferencia entre una brecha de coste por tarea de veintiséis veces y una más pequeña, y es la razón por la que cualquier comparación basada únicamente en los precios de etiqueta exagerará el caso de la categoría barata.
Grok 4.6 también publica una puntuación de capacidad cibernética de 57 en la misma clasificación. No hay una cifra comparable de GPT-6 Luna, así que esa dimensión tiene un solo lado — pero es el tipo de dato que importa si tu carga de trabajo toca herramientas de seguridad, y su ausencia en el modelo más barato es información, más que un vacío que deba llenarse con suposiciones.
Latencia, donde los dos no están cerca y no van en la misma dirección
Las cifras independientes de latencia de Grok 4.6 son 38,63 segundos hasta el primer token y 47,31 segundos de extremo a extremo con esfuerzo alto. Esa es una cifra para un modelo que razona en serio antes de hablar, y no es compatible con una persona mirando un cursor. Nuestro propio listado para el modelo registra un tiempo p50 hasta el primer token de 6,71 segundos y un p95 de 10,00 segundos durante una ventana de siete días, lo que mide un punto distinto de la respuesta y no es comparable con la cifra independiente: los dos números no están en desacuerdo, responden a preguntas diferentes.
GPT-6 Luna funciona a 153,9 tokens de salida por segundo y devuelve su primer token lo bastante rápido como para situarse detrás de una superficie interactiva. Casi triplica el rendimiento de Grok 4.6 con esfuerzo alto. Para un trabajo por lotes, esa diferencia es una mera comodidad en términos de tiempo real. Para cualquier cosa que un usuario esté esperando, es la diferencia entre un producto y un prototipo.
La combinación es inusual y merece decirse sin rodeos: el modelo barato es el rápido, el modelo caro es el lento, y el modelo caro está siete puntos por delante en el compuesto con el mismo esfuerzo. Ese es el perfil de un modelo construido para pensar intensamente una vez, y de un modelo construido para responder rápidamente muchísimas veces. Si tu carga de trabajo es una llamada por tarea, la latencia de Grok 4.6 es asequible. Si es mil llamadas por tarea, no lo es.
Lo que realmente estás comprando del lado de xAI
Grok 4.6 cuesta aproximadamente veintiséis veces más por tarea completada que GPT-6 Luna y está siete puntos de índice por delante con un esfuerzo equivalente. Es un tipo de cambio poco favorable para una carga de trabajo de propósito general, y es razonable para una clase específica de trabajo.
Tres cosas lo justifican. La puntuación cyber de 57 es una capacidad de la que GPT-6 Luna no publica un equivalente. La ejecución de índice de 94 millones de tokens frente a los 150 millones de Luna es una ventaja real de concisión en cualquier tarea en la que la salida la consuma una persona en lugar de un parser. Y el modelo está en producción desde el 12 de agosto, seis semanas más de lo que GPT-6 Luna ha existido siquiera —lo cual no es un benchmark, pero es un historial de resultados, y para un equipo que ya ha construido contra él, el costo de migración de dejarlo es parte del precio de dejarlo.
Contra eso, el caso de GPT-6 Luna no es principalmente la tasa veinte veces mayor. Es el umbral de 272,000 tokens dentro de una ventana de un millón de tokens, la capacidad de que se le indique que deje de razonar por completo, una tarifa de entrada en caché de un centavo por millón, y una cifra de rendimiento que lo hace utilizable como componente en lugar de como punto final. Esas son propiedades estructurales del nivel económico, y ninguna cantidad de ventaja de índice del otro lado las reemplaza.
Ejecutar uno de ellos, o ambos
Grok 4.6 está en OrcaRouter al precio de lista de xAI, bajo una tarifa de traspaso que pone un cambio de tarifa del proveedor de nuestro lado el mismo día en lugar de esperar a que un revendedor renegocie. La conmutación por error automática es la parte que se gana su lugar específicamente para este modelo: una ventana de 500.000 tokens con un acantilado de 200.000 tokens es una carga de trabajo en la que una solicitud ocasionalmente cae en el lado equivocado de la línea, y una ruta que se mueve entre proveedores upstream sin un despliegue vale más que una fracción de centavo por token.
GPT-6 Luna no aparece en nuestro catálogo a la fecha de esta redacción y se accede a él a través de la propia API de OpenAI. Así que un equipo que quiera ambos ejecuta una clave para Grok 4.6 junto con la que ya utiliza para OpenAI. El DSL de enrutamiento es la pieza que encaja con este emparejamiento: una regla que envíe los prompts que superen un umbral de tokens al modelo cuyo umbral de precio rebasen, y todo lo que quede por debajo al modelo que cuesta la doceava parte, puede expresarse como configuración en lugar de como una bifurcación en tu aplicación — lo cual importa cuando los umbrales están tan cerca de los tamaños habituales de los prompts como lo están estos dos.

¿Cuál, y cuándo?
Elige GPT-6 Luna si tu carga de trabajo es de gran volumen, consumida por programas y breve. Clasificación, extracción, enrutamiento, resumen masivo, el bucle interno de un agente. A $0.10/$0.50 con una lectura en caché de un centavo, frente a un modelo que cuesta veintiséis veces más por tarea completada por siete puntos de índice con el mismo esfuerzo, la aritmética no está reñida. Establece el parámetro de esfuerzo explícitamente —el valor predeterminado es medio y el 37 destacado es un número de esfuerzo máximo— y mantén tus llamadas largas por debajo de 272.000 tokens.
Elige Grok 4.6 si necesitas la capacidad ciber, si una persona lee tu salida y vale la pena pagar por su concisión, o si tienes una carga de trabajo de 300.000 a 500.000 tokens que GPT-6 Luna puede atender pero en la que preferirías no ser el primer equipo en descubrir cómo se comporta con esa longitud. Presupuesta explícitamente el acantilado de los 200.000 tokens, y no lo pongas detrás de una superficie interactiva con esfuerzo alto: 38 segundos hasta el primer token no es una cifra de latencia, es una declaración sobre para qué sirve el modelo.
El error que invita esta comparación es tratar la tasa veinte veces mayor como la decisión. Lo es para una forma de carga de trabajo. Para la otra, la decisión se toma en 200.000 y 272.000 tokens, y la relación de precios es un detalle que se lee después.

Comparados en este artículo1
Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario
