
GPT-6 Luna vs Gemini 3.1 Pro: una vista previa con siete meses de antigüedad a veinte veces el precio de entrada
- OrcaNUEVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens
- orcaNUEVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens
- deepseekNUEVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligencia72Código
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligencia76Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Inteligencia69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
El modelo de razonamiento de frontera lleva la etiqueta «Preview» desde que Gemini 3.1 Pro se lanzó el 19 de febrero de 2026. Siete meses después, sigue siendo una vista previa, sigue costando 2,00 dólares por millón de tokens de entrada y 12,00 dólares por millón de salida, y sigue siendo lo que la página del producto denomina el modelo de razonamiento de frontera de la empresa. El 22 de septiembre de 2026, el proveedor lanzó GPT-6 Luna como un nivel pequeño de disponibilidad general a 0,10 y 0,50 dólares. Ponga las dos tarifas de precios una al lado de la otra y el modelo más nuevo, más barato y de disponibilidad general es veinte veces más barato en entrada y veinticuatro veces más barato en salida, y además obtiene una puntuación más alta en el índice independiente que importa a los departamentos de marketing de ambos proveedores.
Esa última cláusula es la parte que merece que nos detengamos. GPT-6 Luna obtiene 37 en el Artificial Analysis Intelligence Index con esfuerzo máximo. Gemini 3.1 Pro Preview obtiene 30 en la misma revisión. Un modelo que se vende como una propuesta de eficiencia para alto volumen está siete puntos por delante de un modelo que se vende como un sistema de razonamiento de frontera, a una vigésima parte del precio de entrada. No se trata de que un modelo barato esté alcanzando a uno caro. En este eje en particular, el modelo barato simplemente está por delante, y el caro lleva siete meses en fase de preview.
La conclusión natural —que Gemini 3.1 Pro tiene un precio excesivo— tampoco es del todo acertada, y el resto de este artículo trata sobre los tres puntos en los que el modelo de Google justifica su tarifa, porque son reales y no son pequeños.
Las cinco cosas que lo deciden
Antes del detalle, la versión corta:
• GPT-6 Luna gana en precio por unas 20 veces en la entrada y 24 veces en la salida, en la entrada en caché por un amplio margen, y en el índice de propósito general por siete puntos con un esfuerzo máximo igualado.
• Gemini 3.1 Pro gana en cuanto a modalidad de entrada —acepta audio y video, algo que GPT-6 Luna no— y en llevar siete meses disponible, lo que para una versión preliminar supone una extensa trayectoria en producción.
• Los límites máximos de salida no están cerca en ninguna de las dos direcciones: GPT-6 Luna emite hasta 128.000 tokens, Gemini 3.1 Pro hasta 65.000.
• Ambos tienen un límite de nivel de contexto largo que recalcula el precio de toda la solicitud: 272.000 tokens de entrada para GPT-6 Luna y alrededor de 200.000 para Gemini 3.1 Pro.
• La trampa del esfuerzo predeterminado se aplica solo a Luna: su 37 es una puntuación de esfuerzo máximo y su configuración media predeterminada obtiene 29, que está por debajo del 30 de Gemini 3.1 Pro.
Dos tarifarios y la aritmética entre ellos
Una línea por dimensión, ambos lados en cada una:
• Entrada por 1M — GPT-6 Luna $0.10 vs Gemini 3.1 Pro $2.00
• Salida por 1M — GPT-6 Luna $0.50 vs Gemini 3.1 Pro $12.00
• Entrada en caché — GPT-6 Luna $0.01 por 1M, un descuento del 90 % frente a Gemini 3.1 Pro $0.20 por 1M, un descuento del 90 %
• Límite de contexto largo — GPT-6 Luna por encima de 272K tokens de entrada vs Gemini 3.1 Pro por encima de aproximadamente 200K tokens de entrada
• Efecto de contexto largo — GPT-6 Luna 2x en entrada y caché, 1.5x en salida, en toda la solicitud frente a Gemini 3.1 Pro $4.00 de entrada / $18.00 de salida, también en toda la solicitud
• Ventana de contexto — GPT-6 Luna 1.050.000 tokens vs Gemini 3.1 Pro 1 M tokens
• Salida máxima — GPT-6 Luna 128.000 tokens vs Gemini 3.1 Pro 65.000 tokens
• Modalidad de entrada — texto e imagen de GPT-6 Luna vs. texto, imagen, audio, video y archivos de Gemini 3.1 Pro
• AA Intelligence Index — GPT-6 Luna 37 con esfuerzo máximo, 29 por defecto frente a Gemini 3.1 Pro 30
• Velocidad de salida — GPT-6 Luna 153,9 tokens/seg frente a Gemini 3.1 Pro, aproximadamente 115-143 tokens/seg según la instantánea
• Interruptor de razonamiento desactivado — GPT-6 Luna, de ninguno a máximo vs. Gemini 3.1 Pro, primero el razonamiento, sin modo sin razonamiento expuesto
• Estado — GPT-6 Luna con disponibilidad general desde 2026-09-22 frente a Gemini 3.1 Pro en vista previa desde 2026-02-19

La fila interesante no es el precio. Es el par de filas de abajo. La etiqueta de vista previa de Gemini 3.1 Pro no es un tecnicismo: cambia lo que Google te debe. Un modelo en vista previa puede cambiarse, recibir otro precio o retirarse sin el aviso de descontinuación que recibe un modelo de disponibilidad general (GA), y un precio que no ha cambiado en siete meses es una promesa que nadie ha hecho por escrito. Todo lo que sigue sobre que el modelo de Google sea la apuesta de producción más segura debe leerse teniendo en cuenta esa salvedad, porque "siete meses de estabilidad" y "siete meses sin una garantía de estabilidad" son los mismos siete meses.
Dónde el modelo de Google se gana las veinte veces adicionales
Tres lugares, y el primero es el que pone fin a la comparación para algunos equipos de manera definitiva.
Modalidad. Gemini 3.1 Pro acepta entrada de audio y vídeo. GPT-6 Luna acepta texto e imagen. Si tu pipeline ingiere grabaciones de llamadas, capturas de pantalla o vídeo, no hay ninguna versión de esta comparación en la que la diferencia de precio importe, porque uno de los dos modelos no puede hacer el trabajo. Eso no es una brecha de benchmark que se reduzca con una versión puntual; es una capacidad que o está presente o está ausente, y es la razón más contundente por la que el tarifario de Google sobrevive al contacto con un proceso de compra real.
Techo de salida, en la otra dirección. Los límites de salida van en sentido opuesto a los de la modalidad de entrada, y este favorece a OpenAI. GPT-6 Luna emite hasta 128.000 tokens en una sola respuesta; Gemini 3.1 Pro, hasta 65.000. Si generas artefactos estructurados extensos —un documento completo, una refactorización grande, un parche de varios archivos—, el techo de Google es aproximadamente la mitad del de OpenAI, y un pipeline que trunca a los 65.000 tokens está roto, sin importar lo que pague por token.
Trabajo de frontera multimodal.El posicionamiento de Gemini 3.1 Pro es el de un modelo de razonamiento que resulta ser multimodal, y la consecuencia práctica es que las tareas que requieren razonar sobre un diagrama, un gráfico o una grabación de pantalla recaen en él en lugar de en una categoría pequeña centrada en el texto. GPT-6 Luna acepta imágenes, así que el límite no son solo el audio y el video: es que el modelo de Google está diseñado para el razonamiento visual y de audio como caso de uso principal, y el de OpenAI está diseñado para la capacidad de procesamiento.
Dónde pierde realmente el nivel barato, y no es donde esperas
El valor predeterminado de esfuerzo es la trampa en este emparejamiento, y golpea más fuerte aquí de lo que lo haría contra un oponente más débil. La puntuación del índice principal de GPT-6 Luna, 37, se mide con el máximo esfuerzo de razonamiento. Su valor predeterminado es medio, y en medio obtiene 29 — un punto por debajo de los 30 de Gemini 3.1 Pro. Así que la ventaja de siete puntos con la que abría este artículo es una comparación entre el techo de un modelo y el techo de otro, y un equipo que instala GPT-6 Luna y deja la configuración tal cual está ejecutando un modelo que está ligeramente por detrás del de Google, siete meses más antiguo, todavía en vista previa, a una vigésima parte del precio.
Eso sigue siendo, para la mayoría de las cargas de trabajo, la decisión correcta: un punto de índice no es una diferencia de capacidad, y una diferencia de precio de 20x sí lo es. Pero es una decisión distinta de la que anuncian las tarifas, y es invisible a menos que uno se ponga a buscar el parámetro de esfuerzo.
El segundo punto donde el nivel barato pierde es la aritmética de contexto largo. Ambos modelos recalculan el precio de toda la solicitud en cuanto cruza un umbral, en lugar de aplicar un recargo solo al exceso, y ambos umbrales son lo bastante bajos como para importar: 272,000 tokens de entrada en GPT-6 Luna, y unos 200,000 en Gemini 3.1 Pro. La cláusula de GPT-6 Luna duplica la entrada y la caché, y eleva la salida en un 50 %. La de Gemini 3.1 Pro lleva toda la llamada a $4.00 de entrada y $18.00 de salida. Ninguna es un recargo marginal, y en un modelo que se vende por su precio, la cláusula es el precio.
El tercero es la verbosidad, que es la línea de coste que nunca aparece en una lista de tarifas. Artificial Analysis midió que GPT-6 Luna generaba 150 millones de tokens de salida durante la ejecución del índice, frente a una mediana de 85 millones: el modelo es hablador y, a $0,50 por millón de salida, eso son $75 en tokens donde un modelo conciso habría gastado $42,50. Sigue siendo un orden de magnitud más barato que la alternativa. También es la razón por la que las cifras de coste por tarea y las de coste por token cuentan historias diferentes, y la razón para medir tu propio volumen de salida antes de modelar el ahorro.
Cómo se ve una migración entre ellos
El modelo de Google es accesible a través de la API propia del proveedor y de varias plataformas de terceros; GPT-6 Luna es accesible a través de la API propia de OpenAI y, hasta el momento de escribir esto, ninguna de las dos es la mitad más sencilla de la pareja sobre la que estandarizar. Ambas exponen una superficie de chat completions compatible con OpenAI, lo que significa que la forma de la llamada no es el problema: los parámetros sí lo son. La escalera de esfuerzo de GPT-6 Luna, su cláusula de 272.000 tokens y su requisito de que el function calling en Chat Completions se ejecute con el esfuerzo de razonamiento establecido en none son comportamientos que Gemini 3.1 Pro no comparte, y un port que cambie únicamente la cadena del modelo producirá una llamada funcional con un perfil de coste incorrecto.
Gemini 3.1 Pro Preview está en OrcaRouter al precio de lista de Google, bajo el modelo de precios de traspaso, lo que significa que un cambio de tarifas de Google entra en vigor en nuestro lado el mismo día. GPT-6 Luna no está en nuestro catálogo al momento de escribir esto. Para un equipo que use ambos —el modelo de Google para todo lo que necesite audio o video, el de OpenAI para texto de gran volumen—, eso es una única clave para Gemini 3.1 Pro junto con lo que ya uses para OpenAI, con la decisión de enrutamiento expresada como configuración en lugar de como dos rutas de código. Este es el emparejamiento donde eso más importa, porque los dos modelos no son intercambiables en absoluto: una ruta que tenga que elegir entre una preview multimodal y un nivel pequeño de GA solo para texto es una ruta que se volverá a decidir cada vez que cualquiera de los proveedores saque una versión.

¿Qué cambiaría esto?
La comparación tal como está es una instantánea de un momento inusual: un modelo GA de septiembre supera a un modelo preview de febrero en el índice general a un vigésimo del precio de entrada, mientras pierde en modalidad y en la madurez que un preview nunca llega a alcanzar del todo. Tres cosas podrían cambiarlo, y cada una merece la pena observarse en lugar de conjeturar.
El primero es Gemini 3.1 Pro saliendo de la vista previa. Un lanzamiento GA traería una política de descontinuación, una tarifa estable y, muy probablemente, un movimiento de precios — Google ha mantenido $2.00/$12.00 durante siete meses de vista previa mientras el resto del mercado se reducía a la mitad a su alrededor, y esa contención es más coherente con un precio de lanzamiento a la espera de una fecha de GA que con una posición meditada.
El segundo es si OpenAI amplía la escalera de esfuerzo de Luna o cambia su valor predeterminado. La diferencia de veintidós puntos entre la puntuación de esfuerzo máximo de GPT-6 Luna y su puntuación de esfuerzo predeterminado es la mayor sensibilidad de configuración de este artículo, y un cambio del valor predeterminado alteraría la capacidad efectiva del modelo para cada llamador que nunca tocó el parámetro.
La tercera es la brecha de modalidad. Es la única dimensión aquí que no es una cuestión de grado, y es la que impide que esto sea una comparación directa de precios. Hasta que uno de estos modelos pueda hacer lo que el otro no puede, la brecha de veinte veces es una cifra real que apunta a dos trabajos diferentes.

Comparados en este artículo1
Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario
