Un tablero de puntuación comparativo de dos columnas generado, titulado 'GPT-6.1 Sol vs GPT-6 Luna - el marcador'. Columna izquierda 'GPT-6.1 Sol': filas que dicen 'Índice de inteligencia: 51.8', 'Costo por tarea de índice: $0.72', 'Precio por 1M: $2.00 / $10.00', 'Tokens de salida en la ejecución del índice: 67M', 'Terminal-Bench 4.0: 56.1%', 'Nivel mínimo de esfuerzo: bajo'. Columna derecha 'GPT-6 Luna': filas que dicen 'Índice de inteligencia: 38.1', 'Costo por tarea de índice: $0.07', 'Precio por 1M: $0.10 / $0.50', 'Tokens de salida en la ejecución del índice: 144M', 'Terminal-Bench 4.0: 12.6%', 'Nivel mínimo de esfuerzo: ninguno'. Un pie de página dice 'Cifras independientes según Artificial Analysis v4.3.2 con esfuerzo máximo; precios de lista del proveedor'.
Guides & Insights

GPT-6.1 Sol vs GPT-6 Luna: Trece puntos de índice, diez veces el dinero y dos evaluaciones donde no se sostiene

Autor

Magnus Corvin

Fecha de publicación

Últimos modelos · 20Ver todos los modelos →
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

OpenAI lanzó GPT-6.1 Sol el 29 de septiembre de 2026, una semana después de que GPT-6 Lunallegara el 22 de septiembre en el mismo ciclo de presentación. Son los dos extremos de la misma generación: Luna es el nivel barato, Sol es el nivel intermedio por encima de él, y GPT-6 Astra se sitúa por encima de ambos. La diferencia de precio entre los dos es de un orden de magnitud —0,10 $ y 0,50 $ por millón de tokens frente a 2,00 $ y 10,00 $; entrada en caché 0,01 $ frente a 0,10 $—, y la diferencia de capacidades en la tabla independiente es de 13,7 puntos de Intelligence Index, 51,8 frente a 38,1 con el máximo esfuerzo de razonamiento. Diez veces el dinero por trece puntos es, más o menos, el peor tipo de cambio de la actual línea de OpenAI. Lo que hace que merezca la pena escribir sobre esta comparación es la pregunta de cuarenta dólares que viene después: ¿cuáles trece puntos?

Los dos modelos, y la semana entre ellos

GPT-6 Luna es el modelo pequeño de la generación GPT-6: el que OpenAI describe como creado para trabajo de gran volumen y sensible a la latencia: clasificación, extracción, enrutamiento, resumen masivo, el bucle interno de un agente. Tiene una ventana de contexto de 1.050.000 tokens y un límite de salida de 128.000 tokens, acepta texto, imágenes y archivos como entrada, y conserva la escalera completa de seis niveles de esfuerzo, incluido none, que el nivel 6.1 eliminó. La tarifa es la razón de su existencia: 0,10 $ de entrada y 0,50 $ de salida por millón de tokens, entrada en caché a 0,01 $ y escrituras en caché a 0,125 $, con un escalón de contexto largo por encima de 272.000 tokens de entrada a 0,20 $, 0,75 $ y 0,02 $ en caché.

GPT-6.1 Sol es la actualización de gama media lanzada una semana después. Misma ventana, mismo límite de salida, mismas modalidades de entrada, una fecha de corte de conocimiento del 30 de abril de 2026 frente a la de Luna, y una escala de esfuerzo que comienza en low porque none y minimal se rechazan directamente. Tiene un precio de $2.00 y $10.00, con la entrada en caché a $0.10 — veinte veces la tarifa de entrada de Luna y veinte veces su tarifa de salida, con una línea de caché que es diez veces más cara por cada acierto en caché.

Ambos están a la venta, ambos están en ChatGPT Work y Codex, así como en la API, y ambos se pueden invocar a través de la misma clave de nuestro lado. Nada de este emparejamiento requiere elegir.

Lo que realmente compran trece puntos de índice

El compuesto es el número menos informativo de la comparación, porque promedia tareas que se comportan de forma muy diferente. Puntuado evaluación por evaluación con el máximo esfuerzo de razonamiento en Artificial Analysis v4.3.2, la forma es una división en lugar de una pendiente:

• AA-LCR v1.1, razonamiento de contexto largo — GPT-6 Luna 0.833 vs GPT-6.1 Sol 0.830. Luna está ligeramente por delante.

• SciCode — GPT-6 Luna 0,546 frente a GPT-6.1 Sol 0,542. De nuevo, efectivamente empatados y, de nuevo, el modelo más barato está nominalmente por delante.

• Terminal-Bench 4.0 — GPT-6 Luna 0.126 vs GPT-6.1 Sol 0.561. Una diferencia de 43 puntos; los dos modelos están en ligas distintas en el trabajo de terminal.

• Humanity's Last Exam — GPT-6 Luna 0.385 vs GPT-6.1 Sol 0.529.

• AutomationBench-AA — GPT-6 Luna 0.532 frente a GPT-6.1 Sol 0.649.

• GDPval-AA v2.1 — GPT-6 Luna Elo 1437,1 frente a GPT-6.1 Sol Elo 1575,1, una diferencia de 138 puntos Elo en trabajo de conocimiento profesional.

• GDP.pdf — GPT-6 Luna 0,228 vs GPT-6.1 Sol 0,310.

• CritPt — GPT-6 0.194 frente a GPT-6.1 Sol 0.317.

• AA-Omniscience — GPT-6 Luna 0,65 frente a GPT-6.1 Sol 41,5. En una escala en la que cero significa tantas respuestas correctas como incorrectas, Luna está justo en la línea de flotación y Sol se sitúa claramente por encima.

• MMMU-Pro — GPT-6 Luna 0,797 vs GPT-6.1 Sol 0,860.

• Coste por tarea de indexación, independiente — GPT-6 Luna $0,068 vs GPT-6.1 Sol $0,72; una diferencia de aproximadamente diez veces a favor del modelo barato

• Tokens de salida en la ejecución del índice — GPT-6 Luna 144 millones frente a GPT-6.1 Sol 67 millones, frente a una mediana de clase de 100 millones para Luna y unos 81 millones para Sol

Dos de diez evaluaciones son un empate a favor del modelo barato. Ocho van al caro, y en seis de esas ocho el margen no es marginal. Esa es la lectura honesta de los trece puntos: no es un gradiente de calidad uniforme, son dos capacidades —ejecución agéntica sostenida y fiabilidad fáctica— donde Luna simplemente no es de la misma clase de modelo, y un amplio término medio donde la diferencia es real pero lo bastante pequeña como para ser invisible en tu propio conjunto de evaluación.

El resultado de AA-LCR merece una salvedad, porque es la cifra que más favorece a Luna. El razonamiento de contexto largo con 0.833 es una puntuación sólida y los dos modelos están a menos de medio punto de distancia, pero el benchmark mide recuperación y razonamiento sobre entradas largas, no la capacidad de actuar a lo largo de una sesión larga. La diferencia en Terminal-Bench 4.0 es cómo se ve "actuar a lo largo de una sesión larga" cuando se puntúa, y es de 43 puntos de amplitud.

A generated hero card for a GPT-6.1 Sol versus GPT-6 Luna comparison, headed 'Thirteen index points, ten times the money', with two badges reading 'GPT-6.1 Sol: 51.8 at $2.00 / $10.00 per 1M' and 'GPT-6 Luna: 38.1 at $0.10 / $0.50 per 1M', a footer reading 'Independent figures per Artificial Analysis v4.3.2 at max effort; vendor list prices.', and the OrcaRouter logo in the bottom-right corner.

La aritmética del costo por tarea, y dónde deja de ser cierta

Artificial Analysis fija el precio de cada ejecución del índice a partir del consumo de tokens medido, por lo que la cifra de coste no es una inferencia basada en una tarifa publicada. La ejecución de GPT-6 Luna costó 0,068 $ por tarea; la de GPT-6.1 Sol costó 0,72 $. La proporción es de 10,7×, algo peor que la relación nominal de precios de veinte a uno solo porque Luna generó 144 millones de tokens de salida en la ejecución frente a los 67 millones de Sol: el modelo barato es más del doble de verboso, y eso erosiona su propia ventaja. Aun así, no están nada cerca en la clasificación, y en una carga de trabajo de respuestas cortas esa diferencia se ampliaría: un menor volumen de salida hace que la penalización por verbosidad de Luna se reduzca mientras que su ventaja de precio permanece fija.

Donde la aritmética deja de ser cierta es en cualquier carga de trabajo a la que el índice no se parezca. Si tu tarea es una edición a escala de repositorio que exige que veinte llamadas a herramientas se mantengan coherentes, un modelo de $0,07 que falla en la tarea te cuesta todo el bucle de reintentos más el tiempo transcurrido, y el modelo de $0,72 que la termina de una sola vez es más barato. El propio planteamiento de lanzamiento de GPT-6.1 Sol se basa enteramente en esta idea: el coste por completar una tarea — y ese es el marco correcto: la comparación pertinente no es la tarifa por token, sino el coste esperado por resultado, y en las tareas que Luna no puede completar esa expectativa no tiene límite.

Dos detalles estructurales agudizan la frontera. Primero, el paso de contexto largo: ambos modelos cambian de precio por encima de 272.000 tokens de entrada, Luna a $0,20 y $0,75 y Sol a $4,00 y $15,00, así que la brecha absoluta se amplía en la frontera en lugar de cerrarse, pero la tarifa recalculada de Luna sigue estando un orden de magnitud por debajo de la estándar de Sol. Segundo, y fácil de pasar por alto: la escala de esfuerzo no tiene la misma forma. Luna acepta none; Sol, no. Una cascada que enruta primero a Sol y recurre a Luna como respaldo ante un error o un tiempo de espera no debe propagar sin cambios el reasoning.effort de la solicitud, porque una configuración que es válida en un modelo devuelve un error en el otro. Eso es una cuestión de la capa de enrutamiento, no de la calidad del modelo, y es exactamente el tipo de cosa que se supone que debe absorber un único endpoint con una regla de enrutamiento.

Ejecutar ambos es el objetivo, no una cobertura

Ambos modelos están en OrcaRouter a los propios precios de lista de Open​AI sin nada añadido: GPT-6 Luna a $0.10 y $0.50 con entrada en caché a $0.01, GPT-6.1 Sol a $2.00 y $10.00 con entrada en caché a $0.10, y el paso de 272,000 tokens en cada uno se transfiere exactamente como lo indica el proveedor. Debido a que la plataforma transfiere el precio de lista del proveedor en lugar de aumentarlo, la proporción de veinte veces en este artículo es la proporción que realmente pagas, en ambos lados.

A screenshot of the OrcaRouter model page for openai/gpt-6-luna, showing the listing dated 2026-09-22, the model described as the fast, cost-efficient tier of OpenAI's GPT-6 series for high-volume and latency-sensitive workloads, a 1M-token context with 128K maximum output, text, image and file input, and the list price of $0.10 input and $0.50 output per million tokens with a 1.45 s median time to first token.

La razón que importa aquí en concreto es que este par es una cascada esperando a ser escrita. Un clasificador, un enrutador, un trabajo de extracción masiva y un agente de programación a escala de repositorio no pertenecen al mismo modelo, y la diferencia de precio es lo bastante amplia como para que elegir mal en cualquiera de las dos direcciones sea costoso: veinte veces demasiado por llamada en una dirección, una tarea fallida en la otra. Una clave, dos modelos y una regla que envía el tráfico fácil a Luna y escala a Sol cuando cambia la clase de tarea o la salida de Luna no pasa una verificación es un cambio de configuración de nuestro lado, no un segundo contrato con un proveedor. La conmutación automática por error cubre el caso en que uno de los dos esté degradado, lo cual, para un modelo que se lanzó hace ocho días, sigue siendo una posibilidad real.

A screenshot of OpenAI's GPT-6 Luna documentation page, showing the model ID gpt-6-luna, the effort ladder supporting none, low, medium, high, xhigh and max, a 1,050,000-token context window with 128,000 maximum output tokens, a May 18, 2026 knowledge cutoff, and the pricing table listing input at $0.10, cached input at $0.01, cache writes at $0.125 and output at $0.50 per million tokens.

La decisión, en una sola pasada

• Clasificación, extracción, enrutamiento, resumen masivo, bucles internos de agentes — GPT-6 Luna, y deja de leer. A $0.10/$0.50 con una lectura en caché de un centavo, trece puntos de índice de capacidad general no valen diez veces la factura en trabajos donde la respuesta es corta y comprobable.

• Programación a escala de repositorio, agentes de terminal, ejecución de varios pasos — GPT-6.1 Sol. La diferencia de 43 puntos en Terminal-Bench 4.0 es todo el argumento; esta es la capacidad que el precio está comprando.

• Preguntas de trabajo del conocimiento en las que una respuesta errónea sale cara — GPT-6.1 Sol, sobre las brechas de AA-Omniscience y GDPval-AA. La puntuación de fiabilidad fáctica de Luna está justo en la línea de flotación.

• Entradas largas con una respuesta generada corta — GPT-6 Luna. Razon sobre contextos largos a la par de un modelo que cuesta veinte veces más, y su penalización de verbosidad de 144 millones de tokens nunca llega a aplicarse.

• Cualquier cosa que ya esté estableciendo none — quédate en Luna, o presupuesta el cambio. Ese nivel no existe en GPT-6.1 Sol.

• Superficies sensibles a la latencia — GPT-6 Luna, según las propias mediciones del tablero: 129,4 tokens de salida por segundo y 100 segundos hasta el primer fragmento, frente a los 59,7 y 332 de Sol.

Comparados en este artículo1

Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario