
GPT-6 Sol y GPT-6 Luna: El token más barato no siempre es la tarea más barata
- OrcaNUEVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens
- orcaNUEVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens
- deepseekNUEVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligencia72Código
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligencia76Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Inteligencia69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
El proveedor envió GPT-6 Sol y GPT-6 Lunael 22 de septiembre de 2026, y el titular en todas partes es el precio: Sol a $2.00 por millón de tokens de entrada y $10.00 de salida, Luna a $0.10 y $0.50, ambos aproximadamente la mitad de lo que cobran GPT-5.6 Sol y GPT-5.6 Luna con las tarifas promocionales actuales, y ambos muy por debajo del buque insignia GPT-6 Astra a $10.00/$50.00. El propio anuncio del proveedor abre con «también hemos hecho que el almacenamiento en caché y la inferencia sean más eficientes». El problema de leer eso como una historia de descuentos es que la unidad que realmente llega a tu factura no es un token. Es una tarea. Y las primeras mediciones independientes, publicadas ese mismo día, muestran que los dos nuevos modelos se desvían en direcciones opuestas justo en esa unidad — y GPT-6 Luna, el más barato de los dos por un factor de veinte en entrada, es el que peor se comporta de los dos frente a su propio predecesor. Uno de estos modelos es una mejora directa y el otro es un auténtico intercambio, y el anuncio del proveedor no distingue entre ellos.
Antes de los números, las reglas de fuentes de este artículo, porque los dos conjuntos de pruebas que hay aquí merecen un peso muy distinto. Los precios, la ventana de contexto, las tarifas de caché y las fechas de corte de conocimiento provienen de la propia documentación de la API y las tablas de precios de OpenAI, consultadas el 23 de septiembre de 2026, y las líneas sobre niveles de servicio y escritura de caché se corroboraron con rastreadores de costes de terceros en lugar de tomarlas únicamente del anuncio. Las tablas de referencia de OpenAI —AutomationBench, DeepSWE 1.1, OSWorld 2.0, Agents' Last Exam y una evaluación interna de factualidad— son reportadas por el proveedor y no se han reproducido, y cada cifra extraída de ellas a continuación se etiqueta como tal. Los números independientes provienen de Artificial Analysis, que ejecutó ambos modelos en su Intelligence Index y su Coding Agent Index el día del lanzamiento; esos son los que conviene tener en cuenta para tomar una decisión. Donde ambos discrepan, el artículo lo señala en lugar de promediarlos.
El lanzamiento, en un párrafo
Sol y Luna son miembros de gama media y baja de la familia GPT-6, entrenados con los métodos que hay detrás de GPT-6 Astra y posicionados como formas más rápidas y económicas de alcanzar la mayor parte de su capacidad. El planteamiento de OpenAI es el coste por tarea más que la capacidad bruta: afirma que GPT-6 Sol comete aproximadamente la mitad de errores que GPT-5.6 Sol en su evaluación interna de factualidad, y que GPT-6 Luna, con un mayor esfuerzo de razonamiento, iguala la factualidad de GPT-5.6 Sol a alrededor de una centésima parte del coste por tarea. Ambos aceptan entrada de texto e imágenes y producen texto, ambos cuentan con una ventana de contexto de 1.050.000 tokens con un límite de salida de 128K —Artificial Analysis indica 872k para el mismo modelo, así que conviene tomar el extremo superior de esa ventana como una cifra declarada por el proveedor— y ambos exponen un esfuerzo de razonamiento desde none hasta max, un nivel que GPT-6 Astra no ofrece, porque Astra no tiene none. Los ID de los modelos son gpt-6-sol y gpt-6-luna. La disponibilidad abarca la API, ChatGPT Work y Codex para cuentas Plus, Pro, Business, Enterprise y Edu, y Amazon Bedrock, que anunció la disponibilidad general de ambos el mismo día. Los usuarios gratuitos y de Go obtienen Luna en la aplicación de escritorio; ninguno de los modelos está todavía en el modo Chat normal.
Lo que dicen los cuatro números independientes y por qué discrepan
Comienza con GPT-6 Sol, porque su historia es simple. Artificial Analysis le asigna 48 en el Intelligence Index, 18.º de 212 modelos medidos, a $1.06 por tarea de índice frente a $1.99 para GPT-5.6 Sol — aproximadamente la mitad del costo para una puntuación de índice de nivel, y una mejora de costo por tarea que se mantiene en lugar de evaporarse. Su Coding Agent Index aumenta de 55 a 57, con Terminal-Bench 4.0 moviéndose del 37% al 43% y SWE-Atlas-QnA del 54% al 58%, a $2.99 por tarea en la frontera de Pareto. Su tasa de alucinación cae del 92% al 60%, y su comportamiento de abstención cambia de forma por completo: ahora responde el 83% de las preguntas donde la generación anterior respondía el 99%, y a cambio obtiene una cuarta parte menos de respuestas incorrectas, con la precisión bajando del 59% al 54%. Ese es un modelo al que se le ha enseñado a callarse cuando no sabe, y el AA-Omniscience Index moviéndose de 22 a 27 es ese mismo hecho expresado como una puntuación.
Ahora, con GPT-6 Luna, la historia cambia. Artificial Analysis le otorga 37 en el Intelligence Index — la misma cifra que obtiene GPT-5.6 Luna. Su coste por tarea del índice baja de 0,18 $ a 0,07 $, alrededor de un 60% menos, y ese ahorro es real. Pero su Coding Agent Index baja, de 43 a 41, con SWE-Atlas-QnA cayendo del 49% al 44% y DeepSWE 1.1 cayendo del 66% al 64%. Su tasa de alucinación mejora del 93% al 77%, y su comportamiento de abstención apenas varía — precisión del 44% frente al 43%, AA-Omniscience de −10 a 1. Leído en conjunto: la misma inteligencia medida, a aproximadamente el 40% del coste por tarea, con un peor agente de programación y una calidad de respuesta prácticamente inalterada.
Eso no es una contradicción, y la razón importa. Un token más barato te da menos solo si el modelo gasta más tokens para terminar el mismo trabajo — y los datos independientes dicen que estos modelos gastan más, no menos. La salida por tarea de índice subió de 29k a 31k tokens para Sol y de 41k a 51k para Luna. El ahorro del 60 % de GPT-6 Luna proviene enteramente de la reducción de precio, no de funcionar de forma más austera. La deriva de tokens por tarea es lo bastante pequeña como para que la aritmética siga favoreciéndote aquí; no es lo bastante pequeña como para ignorarla como categoría, porque es el mecanismo por el cual una futura reducción de precio puede verse neutralizada por un modelo más hablador. El propio enfoque de OpenAI se ha trasladado al costo por tarea por la misma razón.
Dos regresiones quedan fuera de los dos índices principales y merecen que se les ponga nombre, porque ninguna aparece en el anuncio de OpenAI. En GDPval-AA v2.1, que mide entregables de trabajo de conocimiento, GPT-6 Sol pierde aproximadamente 100 Elo frente a su predecesor, y GPT-6 Luna, alrededor de 75. GPT-6 Luna también cede unos 45 Elo en AA-Briefcase v1.1, donde Sol se mantiene estable — Artificial Analysis atribuye la diferencia a una presentación más débil y a elementos de rúbrica ausentes. Si tu uso del nivel económico consiste en resumir, extraer y clasificar de forma masiva, nada de eso te afecta. Si consiste en redactar algo que una persona revisa y aprueba, sí te afecta.

El cambio en el almacenamiento en caché es la verdadera noticia de la API
Bajo la tabla de precios se esconde un cambio que importa más para una factura de producción que la rebaja estrella, y es la parte del anuncio a la que el propio texto de OpenAI alude con una sola cláusula. Tres cosas cambiaron, y la tercera es la que hay que leer dos veces.
El primero es el descuento en sí: las lecturas de entrada en caché se facturan al 10 % de la tarifa de entrada, un descuento del 90 %, que es la misma condición que la familia ya venía aplicando en lugar de una nueva. La entrada en caché de Sol es de $0.20 por millón y la de Luna es de $0.01; las escrituras en caché conllevan un recargo de 1.25x, $2.50 y $0.125 respectivamente, con un único tiempo de vida de 30 minutos.
El segundo es el control. El almacenamiento en caché explícito mediante prompt_cache_options y prompt_cache_breakpoint — los parámetros que te permiten declarar dónde termina un prefijo de prompt reutilizable en lugar de confiar en que el proveedor lo adivine — está disponible en ambos modelos. Esto no es una superficie de API nueva; lo nuevo es que vale la pena usarlo, porque las tasas de acierto predeterminadas aumentaron.
El tercero es el que cambia la arquitectura. Cambiar el esfuerzo de razonamiento o activar y desactivar herramientas ya no invalida el prefijo en caché. Antes de esto, un bucle de agente que subía el esfuerzo para un paso difícil y lo bajaba para uno fácil pagaba el coste de reprocesar todo su contexto en cada giro del ajuste, y lo mismo ocurría con uno que añadía o quitaba una herramienta a mitad de la conversación. Ese impuesto ya no existe en estos dos modelos. OpenAI cita a GitHub, que informó de que los cambios redujeron en más de la mitad la proporción de tokens de prompt que necesitan procesamiento nuevo a lo largo de miles de millones de solicitudes. Tómese eso como una cifra proporcionada por el proveedor: es creíble y no está auditada de forma independiente.
Haz los cálculos con un bucle de agente largo y la clasificación de los dos anuncios se invierte. Un bucle que arrastra un prompt de sistema de 30.000 tokens y un esquema de herramientas a lo largo de 200 turnos mueve 6 millones de tokens de contexto. Sin caché, en GPT-6 Sol, eso supone $12,00 de entrada. Con el prefijo en caché a $0,20 por millón, son $1,20 más la escritura única: un orden de magnitud, por un cambio de parámetro, antes de que se aplique siquiera la rebaja de tarifas. La rebaja de tarifas es lo que vendió el anuncio. El comportamiento de la caché es lo que realmente mueve la cifra, y es la razón por la que una tarifa anunciada de $2,00 se comporta como algo mucho más barato en las cargas de trabajo para las que OpenAI está promocionando estos modelos.
La tarjeta de tarifas, incluidas las partes que el anuncio omite
Las tarifas destacadas no son toda la tarifa, y tres niveles cambian la decisión para cargas de trabajo específicas.
• Base — GPT-6 Sol $2.00 de entrada / $10.00 de salida; GPT-6 Luna $0.10 de entrada / $0.50 de salida, por millón de tokens, para prompts de hasta 272K tokens de entrada.
• Contexto largo — por encima de 272K tokens de entrada, la solicitud completa se factura a 2x la entrada y 1.5x la salida: $4.00/$15.00 para Sol y $0.20/$0.75 para Luna. Esto es un acantilado, no una tarifa marginal. Si tus prompts llegan a 300K tokens, pagas el doble por toda la solicitud, no por los 28K que se pasan del límite, y dividir un documento en dos llamadas por debajo del umbral suele ser más barato que enviarlo una vez por encima.
• Niveles de servicio — Flex reduce la factura a la mitad ($1.00/$5.00 para Sol, $0.05/$0.25 para Luna) a cambio de un procesamiento más lento; Priority la duplica. Ambos se seleccionan mediante el parámetro service_tier. Flex es donde deberían vivir los trabajos tipo batch y casi nunca lo hacen.
• Entrada en caché — $0.20 por millón en Sol y $0.01 en Luna, un 90% de descuento, con un TTL de 30 minutos y un recargo de 1,25x por escritura en caché.
• Contexto y salida — ventana de 1.050.000 tokens, salida máxima de 128K, entrada de texto e imagen, salida de texto, esfuerzo de razonamiento de none a max con medium como valor predeterminado.
• Fechas de corte de conocimiento — el 20 de abril de 2026 para GPT-6 Sol y el 18 de mayo de 2026 para GPT-6 Luna, es decir, un mes de diferencia dentro de la misma familia, algo que conviene saber antes de asumir que ambos modelos comparten una misma visión del mundo.
Lo que dice la tabla de referencia de OpenAI, y lo que no
Las comparaciones publicadas por OpenAI son todas de costo por tarea, todas contra Anthropic y todas realizadas por el proveedor. En AutomationBench 1.0.6, una evaluación agéntica de 47 herramientas, la empresa informa que GPT-6 Sol con esfuerzo xhigh obtiene un 33,2 % con un costo de 0,27 $ por tarea, frente a Claude Opus 5, que obtiene un 26,9 % con aproximadamente 11 veces el costo por tarea. En DeepSWE 1.1 informa que Sol con esfuerzo máximo obtiene un 68,8 % frente a Claude Fable 5 con un 69,9 % —una pérdida en puntuación con un costo por tarea aproximadamente 80 % menor—, y Luna con un 66,6 %. En OSWorld 2.0, Sol obtiene un 60,5 % con xhigh frente al 60,3 % de Opus 5, de nuevo con un costo por tarea alrededor de 80 % menor. En Agents' Last Exam, Sol alcanza un 56,4 %, lo que, según OpenAI, supera el mejor resultado de Opus 5 con un costo por tarea 60 % menor.
Todas esas cifras proceden del proveedor y no se han reproducido de forma independiente, y conviene tener presentes dos advertencias en lugar de archivarlas. En primer lugar, OpenAI tomó como referencia Claude Opus 5, no el Claude Opus 5.5 publicado unas horas antes del anuncio, así que ninguna comparación con el mismo entorno de pruebas establece todavía qué modelo ofrece en realidad el menor coste por exitosa. En segundo lugar, el coste por tarea no es el coste por tarea correcta: un modelo que responde el 83% de las veces y se abstiene en el resto parecerá barato por tarea en una prueba que cuenta las abstenciones como tareas. Los datos independientes sobre las abstenciones anteriores son los que te permiten valorar eso con honestidad: que GPT-6 Sol responda al 83% de las preguntas donde el modelo anterior respondía al 99% es un intercambio deliberado, y que sea acertado o no depende por completo de lo que te cueste una respuesta incorrecta.
OpenAI informa de que GPT-6 Luna, con un mayor esfuerzo, iguala la factualidad de GPT-5.6 Sol a aproximadamente una centésima parte del coste de la tarea. Se trata de una comparación de factualidad, no de capacidad, y el índice independiente Coding Agent Index sitúa a GPT-6 Luna dos puntos por debajo de GPT-5.6 Luna, y mucho menos de GPT-5.6 Sol.

Qué hacer realmente con esto
GPT-6 Sol es el sencillo. La mitad del coste por tarea con una puntuación de índice de nivel, un mejor agente de programación, una gran caída de las alucinaciones y un cambio real en el comportamiento de abstención se suman a una actualización que puedes adoptar según un calendario en lugar de una apuesta. Si estás en GPT-5.6 Sol, esto es una migración, y la única pregunta real es cuáles de tus prompts dependen de la disposición del modelo anterior a responderlo todo.
GPT-6 Luna es el que hay que probar antes de cambiar. No es un GPT-5.6 Luna estrictamente mejor; es uno con una forma distinta: más barato por tarea, más cauto respecto a lo que afirmará y mediblemente peor en programación agéntica. Para clasificación, extracción, enrutamiento y resumen a gran volumen, el intercambio es casi dinero gratis. Para cualquier cosa que alimente a un agente de programación, o que genere un documento que una persona apruebe, la regresión de dos puntos en Coding Agent y la caída de GDPval son la razón para mantener GPT-5.6 Luna en el flujo hasta que hayas ejecutado tus propias tareas con ambos.
Ese es también el argumento para no atarse de forma rígida a ninguno de los dos. Ambos modelos son exclusivos de OpenAI en este momento, y las cargas de trabajo que atienden estos niveles —enrutamiento, extracción, clasificación económica— son precisamente aquellas en las que un segundo proveedor detrás del mismo endpoint convierte una regresión del modelo en un no evento. OrcaRouter transfiere los precios de lista de los proveedores con un 0% de margen, así que un cambio de tarifa de un proveedor llega a nuestro lado el mismo día que llega al suyo, y el DSL de enrutamiento te permite poner GPT-6 Luna detrás de un modelo más barato para la parte fácil del tráfico mientras la parte más difícil va a GPT-6 Sol — con conmutación por error automática si cualquiera de las rutas se degrada. No tienes que elegir un ganador el día del lanzamiento para beneficiarte del lanzamiento.
La advertencia honesta: GPT-6 Sol y GPT-6 Luna no son enrutables a través de OrcaRouter a partir del 23 de septiembre de 2026. Aún no los alojamos, y nada de lo anterior debe interpretarse como una afirmación de que sí lo hacemos. Lo que está de nuestro lado hoy es el conjunto de comparación — GPT-5.6 Sol a $4.00/$20.00, GPT-5.6 Luna a $0.20/$1.20, y GPT-6 Astra a $10.00/$50.00 — que es exactamente lo que necesitas para calcular el costo de la migración antes de comprometerte con ella.

Qué ver a continuación
Tres cosas determinarían lo que este lanzamiento fue en realidad. La primera es si la tarifa de $0.20/$1.20 de GPT-5.6 Luna sobrevive el trimestre, porque un precio permanente de un proveedor ha sido históricamente la jugada de apertura más que su final — y el lanzamiento de Claude Opus 5.5 el mismo día sugiere que la presión que produjo este recorte no ha desaparecido. La segunda es si el cambio hacia la abstención se sostiene en la práctica: que GPT-6 Sol se niegue a responder una de cada seis preguntas es el tipo de cambio que se lee como una mejora en un laboratorio y como un producto roto en un pipeline que asumía una respuesta. La tercera es si el comportamiento de la caché es real en tu tráfico, algo medible esta semana y respondible solo midiendo — el descuento es lo bastante grande como para que una sola hora dedicada a instrumentar las tasas de aciertos de caché en tus prompts más largos valga más que otra tabla de benchmarks.
Comparados en este artículo2
Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario
