Tarjeta de título generada que dice «GPT-6 vs GPT-6 Luna», con un chip que dice «GPT-6 es un nombre de familia, no un id de modelo» y un chip que dice «GPT-6 Luna: $0.10 de entrada / $0.50 de salida, impulsa ChatGPT Free y Go», y un pie de página que dice «Modelos lanzados el 22 de septiembre de 2026; regla de niveles según el propio anuncio de OpenAI.» El logotipo de OrcaRouter está compuesto en la esquina inferior derecha.
Guides & Insights

GPT-6 vs. GPT-6 Luna: a diez centavos el millón de tokens, y el nivel que responde al plan gratuito

Autor

Elias Hawthorne

Fecha de publicación

Últimos modelos · 20Ver todos los modelos →
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

Hay una versión de esta comparación en la que la respuesta es una sola línea: no puedes llamar a GPT-6, y puedes llamar a GPT-6 Luna por diez centavos por millón de tokens de entrada. Pero la versión más útil es la que explica por qué Luna es ahora el modelo que la mayoría de la gente ha usado realmente — OpenAI lo puso detrás de los niveles Free y Go de ChatGPT el 8 de octubre de 2026, lo que lo convierte en el nivel más barato de la generación y, por número de usuarios, el más concurrido. Lo que sigue es la escalera de niveles explicada una sola vez, y luego qué se compra realmente con diez centavos por millón.

La familia, y dónde encaja Luna en ella

OpenAI lanza la generación GPT-6 como tres identificadores de modelo publicados el 22 de septiembre de 2026, sin openai/gpt-6 endpoint detrás del nombre de la familia:

• GPT-6 Astra — el modelo insignia, $10.00 de entrada / $50.00 de salida por millón de tokens, incluido en la lista de precios de OpenAI como la cima de la generación
• GPT-6 Sol — el nivel intermedio, $2.00 / $10.00, y el modelo que OpenAI designa para el chat en los planes de pago de ChatGPT
• GPT-6 Luna — el nivel económico, $0.10 / $0.50, y el modelo que OpenAI designa para los planes Free y Go

Esa última línea es la parte que vale la pena precisar, porque es la razón por la que el tráfico de Luna eclipsa todo lo demás en la familia. El propio anuncio de OpenAI para el despliegue del 7–8 de octubre afirma que «GPT-6 en ChatGPT funciona con GPT-6 Sol para los niveles Plus, Pro, Business y Enterprise, y con GPT-6 Luna para los niveles Free y Go». Un modelo a $0.10 / $0.50 que responde al plan gratuito es un modelo que atiende más preguntas por día que cualquier nivel premium, y es el mismo checkpoint que puedes llamar a través de la API. La superficie orientada al consumidor es un canal de distribución, no un SKU aparte.

Una advertencia que hay que repetir aquí porque este blog ya ha publicado sobre ello: el mismo anuncio dice que Free y Go reciben GPT-6 Luna, mientras que la página del centro de ayuda de OpenAI sobre GPT-6 en ChatGPT describía a Free y Go como ejecutando GPT-5.6 Luna el día en que se consultó. Esas no son afirmaciones compatibles sobre el mismo nivel, OpenAI no ha dicho cuál está vigente, y si tu trabajo depende de qué modelo barato hay detrás del plan gratuito, considera la entrada del centro de ayuda como la página más específica y vuelve a comprobarlo antes de desarrollar basándote en cualquiera de las dos.

Qué compra realmente diez centavos por millón

El titular es el número menos interesante de la tarjeta de Luna. Aquí está la tarjeta completa, y el escalón de nivel justo debajo:

• Contexto corto, hasta 272,000 tokens de entrada — $0.10 por millón de entrada, $0.50 por millón de salida
• Por encima de 272,000 tokens de entrada — $0.20 por millón de entrada, $0.75 por millón de salida, aplicado a toda la solicitud
• Entrada en caché — $0.01 por millón en el nivel corto, un descuento del 90%; $0.02 por encima del umbral
• Escrituras en caché — $0.125 por millón en el nivel corto, $0.25 por encima de ese nivel
• Contexto y salida — 1,050,000 tokens de entrada, 128,000 tokens de salida
• Modalidades de entrada — texto, imagen y archivo, la misma entrada multimodal que Sol y Astra
• Razonamiento — un parámetro de esfuerzo configurable, junto con herramientas, salida JSON y muestreo con semilla

Dos cosas se desprenden de esto. La primera es que Luna no es un modelo recortado. Acepta imágenes y archivos, expone la misma superficie de llamadas a herramientas y salidas estructuradas que sus dos hermanos más caros, y lo único que lo separa de Sol en la hoja de especificaciones es la profundidad, no la capacidad. La segunda es el escalón. Un prompt de más de 272.000 tokens de entrada duplica la tarifa de entrada de Luna y aumenta su tarifa de salida en un 50 %, en toda la solicitud en lugar de solo en el excedente. Ese es un escalón suave para estos precios —una solicitud de 300.000 tokens cuesta alrededor de seis centavos de entrada en lugar de tres—, así que la cláusula de contexto largo que domina la planificación del presupuesto para Astra y es relevante para Sol es casi irrelevante aquí.

El número que sí mueve dinero a escala es la lectura en caché. A un centavo por millón, una carga de trabajo que reenvía el mismo contexto grande en cada turno no paga casi nada por la parte repetida. En un pipeline de extracción o clasificación de gran volumen con un prompt del sistema estable y un documento estable, esa es la diferencia entre un modelo barato y uno casi gratuito, y es la razón específica por la que el costo real por respuesta terminada de Luna queda muy por debajo de lo que sugiere la tarjeta de tarifas.

Lo que te cuesta en capacidad

Luna es el nivel más barato porque es el menos capaz, y el panel independiente no deja lugar a dudas sobre cuánto menos. Consulta Artificial Analysis a través de la entrada del catálogo de OrcaRouter para cada uno el 8 de octubre de 2026:

• AA Intelligence Index — GPT-6 Sol 47.6, puesto 14; GPT-6 Luna 38.1, puesto 37
• Humanity's Last Exam — GPT-6 Sol 47.9 vs GPT-6 Luna 38.5
• SciCode — GPT-6 Sol 57.6 vs GPT-6 Luna 54.6
• Recuperación de contexto largo — GPT-6 Sol 83.7 vs GPT-6 Luna 83.3
• Terminal-Bench 4.0 — GPT-6 Sol 43.9 vs GPT-6 Luna 12.6
• Tráfico durante siete días — GPT-6 Luna, aproximadamente 574 millones de tokens; GPT-6 Sol, aproximadamente 2.1 millones
• Tiempo medio hasta el primer token — GPT-6 Luna 1,494 ms vs GPT-6 Sol 6,785 ms
• Velocidad media de salida — GPT-6 Luna 132.9 tokens/s vs GPT-6 Sol 179.6 tokens/s

La forma de eso es más informativa que la brecha del titular. Luna está 9,5 puntos de índice por detrás de Sol, y la pérdida no se distribuye de manera uniforme: la recuperación de contexto largo es un empate a 0,4 puntos, y SciCode —comprensión de código en lugar de producción de código— está a solo 3 puntos de diferencia. Lo que se derrumba es la ejecución agéntica de varios pasos: Terminal-Bench 4.0 en 12,6 frente a los 43,9 de Sol. Un modelo que puede recuperar de un documento de un millón de tokens casi tan bien como su hermano mayor, y escribir una respuesta competente de un solo intento, es un instrumento distinto de uno que puede llevar un bucle de herramientas hasta su finalización.

Dos advertencias. Las cifras del índice proceden de Artificial Analysis, no de OpenAI, y ese evaluador no garantiza que dos páginas de modelos se representen con la misma revisión del índice el mismo día; por lo tanto, las diferencias inferiores a un punto deben interpretarse como una orientación, no como una precisión exacta. Y las cifras de servicio son nuestras propias mediciones de enrutamiento en una ventana móvil de siete días; varían entre lecturas y resultan útiles por la forma de la diferencia más que como una promesa de nivel de servicio.

Hay una cifra de servicio en la que vale la pena detenerse. El tiempo medio hasta el primer token de Luna es 1.494 ms frente a los 6.785 ms de Sol —aproximadamente 4,5 veces más rápido hasta el primer token— y su rendimiento es considerablemente menor una vez que comienza el streaming. Para una interfaz de chat en la que el usuario está esperando la primera línea, esa inversión es justamente la razón de ser de este nivel, y es la razón por la que el plan gratuito puede sentirse rápido mientras ejecuta el modelo más económico de la familia.

La nueva competencia dentro de la familia

La ventaja de precio de Luna dentro de la generación se ha estrechado desde que se lanzó. GPT-6.1 Solllegó el 29 de septiembre a los $2.00 / $10.00 de Sol con un índice de 51.8, y redujo la tarifa de entrada en caché a $0.10 por millón. Eso no toca la tarifa de contexto corto de Luna —un precio de diez centavos de entrada y cincuenta centavos de salida sigue siendo veinte veces más barato en entrada que cualquier Sol—, pero sí significa que el nivel por encima de Luna se volvió más barato de ejecutar con tráfico en caché, que es precisamente la carga de trabajo donde la ventaja de Luna era más amplia. La brecha sigue siendo grande. Ya no es tan grande como las tarifas por sí solas dan a entender.

A generated two-column comparison scoreboard titled "GPT-6 Sol vs GPT-6 Luna — the scoreboard". The left column, GPT-6 Sol, reads Input $2.00, Output $10.00, AA Intelligence 47.6, Terminal-Bench 4.0 43.9, First token 6,785 ms, Cached input $0.20. The right column, GPT-6 Luna, reads Input $0.10, Output $0.50, AA Intelligence 38.1, Terminal-Bench 4.0 12.6, First token 1,494 ms, Cached input $0.01. A footer line reads "Index figures per Artificial Analysis; serving figures are a rolling seven-day window from OrcaRouter." The OrcaRouter logo is composited in the bottom-right corner.

Dónde cae en la práctica la línea de niveles

Reparte el trabajo según lo que necesita la tarea, no según qué modelo obtiene una puntuación más alta.

Luna es la opción correcta para chat de alto volumen, clasificación, extracción, moderación y resumen en un contexto largo — la fila en la que empata con su hermano más grande en recuperación es la fila que determina si un contexto grande es utilizable. Su latencia del primer token la convierte en la mejor opción para cualquier uso interactivo que no requiera mucho razonamiento. Y a un centavo por millón en caché, un contexto estable es casi gratis en la parte repetida.

Sol, o ahora GPT-6.1 Sol, es la elección correcta en el momento en que la tarea requiere un bucle de herramientas, un plan de largo horizonte o una cadena de pasos que debe completarse. La diferencia en Terminal-Bench —43,9 frente a 12,6— es la señal más clara de esta comparación, y se corresponde con el modo de fallo real: un modelo barato que responde bien al primer paso y luego pierde el hilo. El parámetro effort significa que puedes pedirle a Luna más razonamiento, pero effort eleva el recuento de tokens en lugar del techo; no convierte un 12,6 en un 43,9.

Y Astra sigue siendo la respuesta para el trabajo que solo el modelo insignia puede hacer, lo cual, a $10.00 de entrada y $50.00 de salida frente a los diez centavos de Luna, es una decisión que debería poder justificarse por llamada en lugar de por equipo.

La versión con una sola API de esta opción

La parte incómoda de una familia de tres niveles es que el límite entre niveles cambia según la función, y cambia según la solicitud; por lo general, la misma aplicación quiere Luna para un endpoint y Sol para el siguiente. Eso es un problema de enrutamiento, no de compras. Los tres niveles de GPT-6 están en el mismo catálogo de OrcaRouter, a los que se accede mediante una única API compatible con OpenAI que abarca más de 200 modelos, con el precio de lista del proveedor aplicado con un margen del 0 %, de modo que cualquier cambio de precio de un proveedor en cualquiera de los niveles se refleja aquí el mismo día, en lugar de en tu siguiente conciliación. El DSL de enrutamiento compone la división de forma explícita —por tamaño de solicitud, por endpoint o por cuota—, de modo que la ruta de clasificación puede ejecutar Luna mientras que la ruta agéntica ejecuta Sol, y la conmutación por error automática entre proveedores cubre una ruta que se degrada, en lugar de dejarte a ti descubrirlo por una ejecución fallida.

Una cosa que esto no hace es darte una Luna que se comporte como Sol. Los niveles existen porque los modelos son diferentes, y los números anteriores son el tamaño de esa diferencia. Lo que te aportan una sola clave y una regla de enrutamiento es la capacidad de colocar cada solicitud en el nivel que realmente le corresponde, en lugar de poner todo en el más caro por seguridad o todo en el más barato por presupuesto.

Screenshot of the OrcaRouter model page for openai/gpt-6-luna, showing the OpenAI vendor label, a 2026-09-22 catalogue release date, a 1.05M-token context window, a 128K maximum output, text, image and file input with Vision, Tools, JSON and Reasoning badges, and a rate strip reading $0.10 per million input, $0.50 per million output, a 1.49 s median time to first token, a 5.06 s p95, and 574.0M tokens routed in seven days.

La respuesta, por la única pregunta que importa

Si la tarea consiste en recuperar y luego responder sobre un documento extenso, un chat o el procesamiento masivo de texto, GPT-6 Luna es el nivel adecuado y la tarjeta de diez centavos no es una concesión: la fila de recuperación de contexto largo indica que recupera tan bien como el modelo que cuesta veinte veces más. Si la tarea requiere que un agente de varios pasos la complete, Luna es el nivel equivocado y lo honesto es elegir GPT-6 Sol o GPT-6.1 Sol, donde el precio sigue siendo bajo en términos absolutos y las evaluaciones agénticas dejan de desplomarse.

Lo que "GPT-6" es por sí solo, de nuevo, no es algo a lo que puedas llamar. Es un nombre de familia que abarca tres IDs en tres niveles de precio y tres techos de capacidad distintos, y Luna es la que está abajo del todo: la más barata, la más rápida hasta el primer token, la que responde al plan gratuito y aquella cuyo techo se hace evidente en cuanto una tarea necesita más que una única respuesta con seguridad.

Screenshot of the OrcaRouter model page for openai/gpt-6-sol, showing the OpenAI vendor label, a 2026-09-22 catalogue release date, a 1,050,000-token context window (shown as 1.05M-token context in the model blurb), a 128K maximum output, text, image and file input, and a rate strip reading $2.00 per million input, $10.00 per million output, a 6.79 s median time to first token, a 10.00 s p95, and 2.1M tokens routed in seven days.

Comparados en este artículo1

Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario