
GPT-6 Luna vs GPT-5.6 Luna: El mismo nombre, la mitad del precio y un entregable peor
- openaiNUEVOOpenAI: GPT-6 Luna2026-09-2237Inteligencia
- openaiNUEVOOpenAI: GPT-6 Sol2026-09-2248Inteligencia
- anthropicNUEVOAnthropic: Claude Opus 5.52026-09-2258Inteligencia
- grokNUEVOGrok 4.72026-09-2146Inteligencia
- OrcaNUEVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens
- orcaNUEVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens
- deepseekNUEVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligencia72Código
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligencia76Código
Dos modelos, una palabra en común y una puntuación independiente que es efectivamente idéntica. GPT-6 Luna alcanza 37,26 en el Artificial Analysis Intelligence Index; GPT-5.6 Luna alcanzó 37,32. Una diferencia de 0,07 puntos no es una medición, es ruido, y es el hecho más importante de este emparejamiento. Lo que separa a los dos modelos no es la capacidad — son $0,0681 por tarea de índice completada frente a $0,1783, y una serie de regresiones en el trabajo de conocimiento que el recorte de precio no menciona.
Las fechas importan para leer las cifras. GPT-5.6 Luna se lanzó el 9 de julio de 2026 a 0,20 $ por millón de tokens de entrada y 1,20 $ por millón de salida. GPT-6 Luna se lanzó el 22 de septiembre de 2026 a 0,10 $ y 0,50 $, exactamente la mitad de la tarifa de entrada y un 58 % menos que la tarifa de salida, algo que OpenAI ha descrito como permanente y no promocional. Esa es una reducción real, y también es la mitad más pequeña de la historia. La mitad más grande es que el modelo más nuevo es un modelo diferente, no el mismo con otro precio.

Lo que una migración realmente aporta, en cifras
Si los comparas en las dimensiones que deciden una migración, el resultado es desigual. Algunas filas mejoran, otras retroceden y una mejora muchísimo.
• Precio — GPT-6 Luna $0.10 de entrada / $0.50 de salida por millón de tokens frente a GPT-5.6 Luna $0.20 / $1.20. La mitad en la entrada, 58 % de descuento en la salida.
• Entrada en caché — 0,01 $ por millón frente a 0,02 $. El mismo descuento del 90 % sobre una base reducida a la mitad, así que un prefijo repetido cuesta la mitad de lo que costaba en julio.
• Coste por tarea completada — $0,0681 frente a $0,1783 en la misma suite. Una reducción del 62 %, mayor que la rebaja del precio de los tokens porque la combinación de tareas no es idéntica.
• Tokens de salida por tarea — 50.537 frente a 41.235. El nuevo modelo es un 23% más verboso por tarea terminada, y el 78% de su salida es razonamiento que nunca aparece en la respuesta.
• Ventana de contexto — 1.050.000 tokens frente a 1.000.000. El mismo límite práctico; ambos limitan la salida a 128.000 tokens.
• Abstención — una tasa de alucinación del 76,7 % en AA-Omniscience frente al 92,6 %. Esta es la mayor mejora individual del conjunto, y no es una ganancia de conocimiento: la precisión pasa del 42,7 % al 43,8 %, prácticamente sin cambios. El modelo más reciente se abstiene en lugar de inventar, lo que constituye un cambio de comportamiento más que de capacidad.
• Entregables de trabajo de conocimiento — AA-Briefcase v1.1 cae de 1,345.38 Elo a 1,299.23, y GDPval-AA v2.1 cae de 1,443.14 a 1,367.09. Ambos bajan, en aproximadamente 46 y 76 puntos.
• Programación y trabajo de horizonte largo — Terminal-Bench 4.0 pasa del 11,6 % al 12,6 % y SciCode del 53,6 % al 54,6 %, las dos filas aquí que suben. En contraste, el Coding Agent Index cae de 43 a 41 y las evaluaciones agénticas al estilo SWE se mueven en la misma dirección.
• AutomationBench-AA — 53,2 % frente a 50,2 %. Sube, y lo hace más que cualquier otra medida agéntica del conjunto.

La regresión está en el artefacto, no en el razonamiento.
El patrón en esas dos últimas filas merece que se le ponga nombre, porque constituye toda la decisión. El nuevo modelo es mejor en acciones agénticas de un solo paso y peor a la hora de entregar un documento terminado. Artificial Analysis atribuye el declive en el trabajo de conocimiento a la calidad de la presentación y a entregables que omitieron elementos requeridos de la rúbrica, más que a fallos factuales o de razonamiento —que es precisamente el tipo de regresión que sobrevive a una prueba de humo y falla una revisión.
Junta los dos hechos y la migración se divide limpiamente según qué consume la salida. Si tu pipeline lee salida estructurada —JSON, una clasificación, un campo extraído, una decisión de enrutamiento—, la regresión en la presentación no te cuesta nada, la mejora en la abstención es una ganancia real, y la reducción del 62 % en el costo de la tarea llega en su totalidad. Si una persona lee el entregable —un informe, un memorándum, un documento para el cliente—, el modelo más nuevo es mediblemente peor justo en aquello por lo que estás pagando, y el ahorro te está comprando un revisor.
La cifra de abstención merece el mismo tratamiento. Un modelo que pasa de inventar en el 93 % de lo que no sabe a inventar en el 77 % es un objeto materialmente distinto para una barrera de protección, un filtro de cumplimiento o cualquier canal en el que una respuesta incorrecta segura de sí misma se propague. Esa mejora es real, se mide de forma independiente y es el argumento más sólido, que no depende en absoluto del precio, para trasladar trabajo al nuevo modelo.
¿Qué cambia en tu código y qué no?
La buena noticia es que es menos de lo que implica una rebaja de precio de esta magnitud. La ventana de contexto es de la misma clase, la salida máxima es idéntica con 128.000 tokens, y la cláusula de reajuste de precios para contextos largos de la familia no ha cambiado: las solicitudes de más de 272.000 tokens de entrada se facturan a 2x las tarifas de entrada y caché y 1,5x la tarifa de salida, para toda la solicitud en lugar de para la parte que supera el umbral. Una solicitud que era costosa con 300.000 tokens en GPT-5.6 Luna también es costosa en GPT-6 Luna —la mitad de la tarifa, el mismo acantilado—, así que una carga de trabajo que debería haberse dividido en julio debería seguir dividiéndose ahora.
La escala de esfuerzo es donde cambia el comportamiento, no el costo. GPT-6 Luna expone none, low, medium (el valor predeterminado), high, xhigh y max, y el valor predeterminado importa: una canalización que se ajustó con el esfuerzo predeterminado de un modelo no queda automáticamente ajustada con el de otro. Los equipos que fijaron un ajuste de forma explícita no se ven afectados. Los equipos que adoptaron el valor predeterminado están ejecutando una configuración distinta a la de julio, y el síntoma visible será el volumen de tokens, no la calidad.
Vale la pena repetir una trampa porque no desaparece con el nuevo modelo. En el endpoint Chat Completions, la llamada a funciones solo funciona cuando el esfuerzo de razonamiento se establece en none; todos los demás niveles de esfuerzo, y todas las herramientas integradas, requieren la API Responses. Un equipo que migre un bucle de llamada a herramientas cambiando la cadena del modelo descubrirá que sus herramientas no están disponibles de forma silenciosa con el esfuerzo medio predeterminado, y la solución es reescribir la superficie de llamada en lugar de cambiar un parámetro.
Lo que puedes enrutar hoy y lo que no
Esta es la parte de la migración que no tiene nada que ver con los benchmarks. GPT-5.6 Luna está en OrcaRouter a su precio de lista — 0,20 $ por millón de tokens de entrada, 1,20 $ por millón de salida, una ventana de contexto de 1.000.000 de tokens, una salida máxima de 128.000 tokens y un tiempo hasta el primer token p50 de 1,60 segundos medido en tráfico real en nuestra propia página del modelo. Trasladamos los precios de lista del proveedor sin ningún recargo, así que el día en que OpenAI cambió los precios de esta familia, el cambio ya estaba activo de nuestro lado en lugar de en el siguiente ciclo de facturación.

GPT-6 Luna no es enrutable a través de OrcaRouter a partir del 23 de septiembre de 2026. La disponibilidad se limita a la propia API de OpenAI y a los catálogos en la nube que incluyen esta familia, y no listamos un modelo que no podemos servir. La consecuencia práctica es que un equipo que planifica esta migración puede trasladar el precio hoy y no puede trasladar el enrutamiento hoy — las dos mitades del cambio se concretan en fechas distintas.
Lo que eso hace posible mientras tanto es la configuración que la mayoría de los equipos terminará queriendo de todos modos. Mantén GPT-5.6 Luna en las rutas donde el entregable es el producto, ejecuta GPT-6 Luna dondequiera que la salida sea consumida por código, y trata la frontera como un nivel en lugar de una reescritura. Como los modelos a los que puedes acceder están detrás de un único endpoint con más de 200 modelos en la misma clave y conmutación por error automática entre proveedores, añadir o quitar un nivel es una entrada de configuración en lugar de una segunda integración — y la ruta de escalado deja de depender de que un único modelo esté disponible.
La decisión de migración, dicha sin rodeos
Traslada el trabajo allí donde la salida se lee por máquina y la condición de éxito es verificable. La clasificación, la extracción, las decisiones de enrutamiento, las llamadas a guardarraíles, las pasadas de transformación masiva y las acciones de agente de un solo paso son todas elegibles: el compuesto no cambia, el comportamiento de abstención es sustancialmente mejor y el coste de la tarea ha bajado alrededor del 62 %. Con Batch a la mitad de las tarifas estándar y la entrada en caché a una décima parte de una base reducida a la mitad, un pipeline que era marginal en julio ahora puede resultar sencillo.
No traslades el trabajo en el que una persona da el visto bueno al artefacto, y no traslades las rutas de los agentes de programación a ciegas. Una caída de 46 puntos en AA-Briefcase y una caída de 76 puntos en GDPval son cifras pequeñas que apuntan en la misma dirección que una caída de dos puntos en el Coding Agent Index, y el modo de fallo que describe Artificial Analysis —elementos de la rúbrica omitidos, presentación más débil— es invisible para una comprobación automatizada. Conserva el modelo anterior cuando el acabado sea el entregable.
Y trata el empate de 0,07 puntos en el índice como el hallazgo que es. Este no es un modelo más inteligente a un precio más bajo. Es un modelo con una forma diferente a un precio más bajo, y la pregunta que un plan de migración tiene que responder es qué forma consume tu carga de trabajo — no qué puntuación es más alta, porque en el registro independiente esas dos puntuaciones son el mismo número.
