
GPT-5.6 Luna Max: Cómo los desarrolladores realmente lo usan en Codex — y dónde falla
- openaiNUEVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligencia
- anthropicNUEVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligencia
- typesafeNUEVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 221 tok/s
- OpenAINUEVOOpenAI: GPT-6 Luna2026-09-2238Inteligencia
- OpenAINUEVOOpenAI: GPT-6 Sol2026-09-2248Inteligencia
- AnthropicNUEVOAnthropic: Claude Opus 5.52026-09-2258Inteligencia
- xAINUEVOGrok 4.72026-09-2146Inteligencia
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 103 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 214 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
El 1 de agosto, un archivo de configuración de cuatro líneas empezó a circular en X. Crea un agente de Codex llamado luna_worker, establece su modelo en gpt-5.6-luna, fija su esfuerzo de razonamiento en max, y le asigna la mitad aburrida de tu trabajo mientras GPT-5.6 Sol mantiene el plan. En cuestión de días, la misma receta se había vuelto a publicar en inglés, chino, japonés, coreano, español y árabe, y un plugin basado en la misma idea había superado las 1.300 estrellas de GitHub en cuatro días. También es, más o menos el día en que se hizo viral, la forma incorrecta de conectarlo: el autor de ese plugin sacó a GPT-5.6 Luna de su propio proyecto en 48 horas, públicamente, porque un colega le dijo que no funciona como subagente de Codex — y luego lo volvió a poner dos días después, conectado de una manera completamente diferente.
Todo ese arco ocurrió en una semana, y es lo más útil que nadie ha publicado sobre este modelo. Te dice que el patrón del trabajador barato es real, que la forma obvia de conectarlo es la incorrecta, y que la diferencia entre ambas es la mayor parte del valor. Todo lo relativo a la técnica en este artículo proviene de profesionales que publicaron sus propios resultados entre el 30 de julio y el 5 de agosto de 2026 — no de la documentación de la empresa, que describe a GPT-5.6 Luna como un modelo para "cargas de trabajo de gran volumen y sensibles al costo" y no menciona nada de esto. Cuando un número es medido por un tercero independiente, lo decimos; cuando es el registro de sesión de un desarrollador, también lo decimos, incluso cuando se contradicen entre sí. Se contradicen, y mucho.
Qué es "Luna Max" y por qué la mayoría de la gente nunca lo ve.
No existe un modelo llamado Luna Max. Hay dos diales, y Luna Max es una combinación de ambos: el nivel más económico de la familia GPT-5.6, ejecutado en la configuración de razonamiento más profunda. El dial de nivel elige entre GPT-5.6 Sol, GPT-5.6 Terra y GPT-5.6 Luna. El dial de esfuerzo tiene seis posiciones — none, low, medium, high, xhigh y max — y controla cuánto piensa el modelo antes de responder.
Casi nadie combinaba el nivel económico con el ajuste profundo, por una razón mundana: max está oculto por defecto. En la aplicación de escritorio de ChatGPT/Codex se encuentra en Ajustes → Configuración → esfuerzos de razonamiento disponibles, donde la lista viene con la opción superior desmarcada. Seis desarrolladores distintos publicaron la misma solución de tres clics en la primera semana de agosto, lo cual es un buen indicador de cuántas personas habían estado ejecutando Luna con su profundidad predeterminada y juzgando el modelo en función de eso. En el lado de la API, no hay ningún interruptor que buscar: pasas el id del modelo gpt-5.6-luna y estableces el esfuerzo de razonamiento en max en el cuerpo de la solicitud, y ese es todo el cambio.
Una consecuencia que vale la pena internalizar antes de leer cualquier benchmark: cuando Artificial Analysis publica una puntuación de inteligencia para este modelo, la página se titula GPT-5.6 Luna (max). El número independiente que todos citan para Luna es la configuración de máximo esfuerzo. Si has estado usando la configuración predeterminada y te preguntas por qué tu experiencia no coincide con la tabla de clasificación, esa es la razón.
El dial que nadie explica: el esfuerzo cambia la cantidad de tokens, no el precio de los tokens.
Elevar el nivel de esfuerzo de razonamiento no te lleva a un nivel de precios más caro. GPT-5.6 Luna cuesta $0.20 por millón de tokens de entrada y $1.20 por millón de tokens de salida en cualquier configuración de esfuerzo. Lo que cambia es cuántos tokens gasta el modelo para llegar a una respuesta — y al máximo, gasta muchísimos.
Artificial Analysis midió esto mientras ejecutaba su Intelligence Index, y los números son la confirmación independiente más clara de lo que los profesionales se quejaban:
• Puntuación — 51 en el Índice de Inteligencia de Artificial Analysis, frente a una mediana de 17 para los modelos que evalúa en esa clase.
• Verbosidad — 130M de tokens de salida generados durante la ejecución del índice, frente a una mediana de 61M. Artificial Analysis marca el modelo como "muy verboso".
• Velocidad bruta — 182,5 tokens de salida por segundo, puesto 16 de 163 modelos. Rápido por token.
• Tiempo hasta el primer token — aproximadamente 136 segundos con el máximo esfuerzo, que Artificial Analysis señala que está en el extremo superior incluso para modelos de razonamiento en ese rango de precios.
• Gasto total — $174.06 para evaluar el modelo en todo el índice.
Lee la tercera y cuarta línea juntas, porque ese par es toda la experiencia del usuario. Luna, al máximo, emite tokens rápidamente, pero tarda minutos en comenzar, y luego produce aproximadamente el doble de tokens que un modelo típico en el mismo trabajo. Por eso la queja más común en los informes de campo no es «está mal», sino «es lento» — y por eso el precio bajo no se traduce en una sesión proporcionalmente barata. Estás comprando una tarifa baja por un recuento alto de tokens.
Para contrastar: en nuestra propia página del modelo para GPT-5.6 Luna, la mediana observada del tiempo hasta el primer token a lo largo de siete días de tráfico real es de 1.78 segundos, con un percentil 95 de 9.26 segundos. Eso no contradice la cifra de 136 segundos: es el mismo modelo medido en una combinación de ajustes de esfuerzo, la mayoría de los cuales no son al máximo. La latencia que obtienes es una propiedad del nivel que configures, no del punto final al que llames.

¿Es Luna Max realmente "Sol Medium a un sexto del costo"?
Esta es la afirmación que hizo viral el patrón, y proviene de Dan McAteer, quien la formuló como Luna con razonamiento máximo aterrizando alrededor de GPT-5.6, Sol en medio, o Claude Opus 5 en medio, por aproximadamente una sexta parte del costo. Fue repetida por muchas cuentas, a veces con las salvedades eliminadas, y vale la pena separar lo medido de las sensaciones.
El marcador independiente respalda enfáticamente la parte de la afirmación relativa al costo y solo parcialmente la relativa a la capacidad. Al ejecutar la misma suite de pruebas comparativas con el máximo esfuerzo en todos los niveles, Artificial Analysis registró a Luna en el índice 51 por $174, a Terra en 55 por $1,403, a Kimi K3 en 57 por $2,437 y a Sol en 59 por $2,824. Luna cede ocho puntos de índice a Sol y cuesta aproximadamente una dieciseisava parte para ejecutar el mismo trabajo.

El marcador independiente se afiló el 13 de agosto, cuando DeepSWE lanzó la v1.1 — una revisión de su benchmark de ingeniería de horizonte largo que conserva 113 tareas originales extraídas de 91 repositorios en cinco idiomas, pero ahora califica cada corrección ejecutando el diff confirmado en un contenedor aislado, lo que es más difícil de manipular. En el marcador actualizado, los tres niveles de GPT-5.6 con el máximo esfuerzo quedan donde los situaba el informe de julio: Luna Max con un 67.2% de pass@1 y $0.61 por tarea, Terra Max alrededor del 70%, Sol Max al 73% por $8.39 — seis puntos de tasa de éxito por aproximadamente catorce veces más dinero.
La comparación que merece una segunda mirada se sitúa por debajo de Luna, no por encima. Claude Sonnet 5 Max obtiene un 54% en las mismas 113 tareas — unos trece puntos por detrás de Luna Max — a $26.40 por tarea, lo que equivale a aproximadamente 44 veces lo que Luna pagó por resolver lo mismo. Luna Max también supera a Gemini 3.7 Flash (65% para la configuración de alto esfuerzo en la misma tabla); la publicación de la comunidad que señaló esta ronda sitúa la diferencia con Gemini 3.7 Flash Medium en unos 1,7 puntos. DeepSWE es el banco de pruebas independiente de Datacurve, no una evaluación de la empresa — la afirmación de la propia empresa de que la familia GPT-5.6 logró resultados de vanguardia en Terminal-Bench 2.1 y DeepSWE sigue siendo una afirmación aparte, reportada por el proveedor.
Luego está la evidencia de campo, que está genuinamente dividida. Pawel Huryn ejecutó su propio benchmark de corrección de errores — 105 errores plantados en dos bases de código reales, evaluación a ciegas, una ronda por modelo — y reportó que Luna con el máximo esfuerzo corrigió 33 errores por $1.80, frente a los 24 de Claude Fable 5 por $68. En la dirección opuesta, Diego Haz pasó dos días ejecutando sesiones equiparadas y se pronunció en contra del patrón: Luna promedió $1.20 por sesión, mientras que Sol promedió $29, pero tuvo que rehacer la mayor parte de la producción de Luna y no obtuvo nada utilizable para sus casos de uso, lo que convierte el ahorro en una ilusión más que en un descuento. Otro desarrollador que usó el mismo arnés de pruebas reportó que Sol en configuración media producía un resultado claramente mejor que Luna al máximo en aproximadamente la mitad del tiempo. Una comparativa en chino sobre una única tarea de escena 3D puso números a esa forma: Sol Medium terminó en 21m30s con la calificación de calidad más alta y la menor cantidad de tokens; Luna Max tardó 40m55s, consumió alrededor de 130k tokens, obtuvo la puntuación más baja en calidad y usó la mitad de la cuota semanal de suscripción.
El resumen honesto de la posición de la comunidad después de una semana: Luna Max no es Sol Medium. Cuesta bastante menos que Sol Medium y es peor, y si ese intercambio es bueno depende enteramente de si la tarea está especificada con la suficiente precisión como para que "peor" no importe. Lo cual es exactamente para lo que sirven los patrones de cableado a continuación.
El patrón que sobrevivió al contacto: Sol planifica, Luna implementa, un Sol nuevo revisa
Nadie que haya seguido usando Luna Max lo está usando como agente de codificación de propósito general. La configuración que funciona, en cada versión en la que los profesionales han convergido, tiene cuatro roles:
• Orquestador — GPT-5.6 Sol con alto esfuerzo, manteniéndose en el hilo principal. Es responsable de los requisitos, la arquitectura, la descomposición de tareas y la aceptación final. No escribe el código.
• Implementador rutinario — GPT-5.6 Luna a máximo esfuerzo, en trabajos acotados y totalmente especificados: refactorizaciones mecánicas, escritura de pruebas, análisis de módulos, pasadas de documentación, el tipo de tarea donde el destino es inequívoco.
• Implementador riguroso — GPT-5.6 Terra al máximo esfuerzo, para compilaciones con mucho contexto donde la deriva de instrucciones de Luna resulta costosa.
• Revisor — una instancia GPT-5.6 Sol nueva y de solo lectura que ve el diff final y nada más. El motivo de "nueva" es que un revisor que lleva el contexto de la implementación tiende a aprobar su propio razonamiento.
La implementación de referencia es sol-advisor, un plugin de Codex con licencia MIT creado por Dan McAteer que alcanzó aproximadamente 1.400 estrellas en su primera semana. Lo instalas a través del mercado de plugins de Codex añadiendo el repositorio DannyMac180/sol-advisor y luego añadiendo el plugin sol-advisor. Su estructura actual es instructiva: el carril nativo fija un implementador Terra/High seguido de un revisor Sol/High nuevo, mientras que Luna al máximo es un carril de participación explícita que se ejecuta como una tarea separada visible para el usuario, con la sesión principal de Sol revisando y aceptando su trabajo directamente, en lugar de enrutarlo a través del revisor nativo.
Si prefieres no instalar nada, la versión mínima ampliamente copiada es una definición de agente personalizada en ~/.codex/agents/luna-worker.toml que incluye dos ajustes — model = "gpt-5.6-luna" y model_reasoning_effort = "max" — más una descripción e instrucciones que lo restringen al trabajo delegado con límites claros, le prohíben cambiar el objetivo general o ampliar su propio alcance, y devuelven las decisiones de arquitectura y los requisitos ambiguos al agente principal. El consejo que circula es que Sol escriba este archivo por ti, lo valide contra tu versión instalada de Codex y te muestre el diff antes de que lo aceptes, lo cual es sensato tanto si confías en la receta como si no.
La trampa del subagente, y la solución en la que convergió la comunidad
Aquí es donde la versión viral de este patrón y la versión funcional se separan.
El sistema de subagentes nativo de Codex no trata a GPT-5.6 Luna como un ciudadano de primera clase. McAteer se topó con un bloqueo duro — Luna no está permitida como subagente — y lo solucionó declarándola como agente personalizado, para luego señalar públicamente el coste de esa solución: un agente personalizado no comparte contexto con el agente principal como lo hace un subagente nativo. Días después eliminó el carril de Luna de sol-advisor por completo, citando el hallazgo de otro desarrollador centrado en Codex según el cual Luna se comporta mal en el rol de subagente, con la presunción de que no ha sido post-entrenada para el protocolo multiagente v2. Diego Haz describió de forma independiente la misma barrera desde el otro lado: Sol no puede generar a Luna como subagente, por lo que Luna tiene que vivir en un hilo de nivel superior, lo que complica la coordinación.
La resolución, que ahora es la posición mayoritaria, es dejar de luchar contra ello:
• Dale a Luna Max su propio hilo, no un espacio en el grafo de subagentes. Instruye al orquestador Sol para que lance una tarea Codex separada de nivel superior en Luna, la supervise y recupere el resultado. Esto es lo que McAteer volvió a añadir a sol-advisor el 4 de agosto, y a lo que varios otros habían llegado de forma independiente.
• Acepta el aislamiento de contexto como el precio. Un hilo separado significa un historial separado. Ese es el impuesto que pagas, y también es la razón por la que la transferencia a continuación importa más aquí que en una configuración de subagente nativa.
• Si debes forzarlo a multi-agent v2, el catálogo es la razón por la que se excluye. Un desarrollador rastreó la exclusión hasta el catálogo de modelos estándar que marca a Luna como v1, e informó una solución alternativa: copia ~/.codex/models_cache.json, establece el multi_agent_version de Luna a v2, apunta model_catalog_json a tu copia, reinicia Codex, luego haz que el orquestador lance Luna al máximo con un nivel de servicio rápido y desactiva el forking. Trata esto como un truco no oficial de una persona sobre un archivo interno — es exactamente el tipo de cosa que una actualización de Codex rompe.
El paquete de traspaso: cinco preguntas que resuelven la queja más común
El fracaso más reportado de Luna Max es que no sigue las instrucciones con precisión, especialmente cuando le das un flujo de trabajo específico o un bucle de iteración para ejecutar. Esa queja aparece tanto en desarrolladores a los que les gusta el modelo como en los que lo abandonaron. La mitigación en la que los profesionales siguen insistiendo no es una mejor indicación en el sentido de estilo de escritura; es un contrato más estricto. Antes de que comience el hilo de Luna, responde cinco cosas:
• ¿Qué tarea exacta debe terminar este agente? No el área de trabajo — el estado final.
• ¿Qué archivos, documentos o sistemas están dentro del alcance? Enumerados, no implícitos.
• ¿Qué no debe cambiar? Las interfaces, migraciones, configuraciones y contratos públicos que están fuera de los límites.
• ¿Qué evidencia demuestra la finalización? Una prueba con nombre, la salida de un comando específico, un diff que modifique solo los archivos listados.
• ¿Qué decisión faltante debería hacer que se detenga? El desencadenante para volver en lugar de adivinar — este es el que evita que un modelo barato demasiado entusiasta invente una arquitectura.
Aquí también vale la pena incorporar la guía de prompts de la propia empresa, con la etiqueta que merece: la empresa informa que en sus evaluaciones internas de agentes de codificación, los prompts de sistema más concisos mejoraron las puntuaciones de evaluación entre un 10 y un 15 %, a la vez que redujeron los tokens totales entre un 41 y un 66 % y el costo entre un 33 y un 67 %, y recomienda auditar los prompts heredados de GPT-5.5 o GPT-5.4 en lugar de portarlos directamente. Esas son cifras reportadas por el proveedor. Pero la dirección coincide con lo que ha encontrado el campo: describe el destino con precisión y elimina la narración de cada paso. Nótese la tensión con el párrafo anterior: la precisión sobre el alcance y las restricciones no es lo mismo que la verbosidad, y el consenso de la comunidad es que Luna Max necesita más de lo primero y menos de lo segundo.
Modos de fallo a prever
• Deriva de instrucciones. Corroborado por múltiples desarrolladores: ignora partes del brief inicial, y es peor cuando el brief es un procedimiento a seguir en lugar de un resultado a alcanzar.
• Lentitud en tiempo de reloj. Reportado en repetidas ocasiones, y coherente con los ~136 segundos de tiempo hasta el primer token que Artificial Analysis midió con el máximo esfuerzo. Está bien para trabajos que puedes dejar ejecutándose; doloroso en un bucle interactivo.
• Consumo de contexto. Un desarrollador informó que Luna Max consumía la ventana de contexto de un hilo de Codex de 258k tokens a una velocidad alarmante, y sospechaba que el consumo de cuota se dispara una vez que Codex comienza a compactar cerca del límite. La parte de la compactación es su impresión, no un resultado medido — pero la tasa de consumo es la consecuencia esperada de la verbosidad que Artificial Analysis midió de forma independiente. En el lado de la API, cuidado con el escalón de contexto largo: la estructura de precios de paso para este modelo pasa de $0.20/$1.20 a $0.40/$1.80 una vez que una solicitud supera aproximadamente 272k tokens, por lo que un hilo que sigue creciendo se vuelve más caro por token, no solo más caro en total.
• Cualquier cosa visual. Este es el límite más marcado en los informes de campo. Un profesional muy leído, que canceló una suscripción de programación de Kimi K3 a favor de Luna Max, lo calificó como igual de bueno que lo que estaba dejando y mucho más barato, con una excepción explícita para el frontend. Otro fue más directo: no uses Luna para ejecutar trabajos de diseño, gráficos, formato o diapositivas; la división de planificar con Sol y ejecutar con Luna es para tareas instructivas paso a paso, no para tareas estéticas.
• El catálogo de subagentes. Cubierto anteriormente: si Luna nunca se selecciona en silencio en una ejecución multiagente, está siendo filtrada, no fallando.
• Falsa economía. El único modo de fallo que no aparece en ningún benchmark: una sesión que costó $1.20 en lugar de $29 y produjo un trabajo que reescribiste a mano te costó $1.20 más tu tarde.
Cuándo no optar por el máximo
Max no es una actualización gratuita, y la guía que se ha mantenido es una escalera más que un ajuste:
• Transformaciones claras — un cambio de nombre de campo, una extracción mecánica, una pasada de formato. Esfuerzo bajo o medio en Luna. Condiciónalo a que pase una prueba con nombre.
• Implementación rutinaria — high o xhigh. El valor predeterminado de la comunidad para un worker de Luna es xhigh, no max, precisamente porque max cuesta tiempo y tokens en tareas que nunca fueron difíciles.
• Acotado pero genuinamente difícil — este es el verdadero trabajo de max. El paquete tiene que ser tanto difícil como estrictamente especificado para que el razonamiento adicional se convierta en un mejor resultado.
• Investigación ambigua — cambia el nivel, no el dial. Si el modelo juzga mal en lugar de planificar de menos, más razonamiento en un modelo más barato no lo arreglará; eso es una tarea de Sol.
• Brief vago — corrige el contrato, no el modelo. Ningún ajuste de esfuerzo compensa un criterio de aceptación no declarado.
Una advertencia específica para suscripciones, tomada de una guía de terceros y fácil de errar: las tasas de créditos que Codex cobra por modelo no tienen las mismas proporciones que los precios de lista de la API, así que no puedes tomar una proporción de precios de la API y usarla como regla de enrutamiento de tu suscripción. Los límites de mensajes reportados de cinco horas en el nivel Plus ilustran el punto: aproximadamente 15–90 mensajes locales en Sol, 20–110 en Terra, 50–280 en Luna, con rangos tan amplios porque un "mensaje" no es una unidad fija de trabajo. Si tus decisiones de enrutamiento están impulsadas por un tope de suscripción y no por una factura, mide contra el tope.
Más allá de Codex: a qué más lo están apuntando
La combinación de razonamiento profundo y bajo costo resulta útil fuera de los agentes de codificación, y estos son los usos con pruebas:
• Agentes de navegador. Un desarrollador ejecutó una pila de automatización de navegador en GPT-5.6 Luna para abrir las 15 publicaciones principales de Hacker News, leer cada página enlazada y escribir un informe — costo total, 3 centavos. Horizonte largo, bajo riesgo, alto consumo de tokens: exactamente el tipo de tarea para el que este modelo está tarifado.
• Cadenas de habilidades. Dos profesionales informaron de forma independiente que impulsaron un pipeline de dos habilidades — generación de imágenes hacia un convertidor de imagen a Three.js — a partir de un único objetivo de Luna Max para obtener un objeto 3D low-poly interactivo, y cada uno señaló que apenas movió su contador de uso semanal. Vale la pena leerlo junto con la advertencia de «no uses Luna para trabajo visual»: Luna estaba orquestando herramientas que hacían el trabajo visual, no juzgando la estética en sí.
• Mantener una sesión caliente. El input en caché en este modelo cuesta $0.02 por millón de tokens frente a $0.20 para input fresco — un 90% de descuento que Artificial Analysis enumera en su panel de precios — y la ventana de caché es de aproximadamente 30 minutos. La implicación práctica que varias guías concluyen de forma independiente: una sesión de larga duración que sigue releyendo la misma base de código es drásticamente más barata que una sesión nueva por tarea.
• Arbitraje de cuota. La afirmación más agresiva de todo el conjunto, y claramente etiquetada como afirmación: un desarrollador informa que, debido a que el esfuerzo es casi gratuito mientras que el multiplicador de nivel es grande, ejecutar el máximo esfuerzo en el nivel barato le permitió mover 4.900 millones de tokens durante tres semanas con un plan de 200 dólares — seis cifras a tarifas de API — y que mantiene los modelos Kimi K3, Grok y DeepSeek en el mismo selector detrás de un enrutador local para que alcanzar el límite de un proveedor no detenga el trabajo. Nadie ha reproducido de forma independiente la cifra de tokens. Sin embargo, el hábito de enrutamiento que hay detrás es la parte que vale la pena copiar.
Ejecutando la misma división sin una suscripción a Codex
Todo lo anterior es una historia con forma de suscripción: la razón por la que la gente se preocupa por Luna Max es que amplía un límite semanal. En el lado de la API, la misma arquitectura es más simple de construir y más fácil de razonar, porque estás pagando una factura en lugar de gestionar una asignación — y la división orquestador/trabajador deja de ser un plugin y se convierte en enrutamiento normal.
GPT-5.6 Luna está disponible a través de OrcaRouter a $0,20 por millón de tokens de entrada y $1,20 por millón de tokens de salida — el precio de lista del proveedor, trasladado con un margen del 0 %, que es por lo que el recorte del 30 de julio estuvo activo de nuestra parte el mismo día en que la empresa lo anunció, en lugar de un ciclo de facturación más tarde. Se sirve a través de una API compatible en /v1/chat/completions y /v1/responses, de modo que el campo de esfuerzo de razonamiento viaja en el cuerpo de la solicitud exactamente como lo haría en una llamada directa, y el id del modelo es openai/gpt-5.6-luna. GPT-5.6 Sol y GPT-5.6 Terra están detrás de la misma clave, que es la parte que importa de este patrón: un orquestador en un nivel y un trabajador en otro son dos ids de modelo en una integración, no dos contratos de proveedor. El DSL de enrutamiento permite expresar esa división como una sola llamada, en lugar de unir hilos a mano, y la conmutación automática por error cubre el caso que quienes practican el arbitraje de cuotas resuelven con un router local — cuando un proveedor se degrada, la solicitud aterriza en otro lugar en lugar de detenerse.

Dos advertencias sinceras. Los mecanismos específicos de Codex — el grafo de subagentes, el mercado de plugins, el catálogo de modelos, la asignación semanal — pertenecen a la empresa, y nada de eso viene incluido con una clave de API; si el patrón que quieres es sol-advisor dentro de la aplicación de Codex, quieres una suscripción a Codex. Y los modos de fallo anteriores son propiedades del modelo, no del transporte: el enrutamiento cambia cuánto cuesta una llamada y qué ocurre cuando un proveedor se cae, no si Luna sigue tus instrucciones.
Quién debería copiar esto y quién no
Si tu trabajo es de alto volumen y mecánicamente especificable — refactors, andamiaje de pruebas, extracción, documentación, pasadas de análisis sobre un repo grande — sube al máximo, pon a Luna en su propio hilo con un traspaso de cinco preguntas, mantén una instancia de Sol delante para planificar y otra detrás para revisar, y espera gastar un orden de magnitud menos. Las personas que reportan las mayores victorias están todas haciendo alguna versión de eso, y las cifras de costo independientes respaldan la dirección incluso donde no respaldan el marco de "tan bueno como Sol".
Si tu trabajo es exploratorio, estético, o llega como un encargo vago que se va precisando sobre la marcha, los informes de campo lo dicen claramente: gastarás el doble del ahorro rehaciendo el resultado. Y si eres interactivo —sentado mirándolo—, el arranque en frío de dos minutos con esfuerzo máximo te molestará más de lo que el precio te satisface.
Qué observar: si la empresa realiza el post-entrenamiento de Luna para el protocolo de subagente v2. Cada parte incómoda del manual actual — el hilo separado, el contexto compartido perdido, el truco del catálogo, todo el episodio de retracción y recableado — existe debido a esa única brecha. Ciérrala y la mejor versión de este patrón se vuelve varios pasos más simple.
Preguntas que merecen una respuesta real
¿El esfuerzo de razonamiento máximo cuesta más por token que el predeterminado?
No, y este es el malentendido más común sobre el ajuste. GPT-5.6 Luna cobra $0.20 por millón de tokens de entrada y $1.20 por millón de tokens de salida, independientemente del esfuerzo. Lo que cambia con el máximo es el número de tokens gastados: el modelo planifica más, se comprueba y se corrige antes de responder. Artificial Analysis midió que este modelo emite 130 millones de tokens de salida en un conjunto de pruebas de referencia donde el modelo mediano emite 61 millones. Por lo tanto, una sesión de esfuerzo máximo cuesta más que una de esfuerzo medio en la misma tarea, enteramente por el volumen, y además tarda más en producir su primer token. El esfuerzo es un dial de recuento de tokens con una etiqueta de calidad.
¿Puede GPT-5.6 Luna ejecutarse ya como un subagente nativo de Codex?
Al 5 de agosto de 2026, no — y la comunidad ha dejado de intentarlo. La ruta nativa de subagentes de Codex no acepta Luna; la solución con agentes personalizados la pone en marcha pero pierde el contexto compartido con el agente principal; y el desarrollador detrás del plugin más conocido para este patrón eliminó Luna y luego la volvió a añadir como una tarea de nivel superior lanzada por separado que el orquestador supervisa. Si ves una ejecución multiagente en la que Luna nunca es seleccionada, es probable que esté siendo filtrada porque el catálogo de modelos estándar la marca como v1 en lugar de v2, lo que un desarrollador ha parcheado manualmente bajo su propio riesgo. Esto es lo más probable de la lista que cambie con una actualización de Codex, así que verifícalo contra tu versión instalada en lugar de confiar en cualquier receta, incluida esta.
¿Es lo suficientemente bueno como para reemplazar una suscripción de codificación de Claude o Kimi K3?
Varios desarrolladores han cancelado públicamente un plan de $200 al mes por exactamente esto. La publicación que sacó la pregunta a la luz vino de un inmunólogo que programa a diario: dejó su suscripción de codificación Kimi K3 no porque fuera mala, sino porque no podía justificarla cuando GPT-5.6 Luna era, en su experiencia, igual de buena para su trabajo y mucho más barata — excepto en el frontend. Las cifras de coste independientes hacen difícil descartar el caso: en el mismo conjunto de pruebas, Kimi K3 con el máximo esfuerzo obtuvo 57 por $2,437, mientras que GPT-5.6 Luna con el máximo obtuvo 51 por $174. Pero lean la disidencia antes de cancelar nada. Los desarrolladores que midieron sesiones emparejadas y obtuvieron resultados negativos no estaban probando un modelo distinto; estaban probando un tipo de tarea distinto — abierta, visual o vagamente especificada — y en ese tipo de tarea el modelo más barato perdió lo bastante como para borrar el ahorro. La respuesta defendible es que Luna Max reemplaza una gran parte de tu codificación trabajo, no necesariamente tu mejor codificación modelo, y que los profesionales que más provecho le sacan son los que mantuvieron un nivel de frontera para planificar y verificar.
Comparados en este artículo1
Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario
