Precios de la API de GPT-5.6: Niveles Sol, Terra y Luna, Costo Real y Cómo Llamar a Cada Uno
Guides & Insights

Precios de la API de GPT-5.6: Niveles Sol, Terra y Luna, Costo Real y Cómo Llamar a Cada Uno

Autor

Fengya Tian

Fecha de publicación

Últimos modelos · 20Ver todos los modelos
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

GPT-5.6 es la familia insignia de OpenAI de julio de 2026, y lo importante para los desarrolladores es que no tiene un precio único. Se distribuye en tres niveles: Sol, Terra y Luna. En la API de OpenAI, Sol cuesta $5 por millón de tokens de entrada y $30 por millón de tokens de salida, Terra cuesta $2.50 y $15, y Luna cuesta $1 y $6. Cada nivel tiene un descuento por entrada en caché, los tres aceptan entrada de imágenes además de texto, y la ventana de contexto es de aproximadamente 1.05M de tokens con hasta 128K de salida.

El precio de lista es solo el comienzo del costo real. El nivel que realmente necesitas, cuánto almacenas en caché, cuánto output genera el modelo, y algunas reglas de precios que la mayoría de las guías omiten—prompts de más de 272K tokens, recargo por residencia de datos, y niveles de servicio—determinan la factura mucho más que la tarifa principal. Esta guía desglosa el precio de cada nivel, para qué sirve, cómo puntúa, cómo migrar desde GPT-5.5, cómo llamarlo, y cómo se compara con Claude, GLM, Gemini, DeepSeek y Grok.

Respuesta rápida: precios de GPT-5.6 de un vistazo

- Tres niveles (por millón de tokens, entrada / salida): Sol $5 / $30, Terra $2.50 / $15, Luna $1 / $6.

- Entrada en caché: $0.50 (Sol), $0.25 (Terra), $0.10 (Luna) por millón de tokens; las escrituras en caché cuestan 1.25x la tasa de entrada sin caché.

- Posicionamiento: Sol para el trabajo de razonamiento más difícil y agentivo, Terra como la opción equilibrada por defecto, Luna para tareas de alto volumen y sensibles al costo.

- Modalidad: multimodal—GPT-5.6 acepta entrada de imágenes junto con texto. Contexto ~1.05M tokens, salida máxima 128K.

- Dos reglas de precios a considerar: los prompts que superan los 272K tokens de entrada se facturan a 2x la entrada y 1.5x la salida para toda la solicitud, y los endpoints de residencia de datos añaden un recargo del 10%.

- Formas de pagar menos: El lote tiene un 50% de descuento sobre el estándar, el almacenamiento en caché reduce la entrada repetida a una décima parte, y enrutar el trabajo rutinario a un nivel inferior evita la salida de $30 de Sol.

- Inteligencia: Artificial Analysis coloca GPT-5.6 Sol cerca del tope de su Índice de Inteligencia (puntuación 59).

Precios de la API de GPT-5.6, nivel por nivel

OpenAI fija el precio de GPT-5.6 por millón de tokens, y la salida es mucho más cara que la entrada en todos los niveles. Las tarifas publicadas actuales son:

GPT-5.6 Sol: $5.00 entrada, $0.50 entrada en caché, $30.00 salida (escrituras de caché $6.25).

- GPT-5.6 Terra: $2.50 de entrada, $0.25 de entrada en caché, $15.00 de salida.

- GPT-5.6 Luna: $1.00 de entrada, $0.10 de entrada en caché, $6.00 de salida.

Dos detalles importan antes de planificar un presupuesto. Primero, la tasa de salida domina la mayoría de las facturas reales, especialmente para trabajos de razonamiento y agentes donde el modelo genera rastros largos, llamadas a herramientas y revisiones antes de una respuesta final. Segundo, no hay una línea de precio separada de "Sol Ultra" en la página de precios; "Sol Ultra" es una configuración de razonamiento superior de Sol (una configuración multiagente), no un nivel independiente: presupuesta en torno a Sol, Terra y Luna.

Para qué sirve realmente cada nivel

Luna: de alto volumen y sensible al costo

Luna es el nivel económico a $1 de entrada y $6 de salida. Es el predeterminado correcto para clasificación, extracción, enrutamiento, resumen, redacción y el gran volumen de trabajo rutinario donde una pequeña diferencia de calidad no cambia el resultado. A seis dólares por millón de tokens de salida, es lo suficientemente barato para ejecutarse a escala y para muestrear repetidamente.

Terra: el equilibrio por defecto

Terra se encuentra en el medio a $2.50 y $15. Para la mayoría de trabajos de aplicación y codificación, es el punto de partida sensato: notablemente más fuerte que Luna en tareas más difíciles, pero a la mitad del precio de salida de Sol. Comience aquí, luego mueva una tarea a Sol solo cuando Terra falle visiblemente.

Sol: el razonamiento más difícil y el trabajo agéntico

Sol es el buque insignia a $5 y $30, y Artificial Analysis lo sitúa cerca de la cima de su Intelligence Index. Resérvalo para arquitectura compleja, depuración difícil, agentes de largo plazo y análisis de alto riesgo donde un fallo evitado justifica la prima. Usar Sol para tareas rutinarias es la forma más común de gastar de más en GPT-5.6.

¿Vienes de GPT-5.5? ¿Qué nivel ahorra más?

GPT-5.6 Sol tiene el mismo precio que GPT-5.5: $5 de entrada y $30 de salida, por lo que mover una carga de trabajo de GPT-5.5 directamente a Sol apenas cambia la factura. El ahorro está en los dos nuevos niveles inferiores. Terra ofrece aproximadamente la misma calidad que GPT-5.5 en la mayoría de las tareas a la mitad del precio, por lo que la migración más simple es enviar el tráfico existente de GPT-5.5 a Terra y solo promover las tareas que retroceden de nuevo a Sol.

El plan de migración práctico consta de tres pasos: redirigir las llamadas de GPT-5.5 a Terra, ejecutar tu conjunto de evaluación, y escalar solo los fallos a Sol mientras empujas el trabajo claramente rutinario hacia Luna. La mayoría de las cargas de trabajo de GPT-5.5 salen más baratas de esta manera sin una pérdida de calidad que puedas medir.

Cómo puntúan realmente los niveles

El precio solo importa junto a la capacidad. En las cifras propias de OpenAI de Terminal-Bench 2.1, los niveles se separan aproximadamente como cabría esperar: Sol 88.8%, Sol Ultra 91.9%, Terra 87.4% y Luna 84.7%. Para contexto en la misma tabla, GPT-5.5 obtiene 85.6%, Claude Opus 4.8 es 78.9%, Claude Fable 5 es 83.1%, y Gemini 3.1 Pro (preview) es 70.7%. Artificial Analysis por separado le da a Sol un Intelligence Index de 59, cerca de la cima de su clasificación.

Considere estos resultados como reportados por el proveedor y de carácter indicativo. OpenAI ha publicado un conjunto limitado de evaluaciones para GPT-5.6 y no, al momento de escribir esto, los benchmarks tradicionales de codificación y razonamiento como SWE-bench Verified o GPQA, por lo que utilice estas puntuaciones para decidir qué probar en su propia carga de trabajo, no como un veredicto final.

La velocidad de lectura de entrada en caché de cada nivel es una décima parte de su velocidad de entrada fresca: $0.50 en Sol, $0.25 en Terra, $0.10 en Luna. Sin embargo, escribir en la caché cuesta 1.25 veces la velocidad de entrada sin caché (aproximadamente $6.25 por millón en Sol), por lo que el almacenamiento en caché solo vale la pena cuando un prefijo estable se reutiliza suficientes veces para recuperar la prima de escritura: instrucciones del sistema, un documento grande, reglas de repositorio o una taxonomía de productos. Coloque el material estable al inicio del prompt y la pregunta cambiante al final, y evite insertar marcas de tiempo o identificadores aleatorios delante del contexto reutilizable.

El almacenamiento en caché reduce el costo de entrada repetido; no hace nada por la salida. Debido a que la salida es el lado costoso en todos los niveles, las dos palancas que más mueven una factura de GPT-5.6 son almacenar en caché un prefijo estable y controlar cuánto escribe el modelo.

¿Qué nivel deberías elegir?

No elijas un nivel por reputación. Elígelo por pruebas. Construye un pequeño conjunto de tareas representativas con criterios de aceptación claros, ejecútalos primero en Luna y promociona solo las tareas que fallan a Terra, luego a Sol. Mide el costo por tarea aceptada, no el precio promedio del token, porque un nivel más barato que necesita tres intentos puede costar más que uno más fuerte que tiene éxito a la primera.

Un hábito operativo ahorra dinero real: fijar el ID exacto del modelo de nivel en cada llamada en lugar de confiar en un alias simple, para que una solicitud rutinaria nunca se ejecute silenciosamente en el nivel más caro. Una carga de trabajo mixta generalmente se resuelve con Luna para transformación y redacción rutinarias, Terra para implementación y análisis cotidianos, y Sol reservado para la minoría difícil: la mayoría de las solicitudes nunca necesitan el modelo insignia.

GPT-5.6 vs la competencia en precio

GPT-5.6 no existe de forma aislada. Léase en comparación con el panorama actual (por millón de tokens, entrada/salida, mediados de 2026): Claude Opus 4.8 cuesta $5/$25, Claude Fable 5—el modelo público más fuerte de Anthropic—cuesta $10/$50, GLM 5.2 cuesta $1.40/$4.40 en Z.AI (los hosts de terceros pueden ser más baratos), Grok 4.5 cuesta $2/$6, el de Google Gemini 3.5 Flash cuesta aproximadamente $1.50/$9, y DeepSeek V4-Pro cuesta aproximadamente $0.44/$0.87. Confirme cada uno en la página del proveedor, ya que estos precios varían.

Las conclusiones son específicas. GPT-5.6 Sol iguala a Opus 4.8 en entrada, pero es más caro en salida ($30 frente a $25), por lo que en trabajo agéntico con mucho peso en salida, Opus es ligeramente más barato por token, mientras que Sol lidera el Intelligence Index. Terra es más barato que ambos buques insignia y es la opción con mejor relación calidad-precio dentro de la familia OpenAI. Luna compite con modelos más baratos en precio, aunque Grok 4.5, GLM 5.2 y especialmente DeepSeek se sitúan aún más abajo. Ningún nivel o proveedor lo gana todo, razón por la cual enrutar según la dificultad supera a comprometerse con uno solo.

Una factura mensual trabajada

Ponle números. Para un mes de carga media-alta de 50M de tokens de entrada y 10M de tokens de salida, al precio de lista antes de almacenamiento en caché y uso de herramientas, el cargo del modelo asciende aproximadamente a:

- GPT-5.6 Luna: alrededor de $110.

- GPT-5.6 Terra: aproximadamente $275.

- GPT-5.6 Sol: aproximadamente $550.

- Para comparación: GLM 5.2 unos $114, Grok 4.5 unos $160, Claude Opus 4.8 unos $500, Claude Fable 5 unos $1,000.

Las mismas tareas enrutadas de manera inteligente—Luna y Terra para la mayor parte, Sol para la minoría difícil—se acercan mucho más a la banda de $110–$275 que a un costo fijo de $550 de Sol para todo. Esa diferencia, multiplicada a lo largo de un año, es todo el argumento a favor del enrutamiento basado en niveles.

Costos ocultos a considerar

Varias reglas de precios no aparecen en la tarifa principal y sorprenden a los equipos más tarde:

- Prompts largos: una solicitud de más de 272K tokens de entrada se factura a 2x de entrada y 1.5x de salida para toda la solicitud, por lo que las llamadas de gran contexto y RAG grande pueden más que duplicar el costo.

- Volumen de salida: la salida es hasta seis veces la tasa de entrada, por lo que la salida sin límite o con razonamiento alto es el principal riesgo de gasto excesivo.

- Nivel de servicio: El procesamiento prioritario es aproximadamente el doble de la tarifa estándar (alrededor de $10 de entrada / $60 de salida en Sol); Flex y Batch son más baratos. Elija el nivel deliberadamente con la configuración service_tier.

- Residencia de datos: los puntos finales de procesamiento regional agregan un incremento del 10% para los modelos lanzados el 5 de marzo de 2026 o después, lo que incluye a GPT-5.6.

- Bucles y reintentos del agente: las instrucciones, herramientas e historial se reenvían en cada turno, y una solicitud larga fallada desperdicia la entrada que ya pagaste.

- Deriva de niveles: dejar todo en Sol "para estar seguro" es el hábito más costoso de todos.

Formas de pagar menos

Tres palancas reducen una factura de GPT-5.6 sin cambiar lo que construyes. Batch: las solicitudes asíncronas a través del nivel Batch tienen un 50 % de descuento sobre el precio estándar, ideal para trabajo de Luna de alto volumen que no sea sensible a la latencia. Caching: reutilizar un prefijo estable suficientes veces para superar la prima de escritura de 1.25x y que las entradas repetidas se reduzcan a una décima. Routing: enviar trabajo rutinario a Luna o Terra y escalar solo la minoría difícil a Sol, y mantener los prompts por debajo del umbral de 272K cuando puedas.

Cómo llamar a GPT-5.6

GPT-5.6 está disponible a través de la API de OpenAI y a través de pasarelas compatibles con OpenAI, por lo que la integración se mantiene estable mientras cambias el modelo o el nivel detrás de ella. El siguiente es un patrón estándar compatible con OpenAI; confirma el ID del modelo actual antes de su uso en producción, y fija el nivel exacto en lugar de un alias simple.

from openai import OpenAI
client = OpenAI(base_url="https://www.orcarouter.ai/v1", api_key="YOUR_API_KEY")
response = client.chat.completions.create(
    model="openai/gpt-5.6-terra",
    messages=[{"role": "user", "content": "Refactoriza este módulo y explica los riesgos."}],
)
print(response.choices[0].message.content)

Cambiar de nivel es un cambio de una sola línea en el campo del modelo, lo que hace que el enrutamiento basado en dificultad sea práctico: enviar las llamadas rutinarias a Luna o Terra y escalar solo las difíciles a Sol.

Probando GPT-5.6 a través de OrcaRouter

Una puerta de enlace facilita la adopción de GPT-5.6 por dos razones. Primero, el mismo cliente compatible con OpenAI puede llamar a los tres niveles y modelos de comparación como Claude Opus 4.8, GLM 5.2 y Grok 4.5, por lo que puede ejecutar un conjunto de evaluación en todo sin reescribir el código de integración y medir el costo real por tarea aceptada (incluidas las tarifas de herramientas, reintentos y el recargo de 272K). Segundo, una puerta de enlace puede realizar failover entre proveedores y aplicar un límite presupuestario, por lo que un problema de capacidad temporal o una llamada Sol errante no arruinan el mes. Confirme la ruta en vivo de GPT-5.6 y los IDs de nivel actuales antes de construir un presupuesto sobre ellos.

Próximo paso: Regístrate en OrcaRouter y ejecuta tu propia comparación de niveles GPT-5.6 a través de un endpoint de API.

Preguntas frecuentes

¿Cuál es la diferencia entre GPT-5.6 Sol, Terra y Luna?

Son tres niveles de la misma familia con diferentes precios y niveles de capacidad. Sol es el buque insignia para el trabajo más duro ($5/$30), Terra es el predeterminado equilibrado ($2.50/$15), y Luna es el nivel económico para tareas de alto volumen ($1/$6). Elige el más bajo que supere tus pruebas.

¿Hay un nivel de precios de GPT-5.6 Sol Ultra?

No. "Sol Ultra" es una configuración de razonamiento superior y multiagente de Sol, no una línea separada en la página de precios. Utiliza más tokens y cuesta más por tarea, pero lo presupuestas como Sol con mayor esfuerzo.

¿Por qué mi factura de GPT-5.6 superó una simple estimación?

Generalmente, tokens de salida, el recargo por consulta larga de 272K (2x entrada, 1.5x salida), nivel de servicio Priority, aumento de residencia de datos, o reintentos. Registre la cadena de solicitud completa y mida el costo por tarea aceptada en lugar de por consulta.

¿Puedo ajustar GPT-5.6, y hay un nivel gratuito?

No en ambos. GPT-5.6 no admite ajuste fino, y la API no tiene nivel gratuito: la facturación comienza en el primer token. El acceso gratuito solo existe dentro de ciertos planes de ChatGPT, que es un producto separado de la API.

¿Qué plan de ChatGPT puede usar qué nivel?

Varía según el producto. En ChatGPT Work y Codex, Free y Go pueden usar Terra, mientras que Plus y superiores pueden elegir entre Sol, Terra y Luna; el ajuste ultra más alto está limitado a Pro y Enterprise. Trata los planes de API y ChatGPT como separados: una clave de API no hereda el acceso de una suscripción.

El resultado final

La historia de precios de GPT-5.6 es la categorización. Sol a $5/$30 lidera los rankings de inteligencia, Terra a $2.50/$15 es el valor predeterminado y el hogar natural para el tráfico anterior de GPT-5.5, y Luna a $1/$6 maneja el volumen. El almacenamiento en caché reduce la entrada repetida a una décima parte (después de una prima de escritura de 1.25x), Batch tiene la mitad de precio, pero la salida es el lado caro en cada nivel y las indicaciones largas de más de 272K tienen un recargo.

Trata los tres niveles como un problema de enrutamiento, no como una compra única: usar el nivel bajo por defecto, escalar en caso de fallo, almacenar en caché el contexto estable, emplear Batch cuando la latencia lo permita y mantener un modelo de comparación accesible a través del mismo punto final. Esto produce un costo por tarea aceptada mucho menor que pagar tarifas premium por trabajo rutinario.


© 2026 OrcaRouter

Para proveedores

¿Operas una plataforma de inferencia? Publica tus modelos en OrcaRouter.

Contáctanos

Únete a la comunidad

DiscordEmailXGitHubYouTube