OpenAI redujo los precios de la API de GPT-5.6: qué cambió, por qué y cómo obtenerlo
Guides & Insights

OpenAI redujo los precios de la API de GPT-5.6: qué cambió, por qué y cómo obtenerlo

Autor

Rowan Sterling

Fecha de publicación

Últimos modelos · 20Ver todos los modelos →
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

El 30 de julio de 2026, OpenAI redujo los precios de API de sus dos modelos GPT-5.6 de menor costo — recortando drásticamente el nivel más económico y ajustando el nivel medio. Tres semanas después se centró en el modelo insignia: el 21 de agosto de 2026, OpenAI anunció que los precios de API de GPT-5.6 Sol caen más de un 20 % durante los próximos tres meses mientras la empresa trabaja para ejecutar el modelo de manera más eficiente. Este artículo explica exactamente qué cambió en ambas rondas, la ingeniería detrás de ellas, cómo se comparan los nuevos precios con los de los rivales, los costos ocultos a tener en cuenta, cómo reducir aún más tu factura — y cómo los precios más bajos ya están disponibles en OrcaRouter con un margen de beneficio del 0 %.

Cada cifra a continuación está etiquetada con su fuente. El precio es por millón de tokens (entrada / salida). Las tarifas de Luna y Terra reflejan la lista de precios de OpenAI del 30 de julio de 2026, según lo informado por medios como Unite.AI; la reducción de Sol refleja el anuncio de OpenAI del 21 de agosto de 2026, con precios por token según lo informado por medios como Runtimewire y Reuters. Las páginas del modelo de pase directo de OrcaRouter muestran los mismos números; las cifras de la competencia se atribuyen. Los precios cambian — verifica antes de construir.

TL;DR. OpenAI redujo GPT-5.6 Luna a $0.20 / $1.20 (desde $1 / $6, ~80% de descuento) y GPT-5.6 Terra a $2 / $12 (desde $2.50 / $15, ~20% de descuento) el 30 de julio. El 21 de agosto extendió el descuento al buque insignia: los precios de la API de GPT-5.6 Sol bajan más de un 20% durante los próximos tres meses —a $4 / $20 por millón de tokens desde $5 / $30, según OpenAI— mientras que los créditos basados en tokens de Codex y ChatGPT Work rinden más y el uso de suscripción permanece sin cambios. Dos mejoras de eficiencia costearon el recorte de julio: núcleos de GPU reescritos (aproximadamente un 20% menos de costo de servicio) y un modelo de borrador de decodificación especulativa rediseñado (generación de tokens más de un 15% más rápida). Si enrutas a través de un endpoint independiente del proveedor, con margen del 0%, como OrcaRouter, las nuevas tarifas ya están activas: mismo precio, una API compatible con OpenAI, con todos los modelos rivales al lado para comparar y enrutar entre ellos.

Puntos clave

• GPT-5.6 Luna: ahora $0.20 / $1.20 por 1M de tokens, antes $1 / $6 — una reducción de aproximadamente el 80%.

• GPT-5.6 Terra: ahora $2 / $12, antes $2.50 / $15 — aproximadamente un 20% menos.

• GPT-5.6 Sol (buque insignia): ahora $4 / $20 durante los próximos tres meses, frente a $5 / $30 — un recorte de más del 20% anunciado el 21 de agosto de 2026.

• Codex y ChatGPT Work: los créditos basados en tokens rinden más: la entrada de Sol baja a 100 créditos y la salida a 500 créditos por 1M de tokens (desde 125 / 750).

• Suscripciones sin cambios: el uso incluido de Plus, Pro y Business, los límites de cinco horas semanales y las tarifas de crédito heredadas no se ven afectados.

• Por qué: OpenAI presentó ambas rondas como dividendos de eficiencia: núcleos de GPU de producción reescritos (~20 % menos de costo de servicio) más un rediseño del modelo de borrador con decodificación especulativa (más del 15 % de eficiencia en la generación de tokens), según la publicación de ingeniería de OpenAI del 29 de julio.

• Cómo obtenerlo: los recortes ya están reflejados en OrcaRouter (margen del 0 %) — Luna a $0.20 / $1.20, Sol a $4 / $20 — a través de un endpoint compatible con OpenAI.

¿Qué cambió exactamente?

La familia GPT-5.6 de OpenAI se organiza en una escalera de niveles: Luna (rápida, la más barata), Terra (intermedia) y Sol (la insignia). El recorte del 30 de julio afectó a los dos niveles más baratos. Según la tarjeta de tarifas informada, GPT-5.6 Luna bajó de $1 / $6 a $0.20 / $1.20 por millón de tokens de entrada/salida, aproximadamente una reducción del 80% tanto en entrada como en salida, y GPT-5.6 Terra bajó de $2.50 / $15 a $2 / $12, alrededor del 20%. GPT-5.6 Sol, la insignia creada para el razonamiento más difícil y la codificación agéntica, no se vio afectada ese día; pero el 21 de agosto de 2026, OpenAI anunció un recorte temporal también para ella: los precios de la API bajan más del 20% durante los próximos tres meses, a $4 por millón de tokens de entrada y $20 por millón de tokens de salida, con la entrada en caché reducida de $0.50 a $0.40. El mismo anuncio decía que los créditos que compras rinden más en Codex en los planes basados en tokens, y el uso incluido en tu suscripción sigue igual.

La tarifa base por token no es toda la historia. El precio de GPT-5.6 también tiene niveles según la longitud de la entrada (los contextos muy largos pasan a una tarifa más alta), un descuento por caché de prompts (la entrada almacenada en caché es mucho más barata que la entrada nueva) y una opción por lotes (trabajos asíncronos con descuento). Los tres se mantienen en el recorte, por lo que el precio efectivo para una carga de trabajo con mucho uso de caché o lotes puede ser aún menor. Ojo con el nivel de contexto largo en la otra dirección: alimentar con prompts enormes puede hacerte subir de nivel.

Las dos optimizaciones detrás del corte

Esto no fue una estrategia de pérdida deliberada: OpenAI lo presentó como un dividendo de eficiencia. En una publicación de ingeniería del 29 de julio de 2026, miembros del equipo técnico de OpenAI describieron optimizaciones en la inferencia y en el arnés de agentes detrás de Codex y ChatGPT Work. Dos destacan. Primero, reescrituras de kernels de GPU en toda la infraestructura de producción — con Sol, que se ejecuta dentro de Codex, utilizado para reescribir los propios kernels de la empresa — que, según OpenAI, redujeron los costos de servicio de extremo a extremo en aproximadamente un 20%. Segundo, un modelo de borrador de decodificación especulativa rediseñado que, según se informa, mejoró la eficiencia de generación de tokens en más de un 15%. Menores costos de servicio, trasladados a los clientes como precios más bajos en los planes de alto volumen, es la historia — y es un vistazo a un bucle de retroalimentación que toda la industria persigue: usar modelos de frontera para optimizar la propia infraestructura que los sirve.

El recorte de Sol anunciado el 21 de agosto presenta el mismo enfoque. Según OpenAI, la reducción —más del 20 % durante los próximos tres meses— se debe a que la empresa está haciendo que el modelo sea más eficiente de ejecutar, y es explícitamente temporal en lugar de un reajuste permanente de precios.

Cómo se comparan los nuevos precios

El recorte apunta directamente a la competencia. Según la información de Unite.AI, el nuevo precio de Luna de $0.20 / $1.20 subcotiza el Haiku 4.5 de Anthropic en aproximadamente 5x en entrada y unas 4x en salida, y el nuevo precio de Terra de $2 / $12 queda por debajo del precio estándar de Claude Sonnet 5 (reportado en $3 / $15, que entrará en vigor después del 31 de agosto de 2026). En el campo de los pesos abiertos, Luna se sitúa ahora cerca del piso de inferencia económica establecido por la línea V4 de DeepSeek y el GLM-5.2 de Zhipu (aproximadamente $1.20 / $4.10), con los niveles de Qwen de Alibaba y Gemini Flash de Google en el mismo rango. El recorte temporal de Sol a $4 / $20 mantiene el buque insignia muy por encima de sus propios niveles de volumen, pero reduce la prima — y la reducción de un tercio en los tokens de salida es la que más importa para las cargas de trabajo de agentes con alto volumen de output. La cobertura de la medida señala que llega en un momento en que OpenAI enfrenta una competencia creciente por parte de Anthropic y los modelos de IA chinos.

La inferencia sigue abaratándose

Visto en perspectiva, este recorte encaja en una tendencia plurianual: el coste de un nivel determinado de capacidad ha caído drásticamente, generación tras generación, mientras los laboratorios extraen más rendimiento del mismo hardware. Los propios niveles antiguos de OpenAI ilustran este descenso con el tiempo, y cada avance en eficiencia — mejores kernels, decodificación especulativa, atención más barata — tiende a reflejarse en una bajada de precios en cuestión de meses. Para los compradores, la implicación práctica es diseñar para un mundo en el que la inferencia se abarata según un calendario previsible: no te comprometas en exceso con el precio de un único modelo y mantén bajos los costes de cambiar de proveedor.

El costo oculto a tener en cuenta: los tokens de razonamiento

Los modelos GPT-5.6 son modelos de razonamiento, y eso afecta el gasto real. Cuando el razonamiento está habilitado, el modelo emite tokens de razonamiento internos que se facturan como salida, por lo que su costo de salida efectivo puede ser más alto de lo que sugiere una estimación ingenua de "palabras en la respuesta", especialmente en indicaciones difíciles con alto esfuerzo de razonamiento. La solución es ajustar el esfuerzo de razonamiento a la tarea (bajo o desactivado para llamadas simples), limitar la salida cuando sea posible y medir el uso real de tokens en lugar de asumir. Una tarifa más barata por token ayuda, pero controlar cuántos tokens genera ayuda más.

Lo que significa para los desarrolladores

Si usas GPT-5.6 Luna o Terra para trabajo de alto volumen — clasificación, extracción, enrutamiento, agentes ligeros, chat — tu factura acaba de bajar, en algunos casos en la mayor parte de su valor, sin necesidad de cambiar código. Eso hace que los niveles de volumen sean aún más atractivos para cargas de trabajo sensibles al costo y reduce la brecha de precio frente a los modelos abiertos baratos. Las matemáticas del buque insignia también han cambiado, al menos por ahora: Sol a $4 / $20 durante los próximos tres meses reduce el costo del trabajo intensivo en razonamiento y de los agentes en el nivel superior, y los créditos de trabajo de Codex y ChatGPT basados en tokens rinden más. Sigue siendo una opción premium para las tareas más difíciles — solo que más barata que antes. El patrón ganador es el mismo: clasifica por dificultad — niveles baratos (o modelos abiertos baratos) para el 80% fácil, el buque insignia solo donde justifica su costo.

Cómo reducir aún más tu factura

El recorte de precios es una base sobre la que construir, no la meta. Las mayores palancas adicionales: caché de prompts (reutiliza un prompt de sistema estable o un contexto largo y paga la tarifa de entrada en caché mucho más baja); la opción por lotes (ejecuta trabajos no urgentes de forma asíncrona con descuento); enrutamiento por nivel y modelo (envía cada solicitud al modelo más barato que pueda procesarla, incluidos los modelos abiertos); y control del razonamiento (no pagues por razonamiento profundo en llamadas triviales). Combinadas, estas medidas suelen reducir las facturas reales mucho más que cualquier cambio de tarifa individual. Como punto de referencia concreto: con 10 millones de tokens al mes y un 70% de tokens de entrada, las nuevas tarifas de Luna rondan los $5 al mes (unos $4,37 con caché); el mismo volumen en Sol cuesta unos $125 al mes: el argumento más claro para enrutar por dificultad.

Cómo capturar los precios más bajos de inmediato

Esta es la parte que lo une todo. OrcaRouter cobra un margen del 0% y traslada los precios de los proveedores directamente, por lo que los recortes de OpenAI ya están activos en OrcaRouter: GPT-5.6 Luna muestra $0.20 / $1.20, Terra $2 / $12 y GPT-5.6 Sol $4 / $20 en las páginas de los modelos ahora mismo — las mismas tarifas que la propia tarjeta de OpenAI, accesibles a través de un único endpoint compatible con OpenAI junto a más de 185 otros modelos. Consigues los recortes sin migración, y puedes comparar precios de Sol, Luna y Terra frente a DeepSeek, GLM, Qwen, Gemini y Claude en un solo lugar, para luego enrutar cada solicitud a la opción más barata para el trabajo. También hay un plan gratuito y una página de Ofertas para obtener ahorros adicionales.

Los recortes ya están disponibles en OrcaRouter: GPT-5.6 Luna a $0.20 / $1.20 y GPT-5.6 Sol a $4 / $20 por 1M de tokens, trasladados sin margen.

Organiza por dificultad para ahorrar aún más

La factura más barata no es un único modelo: es el modelo adecuado para cada solicitud. Como OrcaRouter expone toda la gama a través de un único endpoint, puedes enviar llamadas fáciles y de gran volumen a Luna o a un modelo abierto barato, y reservar Sol u otro modelo insignia para las difíciles, cambiando con un ajuste de configuración en lugar de una reintegración. Un recorte de precio en Luna abarata aún más esa estrategia de enrutamiento por dificultad, y el descuento temporal de Sol también reduce el coste de las llamadas difíciles, sin que tengas que rehacer ninguna conexión.

Preguntas frecuentes

¿Cuánto redujo OpenAI los precios de GPT-5.6?

GPT-5.6 Luna cayó de $1 / $6 a $0.20 / $1.20 por millón de tokens (aproximadamente un 80%), y GPT-5.6 Terra de $2.50 / $15 a $2 / $12 (aproximadamente un 20%). El 21 de agosto de 2026, OpenAI también recortó GPT-5.6 Sol de $5 / $30 a $4 / $20 durante los próximos tres meses.

¿Cuándo entró en vigor el recorte de precios?

Los recortes de Luna y Terra entraron en vigor el 30 de julio de 2026, publicados en la tarifa vigente. OpenAI anunció la reducción temporal de Sol el 21 de agosto de 2026, para los próximos tres meses.

¿Por qué OpenAI bajó los precios?

OpenAI atribuye el recorte de julio a optimizaciones de inferencia — kernels de GPU reescritos para producción (un costo de servicio aproximadamente 20% menor) y un modelo de borrador de decodificación especulativa rediseñado (eficiencia de generación de tokens superior al 15%) — según una publicación de ingeniería del 29 de julio de 2026. Enmarcó el recorte de Sol de la misma manera, como un paso dado mientras el modelo se vuelve más barato de ejecutar, en un mercado con una competencia creciente.

¿Se abarató el buque insignia (Sol)?

Sí, temporalmente. El recorte del 30 de julio dejó a GPT-5.6 Sol en $5 / $30, pero el 21 de agosto de 2026, OpenAI anunció una reducción de precios de más del 20% para los próximos tres meses, a $4 / $20 por millón de tokens. Los créditos basados en tokens de Codex y ChatGPT Work también compran más, mientras que el uso de suscripciones permanece sin cambios.

¿Cómo se comparan los nuevos precios con Anthropic y los modelos abiertos?

Según los informes, Luna ahora subcotiza a Haiku 4.5 de Anthropic por aproximadamente 5 veces en entrada / 4 veces en salida, y Terra queda por debajo del precio estándar de Claude Sonnet 5 ($3 / $15). Luna también se sitúa cerca del suelo de modelos abiertos baratos establecido por DeepSeek y GLM-5.2.

¿Cuál es el truco con los tokens de razonamiento?

GPT-5.6 son modelos de razonamiento; los tokens de razonamiento internos se facturan como salida, por lo que el costo efectivo de salida puede superar una estimación ingenua. Ajusta el esfuerzo de razonamiento y limita la salida para controlarlo.

¿Cómo obtengo los nuevos precios más bajos?

Ya están disponibles en la API de OpenAI y, con un margen del 0%, en OrcaRouter — donde GPT-5.6 Luna muestra $0.20 / $1.20 y GPT-5.6 Sol $4 / $20 — a través de un endpoint compatible con OpenAI, sin necesidad de cambiar código.

En resumen

El recorte del 30 de julio de OpenAI hizo que GPT-5.6 Luna y Terra fueran dramáticamente más baratos para trabajos de alto volumen, y su anuncio del 21 de agosto extiende la historia al buque insignia: GPT-5.6 Sol baja a $4 / $20 durante los próximos tres meses, mientras que los créditos de token de Codex compran más y el uso de la suscripción permanece sin cambios. Ambas rondas son dividendos de eficiencia: reescrituras de kernel y ganancias de decodificación especulativa por un lado, y un servicio más barato de ejecutar por el otro, y una respuesta clara a una guerra de precios real. Enruta por dificultad, apóyate en el almacenamiento en caché y el procesamiento por lotes, y controla los tokens de razonamiento para ahorrar al máximo. Y debido a que OrcaRouter transmite los precios de los proveedores con un margen del 0%, las tarifas más bajas ya están activas allí: Luna a $0.20 / $1.20, Sol a $4 / $20: mismo precio, un endpoint compatible con OpenAI, todo el campo de modelos en un solo lugar. Aprovecha los recortes sin cambiar una línea de código y deja que cada solicitud elija el modelo más barato que pueda hacer el trabajo.