
OpenAI redujo los precios de la API de GPT-5.6: qué cambió, por qué y cómo obtenerlo
- qwenNUEVOQwen: Qwen3.8 Max2026-08-03$2.00 / $6.00 por 1M de tokens · 55 tok/s
- deepseekNUEVODeepSeek: DeepSeek V4 Flash 07312026-07-3150Inteligencia69Código
- qwenNUEVOQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens · 206 tok/s
- orcaNUEVOOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicNUEVOAnthropic: Claude Opus 52026-07-2461Inteligencia78Código
- googleNUEVOGoogle: Gemini 3.6 Flash2026-07-2150Inteligencia69Código
- googleNUEVOGoogle: Gemini 3.5 Flash-Lite2026-07-2137Inteligencia49Código
- metaMeta: Muse Spark 1.12026-07-1651Inteligencia71Código
- kimiMoonshotAI: Kimi K32026-07-1557Inteligencia76Código
- openaiOpenAI: GPT-5.6 Luna2026-07-0951Inteligencia71Código
- openaiOpenAI: GPT-5.6 Terra2026-07-0955Inteligencia77Código
- openaiOpenAI: GPT-5.6 Sol2026-07-0959Inteligencia77Código
- grokxAI: Grok 4.52026-07-0854Inteligencia72Código
- tencentTencent: Hy32026-07-0641Inteligencia59Código
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232Inteligencia42Código
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226Inteligencia39Código
- anthropicAnthropic: Claude Sonnet 52026-06-3053Inteligencia72Código
- klingKling: Kling 3.0 Turbo2026-06-1757Inteligencia52Código57Matemáticas
- z-aiZ.ai: GLM 5.22026-06-1651Inteligencia69Código60Matemáticas
- kimiMoonshotAI: Kimi K2.7 Code2026-06-1242Inteligencia61Código61Matemáticas
El 30 de julio de 2026, OpenAI redujo los precios de API de sus dos modelos GPT-5.6 más económicos: recortó drásticamente el nivel más barato y ajustó el nivel medio, sin tocar el modelo insignia. Es un movimiento notable en una guerra de precios cada vez más intensa, y se reflejó de inmediato en la tarifa publicada. Este artículo explica exactamente qué cambió, la ingeniería que hay detrás, cómo se comparan los nuevos precios con los de la competencia, los costos ocultos a tener en cuenta, cómo reducir aún más tu factura — y cómo los precios más bajos ya están disponibles en OrcaRouter con un margen de beneficio del 0 %.
Cada cifra a continuación está etiquetada por fuente. Los precios son por millón de tokens (entrada / salida) y reflejan la tarifa de OpenAI del 30 de julio de 2026, según lo informado por medios como Unite.AI, además de las páginas de modelos de paso directo de OrcaRouter; las cifras de la competencia se atribuyen. Los precios cambian: verifica antes de construir.
TL;DR: OpenAI redujo el precio de GPT-5.6 Luna a $0.20/$1.20 (desde $1/$6, ~80% de descuento) y el de GPT-5.6 Terra a $2/$12 (desde $2.50/$15, ~20% de descuento), mientras que GPT-5.6 Sol se mantiene en $5/$30. Dos mejoras de eficiencia lo han hecho posible: kernels de GPU reescritos (aproximadamente un 20% menos de coste de servicio) y un modelo de borrador de decodificación especulativa rediseñado (generación de tokens un 15% más rápida). El recorte sitúa a Luna por debajo del Haiku 4.5 de Anthropic y cerca del umbral económico de los modelos abiertos marcado por DeepSeek y GLM. Si enrutas a través de un endpoint neutral respecto al proveedor y con margen de beneficio del 0% como OrcaRouter, las nuevas tarifas ya están disponibles: mismo precio, una API compatible con OpenAI, con todos los modelos rivales al lado para comparar y enrutar entre ellos.
Conclusiones clave
• GPT-5.6 Luna: ahora $0.20 / $1.20 por 1M de tokens, antes $1 / $6 — una reducción de aproximadamente el 80%.
• GPT-5.6 Terra: ahora $2 / $12, antes $2.50 / $15 — aproximadamente un 20% menos.
• GPT-5.6 Sol (buque insignia): sin cambios a $5 / $30.
• Por qué: núcleos de GPU de producción reescritos (costo de servicio ~20% menor) más un rediseño del modelo de borrador de decodificación especulativa (eficiencia de generación de tokens superior al 15%), según la publicación técnica de OpenAI del 29 de julio.
• Cómo obtenerlo: el recorte ya está reflejado en OrcaRouter (margen del 0%) — Luna a $0.20 / $1.20 — a través de un endpoint compatible con OpenAI.
¿Qué cambió exactamente?
La familia GPT-5.6 de OpenAI funciona como una escalera de niveles: Luna (rápido, el más barato), Terra (intermedio) y Sol (buque insignia). El recorte del 30 de julio afectó a los dos niveles más baratos. Según la lista de precios reportada, GPT-5.6 Luna bajó de $1 / $6 a $0.20 / $1.20 por millón de tokens de entrada/salida — aproximadamente una reducción del 80% tanto en entrada como en salida — y GPT-5.6 Terra bajó de $2.50 / $15 a $2 / $12, alrededor del 20%. GPT-5.6 Sol, el buque insignia diseñado para el razonamiento más difícil y la codificación agéntica, se mantuvo en $5 / $30. Los niveles de volumen se abarataron drásticamente; el nivel superior no se movió.
La tarifa base por token no es toda la historia. El precio de GPT-5.6 también tiene niveles según la longitud de la entrada (los contextos muy largos pasan a una tarifa más alta), un descuento por caché de prompts (la entrada almacenada en caché es mucho más barata que la entrada nueva) y una opción por lotes (trabajos asíncronos con descuento). Los tres se mantienen en el recorte, por lo que el precio efectivo para una carga de trabajo con mucho uso de caché o lotes puede ser aún menor. Ojo con el nivel de contexto largo en la otra dirección: alimentar con prompts enormes puede hacerte subir de nivel.

Las dos optimizaciones detrás del corte
Esto no fue una estrategia de pérdida deliberada: OpenAI lo presentó como un dividendo de eficiencia. En una publicación de ingeniería del 29 de julio de 2026, miembros del equipo técnico de OpenAI describieron optimizaciones en la inferencia y en el arnés de agentes detrás de Codex y ChatGPT Work. Dos destacan. Primero, reescrituras de kernels de GPU en toda la infraestructura de producción — con Sol, que se ejecuta dentro de Codex, utilizado para reescribir los propios kernels de la empresa — que, según OpenAI, redujeron los costos de servicio de extremo a extremo en aproximadamente un 20%. Segundo, un modelo de borrador de decodificación especulativa rediseñado que, según se informa, mejoró la eficiencia de generación de tokens en más de un 15%. Menores costos de servicio, trasladados a los clientes como precios más bajos en los planes de alto volumen, es la historia — y es un vistazo a un bucle de retroalimentación que toda la industria persigue: usar modelos de frontera para optimizar la propia infraestructura que los sirve.
Cómo se comparan los nuevos precios
El recorte apunta directamente a la competencia. Según el informe de Unite.AI, los nuevos precios de Luna de $0.20 / $1.20 subcotizan el Haiku 4.5 de Anthropic en aproximadamente 5 veces en entrada y unas 4 veces en salida, y los nuevos $2 / $12 de Terra quedan por debajo del precio estándar de Claude Sonnet 5 (reportado en $3 / $15, que entrará en vigor después del 31 de agosto de 2026). En el campo de pesos abiertos, Luna ahora se sitúa cerca del mínimo de inferencia barata establecido por la línea V4 de DeepSeek y el GLM-5.2 de Zhipu (aproximadamente $1.20 / $4.10), con los niveles de Qwen de Alibaba y Gemini Flash de Google en el mismo vecindario. En otras palabras, OpenAI movió sus niveles de volumen hacia abajo, donde ya viven los modelos capaces más baratos, reduciendo la penalización de precio por elegir un modelo propietario frente a uno abierto.
La inferencia sigue abaratándose
Visto en perspectiva, este recorte encaja en una tendencia plurianual: el coste de un nivel determinado de capacidad ha caído drásticamente, generación tras generación, mientras los laboratorios extraen más rendimiento del mismo hardware. Los propios niveles antiguos de OpenAI ilustran este descenso con el tiempo, y cada avance en eficiencia — mejores kernels, decodificación especulativa, atención más barata — tiende a reflejarse en una bajada de precios en cuestión de meses. Para los compradores, la implicación práctica es diseñar para un mundo en el que la inferencia se abarata según un calendario previsible: no te comprometas en exceso con el precio de un único modelo y mantén bajos los costes de cambiar de proveedor.
El costo oculto a tener en cuenta: los tokens de razonamiento
Los modelos GPT-5.6 son modelos de razonamiento, y eso afecta el gasto real. Cuando el razonamiento está habilitado, el modelo emite tokens de razonamiento internos que se facturan como salida, por lo que su costo de salida efectivo puede ser más alto de lo que sugiere una estimación ingenua de "palabras en la respuesta", especialmente en indicaciones difíciles con alto esfuerzo de razonamiento. La solución es ajustar el esfuerzo de razonamiento a la tarea (bajo o desactivado para llamadas simples), limitar la salida cuando sea posible y medir el uso real de tokens en lugar de asumir. Una tarifa más barata por token ayuda, pero controlar cuántos tokens genera ayuda más.
Lo que significa para los desarrolladores
Si usas GPT-5.6 Luna o Terra para trabajo de alto volumen — clasificación, extracción, enrutamiento, agentes ligeros, chat —, tu factura acaba de bajar, en algunos casos en la mayor parte de su valor, sin necesidad de cambiar código. Eso hace que los niveles de volumen sean aún más atractivos para cargas de trabajo sensibles al costo y reduce la brecha de precios frente a los modelos abiertos baratos. El modelo insignia mantiene su precio: Sol a $5 / $30 sigue siendo una opción premium para las tareas más difíciles. El patrón ganador es enrutar por dificultad: niveles económicos (o modelos abiertos baratos) para el 80% fácil, y el modelo insignia solo donde justifica su costo.
Cómo reducir aún más tu factura
El recorte de precios es una base sobre la que construir, no la meta. Las mayores palancas adicionales: caché de prompts (reutiliza un prompt de sistema estable o un contexto largo y paga la tarifa de entrada en caché mucho más baja); la opción por lotes (ejecuta trabajos no urgentes de forma asíncrona con descuento); enrutamiento por nivel y modelo (envía cada solicitud al modelo más barato que pueda procesarla, incluidos los modelos abiertos); y control del razonamiento (no pagues por razonamiento profundo en llamadas triviales). Combinadas, estas medidas suelen reducir las facturas reales mucho más que cualquier cambio de tarifa individual. Como punto de referencia concreto: con 10 millones de tokens al mes y un 70% de tokens de entrada, las nuevas tarifas de Luna rondan los $5 al mes (unos $4,37 con caché); el mismo volumen en Sol cuesta unos $125 al mes: el argumento más claro para enrutar por dificultad.
Cómo capturar los precios más bajos de inmediato
Esta es la parte que lo une todo. a href="https://www.orcarouter.ai/">OrcaRouter/a> aplica un margen del 0 % y traslada directamente los precios del proveedor, por lo que la tarifa de OpenAI ya está disponible en OrcaRouter: GPT-5.6 Luna muestra $0.20 / $1.20 y Terra muestra $2 / $12 en las páginas de modelos ahora mismo — las mismas tarifas que la propia tarjeta de precios de OpenAI, a las que se puede acceder mediante un único endpoint compatible con OpenAI junto a otros 185+ modelos. Obtienes esa tarifa sin necesidad de migrar, y puedes comparar los precios de Luna y Terra con los de DeepSeek, GLM, Qwen, Gemini y Claude en un solo lugar, para luego enrutar cada solicitud a la opción más económica para la tarea. También hay un plan gratuito y una página de Ofertas para ahorrar aún más.

El recorte ya está activo en OrcaRouter: GPT-5.6 Luna a $0.20 / $1.20 por 1M de tokens, pasado a través con un margen del 0%.
Organiza por dificultad para ahorrar aún más
La factura más económica no es un único modelo: es el modelo adecuado para cada solicitud. Dado que OrcaRouter expone todo el campo a través de un solo endpoint, puedes enviar llamadas sencillas y de gran volumen a Luna o a un modelo abierto barato, y reservar Sol u otro modelo de gama alta para las difíciles, cambiando mediante un ajuste de configuración en lugar de una reintegración. Un recorte de precio en Luna abarata aún más esa estrategia de enrutamiento por dificultad, sin necesidad de volver a conectar nada.

Preguntas frecuentes
¿Cuánto redujo OpenAI los precios de GPT-5.6?
GPT-5.6 Luna cayó de $1 / $6 a $0,20 / $1,20 por millón de tokens (alrededor del 80%), y GPT-5.6 Terra de $2,50 / $15 a $2 / $12 (alrededor del 20%). GPT-5.6 Sol se mantuvo en $5 / $30.
¿Cuándo entró en vigor el recorte de precios?
30 de julio de 2026, registrado en el registro de cambios de la API de OpenAI y disponible en la tarjeta de tarifas publicada.
¿Por qué OpenAI bajó los precios?
OpenAI lo atribuye a optimizaciones de inferencia: núcleos de GPU de producción reescritos (aproximadamente un 20% menos de costo de servicio) y un modelo de borrador de decodificación especulativa rediseñado (más de un 15% de eficiencia en generación de tokens), según una publicación de ingeniería del 29 de julio de 2026.
¿Se abarató el buque insignia (Sol)?
No. GPT-5.6 Sol sigue a $5 / $30 por millón de tokens. Solo se recortaron los dos niveles más baratos, Luna y Terra.
¿Cómo se comparan los nuevos precios con Anthropic y los modelos abiertos?
Según los informes, Luna ahora subcotiza a Haiku 4.5 de Anthropic por aproximadamente 5 veces en entrada / 4 veces en salida, y Terra queda por debajo del precio estándar de Claude Sonnet 5 ($3 / $15). Luna también se sitúa cerca del suelo de modelos abiertos baratos establecido por DeepSeek y GLM-5.2.
¿Cuál es el truco con los tokens de razonamiento?
GPT-5.6 son modelos de razonamiento; los tokens de razonamiento internos se facturan como salida, por lo que el costo efectivo de salida puede superar una estimación ingenua. Ajusta el esfuerzo de razonamiento y limita la salida para controlarlo.
¿Cómo obtengo los nuevos precios más bajos?
Ya están disponibles en la API de OpenAI y, con un margen del 0%, en OrcaRouter — donde GPT-5.6 Luna muestra $0.20 / $1.20 — a través de un único endpoint compatible con OpenAI, sin necesidad de cambiar código.
En resumen
El recorte de precios del 30 de julio de OpenAI hace que GPT-5.6 Luna y Terra sean dramáticamente más baratos para trabajos de alto volumen: un dividendo de eficiencia proveniente de la reescritura del kernel y las mejoras en decodificación especulativa, y una respuesta clara a una guerra de precios real que ahora socava los niveles más baratos de Anthropic y se acerca al mínimo de los modelos abiertos. El buque insignia Sol no cambia, así que enruta según la dificultad, apóyate en el almacenamiento en caché y el procesamiento por lotes, y controla los tokens de razonamiento para ahorrar al máximo. Y como OrcaRouter transmite los precios de los proveedores con un margen del 0 %, las tarifas reducidas ya están activas allí: mismo precio, un endpoint compatible con OpenAI, todo el campo de modelos en un solo lugar. Aprovecha el recorte sin cambiar ni una línea de código y deja que cada solicitud elija el modelo más barato que pueda hacer el trabajo.
