Tarjeta de título principal que dice «OpenAI's Decisions API», con el subtítulo «GPT-6 Luna deja de chatear y elige una sola respuesta», con tres tarjetas redondeadas que dicen «Una respuesta de una lista que tú defines», «~150 ms según el proveedor» y «Aún no hay precio publicado», un pie de página que dice «Las cifras de OpenAI son reportadas por el proveedor; aún no hay medición independiente», y el logotipo de OrcaRouter compuesto en la esquina inferior derecha.
Guides & Insights

La API Decisions de OpenAI: GPT-6 Luna deja de chatear y elige una sola respuesta

Autor

Magnus Corvin

Fecha de publicación

Últimos modelos · 20Ver todos los modelos →
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

GPT-6 Luna se lanzó el 22 de septiembre de 2026 como el escalón económico de la escalera GPT-6 de OpenAI. Lo que es nuevo el 29 de septiembre es una tarea para él que no tiene nada que ver con la conversación. La API Decisions de OpenAI toma una pregunta que usted escribió, una lista finita de respuestas que usted permite y un fragmento de contexto —texto o una imagen— y devuelve una de esas respuestas. No prosa. No un párrafo que haya que analizar con la esperanza de que salga bien. Una sola elección, de modo que un ticket de soporte va a una de cinco colas, una imagen cae en una categoría de moderación, o un agente elige su siguiente movimiento de una política que usted definió. Se anunció en DevDay 2026 y ahora está en vista previa limitada, y OpenAI dice que planea un lanzamiento amplio en los próximos días.

Gran parte de lo que un equipo necesita antes de construir sobre esto aún no se ha publicado. No hay precio por llamada, no hay un límite declarado sobre cuántas respuestas candidatas puede incluir una solicitud, no hay ninguna declaración sobre si se puede ajustar con tus propios datos y —a partir del 30 de septiembre— no hay ninguna entrada para ello en ningún lugar del propio índice de documentación para desarrolladores, el registro de cambios o la referencia de API de OpenAI. Revisamos los tres. La capacidad existe actualmente en el resumen del DevDay de OpenAI y en lo que un portavoz de OpenAI dijo a los periodistas el día del lanzamiento. Así que el resto de este artículo mantiene tres niveles visiblemente separados: lo que OpenAI ha confirmado, lo que afirma una medición del día del lanzamiento y lo que nadie puede saber todavía.

Qué es realmente una decisión restringida

Dos enfoques existentes hacen mal este trabajo, y Decisions API apunta a la brecha entre ambos. El primero es hacer prompting sobre un modelo de chat: escribes una instrucción cuidadosa pidiéndole que elija de una lista, te escribe una frase y, si tienes suerte, puedes leer las probabilidades de los tokens de la respuesta para obtener algo que se parezca a una puntuación de confianza. Funciona, quema tokens y el número de confianza es una estimación aproximada. El segundo es entrenar un clasificador pequeño: rápido, barato, y necesita datos etiquetados además de una ejecución de reentrenamiento cada vez que cambia el conjunto de etiquetas.

Un modelo de decisión se sitúa entre ambos. Acepta nuevas etiquetas en el prompt —igual que lo hace un prompt—, pero devuelve una puntuación o una elección sobre la que un desarrollador puede ramificar sin necesidad de analizarla, que es la propiedad que tenía un clasificador y que un modelo de chat nunca tuvo. OpenAI no es ajena a esta forma: su Moderation API lleva años devolviendo puntuaciones por categoría en lugar de texto, con una diferencia que importa aquí. Las categorías de Moderation son de OpenAI. Las categorías de Decisions API son las tuyas.

La restricción es el producto, y vale la pena ser precisos sobre lo que aporta y lo que no. Un espacio de salida finito significa que todos los valores permitidos se conocen de antemano, por lo que tu aplicación puede rechazar una respuesta que no definió, asignar un nivel de permiso diferente a cada rama y recurrir a un humano cuando la confianza o el contexto son escasos. También hace que la evaluación offline sea factible, porque cada caso de prueba tiene una clase objetivo y un costo medible cuando es incorrecto. Lo que no aporta es la corrección. Un modelo restringido aún puede seleccionar la respuesta válida equivocada, dejarse llevar por un contexto engañoso o heredar el sesgo de las categorías que escribiste.

La afirmación de los 150 milisegundos, y el número que OpenAI no publicó

OpenAI dice que la API Decisions toma decisiones aproximadamente diez veces más rápido que GPT-6 Luna a través de la API normal — del orden de 150 milisegundos frente a alrededor de 1,6 segundos. Esa cifra la declara el proveedor y no ha sido reproducida; no existe una medición independiente de ella en los dos días transcurridos desde el lanzamiento, y el propio resumen de OpenAI solo dice «toma de decisiones en tiempo real». La cifra no viene acompañada de ninguna distribución de latencia, región, tamaño de entrada, nivel de concurrencia ni acuerdo de nivel de servicio.

Nuestros propios datos de tráfico no sustituyen esa prueba, pero explican por qué importa la distribución ausente. A lo largo de los siete días hasta el 30 de septiembre, GPT-6 Luna servido a través de la ruta normal de chat-completions de OrcaRouter muestra una mediana de 699 milisegundos y un p95 de 7,6 segundos sobre 3,23 mil millones de tokens de carga de trabajo mixta — una dispersión de más de un orden de magnitud entre la mitad y la cola. Esa es una forma de solicitud distinta a la de una decisión restringida, así que no es una comparación con la afirmación de 150 ms. Es la razón por la que un único p50 de titular es el número equivocado sobre el que diseñar un plazo límite. Si pruebas la versión preliminar, registra la mediana, el p95 y el p99 por separado para entradas de texto e imágenes, incluye el tiempo de red y los reintentos, y mide el plazo límite que tu producto realmente tiene — una decisión de enrutamiento para una cola asíncrona y otra que se sitúa entre un clic y un pago no comparten un presupuesto de latencia.

A single-column scoreboard titled 'GPT-6 Luna and the Decisions API - the scoreboard' with six rows: Decisions API price 'not published', candidate-answer limit 'not published', fine-tuning on your data 'no statement', stated decision latency '~150 ms vendor-reported', GPT-6 Luna input / output '$0.10 / $0.50 per 1M', and AA Intelligence Index at max effort '37.3', with a footer reading 'OpenAI figures vendor-reported; Index per Artificial Analysis; unpublished means blank, not zero.' and the OrcaRouter logo composited in the bottom-right corner.

Precios: cuánto cuesta el modelo subyacente y por qué eso no es el precio de la API

OpenAI no ha publicado ninguna tarifa para la API de Decisions. Tampoco es seguro asumir que se apliquen las tarifas de tokens de Luna, porque la API de Decisions tiene su propio empaquetado — un endpoint diferente con límites diferentes, y OpenAI ha dicho que compartirá más detalles "en el lanzamiento general". Cualquiera que te cotice un costo por decisión en este momento lo está infiriendo.

Lo que se publica es la lista de precios del modelo sobre el que está construido, tomada de la página de precios de OpenAI el 30 de septiembre de 2026:

• Entrada — $0.10 por millón de tokens, que pasa a $0.20 a partir de 272,000 tokens de entrada
• Salida — $0.50 por millón de tokens, que pasa a $0.75 a partir de 272,000 tokens de entrada
• Entrada en caché — $0.01 por millón de tokens; las escrituras en caché se facturan a $0.125, un recargo del 25% sobre la tarifa sin caché
• Procesamiento Batch y Flex — 50% de las tarifas estándar; modo Fast — 2x las tarifas aplicables

La línea del contexto largo es la que suele pillar desprevenida a la gente, y funciona igual que en toda la familia GPT-6: cruzar los 272.000 tokens de entrada hace que toda la solicitud se vuelva a tarificar al nivel superior, no solo el desbordamiento. Una API de decisiones que le pasa un documento largo o un conjunto grande de imágenes al modelo es justo el tipo de llamada que puede cruzar esa línea, lo que es una cosa más que los límites no publicados de la preview dejan en el aire.

GPT-6 Luna en sus propios términos

Si dejamos de lado la API, el modelo que queda debajo es un modelo de razonamiento en el nivel más bajo de una familia de tres peldaños —por debajo de GPT-6 Sol a $2.00/$10.00 y del buque insignia GPT-6 Astra a $10.00/$50.00—, con una ventana de contexto de 1,050,000 tokens, un límite de salida de 128,000 tokens, una fecha de corte de conocimiento del 18 de mayo de 2026, y un esfuerzo de razonamiento configurable en seis valores, desde none hasta max. Acepta entrada de texto e imágenes y devuelve texto, y en la propia documentación para desarrolladores de OpenAI el valor predeterminado de esfuerzo es medium. Una advertencia práctica de esa misma página, no relacionada con la API de Decisions pero relevante si vas a integrar Luna como respaldo: en Chat Completions, la llamada a funciones solo funciona cuando el esfuerzo de razonamiento se establece en none. Las herramientas con cualquier otro ajuste de esfuerzo necesitan la API de Responses.

En cuanto a la calidad, el número independiente es el Intelligence Index de Artificial Analysis con 37.3 para Luna en esfuerzo máximo, frente a 47.5 para GPT-6 Sol — una diferencia de unos diez puntos, que es la forma honesta de leer la diferencia de precio de veinte veces en la entrada. Ninguna de las cifras es una declaración sobre la Decisions API, cuya tarea restringida es una medición completamente distinta y no tiene puntuación publicada.

OpenAI's developer documentation page for the gpt-6-luna model, showing the model heading with compare and playground controls, the reasoning, speed and price tiles, the '$0.1 - $0.5' price range, text and image input with text output, a 1,050,000-token context window, a 128,000-token maximum output, a May 18 2026 knowledge cutoff, the note that reasoning.effort supports none, low, medium (default), high, xhigh and max, and the note that Chat Completions supports function calling only with reasoning effort set to none.

Jev, Laya y el enfoque del «sistema uno»

La API de Decisions no llegó a un campo vacío. El modelo de TypeSafe AI, Jev, lanzado el 15 de septiembre de 2026 por Diogo Almeida y disponible de forma general desde el 21 de septiembre, es el que hizo que esta categoría fuera legible para los desarrolladores: no genera texto en absoluto, sino que devuelve respuestas tipadas con valores de confianza, a $0,042 por millón de tokens de entrada y con la salida facturada a cero. La primera prueba independiente de Jev, realizada por Every, procesó 777 juicios en 37 documentos en menos de 0,7 segundos por aproximadamente un cuarto de centavo, y una segunda prueba lo cronometró en una mediana de 0,35 segundos por pasaje frente a 8,83 segundos para Claude Fable 5.1 con esfuerzo alto — unas 25 veces más rápido a alrededor de 1/580 del costo, a la vez que detectaba seis de siete defectos plantados deliberadamente, frente a Fable 5, que detectó los siete. «Bueno pero no perfecto» fue el veredicto de Every, y es la lectura correcta en una sola línea. Laya es el tercer participante con la misma forma, un modelo de decisiones que responde sin escribir un token.

Que OpenAI haya construido la Decisions API por Jev es especulación. The New Stack, al informar sobre ello el día del lanzamiento, calificó de "probable" una reacción a TypeSafe y señaló que OpenAI probablemente apresuró el anuncio antes de DevDay; OpenAI no ha dicho nada de eso, y la coincidencia temporal —la disponibilidad general de Jev el 21 de septiembre, DevDay el 29 de septiembre— es sugerente pero no es prueba. Lo que no es especulación es que los dos aún no son comparables en el eje que les importa a los compradores. Jev publica un precio, una estructura por llamada y una fecha de disponibilidad general. La API Decisions no publica ninguna de esas tres.

Dónde funciona y qué mantener caliente a su lado

La API Decisions es el empaquetado propio de OpenAI. No es un modelo de nuestro catálogo y no la enrutamos, así que si quieres este endpoint específico, OpenAI es donde reside. El modelo en el que se basa es otro asunto: GPT-6 Luna es una ruta activa en OrcaRouter al precio de lista de OpenAI sin ningún margen añadido — $0,10 de entrada y $0,50 de salida por millón de tokens, con el tramo de >272K a $0,20/$0,75 — y durante los siete días hasta el 30 de septiembre ha servido 3,23 mil millones de tokens a través de nosotros con una tasa de error del 0,18%.

Eso importa para cómo se mitiga el riesgo de una vista previa. La forma sensata de probar un endpoint de decisiones restringidas es mantener activa la ruta basada en prompts como respaldo, porque una vista previa puede cambiar los límites o los precios sin previo aviso y una decisión que está en una ruta crítica necesita un lugar al que ir. Mantener ese respaldo en la misma clave que tus otros modelos significa que no hay un segundo contrato ni cambios de código en la ruta de respaldo: una API para más de 200 modelos, con conmutación automática por error entre proveedores cuando uno flaquea. Y si tu decisión es un paso de una cadena más larga, el DSL de enrutamiento compone modelos en una sola llamada, que es exactamente el patrón de orquestador y decisor que popularizó la cobertura de Jev: un modelo más grande que planifica y un modelo pequeño que elige cada paso. Ese patrón se puede construir hoy a partir de los modelos que servimos; la propia Decisions API quedaría fuera de él hasta que OpenAI la abra.

Quién debería moverse, y quién debería esperar

Si tu problema es un trabajo de clasificación o enrutamiento de gran volumen en el que una rama incorrecta es barata y reversible, la vista previa merece que esta semana definas una estructura de solicitud y un conjunto etiquetado: la capacidad es real, la restricción es una mejora genuina respecto a analizar prosa, y una vista previa es el momento más barato posible para aprender dónde recaen los costos de sus errores. Si tu decisión autoriza dinero, envía mensajes a un cliente o se sitúa entre un usuario y un pago, nada de lo de esta semana cambia tu cálculo: no hay un precio publicado que modelar, ni un límite publicado en torno al cual diseñar, ni un SLA, ni una palabra sobre si puedes ajustar la cosa con tus propios datos. Esos cuatro vacíos son los que tiene que llenar el "despliegue general", y hasta que OpenAI los nombre, la lectura honesta de la Decisions API es la de una interfaz prometedora con un reloj rápido declarado por el proveedor y sin factura adjunta.

OrcaRouter's model page for openai/gpt-6-luna, showing the model name and OpenAI attribution dated 2026-09-22, capability pills for vision, tools, JSON and reasoning, the description of GPT-6 Luna as the fast cost-efficient model below GPT-6 Sol, the /v1/chat/completions route, a $0.10 input and $0.50 output rate per million tokens with a 699 ms p50 time to first token, a 1M-token context with 128K maximum output, and 3234.7M tokens of traffic.

Comparados en este artículo1

Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario