
GPT-6 Astra API: el ID del modelo, el endpoint y lo que realmente cuesta una tarea de horizonte largo
- orcaNUEVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens
- deepseekNUEVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- openaiNUEVOOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligencia72Código
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligencia76Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligencia69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Inteligencia78Código
The short version: GPT-6 Astra is callable today at https://api.openai.com/v1 under a single model id, gpt-6-astra, at $10.00 per million input tokens, $1.00 cached input and $50.00 output — the figures OpenAI's own pricing page carried on September 16, 2026. The model itself is from September 3, 2026, thirteen days before this page was written, so nothing here is launch coverage and nothing here is framed as an announcement. This is the reference page for the developer question that comes after availability: what string to pass, which endpoint takes it, what the 1,050,000-token window really buys, what the account has to look like first, and what one genuine long-horizon agent run costs on a rate card that quietly reprices itself above 272,000 input tokens. GPT-5.6 Sol appears throughout only as the price baseline it is sold above, never as the subject.
La razón por la que un modelo de trece días merece una página esta semana es que las vías de acceso a él cambiaron después de que cambiara el lanzamiento, y la ruta de la API es ahora la habitual. Cuando OpenAI lanzó Astra el 3 de septiembre, lo describió como un despliegue progresivo más que como una disponibilidad; para el 8 de septiembre ya decía que el modelo se había desplegado por completo para los usuarios de Plus, Pro, Business y Enterprise en Codex y ChatGPT Work, y para la semana del 14 de septiembre AWS lo listaba en Bedrock y Microsoft Foundry lo ofrecía con disponibilidad general. Para quien llama a la API, esa secuencia importa menos de lo que parece —el endpoint ha estado activo y documentado todo el tiempo—, pero sí significa que las preguntas de adquisición en torno a él ahora tienen respuestas que no tenían el día del lanzamiento. Todo lo que aparece a continuación se leyó en la propia documentación del modelo, la página de precios y la página de controles de datos de OpenAI el 16 de septiembre de 2026, y cualquier cosa que provenga de otro lugar lo indica en la frase que la contiene.
El ID del modelo, y la pregunta de la instantánea respondida honestamente.
La cadena que hay que pasar es gpt-6-astra — en minúsculas, con guiones, sin prefijo de proveedor. Ese es el único id que OpenAI documenta para este modelo.
Si buscas una instantánea con fecha para fijar, no hay ninguna que encontrar, y no vamos a inventar un sufijo de aspecto plausible. La página del modelo de OpenAI para GPT-6 Astra enumera exactamente una entrada en Snapshots, y es la gpt-6-astra a secas. No existe ninguna forma fechada al estilo -2026-09-03 ni ningún alias -latest del lado del proveedor. Durante la investigación vimos un alias cambiante con la forma ~openai/gpt-astra-latest en un listado de router; eso es una construcción de pasarela creada sobre el id del proveedor, no algo que OpenAI publique, y no debería ir en tu configuración como si lo fuera.
La consecuencia práctica es pequeña, pero vale la pena mencionarla. Puedes recuperar el objeto del modelo para confirmar con qué estás hablando:
curl https://api.openai.com/v1/models/gpt-6-astra -H "Authorization: Bearer $OPENAI_API_KEY"
Fija el id base en un valor de configuración en lugar de escribirlo en una docena de sitios de llamada. Si OpenAI añade más adelante instantáneas con fecha, el id base se convierte en el blanco móvil y tu valor fijado empieza a cambiar bajo tus pies — un solo lugar que editar es la diferencia entre un cambio de dos minutos y una tarde de buscar con grep.
El endpoint: URL base, compatibilidad y una solicitud que se ejecuta
The base URL is https://api.openai.com/v1. Per OpenAI's model documentation, GPT-6 Astra is supported on Responses (/v1/responses), Chat Completions (/v1/chat/completions) and Batch (/v1/batch). It is explicitly not supported on Realtime, Assistants, Fine-tuning, Embeddings, image generation and editing, video, audio, moderation, or the legacy Completions endpoint — and those absences matter as much as the presence list, because a team that planned around the Assistants API or a fine-tuned variant has to replan rather than rewrite.
Sobre la compatibilidad: esta es la API de primera parte de OpenAI, que es el formato de transmisión para el que se escribió cada SDK y cliente compatible con OpenAI. Cualquier cosa que hable ese formato se comunicará con gpt-6-astra sin necesidad de una capa de compatibilidad; solo cambias la cadena del modelo y, si estás migrando desde un modelo de OpenAI anterior, los nombres de los parámetros que aparecen a continuación. El trabajo nuevo debería usar la Responses API: es la superficie en la que OpenAI documenta el control de razonamiento de este modelo, es donde residen las herramientas integradas, y el soporte de Chat Completions para los modelos más nuevos históricamente ha sido el más superficial de los dos.
Una llamada de streaming mínima, con el esfuerzo de razonamiento establecido:
curl https://api.openai.com/v1/responses \
-H "Authorization: Bearer $OPENAI_API_KEY" \
-H "Content-Type: application/json" \
-d '{"model": "gpt-6-astra", "input": "Enumera los archivos que cambiarías para migrar este servicio fuera de la API de autenticación heredada.", "reasoning": {"effort": "high"}, "max_output_tokens": 16000, "stream": true}'
Y lo mismo en Python, que es donde la mayoría de los lectores se desenvuelve en realidad:
from openai import OpenAI
client = OpenAI()
stream = client.responses.create(model="gpt-6-astra", input="Enumera los archivos que cambiarías para migrar este servicio fuera de la API de autenticación heredada.", reasoning={"effort": "high"}, max_output_tokens=16000, stream=True)
para evento en stream:
if event.type == "response.output_text.delta": print(event.delta, end="")
Tres cosas de esa solicitud son específicas de este modelo en lugar de estar copiadas de una guía de inicio rápido genérica.
• El esfuerzo de razonamiento es un ajuste de costo, no solo un ajuste de calidad. La página del modelo de OpenAI enumera los valores admitidos como low, medium, high, xhigh y max. Fíjate en dónde empieza esa lista: no hay none ni minimal para GPT-6 Astra, así que el mínimo subió. Los tokens de razonamiento se facturan como tokens de salida a $50,00 por millón, lo que significa que pasar el esfuerzo de high a max es una decisión con un precio asociado, no una mejora de calidad gratuita.
• Se admite streaming, y es la forma honesta de ejecutar turnos largos. Una sola solicitud en este modelo puede emitir hasta 128,000 tokens de salida. Esperar a que eso llegue en un solo cuerpo de respuesta, sin visibilidad de si está avanzando, es como terminas adivinando los tiempos de espera.
• El almacenamiento en caché de prompts es explícito aquí. La API de Responses documenta un prompt_cache_breakpoint en contenido de texto, imagen y archivo, con un modo explícito, que marca "el final exacto de un prefijo de prompt reutilizable" y hereda su TTL de prompt_cache_options.ttl de la solicitud. En un modelo cuya tarifa de entrada en caché es una décima parte de su tarifa sin caché, dónde colocas ese límite es la línea de mayor impacto en tu solicitud.

Qué significa realmente una ventana de 1.050.000 tokens
Las cifras documentadas son una ventana de contexto de 1.050.000 tokens, una entrada máxima de 922.000 tokens, una salida máxima de 128.000 tokens y una fecha de corte de conocimiento del 30 de abril de 2026.
Empieza por la aritmética que la gente pasa por alto: 922.000 más 128.000 es igual a 1.050.000. La ventana se comparte entre lo que envías y lo que el modelo puede devolver, y el límite de salida queda reservado dentro de ella. No puedes enviar 1.050.000 tokens de entrada; el límite práctico para una sola solicitud es 922.000, y menos que eso si quieres espacio para una respuesta real.
¿Qué se puede comprar con un millón de tokens en las unidades con las que realmente trabajas? Las conversiones de tokens a texto son aproximadas, y estas son nuestras y no de OpenAI, pero son del orden de magnitud correcto: a aproximadamente cuatro caracteres por token, 1.050.000 tokens son del orden de 750.000 palabras, o algo así como cien mil líneas de código. Eso es un repositorio de tamaño medio, completo, con espacio de sobra para la salida de herramientas que un agente genera mientras trabaja. El caso de horizonte largo para el que se vende el modelo es exactamente este: un agente que leyó un archivo hace una hora y todavía puede ver lo que decía, en lugar de uno que ha compactado la mañana en un párrafo de resumen.
Después está la parte que corresponde a una página de costes en lugar de a una página de especificaciones. La documentación del modelo de OpenAI indica que los prompts con más de 272.000 tokens de entrada tienen un precio de 2x las tarifas de entrada y de caché, y 1,5x la de salida para toda la solicitud. La página de precios lo incluye como una segunda fila: el contexto largo en GPT-6 Astra cuesta $20,00 de entrada, $2,00 de entrada en caché y $75,00 de salida. Así que las tres cuartas partes superiores de esa ventana son una banda de precios, no solo un margen de capacidad. Una ejecución cuya transcripción supere los 272.000 tokens paga el doble por cada token de entrada —incluidos los de caché— durante toda la solicitud, y esa es la mayor variación en la economía de este modelo. Se detalla por completo a continuación.
Otra mecánica que conviene conocer, porque es el propio reconocimiento del proveedor de que una sola ventana no es toda la solución. Para Codex, OpenAI describe un enfoque de contexto experimental que se distribuye con Astra, en el que las notas persisten entre ventanas de contexto en lugar de una compactación repetida en un único resumen, y las ventanas anteriores siguen siendo consultables, de modo que los requisitos y los resultados de pruebas de mensajes anteriores y de la salida de herramientas siguen siendo localizables. OpenAI lo califica de experimental, dice que está habilitado en el config.toml de Codex y afirma que se convertirá en la opción predeterminada para Astra. Si estás construyendo el equivalente por tu cuenta sobre la API, esa es la forma que debes copiar: notas duraderas más un historial recuperable, en lugar de un único prompt heroico.
Y el límite del propio número: una ventana grande es una capacidad, no una garantía de atención a lo largo de ella. Las cifras de horizonte largo reportadas por el proveedor son una mejor guía del comportamiento que el recuento de tokens — OpenAI reporta OSWorld 2.0 con un 72,6 % en aproximadamente 40 minutos por tarea, y Terminal-Bench 4.0 con un 57,9 % frente al 37,3 % de GPT-5.6 Sol. Esos son los propios números de OpenAI, no reproducidos por nosotros, y el panorama independiente es cercano pero no idéntico: Artificial Analysis midió Astra con un 59,1 % en Terminal-Bench v4.0 frente al 52,0 % de Claude Fable 5.1 y el 39,9 % de GPT-5.6 Sol. Ambos conjuntos de cifras coinciden en que la brecha de horizonte largo respecto a la generación anterior es real; ninguno de los dos es un sustituto de ejecutar tu propia tarea.
Modalidades de entrada, y la cuestión del archivo dejada honestamente abierta
La página del modelo de OpenAI enumera modalidades de entrada de texto e imagen, con salida de texto. Sin audio, sin video, sin generación de imágenes en este modelo.
La entrada de imagen se incluye como una parte de contenido dentro de un mensaje de usuario. El tipo de parte es input_image, y la imagen se proporciona ya sea como una URL totalmente cualificada o como una URL de datos base64 en image_url, o como un file_id de la Files API. Hay un detail opcional de auto, low, high u original, que por defecto es auto. La forma es:
{"model": "gpt-6-astra", "input": [{"role": "user", "content": [{"type": "input_text", "text": "¿qué cambió en esta captura de pantalla?"}, {"type": "input_image", "image_url": "data:image/png;base64,...", "detail": "high"}]}]}
La documentación de visión de OpenAI enumera PNG, JPEG, WEBP y GIF no animado como formatos aceptados, con hasta 512 MB de carga útil total por solicitud y hasta 1.500 imágenes por solicitud, y las imágenes de más de 30.000 parches se rechazan en lugar de reducir su tamaño. Esos son los límites generales de visión de la plataforma, no los específicos de Astra, y las imágenes se facturan como tokens igual que cualquier otra entrada.
Ahora, la pregunta con la que los lectores realmente llegan, y la respuesta honesta. ¿Puedes enviar archivos o PDF? No pudimos confirmar la entrada de documentos para este modelo en la documentación de OpenAI, y no vamos a insinuar que funciona. La API de Responses sí define una parte de contenido input_file, así que la infraestructura existe en la API en general; pero la página de OpenAI para GPT-6 Astra enumera texto e imagen como sus modalidades de entrada y no incluye archivo, y no encontramos ninguna declaración de OpenAI que documente la entrada de PDF para este endpoint. Un listado de router para el mismo modelo sí muestra archivo junto con texto e imagen — trátalo como reportado por el router, que es lo que un router registra sobre una ruta en lugar de lo que garantiza el proveedor. Si la ingesta de documentos es crítica para tu carga de trabajo, pruébala contra el endpoint real antes de construir sobre ella, y ten listo un respaldo de OCR a texto. Esa es la diferencia entre una tarde de pruebas y una reescritura.
La línea de precios completa, y una ejecución a largo plazo con precio calculado.
Todas las cifras de esta sección se tomaron de la propia página de precios de OpenAI el 16 de septiembre de 2026, y todas corresponden a millones de tokens en el nivel Standard, salvo que la línea indique lo contrario.
• Contexto corto, hasta 272K de entrada — $10.00 de entrada, $1.00 de entrada en caché, $12.50 de escritura en caché, $50.00 de salida.
• Contexto largo, más de 272K de entrada — $20.00 de entrada, $2.00 de entrada en caché, $25.00 de escritura en caché, $75.00 de salida, aplicado a la solicitud completa.
• Batch and Flex — la mitad de Standard: $5.00 / $0.50 / $6.25 / $25.00 contexto corto, $10.00 / $1.00 / $12.50 / $37.50 contexto largo.
• Modo rápido — el doble del Estándar: $20.00 / $2.00 / $25.00 / $100.00 contexto corto, $40.00 / $4.00 / $50.00 / $150.00 contexto largo. OpenAI señala que el modo rápido no está disponible para GPT-6 Astra con residencia de datos en la UE.
• Residencia de datos — los endpoints que la utilizan conllevan un recargo del 10 % para los modelos lanzados el 5 de marzo de 2026 o después. GPT-6 Astra cumple los requisitos, por lo que una implementación con residencia de datos se sitúa un 10 % por encima de todas las cifras anteriores.
La cifra que hay que interiorizar es la tarifa de entrada en caché. $1.00 frente a $10.00 es un descuento del 90 % en la parte del prompt que se envía de nuevo —y, en la carga de trabajo de un agente, eso es casi todo el prompt. Las escrituras en caché se facturan a $12.50, o 1.25x la tarifa de entrada sin caché, así que el punto de equilibrio es simple: 100,000 tokens enviados sin caché dos veces cuestan $2.00, mientras que escribir ese prefijo una vez y volver a leerlo una vez cuesta $1.35. El uso de caché resulta rentable a partir de la segunda reutilización, y un agente que trabaja la misma transcripción durante cien turnos la reutiliza cien veces.
Lo que nos lleva a la aritmética que realmente decide si este modelo es asequible, porque la tarifa principal no es el número que aparece en la factura. Aquí hay una ejecución modelada —la nuestra, basada en las tarifas publicadas de OpenAI, no una factura medida— para el tipo de tarea para la que se vende el modelo: un agente de codificación autónomo que trabaja en una migración a escala de repositorio durante unas horas, 120 llamadas al modelo, una transcripción de trabajo que promedia alrededor de 500.000 tokens de entrada por llamada a medida que se acumula, el 80% de esa entrada servida desde caché, y 400.000 tokens de salida en toda la ejecución, incluido el razonamiento.
A las tarifas Standard de contexto corto:
• Entrada sin caché — 12 M tokens × $10.00 = $120.00
• Entrada en caché — 48M tokens × $1.00 = $48.00
• Salida — 0.4M tokens × $50.00 = $20.00
• Total ≈ $188.00 por la ejecución
La misma ejecución en la banda de contexto largo, que es lo que realmente obtiene una transcripción que supera los 272,000 tokens por llamada:
• Entrada sin caché — 12M tokens × $20.00 = $240.00
• Entrada en caché — 48M tokens × $2.00 = $96.00
• Salida — 0,4 M de tokens × $75,00 = $30,00
• Total ≈ $366.00 por la ejecución
De eso se desprenden dos conclusiones, y ninguna se ve en la tarifa titular. Primero, dónde vive tu transcripción vale tanto como qué modelo eliges — la misma tarea cuesta aproximadamente el doble dependiendo de si cruza el umbral de 272K, lo que convierte la disciplina de contexto (recuperar los 100K correctos en lugar de cargar con 600K) en una técnica de control de costos en este modelo, no solo de rendimiento. Segundo, el almacenamiento en caché vale más de lo que sugiere el descuento: sin ningún acierto de caché, el primer escenario conlleva $600.00 de entrada en lugar de $168.00, y la ejecución cuesta unos $620 en lugar de $188. Activa el almacenamiento en caché antes de subir el esfuerzo de razonamiento.
Para la línea base, la misma combinación de tokens en GPT-5.6 Sol con las tarifas que la página de precios de OpenAI mostraba el 16 de septiembre — 4,00 $ de entrada, 0,40 $ de entrada en caché, 20,00 $ de salida en contexto corto — asciende a aproximadamente 75,20 $, y en la fila de contexto largo de Sol (8,00 $ / 0,80 $ / 30,00 $) a aproximadamente 146,40 $. Eso hace que esta ejecución sea de unas 2,5x en cualquiera de las dos bandas. Dos advertencias sobre ese múltiplo, porque ya ha causado confusión en otros sitios: el número de Sol es una tarifa promocional — OpenAI dice que la promoción estará disponible al menos hasta el 21 de noviembre de 2026 — mientras que el de Astra es de lista, así que el múltiplo mide las dos tablas de tarifas actuales y no un hecho estable sobre los modelos, y se reduce si la promoción caduca. Y el antiguo «2,5x» que circula para Astra a veces se calcula frente a la lista previa a la promoción de Sol de 5,00 $/30,00 $, lo que da 2x en entrada y alrededor de 1,67x en salida. Especifica a qué tarifa de Sol te refieres o el número no vale nada.
Una línea más: el nivel Batch lo reduce todo a la mitad, llevando la primera ejecución a unos $94. Que puedas usarlo depende de la siguiente sección.

Retención cero de datos, y el descuento que se descalifica a sí mismo
OpenAI afirma que la Retención Cero de Datos está disponible para clientes de API elegibles en endpoints compatibles, sujeta a aprobación — y ambas mitades de esa frase cumplen una función real. No es una opción de autoservicio: la elegibilidad está sujeta a la aprobación previa de OpenAI y a la aceptación de requisitos adicionales, y se activa hablando con el equipo de ventas. Una vez aprobada, se configura a nivel de organización o de proyecto en Configuración → Organización → Controles de datos, en la pestaña Retención de datos, donde un proyecto puede heredar el valor predeterminado de la organización, establecer ZDR explícitamente, seleccionar Supervisión de abuso modificada o desactivar ambas opciones.
Qué cambia en la práctica: ZDR excluye el contenido del cliente de los registros de monitoreo de abuso, reemplazando la retención predeterminada de hasta 30 días, y el parámetro store en /v1/responses y /v1/chat/completions se trata como false incluso si una solicitud intenta establecerlo como true.
El detalle que más importa en una página sobre costos: /v1/batches no está en la lista de endpoints elegibles para ZDR. La página de controles de datos de OpenAI lo enumera como no elegible, con el estado de la aplicación retenido hasta que se elimine. Así que en GPT-6 Astra, el descuento del 50% del nivel Batch y la Retención de Datos Cero son mutuamente excluyentes — una carga de trabajo sujeta a cumplimiento que necesita ZDR debería presupuestar la tarifa Estándar, no la tarifa batch, y la cifra de $94 anterior no está disponible para ella.
Tres advertencias adicionales, expuestas sin rodeos, porque una página que vende ZDR de más es peor que una que lo omite. ZDR no es absoluto: en «Eyes Off», OpenAI se reserva el derecho a hacer que los modelos no sean elegibles para ZDR para clientes específicos, con aviso previo por escrito, y en «Safety Retention», el contenido puede conservarse y ser revisado por humanos cuando los clasificadores señalen un riesgo grave. Las entradas de imágenes y archivos señaladas por posible CSAM se conservan para revisión manual incluso bajo ZDR. Y ZDR se detiene en el límite de OpenAI: si tu agente llama a un servidor MCP remoto o a la API de otro proveedor, ese tráfico se rige por la política de retención de ese tercero, no por esta. Por separado, la residencia de datos es un control distinto de ZDR, requiere su propia aprobación y una enmienda de Modified Retention fuera de Estados Unidos, y conlleva el recargo del 10 % mencionado anteriormente. Si dependes del almacenamiento en caché bajo ZDR, lee la página de controles de datos de OpenAI para saber qué retiene el almacenamiento en caché; no vamos a publicar una cifra de retención para ello que nosotros mismos no hayamos podido leer allí.
Los límites de velocidad tal como están documentados, y el que muerde primero
La página del modelo de OpenAI publica estos límites por nivel para GPT-6 Astra: solicitudes y tokens por minuto, y luego el límite de la cola de lotes:
• Nivel 1 — 500 RPM, 500.000 TPM, cola por lotes 1.500.000
• Nivel 2 — 5.000 RPM, 1.000.000 TPM, cola de lotes 3.000.000
• Nivel 3 — 5.000 RPM, 2.000.000 TPM, cola de lotes 100.000.000
• Nivel 4 — 10.000 RPM, 4.000.000 TPM, cola de lotes 200.000.000
• Nivel 5 — 15,000 RPM, 40,000,000 TPM, cola de lotes 15,000,000,000
Dos límites que vamos a señalar como no documentados en lugar de rellenarlos: no hay un límite publicado para el nivel gratuito, porque GPT-6 Astra no está en el nivel gratuito en absoluto; y no encontramos ningún techo publicado por encima del Nivel 5 ni una tabla de límites aparte para el modo Fast. Si un proveedor no ha publicado un límite, trata esa ausencia como algo no resuelto — no asumas que es ilimitado.
El número que afecta primero a la carga de trabajo de un agente es el TPM de 500.000 del Nivel 1. Una sola llamada a este modelo puede contener una transcripción de 500.000 tokens, lo que significa que una sola solicitud puede consumir un minuto completo de tu presupuesto de tokens en el nivel de entrada. Una ventana de contexto de un millón de tokens no le sirve de mucho a un agente que acapara la misma transcripción durante 120 turnos si el nivel no puede procesar los tokens. Dimensiona el nivel según el volumen de tokens del ejemplo práctico anterior, no según el número de solicitudes, y ten en cuenta que el ascenso de nivel depende del gasto y del historial de la cuenta, por lo que vale la pena establecerlo antes de una fecha límite en lugar de durante una.
Azure y AWS Bedrock, una línea cada uno
• Microsoft Azure — GPT-6 Astra se puede implementar en Microsoft Foundry bajo el mismo id gpt-6-astra, y la cobertura de Foundry sitúa la disponibilidad general a principios de septiembre de 2026 e informa de implementaciones en Global Standard y US Data Zone, sin EU Data Zone en el lanzamiento, y tarifas iguales o cercanas a las de la lista de OpenAI con una fila de contexto largo. Leemos eso de la cobertura de Foundry y no de la propia página de catálogo de Microsoft, a la que no pudimos acceder hoy — verifica la lista actual de implementaciones, el conjunto de regiones y la tarifa en la documentación propia de Microsoft antes de planificar una implementación en él.
• AWS Bedrock — aparece como openai.gpt-6-astra, disponible a través de las API de Bedrock compatibles y confirmado en el resumen semanal de AWS con fecha del 15 de septiembre de 2026, con el propio perímetro de gobernanza de Bedrock (aislamiento del endpoint de VPC, cifrado de KMS, Guardrails) y la declaración de AWS de que los datos de inferencia no se utilizan para el entrenamiento del modelo. La inferencia en la región y la inferencia geográfica entre regiones reportadas en Bedrock se facturan un 10 % por encima de las tarifas base; esa cifra es de segunda mano según nuestra lectura, así que consulta la propia página de precios de AWS.
Ninguna de las dos rutas cambia el modelo. Ambas cambian el proceso de compras, lo cual, para un lector empresarial, es justamente lo esencial: un despliegue de Foundry o Bedrock puede encajar dentro de un compromiso de nube existente, heredar su IAM, su registro y su perímetro de red, y llegar a una factura que finanzas ya ha aprobado — con frecuencia, la diferencia entre un piloto y algo que realmente sale a producción. La contrapartida es que asumes el ciclo de vida del modelo de la nube y la tarifa de la nube, y se informa que ambas nubes están al nivel o por encima de la lista de precios de OpenAI, no por debajo.
Dónde encaja un router, incluidas las partes que argumentan en su contra
GPT-6 Astra está en el catálogo de OrcaRouter como openai/gpt-6-astra, y OrcaRouter traslada el precio de lista del proveedor con un margen del 0 % — el precio del proveedor es nuestro precio, y un movimiento de precio del proveedor llega a tu factura el mismo día, no en la renovación. En un modelo a este precio, eso no es una afirmación de error de redondeo: la aritmética anterior es la misma aritmética que pagarías directamente.

El argumento honesto a favor del enrutamiento aquí no es el precio, sino la reversibilidad. Astra cuesta aproximadamente 2,5 veces más que el modelo inferior, y su costo fluctúa según un umbral que tu arquitectura controla, así que la mayoría de los equipos quiere probarlo con una porción de tráfico real antes de comprometerse con una ruta de producción. Con una sola clave puedes ponerlo detrás del mismo endpoint que los modelos que ya ejecutas, enviarle parte del tráfico y conmutar automáticamente a algo más barato cuando no compense la diferencia: un cambio de configuración en lugar de una migración, con una API que cubre más de 200 modelos, un DSL de enrutamiento que compone varios modelos en una sola llamada y fusión de modelos cuando quieres que un panel responda en conjunto.
Las partes que argumentan en contra, dichas sin rodeos. Un enrutador es un salto más en la ruta de la solicitud y una parte más en el flujo de datos, y en este modelo eso no es hipotético, porque ZDR se aprueba por organización en OpenAI y una solicitud enrutada no queda cubierta automáticamente por tu aprobación de ZDR. Si envías datos regulados, confirma los términos de datos de la ruta antes de enviarlos, y prepárate para llamar directamente al proveedor para esa carga de trabajo. El enrutamiento también añade un componente que puede fallar o añadir latencia, y hace que cambiar de modelo sea tan fácil que es posible cambiar quién responde a tus usuarios sin revisarlo. Nada de eso supera, para la mayoría de los equipos, el argumento a favor de probar y poder revertir; todo ello vale la pena saberlo antes de decidir que el enrutador es gratis. Enfrentamos las plataformas de enrutamiento entre sí en un artículo aparte en lugar de repetir aquí la comparación.
Tres preguntas cuyas respuestas no son de una sola cláusula
¿Puedo hacer fine-tuning de GPT-6 Astra o usarlo con la API de Assistants? No, en ninguno de los dos casos, y esto es una limitación de diseño, no una configuración que hayas pasado por alto. La página del modelo de OpeAI incluye Chat Completions, Responses y Batch como los endpoints compatibles, y señala explícitamente Fine-tuning y Assistants como no compatibles; además, no hay ninguna fila de GPT-6 Astra en la tabla de precios de fine-tuning de OpeAI. Si tu arquitectura depende de un modelo insignia con ajuste fino, hay que usar prompts con Astra en su lugar, lo que traslada el costo del entrenamiento a los tokens de entrada, y a $10.00 por millón con un prompt de sistema extenso, eso es una partida presupuestaria real y no una nota al pie.
¿Rechazará el modelo el trabajo de seguridad que tengo autorización para realizar? A veces, sí, y merece la pena saberlo antes de empezar a construir. GPT-6 Astra es el primer modelo de OpenAI que alcanza el umbral de capacidad de ciberseguridad Crítico según el Marco de Preparación de la empresa y, tal como se distribuye, rechaza tareas cibernéticas avanzadas como escribir exploits de prueba de concepto. OpenAI afirma que planea ampliar el acceso con salvaguardas menos restrictivas mediante su programa Daybreak. Para un defensor, esto se manifiesta como un rechazo que no es un límite de velocidad ni un error: tenlo previsto en tu gestión de errores en lugar de reintentar contra él.
¿Necesito una aprobación especial para llamar a este modelo? No para el endpoint estándar: no hay lista de espera ni paso de aprobación para llamar a gpt-6-astra, solo una cuenta con facturación. Para lo que sí podrías necesitar aprobación es para todo lo que lo rodea: Zero Data Retention, que está sujeto a solicitud; la residencia de datos fuera de Estados Unidos, que requiere su propia enmienda; y un aumento de nivel, si tienes la intención de enviar volúmenes de tokens a escala de agentes a través de una cuenta Tier 1. El modelo es la parte fácil de la adquisición.
Qué observar y quién debería moverse ahora
Si vas a construir sobre este modelo, las cuatro cosas que vale la pena vigilar están todas del lado del proveedor y todas llevan fecha. Si OpenAI publica una instantánea con fecha para gpt-6-astra —lo que convertiría el id escueto en un blanco móvil y haría que fijarlo tuviera sentido. Si el umbral de 272.000 tokens se mueve, porque esa sola línea vale más para tu factura que cualquier benchmark de la página. Si las tarifas de Bedrock y Foundry convergen con las de lista de OpenAI o se mantienen por encima, ya que eso decide la vía de compra tanto como el propio modelo. Y si el programa Daybreak cambia lo que el endpoint rechazará, lo que para los equipos de seguridad es la diferencia entre una herramienta utilizable y una demo.
En cuanto a quién debería actuar, la división es clara. Si ya estás pagando por GPT-5.6 Sol a tarifas promocionales para trabajo de agentes de horizonte largo, el 2.5x es real y la pregunta es concreta: ¿la tasa de finalización de tareas en tu propia carga de trabajo supera la diferencia de precio? Pruébalo con una porción de tráfico real y averígualo: el ejemplo práctico anterior te dice cuánto cuesta la porción antes de empezar. Si tu trabajo es chat de contexto corto o clasificación de alto volumen, este no es tu modelo; el reajuste de precios para contexto largo y la tarifa de salida de $50.00 lo convierten en una forma costosa de hacer algo que GPT-5.6 Luna hace por una fracción del precio. Y si eres una empresa con un requisito de cumplimiento, empieza primero la conversación sobre ZDR, porque condiciona el descuento de Batch, el recargo por residencia y tu elección de ruta, y nada de eso es una decisión que puedas tomar el día que lo necesites.
Comparados en este artículo2
Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario
