
GPT-6 Astra API: 모델 ID, 엔드포인트, 그리고 장기 지평 과제의 실제 비용
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당
- deepseekNEWDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- openaiNEWOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- googleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- anthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236지능69코딩
- grokSpaceXAI: Grok 4.62026-08-1244지능77코딩
- metaMeta: Muse Spark 1.22026-08-0540지능72코딩
- qwenQwen: Qwen3.8 Max2026-08-0345지능76코딩
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135지능69코딩
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100만 토큰당
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451지능78코딩
The short version: GPT-6 Astra is callable today at https://api.openai.com/v1 under a single model id, gpt-6-astra, at $10.00 per million input tokens, $1.00 cached input and $50.00 output — the figures OpenAI's own pricing page carried on September 16, 2026. The model itself is from September 3, 2026, thirteen days before this page was written, so nothing here is launch coverage and nothing here is framed as an announcement. This is the reference page for the developer question that comes after availability: what string to pass, which endpoint takes it, what the 1,050,000-token window really buys, what the account has to look like first, and what one genuine long-horizon agent run costs on a rate card that quietly reprices itself above 272,000 input tokens. GPT-5.6 Sol appears throughout only as the price baseline it is sold above, never as the subject.
13일 된 모델이 이번 주에 한 페이지를 차지할 만한 이유는, 출시 이후 그 모델로 들어가는 경로들이 바뀌었고, 이제 API 경로가 일반적인 경로가 되었기 때문이다. OpenAI가 9월 3일 Astra를 출시했을 때 그것은 가용성이 아니라 순차 배포를 설명했다. 9월 8일까지는 해당 모델이 Codex와 ChatGPT Work에서 Plus, Pro, Business 및 Enterprise 사용자에게 완전히 배포되었다고 말하고 있었고, 9월 14일이 있는 주에는 AWS가 이를 Bedrock에 올리고 있었으며 Microsoft Foundry는 이를 일반 제공 상태로 취급하고 있었다. API 호출자에게 그 순서는 들리는 것보다 덜 중요하다 — 엔드포인트는 그동안 계속 라이브 상태였고 문서화되어 있었다 — 하지만 그것은 이제 그 주변의 조달 질문들에 출시 당일에는 없던 답이 생겼다는 뜻이다. 아래의 모든 내용은 2026년 9월 16일에 OpenAI 자체의 모델 문서, 가격 페이지 및 데이터 제어 페이지에서 읽은 것이며, 다른 출처에서 온 내용은 이를 담고 있는 문장에서 그 사실을 밝힌다.
모델 ID와 스냅샷 질문에 솔직하게 답변
전달할 문자열은 gpt-6-astra — 소문자이며 하이픈으로 연결되어 있고, 공급업체 접두사가 없습니다. 이것이 OpenAI가 이 모델에 대해 문서화한 유일한 ID입니다.
고정할 날짜가 지정된 스냅샷을 찾고 있다면, 찾을 수 있는 것이 없으며, 그럴듯해 보이는 접미사를 만들어 붙일 생각도 없습니다. OpenAI의 GPT-6 Astra 모델 페이지에는 Snapshots 아래에 정확히 하나의 항목만 나열되어 있는데, 그것은 순수한 gpt-6-astra입니다. 다음은 없습니다: -2026-09-03 스타일의 날짜 형식도 없고, -latest 별칭도 벤더 측에는 없습니다. 연구 중에 라우터 목록에서 ~openai/gpt-astra-latest 형태의 움직이는 별칭을 보았는데, 그것은 벤더 ID 위에 구축된 게이트웨이 구성이며, OpenAI가 게시하는 것이 아니므로, 마치 그런 것처럼 여러분의 설정에 넣어서는 안 됩니다.
실질적인 결과는 작지만 짚고 넘어갈 만합니다. 무엇과 대화하고 있는지 확인하려면 모델 객체를 조회하면 됩니다:
curl https://api.openai.com/v1/models/gpt-6-astra -H "Authorization: Bearer $OPENAI_API_KEY"
베어 id는 열두 군데 호출 지점에 직접 입력하지 말고 구성 값에 고정하세요. 나중에 OpenAI가 날짜가 붙은 스냅샷을 추가하면 베어 id가 움직이는 표적이 되어, 고정해 둔 값이 어느새 바뀌기 시작합니다 — 고칠 곳이 한 군데뿐이라는 건 2분이면 끝나는 변경과 오후 내내 grep을 돌리는 일의 차이입니다.
엔드포인트: 기본 URL, 호환성, 그리고 실행되는 요청
The base URL is https://api.openai.com/v1. Per OpenAI's model documentation, GPT-6 Astra is supported on Responses (/v1/responses), Chat Completions (/v1/chat/completions) and Batch (/v1/batch). It is explicitly not supported on Realtime, Assistants, Fine-tuning, Embeddings, image generation and editing, video, audio, moderation, or the legacy Completions endpoint — and those absences matter as much as the presence list, because a team that planned around the Assistants API or a fine-tuned variant has to replan rather than rewrite.
호환성에 관하여: 이것은 OpenAI 자체의 퍼스트파티 API이며, 모든 OpenAI 호환 SDK와 클라이언트가 기준으로 삼아 작성된 와이어 형식입니다. 그 형식을 구사하는 것은 무엇이든 shim 없이 gpt-6-astra와 통신합니다 — 모델 문자열을 바꾸고, 이전 OpenAI 모델에서 마이그레이션하는 경우에는 아래의 매개변수 이름을 바꾸면 됩니다. 새로운 작업에는 Responses API를 사용하는 것이 좋습니다: 이 API는 OpenAI가 이 모델의 추론 제어를 문서화하는 표면이며, 내장 도구가 있는 곳이고, 최신 모델에 대한 Chat Completions 지원은 역사적으로 둘 중 더 얕은 쪽이었습니다.
최소한의 스트리밍 호출, reasoning effort를 설정한 상태:
curl https://api.openai.com/v1/responses \
-H "Authorization: Bearer $OPENAI_API_KEY" \
-H "Content-Type: application/json" \
-d '{"model": "gpt-6-astra", "input": "이 서비스를 레거시 인증 API에서 벗어나도록 이전하기 위해 변경해야 할 파일을 나열하세요.", "reasoning": {"effort": "high"}, "max_output_tokens": 16000, "stream": true}'
그리고 같은 것을 Python에서도, 대부분의 독자가 실제로 생활하는 곳에서:
from openai import OpenAI
client = OpenAI()
stream = client.responses.create(model="gpt-6-astra", input="이 서비스를 레거시 인증 API에서 벗어나도록 옮기기 위해 변경해야 할 파일들을 나열해 주세요.", reasoning={"effort": "high"}, max_output_tokens=16000, stream=True)
for event in stream:
if event.type == "response.output_text.delta": print(event.delta, end="")
그 요청에 관한 세 가지 점은 일반적인 퀵스타트에서 그대로 가져온 것이 아니라 이 모델에만 해당하는 것입니다.
• 추론 강도는 품질 조절 다이얼만이 아니라 비용 조절 다이얼입니다. OpenAI의 모델 페이지에는 지원되는 값이 low, medium, high, xhigh, max로 나열되어 있습니다. 그 목록이 어디서 시작하는지 주목하세요. GPT-6 Astra에는 none이나 minimal이 없으므로 하한선이 올라갔습니다. 추론 토큰은 백만 개당 $50.00의 출력 토큰으로 청구되므로, 강도를 high에서 max로 바꾸는 것은 무료 품질 업그레이드가 아니라 가격이 따르는 결정입니다.
• 스트리밍이 지원되며, 긴 턴을 실행하는 정직한 방법입니다. 이 모델에서 단일 요청은 최대 128,000개의 출력 토큰을 생성할 수 있습니다. 그것이 하나의 응답 본문에 도착하기를 기다리면서, 진행 중인지 전혀 알 수 없다면, 결국 타임아웃을 추측하게 됩니다.
• 여기에서는 프롬프트 캐싱이 명시적입니다. Responses API는 텍스트, 이미지, 파일 콘텐츠에 대한 prompt_cache_breakpoint를 문서화하며, 모드는 explicit이고, "재사용 가능한 프롬프트 접두사의 정확한 끝"을 표시하고 TTL은 요청의 prompt_cache_options.ttl에서 상속받습니다. 캐시된 입력 요율이 캐시되지 않은 요율의 10분의 1인 모델에서는 그 경계를 어디에 두느냐가 요청에서 가장 영향력이 큰 부분입니다.

1,050,000 토큰 윈도우가 실제로 의미하는 것
문서에 기재된 수치는 1,050,000토큰 컨텍스트 창, 922,000토큰 최대 입력, 128,000토큰 최대 출력, 그리고 2026년 4월 30일의 지식 컷오프입니다.
사람들이 놓치는 산술부터 시작하겠습니다: 922,000 더하기 128,000은 1,050,000입니다. 이 창은 여러분이 보내는 내용과 모델이 반환할 수 있는 내용 사이에서 공유되며, 출력 상한은 그 창에서 예약됩니다. 여러분은 1,050,000 토큰의 입력을 보낼 수 없습니다. 단일 요청의 실질적 상한은 922,000이며, 실제 답변을 위한 여유를 원한다면 그보다 더 적습니다.
백만 토큰은 당신이 실제로 일하는 단위로 무엇을 살 수 있을까? 토큰-텍스트 변환은 근사치이고, 이 수치는 OpenAI의 것이 아니라 우리 것이지만, 올바른 자릿수다: 토큰당 대략 네 글자라면 1,050,000 토큰은 750,000단어 규모, 또는 10만 줄 안팎의 코드에 해당한다. 그것은 중간 규모 저장소를 통째로 담고도, 에이전트가 작업하면서 생성하는 도구 출력을 위한 여유가 남는 분량이다. 이 모델이 내세우는 장기 지평 사례가 바로 이것이다: 한 시간 전에 파일을 읽은 에이전트가 그 파일이 뭐라고 했는지 여전히 볼 수 있는 것, 아침을 한 문단의 요약으로 압축해 버린 에이전트가 아니라.
그다음은 스펙 페이지보다 비용 페이지에 어울리는 부분이다. OpenAI의 모델 문서에 따르면, 272,000개의 입력 토큰을 초과하는 프롬프트는 다음 요율로 가격이 책정된다: 전체 요청 기준 입력 및 캐시 요율 2배, 출력 1.5배. 가격 페이지에는 이를 두 번째 행으로 싣고 있다: GPT-6 Astra의 롱 컨텍스트는 입력 $20.00, 캐시 입력 $2.00, 출력 $75.00이다. 따라서 그 윈도우의 상위 4분의 3은 단순한 여유분이 아니라 하나의 가격 구간이다. 트랜스크립트가 272,000 토큰을 넘는 실행은 전체 요청에 대해 모든 입력 토큰—캐시된 토큰까지 포함해—에 두 배를 지불하며, 이것이 이 모델의 경제성에서 단일 최대 변동 요인이다. 아래에서 이를 전부 다룬다.
한 가지 더 알아둘 만한 메커니즘이 있습니다. 이는 하나의 창이 전부가 아니라는 벤더 스스로의 인정이기 때문입니다. Codex의 경우, OpenAI는 Astra와 함께 제공되는 실험적 컨텍스트 접근 방식을 설명합니다. 여기서는 노트가 반복적으로 단일 요약으로 압축되는 대신 컨텍스트 창 전반에 걸쳐 지속되며, 이전 창은 검색 가능한 상태로 남아 있어 이전 메시지와 도구 출력의 요구사항 및 테스트 결과를 계속 찾을 수 있습니다. OpenAI는 이를 실험적이라고 부르고, Codex config.toml에서 활성화되어 있다고 말하며, Astra의 기본값이 될 것이라고 말합니다. API에서 동등한 것을 직접 구축하고 있다면, 그것이 복사해야 할 형태입니다. 하나의 영웅적인 프롬프트보다는 지속적인 노트와 검색 가능한 이력입니다.
그리고 숫자 자체의 한계: 큰 창은 용량이지, 그 전체에 걸친 주의를 보장하는 것은 아니다. 공급업체가 보고한 장기 지평 수치는 토큰 수보다 행동을 더 잘 안내한다 — OpenAI는 OSWorld 2.0을 작업당 약 40분에 72.6%로, Terminal-Bench 4.0을 GPT-5.6 Sol의 37.3%에 대비해 57.9%로 보고한다. 이는 OpenAI 자체 수치이며 우리가 재현하지 않은 것이고, 독립적인 그림은 비슷하지만 동일하지는 않다: Artificial Analysis는 Astra를 Terminal-Bench v4.0에서 59.1%로 측정했으며, 이는 Claude Fable 5.1의 52.0%와 GPT-5.6 Sol의 39.9%에 대비된다. 둘 다 이전 세대에 비해 장기 지평 격차가 실제라는 데 동의하지만, 어느 것도 자신의 작업을 실행하는 것을 대체하지는 않는다.
입력 모달리티, 그리고 파일 문제는 솔직히 열어 둔 상태
OpenAI의 모델 페이지에는 입력 모달리티가 텍스트와 이미지로 나열되어 있으며, 텍스트 출력이 있습니다. 이 모델에서는 오디오, 비디오, 이미지 생성 기능이 없습니다.
이미지 입력은 사용자 메시지 내부의 콘텐츠 파트로 들어갑니다. 파트 유형은 input_image이며, 이미지는 완전한 URL 또는 image_url에 대한 base64 데이터 URL로 제공되거나 Files API의 file_id로 제공됩니다. detail은 선택 사항으로 auto, low, high 또는 original이며, 기본값은 auto입니다. 형태는 다음과 같습니다:
{"model": "gpt-6-astra", "input": [{"role": "user", "content": [{"type": "input_text", "text": "이 스크린샷에서 무엇이 변경되었나요?"}, {"type": "input_image", "image_url": "data:image/png;base64,...", "detail": "high"}]}]}
OpenAI의 비전 문서에서는 PNG, JPEG, WEBP 및 애니메이션이 아닌 GIF를 허용되는 형식으로 나열하며, 요청당 총 페이로드는 최대 512MB, 요청당 이미지는 최대 1,500장입니다. 또한 30,000개 패치를 초과하는 이미지는 크기를 줄이는 대신 거부됩니다. 이는 Astra에 특화된 제한이 아니라 플랫폼의 일반적인 비전 제한이며, 이미지는 다른 입력과 마찬가지로 토큰으로 과금됩니다.
이제 독자들이 실제로 궁금해하는 질문과, 솔직한 답변입니다. 파일이나 PDF를 보낼 수 있나요? 저희는 OpenAI 문서에서 이 모델의 문서 입력을 확인할 수 없었고, 작동한다고 암시하지도 않겠습니다. Responses API는 실제로 input_file 콘텐츠 파트를 정의하고 있으므로, API 전반적으로는 그 기반이 마련되어 있습니다. 하지만 GPT-6 Astra에 관한 OpenAI 페이지는 입력 모달리티로 텍스트와 이미지만 나열할 뿐 파일은 나열하지 않으며, 이 엔드포인트의 PDF 입력을 문서화한 OpenAI의 진술도 찾지 못했습니다. 동일한 모델에 대한 라우터 목록에는 텍스트, 이미지와 함께 파일도 표시되어 있습니다. 이는 라우터가 보고한 정보로, 벤더가 보증하는 내용이 아니라 라우터가 경로에 관해 기록한 것일 뿐입니다. 문서 수집이 워크로드에 결정적인 요소라면, 그 위에 구축하기 전에 실제 엔드포인트로 테스트하고 OCR-텍스트 폴백을 준비해 두세요. 그것이 오후 한나절의 테스트와 재작성을 가르는 차이입니다.
전체 가격 라인, 그리고 장기적 실행 한 건의 가격 산정
이 섹션의 모든 수치는 2026년 9월 16일에 OpenAI 자체 가격 페이지에서 확인한 것이며, 해당 줄에 별도의 언급이 없는 한 모두 Standard 티어 기준 백만 토큰당 가격입니다.
• 짧은 컨텍스트, 최대 272K 입력 — 입력 $10.00, 캐시된 입력 $1.00, 캐시 쓰기 $12.50, 출력 $50.00.
• 롱 컨텍스트, 272K 초과 입력 — 입력 $20.00, 캐시된 입력 $2.00, 캐시 쓰기 $25.00, 출력 $75.00, 전체 요청에 적용됩니다.
• Batch 및 Flex — Standard의 절반: 숏 컨텍스트 $5.00 / $0.50 / $6.25 / $25.00, 롱 컨텍스트 $10.00 / $1.00 / $12.50 / $37.50.
• Fast 모드 — Standard의 두 배: 단문 컨텍스트 $20.00 / $2.00 / $25.00 / $100.00, 장문 컨텍스트 $40.00 / $4.00 / $50.00 / $150.00. OpenAI는 Fast 모드가 EU 데이터 레지던시를 사용하는 GPT-6 Astra에서는 사용할 수 없다고 밝혔습니다.
• 데이터 레지던시 — 이를 사용하는 엔드포인트에는 2026년 3월 5일 이후 출시된 모델에 대해 10% 할증이 적용됩니다. GPT-6 Astra가 해당되므로, 레지던시 배포는 위의 모든 수치보다 10% 높습니다.
내면화해야 할 핵심은 캐시된 입력 요율입니다. $10.00 대비 $1.00은 다시 보내는 프롬프트 부분에 대한 90% 할인이며, 에이전트 워크로드에서는 그 부분이 프롬프트의 거의 전부입니다. 캐시 쓰기에는 $12.50, 즉 캐시되지 않은 입력 요율의 1.25배가 청구되므로 손익분기점은 간단합니다. 100,000개 토큰을 캐시하지 않고 두 번 보내면 $2.00이지만, 해당 프리픽스를 한 번 쓰고 다시 한 번 읽으면 $1.35입니다. 캐싱은 두 번째 재사용부터 이득이며, 동일한 대화 기록을 100턴 동안 다루는 에이전트는 이를 100번 재사용합니다.
그렇다면 이 모델이 실제로 감당할 만한지 결정하는 계산으로 넘어가겠습니다. 대표 요금은 청구서에 찍히는 숫자가 아니니까요. 다음은 이 모델이 판매되는 전형적인 작업, 즉 자율 코딩 에이전트가 몇 시간에 걸쳐 저장소 규모의 마이그레이션을 수행하는 상황을 모델링한 실행 예시입니다. OpenAI가 공개한 요금을 바탕으로 저희가 구성한 것이며, 실제로 측정된 청구서는 아닙니다. 모델 호출 120회, 누적되면서 호출당 평균 약 500,000 입력 토큰에 달하는 작업 트랜스크립트, 그 입력의 80%는 캐시에서 처리, 그리고 추론을 포함해 전체 실행에서 400,000 출력 토큰입니다.
기준짧은 컨텍스트 스탠다드 요금:
• 캐시되지 않은 입력 — 12M 토큰 × $10.00 = $120.00
• 캐시된 입력 — 48M 토큰 × $1.00 = $48.00
• 출력 — 0.4M 토큰 × $50.00 = $20.00
• 이번 실행 총액 ≈ $188.00
동일한 실행을 롱 컨텍스트 대역에서 수행한 경우, 즉 호출당 272,000토큰을 초과하는 트랜스크립트가 실제로 받게 되는 조건은 다음과 같다:
• 캐시되지 않은 입력 — 12M 토큰 × $20.00 = $240.00
• 캐시된 입력 — 48M 토큰 × $2.00 = $96.00
• 출력 — 0.4M 토큰 × $75.00 = $30.00
• 이번 실행 총액 ≈ $366.00
그로부터 두 가지 결론이 나오는데, 둘 다 대표 요금만으로는 보이지 않습니다. 첫째, 트랜스크립트가 어디에 위치하는지는 어떤 모델을 선택하는지만큼 중요합니다 — 동일한 작업이 272K 임계값을 넘는지에 따라 대략 두 배가 되며, 이는 컨텍스트 규율(600K를 보유하는 대신 올바른 100K를 검색하는 것)이 이 모델에서 단지 성능 기법이 아니라 비용 통제 기법이 되게 합니다. 둘째, 캐싱은 할인율이 시사하는 것보다 더 가치가 있습니다: 캐시 적중이 전혀 없으면 첫 번째 시나리오는 $168.00 대신 $600.00의 입력을 부담하며, 실행 비용은 $188이 아니라 약 $620입니다. 추론 노력을 높이기 전에 캐싱을 켜십시오.
기준선의 경우, GPT-5.6 Sol에서 동일한 토큰 구성으로 OpenAI 가격 페이지가 9월 16일에 제시한 요율 — 짧은 컨텍스트 기준 입력 $4.00, 캐시 입력 $0.40, 출력 $20.00 — 을 적용하면 대략 $75.20이며, Sol의 장문 컨텍스트 요율($8.00 / $0.80 / $30.00)에서는 대략 $146.40이 됩니다. 그러면 이번 실행은 두 구간 모두에서 약 2.5배가 됩니다. 그 배수에 관해서는 두 가지 주의 사항이 있습니다. 이미 다른 곳에서 혼란을 일으켰기 때문입니다. Sol의 숫자는 프로모션 요율입니다 — OpenAI는 프로모션이 최소 2026년 11월 21일까지 제공된다고 말합니다 — 반면 Astra의 것은 정가이므로, 이 배수는 모델에 대한 안정적인 사실이라기보다 오늘의 두 요율표를 측정한 것이며, 프로모션이 끝나면 좁아집니다. 그리고 Astra에 대해 떠도는 예전 "2.5배"는 때때로 Sol의 프로모션 전 정가인 $5.00/$30.00을 기준으로 계산되는데, 이는 입력에서 2배, 출력에서 약 1.67배가 됩니다. 어떤 Sol 요율을 말하는지 명시하세요. 그렇지 않으면 그 숫자는 무가치합니다.
한 줄 더: Batch tier는 이 모든 것을 절반으로 줄여 첫 실행 비용을 약 $94로 낮춥니다. 이를 사용할 수 있는지는 다음 섹션에 달려 있습니다.

제로 데이터 보존, 그리고 스스로를 무효화하는 할인
OpenAI는 Zero Data Retention이 지원되는 엔드포인트에서 자격을 갖춘 API 고객에게 제공되며, 승인을 조건으로 한다고 밝히고 있습니다 — 그리고 그 문장의 두 부분 모두 실제로 중요한 역할을 합니다. 이는 셀프서비스 토글이 아닙니다: 자격 여부는 OpenAI의 사전 승인과 추가 요건 수용을 조건으로 하며, 시작하려면 영업 담당자와 상담해야 합니다. 승인되면 설정 → 조직 → 데이터 제어의 데이터 보존 탭에서 조직 또는 프로젝트 수준으로 구성되며, 여기서 프로젝트는 조직 기본값을 상속하거나, ZDR을 명시적으로 설정하거나, Modified Abuse Monitoring을 선택하거나, 둘 다 비활성화할 수 있습니다.
실제로 달라지는 점: ZDR은 고객 콘텐츠를 남용 모니터링 로그에서 제외하여 최대 30일의 기본 보존을 대체하며, /v1/responses 및 /v1/chat/completions의 store 매개변수는 요청에서 true로 설정하려고 해도 false로 처리됩니다.
비용에 관한 페이지에서 가장 중요한 세부 사항: /v1/batches는 ZDR 자격이 있는 엔드포인트 목록에 없습니다. OpenAI의 데이터 제어 페이지에는 부적격으로 나와 있으며, 애플리케이션 상태는 삭제될 때까지 보존됩니다. 따라서 GPT-6 Astra에서 Batch 티어의 50% 할인과 Zero Data Retention은 상호 배타적입니다. ZDR이 필요한 컴플라이언스 제약 워크로드는 배치 요율이 아니라 Standard 요율을 예산에 반영해야 하며, 위의 $94 수치는 해당 워크로드에 이용할 수 없습니다.
세 가지 추가 주의사항을 분명히 밝힙니다. ZDR을 과대포장하는 페이지는 이를 아예 빠뜨린 페이지보다 더 나쁘기 때문입니다. ZDR은 절대적이지 않습니다. "Eyes Off" 아래에서 OpenAI는 사전 서면 통지와 함께 특정 고객에 대해 모델을 ZDR 대상에서 제외할 권리를 보유하며, "Safety Retention" 아래에서는 분류기가 중대한 위험을 표시하는 경우 콘텐츠가 보존되고 사람이 검토할 수 있습니다. 잠재적 CSAM으로 표시된 이미지 및 파일 입력은 ZDR 하에서도 수동 검토를 위해 보존됩니다. 그리고 ZDR은 OpenAI의 경계에서 멈춥니다. 에이전트가 원격 MCP 서버나 다른 공급업체의 API를 호출하면, 그 트래픽은 이 정책이 아니라 해당 당사자의 보존 정책의 적용을 받습니다. 별도로, 데이터 레지던시는 ZDR과는 다른 통제이며, 미국 외 지역에서는 자체 승인과 Modified Retention 개정 조항을 필요로 하며, 위에서 언급한 10% 할증이 적용됩니다. ZDR 하에서 캐싱에 의존하고 있다면, 캐싱이 무엇을 보존하는지 OpenAI의 데이터 제어 페이지에서 읽어 보십시오. 우리가 그곳에서 직접 읽을 수 없었던 보존 수치를 여기에 인쇄하지는 않겠습니다.
문서에 기재된 속도 제한, 그리고 가장 먼저 걸리는 것
OpenAI의 모델 페이지는 GPT-6 Astra에 대해 다음과 같은 등급별 한도를 공개합니다 — 분당 요청 및 토큰, 그다음 배치 대기열 한도:
• Tier 1 — 500 RPM, 500,000 TPM, 배치 큐 1,500,000
• 티어 2 — 5,000 RPM, 1,000,000 TPM, 배치 큐 3,000,000
• 티어 3 — 5,000 RPM, 2,000,000 TPM, 배치 큐 100,000,000
• 티어 4 — 10,000 RPM, 4,000,000 TPM, 배치 큐 200,000,000
• 티어 5 — 15,000 RPM, 40,000,000 TPM, 배치 큐 15,000,000,000
우리는 두 가지 한도를 문서화되지 않은 것으로 이름 붙일 것입니다. 채워 넣는 대신: 공개된 무료 티어 한도는 없습니다. 왜냐하면 GPT-6 Astra는 무료 티어에 전혀 속하지 않기 때문입니다; 그리고 Tier 5 위에 공개된 상한도, Fast mode에 대한 별도 한도 표도 찾지 못했습니다. 공급업체가 한도를 공개하지 않았다면, 그 부재를 미해결로 취급하십시오 — 무제한이라고 가정하지 마십시오.
에이전트 워크로드를 가장 먼저 물어뜯는 수치는 Tier 1의 500,000 TPM이다. 이 모델에 대한 단일 호출은 500,000토큰짜리 트랜스크립트를 실을 수 있으므로, 요청 한 건이 엔트리 티어에서 토큰 예산 1분 전체를 소진할 수 있다는 뜻이다. 해당 티어가 토큰을 밀어낼 수 없다면, 120턴에 걸쳐 같은 트랜스크립트를 차지하고 앉아 있는 에이전트에게 백만 토큰 컨텍스트 윈도우는 별로 쓸모가 없다. 티어는 요청 수가 아니라 위의 예시에서 나온 토큰 볼륨을 기준으로 산정하라. 그리고 티어 승급은 지출과 계정 이력에 달려 있으므로, 마감 중에가 아니라 마감 전에 확보해 두는 것이 좋다.
Azure와 AWS Bedrock, 각각 한 줄씩
• Microsoft Azure — GPT-6 Astra는 동일한 gpt-6-astra id로 Microsoft Foundry에서 배포할 수 있으며, Foundry 관련 보도에서는 정식 출시 시점을 2026년 9월 초로 잡고 Global Standard 및 US Data Zone 배포를 언급하고 있으며, 출시 시점에는 EU Data Zone이 없고, 요금은 장문 컨텍스트 행이 포함된 OpenAI 정가와 같거나 그에 근접합니다. 이는 Microsoft 자체 카탈로그 페이지가 아니라 Foundry 관련 보도에서 확인한 내용이며, 해당 카탈로그 페이지에는 오늘 접속할 수 없었습니다 — 이에 배포를 계획하기 전에 Microsoft 자체 문서에서 현재 배포 목록, 리전 세트, 요금을 확인하십시오.
• AWS Bedrock — openai.gpt-6-astra로 등록되어 있으며, 지원되는 Bedrock API를 통해 사용할 수 있고, 2026년 9월 15일자 AWS 주간 요약에서 확인되었습니다. Bedrock 자체의 거버넌스 경계(VPC 엔드포인트 격리, KMS 암호화, Guardrails)와 추론 데이터가 모델 학습에 사용되지 않는다는 AWS의 성명이 포함되어 있습니다. Bedrock에서 보고된 리전 내 및 지리적 교차 리전 추론은 기본 요금보다 10% 높게 청구됩니다. 이 수치는 저희가 확인한 바로는 2차 출처이므로 AWS 자체 가격 페이지를 확인하세요.
두 경로 모두 모델을 바꾸지는 않습니다. 둘 다 조달 방식을 바꾸는데, 엔터프라이즈 독자에게 바로 그 점이 핵심입니다. Foundry나 Bedrock 배포는 기존 클라우드 약정 안에 자리 잡고, 그 IAM과 로깅, 네트워크 경계를 그대로 물려받으며, 재무팀이 이미 승인한 청구서에 올라갈 수 있습니다. 파일럿과 실제로 출시되는 무언가를 가르는 차이가 흔히 여기서 갈립니다. 대가는 클라우드의 모델 라이프사이클과 클라우드의 요율을 받아들여야 한다는 것이며, 두 클라우드 모두 OpenAI의 정가와 같거나 그보다 높은 수준으로 보고되고 있습니다, 낮은 게 아니라.
라우터가 어디에 적합한지, 그것에 반대하는 부분들까지 포함하여
GPT-6 Astra는 OrcaRouter 카탈로그에 openai/gpt-6-astra로 등록되어 있으며, OrcaRouter는 공급자 정가를 0% 마크업으로 그대로 전달합니다 — 공급업체의 가격이 곧 우리의 가격이고, 공급업체의 가격 변동은 갱신 시점이 아니라 같은 날 청구서에 반영됩니다. 이 가격대의 모델에서 그것은 반올림 오차 수준의 주장이 아닙니다: 위의 계산은 직접 지불할 때와 동일한 계산입니다.

여기서 라우팅을 정당화하는 솔직한 이유는 가격이 아니라 되돌릴 수 있다는 점입니다. Astra는 바로 아래 모델의 약 2.5배이고, 그 비용은 아키텍처가 제어하는 임계값에 따라 크게 출렁이므로, 대부분의 팀은 프로덕션 경로를 확정하기 전에 실제 트래픽의 일부에서 시험해 보길 원합니다. 하나의 키를 통해 이미 운영 중인 모델과 동일한 엔드포인트 뒤에 두고, 트래픽의 일부를 보내며, 그 차액을 벌어들이지 못할 때 더 저렴한 것으로 자동 장애 조치할 수 있습니다 — 마이그레이션이 아니라 구성 변경이며, 하나의 API가 200개 이상의 모델을 포괄하고, 여러 모델을 단일 호출로 구성하는 라우팅 DSL, 그리고 여러 모델이 패널처럼 함께 답하게 하고 싶을 때의 모델 퓨전을 제공합니다.
그에 반대하는 부분들을 아주 분명하게 말하겠습니다. 라우터는 요청 경로에 하나의 홉을 더 추가하고 데이터 흐름에 하나의 당사자를 더 추가합니다. 그리고 이 모델에서는 그것이 가정이 아닙니다. ZDR은 OpenAI에서 조직별로 승인되며, 라우팅된 요청이 자동으로 귀하의 ZDR 승인 범위에 포함되는 것은 아니기 때문입니다. 규제 대상 데이터를 전송한다면 보내기 전에 해당 경로의 데이터 약관을 확인하고, 해당 워크로드에 대해서는 공급업체에 직접 연락할 준비를 하십시오. 라우팅은 또한 실패하거나 지연 시간을 추가할 수 있는 구성 요소를 더하며, 모델 교체를 너무 쉽게 만들어 검토 없이 사용자에게 응답하는 대상을 바꿀 수 있게 합니다. 그 어느 것도 대부분의 팀에게는 시험 및 되돌리기 가능성이라는 논거를 능가하지 않습니다. 다만 라우터가 공짜라고 판단하기 전에 이 모든 것을 알아 둘 가치는 있습니다. 우리는 여기서 그 비교를 다시 늘어놓기보다 별도의 글에서 라우팅 플랫폼들을 서로 맞대어 비교했습니다.
한 절로 답할 수 없는 세 가지 질문
GPT-6 Astra를 파인튜닝할 수 있나요? 아니면 Assistants API와 함께 사용할 수 있나요? 두 가지 모두 안 됩니다. 그리고 이건 놓치신 설정 항목이 아니라 설계상의 경계입니다. OpeAI의 모델 페이지에는 Chat Completions, Responses, Batch가 지원 엔드포인트로 나열되어 있고 Fine-tuning과 Assistants는 지원되지 않는 것으로 명시되어 있으며, OpeAI의 파인튜닝 가격표에는 GPT-6 Astra 행이 없습니다. 아키텍처가 파인튜닝된 플래그십 모델에 의존한다면 Astra는 대신 프롬프트로 처리해야 하는데, 이는 비용을 학습에서 입력 토큰 쪽으로 옮기는 셈이며, 대규모 시스템 프롬프트에서 백만 토큰당 $10.00이라면 이는 각주가 아니라 실질적인 예산 항목입니다.
모델이 제가 권한을 받은 보안 작업을 거부할까요? 때로는 그렇습니다. 그리고 구축하기 전에 알아둘 가치가 있습니다. GPT-6 Astra는 회사의 Preparedness Framework에 따라 Critical 사이버보안 역량 임계치에 도달한 최초의 OpenAI 모델이며, 출시된 상태로는 개념 증명 익스플로잇 작성과 같은 고급 사이버 작업을 거부합니다. OpenAI는 Daybreak 프로그램을 통해 덜 제한적인 안전장치로 접근을 확대할 계획이라고 말합니다. 방어자 입장에서는 이것이 속도 제한도 아니고 버그도 아닌 거부로 나타납니다 — 재시도로 돌파하려 하기보다 오류 처리에서 이에 대한 예산을 잡으세요.
이 모델을 호출하려면 특별한 승인이 필요한가요? 표준 엔드포인트라면 아닙니다 — gpt-6-astra를 호출하는 데 대기 명단도, 승인 절차도 없습니다. 청구가 설정된 계정만 있으면 됩니다. 승인이 필요할 수 있는 것은 그 주변의 모든 요소입니다: 별도 신청 절차가 필요한 Zero Data Retention, 자체적인 계약 개정이 필요한 미국 외 데이터 레지던시, 그리고 Tier 1 계정을 통해 에이전트 규모의 토큰 볼륨을 처리하려는 경우의 티어 상향입니다. 모델은 이 조달에서 쉬운 부분입니다.
주목할 것, 그리고 지금 누가 움직여야 하는가
이 모델을 기반으로 구축하고 있다면, 주시할 가치가 있는 네 가지는 모두 공급업체 측 사안이며 모두 날짜가 명시된 사안입니다. OpenAI가 gpt-6-astra에 대해 날짜가 명시된 스냅샷을 공개하는지 여부 — 그러면 순수 ID가 움직이는 표적이 되어 고정(pinning)이 의미를 갖게 됩니다. 272,000토큰 임계값이 이동하는지 여부 — 그 한 줄이 페이지의 어떤 벤치마크보다 청구서에 더 큰 영향을 주기 때문입니다. Bedrock과 Foundry 요금이 OpenAI의 정가로 수렴하는지, 아니면 그 이상에 머무는지 여부 — 이는 모델 못지않게 조달 경로를 결정하기 때문입니다. 그리고 Daybreak 프로그램이 엔드포인트가 거부할 대상을 바꾸는지 여부 — 보안 팀에게 이는 사용 가능한 도구와 데모 사이의 차이입니다.
누가 행동에 나서야 하는지에 관해서는 구분이 명확하다. 장기 지평(long-horizon) 에이전트 작업을 위해 이미 프로모션 요금으로 GPT-5.6 Sol에 비용을 지불하고 있다면, 2.5배는 실재하며 질문은 좁다: 자체 워크로드에서의 작업 완료율이 가격 차이를 넘어서는가? 실제 트래픽의 일부에 실행해 보고 확인하라 — 위의 계산 예시는 시작하기 전에 그 일부에 드는 비용이 얼마인지 알려준다. 당신의 작업이 단문맥(short-context) 채팅이나 대량 분류라면, 이것은 당신의 모델이 아니다; 장문맥(long-context) 가격 재조정과 $50.00 출력 요율은 GPT-5.6 Luna가 훨씬 저렴한 가격에 하는 일을 비싸게 하는 방법이 된다. 그리고 규정 준수 요건이 있는 엔터프라이즈라면 ZDR 논의를 먼저 시작하라. 왜냐하면 그것이 Batch 할인, 레지던시 할증, 그리고 경로 선택을 좌우하기 때문이다 — 그리고 그 중 어느 것도 필요로 하는 당일에 결정할 수 있는 사항이 아니다.
이 글에서 비교한 모델2
이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트
