Ultrafast 등급용으로 생성된 타이틀 카드. 헤드라인은 'GPT-6 Astra Ultrafast', 부제는 '모든 라인에서 6배의 속도', 두 개의 배지는 '가격 책정 및 일반 제공'과 '패스트 레인은 두 번째 모델이 아닙니다'.
Guides & Insights

GPT-6 Astra Ultrafast 6배: 공개된 요금표가 실제로 당신에게 청구하는 비용

작성자

Gideon Frost

게시일

최신 모델 · 20모든 모델 보기 →
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

GPT-6 Astra Ultrafast는 2026년 9월 29일부로 더 이상 대기자 명단 서비스가 아니게 되었습니다. 이제 공개된 가격이 있는 구매 가능한 서비스 티어이며, 그 가격은 모든 항목에서 표준의 정확히 6배입니다. 그 기반이 되는 모델 — 2026년 9월 3일에 출시된 회사의 플래그십인 GPT-6 Astra — 은 변경되지 않았습니다. DevDay에서 바뀐 것은 그 위의 패스트 레인이 일반 제공되기 시작했다는 점이며, 회사의 API 문서에는 이제 Ultrafast가 "GPT-6 Astra용으로 폭넓게 제공되며, GPT-5.6 Sol용으로는 프리뷰 액세스가 제공됩니다"라고 분명히 적혀 있습니다. 처음으로 이 티어를 예산 항목에 넣을 수 있게 되었고, 거기에 넣을 숫자는 2026년 9월 30일 회사 자체 가격 페이지에서 확인한 대로 입력 토큰 100만 개당 $60.00, 출력 토큰 100만 개당 $300.00입니다.

그렇기 때문에 이것은 출시 보도가 답했던 질문과는 다른 질문이 된다. 이번 주의 흥미로운 사실은 그 등급이 존재한다는 것이 아니다 — preview는 2026년 8월 13일에 발표되어 지겹도록 다뤄졌다. 흥미로운 사실은 가격이 없던 등급에 이제 가격이 생겼다는 것이고, 그로부터 따라 나오는 계산은 특정하고 수치화 가능한 방식으로 호의적이지 않다. 6배는 어깨를 으쓱하고 넘길 수 있는 프리미엄이 아니다; 그것은 더 적은 턴 안에 되찾아야 하는 프리미엄이며, 그럴 수 있는지 여부는 모델의 속성이 아니라 워크로드의 속성이다.

모든 라인에 걸린 여러 건의 보류, 그리고 그것이 가장 먼저 이해해야 할 점입니다.

2026년 9월 30일에 OpenAI의 가격 페이지를 보면, GPT-6 Astra의 Ultrafast 열은 일부 항목에는 할증이 붙고 다른 항목에는 붙지 않는 방식이 아니라 Standard 열의 균일한 6배다. 이 점이 중요한 이유는, 요청의 형태를 바꾸어서 그 비용을 최적화로 피할 수 없다는 뜻이기 때문이다.

• GPT-6 Astra, 스탠다드 서비스, 최대 272,000개 입력 토큰 요청 — 100만 토큰당 입력 $10.00, 캐시된 입력 $1.00, 캐시 쓰기 $12.50, 출력 $50.00.

• GPT-6 Astra Ultrafast, 동일 임계값 — 입력 $60.00, 캐시된 입력 $6.00, 캐시 쓰기 $75.00, 출력 $300.00, 100만 토큰당. 네 항목 모두 정확히 6배입니다.

• 입력 토큰이 272,000개를 초과하면 전체 요청의 가격이 다시 책정됩니다 — Standard는 $20.00 / $2.00 / $25.00 / $75.00로, Ultrafast는 $120.00 / $12.00 / $150.00 / $450.00로 변경됩니다. 여전히 6배입니다. OpenAI가 GPT-6 Astra에 대해 문서화한 롱 컨텍스트 규칙은 임계값을 넘으면 전체 요청에 대해 입력 및 캐시 요율 2배, 출력 1.5배를 적용하는 것이며, 두 등급 모두에 동일하게 적용됩니다.

• 같은 카드의 다른 티어 — Batch와 Flex는 Standard의 50%이고, Fast 모드는 Standard의 2배입니다. 따라서 이 한 모델의 배수 사다리는 0.5x, 1x, 2x, 6x이며, 마지막 두 단계 사이에는 중간 단계가 없습니다.

Ultrafast에 해당하는 Batch는 없습니다. Batch와 Flex는 표준 레인에서 더 느슨한 스케줄링을 감수하고 구매하는 할인입니다. 빠른 레인의 느리고 저렴한 버전은 없습니다. 속도를 원한다면 보내는 모든 토큰과 돌려받는 모든 토큰에 6x를 지불해야 하며, 캐시된 입력과 새 입력을 어떻게 섞어도 그 비율을 개선할 수 없습니다.

A screenshot of OpenAI's API pricing page with the Ultrafast tab selected, showing gpt-6-astra at $60.00 input, $6.00 cached input, $75.00 cache writes and $300.00 output per 1M tokens for short-context requests, stepping to $120.00 / $12.00 / $150.00 / $450.00 above 272,000 input tokens, alongside gpt-5.6-sol at $4.00 / $0.40 / $5.00 / $20.00 short-context and $8.00 / $0.80 / $10.00 long-context, with the page's notes that data-residency endpoints carry a 10% uplift for models released on or after March 5, 2026, that FedRAMP carries a further 10%, that Priority processing was renamed Fast mode on July 30, 2026, and that GPT-5.6 Sol's promotional pricing is available at least through November 21, 2026.

통화 한 번에 실제로 드는 비용

추상적인 개념도 구체적인 요청 두 가지가 있으면 훨씬 쉽게 따져볼 수 있습니다. 둘 다 OpenAI가 공개한 백만당 요금을 사용하며, 계산은 저희 몫입니다.

입력 토큰 20,000개와 2,000토큰 응답을 사용하는 단일 호출은 Standard에서 $0.30이 청구됩니다 — 20,000토큰은 백만 토큰당 $10로 $0.20이고, 2,000토큰은 백만 토큰당 $50로 $0.10입니다. Ultrafast에서 같은 호출은 $1.80이 청구됩니다. 광고한 대로 정확히 6배입니다.

이제 에이전트 루프를 실제로 설명하는 사례를 보자: 200,000토큰 대화에서 190,000토큰은 캐시된 프리픽스이고 10,000토큰만 새로 추가되어, 1,000토큰 스텝을 생성한다. Standard는 캐시 읽기에 $0.19, 새 입력에 $0.10, 출력에 $0.05를 청구한다 — 스텝당 $0.34. Ultrafast는 $1.14, $0.60, $0.30을 청구한다 — 스텝당 $2.04. 다시 6배지만, 이 구성이 어떤 결과를 냈는지 보라: 캐싱은 이 모델에서 가장 효과적인 단일 비용 레버이며, Standard 레인에서는 여전히 정확히 6배 더 저렴하다. 따라서 캐시를 많이 활용하는 에이전트는 고속 티어로부터 비례적으로 아무것도 얻지 못하며, 고속 티어는 프리미엄을 완화해 주지도 않는다.

그 결과가 바로 내면화할 가치가 있는 부분이다. 배수가 일정하기 때문에, 손익분기점은 당신의 토큰 구성과 전혀 관계가 없다. 그것은 전적으로 턴 수에 달려 있다. Ultrafast는 워크로드에서 실행할 때 과금되는 턴 수를 대략 6분의 1로 줄이는 경우에만 본전을 뽑는다. 재시도 루프를 단일 패스로 축약하거나, 짧은 명확화 호출이 이어지는 것을 더 빠른 하나의 대화형 세션으로 대체할 때다. 당신의 워크로드가 이전과 같은 수의 턴을 단지 더 빨리 실행할 뿐이라면, 당신은 정확히 6배의 비용으로 지연 시간을 사는 것일 뿐 그 외에는 아무것도 아니다.

요청 제한과 지역은 공개되지 않은 상한선이다

두 가지 제약 조건은 가격 밖에 있으며, 요금표를 읽을 때 놓치기 쉽습니다.

첫 번째는 처리량입니다. GPT-6 Astra용 Ultrafast는 모든 API 사용자가 이용할 수 있지만, 초기에는 낮은 요청 한도로 제공됩니다. OpenAI는 티어 1~3의 경우 분당 500,000토큰, 티어 4는 1,000,000토큰, 티어 5는 5,000,000토큰을 명시하고 있습니다. 속도를 무기로 판매되는 티어에서 이는 실질적인 상한입니다. 분당 50만 토큰으로 200,000토큰 에이전트 컨텍스트를 처리하면 낮은 티어에서는 분당 2.5회 요청에 불과합니다. OpenAI 자체 지침도 반대편에서 같은 문제를 지적하며, 요청별 네트워크 오버헤드가 해당 티어가 비용을 지불하고 얻는 지연 시간을 갉아먹을 수 있기 때문에 WebSockets를 강력히 권장합니다.

두 번째는 레지던시입니다. Ultrafast는 미국 데이터 레지던시와 글로벌 처리만 지원합니다. EU 또는 기타 미국 외 지역 처리 엔드포인트는 지원하지 않습니다. GPT-6 Astra를 위해 EU 레지던시 엔드포인트에 배포가 의존한다면, 이 티어는 어떤 가격으로도 사용할 수 없으며, 이는 구성 선택이 아닌 확고한 경계입니다. 또한 레지던시 엔드포인트는 2026년 3월 5일 이후 출시된 모델에 대해 10% 할증이 적용되며, GPT-6 Astra가 여기에 해당합니다.

속도 헤드라인은 14배에서 8배로 낮아졌다

이 점은 신중하게 짚고 넘어갈 가치가 있습니다. 대부분의 보도에서 회자되는 숫자는 이미 낡았기 때문입니다. 오늘 게시된 OpenAI의 Ultrafast 문서 페이지에는 "우리의 가장 빠른 API 서비스 등급으로, Standard 모드보다 최대 8배 더 빠른 속도를 제공합니다."라는 문구가 있습니다. GPT-5.6 Sol의 2026년 8월 13일 프리뷰 발표에서는 "Standard 처리보다 최대 14배 더 빠른 속도"와 Cerebras 하드웨어에서 초당 최대 750개의 출력 토큰을 약속했습니다.

그 둘은 같은 주장이 아니며, 그 차이는 철회라기보다 주제 전환에 가깝습니다. 14x 수치는 제한된 프리뷰에서 GPT-5.6 Sol로 측정된 것이고, 8x 수치는 GPT-6 Astra를 폭넓게 사용 가능한 모델로 둔 현재 기준으로 OpenAI가 해당 등급에 대해 공개하는 값입니다. Astra에서 14x를 기준으로 예산을 잡는 사람은 OpenAI가 Astra에 대해 공개하지 않은 수치를 기준으로 예산을 잡는 것입니다. 정직하게 읽자면 두 수치 모두 공급업체가 보고한 출력 처리량 상한이고, 어느 것도 귀하의 워크로드에 대한 지연 시간 보장이 아니며, 종단 간 시간에는 여전히 입력 처리, 도구 호출, 그리고 귀하 자신의 오케스트레이션이 포함됩니다. 8x를 계획 수치로 삼고, 그보다 나은 것은 가정하지 말고 자체 트래픽에서 검증할 보너스로 여기십시오.

월요일에 이걸 어떻게 해야 하나요?

산술에서 도출되는 결정 규칙은 마케팅이 시사하는 것보다 더 좁으며, 누군가가 에스테이트 전반에 Ultrafast를 활성화하자고 제안하기 전에 이를 적어 둘 가치가 있다.

워크로드가 지연에 민감하고 인터랙티브하며, 사람이 기다리고 있는 곳에서 켜세요. 인시던트 트리아지, 실시간 지원 에스컬레이션, 분석가가 한 자리에서 계속 반복 작업하는 리서치 루프 — 이런 경우가 바로 답이 4분 뒤가 아니라 지금 도착하는 가치가 토큰 가격에 비례하지 않는 상황이며, 적은 수의 턴에 대한 6배 청구서가 기다리는 사람의 비용보다 훨씬 작은 상황입니다. 프리뷰 발표에서 OpenAI가 직접 든 예시도 정확히 이런 형태였습니다. 장애가 벌어지는 동안 로그를 읽는 것, 밤새 돌아가던 리서치 루프를 하나의 작업 세션으로 압축하는 것.

워크로드가 처리량에 의해 제한되거나 배치 형태라면 꺼 두세요. 야간 재인덱싱, 대량 분류 패스, 예약된 보고서, 백필 — 이들 중 어느 것도 월클록 지연 시간에는 관심이 없고, 모두 토큰 수에 좌우되며, 모두 Batch와 Flex의 동일한 요금표에 바로 있는 0.5x 옵션을 이용할 수 있습니다. 더 빨리 끝내려고 배치 요금의 12배를 지불하는 것은 이 표에서 돈을 낭비하는 가장 명백한 방법입니다.

어색한 중간 지대는 에이전틱 코딩 루프이며, 바로 그곳에서 턴 수 계산이 판가름한다. 속도가 진정으로 재시도를 없앤다면 — 모델이 타임아웃과 싸우지 않기 때문에 여러 파일 변경에 대한 첫 시도가 더 자주 성공한다면 — Ultrafast는 토큰당 6배임에도 완료된 작업당 비용이 더 저렴할 수 있다. 그것은 일반적인 주장이 아니라 여러분 자신의 트레이스에 관한 측정 가능한 주장이며, 측정은 저렴하다: 두 티어 모두에서 완료된 작업당 청구된 턴 수를 세고 요율을 곱하라. 비율이 6에 가깝지 않다면, 빠른 티어는 지연 시간을 사는 것이며, 그렇게 정당화되어야 한다.

티어에는 가격이 매겨져 있다; 그 주변의 경로들은 같은 문제가 아니다

이를 어떻게 보유할지에 대한 실용적인 참고 사항 하나. 표준 서비스의 GPT-6 Astra는 OrcaRouter에서openai/gpt-6-astra로 제공됩니다. 제공자의 자체 요율로 — 백만 토큰당 입력 $10.00, 출력 $50.00이며, 272K 롱 컨텍스트 단계에서는 $20.00 / $75.00입니다 — 0% 마크업으로 제공됩니다. 즉, 제공자의 정가가 그대로 전달되며, 공급업체의 가격 변동은 다음 계약 갱신 시가 아니라 OpenAI의 요율표에 반영되는 당일 귀하의 청구서에 적용됩니다. 동일한 키로 200개 이상의 모델에 접근할 수 있습니다, 따라서 표준 티어는 저렴한 티어나 경쟁사 모델과 동일한 클라이언트 뒤에 별도의 통합 없이 위치할 수 있습니다.

우리가 하지 않는 일은 Ultrafast 티어를 제공하는 것입니다. 그것은 별도로 라우팅할 수 있는 모델이 아니라 OpenAI 계정에 설정하는 서비스 티어 플래그이며, service_tier: "ultrafast"로 보내는 요청에서 gpt-6-astra를 설정하는 방식입니다. 그리고 이 요금은 위에 나온 요율로 OpenAI가 여러분의 자체 계정에 청구합니다. 이 기능을 활성화하면 여러분의 직접 OpenAI 연동 안에 자리 잡게 되며, OrcaRouter는 그와 함께 라우팅하는 표준 티어 트래픽을 처리하기에 알맞은 곳입니다. 이 점을 솔직하게 말하는 것이, 우리에게 없는 기능을 있는 것처럼 암시하는 것보다 더 유용합니다.

A screenshot of the OrcaRouter model page for GPT-6 Astra, model id openai/gpt-6-astra, showing a 1M-token context window, 128K maximum output, text, image and file input, text output, public benchmarks attributed to OpenAI dated 2026-09-04, input price $10.00 and output price $50.00 per 1M tokens, p50 time to first token 4.69 s, a 10.00 s figure, and 155.1M tokens of traffic, with the page's code sample and EN language toggle visible in the header.

결정 규칙, 한 단락으로

6배는 티어의 가격이지 모델의 가격이 아니다. 가중치, 1,050,000토큰 컨텍스트 창, 128,000토큰 출력 상한, 그리고 답변은 모두 표준 GPT-6 Astra와 동일하다. 당신이 사는 것은 최대 8배 더 빠른 출력 처리량이며, 모든 항목이 6배인 요금표에, 낮은 초기 속도 제한과 EU를 완전히 배제하는 미국 거주 제한이 붙는다. 이 거래는 답변을 기다리는 사람에게는 명백히 옳고, 반값 레인이 있는 예약 배치 작업에는 명백히 틀리며, 속도가 턴 수를 줄여주는지에 따라 답이 달라지는 에이전트 루프에는 진정으로 미정이다. 커밋하기 전에 자신의 트레이스에서 턴 수를 측정하고, 나머지는 정가로 라우팅하라.

A screenshot of OpenAI's Ultrafast documentation page, showing the sentence 'Our fastest API service tier, with up to 8x faster speeds than Standard mode.', the sentence 'It is broadly available for GPT-6 Astra, with preview access for GPT-5.6 Sol.', the recommendation to use WebSockets because per-request network overhead can reduce the latency gains, the note that Ultrafast for GPT-6 Astra is available to all API users at low rate limits with higher limits or Sol preview access available through an OpenAI account team, and a Python code sample setting service_tier to 'ultrafast' with model 'gpt-6-astra'.

이 글에서 비교한 모델1

이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트