생성된 타이틀 카드로, 헤드라인은 'GPT-6 Astra Ultrafast, Blackwell에서 실행', 부제는 'NVIDIA, 8x를 가능하게 한 하드웨어를 밝히다', 세 장의 카드는 각각 '하드웨어: Blackwell GPUs', '가격 배수: 표준 요금의 6.00x', '주장된 속도: 최대 8x'이며, 하단에는 'NVIDIA 게시물, 2026년 10월 1일 - 공급업체 보고 수치'가 적혀 있습니다.
Guides & Insights

GPT-6 Astra Ultrafast, Blackwell에서 실행: NVIDIA, 8배 성능을 가능하게 한 하드웨어 공개

작성자

Gideon Frost

게시일

최신 모델 · 20모든 모델 보기 →
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

2026년 10월 1일, NVIDIA는 Dion Harris가 작성한 "How NVIDIA GPUs Help Accelerate OpenAI's GPT-6 Astra Ultrafast"라는 제목의 글을 게시했는데, 그 중심에 있는 문장은 두 회사 중 어느 쪽도 그 티어가 무엇 위에서 실행되는지 밝힌 적이 없던 가운데 이를 처음으로 알린 말이었다. "GPT-6 Astra Ultrafast는 NVIDIA Blackwell GPU에서 실행되며, 현재 OpenAI API와 자격을 갖춘 ChatGPT Work 및 Codex 사용자가 이용할 수 있습니다." 그것이 바로 뉴스이며, 헤드라인이 시사하는 것보다 범위는 좁다. 모델인 GPT-6 Astra는 2026년 9월 3일에 출시되었다. 그 위에 올려진 Ultrafast 서비스 티어는 2026년 9월 29일에 폭넓게 제공되기 시작했다. 속도 주장, 즉 Astra 표준 모드보다 최대 8배 빠른 토큰 생성이라는 주장은 NVIDIA가 그것을 다시 언급했을 때 이미 이틀 전에 나온 것이었다.

그러면 그 글이 실제로 답하고 있는 질문이 떠오른다. "얼마나 빠른가"가 아니라 "누구의 실리콘인가"라는 질문이다.

A screenshot of OpenAI's Ultrafast mode documentation page, showing the sentence 'Our fastest API service tier, with up to 8x faster speeds than Standard mode.', the sentence 'It is broadly available for GPT-6 Astra, with preview access for GPT-5.6 Sol.', the note that Ultrafast for GPT-6 Astra is currently available to all API users at low rate limits with higher limits or Sol preview access requestable through an OpenAI account team, the recommendation to use WebSockets because without a persistent connection network overhead can reduce the latency gains, and a Python code sample setting service_tier to 'ultrafast' with model 'gpt-6-astra'.

그 게시물이 실제로 추가한 세 가지

반복된 설명을 걷어내면 10월 1일 게시물은 세 가지 사실을 제공한다.

• 하드웨어 — Blackwell. 9월 30일 공개된 OpenAI 자체의 Ultrafast 문서는 이 등급의 속도와 구성, 요청 한도를 설명하면서 GPU는 전혀 언급하지 않는다. 따라서 칩 귀속 정보는 하드웨어 공급업체라는 단일 출처에만 의존한다. 그렇다고 해서 그것이 거짓이 되는 것은 아니다. 다만 자사 장비에 관한 공급업체의 주장일 뿐이며, 그렇게 표시할 가치가 있다.

• 실명이 공개된 두 엔지니어 — OpenAI의 추론 책임자인 Philippe Tillet과 OpenAI의 컴퓨팅 최고기술책임자인 Uday Ruddarraju, 두 사람 모두 이 가속이 무엇에서 비롯되었는지에 관해 공식적으로 언급했다.

• 대상 사용자 — "자격을 갖춘 ChatGPT Work 및 Codex 사용자"로, 이 등급이 출시될 당시의 API 전용이라는 틀보다 더 넓은 범위입니다. OpenAI 자체 문서에는 여전히 GPT-6 Astra의 Ultrafast가 "낮은 요청 한도로 모든 API 사용자가 이용 가능"하다고 나와 있으며, 그 낮은 한도라는 단서는 공식적으로 철회된 적이 없습니다.

두 인용문, 그리고 그것들이 흥미로운 부분인 이유

틸레의 기여는 벤치마크라기보다 루프다. 그는 NVIDIA의 툴링과 문서에 대한 투자가 "우리가 우리 모델을 프로그래밍에 예외적으로 뛰어나게 만들 수 있게 해 주었고", 그러면 Astra가 "그 지식을 NVIDIA 하드웨어를 매력적으로 만드는 고성능 커널로 전환할 수 있다"고 말한다. 루다라주는 이 작업의 방향에 대해 더 직설적이다: "우리는 내부 모델을 사용해 NVIDIA GPU에서 추론을 최적화했다."

함께 읽으면, 이는 역량이라기보다 배포에 관한 주장이다: OpenAI의 프런티어 모델은 이제 GPU 커널을 작성하는 일을 충분히 잘해서, OpenAI가 자사의 서빙 스택을 최적화하는 데 이들을 사용한다. 이는 또한 NVIDIA 게시물에서 출시 주간과 전혀 관련이 없는 한 섹션, 즉 "지속적으로 성능 개선"이라는 제목과도 일치한다. 그 섹션은 OpenAI가 자사 모델을 자기가 실행하는 NVIDIA 소프트웨어에 계속 적용하기 때문에 배포된 추론이 시간이 지나면서 더 빨라진다고 주장한다.

이 중 어느 것도 측정이 아니다. 이것은 두 엔지니어가 어떤 과정을 설명한 것으로, GPU를 판매한 회사가 게시한 것이다. 정직하게 읽자면 그 과정은 그럴듯하고, 믿기에 부담이 없으며, 외부에서는 반증할 수 없다 — 이 이야기에 나오는 모든 속도 수치에도 마찬가지로 해당된다.

여기 Blackwell, 저기 Cerebras

이것이 하는 가장 유용한 일은 아무도 설명하지 못한 분열을 드러내는 것이다. 2026년 8월 13일, OpenAI는 다른 모델인 GPT-5.6 Sol을 기반으로 '최대 14배' 빠른 패스트 티어를 출시했으며 — 패스트 티어 배후의 공급원으로 브랜딩된 — 웨이퍼 스케일 하드웨어가 초당 750 출력 토큰에 이른다고 설명했다. 6주 후, 그 패스트 티어는 Google에서 실행되며, 8배다.

두 가지 빠른 티어, 두 가지 하드웨어 해답. 그중 하나는 전문 파트너이고, 다른 하나는 이 회사 자체의 최대 공급업체다. 두 공급업체 모두 두 서빙 경로 사이의 비교를 공개하지 않았으며, 어떤 독립 평가자도 어느 쪽도 측정하지 않았다. 또한 NVIDIA의 게시물이 두 번째 이름을 어떻게 다루는지도 주목하라. “Rubin”은 모델이 “Blackwell 및 Rubin GPU”용 커널을 작성한다는 Tillet의 인용문 안에서 한 번 등장한다. 이는 OpenAI의 모델이 무엇을 프로그래밍할 수 있는지에 관한 진술이지, 오늘날 Rubin에서 무언가가 서빙되고 있다는 진술이 아니다.

NVIDIA가 공개하지 않은 숫자

이 이야기에는 두 회사 모두 8x 옆에 함께 제시하지 않은 수치가 하나 있는데, 그것이 바로 팀이 해당 티어를 켤지 말지를 결정하는 수치다. OpenAI가 공개한 Ultrafast 요금표에는 gpt-6-astra가 백만 입력 토큰당 $60.00, 캐시된 입력 $6.00, 캐시 쓰기 $75.00, 출력 $300.00으로 기재되어 있다. 표준 티어에서 동일 모델은 $10.00과 $50.00이고, 캐시된 입력은 $1.00, 캐시 쓰기는 $12.50이다. 각 열은 표준 요금의 정확히 6배다.

• 그 배수 — 입력, 출력, 캐시된 입력 및 캐시 쓰기에서 6.00x. "최대"가 아닙니다. 6배.

• 상한선 — 8배, 두 공급업체 모두 "최대"를 붙여 인용할 뿐 아무런 조건도 명시하지 않는 수치.

• 그것이 의미하는 바 — 가격 배수는 아래에 해당 티어가 스스로 주장하는 최선의 경우보다 위치합니다. 상한선에서는 이 거래가 유리하지만, 트래픽 기준 6배 미만이라면 절약되는 시간 단위당 지불하는 비용이 마케팅이 시사하는 것보다 더 많습니다. 그래서 이 티어에 대한 유일하게 의미 있는 검증은 귀하의 자체 요청에 대한 측정입니다.

• 장문 컨텍스트 구간 — 입력 토큰이 272,000개를 초과하면 Ultrafast 요금은 입력 $120.00, 출력 $450.00이 되며, 이는 표준 등급 자체의 구간별 요금의 여섯 배입니다.

• 운영상의 세부 유의사항 — OpenAI는 Ultrafast의 분당 토큰 수 단계를 문서화합니다. 사용 등급 1~3은 500,000, 등급 4는 1,000,000, 등급 5는 5,000,000입니다. Ultrafast는 미국 데이터 레지던시와 글로벌 처리만 지원하며, EU 또는 기타 비미국 지역 처리 엔드포인트는 없습니다. 또한 문서에서는 Ultrafast에 WebSockets를 권장하며, "특히 빠르게 연속으로 많은 도구 호출을 수행하는 에이전트 애플리케이션의 경우"라고 강조하고, "영구 연결이 없으면 네트워크 오버헤드로 인해 지연 시간 개선 효과가 줄어들 수 있다"고 경고합니다.

A screenshot of OpenAI's API pricing page with the Ultrafast tab selected, showing the gpt-6-astra row at $60.00 input, $6.00 cached input, $75.00 cache writes and $300.00 output per 1M tokens for short-context requests, stepping to $120.00 / $12.00 / $150.00 / $450.00 above 272,000 input tokens, alongside gpt-5.6-sol at $4.00 / $0.40 / $5.00 / $20.00 short-context and $8.00 / $0.80 / $10.00 long-context, with the page's notes that regional processing endpoints carry a 10% uplift for models released on or after March 5, 2026, that FedRAMP endpoints carry a further 10%, that Priority processing was renamed Fast mode on July 30, 2026, and that GPT-5.6 Sol's promotional pricing is available at least through November 21, 2026.

마지막 요점이야말로 실행에 옮겨야 할 부분이다. 해당 티어를 활성화하고도 그 아래에서 요청별 HTTP를 그대로 두는 팀은, 속도 향상의 일부를 연결 설정에 도로 넘겨주기 위해 6배의 요금을 치른 셈이다 — 문서화되어 있고 피할 수 있는 돈 낭비 방식이다.

단일 엔드포인트에서 이것이 어떻게 보이는지

GPT-6 Astra는 OrcaRouter에서 openai/gpt-6-astra로 제공됩니다: 1,050,000 토큰 컨텍스트 창, 최대 128,000 출력 토큰, 텍스트·이미지·파일 입력을 지원하며, OpenAI의 정가가 백만 토큰당 입력 $10.00, 출력 $50.00로 그대로 적용되고, 입력 토큰이 272,000개를 초과하면 $20.00 및 $75.00로 인상됩니다. 카탈로그 대표 벤치마크는 GPQA Diamond에서 96.1입니다.

Ultrafast 티어는 OrcaRouter에 없으며, 있을 수도 없습니다. 그것은 모델 ID가 아니라 OpenAI 계정의 접근이 제어되는 속성이기 때문입니다. 그래서 openai/gpt-6-astra-ultrafast는 model-not-found를 반환합니다. 티어를 켜면 그것은 여러분의 직접 OpenAI 통합에 존재합니다. 이 상황에서 200개 이상의 모델을 제공하는 엔드포인트가0% 마크업으로 여러분에게 주는 것은 패스트 레인이 아니라 통제력입니다. 공급자의 정가가 마크업되지 않고 그대로 전달되기 때문에, OpenAI의 요금 변경은 그쪽에 적용되는 당일에 우리 쪽에도 적용됩니다. 그리고 표준 Astra 레인이 이미 있기 때문에, 이 결정을 매듭짓는 실험은 단 한 줄의 설정입니다: 동일한 프롬프트, 표준 티어, 그리고 그 옆에 더 저렴한 모델을, 같은 키에서. 이는 대부분의 팀이 앞으로 실행하게 될 지연 시간 벤치마크에 가장 가까운 것이며, 설정하는 데 비용이 전혀 들지 않습니다.

A screenshot of the OrcaRouter model page for GPT-6 Astra, model id openai/gpt-6-astra, showing a 1,050,000-token context window, 128k maximum output, text, image and file input, public benchmarks attributed to OpenAI dated 2026-09-04, input price $10.00 and output price $50.00 per 1M tokens, p50 time to first token 4.69 s, a 10.00 s figure and 155.1M tokens of traffic, with an OpenAI-compatible Python code sample and the EN language toggle in the header.

아직 측정되지 않은 것은 무엇인가

오늘 확인할 수 있는 세 가지가 있다. 해당 등급은 존재하고, 요금표에 표준 요금의 정확히 6배로 기재되어 있으며, 10월 1일부로 NVIDIA Blackwell GPU에 공개적으로 귀속되어 있다.

한 가지는 아닙니다: 트래픽에 대한 배수입니다. 어떤 벤더도 명시된 동시성 수준에서 해당 티어의 지연 시간 분포를 공개하지 않았고, 어떤 제3자도 8x를 재현하지 못했습니다. Ultrafast에서의 Astra와 표준에서의 Astra를 비교한 벤치마크도 없으며, 유리하게 나오는 벤치마크가 있어서도 안 됩니다 — 더 빠른 경로에서 동일한 체크포인트를 돌리는 것이므로, 동일한 설정은 서로 다른 속도에서 동일한 답을 내야 합니다. 같은 프롬프트에서 두 레인이 갈라진다면, 그것은 기능이 아니라 버그 리포트입니다.

그래서 10월 1일의 유용한 요약은 발표문이 읽히는 것보다 작다. 같은 등급에 같은 가격, 여전히 검증되지 않은 속도 상한을 그대로 둔 채 이제 하드웨어 라벨을 달고 있을 뿐이다. 그 라벨은 중요하다 — OpenAI가 이것을 어느 가속기 라인에서 확장하고 있는지 알려주고, 빠른 등급 이야기가 두 달도 안 되어 전문 파트너에서 업계 최대 GPU 공급업체로 옮겨갔다는 것을 알려준다. 다만 그것은 당신 자신의 지연 예산에 대해서는 아무것도 알려주지 않으며, 어떤 게시물도 그렇게 하지 않을 것이다.