
GPT-6.1 Sol Ultrafast가 API에 출시되고, Codex와 ChatGPT가 작동한다
- openaiNEWOpenAI: GPT-6.1 Sol2026-09-2952지능
- anthropicNEWAnthropic: Claude Sonnet 5.52026-09-2856지능
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100만 토큰당 · 111 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238지능
- OpenAIOpenAI: GPT-6 Sol2026-09-2248지능
- AnthropicAnthropic: Claude Opus 5.52026-09-2258지능
- xAIGrok 4.72026-09-2146지능
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 100만 토큰당 · 55 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당 · 347 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- OpenAIOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- AnthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 100만 토큰당 · 60 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당 · 377 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당 · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
OpenAI가 Ultrafast 모드를 출시합니다. 대상은 GPT-6.1 Sol — 자사가 판매하는 가장 빠른 서비스 등급이며, near-Astra Sol 등급이 이러한 등급을 갖는 것은 이번이 처음입니다. 이번 조치로 GPT-6.1 Sol은 다음 모델과 같은 범주에 들어갑니다: GPT-6 Astra Ultrafast — API, Codex, ChatGPT Work에서도 마찬가지입니다. 그리고 대기 명단이 아니라 공개된 요금표와 함께 제공됩니다: 입력 토큰 100만 개당 $12.00, 출력 토큰 100만 개당 $60.00으로, 표준 GPT-6.1 Sol 비용의 정확히 6배입니다. 광고에 적힌 속도 주장은 "최대 8배"입니다. 흥미로운 점은 그 표현이 무엇을 측정하는지인데, 답은 여러분이 곧 비용을 지불하려는 그 모델이 아닙니다.
개발자 변경 로그에는 10월 8일자 항목이 실려 있습니다: "Responses API에 GPT-6.1 Sol용 Ultrafast 모드를 추가했습니다. 사용하려면 gpt-6.1-sol과 함께 service_tier: "ultrafast"를 사용하여 생성된 출력 토큰 사이의 시간을 줄입니다. 모든 API 사용자가 사용할 수 있으며, 요청 속도 제한이 적용되고, 글로벌 처리와 미국 및 EU 데이터 레지던시를 제공합니다." Ultrafast 문서 페이지에는 이제 "GPT-6 Astra 및 GPT-6.1 Sol에 대해 폭넓게 제공되며, GPT-5.6 Sol은 프리뷰 액세스로 제공됩니다"라고 나와 있으며, ChatGPT 측 속도 페이지에서는 구독 측면을 확인합니다: Ultrafast는 Codex와 ChatGPT Work에서 Pro $500 및 자격을 갖춘 Enterprise 및 Edu 플랜에서 사용할 수 있습니다.
Ultrafast는 두 번째 모델이 아니라 서비스 등급입니다.
가중치에 관해서는 아무것도 바뀌지 않습니다. 동일한 체크포인트, 동일한 1,050,000토큰 컨텍스트 윈도우, 동일한 922,000토큰 최대 입력, 동일한 128,000토큰 출력 상한, 동일한 2026년 4월 30일 지식 컷오프, 동일한 답변입니다. 여러분이 구매하는 것은 스케줄링 우선순위입니다: 모델이 토큰을 더 빠르게 생성하며, OpenAI 자신의 설명도 의도적으로 좁습니다 — 이 등급은 "생성된 출력 토큰 사이의 시간을 단축"합니다. 이는 모델을 더 똑똑하게 만들어 주지 않으며, 사고 단계를 더 짧게 만들어 주지도 않습니다.
그 구분이 결정의 전부다. 연속으로 40번의 도구 호출을 하는 에이전트 루프에서는 매 턴의 출력이 더 빨리 도착하기 때문에 이득이 누적된다. 실제 경과 시간의 대부분을 숙고하는 데 쓰는 단일한 어려운 추론 요청에서는, 여섯 배의 비용을 치르고도 똑같은 스피너만 보게 될 수 있다.
티어 사다리, 한 번, 쉬운 말로:
• 배치 및 — 절반 가격, 아무도 기다리지 않는 작업을 위한 저렴한 레인
• Standard — 백만 토큰당 입력 $2.00 / 캐시 $0.10 / 캐시 쓰기 $2.50 / 출력 $10.00
• Fast — Standard의 두 배, 또는 $4.00 / $0.20 / $5.00 / $20.00; OpenAI는 2026년 7월 30일 Priority processing을 Fast mode로 명칭을 변경했습니다
• Ultrafast — Standard의 6배, 또는 $12.00 / $0.60 / $15.00 / $60.00
• 272K 입력 토큰 초과 시 — 전체 요청이 입력 및 캐시 요율 2배, 출력 1.5배로 재청구되며, Ultrafast 롱 컨텍스트는 $24.00 / $1.20 / $30.00 / $90.00입니다
아무도 마케팅 페이지에 올려놓지 않는 산수
여덟 배의 속도를 위해 여섯 배의 가격을 내는 것은 손해 보는 거래도 아니고 공짜 점심도 아니다. Ultrafast는 토큰당 요금이 청구되므로, Standard에서 $1.00가 드는 작업은 Ultrafast에서 $6.00가 들며, 약 8분의 1의 시간에 끝난다. 절약되는 것은 청구서가 아니라 실제 경과 시간이다. 그 작업의 대기 시간 중 8분의 7을 없애기 위해 5달러를 더 내는 것이며, 그것이 저렴한지 터무니없는지는 전적으로 반대편에서 기다리는 사람이나 파이프라인이 분당 얼마의 가치가 있는지에 달려 있다.
두 가지 함의가 뒤따르는데, 바로 그것들이 놓치기 쉬운 것들입니다:
• 인터랙티브 작업은 당연한 '예'입니다. 개발자가 diff가 반영되는 것을 지켜보는 경우, 결과를 읽기 전까지 진행할 수 없는 에이전트 — 이런 경우에는 지연 시간이 곧 제품입니다. 40턴 루프에서 8배 더 빠른 출력은 인간의 인식에 대한 미미한 개선이 아닙니다. 그것은 당신이 사용하는 도구와 백그라운드로 돌리는 도구 사이의 차이입니다.
• 예약 및 배치 작업은 쉽게 거절할 수 있는 대상입니다. 작업이 어차피 아침까지 걸린다면, Ultrafast는 아무것도 아닌 일에 6배 청구서를 내는 셈이고, 반값인 Batch 레인은 바로 거기 있습니다.
캐시된 입력은 다시 살펴볼 가치가 있습니다. 그것도 움직이기 때문이죠: Ultrafast에서는 백만 토큰당 $0.60, Standard에서는 $0.10이며, 여전히 캐시되지 않은 입력 요율의 5%입니다. 매 턴마다 대규모 시스템 프롬프트를 다시 보내는 프롬프트 캐시 사용 에이전트는 캐시 할인이 그들을 티어로부터 보호해 주기보다는 티어에 따라 함께 커진다는 점을 알게 될 것입니다.

“최대 8배”라는 숫자의 출처
이 부분은 주의 깊게 읽어야 합니다. 바로 여기에서 롤아웃의 헤드라인과 롤아웃의 문서가 조용히 서로 다른 것을 설명하기 때문입니다.
OpenAI가 공개하는 유일한 모델별 속도 측정치는 이 문장입니다: "GPT-6 Astra Ultrafast는 Codex의 Standard 모드에서 GPT-6 Astra보다 최대 8배 빠르게 토큰을 생성합니다." 이는 Codex에서 측정된 Astra 수치입니다. GPT-6.1 Sol에 대해 공개된 이에 상응하는 배수는 없습니다. 이 모델의 Ultrafast를 다루는 문서에는 생성된 출력 토큰 사이의 시간을 줄여 준다고 되어 있고 가격표를 가리키지만, 그에 대한 숫자는 제시하지 않습니다. ChatGPT 쪽 속도 페이지는 Astra 문장을 반복하고 끝납니다.
그래서 "최대 8배 더 빠름"을 솔직하게 해석하면 이렇다: 그것은 해당 티어의 대표 문구이며, 9월 29일부터 Ultrafast에 있어 온 형제 모델에서 비롯된 것이고, 두 모델 중 어느 것에 대해서도 독립적인 제3자가 재현한 적 없는 공급업체 주장이다. GPT-6.1 Sol에는 충분히 들어맞을 수도 있다. 두 모델이 동일한 서빙 스택에서 실행되고 그 티어의 메커니즘도 같기 때문이다. 하지만 OpenAI 외부에서는 누구도 Sol 변형에 대한 초당 토큰 측정치를 공개하지 않았고, 그 문장에서 "최대"는 실질적인 역할을 하고 있다.
티어를 모델별로 분리해 두는 것도 가치가 있습니다. 구형 모델은 아직 끝나지 않은 과제이기 때문입니다. Ultrafast는 2026년 8월 13일 GPT-5.6 Sol을 대상으로 "Standard 처리보다 최대 14배 빠름"이라는 조건으로 발표되었으며, 일부 고객을 대상으로 제한적 프리뷰로 제공되었습니다. 3개월이 지난 지금도 문서에는 GPT-5.6 Sol에 "preview access"가 있다고 나와 있고, Ultrafast 가격표에는 정확히 두 개의 행, 즉 GPT-6 Astra와 GPT-6.1 Sol만 들어 있습니다. 일반 제공에 도달한 적도 없고 공개된 요금도 없는 14배라는 숫자는 제품이 아니라 주장일 뿐입니다.

누가 실제로 그것을 켤 수 있나?
API 쪽은 넓고, 구독 쪽은 좁으며, 그 차이가 사람들을 당황하게 만든다.
• API — gpt-6.1-sol에서 모든 API 사용자가 이용할 수 있으며, Standard 및 Fast와는 별도의 속도 제한이 적용됩니다. 즉, 단순히 두 번째 가격이 아니라 두 번째로 관리해야 할 예산이 생기는 셈입니다.
• GPT-6.1 Sol을 위한 초고속 속도 제한 — Build에서는 분당 1,000,000 토큰, Launch에서는 4,000,000 토큰, Grow에서는 40,000,000 토큰입니다. OpenAI는 10월 6일에 사용량 등급을 5개에서 3개로 단순화했으므로, 이 세 가지 명칭이 현재의 등급 체계이며 예전 것이 아닙니다.
• 데이터 레지던시 — GPT-6.1 Sol은 미국 및 EU 데이터 레지던시와 글로벌 처리를 지원하며, Fast와 Ultrafast에서도 마찬가지입니다. Astra의 Ultrafast는 EU 레지던시를 제공하지 않으므로, 워크로드가 EU에 고정되어 있다면 이 구성이 실제로 구매할 수 있는 최초의 Ultrafast 구성입니다.
• Codex 및 ChatGPT Work — Ultrafast는 Pro $500 요금제와 자격을 갖춘 Enterprise 및 Edu 요금제에서 사용할 수 있습니다. Enterprise 관리자는 기본적으로 이 기능이 꺼져 있으며 사용자별 또는 워크스페이스별로 활성화해야 합니다.
• Chat — 포함되지 않습니다. GPT-6.1 Sol 자체는 Work와 Codex에 있으며, 소비자용 Chat 인터페이스는 여기에 포함되지 않습니다.
• 구독에서 청구되는 방식 — 포함된 사용량은 Standard 요율의 8배로 차감되며, 구매한 크레딧이나 Enterprise 종량제는 Standard 요율의 6배로 청구됩니다. 이 기능을 켜 둔 채로 두기 전에 두 수치 모두 알아 둘 가치가 있습니다.
구현 세부 사항 하나가 속도 향상을 체감할 수 있을지 여부를 결정합니다. OpenAI의 지침은 이 점을 분명히 합니다. WebSockets를 사용하라는 것입니다. "특히 빠르게 연속해서 많은 도구 호출을 하는 에이전트 애플리케이션"의 경우 더욱 그렇습니다. 왜냐하면 "영구 연결이 없으면 네트워크 오버헤드가 지연 시간 개선 효과를 줄일 수 있기" 때문입니다. 클라이언트가 호출마다 새로운 HTTP 연결을 열면, 요청별 오버헤드가 방금 6배 비용을 지불한 등급의 이점을 전부 잡아먹을 수 있습니다. HTTP도 여전히 작동합니다. 다만 그 등급에 돈을 쓸 가치가 없을 수도 있습니다.
우리가 라우팅하는 것과 라우팅하지 않는 것
스탠더드 등급 GPT-6.1 Sol이 OrcaRouter에 openai/gpt-6.1-sol로, 공급자 자체 가격인 백만 토큰당 입력 $2.00, 출력 $10.00에 0% 마크업으로 제공됩니다 — 벤더의 정가가 그대로 전달되는 방식이라, OpenAI가 요율을 변경하면 다음 계약 갱신 시점이 아니라 요율표에 반영되는 바로 그날 청구서에도 반영됩니다. 동일한 키와 엔드포인트로 200개 이상의 모델을 사용할 수 있으므로, GPT-6.1 Sol 호출과 Claude 또는 Qwen 호출이 자동 장애 조치를 갖춘 하나의 통합 뒤에 자리하고 두 번째 계약이 필요 없으며, 라우팅 DSL은 작업에 하나 이상의 의견이 필요할 때 여러 모델을 단일 호출로 구성해 줍니다.
Ultrafast는 그러한 모델 중 하나가 아니며, 그렇다고 암시하는 것은 오해의 소지가 있습니다. 그것은 OpenAI 계정의 서비스 등급 플래그이며, service_tier: "ultrafast"를 gpt-6.1-sol로 보내면 OpenAI가 위 요율로 귀하의 계정에 청구합니다 — 즉, 그것은 귀하의 직접적인 OpenAI 연동 안에 존재합니다. 이를 켠다면 등급형 트래픽은 귀하의 벤더 키에 두고, 일반 볼륨 트래픽은 저희를 통해 라우팅하세요. 그것이 정직한 분할이며, 사람을 기다리지 않는 모든 작업에는 더 저렴한 방식이기도 합니다.

오늘은 그걸로 무엇을 할까
Pro $500에서 Codex 또는 ChatGPT Work 시트가 있다면, 토글은 이미 있고, 체험은 사용량 배수 외에는 비용이 들지 않는다 — 같은 작업을 두 방식으로 실행해 보고, 실제로 실행하는 루프에 8배가 나타날 만큼 턴이 충분한지 확인하라. API를 사용 중이라면, 실행해 볼 가치가 있는 실험은 발표가 시사하는 것보다 범위가 좁다: 지연 시간 중 얼마나 많은 부분이 토큰 생성이고 얼마나 많은 부분이 모델의 사고인지 계측한 다음, Ultrafast를 실제로 압축할 수 있는 부분에 겨냥하라.
그리고 동일한 요청에 대해 Fast(2x)와 Ultrafast(6x) 중 선택할 수 있다면, Fast는 먼저 등장한 등급이며 요금표만으로도 그 동작을 추론할 수 있는 등급입니다. Ultrafast는 이 모델에 새로 추가된 것으로, 누구의 독립적인 측정으로도 가격이 매겨지지 않았고, 자신의 스톱워치가 말하는 만큼만 가치가 있습니다.
이 글에서 비교한 모델1
이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트
