
GPT-5.6 Sol Ultrafast vs GPT-5.6 Sol: 동일한 가중치, 다른 서비스 등급
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100만 토큰당 · 610 tok/s
- openaiNEWOpenAI: GPT-6 Luna2026-09-2237지능
- openaiNEWOpenAI: GPT-6 Sol2026-09-2248지능
- anthropicNEWAnthropic: Claude Opus 5.52026-09-2258지능
- grokNEWGrok 4.72026-09-2146지능
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100만 토큰당 · 189 tok/s
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당 · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- openaiOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- googleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- anthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당 · 111 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당 · 225 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236지능69코딩
- grokSpaceXAI: Grok 4.62026-08-1244지능77코딩
- metaMeta: Muse Spark 1.22026-08-0540지능72코딩
GPT-5.6 Sol Ultrafast는 새 모델이 아니며, 이것은 출시 기사도 아닙니다. 벤더는 2026년 8월 13일에 이 모드를 발표했고, 같은 날 ultrafast 값이 회사의 공개 OpenAPI 스키마에, 구체적으로는 명세의 ServiceTierResponses 설명 안에 나타났습니다. 이 설명은 자체 문구로 해당 티어의 범위를 gpt-5.6-sol 엔드포인트로 한정하고, 접근 제어 대상으로 표시합니다. 이 페이지를 다시 우리 대기열에 올린 것은 더 작고 더 구체적인 변화입니다: 2026년 9월 25일, 커밋 fe4f7a1이 그 값을 두 개의 추가 열거형, 즉 요청 수준 service-tier 매개변수와 에이전트 service-tier 정책 필드로 확장했습니다. 발표 후 6주가 지난 지금도 이 티어는 여전히 대기 명단 상태이고, 공개된 가격도 없으며, 이제 실제로 제공할 수 있는 것보다 더 많은 API 표면에 연결되어 있습니다. GPT-5.6 Sol Ultrafast와 GPT-5.6 Sol은 같은 모델입니다. 이 비교가 결정할 수 있는 유일한 것은 누가 포인터를 통제하는지, 그리고 누가 당신에게 비용을 알려주었는지입니다.
그래서 헤드라인에 오른 이 대결은 이례적인 조합입니다. GPT-5.6 Sol Ultrafast와 GPT-5.6 Sol은 같은 모델입니다. 동일한 가중치, 동일한 체크포인트, 동일한 추론 동작, 동일한 105만 토큰 컨텍스트 윈도우, 동일한 128K 최대 출력, 동일한 답변입니다. OpenAI 자신의 설명은 "더 똑똑한 모델"이 아니라 "초당 더 유용한 작업량"입니다. 이 비교의 두 열 사이에서 유일하게 다른 점은 토큰이 생성되는 방식과 요청 본문에서 해당 티어가 무엇이라고 불리는지뿐입니다. 이는 이 비교를 현재 라인업에서 가장 깔끔한 통제 실험으로 만들면서, 동시에 가장 구매를 알아보기 어려운 대상으로 만듭니다. 두 티어 중 하나는 공개된 가격이 전혀 없기 때문입니다.
이번 주에 실제로 무엇이 달라졌을까
9월 변경에 대한 증거는 블로그 게시물이 아니라 커밋이다. OpenAI는 자사 API의 기계 판독 가능 스키마를 게시하는 저장소인 openai-openapi를 유지하며, 2026-09-25 날짜의 커밋 fe4f7a1은 두 열거형—에이전트에 연결된 서비스 티어 정책과, 명세가 "모델 요청에 사용되는 서비스 티어"라고 설명하는 요청 수준 필드—에 ultrafast를 추가한다. 이는 데뷔가 아니라 확장이다: 이 커밋 이전에 그 두 목록은 auto, default, flex, priority, fast로 되어 있었고, 해당 티어는 이미 8월 13일부터 스키마에 있었다. 이 커밋이 주목할 만한 까닭은 그것이 어떤 필드에 도달했는지에 있다 — 에이전트가 구성되는 정책 필드이며, 이는 요청별 재정의와는 다른 영역이다.
중요한 설명은 이 커밋이 아니라 8월 13일 커밋에서 비롯되며, 그것은 OpenAI가 해당 티어에 관해 어디에서든 공개한 가장 구체적인 진술이다. 새 값과 함께, 명세에는 다음과 같이 적혀 있다: "'ultrafast'로 설정하면 요청은 액세스 제어되는 Ultrafast Processing 서비스 티어로 처리됩니다. 이 티어는 현재 gpt-5.6-sol에 사용할 수 있으며, 이를 통해 제공되는 응답에는 service_tier=ultrafast가 표시됩니다."
그 문장을 두 번 읽으세요. 그렇지 않았다면 이 비교 페이지가 두 가지 질문에 대해 어쩔 수 없이 얼버무려야 했을 텐데, 그 문장이 그 두 가지를 정리해 주기 때문입니다. 이 티어는 하나의 모델, 즉 GPT-5.6 Sol 플래그십에만 한정되며 라인업의 다른 무엇도 해당하지 않습니다. 또한 개방형이 아니라 접근이 제어되는데, 이는 OpenAI가 대기자 명단 방식의 프리뷰라고 설명한 것과 일치합니다. 또한 이를 받았는지 어떻게 알 수 있는지도 알려 줍니다. 응답이 실제로 요청을 처리한 티어를 그대로 되돌려 주므로, 표준 처리로의 폴백은 지연 시간에서 추론해야 하는 것이 아니라 응답 본문에서 바로 보입니다. 동일한 설명이 표준 및 Beta Responses 스키마 모두에 나타나며, 8월 13일 이후로 계속 그렇습니다.
![A screenshot of the GitHub commit page for openai/openai-openapi commit fe4f7a1 by openai-openapi-publisher[bot], titled "Add 'ultrafast' service tier option to improve request speed", showing the diff adding "ultrafast" to the enum lists after "fast" and a new x-enumDescription reading "Uses the ultrafast service tier."](https://cms.orcarouter.ai/api/media/file/2-1341.png)
더 약한 두 번째 신호가 다음 날 도착했다. 9월 26일자 보도는 Responses API Playground에 새로 추가되는 Speed 선택기 — Fast, Standard, Ultrafast — 를 설명하며, Ultrafast의 더 넓은 제공은 OpenAI의 DevDay 개발자 컨퍼런스 이후에 이루어질 것으로 예상된다. 우리는 그 선택기를 직접 보지 못했고 OpenAI도 출시 공지를 게시하지 않았으므로, 이를 출시된 기능이 아니라 단일 출처 보도로 취급해야 한다. 오늘 확인 가능한 부분은 공개 스키마의 두 지점과 해당 티어에 대한 요금표가 아직 나타나지 않았다는 사실이다.
변하지 않은 것이 마찬가지로 중요하다. Ultrafast 요금제는 여전히 없다. 9월 27일에 확인한 OpenAI의 가격 페이지에는 이전과 동일한 네 개의 탭, 즉 Standard, Batch, Flex, Fast가 있으며, "ultrafast"라는 문자열은 어디에도 나타나지 않는다. 이용은 여전히 일부 고객을 위한 제한적 프리뷰로 설명되며, 용량이 늘어남에 따라 확대된다. 이 등급은 계약서에는 있고 가격표에는 없는 동시에 존재하며, 그것이 이 등급의 솔직한 현실이다.
두 계층, 나란히
이 둘을 구분하는 기능이 없기 때문에, 비교는 거의 전적으로 서빙과 빌링으로 귀결됩니다. 아래의 모든 행은 양쪽을 하나의 행에 함께 담고 있습니다.
• 모델 — GPT-5.6 Sol Ultrafast는 GPT-5.6 Sol 표준 처리와 동일한 GPT-5.6 Sol 체크포인트를 실행합니다. 동일한 체크포인트, 증류 없음, 모델 크기 축소 없음.
• 출력 처리량 — 초당 최대 750개의 출력 토큰, 표준 대비 최대 14배. OpenAI의 8월 13일 발표에 따르면 GPU 클러스터에서의 표준 GPT-5.6 Sol 처리와 비교한 수치이며, 이는 14배가 측정되는 기준이 되는 값입니다.
• 하드웨어 — Cerebras의 웨이퍼 스케일 칩으로, 가중치가 온칩 SRAM에 상주하며, 3년간 약 100억 달러 규모로 보도된 OpenAI의 2026년 1월 Cerebras와의 컴퓨팅 파트너십의 첫 제품이다. 기존 GPU 추론과 비교하면, 기존 방식에서는 대부분의 시간이 메모리와 연산부 사이에서 가중치를 옮기는 데 소요된다.
• 가격 — 2026년 9월 27일 기준으로 미공개, vs 백만 토큰당 입력 $4.00 / 출력 $20.00, OpenAI의 현재 프로모션 요금, 그리고 캐시된 입력의 경우 백만 개당 $0.40.
• 가용성 — 일부 고객을 대상으로 대기자 명단을 통한 제한적 프리뷰 vs API 키만 있으면 누구나 호출할 수 있는 기본 레인.
• 돌려받는 답변 — 원칙적으로 동일함 vs 원칙적으로 동일함. 같은 프롬프트에서 갈라진다면, 그것은 기능이 아니라 발견이다.

속도 주장, 그리고 그 상한선
헤드라인 숫자는 14×이며, 이 페이지의 나머지 부분이 받는 것과 같은 주의를 기울일 가치가 있습니다. OpenAI는 표준 처리 대비 초당 최대 750개의 출력 토큰을 제시합니다 — 이는 출력 토큰에 대한 처리량 수치이지, 모든 요청이 14배 더 빨리 끝난다는 주장이 아닙니다. 엔드투엔드 시간에는 입력 처리와 모델 자체의 추론도 포함되며, 웨이퍼 스케일 하드웨어가 이 둘 중 어느 것도 같은 비율로 압축하지는 못합니다. 그렇기 때문에 회사는 14×를 측정치가 아니라 최댓값이라고 표시합니다.
공개된 비교는 표의 양쪽 모두 벤더가 보고한 것이며, 그중 하나는 두 벤더의 스택에 걸쳐 있습니다. 2,500개 질문으로 구성된 Humanity's Last Exam 실행은 Ultrafast에서 11시간 11분에 완료된 것으로 보고되었고, Claude Fable 5의 경우 78시간 27분이 소요되었으며 정확도는 비슷했습니다. 즉, 이는 경쟁사의 모델이 포함된 벤치마크에 대해 OpenAI와 Cerebras가 우리에게 알려주는 것이며, 이번 출시에 대한 독립적 보도는 동일한 실행에서 약 11배라는 더 좁은 범위의 생성 속도 비교를 인용한 반면, Cerebras 자체 수치는 총 테스트 시간 기준 약 7배를 시사합니다. 14배, 11배, 7배 사이의 격차는 모순이 아닙니다. 그것은 세 주체가 하나의 워크로드에서 서로 다른 부분을 측정할 때 벌어지는 일입니다. Cerebras는 별도로 GDP-Val에서 측정 가능한 품질 저하 없이 엔드투엔드 5.6배를 보고합니다. 이 중 어느 것도 제3자에 의해 재현되지 않았습니다.
가격표에 구멍이 하나 있어
여기서 두 등급은 더 이상 대칭적이지 않게 됩니다. GPT-5.6 Sol에는 네 개의 공개된 요금표가 있으며, Ultrafast는 그중 하나가 아닙니다.
• Standard GPT-5.6 Sol — 백만 토큰당 $4.00 / $20.00이며, 캐시된 입력은 $0.40, 롱 컨텍스트 티어는 입력이 약 272K 토큰을 넘으면 $8.00 / $30.00입니다.
• 패스트 모드 — $8.00 / $40.00, 표준 요금의 정확히 두 배입니다. 2026년 7월 30일에 Priority processing에서 이름이 변경된 등급이며, API는 service_tier: "priority" 또는 service_tier: "fast"를 모두 허용합니다. 최대 약 2.5배의 출력 속도를 얻을 수 있습니다.
• Batch and Flex — $2.00 / $10.00, 더 유연한 일정을 대가로 표준 요금에서 50% 일괄 할인.
• 초고속 — 요금표 없음. 우리가 추측으로 채운 빈칸이 아니라, OpenAI가 남겨 둔 빈칸이다.
그 Fast-mode 행은 누구든 Ultrafast의 가격을 견줘 볼 수 있는 유일한 실질적 선례이고, 예산을 계획하는 사람이라면 누구에게나 정신이 번쩍 들 만한 선례입니다: OpenAI가 실제로 숫자를 붙인 유일한 속도 등급은 표준 요금의 정확히 두 배를 받고 2.5배의 속도를 냅니다. Ultrafast는 더 희소한 하드웨어에 기대는 더 큰 속도 주장입니다 — Cerebras의 웨이퍼 용량은 흔한 상품이 아니죠 — 따라서 최종 프리미엄의 방향은 의심할 여지가 없습니다. 그 크기는 의심스럽습니다. 요금표가 나오기 전까지, 어디에서든 인용된 "GPT-5.6 Sol Ultrafast price" 수치는 누군가의 추론이며, 우리의 추론도 포함됩니다.
실제로 당신이 그것을 뭐라고 부르겠어요
스키마 변경은 최종 호출의 형태를 알려줍니다. 해당 티어가 다른 티어들의 패턴을 따른다면, 이미 보내고 있는 요청에 필드 하나가 추가된 형태로 등장합니다. 즉 model gpt-5.6-sol은 그대로 두고, 프롬프트도 그대로 두고, 티어 선택자만 추가하면 됩니다. 오늘날 Fast 모드를 priority를 fast로 바꿔 선택하는 것과 같은 방식입니다. 모델에 달라지는 게 없으니 응답 파싱에도 달라지는 것이 없습니다. 이것이 모델 교체 대신 서빙 티어를 택하는 매력의 전부이며, 이 글 같은 비교 페이지에 비교할 거리가 거의 없는 이유이기도 합니다.
오늘 당신이 할 수 없는 것은 그것을 결정하는 일입니다. 열거형 값은 존재하지만, 대부분의 계정에서는 그 뒤의 용량이 존재하지 않습니다. 따라서 앞으로 몇 주 동안의 실질적인 질문은 두 티어 중 어느 것을 고를지가 아니라, 그 선택이 불가능한 동안 무엇을 실행할지입니다.
그것은 대기자 명단보다 게이트웨이가 더 잘 답하는 질문입니다. 그 모델의 표준 티어는 지금 OrcaRouter에서 openai/gpt-5.6-sol로 라이브 상태이며, 공급자의 자체 요율로 제공되고 토큰에 대한 마진 제로, api.orcarouter.ai/v1의 OpenAI 호환 엔드포인트를 통해 제공됩니다 — 따라서 OpenAI의 프로모션 요금 $4 / $20과 롱컨텍스트 $8 / $30 단계는 저희가 재책정하는 것이 아니라 그대로 전달되며, 그 요금 변경은 OpenAI에 반영되는 같은 날 저희 쪽에도 반영됩니다. 동일한 키가 200개 이상의 모델을 함께 제공하는데, 이는 여기서 평소보다 더 중요합니다: service_tier: "ultrafast"를 설정해서 답을 얻을 수는 없기 때문에, 오늘 지연 시간을 사는 방법은 작업을 다르게 라우팅하는 것입니다 — 대화형 호출은 카탈로그에서 품질 기준을 가장 빠르게 통과하는 모델로 보내고, 야간 배치는 통과하는 가장 저렴한 레인에 두십시오. 그 티어가 열리면 스위치를 뒤집을 곳은 라우터이며, 그때까지 그것은 대기자 명단과 계획의 차이입니다.

어느 것이 프로덕션에 들어가야 하나요?
잠시 "versus"라는 단어는 무시하세요. 여기에는 내려야 할 품질 결정이 없기 때문입니다. 토큰당 비용을 최적화한다면 표준 GPT-5.6 Sol이 답이고, 기다릴 수 있는 모든 작업에는 50% 할인되는 Batch 레인이 답입니다. 사람이 스피너 앞에 앉아 있는 시간을 최적화한다면, Ultrafast를 쓸 수 있게 되는 순간 그것이 답입니다. 그리고 OpenAI가 이번 프리뷰를 위해 언급한 워크로드들은 그 이유를 정확히 보여줍니다. 실시간 장애 상황에서 로그와 diff를 열어 두고 하는 인시던트 대응, 계속 움직이는 데이터를 대상으로 하는 사기 탐지, 반 초의 침묵만으로도 망가진 제품처럼 읽히는 지원 대화, 그리고 예전에는 밤새 돌렸을 연구 루프가 한 번의 업무 세션 안으로 압축되는 경우입니다.
판단 기준은 프롬프트의 크기가 아니라 요청 그래프의 형태입니다. 하나의 긴 생성은 이론상 14배의 이점을 얻지만 실제로는 그보다 훨씬 적습니다. 입력 처리와 추론이 그 비율로 압축되지 않기 때문입니다. 사용자에게 보이는 하나의 작업 뒤에 있는 40번의 순차적 도구 호출은 전체 배수에 훨씬 가까운 이득을 얻습니다. 그 왕복 통신 하나하나가 사용자가 견뎌야 하는 지연 시간이기 때문입니다. 워크로드가 후자에 해당한다면 이 티어는 당신을 위한 것입니다. 전자에 해당한다면 표준 레인으로도 충분했을 것입니다.
주목해야 할 두 가지가 있는데, 둘 다 우리가 여기서 결론지을 수 있는 소문이 아니다. 첫째, 요금표다. 가격 없는 프리미엄 등급은 예산에 반영할 수 없고, Fast-mode의 선례를 보면 그 가격이 작지 않을 것임을 짐작할 수 있다. 둘째, 보고된 대로 DevDay 즈음에 대기자 명단이 실제로 해제되는지 여부다. 대부분의 계정이 사용할 수 없는 service_tier 값은 가용성이 아니라 문서일 뿐이며, 그 둘의 차이는 계획과 약속의 차이다.
