
GPT-6.1 Ultrafast vs GPT-6.1 Sol: 세 가지 작업, 각각 하나의 평결
- openaiNEWOpenAI: GPT-6.1 Sol2026-09-2952지능
- anthropicNEWAnthropic: Claude Sonnet 5.52026-09-2856지능
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100만 토큰당 · 111 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238지능
- OpenAIOpenAI: GPT-6 Sol2026-09-2248지능
- AnthropicAnthropic: Claude Opus 5.52026-09-2258지능
- xAIGrok 4.72026-09-2146지능
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 100만 토큰당 · 55 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당 · 347 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- OpenAIOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- AnthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 100만 토큰당 · 60 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당 · 378 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당 · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
질문해 보자: GPT-6.1 Ultrafast가 GPT-6.1 Sol 가격의 여섯 배에 값어치가 있는지 — 그리고 솔직한 답은, 세 가지 워크로드 중 두 가지는 지금 있는 자리에 그대로 머물러야 한다는 것이다. 대화형 코딩 에이전트는 옮겨야 한다. 야간 평가 스윕은 옮기지 말아야 하고, 배치 요약기도 마찬가지다. 그 이유는 이 등급의 값이 과하게 매겨졌기 때문이 아니라, 애초에 그들이 이 등급이 파는 것을 산 적이 없기 때문이다. GPT-6.1 Sol은 2026년 9월 29일에 출시되었고, Ultrafast는 2026년 10월 8일에 그 위에 얹힌 모드로 등장했다: 동일한 체크포인트, 동일한 1,050,000토큰 컨텍스트 윈도우, 동일한 128,000토큰 출력 상한, 2026년 4월 30일 지식 컷오프, 동일한 답변, 백만 입력 토큰당 $12.00, 백만 출력 토큰당 $60.00 대 $2.00와 $10.00. 속도 등급이란 벽시계 시간을 사는 것이고, 벽시계 시간은 누군가가 기다리고 있는 작업에만 돈값을 한다.
그 관점 전환이 이 글의 전부다. 나머지는 당신의 일 중 어느 것이 기다림형인지 알려주는 산수이고, 계획했든 안 했든 상관없이 그 배수와 함께 찾아오는 두 가지 비용이다.
실제로 다른 점은 요청 필드 하나와 청구서 하나뿐입니다
Ultrafast 체크포인트는 없고, 별도의 컨텍스트 제한도 없고, 대체 지식 컷오프도 없고, 고정할 것도 없습니다. 동일한 모델 식별자를 서비스 티어 필드가 설정된 상태로 보내면 OpenAI가 요청을 다르게 스케줄링합니다. 그 필드 없이 보내면 Standard입니다. 개발자가 코드를 작성할 때 기준으로 삼는 모든 것은 동일하며, 목록의 길이 자체가 논거이므로 그 목록을 기계적으로 따지는 것이 좋습니다.
• 모델 ID — 양쪽 모두 동일한 식별자, 기본 스냅샷 하나뿐, 고정할 날짜 지정 버전은 없음.
• 컨텍스트 — 1,050,000토큰 창, 최대 입력 922,000토큰 및 최대 출력 128,000토큰(양쪽 모두)
• 추론 단계 — 양쪽 모두에서 low, medium(기본값), high, xhigh, max를 지원하며, none과 minimal은 양쪽 모두에서 미지원.
• 도구 표면 — 웹 검색, 파일 검색, 이미지 생성, 코드 인터프리터, 호스팅된 셸, 패치 적용, 스킬, 컴퓨터 사용, MCP 및 도구 검색, Responses API를 통해 양쪽 모두에서.
• 가격 — Standard 기준 백만 토큰당 입력 $2.00 / 캐시된 입력 $0.10 / 캐시 쓰기 $2.50 / 출력 $10.00이며, Ultrafast 기준으로는 $12.00 / $0.60 / $15.00 / $60.00입니다.
• 272,000 입력 토큰 초과 시 — 전체 요청이 입력 및 캐시 요율 2배, 출력 1.5배로 재산정되며, 이에 따라 Ultrafast long-context는 $24.00 / $1.20 / $30.00 / $90.00이 됩니다.
• 속도 — Standard는 정의상 기준선이고, Ultrafast는 최상위 등급이며, OpenAI가 공개하는 유일한 모델별 배수는 이 모델이 아니라 GPT-6 Astra에 속합니다.
그 마지막 문장은 다른 모든 것의 밑바탕에 깔려 있는 단서이며, 아래쪽에서 별도의 섹션을 차지한다. 먼저, 일자리들이다.
첫 번째 작업: 대화형 에이전트. 움직이는 것은 바로 이것입니다.
연속으로 40번의 도구 호출을 수행하는 에이전트 루프가 바로 이 티어가 겨냥해 만들어진 구매자입니다. 모든 턴의 생성 시간이 다음 턴을 좌우하고, 사용자가 지켜보고 있기 때문입니다. 40턴에 걸쳐 턴당 30,000개의 입력 토큰을 보내고 1,500개의 출력 토큰을 받는 세션을 생각해 보세요. 총 1,200,000개의 입력 토큰과 60,000개의 출력 토큰이며, 모든 요청이 272,000토큰 재가격 임계값보다 훨씬 낮습니다.
• Standard — 입력 토큰 120만 개에 $2.00을 적용하면 $2.40이고, 출력 토큰 60,000개에 $10.00을 적용하면 $0.60입니다. 실행 한 번에 3달러입니다.
• 초고속 — 120만 입력 토큰은 $12.00 기준 $14.40이고, 출력 토큰 60,000개는 $60.00 기준 $3.60입니다. 이 실행에 18달러입니다.
• 델타 — 그 외에는 출력이 동일한 작업에서 생성 지연 시간의 대부분을 제거하는 데 드는 $15.00.
$15.00이 싼지 여부는 토큰이 아니라 분에 관한 질문이다. 세션이 Standard에서 20분, Ultrafast에서 4분 걸린다면, 당신은 15달러에 16분을 산 셈이며 — 분당 약 $0.94 — 중요한 비교는 그 16분이 당신에게 얼마의 비용을 들였는지에 대한 것이다. 제반 비용을 포함한 단가로 보면 개발자는 분당 1달러 이상의 가치가 있으므로, 사람이 루프에 개입하는 경우라면 답은 명확하다. 사람 검토 대기열을 기다리는 에이전트는 분당 아무 가치도 없으며, 그 경우 같은 16분은 공짜 16분일 뿐이고 해당 티어는 낭비다.
그것이 적용해야 할 테스트이며, 모델과는 아무 관련이 없습니다. 생성 시간은 누구의 시계에 달려 있으며, 그 시계는 얼마만큼의 가치가 있습니까? 답이 "사람의 시계이고, 그 가치는 아주 크다"라면, Ultrafast는 청구서에서 가장 저렴한 항목입니다. 답이 "스케줄러의 시계이고, 아무 가치도 없다"라면, 그것은 가장 비싼 항목입니다.

두 번째 작업: 야간 평가 전수 조사. 이건 안 돼
평가 스윕은 수천 개의 프롬프트를 모델에 통과시키고, 결과를 오브젝트 스토리지에 기록하며, 아침이 되면 사람이 그 표를 읽는다. 지연 예산은 분 단위가 아니라 밤 단위다. 파이프라인에서 모델을 기다리는 것은 큐에 있는 다음 요청 외에는 아무것도 없다.
Ultrafast는 스윕의 실제 경과 시간 비용을 없애지 않습니다. 스윕의 실제 경과 시간 비용은 당신이 내린 스케줄링 결정이지, 당신에게 있는 지연 문제가 아니기 때문입니다. 그것이 하는 일은 청구서를 여섯 배로 늘리고, 작업을 조직별 자체 속도 제한이 있는 예산으로 옮기는 것입니다. 이는 무인 배치에서 실제 위험입니다. 속도 제한 상한은 대규모 스윕이 맞닥뜨리는 바로 그 실패 모드이고, 티어 페이지는 그 수치를 공개하지 않기 때문입니다.
그리고 같은 요금표에는 이 작업을 위해 가격이 책정되어 있고 반대 방향으로 가격이 매겨진 레인이 하나 있습니다. Batch와 Flex는 Standard의 절반 요금으로 운영되며, API의 Batch 처리는 바로 이런 형태를 위해 설계되었습니다. 대용량, 상호작용형 마감 기한 없음, 결과는 비동기적으로 반환됩니다. 위 수치를 기준으로 보면, 동일한 40턴 토큰 총량은 Batch에서 $1.50, Ultrafast에서 $18.00이 듭니다. 이는 차이를 구분할 수 없는 작업에 대한 12배 격차입니다.
피해야 할 실수는 Ultrafast를 범용 업그레이드로 취급하는 것이다. 그것은 사다리의 꼭대기다 — Batch와 Flex는 0.5, Standard는 1, Fast는 2, Ultrafast는 6의 위치에 있다 — 그리고 사다리는 더 나은 버전들의 메뉴가 아니다. 잘못된 단을 고르는 일에는 잘못된 모델을 고르는 일보다 더 많은 돈이 걸려 있다.
세 번째 작업: 배치 요약기. 이것도 안 됩니다, 이유는 다릅니다
워크로드가 문서 저장소를 매일 밤 한 차례 훑는 작업이라고 가정해 보자: 입력은 길고 출력은 짧으며, 루프에 사람이 없고, SLA는 몇 시간 단위로 측정된다. 바로 이런 경우 토큰 구성이 Ultrafast에 유리하게가 아니라 불리하게 작용한다.
272,000 토큰 임계값이 그 이유입니다. 두 등급 모두에서, 이를 초과하는 단일 요청은 전체 요청의 가격을 재산정합니다 — 모든 입력 토큰, 모든 캐시된 읽기, 모든 출력 토큰 — 입력 및 캐시 요율의 두 배, 출력의 1.5배로. 따라서 Long-context Ultrafast는 백만 입력 토큰당 $24.00, 백만 출력 토큰당 $90.00를 청구하며, 재산정은 임계값을 초과하는 부분이 아니라 요청에 의해 트리거됩니다. 때때로 300,000 입력 토큰으로 요청을 보내는 문서 요약기는 그 300,000개 모두에 대해 롱 컨텍스트 요율을 지불합니다.
캐시 동작이 이를 가중시킵니다. 캐시된 읽기는 이 모델에서 가장 저렴한 토큰이자 가장 효과적인 비용 지렛대이며, 티어가 비용을 흡수하기보다 티어에 따라 함께 올라갑니다 — Standard에서는 캐시된 입력 100만 개당 $0.10, Ultrafast에서는 $0.60이며, 둘 다 캐시되지 않은 입력 요율의 5%입니다. 이 배수를 완화해 주는 캐시 토큰과 새 토큰의 조합은 없으므로, 극도로 최적화된 캐시 파이프라인도 패스트 레인에서 할인을 받지 못합니다. 그저 더 작은 숫자의 6배를 지불할 뿐입니다.
이 둘을 종합하면, 요약기는 Ultrafast의 프리미엄이 절대 금액 기준으로 가장 크고 그 이점은 가장 작은 경우입니다. 테스트가 정말로 길고 마감이 정말로 촉박하다면, 올바른 구성은 Batch 또는 표준 Standard이며, Ultrafast의 올바른 사용은 프롬프트를 반복 수정하면서 각 수정마다 사람이 기다리는 중간 개발 루프입니다.
여러 개를 함께 쓸 때 따라오는 두 가지 비용
6배 요율은 가격에서 눈에 보이는 부분일 뿐이다. 실제 생산에서는 보이지 않는 두 가지 부분이 더 중요하다.
첫째는 레이트 리밋 예산입니다. Ultrafast는 Standard 및 Fast 예산과 별도로 자체 한도에서 작동하며, OpenAI는 이를 티어 페이지에 공개하기보다 조직별로 설정합니다. 지침은 트래픽을 늘리기 전에 조직의 한도를 확인하고, 한도 상향이 필요하면 계정 팀에 문의하라는 것입니다. 따라서 워크로드를 Ultrafast로 전환하면 두 가지가 동시에 일어납니다. 청구 금액이 배로 늘어나고, 워크로드가 확인할 수 없을 수도 있는 상한선으로 옮겨집니다. 무인 에이전트의 경우 상한선이 먼저 걸립니다.
두 번째는 절감 효과의 형태입니다. Ultrafast는 토큰 간 시간을 줄여 주며, 첫 토큰까지의 시간이나 숙고 단계를 줄이는 것은 아닙니다. 아무것도 내보내기 전에 전체 소요 시간의 대부분을 생각하는 데 쓰는 요청은 Ultrafast로 전환해도 여전히 느리게 느껴질 수 있습니다. 해당 티어가 가속하는 것은 애초에 병목이 아니었던 요청의 일부이기 때문입니다. 이것이 "우리는 6배를 지불했는데 속도는 같다"는 보고를 낳는 실패 모드입니다. 지연 시간이 티어가 닿지 못하는 곳에 있는 애플리케이션을 측정하고 있는 것이죠. 결정하기 전에 초가 실제로 어디로 가는지 — 첫 토큰까지의 시간과 토큰 간 시간을 비교해 — 측정하세요. 티어는 그중 하나만 담당하기 때문입니다.
왜 "더 빠르다"는 아직 OpenAI에 책임을 물을 수 있는 숫자가 아닌가
Ultrafast는 "최대 8배"를 내세워 판매되고 있지만, 그 문구의 근거가 되는 측정은 다른 모델에 관한 것입니다. 공개된 문장은 GPT-6 Astra Ultrafast가 Codex의 Standard 모드에서 GPT-6 Astra보다 최대 8배 빠르게 토큰을 생성한다는 내용입니다. GPT-6.1 Sol에 대해서는 이에 상응하는 공개된 배수가 없으며, 어떤 독립적인 주체도 Sol 버전의 초당 토큰 수치를 공개하지 않았습니다. 이 등급에 대한 문서는 생성된 출력 토큰 사이의 시간을 줄인다고 설명하며 요금표를 가리킵니다.
두 모델이 동일한 서빙 스택에 있고 그 티어의 메커니즘도 같다는 점에서, 그 배수가 성립한다는 것은 합리적인 사전 가정입니다. 하지만 그 문장에서 “최대”는 실제로 중요한 역할을 하고 있으며, 다른 클라이언트의 형제 모델에서 측정된 벤더 상한은 여러분의 워크로드가 보게 될 숫자가 아닙니다. 더 오래된 단계도 마찬가지입니다. GPT-5.6 Sol에 대한 Ultrafast는 2026년 8월에 제한적 미리보기로 “Standard processing보다 최대 14배 빠름”이라고 발표되었고, 문서에는 여전히 Ultrafast 요금표가 정확히 두 개의 행을 가진 미리보기 액세스라고 나와 있습니다.
OpenAI에 요구할 수 있는 것은 가격이다. 가격은 공개되어 있고 모든 토큰에 적용되기 때문이다. 이는 이 페이지에서 다루는 결정이 공급업체의 속도 주장이 아니라 여러분 자신의 지연 예산에 관한 결정이라는 뜻이다.

커밋하지 않고 테스트하고 다시 전환하기
이 티어는 모든 API 사용자가 이용할 수 있으므로, 실제 소요 시간에 관한 질문에 답하는 저렴한 방법은 동일한 프롬프트 세트를 필드를 켠 경우와 끈 경우로 두 번 실행하고 토큰 수와 타이밍을 비교하는 것입니다. 그 테스트에서 주의할 두 가지는 요청이 272,000토큰 선을 넘는지, 그리고 첫 토큰까지 걸리는 시간이 토큰 간 시간을 지배하는지입니다. 둘 중 하나만으로도 티어가 광고된 대로 정확히 작동하고 있을 때 실험이 아무런 차이가 없는 결과처럼 보이게 할 수 있습니다.
되돌리는 것은 마이그레이션이 아니라 요청 필드이며, 표준 레인은 OrcaRouter를 통해 공급업체 자체의 목록 요율로 제공됩니다: openai/gpt-6.1-sol — 입력 토큰 백만 개당 $2.00, 출력 토큰 백만 개당 $10.00, 마크업 0%로 제공업체 가격이 그대로 전달되므로 공급업체의 가격 변경은 같은 날 우리 쪽에 반영됩니다. Ultrafast 자체는 우리가 판매하는 것이 아닙니다. 그것은 귀하의 OpenAI 계정에 청구되는 서비스 등급 플래그이며, 그렇게 말하는 것이 그렇지 않은 듯이 암시하는 것보다 더 유용합니다. 키 하나로 실제로 구매할 수 있는 것은 표준 레인과 하나의 OpenAI 호환 엔드포인트 뒤에 있는 나머지 카탈로그, 그리고 공급업체 전반에 걸친 자동 페일오버입니다. 값비싼 등급을 프로덕션 에이전트 앞에 두려고 하면서 표준 레인이 코드 변경이 아니라 라우팅 결정이 되기를 원한다면 이는 갖출 만한 가치가 있습니다.

빠른 레인에 관한 실용적인 참고 사항 중 저렴한 쪽에는 해당하지 않는 것이 하나 있습니다: 바로 WebSockets입니다. OpenAI는 Ultrafast에 지속적인 WebSocket 연결을 권장하는데, 이는 많은 순차 호출을 수행하는 에이전트에는 맞는 형태이고 프로세스당 요청 하나를 처리하는 배치 스크립트에는 맞지 않는 형태입니다. 클라이언트가 두 번째 종류라면, 해당 티어 자체가 권장하는 전송 방식은 야간 작업이 다른 곳에 속하는 또 하나의 이유입니다.
평결이 바뀔 때
세 가지 진전이 작업을 "stay" 목록에서 빼낼 것이다. GPT-6.1 Sol에 대한 Ultrafast 레이트 리밋이 공개되면 배치 케이스에서 상한 위험을 제거할 것이다. Sol 등급에 대한 속도 측정치가 공개되거나 독립적으로 재현된다면, 이를 가정하는 대신 실제 경과 시간 절약분을 예산에 반영할 수 있을 것이다. 그리고 빠른 레인의 할인 단계 — Batch에 상응하는 Ultrafast로, 이 등급은 여전히 빠르지만 가격이 여섯 배는 아닌 — 는 사다리 중간에 있는 모든 작업의 경제성을 바꿀 것이다.
그중 어느 것도 오늘날 존재하지 않습니다. 존재하는 것은 이름 그대로인 등급입니다: 동일한 GPT-6.1 Sol을 다르게 스케줄링한 것이며, 모든 항목에서 가격이 여섯 배입니다. 대화형 에이전트를 옮기고, 나머지 둘은 그대로 두십시오. 그리고 어느 것이 당신의 것인지 결정하기 전에 당신의 초가 실제로 어디로 가는지 측정하십시오.
이 글에서 비교한 모델1
이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트
