생성된 제목 카드에는 'GPT-6.1 Sol Context Window'라고 적혀 있고, 부제는 '1,050,000 토큰, 922,000 라인, 그리고 272,000 절벽'입니다. 그 아래에는 둥근 패널 세 개가 놓여 있습니다: 1,050,000에는 '공급업체 페이지의 컨텍스트 윈도우', 922,000에는 '문서 양식의 최대 입력', 272,000에는 '전체 요청의 가격을 다시 산정하는 입력 라인'이라는 라벨이 붙어 있습니다. OrcaRouter 로고가 오른쪽 아래 모서리에 나타납니다.
Guides & Insights

GPT-6.1 Sol 컨텍스트 윈도우: 1,050,000 토큰, 922,000줄, 그리고 272,000 절벽

작성자

Elias Hawthorne

게시일

최신 모델 · 20모든 모델 보기 →
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

벤더의 GPT-6.1 Sol 모델 페이지는 2026년 10월 7일에 확인한 기준으로 1,050,000 토큰의 컨텍스트 윈도우와 최대 출력 128,000 토큰을 명시하고 있다. URL 끝에 .md를 붙여 얻는 기계 판독 가능 형식의 같은 페이지에는 렌더링된 페이지가 결코 표시하지 않는 세 번째 수치, 즉 최대 입력 토큰 922,000이 담겨 있다. GPT-6 Sol은 6.1이 2026-09-29에 그 뒤를 잇기 위해 출시된 모델로, 자체 페이지에 동일한 두 개의 상한 수치를 게시하고 자체 마크다운 형식에도 같은 922,000 줄을 담고 있다. openai/gpt-6-sol에 대한 우리 자체 모델 카드는 컨텍스트 윈도우를 1,050,000 토큰으로, 출력 상한을 128,000으로 보고하고, 그중 첫 번째를 스펙 스트립에 "1M"으로 표시하며, 같은 페이지 더 아래의 비교 표에서는 동일한 모델에 대해 "1.1M"을 인쇄한다.

그래서 페이지들이 실제로 서로 어긋나며, 그것이 어떻게 어긋나는지는 정확히 짚을 가치가 있다. 벤더의 렌더링된 사양 스트립은 윈도우와 출력 상한을 제공하고 입력 상한은 제공하지 않는다. 같은 모델에 대한 벤더의 마크다운 문서는 세 가지를 모두 제공한다. 렌더링된 페이지를 기준으로 요청 크기를 산정하는 사람은 벤더가 공개한 것보다 제약을 하나 덜 가지고 작업하는 셈이며, 빠진 그 하나가 바로 요청이 들어맞는지를 결정하는 숫자다.

세 개의 숫자, 세 개의 출처, 그리고 아무도 적어 두지 않는 하나의 뺄셈

다음은 각 숫자와 그것이 나온 문서이며, 모두 2026년 10월 7일에 읽었습니다.

• 1,050,000 컨텍스트 윈도우 — 벤더의 gpt-6.1-sol 모델 페이지에서, 렌더링된 사양 스트립과 해당 마크다운 양식 모두에서, 그리고 gpt-6-sol 페이지에서도 동일한 수치입니다. 이 값은 또한 openai/gpt-6-sol 및 openai/gpt-6-luna에 대해 저희 카탈로그가 반환하는 값이기도 하며, 여기서 해당 필드는 반올림된 값이 아니라 1,050,000으로 입력되어 있습니다.

• 최대 출력 토큰 128,000개 — 두 세대 모두 같은 페이지, 같은 두 가지 형식입니다. 저희 카드의 필드에는 128,000이라고 표시되지만, 디스플레이에서는 "128K"로 반올림되어 표시됩니다.

• 최대 입력 토큰 922,000개 — 벤더의 gpt-6-sol 모델 페이지와 gpt-6.1-sol 페이지의 마크다운 형식입니다. 이는 두 페이지의 렌더링된 스트립에도 없고, 해당 모델에 대한 저희 카탈로그 필드에도 없는데, 그 필드는 윈도우와 출력 상한에서 끝납니다.

세 수치는 서로 산술적으로 일치합니다. 922,000에 128,000을 더하면 정확히 1,050,000입니다. 벤더 자체의 추론 가이드는 모델 페이지에서 결코 그 합을 직접 계산하지 않으면서도 이 동일성이 의미를 갖게 하는 메커니즘을 설명합니다. 추론 토큰은 "여전히 모델의 컨텍스트 윈도우에서 공간을 차지한다"고 말하며, 생성된 토큰이 "컨텍스트 윈도우 한도나 설정한 max_output_tokens 값에 도달하면" 응답은 불완전으로 표시되어 돌아옵니다. 입력되는 것과 출력되는 것 사이에 공유되는 윈도우에서는 입력 상한이 윈도우에서 출력 예약분을 뺀 값이 됩니다.

그 해석은 뒷받침된 것이지 입증된 것은 아니며, 이 둘은 구분할 가치가 있다. 문서화된 것은 1,050,000이라는 윈도, 128,000이라는 출력 상한, 그리고 922,000이라는 최대 입력이다. 추론되는 것은 그중 어느 것이 가장 먼저 발동하는 제약인가이다. 이 추론은 전체 출력 허용량을 예약하는 모든 요청에는 성립하고, 그렇게 하지 않는 요청에는 성립하지 않는다 — max_output_tokens를 4,000으로 설정하면 1,046,000 입력 토큰도 명백히 거부되지는 않는다. 벤더가 해당 숫자들이 실려 있는 페이지에 그 뺄셈을 적어 넣기 전까지는, 이 짝을 엄격한 허용 규칙이라기보다 예산의 형태로 취급하고, 블로그 글에 대고가 아니라 카운팅 엔드포인트를 기준으로 검증하라.

컨텍스트는 가격이 아니다: 272,000토큰 단계

더 큰 컨텍스트 창은 용량에 대한 주장입니다. 비용에 대한 주장은 아니며, 이 제품군에서는 두 주장이 문서화된 경계에서 갈라집니다. 공급업체의 가격 페이지는 이 규칙을 한 문장으로 명시합니다: 272K 입력 토큰을 초과하는 프롬프트는 전체 요청에 대해 입력 및 캐시 요율의 2배, 출력의 1.5배로 가격이 책정됩니다. 같은 페이지의 두 열에 대한 자체 정의는 “짧은 컨텍스트: ≤272K 입력 토큰. 긴 컨텍스트: >272K 입력 토큰.”입니다.

단어 full을 주의 깊게 읽어 보세요. 이 티어는 경계를 넘어선 토큰에만 세금을 매기지 않습니다 — 첫 번째 토큰을 포함해 모든 것의 가격을 다시 매깁니다. 그리고 이것은 6.1 변경 사항이 아닙니다: 동일한 임계값을 가진 동일한 규칙이 GPT-6 Sol에도 적용됩니다. 그래서 그 절벽은 릴리스가 아니라 티어 탓으로 돌려야 합니다.

프리픽스가 이미 캐시에 상주해 있어 캐시 쓰기 비용이 비교를 흐리지 않도록, GPT-6.1 Sol의 공개 요율로 양쪽 모두에서 긴 컨텍스트 작업 하나를 수행하세요:

• 입력 토큰 240,000개(캐시 200,000개, 신규 40,000개), 출력 6,000개 — 신규 입력 40,000개는 백만 개당 $2.00이므로 $0.080; 캐시된 입력 200,000개는 $0.10이므로 $0.020; 출력 6,000개는 $10.00이므로 $0.060. 총계 $0.160.

•300,000 토큰(캐시 260,000, 신규 40,000), 출력 6,000 — 이제 요청이 기준선을 넘어섰으므로 모든 요율이 바뀝니다: 입력 40,000은 $4.00 기준 $0.160, 캐시 입력 260,000은 $0.20 기준 $0.052, 출력 6,000은 $15.00 기준 $0.090. 합계 $0.302.

입력 토큰이 25퍼센트 더 많아지면 청구서는 89퍼센트 더 커진다. 같은 두 요청을 GPT-6 Sol에서 실행해도 양상은 더 가파른 기울기로 유지된다 — 선 아래에서는 $0.180, 선 위에서는 $0.354인데, 이는 구형 카드의 캐시 요금 $0.20이 6.1의 긴 컨텍스트 캐시 요금과 같은 위치에 있기 때문이다. 교차점은 기울기가 아니라 계단이며, 이를 가장 저렴하게 확인하는 방법은 털끝만큼 넘어가 보는 것이다. 출력 토큰 1,000개를 포함한, 전혀 캐시되지 않은 271,000토큰 요청은 $0.552이고, 273,000에서는 $1.107이다. 입력 토큰은 0.7퍼센트 더 많은데, 비용은 2.01배다. 그 요청에서 토큰 2,000개를 다시 덜어내면 청구서는 $1.107에서 $0.552로 떨어진다 — 입력의 1퍼센트 미만을 줄여 비용을 절반으로 만드는 셈이다.

이 섹션의 어떤 내용도 GPT-6.1 Sol의 윈도가 크다는 것에 관한 것이 아니다. 그것은 윈도가, 그 크기가 감당할 수 있는 것보다 더 큰 비용이 드는 경계에 도달할 만큼 충분히 크다는 것에 관한 것이다.

A generated two-column scoreboard titled 'GPT-6.1 Sol vs GPT-6 Sol - the scoreboard'. Both columns carry the same six rows. GPT-6.1 Sol reads: context window 1,050,000 tokens; max input 922,000 tokens (docs form); max output 128,000 tokens; input price $2.00 / $4.00 per M; cached input $0.10 / $0.20 per M; output price $10.00 / $15.00 per M. GPT-6 Sol reads the same on every row except cached input, which is $0.20 / $0.20 per M. A footer line credits OpenAI's model and pricing docs read Oct 7 2026 and explains that the second figure in each price row is the long-context rate above 272,000 input tokens. The OrcaRouter logo appears in the bottom-right corner.

1,050,000 토큰을 실제로 채우는 것은 무엇인가

컨텍스트 예산은 여섯 가지 요소로 이루어져 있으며, 그것들은 모두 같은 정도로 캐시 가능한 것은 아니다. 예시적인 240,000토큰 에이전트 요청의 대략적인 비중; 비율은 우리 것이고, 캐시 가능성 규칙은 같은 날 읽은 해당 공급업체의 프롬프트 캐싱 가이드에서 가져온 것이다.

• 프로바이더가 주입한 시스템 콘텐츠 및 요청 포맷팅 — 메시지보다 앞서 렌더링되고, 입력으로 과금되며, 최소 캐시 가능 길이에서 명시적으로 제외됩니다. 제어할 수 있는 것도, 줄일 수 있는 것도 아닙니다.

• 개발자 및 시스템 지침, 약 6,000 토큰. 캐시 가능. 이는 프리픽스의 맨 앞부분이므로, 여기가 변경되면 그 뒤의 모든 것이 무효화됩니다.

• 도구 정의와 스키마, 호스팅된 도구 표면과 사용자의 함수를 합쳐 약 14,000토큰입니다. 캐시 가능하지만, 프리픽스에서 가장 취약한 부분입니다. 가이드에서는 도구 이름, 설명, 스키마, 순서, 도구별 지침을 프리픽스 경계를 움직이는 요소로 나열합니다.

• 검색된 텍스트, 약 180,000토큰. 캐시 가능하며, 단연 가장 큰 항목입니다. 호출 간에 바이트 단위로 안정적일 때만 캐시할 가치가 있습니다 — 요청마다 재조립되는 코퍼스는 정가를 지불하는 코퍼스입니다.

• 누적된 대화 기록 — 이전 턴과 도구 결과 — 약 30,000 토큰이며 계속 증가하고 있습니다. 가장 최근 변경 사항까지 캐시할 수 있으며, 이번 턴에 도착한 도구 결과는 전체 요율이 적용되는 새 입력입니다.

• 추론 토큰 — 생성될 뿐 캐시되지 않으며 출력으로 청구됩니다. 윈도우를 소모하고 응답 본문에서는 보이지 않습니다.

그 목록에서 곧바로 두 가지 운영상의 주의점이 나옵니다. 첫째, 캐시 항목은 개별 머신에 보관됩니다: 가이드에 따르면 요청은 "만료되지 않은 일치하는 항목을 보유한 머신에 도달한 경우에만" 프리픽스를 재사용할 수 있으며, 오버플로 라우팅은 대략 분당 15회 요청을 넘으면 시작됩니다. 코드에서 안정적인 프리픽스라도 프로덕션에서는 미스가 발생할 수 있습니다. 둘째, 최소 캐시 가능 프리픽스는 1,024개의 표시되는 입력 토큰이며, 숨겨진 시스템 토큰은 여기에 포함되지 않습니다 — 따라서 주변 요청이 아무리 커도 작은 시스템 프롬프트는 캐시 가능한 프리픽스가 아닙니다.

출력 상한은 별도의 예산이지, 추가로 받는 한 몫이 아닙니다.

128,000개의 최대 출력 토큰이 답변 128,000토큰을 의미하는 것은 아닙니다. 추론 가이드에는 max_output_tokens가 모델이 생성하는 총량, 즉 "추론 토큰, 가시적 출력 토큰, 비가시적 서식 토큰"을 포함한 총량을 제한하며, 추론 토큰은 창에서 공간을 차지하면서 출력으로 청구된다고 명시되어 있습니다.

그것은 잘림을 예외 상황이 아니라 설계 결정으로 만듭니다. 실패하는 방식 때문입니다. 생성이 한도에 도달하면 응답은 상태가 incomplete이고 이유가 max_output_tokens인 채로 반환됩니다. 그리고 가이드는 이것이 "보이는 출력 토큰이 하나도 생성되기 전에 발생할 수 있으며, 이는 보이는 응답을 받지 못한 채 입력 및 추론 토큰에 대한 비용이 발생할 수 있음을 의미합니다"라고 경고합니다. 전체 윈도를 입력에 써버리고 출력 예약분을 운에 맡기는 예산은, 전체 긴 컨텍스트 요청을 청구하고도 호출자가 파싱할 수 있는 것은 아무것도 반환하지 않을 수 있는 예산입니다. 벤더가 직접 제시하는 시작 권장 사항은, 프롬프트가 실제로 무엇을 필요로 하는지 아직 측정하고 있는 동안 추론과 출력을 위해 최소 25,000개의 토큰을 예약하라는 것입니다.

GPT-6.1 Sol은 이를 더욱 정교하게 만들며, 이는 이번 릴리스에서 진정으로 6.1에 특화된 몇 안 되는 항목 중 하나입니다. 추론 노력 단계는 low, medium, high, xhigh, max로 이어지고, none 및 minimal 설정은 지원되지 않습니다. GPT-6 Sol은 여섯 가지를 모두 받아들입니다. 따라서 6.1에는 추론 비용을 꺼버리는 설정이 없고, 기본값은 medium이며, 예산의 출력 쪽은 결코 무료가 아닙니다.

캐시된 입력 절반화 — 창이 가장 넓은 지점에서 읽기

GPT-6 Sol과 비교해 GPT-6.1 Sol 요금표에서 달라진 유일한 요율은 캐시 입력입니다: 백만 토큰당 $0.20에서 $0.10으로 내려갔으며, 모델 페이지에서는 이를 비캐시 입력 요율의 5%로 표현하고, 공급업체의 캐싱 가이드에서는 대부분의 GPT-5.6 이상 모델이 적용받는 0.1x와 대비되는 0.05x 사례로 명시적으로 부릅니다. 입력, 캐시 쓰기, 출력은 두 요금표에서 동일하며, 장문 컨텍스트 배수도 동일합니다.

이 페이지가 다루는 바로 그 워크로드에 대해서는 바로 그 계량 항목이 움직였어야 하는 대상이며, 그 이유는 요청의 크기가 아니라 긴 요청의 구성에 있습니다. 위의 300,000토큰 작업에서는 입력 토큰 중 260,000개가 캐시된 접두사입니다 — 요청이 보내는 모든 것의 87퍼센트입니다. 따라서 캐시된 항목은 청구서에서 가장 큰 단일 입력 계량 항목이며, 이는 긴 컨텍스트 작업의 일반적인 특성입니다: 사용하는 창이 길수록, 그중 더 많은 부분이 이미 보낸 접두사입니다. 그 계량 항목을 절반으로 줄이는 것은 해당 요청에서 $0.052의 가치가 있습니다.

그리고 그 절벽은 같은 요청에서 반감이 주는 것보다 더 많은 것을 되가져간다. 선 아래에서 지불했을 숏 컨텍스트 요율로 책정하면, GPT-6.1 Sol에서 같은 300,000토큰 작업은 $0.302 대신 $0.166이 들 것이다 — 경계 통과 비용은 $0.136, 즉 이번 릴리스에서 변경된 단 하나의 미터가 지닌 가치의 약 2.6배다. 선 위에서 캐시 요율은 $0.20으로 표시되는데, 이는 이 제품군에서 새로운 숫자가 아니다: 6.1 카드의 헤드라인 두 배이자, 이번 릴리스 전에 GPT-6 Sol이 선 아래에서 캐시 읽기에 부과했던 금액과 정확히 같다. 롱 컨텍스트 캐시 워크로드는 헤드라인 변경을 챙긴 뒤 경계에서 그것을 도로 반납하며, 원인은 모델이 아니라 그 경계다.

A screenshot of the machine-readable markdown form of OpenAI's GPT-6.1 Sol model documentation, captured October 7 2026, showing the Model details block with the three figures on consecutive lines — 1,050,000 context window, Maximum input tokens: 922,000, and 128,000 max output tokens — above the Text tokens pricing table listing Input $2, Cached input $0.1, Cache writes $2.5 and Output $10 per 1M tokens, the note that cached input tokens are priced at 5% of the uncached input rate, and the sentence 'Prompts with more than 272K input tokens are priced at 2x input and cache rates and 1.5x output for the full request.'

컨텍스트 예산을 산정하는 방법

절차로서, 제약이 구속력을 갖는 순서대로:

• 요청을 세세요. 추정하지 마세요. 정확한 페이로드(도구, 이미지, 파일 등 전부)를 Responses API의 입력 토큰 수 엔드포인트에 POST하세요. 가이드가 그 이유를 분명히 설명합니다. 이 수치에는 로컬에서 토큰화할 수 있는 텍스트에는 결코 나타나지 않는 메시지 역할과 경계에 대한 서식 토큰이 포함되며, 문자 수를 4로 나누는 것과 같은 로컬 추정치는 이미지, 파일, 스키마에 대해 부정확합니다.

• 출력 쪽을 먼저 예약하세요. max_output_tokens를 선택할 때는 이것이 추론, 표시되는 출력, 서식 지정을 모두 포함한다는 점을 기억하고, 0에서가 아니라 공급업체의 25,000토큰 버퍼에서 시작하세요. 입력 예산은 창에서 그 예약분을 뺀 값이며, 922라는 수치는 같은 뺄셈에 대한 공급업체의 버전입니다.

• 요청을 보내기 전에 272,000을 기준으로 양쪽 가격을 모두 산정해 보세요. 그 간격이 충분히 크기 때문에, 기준선 바로 아래에 맞추려는 요청과 바로 위에 맞추려는 요청은 서로 다른 상품입니다.

• 프리픽스는 안정성 순으로 정렬하세요. 지침, 그다음 도구 스키마, 그다음 코퍼스, 그다음 트랜스크립트 순입니다. 호출마다 바뀌는 것은 맨 끝에 두세요. 그래야 전체 캐시가 아니라 프리픽스 일치만 다시 하면 됩니다.

캐시를 기대하기 전에 1,024개의 표시 입력 토큰을 넘기세요. 그 최솟값 미만에서는 아무것도 캐시되지 않으며, 숨겨진 제공자 토큰은 그 최솟값에 포함되지 않습니다.

• 재사용이 타당한지 확인하세요. 프리픽스는 30분 캐시 수명 내에 재사용되어야 하며, 해당 엔트리를 보유한 머신에 도달해야 합니다. 두 조건 모두 가이드에 설명되어 있으며, 어느 것도 코드의 속성이 아닙니다.

• 모델이나 설정을 변경한 후에는 다시 측정하세요. GPT-6.1 Sol로 전환하면 추론 끄기(reasoning-off) 위치가 사라지므로 추론 토큰 수가 달라지고, 그에 따라 예산의 출력 측면도 바뀝니다. 또한 추론 노력(reasoning effort), 도구, 구조화된 출력 스키마 또는 컨텍스트 관리의 변경 역시 프리픽스 경계를 이동시켜 캐시된 요율을 완전히 잃게 만들 수 있습니다.

• 작업이 줄어들지 않을 때 어떻게 할지 결정하세요. 컴팩션은 문서화된 탈출구입니다: Responses 요청은 context_management를 compact 임계값과 함께 설정할 수 있으며, 서버는 이전 대화 내용을 더 적은 토큰으로 핵심 상태를 이어 가는 불투명한 컴팩션 항목으로 대체합니다. 이는 무료 축소가 아니라 예산 결정입니다. 가이드에 따르면 컴팩션은 "첫 번째 변경된 토큰부터 재사용을 막을 수 있습니다" — 즉, 컴팩션 패스는 그 뒤의 프리픽스를 무효화합니다.

A screenshot of the OrcaRouter model page at www.orcarouter.ai/models/openai/gpt-6-sol, captured October 7 2026, showing the OrcaRouter nav bar, the breadcrumb Home -> Models -> OpenAI, the model identifier openai/gpt-6-sol attributed to OpenAI with the date 2026-09-22, the Vision, Tools, JSON and Reasoning capability badges, the spec tiles reading Max output 128K, input text + image + file, output text and a p50 TTFT of 1.44 s, the description stating a 1.05M-token context, and the /v1/chat/completions rate row of $2.00 in and $10.00 out per 1M tokens.

이 페이지의 계산은 GPT-6.1 Sol이 대체하는 세대에서 시작하며, 그 단계는 오늘 호출 가능한 단계입니다: openai/gpt-6-sol에 대한 우리 카드는 1,050,000토큰 컨텍스트 창과 최대 출력 128,000토큰을 보고합니다 OpenAI의 정가 기준으로 0% 마크업 — 공급업체의 가격이 페이지에 표시된 가격입니다, 그리고 공급업체의 변동은 갱신 시점이 아니라 같은 날 거기에 반영됩니다. 우리 카드에는 자체 최대 입력 필드가 없으므로, 해당 모델의 922,000토큰 수치는 공급업체 자체 문서에서 가져와야 하며, 이 페이지는 일관되게 그렇게 해 왔습니다. 이 카드가 유용한 점은 규모 산정입니다: 카드가 실제로 공개하는 창과 출력 상한은 위의 예산 절차가 서로 빼는 두 수치이며, 아래 단계는 6.1이 아직 새로운 동안 실제로 그 절차를 적용해 볼 수 있는 단계입니다. 위치는 https://www.orcarouter.ai/models/openai/gpt-6-sol입니다.

이 글에서 비교한 모델1

이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트