GPT-6 Sol과 Grok 4.7을 비교하는 기사의 히어로 타이틀 카드로, 'GPT-6 Sol vs Grok 4.7'이라는 제목과 '세 배의 비용이 드는 더 저렴한 토큰'이라는 부제를 표시하며, '240M vs 77M 출력 토큰' 통계를 보여준다. Grok 4.7은 출력 $6.00, 작업당 $3.74이고, GPT-6 Sol은 출력 $10.00, 작업당 $1.06이다.
Guides & Insights

GPT-6 Sol vs Grok 4.7: 더 저렴하지만 세 배의 비용이 드는 토큰

작성자

Magnus Corvin

게시일

최신 모델 · 20모든 모델 보기
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

2026년 9월, 하루 간격으로 두 모델이 출시되었는데, 가격표만 놓고 보면 둘은 그리 가깝지 않다. Grok 4.7은 9월 21일, 입력 토큰 100만 개당 2.00달러, 출력 토큰 100만 개당 6.00달러에 출시되었다. GPT-6 Sol은 9월 22일, 동일한 입력 2.00달러, 출력 10.00달러에 출시되었다. Grok의 출력이 40% 더 저렴하다. 대부분의 비교가 바로 이 점만 근거로 Grok을 선택하겠지만, 그것은 잘못된 숫자를 보고 있는 것이다.

이 짝을 결정하는 숫자는 어느 요금표에도 없습니다. 그것은 2억 4천만 대 7천 7백만 — Artificial Analysis가 Intelligence Index를 실행하는 동안 각 모델이 생성한 출력 토큰입니다. Grok 4.7은 같은 질문 세트에 답하기 위해 3배가 조금 넘는 토큰을 태웠습니다. 이를 토큰당 요금에 곱하면, 출력 단가가 더 저렴한 모델이 완료된 작업당 $3.74, 상대는 $1.06의 비용이 들게 됩니다. 토큰당으로는 더 저렴하지만 청구서는 3배가 넘습니다.

각 모델이 실제로 무엇인지

Grok 4.7은 Grok 4.6의 후속 모델로, xAI의 가장 강력한 코딩 및 지식 작업 모델로 자리매김하며, 500,000토큰 컨텍스트 창, 텍스트 및 이미지 입력, 텍스트 출력, 그리고 낮음, 중간, 높음, xhigh로 설정 가능한 추론 강도를 갖추고 있습니다. xAI는 파라미터 수를 공개하지 않았습니다. 이 모델은 2026년 6월로 보고된 사전 학습 컷오프를 받아들이며, 8월까지 보충 학습이 이루어졌습니다.

GPT-6 Sol은 OpenAI의 중급 GPT-6 모델로, 플래그십 GPT-6 Astra 아래, 보급형 GPT-6 Luna 위에 있으며, 1,050,000토큰 컨텍스트 윈도우, 922,000토큰 최대 입력, 128,000토큰 출력 상한, 그리고 2026년 4월 20일 지식 컷오프를 갖추고 있습니다. 텍스트와 이미지를 입력받아 텍스트를 출력하며, 추론 노력은 없음부터 최대까지 설정할 수 있고, OpenAI는 이 모델의 가격이 프로모션이 아닌 영구적이라고 설명했습니다.

컨텍스트 윈도는 비슷하지 않습니다. Sol의 것은 대략 두 배입니다. 이는 정확히 한 가지 워크로드 유형에 중요하며, 대부분의 사람들이 실행하는 유형은 아닙니다.

요율표, 그리고 그것을 뒤집는 선

• 입력 — GPT-6 Sol 백만 토큰당 $2.00 대 Grok 4.7 백만 토큰당 $2.00; 동일

• 출력 — GPT-6 Sol 백만 토큰당 $10.00 vs Grok 4.7 백만 토큰당 $6.00; Grok이 40% 더 저렴합니다

• 캐시된 입력 — GPT-6 Sol은 백만 토큰당 $0.20, Grok 4.7은 백만 토큰당 $0.50; Sol의 캐시 읽기는 2.5배 더 저렴한데, 이는 출력 요금이 시사하는 바와 반대입니다.

• 캐시 쓰기 — GPT-6 Sol은 백만 토큰당 $2.50인 반면, Grok 4.7은 같은 시트에 공개되지 않은 요율

• 컨텍스트 창 — GPT-6 Sol 1,050,000 토큰 대 Grok 4.7 500,000 토큰

• 장문 컨텍스트 할증 — GPT-6 Sol은 입력 토큰 272,000개를 초과하는 요청에 대해 전체 요청 기준으로 입력 및 캐시 요율을 2배, 출력을 1.5배로 재산정하는 반면, Grok 4.7은 입력 토큰 200,000개에서 모든 요율을 2배로 올리며, 이 역시 전체 요청에 적용된다

• 지식 컷오프 — GPT-6 Sol 2026년 4월 20일 vs Grok 4.7: 2026년 6월로 보고된 사전 학습 컷오프, 8월까지 보충 학습

• 추론 강도 — GPT-6 Sol 없음, 낮음, 중간(기본값), 높음, 매우 높음, 최대 vs Grok 4.7 낮음, 중간(기본값), 높음, 매우 높음

• 모달리티 — 텍스트와 이미지 입력, 텍스트 출력, 둘 모두 해당

캐시 요금 항목은 구매자가 곰곰이 따져봐야 할 부분이다. Grok의 출력 요금은 더 낮지만, 캐시된 입력 요금은 Sol의 2.5배이며, 캐시된 입력은 긴 에이전트 이력과 반복되는 시스템 프롬프트가 있는 곳이다. 대규모의 안정적인 컨텍스트를 주로 다시 읽는 워크로드라면 두 요금이 $6 대 $10이라는 숫자가 시사하는 것보다 훨씬 가깝게 느껴질 것이며, 여기에 토큰 볼륨 비율까지 적용하면 순위가 뒤바뀐다.

A six-row scoreboard card titled 'GPT-6 Sol vs Grok 4.7 - the scoreboard', comparing the two models on output price, cached input, context window, Intelligence Index score, index output tokens and cost per task. The left column lists GPT-6 Sol at $10.00 output, $0.20 cached input, a 1,050,000-token context, an Index of 48, 77M index tokens and $1.06 per task; the right column lists Grok 4.7 at $6.00 output, $0.50 cached input, a 500,000-token context, an Index of 46, 240M index tokens and $3.74 per task. A footer reads 'Vendor list prices; index figures per Artificial Analysis.'

왜 2억 4천만 토큰이 모든 것을 말해주는가

Artificial Analysis는 Grok 4.7이 xhigh에서 인덱스 실행 동안 약 2억 4천만 개의 출력 토큰을 생성한 것으로 측정했으며, 이는 같은 보드에 있는 모델들의 중앙값 약 8,800만 개와 대비된다. 자체 요약에서는 이 모델을 "눈에 띄게 느리고 매우 장황하다"라고 표현한다. 같은 하네스에서 측정된 GPT-6 Sol은 7,700만 개를 생성했으며, 보드에서는 "상당히 간결하다"라고 설명된다.

이 보드는 또한 그 결과를 직접 보고한다. Grok 4.7은 작업당 $3.74로 Intelligence Index에서 46점을 기록한다. 높은 설정에서는 점수도 46점이며 비용은 작업당 $2.73이다. GPT-6 Sol은 작업당 $1.06으로 48점을 기록한다. 동일한 인덱스, 동일한 하네스, 그리고 어떤 요금표에도 나오지 않는 2배에서 3.5배의 비용 차이다.

이 수치들을 깔끔한 일대일 비교로 받아들이기 전에 두 가지 주의할 점이 있습니다. 두 페이지는 같은 날 캡처되었지만 보드마다 총계가 다릅니다 — Grok 페이지는 212개 모델 클래스를 보여 주고, 별도의 Grok 목록은 655개 중 순위를 보고합니다 — 따라서 두 점수가 동일한 인덱스 빌드에 있다고 보장할 수 없습니다. 또한 두 수치 중 어느 것도 공급업체 수치가 아닙니다. Artificial Analysis는 자체 하네스를 실행하며, 바로 그 점이 핵심이지만, 두 목록 간 추론 설정이 다르므로(Grok은 xhigh, Sol은 max) 500퍼센트 비용 격차는 발견 사항으로, 2포인트 인덱스 격차는 대략적인 값으로 취급하십시오.

Screenshot of the Artificial Analysis model page for Grok 4.7 (xhigh), captured 23 September 2026, showing an Intelligence Index score of 46, list pricing of $2.00 per million input tokens and $6.00 per million output tokens with a 75% cache discount, a cost of $3.74 per Intelligence Index task, 240 million output tokens generated during the index run, a 500,000-token context window and 39.2 output tokens per second.

xAI가 공개한 것, 그리고 아무도 확인하지 않은 것

xAI 자체 발표 수치는 강력하며, 모든 벤더 출시 수치가 그렇듯 재현되지 않았다. CursorBench 4.0은 xhigh에서 46.3%로 Grok 4.6의 40.4%와 대비된다. Terminal-Bench 4.0은 38.0%로 20.3%와 대비된다 — 이번 릴리스에서 단일 최대 상승폭이다. DeepSWE v1.1은 high에서 71.0%로 65.2%와 대비된다. EEBench는 64.0%로 53.0%와 대비된다. 이는 xAI의 하네스, xAI의 설정, xAI의 보고다.

OpenAI가 GPT-6 Sol에 대해 내놓은 수치들은 같은 패턴을 따르며, 마찬가지로 할인해서 봐야 한다. 차이는 Sol이 Grok보다 독립적인 증거를 하나 더 갖고 있다는 점이다. 바로 Artificial Analysis의 작업당 비용 수치인데, 이는 벤더의 점수표가 아니라 측정된 토큰 소비량으로부터 계산된다. 이 비교에서 살아남는 숫자는 바로 그것이다.

두 모델 중 어느 쪽에 대해서도 아무도 발표하지 않은 것은, 동일한 과제에서 동일한 하네스와 동일한 노력 설정으로 맞붙인 직접 비교다. 그런 걸 보게 된다면, 그 세 변수 중 무엇이 달라졌는지 확인하세요.

한 달치 캐시된 에이전트 트래픽 가격 책정

대부분 안정적인 컨텍스트로 구성된 워크로드를 생각해 보겠습니다: 60,000토큰의 시스템 프롬프트와 리포지토리 요약을 가진 코딩 에이전트가 한 달에 5,000회 호출에서 이를 다시 읽고, 각 호출이 4,000개의 출력 토큰을 반환합니다. 캐싱이 작동하며 안정적인 프리픽스는 캐시된 요율로 청구된다고 가정합니다.

GPT-6 Sol 기준: 캐시된 입력 토큰 3억 개는 백만 개당 $0.20로 $60.00입니다. 출력 토큰 2천만 개는 백만 개당 $10.00로 $200.00입니다. 총합은 $260.00입니다.

Grok 4.7 기준: 동일한 3억 개의 캐시된 입력 토큰은 백만 개당 $0.50로 $150.00입니다. 2천만 개의 출력 토큰은 백만 개당 $6.00로 $120.00입니다. 합계는 $270.00입니다.

거의 동일합니다 — 그리고 이는 토큰량을 일정하게 유지한 경우이며, 이는 관대한 가정입니다. 인덱스 실행에서 측정된 Grok 4.7의 장황함은 Sol의 세 배였습니다. 출력량에 1.5배를 곱하기만 해도 Grok의 청구액은 Sol의 $320.00 대비 $330.00이 되고, 거기서부터 격차는 더 벌어집니다. 더 저렴한 출력 단가는 캐싱과 장황함이 더해지면 살아남지 못하며, 캐싱만으로도 간신히 살아남습니다.

여기서 OrcaRouter를 통한 두 모델의 가격에 관한 주장은 아닙니다 — 어느 모델도 우리 카탈로그에 없습니다. GPT-6 Sol은 OpenAI 자체 API를 통해, Grok 4.7은 xAI를 통해 접근할 수 있으며, Grok 4.6을 포함한 나머지 Grok 라인업은 우리를 통해 패스스루 모델에 따라 xAI의 정가로. 이 계산의 핵심은, 여러분이 작성하는 에스컬레이션 규칙이 요율표가 아니라 자체 트래픽에서의 완료된 작업당 비용을 기준으로 삼아야 한다는 것입니다 — 그리고 라우팅 레이어가 있기에 두 번째 계약 없이 그 규칙을 시험해 볼 수 있습니다.

Screenshot of OrcaRouter's model page for Grok 4.6, captured 23 September 2026, showing the model id grok/grok-4.6 from provider SpaceXAI, a 500,000-token context window, text, image and file input, list pricing of $2.00 per million input tokens and $6.00 per million output tokens, and an OpenAI-compatible API served over both /v1/chat/completions and /v1/responses. Grok 4.7 itself does not appear on the catalogue.

각자가 속한 곳

• 대용량·캐시된 컨텍스트 에이전트 작업 — GPT-6 Sol. 캐시 입력 라인은 Sol에 2.5배 유리하고 출력량 라인은 Grok에 그보다 더 큰 폭으로 유리하며, 이 둘은 겹쳐서 증폭된다.

• 이번 릴리스에서 공개된 Terminal-Bench 개선 중 가장 강력한 것을 원하는 코딩 작업 — 숫자를 가진 모델은 Grok 4.7이고, 그 숫자는 아주 큽니다. 토큰만 예산에 잡고, 요율은 신경 쓰지 마세요.

• 500,000 토큰이 넘는 긴 문서 — GPT-6 Sol, 그리고 이건 근소한 차이가 아니다. Grok의 윈도는 Sol의 윈도가 절반 지점에 이르는 곳에서 끝난다.

• 지연 시간에 민감한 경로 — 둘 다 아닙니다. Artificial Analysis는 Grok 4.7을 초당 출력 토큰 39.2개로 기재하며, 이를 눈에 띄게 느리다고 설명합니다. 더 낫다고 가정하기 전에 현재 순위표에서 Sol 자체의 속도 수치를 확인하세요.

• "그래서 Grok이 더 저렴하다"로 끝나는 토큰당 비교를 보여받았다면 — 그것은 한 단계 너무 일찍 끝난 것입니다. 다음 단계는 토큰 수입니다.

이 글에서 비교한 모델1

이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트